第 20 课 | 场景一交付:效果验证与价值复盘
从第 13 课到第 19 课,我们完成了场景一「竞品监控」的完整闭环。这节课,我们不写代码,而是算一笔账——这套系统到底值多少钱?省了多少时间?未来还能怎么进化?
一、场景一全流程回顾
1.1 8 课链路
1.2 每课产物
| 课次 | 主题 | 核心产物 | 技术栈 |
|---|---|---|---|
| 13 | 基础爬虫 | IT之家新闻采集器 | requests + BeautifulSoup |
| 14 | 进阶爬虫 | 虎嗅 API + 澎湃 Selenium | API 分析 + Selenium |
| 15 | 数据清洗 | 清洗流水线 + LLM 增强 | pandas + 规则引擎 |
| 16 | LangChain 入门 | 新闻分析链 | LCEL + Pydantic |
| 17 | 智能分析 | 竞品洞察生成器 | System Prompt + 四维分析 |
| 18 | 报告生成 | Word 周报生成器 | python-docx + matplotlib |
| 19 | 定时自动化 | 全自动流水线 | schedule + 日志 |
二、效率对比:人工 vs 自动化
2.1 耗时对比
| 环节 | 人工耗时 | 自动化耗时 | 提升倍数 |
|---|---|---|---|
| 浏览行业新闻(50 条) | 30 分钟 | 0 秒 | - |
| 筛选重要信息 | 20 分钟 | 5 秒 | 240x |
| 分析竞争格局 | 30 分钟 | 5 秒 | 360x |
| 归纳趋势洞察 | 30 分钟 | 5 秒 | 360x |
| 制作图表 | 20 分钟 | 2 秒 | 600x |
| 撰写分析报告 | 40 分钟 | 5 秒 | 480x |
| 排版格式 | 20 分钟 | 3 秒 | 400x |
| 总计 | 3 小时 10 分钟 | 25 秒 | 456x |
2.2 质量对比
| 维度 | 人工 | 自动化 | 结论 |
|---|---|---|---|
| 覆盖范围 | 30-50 条/天 | 100+ 条/天 | 自动化更全面 |
| 一致性 | 因分析师而异 | 100% 一致 | 自动化更稳定 |
| 遗漏率 | 15-20% | 3-5% | 自动化更低 |
| 时效性 | 隔天出报告 | 实时/每日 | 自动化更快 |
| 可追溯 | 依赖记忆 | 完整日志 | 自动化更可靠 |
三、ROI 计算
3.1 成本模型
人力成本(按月计算):
| 项目 | 传统方式 | 自动化方式 |
|---|---|---|
| 每周工时 | 3 小时 × 5 天 = 15 小时 | 0 小时 |
| 月工时 | 60 小时 | 0 小时 |
| 时薪(分析师) | 100 元/小时 | - |
| 月人力成本 | 6,000 元 | 0 元 |
| 年人力成本 | 72,000 元 | 0 元 |
技术成本(按月计算):
| 项目 | 成本 |
|---|---|
| 电费(RTX 3090 运行) | 约 50 元/月 |
| LLM API(如用云端) | 约 100 元/月(本地免费) |
| 服务器维护 | 0 元(本地运行) |
| 年技术成本 | 约 600-1,800 元 |
3.2 ROI 计算
年节省 = 72,000 - 1,800 = 70,200 元 ROI = 70,200 / 1,800 = 39x 回本周期 = 1,800 / (72,000/12) = 0.3 个月 ≈ 9 天9 天回本,年化 ROI 39 倍。这还只是显性成本。隐性价值更大:
- 分析师释放的 60 小时/月可以用于深度研究
- 不会遗漏重要信息(避免决策失误)
- 报告质量稳定(不会因分析师状态波动)
四、技术架构总结
4.1 系统架构
4.2 技术栈全景
| 层级 | 技术 | 作用 |
|---|---|---|
| 基础设施 | Python 3.12 + UV | 环境管理 |
| 模型部署 | Ollama + Qwen2 7B | 本地推理 |
| 嵌入检索 | BGE + ChromaDB + Reranker | 语义检索 |
| 框架编排 | LangChain + LCEL | 应用构建 |
| 数据采集 | requests + BeautifulSoup + Selenium | 网页爬取 |
| 数据处理 | pandas + LLM 增强 | 清洗结构化 |
| 报告生成 | python-docx + matplotlib | 文档图表 |
| 自动化 | schedule + Windows 任务计划 | 定时运行 |
五、经验教训
5.1 做得好的
- 业务驱动先行:从第 1 课就明确"竞品监控"这个场景,技术服务于业务
- 渐进式搭建:从爬虫到报告,每课都有可交付的产物
- 本地优先:Ollama 部署本地模型,零 API 成本,数据不外泄
- 错误处理:重试、日志、告警,让系统在无人值守时也可靠
5.2 可以改进的
- 反爬能力:目前对复杂反爬网站(如豆瓣)效果有限,将在第 49 课加强
- 多源整合:目前只爬了 IT之家,需要更多数据源
- 实时性:目前是每天一次,可以改为小时级
六、展望场景二
场景二「数据问答 Agent」将解决一个更核心的问题:
让业务人员像对话一样查数据,而不需要写 SQL。
"上周哪个品类的销量增长最快?" → Agent 自动生成 SQL → 查询数据库 → 返回答案 "对比一下 Q1 和 Q2 的毛利率变化" → Agent 生成多步查询 → 数据可视化 → 分析报告从第 21 课开始,我们将进入这个更激动人心的场景。
本课无代码。场景一全部代码已包含在第 13-19 课中。