GPT Researcher 快速上手指南:10分钟从主题到带引用的研究报告
【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
手动搜资料、逐篇读文献、再拼报告,一份像样的调研往往要花一整天。GPT Researcher 是一个开源的自主研究智能体:输入一个主题,它自动联网检索、汇总来源,写出带引用链接的结构化报告。本文带你用 10 分钟跑通它。
📌 项目定位:三条核心能力
先说清它解决什么问题:你只负责提出任务,检索、归纳、写报告这些活由智能体完成。
- 主题变报告:自动把任务拆成多个子问题,并行检索后聚合成完整报告
- 来源可追溯:单次研究可聚合 20 个以上网页来源,报告中的结论附带出处
- 组件可替换:LLM 默认用 OpenAI,也可换成 Ollama 等本地模型;搜索引擎支持 Tavily、DuckDuckGo、Google 等多种方案
📦 环境准备:版本要求与安装步骤
这一节解决"怎么把它装起来"。要求 Python 3.11+,以及两个密钥:LLM 服务的OPENAI_API_KEY和搜索引擎的TAVILY_API_KEY(二选一即可先跑起来)。
git clone https://gitcode.com/GitHub_Trending/gp/gpt-researcher # 克隆项目 cd gpt-researcher export OPENAI_API_KEY=sk-xxxx # 填入你的 LLM 服务密钥 export TAVILY_API_KEY=tvly-xxxx # 填入搜索引擎密钥 pip install -r requirements.txt # 安装依赖 python -m uvicorn main:app --reload # 启动 Web 服务密钥不想写export的话,也可以建一个.env文件放在项目根目录,内容相同、去掉export。启动后打开http://localhost:8000就是可视化研究界面,后面几节我们改用代码方式调用。
🚀 第一次运行:最小可运行示例
这一节解决"不调界面、只写代码怎么出报告"。以 pip 包方式使用时先执行pip install gpt-researcher,然后看这个 9 行示例:
import asyncio from gpt_researcher import GPTResearcher async def run(): researcher = GPTResearcher(query="固态电池最新研究进展", report_type="research_report") # 报告类型 await researcher.conduct_research() # 第一步:检索并汇总来源 report = await researcher.write_report() # 第二步:生成报告 print(report) asyncio.run(run())conduct_research负责跑检索流水线,write_report负责写作。跑完后你会拿到一篇带引用列表的 Markdown 报告;researcher.get_research_sources()还能单独取出所有来源 URL。
⚙️ 原理简析:从任务输入到报告输出
这一节解决"它到底是怎么干活的",理解后你就知道去哪里调参数。
整条链路是"任务输入 → 规划 → 并行检索 → 报告输出":
- 任务输入:你传入一个查询,系统据此创建一个任务专属智能体
- 规划:规划器(planner)把主题拆成一组子问题,合起来能客观回答原任务
- 并行检索:每个子问题交给独立的检索执行智能体,联网搜索、爬取网页、逐篇摘要并记录来源
- 聚合写作:把各分支摘要去重过滤后汇总,写入器据此生成带引用的最终报告
核心逻辑都在 gpt_researcher/ 目录:actions/是检索与写作动作,retrievers/是各搜索引擎适配,config/是默认参数。
🎬 实战场景:三个具体用法
学术文献调研。场景:开题前需要快速摸清某方向的现状。把查询设为"2025年固态电池技术路线对比",用默认的research_report类型,几分钟内拿到一篇含引用链接的报告,来源列表可直接导进文献管理工具。
竞品与市场分析。场景:做产品决策要看竞品动态。查询设为"主流开源向量数据库的功能与定价对比",报告会按子问题组织内容,各厂商信息来源可逐一核查。
资源清单收集。场景:只要链接不要长文。把report_type换成resource_report,查询设为"2025 年值得参加的 AI 会议",输出就是带出处的资源列表,省掉筛选时间。
🛠 进阶与调优:四条可操作建议
这一节解决"跑通之后怎么调"。大多数调整只需改环境变量,对应默认值见 gpt_researcher/config/variables/default.py:
export TOTAL_WORDS=2500 # 默认 1200 词,需要长报告就调大 export DEEP_RESEARCH_DEPTH=2 # 深度研究的探索层数 export DEEP_RESEARCH_BREADTH=4 # 每层并行的研究分支数 export RETRIEVER=duckduckgo # 换搜索引擎,免申请 Tavily 密钥- 报告长度不够:优先调大
TOTAL_WORDS,配合MAX_SUBTOPICS增加子问题数量 - 想要更深的挖掘:把
report_type设为deep,进入树状递归研究模式,单次约 5 分钟,官方给出的参考成本约 0.4 美元(o3-mini high),详见 deep_research.md - 想接自己的文档:设置
DOC_PATH指向本地资料目录,把检索来源切到本地文档与网页混合,做法参考 contenteditable="false">【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考