从搜索框到 Deep Research:Agentic 检索怎么把一次查询变成一场调查

大众叙事里,Deep Research 是 OpenAI 在 2025 年 2 月「引爆」的。时间线其实倒了过来:Google 在 2024 年 12 月 11 日就把 Deep Research 挂上了 Gemini Advanced,比 OpenAI 早了七周;而且 Google 的版本从第一天起就把「多步研究计划」显式展示给用户、允许修改后再执行——这个「人批计划」的交互设计直到 2026 年仍是各家产品的重要差异点。两年过去,deep research 已经从旗舰功能卷成了标配:免费档可用、开放 API、还能接进你自己的数据源。本文不聊行业战争(那篇交给本站的《AI 搜索的 2026》),只拆技术骨架:这类系统到底在怎么工作,哪些是学出来的、哪些是编排出来的,以及它慢吞吞跑十分钟之后给出的答案,可信度到底几何。

先把时间线捋直

把主要玩家的节点放在一张表里(配额与价格均以发布时口径为准):

产品 首发 起点 配额/价格
Gemini Deep Research 2024-12-11 Gemini 1.5 Pro(注意:不是同日发布的 2.0 Flash,官方博客让用户手动切到 1.5 Pro with Deep Research) AI Pro 订阅档;2025-03 起向全体用户免费开放
OpenAI Deep Research 2025-02-02 o3 的 browsing 优化版,端到端 RL 训练 Pro $200/月,100 次/月;2025-02-25 起 Plus 10 次、Pro 上调 120 次
Perplexity Deep Research 2025-02-14 自家 Sonar 搜索栈 免费 5 次/天;Pro $20/月 500 次/天,主打 2–4 分钟速出
Claude Research 2025-04-15 Claude + agentic flow 随订阅计划;特色是同时检索 web 与用户的 Google Workspace
Grok DeepSearch / DeeperSearch 2025-02 / 2025-03 Grok 3 DeeperSearch 官方定位「credible over speed」
Kimi-Researcher 2025-06 端到端 agentic RL(官方称无 SFT) 自报 HLE pass@1 26.9%,当时持平 OpenAI

之后的两步把形态定型:2025-06-27 OpenAI 开放 Deep Research API(o3 系列获得 web search 能力);2025-07-17 的 ChatGPT agent 把「深度检索」与「浏览器操作」合并成一个通用 agent——「bridging research and action」,调查与行动从此共享同一套循环。Google 这边同样三步走:2025-03-13 免费(覆盖 45 种以上语言)→ 2025-04-08 升级 Gemini 2.5 Pro → 2025-11-18 随 Gemini 3 重做全流程,12 月又把重构后的 deep research agent 开放给开发者。到 2026 年,这个能力已经沉到平台层:ChatGPT 侧的 deep research 可接入 apps/connectors 与 MCP 服务器做私域调查,「给你公司内部知识库写一份尽调报告」成了标准用法。

通用循环:一次调查的六个动作

剥开各家包装,agentic 检索的循环可以拆成六步。一是查询规划:把用户问题分解成子问题与研究计划——Gemini 把这步产品化给用户改批;OpenAI 和 Kimi 则把「怎么规划」内化进模型。二是迭代检索:执行搜索后「根据学到的东西发起新的搜索」(Google 官方原话)——这是它与单轮 RAG 的本质区别:搜索词不是一次写定的,是过程中动态生成的。三是阅读与抽取:OpenAI 系统卡明确列出 search、click、scroll、interpret files 四项能力,都是在自建浏览数据集上用强化学习练出来的,不是规则脚本。四是反思与补漏:开源实现里这一步最直白——流行的极简项目 dzhng/deep-research(目标五百行以内)每一轮从结果中提取 learnings、发现缺口,depth 参数没耗尽就带着新问题递归深入。五是约束与安全:读网页的 agent 天然多一层不可信输入面——系统卡把 prompt injection 列为两大增量风险之一,缓解手段包括不允许 agent 导航到任意构造的 URL。六是生成带引用的报告:所有产品殊途同归的出口,引用链接是这类产品与普通聊天的外观分界线。

两条路线:学出来的循环 vs 编排出来的循环

六步循环有两种造法。端到端 RL 路线(OpenAI、Kimi):不给显式流程,用强化学习奖励「找到关键信息或写出综合报告」,让模型自己学会何时搜、搜什么、何时停——Kimi 官方甚至强调「无 SFT、纯 RL」。显式编排路线(Gemini 的 plan-execute、Perplexity 的快速迭代、几乎全部开源实现):流程写死在框架里,LLM 负责每一步的局部决策。开源生态基本全在后一列:HuggingFace 在 OpenAI 发布后 24 小时内启动复现,用 smolagents 的 CodeAgent 加搜索工具在 GAIA 上拿到约 54%(对比 OpenAI 自报 67.36%);GPT Researcher 则早在 2023 年 5 月就开始做「自主研究 agent」,比这波热潮早了快两年。

哪条路线对?一个基准数据很有说服力:OpenAI 专为浏览类任务造的 BrowseComp(1,266 道需要多跳定位的问题)上,裸推理模型(o1)成绩不足 10%,deep research 达到 51.5%。两者用的是同一代模型底子——差的那 40 多分,主要不是「模型更聪明」,而是「持续多步浏览」这个行为本身。这个行为既可以是 RL 学出来的,也可以是编排出来的;GAIA 上 HF 用通用 agent 框架复现出 54% 说明循环结构比模型规模更关键,而 Kimi 用纯 RL 追平自报分数又说明两条路线最终会师。

开源阵营:把循环抄回家

值得单独一提的是,这个循环的开源复刻速度快得惊人。OpenAI 发布后 24 小时内,HuggingFace 就启动了复现(open-deep-research,基于 smolagents 的 CodeAgent,最终 GAIA 均分约 54%);LangChain 的 open_deep_research 走 provider 无关路线,搜索工具与 MCP server 都可插拔;GPT Researcher 则是「前朝遗老」——2023 年 5 月就存在、约三万 stars、自称第一个开源 deep research agent,如今已迁移到 LangChain 的 Deep Agents 框架上。这些开源版的共同启示在 dzhng/deep-research 的 README 里写得最直白:核心循环不到五百行代码——「deep research」的护城河从来不在循环代码本身,而在三样东西:足够强的底座模型、干净的搜索与抓取管道、以及 RL 阶段烧掉的那批浏览数据。前两样开源世界都有平替,第三样暂时没有,这就是开源复现普遍落后官方版 10 个百分点左右的主要缺口。

基准速查:分数在怎么爬

基准 说明 关键刻度
Humanity's Last Exam 专家级难题 OpenAI DR 发布时 26.6%(浏览+Python 工具)→ Kimi-Researcher 26.9%(2025-06)→ 2026-10 第三方榜单头部约 61–65%
GAIA 通用助手真实任务(人类约 92%) OpenAI DR 67.36%(当时 SOTA)→ HF 开源复现约 54% → 2025 年下半年开源系统已反超
BrowseComp 多跳信息定位 deep research 51.5% vs 裸模型 <10%
SimpleQA 短事实问答 Perplexity 自报 93.9%;同赛道多家都自报 SOTA——供应商自报口径打架的典型现场

HLE 那条曲线值得多看一眼:一年半多一点的时间,头部成绩从 26.6% 爬到 60% 以上——「专家级考试」从几乎不及格卷到接近饱和。这既是 deep research 循环的胜利,也意味着它正在重演 SWE-bench 式的饱和剧本(基准的寿命问题,本站《SWE-bench 兴衰记》有过完整拆解)。

慢不等于对:引用可靠性的账单

十分钟的调查换来的报告,可信度并不与耗时成正比。独立测试接连给出了难看的数字:哥伦比亚新闻评论 Tow Center(2025-03)测了 8 款 AI 搜索引擎,结论是「它们全都不擅长引用新闻」,部分工具错误引用率超过 60%;BBC(2025-10)发现新闻议题上 51% 的 AI 回答有显著问题,其中引用 BBC 内容的回答 19% 含事实错误;欧洲广播联盟联合 14 国机构的更大规模测试(2025-10)给出 45% / 81% 的「有显著问题 / 存在问题」两档数字,且跨语言跨地区一致。学术侧的 DeepTRACE 审计(arXiv:2509.04499)补了一个重要细节:开启 deep research 配置后引用准确率能推到 80% 以上——深调查模式确实比快速回答更可靠,但该研究同时发现用 LLM 当评审与人类标注的相关性只有 0.62,「用 AI 审计 AI」本身也有噪声。多轮报告生成环节同样有学术论文专门记账(《Deep Research Agents are Unreliable at Multi-turn Report Generation》以引用忠实度、论断有据性等指标系统性记录了不可靠之处)。这些失真的外部性已经显形:Pew 的研究观察到 AI 摘要出现时用户点击原文的比例明显下降(具体降幅各方口径不一),已有小型出版商报告广告收入大幅下滑——本站《AI 搜索的 2026》详述过这场流量战争的进程。Gary Marcus 在产品发布次日写下的批评(《Deep Research, Deep Bullshit》)至今仍是合适的提醒:问题不是「幻觉」这个词,而是系统没有真值锚定——它擅长把一篇像样的报告组织出来,不保证每个句子都对。

结语

Agentic 检索的真正创新不在某个模型,而在把「检索」从一次性调用变成了带反思的循环——规划、迭代、阅读、补漏,每一步都可以是学出来的或编排出来的,重要的是循环本身:BrowseComp 上那 40 多分的差距属于多步浏览行为,不属于更大的参数量。两年里这个循环已经标准化到开源复现只需几百行代码,下一程的分化点在别处:接私有数据的连接器生态、报告之外的「行动」能力,以及最要紧的——让引用真正可信。在那之前,对它输出的正确姿势依然是把它当成一位「速度快、线索多、需要复核」的研究助理,而不是一台真理机器。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?