秘塔的 Deep Research 做得怎么样?| 在深度测评后,我们发现了 2 个亮点

你追我赶太好了!

**

你追我赶太好了

👦🏻 作者: 镜山

🥷 编辑: Koji

🧑‍🎨 排版: NCon

说到秘塔,很多⼈可能觉得这是⼀个⽐较低调的 AI 团队,不过他们在业内有着不错的⼝碑,甚⾄拥有⼀批忠实的⽤户。

Koji 曾在「狂喜播客节」和卫诗婕、晚点的程曼祺、三五环的刘飞录了一期现场播客。当时曼祺提到,她日常一直在用「秘塔写作猫」帮助做内容的审核,按头安利给大家。

回顾秘塔的发展轨迹,从 2018 年的基于 Transformer 架构的秘塔翻译、2021 年的写作猫 AI 写作、2024 年年初的 AI 搜索、浅度研究(Shallow research),再到 2 个月前,凭借「塔子老师,今天学点啥」的 AI 教育功能出圈,秘塔的每个产品都在努力向 AI 领域「靠拢」,精准踩中了用户痛点。

今天,秘塔悄悄推出了自己的Deep Research功能,在社群中引发关注。

🚥

带着好奇心,「十字路口」团队深度测试了秘塔的这个新功能。

说实话,Deep Research 的功能现在快成了所有海外 AI Chatbot 产品的标配,但在国内公开可用的选择并不多。从 Benchmark 的表现来看,像是用来综合评估** AI Agent(智能体)的信息挖掘能⼒的 Xbench-DeepResearch** ,秘塔就获得了不错的评分:

在实际测试过程中,它的初始体验出乎意料,也合乎基准测试上的表现:通过采用**「研究思路链」的交互设计**(下文会详细介绍),立即给用户带来了开门见山的一个 Aha Moment!

接下来,分享我们的深度测评。

追求完整思路链的 Deep Research

我们发现秘塔的 Deep Research 在 BrowseComp‑ZH 基准测试中获得了 45.33 的高分,这是一个专门针对中文互联网环境设计的 Web browsing 能力基准测试。而在英文版 BrowseComp 测试中,成绩也还不错:

这一数据结果很直观地体现在**搜索结果的逻辑完整性、搜索范围和准确度提升了。**它不会因为找到几条相关信息就赶紧下结论,而是会持续挖掘,直到形成完整的思路链。

下面,我们来看几个 AI 领域方向的研究案例。

1)案例:超导领域造假事件

秘塔 AI 搜索提供了多种搜索范围选择,日常使用直接勾选「全网」即可,如果需要深入学术研究,可以选择「学术」模式。

「学术」这其实是秘塔的一大亮点,因为在过去的一年里,他们持续扩充中英文学术资源库。

比如,这两年「人类终极材料梦想」——各种造假事件不断冲上各个社媒平台热搜。由于超导和 AI 在科技圈都有成为「技术神话」的趋势,所以我想研究一下这两者是否存在关联。

就可以很简单地输入一段提示词:

为什么超导领域造假事件这么多?会不会成为新一轮人类技术乌托邦的精神象征?

最大亮点:AI 的「研究思路链」:

等到秘塔开始研究后,我抬头看了眼屏幕,发现它并不像往常的深度研究功能一样出现一个进度条,而是展示出来了它的研究思路链

它会显示当前在思考什么问题,下一步要查什么资料。

而且,如果是学术问题,我发现秘塔好像会更倾向于搜索英文资料。

更有趣的是,系统会自动补齐研究链条中的空白节点。当它发现研究中缺了什么关键信息,就会自动「长出」新的分支去补上这个空缺。

你会发现整张思路链会一直处在动态变换中:

当我细看秘塔 DeepResearch 在每个节点里的「想法」时,发现一开始它就定下了一个很有趣的研究方向:

超导技术在人们心中代表什么,以及造假事件的影响。

要理解这个「研究思路链图」,得配合最后的报告一起看。

比如说,秘塔 DeepResearch 在一开始就敏锐地抓住了跨领域的象征意义和社会比喻这个角度,然后系统性地展开分析。

AI 首先识别出:超导技术已经成了多个领域的「终极梦想」的象征。

它很敏锐地看出媒体是怎样把超导包装成「科技救世主」的,剥离了许多层「复杂科技」和「专业学术话语」的外壳。

最终,AI 不是简单给出结论了事,而是用动态思路链的方式展示完整的推理过程和逻辑分支。

用户能清楚看到每一步的证据链条。和传统的「总结式」分析比起来,秘塔 DeepResearch 更关注逻辑的完整性和深层挖掘。

这幅深度「研究思路链图」的左上角显示,整个深度研究过程消耗了 234812 个token,搜集了 420 个学术来源,时间花费很短,只有 9.3 分钟。

思维链条可视化最大的好处是透明度。用户可以清楚看到:

【1】哪些信息来源很充足,结论很可信;

【2】哪些节点信息缺失,可能影响准确性;

【3】AI 为什么选择某条推理路径而不是另一条。

研究思路链条的可视化不仅减少了研究报告中常见的「错误引用」问题,还允许用户直接查看 AI 思路链中的信息缺失部分。

例如,在最终研究报告生成前,其中几条思路链存在一定的信息缺失:

因此,报告更倾向于采用研究思路链图上方那条思路链的内容,因为这条链的数据来源更加充足,结论的完整度也更高。

最后,秘塔 Deep Research 给出了一份大概 2-3 千字左右的报告,比较详细且结构清晰,而 token 消耗量在几十万量级。实测下来,如果在提示词里要求更长字数的话,输出文本也会更长,更深入:

搜索的专业度、深度、广度都很好: 秘塔 DeepResearch 一次性找到了 417 份学术论文和研究报告的 PDF 版,这些资料大多来自很知名的学术数据库。我大概梳理了下,资料源头包括:IEEE Xplore、ArXiv 预印本平台、Nature / Science / PNAS 等顶级期刊。

我飞速录制一段 Gif 动图,可以直观看到秘塔 DeepResearch 在学术 DeepResearch 方面的强大能力!

这个研究课题的焦点之一其实就是 LK-99 (一种由韩国科学家在 2023 年 7 月提出来的化合物,之后被认为无法复现)。

我可视化了一下秘塔 DeepResearch 搜出来的论文,围绕 LK-99 的一共有 15 篇,时间跨度从事件爆发开始的 7 个月内,各个阶段的重要研究成果全都被完整收录了进来:

沿用了秘塔的 AI 讲解: 秘塔这次搜索了 540 个信息源,覆盖面确实够广:B 站视频、学术 PDF、ACL 论文库等各类资源都包含在内。

我录制了一段 Gif:

这种交互方式其实有个很大的好处,因为秘塔上回出圈就是因为它的 AI 版教学功能「今天学点啥」。所以这回,当用户在左侧发现一条「生涩、难以理解」的内容之后,可以直接点击右侧的「讲解」。

然后,用户就无缝接入到「塔子老师课堂」了,完成闭环的深度学习。 现在的一些 AI Agent 产品其实也有这个趋向:从深度研究功能出发,为用户提供深度学习的场景

从体感上来说,秘塔的这种交互确实能够支撑得起「深度学习」,在我的使用过程中感觉很方便。

高完成度的互动式网页: 在研究报告的最下方可以一键生成一份高度结构化的互动式网页:

这份「超导领域造假与人类技术乌托邦」研究报告的完成度很高,整体比较简洁美观,颜色的搭配协调度很好:

在这份可视化研究报告中,我发现报告的质量很稳定,会经常插入图片、表格甚至是外部的视频模块:

一个特别令我惊喜的点是,秘塔 DeepResearch 做可视化报告时,会根据深度研究的内容,接着去找相关资料,而且找得很准。

为什么这么说?

因为,在「超导技术」造假这方面,最为出圈、可能也是最有趣的就是「来自星星的何教授」的 B 站视频了。视频插入的位置很准确,而且,此类视频,秘塔 DeepResearch 还放了好几个,让用户可以边看报告边学习:

下面我们再看一个没有那么「学术」的案例。

2)案例:OpenAI正在开发的硬件都有什么可信情报了?

对于一般的新闻类信息,秘塔 Deep Research 的思路链条会咬的很死,更加追求信息来源的权威性。

比如,我想了解下最近 OpenAI 又被透露消息的 AI 硬件的发展,就可以输入一段简单的提示词:

OpenAI正在开发的硬件都有什么可信情报了?

报告总体的结构,依旧体现了深度研究很有广度、深度、逻辑。

比如:

【1】 广度方面,这份报告研究的很细,涵盖 AI 终端设备、AI 芯片、人形机器人等多个关键赛道;

【2】 深度方面,它会在每个细分领域都深入分析,而非很浅地描述。

【3】 逻辑方面:与秘塔 DeepResearch 展现出来的「思路链」一样,递进式的分析,有完整的分析闭环。

深度研究很「谨慎」 在仔细阅览这段报告时,我发现秘塔的 Deep Research 会很「谨慎」,比如它会整合权威时间点,在每一个关键里程碑后面都附带可信来源。

而且,它会专门给出一份情报可信度分析。

很有趣的是,秘塔果然会围绕 OpenAI 造硬件这件事进行全面搜索,因为它真的找到了一个官方矛盾点:OpenAI CEO —— Sam Altman 的名言, AI 硬件可能永远不推出。

秘塔给出的可视化报告中,也通过三色标记,将这三种类型的信息依次标注「高可信来源」、「待验证信息」、「官方矛盾点」:

我还根据这些信息回到了它的「研究思路链图」里,梳理了它的推理逻辑,发现:

当它需要查询 「OpenAI 硬件产品的技术规格和实现细节是什么?」时,秘塔会自动导向时间,信息来源,再进行内容的细化,然后甚至还会有立场修正,具体化。

整个流程大概是:

时间节点 → 信息来源来自哪 → 内容如何细化 → 立场如何交叉验证 → 怎么做具体化分析

如果是官方来源的信息则会进行标注,可能是秘塔深度研究背后的架构会让它更关注权威信息:

各项时间线与合作信息都有具体出处(比如 Broadcom 合作声明、Altman 访谈等等)。

对于一段模糊的提示词(OpenAI 正在开发的硬件),秘塔会将这些硬件分为三个部分:AI 终端设备、AI 芯片,人形机器人。

每个硬件领域都有 技术、团队、合作、时间表、挑战 等完整分析,环环相扣,逻辑闭环的表现很不错。

在人形机器人方面,秘塔会直接将 Sam Altman 与 OpenAI 关联,并执着于研究 Sam Altman 公开立场的转变,它甚至找到了华西证券在 2023 年的一份证券行业研究周报

以及一份飞书的文档:

秘塔这回搜了 360 个信息源,我大概统计了下,研究报告中一共采用的信源大概是 58 个。

而且,信息来源并不只是中英文信息,甚至在 OpenAI 的 AI 芯片方向,还涉及了日文、韩文的 PDF 资料:

比如,秘塔在一篇韩文的关于「扎克伯格和马斯克没有选择等待 Blackwell(B100)系列,而是加码投入 Hopper 系列,以及 OpenAI 的 Sam Altman 投身 AI 芯片」的 PDF 文件中,找到了相关信息:

而且,我翻看了下秘塔的搜索来源,在最上方有一个「管理」按键,这也是秘塔之前搜索的老功能了,虽然不新鲜但却很好用:

通过这个功能入口,用户可以自主定制化秘塔 AI 搜索的来源偏好,可以添加「希望更多出现的网站」和「不希望出现的网站」。

Deep Research 通常作为辅助工具使用,用户对行业往往已有一定了解。在实际使用中会遇到这样的问题:

有些信息源可信度不高,有些信息源很有价值,但 AI 有时会在类似网站中错过用户想要的权威来源。

这个功能让用户能够引导 AI 朝更可靠、更定制化的方向搜索。

「Deep Research」仍有巨大想象空间

我们总结下秘塔 Deep Research 表现还不错的地方:

【1】基准测试数据很亮眼,在中文互联网的表现尤其不错;

【2】研究广度 + 深度都比较好,搜索覆盖面相当广泛,信息获取能力表现不俗;

【3】逻辑架构很清晰,整体研究脉络很分明,没有那种「为了堆信息量而堆」的感觉;

【4】「研究思路链」式交互设计很有创新,用户体验比我们预期的要流畅。

整体来说,秘塔这次对于 Deep Research 的尝试做出了一些他们自己的提升。看完秘塔这次的 Deep Research 功能,感觉就像是在看一场技术追逐竞赛的最新回合。

ChatGPT 和 Gemini 打响 Deep Research 第一枪之后,到现在各家纷纷跟进。我们看到的是一个快速迭代、不断试错的过程。秘塔的入局或许不是最早的,但他们走出了一条差异化的竞争路径。


最终,用户对 Deep Research 的需求其实简单又直接,就像它的字面意思:

AI 帮我「深度研究」,让我更快地、更好地理解这个复杂的世界。