Agent 不再只靠语言理解世界|Vital Young

语言并不是世界,它只是人类的抽象编码

1976 年,心理学家 Harry McGurk 在《Nature》上发表了一篇论文 Hearing Lips and Seeing Voices,分享了一个反直觉的实验结果:当听到的声音和看到的嘴型不一致时,大脑不会单独选择相信耳朵或眼睛,而是自动合成出二者感知以外、并不存在的第三种感知结果。

接受测试的人群中,98% 即使知道答案,也无法抗拒行为惯性。心理学和神经科学领域,把这一现象称为 "麦格克效应"(McGurk Effect)。

此后五十年,神经科学研究指向了一个更根本的解释:多模态融合本来就是人类认知系统的底层架构。 2002 年,Ernst 和 Banks 用贝叶斯推断框架,进一步揭示了现象背后的数学结构:人类大脑本质上是在做概率计算。在真实世界中,单一通道的信息永远是残缺的、有噪声的;当有多个信号大概率来自同一事件时,融合它们得到的判断,永远比只依赖其中任何一个更为准确。

"感官越多参与,整体的解就越接近最优。" 这条被人类进化验证了几百万年的路径,AI 正在重走一遍。

2024 年,主流技术方向几乎同时迈出了一步,让 Agent 学会 "看" 屏幕,像人一样直接看界面、理解布局、识别按钮、判断下一步该怎么操作,把感知与行动接在了一起。当 Agent 的输入端从文字扩展到真实的视觉环境,它与世界之间的关系也就发生了变化,从 "人类把信息翻译给 AI",变成 Agent 自己去看、去判断、去做。

不过,视觉只是一方面。当 Agent 拥有了更多 "感官" 之后,它理解世界的方式、做出的行为会因此而不同吗?

带着这个问题,5 月 14 日我们联合 MiniMax、火山引擎 V-START 加速器、Research AI+ 以及 Elsewhere 共同发起第八期 Vital Young 活动,邀请正在 Agent 多模态方向上探索的伙伴一起畅聊。

MiniMax 自创立第一天起便专注多模态的研发,生态负责人 Arthur 在开放麦环节中分享道,多模态的最终目标不是 "什么都能处理",是处理的时候知道彼此之间的关系,让文本、图像、视频、音频在同一个模型内部真正交叉理解,像人一样,同时听到、看到,了解整体。回到开头的贝叶斯结论,融合永远优于单一通道,MiniMax 在做的,是把这条进化规律写进模型里。

格子互动创始人凌天格,则分享了对声音模态的深入理解。作为创业近 4 年的 00 后 "老兵",他正带领团队研发新型声音 Agent 引擎,让声音变成一种可编程的数字资产,覆盖生成、转换、实时变声等能力。当 Agent 从文字走向语音交互,声音不再只是附属功能,而是 Agent 与人建立信任的第一界面。

瞬极科技创始人王子腾从视觉方向切入,分享了他的研究与观察。传统相机按固定帧率拍照,无论世界是否变化都在不断曝光;「事件相机」的逻辑完全不同,只在光线发生变化时才输出信号,响应速度能达到微秒级,动态范围超传统相机数千倍。当这种仿生视觉被装到 Agent 之上,意味着它可以像人眼一样长时间、不间断地感知真实环境,更丝滑地融入生活。

在其他感知维度上,Digitalmemos 创始人王启光带来了软硬一体设备,让 Agent 在不同场景下同时吸收画面与声音,实时拆解成可用的知识方案;ORRIS Scent Player 希望通过可穿戴设备读取生理信号,以气味帮助人实时调节状态;一目科技的市场负责人则分享了视触觉传感器研发上的最新进展;珀乐互动创始人杨晟,从多年文娱领域的经验出发,探讨如何构建 Agent 对多模态、人机互动的理解,创造新世界……

视觉、听觉、触觉、嗅觉……8 位分享者从各自方向拼出了 Agent 多模态现状。1976 年的论文揭示人类大脑从来不靠单一感官理解世界;五十年后,同样的规则正在被写进 Agent 的工程架构里,成为机器理解复杂世界的最优选择之一。

另外,本次活动合作方 Research AI+ 的发起人新然,还分享了一个更宏观的数据观察:据 Leonis Capital 发布的 Leonis AI 100 报告展示,超一万家 AI Native 公司中增长最快的 100 家里,有 82 位技术背景 CEO ;241 位创始人,86% 来自研究或者工程背景。

互联网时代,主导变化的是商业模式;AI 时代,有越来越多技术人走出论文与实验室,来到活动现场,在碰撞、分歧与协作中推动新的共识,推动前沿变化。

Vital Young 不追求每次讨论都有答案、也不回避争论本身。欢迎随时带着疑问与好奇心,继续来赶集!