TRAE SOLO 居然和 Insta360 合作了?还出了个 Voice Working 硬件
「说话」这件事,在 AI 工具里开始被认真对待了
「说话」这件事,在 AI 工具里开始被认真对待了

👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon

最近 1 年,有一批 AI 工具开始悄悄出圈:Typless、WisprFlow、豆包输入法、还有一堆类似的 AI 语音输入法。它们的功能基本都是**「对着麦克风说话,AI 帮你把口语清洗成干净的文字,然后直接输入到光标所在的任何地方。」**
这个品类能起来,背后的逻辑并不难以理解:
从「脑子里有个想法」到「把它整理成一段清楚的文字再敲进输入框」这个过程,会让很多人每天在消耗大量精力。
随着 AI 语音输入法的各种「实验性」功能的出现,厂商和更多独立开发者们发现了更适配的场景:
Vibe Voice Coding。
正好上周,「十字路口」团队就十分「应景」地和 Apple 联名推出了一个新产品概念:iShout™。极简铝合金外壳,侧面一颗苹果 Logo,接上 Mac 即用,「彻底避免偷偷摸摸用语音输入这件事,更有 Courage」(开玩笑的 😅😅😅)

而就在昨天,TRAE 在 SOLO 桌面端 + 网页端上线了语音输入功能,基于以前在 TRAE(IDE + SOLO 模式)里的语音输入功能进行了大幅优化,同时和影石 Insta360 Mic Air,推出了一款联名套装。

这个组合让大家好奇:
影石 Insta360 Mic Air 在视频创作圈本来就有不错的口碑,专门拿来做 Voice Working 的硬件搭档,选品思路是怎样的?结合 TRAE SOLO,又能提升什么样的体验?
🚥
「十字路口」团队提前拿到了这套设备,用了将近一周。下面聊聊我们的观察和「开箱体验」。
「说话」这件事,在 AI 工具里开始被认真对待了
先来说说背景,OpenAI 去年推出 GPT Voice Mode 之后,语音和 AI 交互这件事,开始有了不一样的意味。

但最初的使用场景,还是比较「消费级」的,比如问问题、随手翻译、聊天。这一层上,语音输入和智能音箱没有本质区别。
接下来,就是语音输入在 AI Coding 工具里开始被当成一件正事来做。
AI Coding 工具这两年发展很快。从最初的代码补全,到 Copilot 一类的实时建议,再到 Cursor、TRAE、Claude Code、Codex 这种 Agent 模式,AI 能做的事情范围一直在扩大,能自主推进的任务也越来越复杂。但有一个环节,一直没有被认真优化过:
用户怎么把需求合理地「喂」给 AI。
从这个背景看这次的联名就比较合理了。TRAE 目前是国内 AI Coding 领域市占率排非常高的产品,SOLO 是它今年的主推方向:高度自动化,AI 主导整个开发流程,用户只需要描述目标。语音输入接进来,和这套逻辑方向是一致的。
另一方面,Mic Air 是一款给视频创作者用的无线麦克风,核心参数是 48kHz 高精度收音、一键 AI 降噪、低延迟传输。这三个特性,在视频录制场景里有价值,在 Voice Working 场景里同样关键。
一款面向创作者的专业收音设备,被选来做 AI Coding 工具的输入硬件,说明着语音正在变成「可以认真长期依赖的工作方式」。
我们的「开箱」全记录
先把设备连起来
Mic Air 是一套无线麦克风,盒子里有发射器、接收器,还有配套的充电线。

发射器的组合非常方便,整体都是磁吸式的,只需对准贴合就可以,很灵巧:
外观很轻巧,发射器可以夹在衣领上或直接放桌面,接收器是 USB-C 接口,插进电脑就能用。出厂已经配对好,不需要额外操作。

连接过程很简单。把接收器插进 MacBook 侧边的 USB-C 接口,系统会自动识别成音频输入设备。台式机的话,找主机背后的 USB-C 口插上,同样能识别。

插进去之后,去「系统设置 - 声音 - 输入与输出」,把输入设备切到 Mic Air ,音量调最大。增益建议保持在 2 档以内,就是接收器上亮 2 颗白色指示灯的状态,收音稳定,不容易爆音。

TRAE SOLO 有两个入口:macOS 桌面端可以去 trae.cn 下载;网页端访问 solo.trae.cn,不需要安装。两个端我都用了,平时更习惯本地端,打开快。
登录之后,在输入框底部找到麦克风图标,点一下就能开启语音输入。没有额外的授权弹窗,不需要进设置配置,点了就开始说。
从拆箱到第一次开口说话,我花了大概不到 5 分钟。之后,我们就可以佩戴上 Mic Air,进入到 TRAE SOLO 然后通过点击右下角的语音按键,进行 AI Vibe Vocie Coding 了:

智能结构化转录
首先,Vibe Voice Coding 最重要的能力之一往往被认为是:「结构化转录」。
用过语音转文字的人大概都有这个体验:识别率不是最大的问题,真正麻烦的是转出来的内容太「原始」,口头禅全留着,重复的词、停顿、语气助词一个没少,读起来费劲,直接用不了,还要手动再整理一遍,甚至还需要用 AI 工具或者内置的提示词优化模块再重新梳理,反而比打字更麻烦。
TRAE SOLO 的语音输入主打的是「口语清洗 + 结构化输出」。来看看看看实际效果。
TRAE SOLO 并不只是为了 Coding 的产品,它有 2 个模式:MTC (多场景办公任务)和 Code(全流程开发),可以通过左上角一键切换,每个模式都可以使用语音清理。

我用了一个对自己来说比较熟悉的场景:作为 AI 博主,想让 TRAE SOLO 帮我整理一份海外 AI 语音赛道的可视化研究报告。没有提前打草稿,按平时说话的节奏,直接对着 Mic Air 口述:
「帮我做一份研究报告,就是那种……海外 AI 语音赛道的,我想把主流玩家都盘一下。WisprFlow、Typless,还有 OpenAI Voice、ElevenLabs,嗯……对,主要就这几家。把他们过去一年的融资情况、用户规模,还有产品更新的时间线都扒一下。最后整理成一个可视化的网页,有图有表,这样比较直观,我要发到社群里给大家看。」

这段话里,有「就是那种……」「嗯」「对」这类口头禅,也有「这样比较直观」这种多余的后缀。
TRAE SOLO 接收之后,转录出来的版本是:
「帮我做一份海外AI语音赛道的研究报告,整理WhisperFlow、Typeface、OpenAI Voice、Even Labs等主流玩家过去一年的融资情况、用户规模、产品更新时间线,最后输出可视化网页,包含图表,用于社群分享。」

口头禅清干净了,「嗯」「就是那种」基本都删除了,所有「对 AI 模型不起作用的语病词」都清理了,而且整体的提示词更精简,转成了具体的动作「输出」。

而且,很多时候它还会自动做结构化处理,把一段连续的口述整理成了编号列表,每条需求单独成句,完全可以直接作为 Prompt 使用。
我们原本设计了一个 AI Journal 的博客网站,整体是 Forest Sage 配色、Funnel Sans 标题、Newsreader 正文、Geist 辅助信息,加了大面积 atmospheric landscape 风格的渐变氛围:

但是这个博客网站的详情页还是有很多硬伤,这时候就可以用 Mic Air 清晰表达优化方案:

转录结果:

TRAE SOLO Code 模式就会根据这一段结构化的内容,去修改的 AI Journal 博客网站展示:

最后的效果是这样的,最上方的进度条和右侧的卡片大纲以及一键复制功能基本都弄上了:

这种「说着说着补充」的表达方式,在真实工作中很常见,尤其是刚开完会、脑子里有一堆信息等着处理的时候。
TRAE SOLO 能把这种非线性的口述整理成顺序清楚的列表,是这个功能里我觉得最实用的部分之一。
这一轮顺带测了一下 Mic Air 的降噪效果。我刻意开着电脑风扇、旁边放着背景音乐,制造了一个比较嘈杂的环境。AI 降噪能力下,转录结果没有明显受到背景噪音干扰,识别率还不错。
这里有一个细节,我觉得体验很好:TRAE 能准确区分「这是需求内容」和「这是功能指令」。同样是口头说出来的话,前者进需求处理,后者触发功能操作。这个区分的准确率很高,误触发的情况很少出现。
整体来说,有一个感觉比较明显:工作流里的「断点」少了。
还有,Mic Air 低延迟的特性,在这个场景里感知比较直接。从开口说话到 TRAE 开始处理,几乎感觉不到间隔。这对说话节奏快、说完就想立刻看到响应的人来说,会直接影响使用意愿,一旦有明显延迟,语音输入的流畅感就打折扣了。
实时问答互动
这个功能目前还没有上线,预计 4 月底支持,所以我们没有实际测到,简单说一下方向。
前两个功能,一个解决「输入」,一个解决「操作」。实时问答互动要处理的,是「讨论」。
简单说,就是可以和 AI 进行语音形式的来回对话,实时转录、实时响应,参考 GPT Voice Mode 那种语音交流的体验,只是使用场景放在 AI 编程工作流里。
有一个比较典型的使用方向:技术选型讨论。
比如,我们可以设想这样的一个场景:遇到一个拿不准的实现方式,可以直接开口说「这里用 async 还是 queue 更合适」,AI 给口头解释,你说「那就用 queue 吧,帮我改」,整个决策过程不需要打任何字。
这大概是语音输入在 AI 编程工具里,能做到的一个比较完整的使用状态。这个功能的上线,值得期待。
聊聊这次联名背后的逻辑
所以,AI Vibe Voice Coding 这件事的意义,到底在哪里?
如果只说「AI 工具多了一个语音输入方式」,这件事不值得单独说。真正值得说的,是它碰到了一个之前很少被认真处理的层面。
AI 工具这两年的竞争,主要发生在两个地方。
【1】一个是模型能力:是否能处理更复杂的任务。
【2】另一个是产品交互:谁的 Agent 流程更顺、自动化程度更高、从需求到结果走的路更短。
但有一层,一直是缺位且被忽视的:**用户和 AI 之间,信息是怎么传递的。这一层,过去默认就是键盘和打字。**这个默认没有问题,但它的效率确实有上限。
当 AI 工具进入更重度的使用阶段,比如每天几十次、上百次的任务输入,打字的摩擦感开始变得明显。尤其在需求复杂、思路还没整理好的时候,把想法转化成精准的书面文字,本身就是一件有成本的事。
这一点,其实已经在 AI 圈最头部的一批人身上先发生了。前 OpenAI 创始成员 Andrej Karpathy 和 Vercel CEO Guillermo Rauch,都公开表示自己的主力输入方式已经不再是键盘,而是 AI 语音输入。

Karpathy 的原话是:
「It's not really coding — I just see stuff, say stuff, run stuff, and copy-paste stuff, and it mostly works.」
背后的「数字逻辑算数」并不复杂:人说话大约每分钟 140 词,打字大约 40 词。过去 AI 跟不上,转录不清楚,这个差距不重要;现在 AI 跟得上了,键盘反倒成了潜在瓶颈。
TRAE 这次在 SOLO 桌面端+网页端里做语音输入,思路和 SOLO 的方向是一致的。SOLO 本来就是为「用户只需要描述目标,AI 推进一切」这个方向设计的,语音降低了「描述目标」这个动作的成本,两件事在同一条线上。
Mic Air 加进来,是把这件事做实了一步。专业收音设备的介入,意味着这套工作方式可以长期稳定地用下去,而不是将就。
从这个角度看,这次联名的意义在于:把语音从一个「可选项」往「值得认真配置的工作方式」推了一步。
🚥
接下来,我们或许可以做一个大胆预测:
Voice Working 这件事,2026 年会有越来越多的 AI 工具认真对待。
现在的主要阻力其实不在技术,而在使用习惯。很多人还不太习惯对着屏幕说话,怕打扰到别人、怕不好意思。
不过,这些「硬门槛和软门槛」一定会随着工具成熟度的提升慢慢降低。
TRAE SOLO + 影石 Insta360 Mic Air 这个组合,算是在这个方向上,给出了一个早期答案。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪
