我让 MiniMax 接管了我的电脑,结果……
当 Agent 只活在网页里,它的能力上限是死的。
当 Agent 只活在网页里,它的能力上限是死的。
👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon
1 月 12 日 Claude Cowork 发布之后,很多人注意到了一个非常明显的变化:
大家突然不太关心 Agent 会不会在 Web 端上做长序列任务了。
因为这一层,已经不构成差异化了。
在 Web 端里会拆任务,甚至能把一个复杂目标拆成十几个子步骤,再做成自动化执行,已经不算是差异化优势。
因为,Claude Cowork 把 Agent 产品的竞争往前推了一步,让 Agent 进入桌面级任务执行。

于是,一个新的关注点正在形成:能不能进我的电脑、能不能看我的文件、能不能进我的系统、能不能在我不盯着的情况下,把一段工作跑完?
这可能才是 2026 年 Agent 的分水岭。 也正是在这个节点,很多 AI 基础模型厂商的产品开始涌现。
昨天,MiniMax 官网上线了 MiniMax Agent Desktop App,网页版的 MiniMax Agent 也升级为了 2.0,推出了「专家 Agent」,试图推出一个新概念:AI-Native Workspace(AI 原生工作台)。
🚥 接下来,分享我们对这 2 个新功能的全面实测体验。
Case 1|MiniMax Agent Desktop
第一步很简单,直接去 MiniMax Agent 的官网,下载 MiniMax Agent Desktop就行。
现在这个版本是免费的,基本没有门槛,下载完就能直接上手体验。


桌面整理
先从一个最基础的功能开始试。当时 Claude Cowork 最出圈的,其实就是整理桌面,这个功能本身也很直观。
上面那张图是我一开始的桌面状态,说实话就是很乱。文件、图片、录屏混在一起,分散在各个位置,找东西也不太方便。
下面那张图是它整理之后的结果,可以明显看到桌面清爽了很多,文件被归到一起,看着也更顺眼了。

我还专门录了一个视频,后面做成了动图。
从这个动图里可以看到,它是直接在桌面上实时操作的,会一边跑一边帮你把这些文件整理好,整个过程是可见的:

我又单独截了几张图,可以更清楚地看到它是怎么做的。
它会把原本散在桌面上的文件,按类型分好,然后放进它自己新建的文件夹里,比如录屏、图片、项目这些,整体逻辑还挺清楚的。

深度打通本地文件
从上面这个例子其实已经能看出来,MiniMax Agent Desktop 是可以直接访问你本地文件的。
不过它的做法比较克制,会尽量让你先选定一个文件夹,只在这个范围内操作本地内容,这样风险也会低很多。比较稳妥的方式,是在本地单独建一个文件夹,当作你的项目库。
之后就让 Agent 只在这个文件夹里工作,所有文件整理、处理、生成,都在这个范围内完成:

我之前其实已经用 MiniMax Agent 做过一次表格。
当时我整理了一个 X 上 100 位 AI 博主账号的 CSV 文件,里面包括他们的名字、对应的 X 主页链接,还有一些简单的账号简介之类的信息。

然后我就直接让它从这个 CSV 里,帮我筛出 5 个需要重点关注的 AI 产品类 KOL 账号。
接着再让它进入对应的 X 链接,抓取最近的内容,最后整理成一份 PDF 简报。
提示词如下:
你现在可以操作我的电脑,包括:1️⃣ 读取本地 Excel2️⃣ 打开浏览器并登录网页3️⃣ 下载素材并保存在本地4️⃣ 最终输出一份分析报告。 读取 (ai_trends_watchlist.csv)文件,帮我找出需要重点监控的 5 个AI产品KOL账号,里面有他 们X(推特)的链接,各抓取最近 24 小时内互动最高的内容,对每条内容做简要摘要,保存成PDF文存到本地里。
最后你可以看到,它确实是直接去读了我本地的这个 CSV 文件。
在此基础上,它筛出了下面这 5 个账号,基本是产业、学术、产品、资讯这几类里,各选了几位出来。

接着,它会直接从这个 CSV 里读取我给出的 X 链接,然后调用浏览器,在 X 上,把这些账号的推文内容查一遍。

然后,它会基于前面抓到的这些内容,先生成一份 Markdown 格式的报告,再把这份内容转换成 PDF 文件,整个流程是连着跑下来的,不需要我中途再去手动处理。

最后你可以看到,这些生成好的简报文件,都会被保存到我一开始选定的那个工作目录里。

我还录了一个完整的动图。
从这个动图里能看到,它生成的是一份结构很清楚的简报,关键链接基本都有,整体概览也都在。最后它把这份内容直接做成了 PDF,存到了我本地文件里。

不过到这里我觉得其实还可以再往前走一步,于是就继续给它加了一些任务,比如:
将这些PDF的内容,写成一段深度研究Prompt,打开本地的Atlas浏览器,做一个深度研究
你会发现,它是真的会接管我本地的 Atlas 浏览器,然后自己去做 Web 搜索,把相关资料一条条查出来,最后汇总成一份内容很丰富的深度研究结果。

在这个过程中,它会去查非常多的网页,有时候甚至会上百个链接,围绕这五个关键主题分别展开研究,一次把信息跑全。

最后,它会把这次深度研究整理成一份更正式的内容,里面还会包含一些偏学术风格的表格。
整理完成之后,同样会生成一份 PDF,直接存到我本地。

接下来,它还会额外给我一段结构非常清楚的深度研究提示词,让我可以直接拿去用。
因为它没法登录我的 ChatGPT 账号,所以就把这段提示词直接生成出来,我只需要复制到 ChatGPT 里,就能继续做一次更深的 research。

Case 2|专家 Agent
这次更新里还有一个比较重要的点,就是 MiniMax 推出了一个叫「专家 Agent」的模块。
简单说,你可以提前自己定制一个 Agent,在里面放入你的专属知识库,或者一些你平时用的 SOP。
通用 Agent 的能力比较平均,但在具体的垂直领域里,往往只能做到一个还可以,70 分的水平。
如果你把自己的资料、经验和流程直接喂给这个专家 Agent,它在对应领域里的表现就会明显更好,完成度也会更高,可能能拿到 80 分以上的水平。

下面我演示一个我自己做的 女频小说专家 Agent。
在 MiniMax Agent 的后台里,你可以很细地去自定义这个 Agent,包括它的角色设定、功能描述,还有具体的提示词指令。
它的提示词长度上限可以到 5 万字,所以可以支撑一个逻辑很复杂的专家 Agent。
我这个 Agent 的核心思路,是让它一步步、按结构去确认用户需求,然后生成一段完整的女频小说,再根据反馈做多轮修改,必要的话还能配图。
如果用户希望留存内容,最后也可以直接把结果保存到 Notion 里。

你可能也注意到了,这里其实还可以给这个专家 Agent 接入 MCP。
在我这个女频小说专家 Agent 里,就需要用到 Notion 的 MCP。这里要填的是 Notion 的内部集成密钥,同时还能指定它可以访问哪些页面或数据库,权限范围是你自己选的。

最后,这个专家 Agent 展现出来的,就是一种流程化、分步骤确认的能力,下面这几张截图其实已经很直观了。
它会直接给你一个表格或选择界面,让你按步骤确认内容,比如题材类型、主 CP 的关系、情绪走向、重点偏好这些。
这些选项本身都是我提前设定好的,结构也比较复杂。MiniMax Agent 的专家 Agent 会把这些内容真正「跑出来」,整理成清楚的步骤和界面,再根据你的选择继续往下生成内容。

当我把前面这七八个步骤都填完之后,它会先给我一份非常完整的创作需求确认。
从故事方向到结局走向,再到是否配图、需要避开的内容,整个流程都被梳理得很清楚。
你也能明显感觉到,这种复杂度已经不太适合直接丢给通用 Agent 来做了,用专家 Agent 来承接这种多步骤、多约束的需求,会顺很多。

接下来,MiniMax Agent 就会基于这份需求,开始按步骤做规划,再按步骤把内容生成出来。
而且它不只是直接写完就结束,还会按我预设的流程做一轮回看和调整,然后补上配套的素材,比如核心人物卡、人物关系和「谁欠谁什么」的那种关系表之类的。

最后生成出来的,其实是一整份完整的小说内容。
篇幅你是可以自己选的,大概从 5000 字到上万字都可以。我当时选了一个偏短的版本,也录了一个动图,你可以看一下。
整体跑下来你会发现,在这种有流程、有约束的模式下,它生成出来的内容质量,确实要比传统的 Chatbot 高不少。

甚至在一些关键情节上,它还会自己去生成对应的图像提示词,再配上相应的插图,不需要我再单独去拆场景或写 prompt。

然后接下来,因为我一开始就跟它说了,要把小说保存到我的 Notion 里,它就会直接去调用 Notion,把生成的内容按流程存进去。

最后,在我给它开放权限的那个 MCP 工作目录下面,它会新建一个子页面,把整篇小说的内容完整地存进我的 Notion 里。


回看 MiniMax Agent Desktop 的这次体验,其实有个变化挺明显的:大家已经不太纠结模型能不能把任务拆得多细了,这些能力慢慢都变成了标配。
当它能看到你的文件、理解你正在做什么,还能在你不一直盯着的情况下,把一整段流程跑完,感觉就开始不一样了。
桌面级视角也好、本地文件也好,其实说到底,都是在解决同一件事:AI 能不能真正替你把活干完。
作为一个 AI-native Workspace(AI 原生工作台) ,这至少包含 3 点转向:
第一,Agent 能看到你的真实工作环境。
第二,Agent 能进入你的工作上下文。
第三,Agent 能长期运行、持续接管。
当 Agent 拥有「桌面级视角」,事情开始不一样了。
因为真正发生变化的,其实是权限边界。
不再局限于有限环境之后,真的可以托管,对用户来说,释放了大量的精力。
因为,在传统权限框架下的 Agent 工作流里,最后一步你依然要自己完成:打开文件、切换系统、点确认按钮、承担结果。这也是为什么很多人用完之后都会觉得:似乎没有省下精力。
这也是为什么 Agent Desktop 这类产品会出现。
这,可能才是 2026 年 AI 开始影响生产力的方式。

