MiniMax 发布 M2.7,当模型开始自我进化|绿洲生命力

生产力的组织方式即将改变

可以给出答案,但无法稳定完成任务,是模型在过去四年迭代中的共性问题。

这一情况主要是受主流迭代路径的影响。

2017 年,OpenAI 在 Deep Reinforcement Learning from Human Preferences 中提出,用人类偏好替代手工奖励函数,使模型在没有明确目标函数的情况下学习复杂行为。这一思路奠定 RLHF 的基础,极大提升了对话模型的可用性,在 "生成—打分—更新" 的循环中,模型能逐步收敛出最接近人类预期的问题结果。

但现实中,任务的完成,并不只能依赖结果。

执行过程里,问题会不断出现,需要时刻判断状态、调整工具顺序、作出中间决策等。只要这些环节缺乏优化机制,模型就会始终出现只有结果,路径不稳定、无法稳定完成任务的状况。

一言蔽之,RLHF 方案只能让模型学会给出答案。如何行动且解决问题?模型并不知道。

如果问题出在行动过程中,那优化目标就不能停留在 "答案" 上。

MiniMax 昨天发布了新模型 M2.7,正是沿着这一思路展开工作。 在 M2.5 发布仅一个月后,MiniMax 即完成了 M2.7 的迭代。这次,模型不再只关注答案生成,通过 Agent Harness 的方式,系统提供了执行环境、评估机制与状态管理,使模型在任务过程中持续记录轨迹,并根据结果不断调整后续行为。

执行、评估与修正,就此形成循环。

其实在过去,行业也曾尝试引入过程反馈机制。OpenAI、Anthropic 与 DeepMind 分别探索了 Process supervision、Self-refinement 和多轮推理结构,但这些方法大多停留在单次任务的修正能力上。M2.7 首次将过程反馈纳入了系统本身,在多个任务实现过程中,模型也拥有了可以持续优化的能力,真正实现 "自我迭代"。在内部评测中,这种多轮优化可以连续运行上百次迭代,并带来约 30% 的性能提升,无论指令遵循、办公协同和 Coding 层面,都有极大提升。

如果与 2 月发布的 M2.5 对比,在文档处理能力上,GDPval-AA 已达到 1495 Elo,在开源模型中处于领先水平;Artificial Analysis Intelligence Index 得分提升至 50,一个月内提高 8 分,进入全球前列;幻觉率约 34%,仍保持在同类模型中的较低水平。

哪怕是 MLE Lite 的 22 道高难度竞赛中,M2.7 最后仍能取得 9 金 5 银 1 铜的成绩,得牌率 66.6%,仅次于 Opus-4.6(75.7%)、GPT-5.4(71.2%),与 Gemini-3.1 持平。

此外,在更贴近真实工程任务的 SWE-Pro 测试中,M2.7 取得了 56.22% 的正确率,与 GPT-5.3-Codex 持平;在端到端项目交付的 VIBE-Pro 基准中同样取得高分。内部测试数据表明,部分研发场景中,这种 "执行中优化" 的能力,已经可以覆盖约 30%–50% 的实际工作量。

更复杂的综合任务中,这种能力同样成立。

在包含 40 个复杂技能的场景中,模型仍然可以保持 97% 的指令遵循率;在 MM-Claw "龙虾测试" 中,正确率达到 62.7%,接近 Claude Sonnet 4.6,甚至被部分用户称为当下最适配 "龙虾" 的模型选择。

如果把时间线拉长,类似的技术结构性变化,并不是首次发生。

蒸汽机时代初期,工人需要持续手动调节机器;调速器出现之后,机器可以根据状态自动调整。Kubernetes 出现也是同样的逻辑,工程师不再需要手动操作系统,只需要定义目标,系统便会自动化部署、维持运作状态。

M2.7 的更新,与其说是一次模型迭代,更重要的意义在于评价标准的改变。过去模型之间,比拼的只是问题回答能力;下一阶段,对任务执行的过程与结果负责,才是模型的核心迭代方向。

当模型开始自我进化,Agent 将不止充当人类的辅助工具。

社会生产力的组织方式,也即将发生根本改变。

(点击阅读原文,了解本次更新细节信息)