刚刚,o3 与 o4-mini 正式发布,定义未来推理新范式,o1 系列被扫进历史垃圾堆
o3 与 o4-mini,重新定义了未来的推理范式。

今天,OpenAI 正式发布 o3、o4-mini、o4-mini(high)!
这次不是升级,而是颠覆。
继 o1-preview 之后短短 3 个月,在那场 OpenAI 12天发布会的最后一天,o3 概念正式问世。
在通向 AGI 的北极星—— ARC-AGI 基准测试中,o3 更是突破所有历史纪录。
不过,o3 面向大众沉寂的几个月里,作为 OpenAI 迄今为止最具成本效益的 o3-mini(擅长快速推理)和 o3-mini-high(擅长编程代码),似乎并未获得想象中的用户人群一边倒的狂热掌声。
这反而引起了大家对 o3 完整版的无限期待,希望它能带给大家**" o1 时刻 "**。
大家希望这批新模型将重新定义 AI 应用的边界,无论普通用户,还是开发社区都能获得珍贵的"可能性"。
我整理了这场发布会,完整梳理了这回的" o3 时刻 ",以及预兆下一个版本的"o4-mini"。
你认为它们将会是 OpenAI 迈向 AGI 里的又一枚关键拼图?还是一枚在 ChatGPT 产品侧过渡性补强和商业化过渡中的弃子?

这回发布会由 OpenAI 联合创始人 Greg Brockman 和 首席研究官 Mark Chen 等人主持,他们继续带着那张微笑的脸,讲述这回的技术革新故事。
o3 与 o4-mini 全面进化
这回发布的 o3 专为深度编码工作流程和复杂技术问题解决而设计,而 o4-mini 则注重效率。
o3 可以称为 OpenAI 最强推理模型:在编码、数学、科学、视觉感知等领域的基准测试中都堪称 SOTA 级别。
我整理了几个 o3 重点关注方面:
- 适用场景:适合需要多方面分析、答案不明显的复杂查询。
- 视觉任务突出:擅长分析图像、图表、图形
- 错误率降低:外部专家评估,o3 在困难现实任务中比 o1 重大错误少 20%,尤其在编程、商业/咨询、创意构思领域表现优异。
- 分析严谨:早期测试者赞其作为思维伙伴,特别在生物学、数学、工程领域能生成并批判性评估新颖假设。
o4-mini 则是一个针对快速、成本效益推理进行优化的较小模型,但是性能同样强悍:
- 小而强大:体积小、成本低,尤其在数学、编程和看图任务上表现惊艳。
- 数学和编程能力极强:在 2025 年的AIME数学竞赛中,o4-mini 用 Python 辅助时得分高达99.5%。
- 不只擅长理工科:它在非理工任务(比如商业、创意)以及数据科学上也比上一代(o3-mini)更优秀。
- 效率高:适合需要快速处理大量问题的场景,比如大数据分析或高频任务。
这两个模型在指令遵循及响应有用性、可验证性方面都优于前代,更自然、更个性化。
跑分方面,也不得不看,毕竟现在 LLM 一出来就要在各种基准测试上狂飙。如果只落下一个车位,就会被人放在排行榜上。
这回的 o3 和 o4-mini 在 AIME 数学测试、编程能力、GPQA Diamond PHD 级别科学测试题、人类最终考试等多个针对复杂问题解决能力的测试集上,都表现极佳,与前一代的 o1 平均拉开了 20% 的差距。

在包括 AIME 2024、 AIME 2025 数学竞赛和一些其他基准测试中,o4-mini 都要比 o3 完整版表现出的数学推理和问题解决能力还要强。
搭配上 Python 和浏览工具的 o3 ,在人类最后考试上甚至达到了 24.9%的准确率,几乎与 DeepResearch 持平,但是 o3 模型的运行速度是 DR 完全不能比的。
数学推理能力
我们也找来了 2 道都曾难倒 o1 和 o3-mini 的"难题"来考验下 o3 和 o4 系列。
1.李老师夫妇最近生了二娃,小张在两个娃娃中随机选一个被告知是女孩,请你告诉小张另一个娃也是女孩的概率(假定生男生女的概率均等)
这题曾连续难倒 o1 和 o3-mini,但是 o3 思考 10 秒后,通过极短的推导思路推理出了正确答案。

o4-mini 和 o4-mini(high)在推理上的效率大幅提升,面对这题几乎是秒解。

2. 有 4 头牛,这 4 头牛的重量都是整千克数,把这 4 头牛两两合称体重,共称5 次,分别是 99、113、125、130、144,其中有两头牛没有一起称过。那么,这两头牛中重量较重那头重量为
面对这道题,o1 和 o3-mini 也是连续错误。
o3、o4-mini 和 o4-mini(high)全部答对,并且 o4-mini(high)只用了非常夸张的 16 秒。
不过,不得不说的是 o4-mini 花费的时间甚至比 o3 还要多,达到了 2m26s,DeepSeek R1 推理这道题目也只需要 134秒而已。



多模态能力
多模态方面的基准测试主要涉及三个任务:
- MMMU(大学级别视觉问题解决)
- MathVista(视觉数学推理)
- CharXiv-Reasoning(科学图表推理)
总的来说,o3 与 o4-mini 相对于 o1 都有了不小的提升。
需要更强的专业知识和多模态理解能力科学图表推理方向,o3 比 o1 高出了 20%。

最有看点的是:o3 可以用图像进行思考。这开启了一种新的问题解决范式,将视觉推理和文本推理相结合。
OpenAI 在官方博客中说到:借助工具使用,模型可以实时操作图像——旋转、缩放或变换它们,作为推理过程的一部分。
在下面这个官方例子中,使用者输入:
我今天早些时候拍了这张照片。你能找到我看到的最大的船的名字,以及它接下来会停靠在哪里吗?
o3 展示了其 1 分 33 秒的推理过程:
- 分析图像: 我认为我在裁剪时错过了船只。它们似乎在左边,我会放大以便更好地检查。
- 分析图像: 好的,我现在看到船了。最大的那艘似乎是右边那艘红壳油轮,中间还有另一艘较小的船。用户想知道最大船的名字以及它接下来会停靠在哪里。在这个距离,船壳上的名字可能太模糊看不清。也许进一步放大能帮助看清。
o3 已经结合了视觉处理、逻辑推理和动态工具调用的能力。

这些操作并非孤立进行,而是作为模型推理过程的有机组成部分。
这意味着,模型可以在分析和理解图像内容的同时,灵活地对其进行改造。
当使用者上传一张具有比较复杂路径的迷宫图片,并尝试让 o3 解决这个迷宫并画出红色的路径时,o3 在实际的推理分析过程中会大量的运用到 Python 协助分析。

最终的答案如下,o3 利用** Python 数据分析、网络搜索、图像生成等工具协同工作**,在原有图片之上,用红色笔触绘制了一个可能的解决方案路径。

不过,从答案中也能明显观察到,o3 的视觉精度与工具的协同调用虽然已经比较成熟,但仍会存在不精准的局限性问题:过长的推理链条、感知错误、可靠性问题。
编码
在编码能力方面,o3 与 o4-mini 都大幅超越 o1。

由于 o3 和 o4-mini 在编码方面的表现比较出色,OpenAI 为此专门推出了一款新产品——Codex CLI,作为一个编码 agent 搭配这两大模型使用:
- 面向终端开发者:提供 ChatGPT 级别推理,支持运行代码、操作文件、迭代开发,集成版本控制。
- 零配置:只需 OpenAI API 密钥即可使用。
- 安全可靠:网络禁用、目录沙箱,自动审批。
- 多模态:支持截图或图表输入以实现功能。
- 完全开源:可查看代码并贡献开发。
Codex CLI 完全开源,并且之后将会持续改进。
Codex CLI 链接:https://github.com/openai/codex
另一个看点是 o3 和 o4-mini 模型可完全访问 ChatGPT 的内置工具,并通过 API 函数调用支持自定义工具。
这些模型经过训练,能够推理问题解决方式,选择合适的工具使用时机和方式,快速生成详细且深思熟虑的回答。

模型通过链式调用多个工具完成任务,并能根据获取的信息动态调整。
比如,上传一张节目表演图,并配合文字表示自己已经看到了第 4 个表演,提出一些限定性要求,让 o3 通过图片制作计划表。

成本效益对比一直是各路观察者最为关注的内容,因为它直观地展现了资源投入与产出效果之间的关系。
对于 AIME 2025 基准测试,在几乎同样的推理成本下,o4-mini 相较于 o3-mini 提升了 10%。
在 GPQA 基准测试下,2 个模型却出现了倒灌现象。

这一现象在 o1 和 o3 的对比上,被一定程度地颠覆了:o3(high)在推理成本低于 o1(high)的情况下,在 AIME 2025 基准测试上高出了 10 % 左右;在 GPQA 测试中,所有的同等模型下,o3 都要比 o1 模型成本更低,性能表现上涨。

目前 o3 和 o4-mini,已经可以在各大 AI 编程厂商调用(例如 Github Copilot )。并且,从今天开始,ChatGPT Plus、Pro 和 Team 用户已经可以使用 o3、o4-mini 和 o4-mini-high,用以取代 o1 系列。
目前,我的调用栏里** o1 系列已经被撤换,全面上新 o3**。

不过,作为性能表现全面提升的推理模型,成本仍然不算低,估计将会限制配额。
接下来的几周,OpenAI 还将 发布 o3-pro。
扩展定律未死
在整个 o3 的开发过程中,OpenAI 发现"扩展定律仍然活得好好的"。o3 的大规模强化学习与 GPT 预训练一样:算力堆的越多,性能就越强。
在强化学习领域扩展计算规模,OpenAI 将训练和推理时间提升了一个数量级,性能仍显著提高。模型思考时间越长,性能越好。相比 o1,o3 在相同延迟和成本下性能更高,且思考时间延长时性能持续提升。
可以预见的是,OpenAI 的巨型数据中心项目仍将大量上马。
o3 的发布可谓是一波三折,从 Sam Altman 大脑思维的不断变换来看,可谓是「胎死腹中」又「离奇复活」。
OpenAI 在 2024 年 12 月 宣布了 o3 和 o3-mini 模型,一个月后,o3-mini 正式发布,然而,完整的 o3 模型却失联了。OpenAI 宣布取消 o3 作为独立模型的发布计划,而是将其技术整合到即将推出的 GPT-5 中。
这一招据称是为了 GPT-5 的进一步优化而争取时间。显然,这一步棋不止于技术,更涉及 OpenAI 一如既往的商业考量。
Sam Altman 的这一波波"无常"操作,吊足了大家胃口,但也引起了非议。
DeepSeek 狂轰乱炸,整整霸占科技圈头条一周后,OpenAI 突然抛出了 o3-mini。这回,在即将到来的 DeepSeek-R2 发布前夕,又再次大幅变更计划,AI 届的"产品营销大师"是否是为了精准狙击 DeepSeek?
在这个技术跃迁、竞争急剧加速的时代,没有人敢彻底下注 OpenAI 一定能走向终点——毕竟 AI 世界的**"黑天鹅"向来不缺**,DeepSeek 就是一个再明显不过的例子。

不过,无论这场 AI 大秀的镁光灯打向何方,OpenAI 都将会是"AGI 之梦"最有力的实现者,那个最有可能"领跑终点"的选手。
