产品

o1

OpenAI o1

OpenAI o1 是 OpenAI 于 2024 年 9 月发布的首个通过强化学习训练的推理模型系列,包含 o1-preview 和更小、成本更低的 o1-mini 两个版本。据云启资本的分析,o1 的核心突破在于引入了"思维链"机制——在给出最终答案前,模型会在内部进行长链条的逻辑推理和自我纠错,模拟人类"系统2"的慢速理性思考,而非传统 GPT 模型的直觉式反应。

在能力表现上,o1 在需要深度推理的领域展现出显著跃升:国际数学奥林匹克资格考试中正确率达 83%,远超 GPT-4o 的 13%;编程竞赛 Codeforces 中超过 89% 参赛者;北美数学竞赛跻身全美前 500 名之列。多模态理解测试 MMMU 中,o1 以 78.2% 成为首个可与人类专家竞争的 AI 模型。不过云启资本也指出,o1 当时不具备网络浏览、文件上传等 ChatGPT 的实用功能,世界事实知识表现不及 GPT-4o,日常场景下 GPT-4o 仍更实用。

技术层面,源码资本推测 o1 可能结合了过程奖励模型(PRM)与蒙特卡洛树搜索,通过"验证每一步"而非仅反馈最终结果来密集训练模型。OpenAI 研究员 Jason Wei 将其概括为"游戏规则完全被重新定义"——关键不在于扩展训练计算,而在于思维链带来的自适应推理时计算扩展。真格基金支持的季逸超团队则通过 API 实验发现,o1 的推理 token 数量与请求时长呈线性关系,暗示其可能仍是线性自回归解码而非并行树搜索。

o1 的发布也标志着 Scaling Law 的新方向:性能提升不仅依赖预训练数据,更可通过强化学习计算量和延长"思考时间"实现。线性资本在 2024 年 10 月的讨论中认为,o1 尚处"从有到能用"的早期阶段,回答一个问题需 30 秒,速度和效率仍有很大提升空间。至 2025 年 4 月,o1 系列已被 o3 和 o4-mini 取代,后者在更低推理成本下实现了更高性能。

由 AI 生成,可能出现错误,请仔细核对内容。

o1产品
OpenAI o1
渲染中…
在 13 篇文章中被提及

相关报道