GPT-4.1 深夜亮相 | 在闭源堡垒崩塌前夜?GPT-4o 终于迎来了它的接班人

GPT-4.5 三个月后淘汰。

时间先倒回一年前,2024年5月,OpenAI发布多模态语言模型 GPT-4o,可处理文本、音频和图像的任意组合输入,并生成相应输出。其多模态能力被认为是 OpenAI 发展道路的里程碑。

今天,OpenAI 发布 GPT-4.1,它的进化版终于到来了。

当所有人都在猜 OpenRouter 平台上的神秘模型 Optimus Alpha 是否是个开源大模型、o3、o4-mini哪个会先到来时,OpenAI 今天把 GPT-4.1 发布了,这是个首先面向 API 开发用户的大模型。

GPT-4.1,in the API,下一代进化版

总的来看,OpenAI 本次发布的是一个系列:GPT-4.1、GPT-4.1 mini、GPT-4.1 nano,在指令遵循和编码上,相对于 GPT-4o 得到了更大的改进,更大的上下文窗口(高达 1M 个token)。

同时值得注意的是,4.1 只对 API 开发者用户开放。

但也并不是像大家预想的那样是一个革命性的突破。

GPT-4.1 相比于 GPT-4o 有了更大的提升,Mini 和 Nano 则注重速度和更低的成本

在 SWE-bench(软件工程基准测试,代码理解、调试和生成等复杂任务)上的验证准确率(Verified Accuracy),GPT-4.1 系列中,GPT-4.1 的准确率(55%)远高于 GPT-4.1 mini(24%)和 GPT-4o mini(9%),甚至高出了GPT-4o 20 个百分点

模型现在探索代码库、完成任务、生成能跑还能通过测试的代码,能力提升了很多。

GPT-4.1 在前端编码上明显比 GPT-4o 强,能做出功能更好、界面更漂亮的 Web 应用。官方给了一个创建卡片界面的示例:

Prompt: Make a flashcard web application. The user should be able to create flashcards, search through their existing flashcards, review flashcards, and see statistics on flashcards reviewed. Preload ten cards containing a Hindi word or phrase and its English translation. Review interface: In the review interface, clicking or pressing Space should flip the card with a smooth 3-D animation to reveal the translation. Pressing the arrow keys should navigate through cards. Search interface: The search bar should dynamically provide a list of results as the user types in a query. Statistics interface: The stats page should show a graph of the number of cards the user has reviewed, and the percentage they have gotten correct. Create cards interface: The create cards page should allow the user to specify the front and back of a flashcard and add to the user's collection. Each of these interfaces should be accessible in the sidebar. Generate a single page React app (put all styles inline).

指令跟随上,GPT-4.1 也有不俗的表现。

GPT-4.1 模型在处理长文本时的能力有了比较大的提升,通俗点来说,就是它能在很长的文本中精准找到关键信息。

“在所有位置和所有上下文长度下都能准确检索”

这意味着,GPT-4.1 不仅能找到信息,还能理解信息的上下文,判断它对任务是否有用。

在 OpenAI 公开的长文本上下文理解基准测试「MRCR」中,GPT-4.1(以蓝色标识)是几乎唯一能够在 token 数量增加时仍维持高精度的模型。

在 512k token 甚至是 1024k token 的超长文本场景下,GPT-4.1 依然能实现接近 50% 的精度,这表现确实不俗。

长上下文性能在多模态场景中也很关键,比如处理长视频。

在 Video-MME(长无字幕)测试中,模型需要根据 30-60 分钟的无字幕视频回答多选题。

GPT-4.1 表现拿下 72.0% 的得分,超过 GPT-4o 的 65.3%,创下最先进的性能。

从定价角度看,GPT-4.1 nano 或为 OpenAI 迄今发布的最具成本效益且速度最快的模型之一。根据定价信息,其输入价格为 0.10 美元/100 万 token,缓存输入为 0.03 美元/100 万 token,输出价格为 0.40 美元/100 万 token。

反观 GPT-4o:输入 2.5 - 3 美元/100 万 token,输出 10 美元/100 万 token。

OpenAI 的 GPT-4.1 现已对大多数接入 API 的 AI 编程厂商可用,比如:Copilot、WindSurf、Cursor

这一新的旗舰模型,已在 API 中提供给所有开发者级别(1、2、3、4、5)。

在产品发布会上,OpenAI 的主持人也大方了一回,把“最便宜,最快速,最智能”的** GPT 4.1 全面免费( 7 天)**,接下来也会迎来一大波打折季。

与之相对的是 GPT-4.5-Preview 将在三个月后被弃用,于 2025 年 7 月 14 日从 API 中移除。

OpenAI 何时能放一个真正的开源大模型?

不过,即便 GPT-4.1 各版本的价格全面比其前身要低一些的同时,其本质属性仍非开源。

大家在DeepSeek百日剧变后,开始真正地期待 OpenAI 何时能放一个真正的开源大模型?

DeepSeek 的动作不仅让大家看到了开源模型的潜力,也把整个行业的竞争推到了白热化。过去,OpenAI 一直靠着闭源的 ChatGPT 系列在市场上呼风唤雨。

但现在风向变了——闭源就是比开源强的定论早已烟消云散,开源的透明性、灵活性和社区驱动的快速迭代成了新宠。

用户们,尤其是开发者跟企业,越来越想要一个透明、性价比高的模型,而不是只能用 API 调来调去的"黑盒子"。

李飞飞合著的《2025年人工智能指数报告》(Artificial Intelligence Index Report 2025)中,写道:

开源模型已经"够好",闭源不再是唯一选择,Chatbot Arena 榜单上,闭源模型的领先优势仅剩 1.7%。

OpenAI 现在开源的压力挺大的,原因大概有这么几个:

  1. 对手:DeepSeek R2 快发布了,Sam Altman 也在访谈中承认,OpenAI 在开源上起步晚了点。
  2. 用户:当开源模型、小模型的流行度飙增时,一些做AI硬件、有隐私需求的企业与用户,已经开始表现出了他们强烈的青睐。当用户开始用脚投票时,再开源可能就晚了。
  3. 社区影响力:DeepSeek和Qwen已经印证了开源模型能够依靠社区一起搞,更新快。
  4. 市场:Anthropic、Cohere 这些公司在开源上并没有闲着的打算。

总之,竞争、需求、社区、法规、市场这堆事儿都推着 OpenAI 往开源走。

Sam Altman 在一场访谈中承认" OpenAI 开源是有点慢了"

现在全网都在盯着 OpenAI,看他们到底啥时候能把这个"真正的开源大模型"掏出来。

OpenAI 是会直接放大招,还是再搞一波营销?

不管怎样,当OpenAI的开源大模型问世,AI领域内的初创企业们将会再一次如沐甘霖。OpenAI 的入场,意味着开源已然成为 AI 大模型研发企业社会价值的"再评判标准",无论是主动选择还是被市场推动

OpenAI 终于需要开始思考如何响应 DeepSeek、Qwen、Meta、Mistral 等等厂商所引爆的开源潮,我们也终将看到这股潮水流向何方。