产品

GPT3

GPT-3

GPT-3 是 OpenAI 于 2020 年 6 月发布的生成式预训练语言模型,采用 Transformer 解码器架构,拥有 1750 亿参数和 2048 个 Token 的训练文本长度。其训练数据接近 5000 亿个 token,主要来源包括 Common Crawl、Webtext2、Books 及 Wikipedia 等,其中 Common Crawl 占比最大。据微软发布的信息,OpenAI 使用了一台全球排名前 5 的超级计算机系统来训练 GPT-3,该系统拥有超过 28.5 万个 CPU 核心、1 万个 GPU 和每秒 400G 的网络,训练成本约为 1200 万美元。

GPT-3 的出现标志着大模型"暴力美学"的起点,但 OpenAI 很快意识到模型本身并不足以创造重大商业价值——据 Sam Altman 回忆,最初向创始人推销 GPT-3 时,除了文案写作外几乎找不到真正的应用场景。这一判断推动了 OpenAI 的阶段性转向:将 GPT-3 对齐成普通人能用的界面,先后发展出 InstructGPT、SFT(监督微调)和 RL(强化学习)等后训练技术,最终催生了 2022 年 11 月横空出世的 ChatGPT。用源码资本的话说,这体现了 OpenAI"从模型到产品的端到端优化能力"。

由 AI 生成,可能出现错误,请仔细核对内容。

GPT3产品
GPT-3
暂无关系图谱
在 4 篇文章中被提及

相关报道