产品

Transformer

Transformer

Transformer 是 2017 年由 Google 提出的神经网络架构,最初为机器翻译设计,核心创新在于用自注意力机制(Self-Attention)替代了 RNN 的顺序处理方式,使模型能够动态权衡序列中每个标记相对于其他标记的重要性。这一架构随后成为生成式 AI 的核心范式,OpenAI 的 GPT 系列即基于 Transformer 构建,从 GPT-1 开始通过"预测下一个 token"的自监督方式,逐步摆脱对人工标注数据的依赖并开启规模化训练。

然而,Transformer 的自注意力机制存在空间平方复杂度的计算瓶颈,随着序列长度增长,训练和推理成本急剧上升,这促使学界与产业界探索多种优化路径:线性注意力(如 DeltaNet、Qwen-Linear)、稀疏注意力(如 NSA、MoBA)以及 Mamba 等次二次方架构。绿洲资本投资团队回溯来看,Transformer 与梯度下降等技术在科学界早已存在,但其"革命性"在于让 AI 从"归纳"走向"生成",该机构于 2022 年 11 月明确将 AI 作为重点投资方向。五源资本投资的彩云科技则曾尝试自研非标准架构,但最终因工程化难度——缺乏专用硬件加速支持——回归 Transformer 路线。

由 AI 生成,可能出现错误,请仔细核对内容。

Transformer产品
Transformer
暂无关系图谱
在 33 篇文章中被提及

相关报道