MiniMax Tech Week 技术跃迁的全景式创新|Vital Views
参赞生命力

自 6 月 17 日起,MiniMax 连续 5 个工作日集中发布了一系列文章,覆盖了底层模型架构更新、训练效率优化、视频与音频生成、以及智能体产品等多项技术的迭代成果展示。
Tech Week 的集中发布,不仅展示了 MiniMax 在架构、工程到应用层的全面技术突破,也映射出其面向通用 AI 基础设施演进的长远布局与战略定力。
我们从这些关键性突破出发,进一步梳理其技术演化的内在逻辑与系统性创新策略,并与大家分享。
Enjoy。

MiniMax-M1:推理模型的架构级创新
6 月 17 日,MiniMax 公布首个开源的混合架构推理模型 MiniMax-M1 ,在底层架构与强化学习机制上都进行了关键性重构。
该模型采用了名为 “闪电注意力”(Flash Attention) 的架构级优化方案,通过分块计算(Tiling)、边算边归一化(On-the-fly Normalization)、共享内存与寄存器等硬件协同设计,大幅提升计算效率并有效降低显存需求。
这一优化机制最早出现在斯坦福 2022 年的论文中,先前已被 GPT-4 与 Llama 3 等开源模型技术集成。而 MiniMax 在本次的技术更新中,从工程方面进一步实现了优化迭代,以内存和硬件并行设计避免了重复读写占用 GPU HBM 内存,利用寄存器(Register)和共享内存(Shared Memory)减少内存带宽瓶颈,更好地将技术利用到落地场景中。
强化学习方面,MiniMax 提出了原创 CISPO(Clipped IS-weight Policy Optimization)全新 RL 算法。 该方法相较传统 DPO 或 GRPO,保留了所有 Token 的更新路径,避免了因 Token 剪裁而丢失关键上下文,显著提高了强化学习收敛速度和质量。CISPO 的高效运行依赖于闪电注意力,二者构成深度耦合的训练体系。
得益于上述创新,MiniMax-M1 目前支持多达 100 万 Token 的输入上下文,8 万 Token 的输出生成能力,已经达到甚至超越 Gemini 2.5 Pro 的水准。

Minimax-M1-80k 上下文长度 vs 主流模型
同时,其 RLHF 训练在 512 块 H800 上仅用三周即完成,成本较行业同类产品下降一个数量级,体现出极强的工程效率。

CISPO 算法与传统 RL 算法学习效率对比
Hailuo-02:打破全球视频模型成本纪录,实现架构突破
6 月 15 日发布的 Hailuo-02 视频生成模型,是 MiniMax 在视频大模型方向的又一里程碑式的技术成果。
该模型引入 NCR(Noise-aware Compute Redistribution)架构,通过噪声感知机制对不同区域分配计算资源。高噪声区域代表信息密度较低,适合压缩处理;低噪声区域则意味着细节关键,需保留更高算力进行建模。该机制有效减少 HBM 内存读写量逾 70%,训练与推理效率提升 2.5 倍。

Minimax NCR 架构
Hailuo-02 模型参数相较 Hailuo-01 增长 3 倍,视频分辨率提升至原生 1080P,能实现单次生成 10 秒的高清内容,涵盖精细肢体动作、流体动力学模拟与真实物理交互,甚至可还原杂技演出级别的复杂动态。其性能接近 Google Veo3、但 API 成本相比之下只有约 1/9,构建起了极高的性价比壁垒。

Hailuo 02 对比其他视频模型成本估算
从建模范式来看,NCR 不仅是架构层优化,更是一种以信息密度为驱动的训练资源再分配机制,体现出 MiniMax 对视频扩散模型核心问题的深度理解与创新能力。
MiniMax Agent:打造 "靠谱" 的通用智能体
6 月 19 日发布的 MiniMax Agent 是其在大模型 Agent 化方向的探索成果,聚焦于 PPT 制作、网页搭建、代码辅助等任务,从工程层面实现了跨越式创新。
其整体架构采用分层协作设计,由 "总调度 Agent" 负责理解全局任务目标,并调配多个 "执行 Agent" 分别完成子任务,支持最多 7 个 Agent 并行协作。结合长记忆机制和 "反思" 功能,Agent 能在执行中持续监控任务进展,存取关键信息,并自动调整策略。
在实际 Demo 中,MiniMax Agent 已能完成从数据整理到页面设计、图表生成的完整 PPT 制作流程,并具备一定程度的多模态协同能力。

MiniMax Agent 产品官方页面
MiniMax 所强调的 "靠谱" 理念,更注重在真实场景中的工程稳定性与可控性,而非片面追求模型的智能化极限,体现出其在产品定义上更为务实和可落地的思路。
Video Agent 与 Voice Design:从工具走向智能创作链路
此外,新推出的 Hailuo Video Agent 进一步扩展了视频生成产品能力,打通从创意构思、分镜设计、图片素材生成、配音到剪辑的完整视频生产链路。用户只需提供自然语言指令,系统便可自动调用各类工具模块,并实时可视化思维链路,使整个创作过程清晰可控。

MiniMax Hailuo Agent Platform
Voice Design 则面向音频生成推出了专业级的音色生成工具。借助 MiniMax 自研语音模型 Speech-01 和 02,Voice Design 支持** "任意语言 × 任意口音 × 任意音色" **的自由组合。通过对用户需求的拆解,转化为发声方式、情绪基调与角色画像等标签,系统可自动完成音色编码与生成,同时还支持 "抽卡" 机制,为用户提供多次尝试,以便生成理想声音状态。
Voice Design 有效解决了传统语音合成中音色库通用性强但细分度不足、用户素材准备门槛高等难题,特别适用于游戏、播客与虚拟人物场景,极大拓宽了语音生成的应用边界。

MiniMax Voice Design 音色设计架构
纵观此次 Tech Week 的集中发布,MiniMax 展现出清晰且坚定的技术进化路径——以系统化的架构创新与面向实际的工程设计,持续推动 AI 从底层能力到应用形态的全面跃迁。
在基础层,其自研的 Flash Attention 与 NCR 架构精准聚焦算力效率与资源调度问题,重构了大模型的部署性价比;在产品层面,从通用 Agent 到音视频生成链路,MiniMax 正在搭建一个由模型能力驱动、可被真实使用的智能生态系统。
MiniMax 所坚持的,不是参数规模的炫技竞争,而是一种根植现实问题、强调使用体验与系统集成的技术战略。
我们认为,这种兼具判断力与执行力的路径,不仅体现出其深厚的技术洞察,更是 MiniMax 构建长期技术护城河、穿越周期创造价值的关键所在。





