Tripo AI 基础模型开源,启动"技术开源月"|绿洲生命力

参赞生命力

2024 年 3 月,VAST 与 Stability AI 联合开源 3D 大模型 TripoSR,凭借单图 0.5 秒极速建模的突破性能力,迅速成为全球 3D 创作者的首选模型。

在这一年中,开源项目不断拓宽人工智能行业的边界,有力推动了学术研究和生态商业项目的蓬勃发展。

VAST 也持续迭代升级 Tripo 系列:2024 年 9 月推出 Tripo 2.0,2025 年 1 月发布 Tripo 2.5。这些版本基于千万级高质量 3D 原生数据库训练,在生成速度、模型精度和成功率等多个维度持续突破。其卓越的几何细节精确度,重新定义了 3D 模型生成的技术高度。

在全球技术探索中,我们深知底层架构的颠覆性创新和模型能力突破,是基础模型团队的关键发展路径。在不断将 Tripo 打造成封闭环境中"更完美解决方案"的同时,我们更应该将自身转化为开源生态中的"基础粒子"。开放的技术生态比封闭系统更具长期价值。

因此,2025 年 3 月,我们启动了"技术开源月"计划。

我们将连续开源 8 大项目,覆盖从基础生成模型、核心功能组件到创新思路探索的全技术链路。期待能够构建全球首个端到端 3D 生成开源体系,并诚挚希望从事 3D 生成的研究员和生态开发者,能从我们的工作中获得启发和裨益。

今天,VAST 开源两组基础 3D 生成模型 TripoSG 和 TripoSF。

TripoSG 强势升级,首度实现 3D 生成领域 MoE Transformer 架构

TripoSG 是一个基于 RF 的 MoE Transformer 3D 生成基础模型。

本次开源 TripoSG 1.5B 模型的权重、推理代码,可在 HuggingFace 上体验交互式演示 Demo。

经测试,TripoSG 生成质量约等同于 Tripo2.0,高于市面已有的开源 3D 生成项目。突出的优势是生成结果的泛化性强,生成复杂组合物体的稳定性高。

坚持 Scaling Law、更高质量的数据、更大的模型仍然是 TripoSG 取胜的关键因素。我们分享了 TripoSG 在高效的训练路径、架构设计和数据治理方向的四个方法。

第一,率先将基于校正流(RF,Rectified Flow)的 Transformer 架构应用于 3D 形状生成。

从研发Tripo2.0 起我们发现,相较于传统的扩散模型(Diffusion Model),矫正流在噪声和数据之间提供了更简洁的线性路径建模,有助于实现更稳定、高效的训练。与 DiT 结合能够更好提供模型稳定性。

第二,为了更高效地实现 Scaling,TripoSG 是首个在 3D 领域发布的 MoE Transformer 模型。

这个方法此前在语言、图片、视频模型领域实践过,但 3D 领域落地也同样高效,这样一来,可以在几乎不增加推理计算成本的前提下,显著提升模型参数容量,并重点应用于网络中更深、更关键的层级。

同时,以 Transformer 为基础,TripoSG 融合了包括跳跃连接(skip-connections)在内的关键增强设计,以改善跨层特征融合。此外,独立的交叉注意力(cross-attention)机制也能够高效地注入全局(CLIP)和局部(DINOv2)图像特征,让输入的 2D 图像和输出的 3D 形状之间精准对齐。

第三,寻找更好的几何表示,开发高质量 VAE 与创新几何监督。

我们一直在探索更好的几何表示。在 TripoSG 中,我们选择了一种采用符号距离函数(SDFs,Signed Distance Functions)进行几何表示的 VAE,相较之下,比此前常用的体素占用栅格(occupancy grids)具有更高的精度。

同时,基于 Transformer 的 VAE 架构在分辨率上有很强的泛化性,无需重新训练,即可处理更高分辨率的输入。

第四,重视数据治理,开发了一套完善、精细的数据构建与治理流水线。

数据的质量和数量一样重要,VAST 拥有全球最多的高质量 3D 原生数据集,也同时开发了一整套完整的数据治理流水线,供开源社区参考。

流程各阶段如下:质量评分(Scoring)—— 数据筛选 (Filtering)——修复与增强 (Fixing & Augmentation)—— SDF 数据生产 (SDF Production)

通过这一流程,我们为 TripoSG 构建了一个包含 200 万高质量"图像 - SDF "训练样本对的数据集。

消融实验明确证明,在此高质量数据集上训练的模型性能显著优于在更大规模、但未经过滤的原始数据集上训练的模型。

(感谢 ChatGPT-4o 为 TripoSG 开源倾情配图)

TripoSF 解锁 3D 模型内部结构生成,更好的 Tokenizer 突破 3D 生成 SOTA

TripoSF 是 VAST 基于一个新的 3D 表示 SparseFlex 研发的 3D 基础模型。

经过测试,其结果超过市面上所有开源和闭源的工作,本次开源了 TripoSF VAE 的预训练模型及相关的推理代码,将在 Tripo3.0 时体验到 TripoSF 的满血版效果。

在结果上,TripoSF 重新定义了"模型质量的上限"

模型第一次不仅可以获得"背面",甚至可以得到"内部结构"(同时见上图的公交车座位和司机驾驶位);

同时,过去的工作生成衣服或者花瓣都是有厚度的几何结构,但如图示 TripoSF 的结果对于"单面资产"的处理更加如鱼得水。

在其他品类的模型表现上其细节的丰富程度也达到前所未有的效果。

研发 TripoSF 的针对性目标,是突破传统 3D 建模在细节、复杂结构和扩展性上的瓶颈。

在处理这一问题上过去的方法仍有许多不足,比如预处理带来的细节损失、对复杂几何形状表达能力的不足,或在高分辨率下面临高昂的内存和计算成本。我们一直在研究中寻找能够拉高 3D 生成任务上限的 Tokenizer,本次 TripoSF 的核心表示方法 SparseFlex 就是在这个方向探索的重要进展。

SparseFlex 借鉴了 Flexicubes(可微分地提取带尖锐特征的网格)的优势,并创造性地引入了稀疏体素结构,仅在物体表面附近的区域存储和计算体素信息。

带来的效果很显著:

  • 大幅降低内存占用,让 TripoSF 能够在 1024³ 的高分辨率下进行训练和推理。
  • 原生支持任意拓扑处理:不仅通过省略空白区域的体素,自然地表示开放表面(如布料、叶片),还有效捕捉内部结构。
  • 支持基于渲染损失的直接优化:SparseFlex 是可微分的,允许 TripoSF 使用渲染损失进行端到端训练,避免了数据转换(如水密化)导致的细节退化。

实验结果表明,TripoSF 的质量达到了新 SOTA。在多个标准基准测试中,TripoSF 与先前方法相比,实现了约 82% 的 Chamfer Distance 降低和约 88% 的 F-score 提升。

【 TripoSG 】

Homepage:https://yg256li.github.io/TripoSG-Page/

论文 arXiv:https://arxiv.org/abs/2502.06608

GitHub 代码:https://github.com/VAST-AI-Research/TripoSG

HuggingFace 权重:https://huggingface.co/VAST-AI/TripoSG

HuggingFace 演示:https://huggingface.co/spaces/VAST-AI/TripoSG

【 TripoSF 】

Homepage:https://xianglonghe.github.io/TripoSF/

论文 arXiv:https://arxiv.org/abs/2503.21732

GitHub 代码:https://github.com/VAST-AI-Research/TripoSF

HuggingFace 模型权重:https://huggingface.co/VAST-AI/TripoSF

更多开源项目的后续更新和强化都会第一时间更新在 VAST AI Research 的官方 Github、HuggingFace、X 中。

Github:https://github.com/VAST-AI-Research

HuggingFace:https://huggingface.co/VAST-AI

X:https://x.com/VastAIResearch

除了一系列的开源项目之外,在 Tripo 官方网站上提供的创作者工具(https://www.tripo3d.ai),及极高性价比的API (https://www.tripo3d.ai/api) 都可以访问使用 VAST 提供的最新模型服务。

如有技术及学术层面的建议与合作,欢迎发送邮件至research@vastai3d.com 与我们交流。

扫描仪扫不全月背的沟壑,但旷野上总有人埋头凿矿。

叮当声此起彼伏,直到某天连成一片——开源是铁镐落在土里的响动,月球背面没有地图。