HappyHorse 1.0,你的快乐小马已上线
快乐小马,在千问。
快乐小马,在千问。

👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon

阿里 ATH 的 HappyHorse 1.0 快乐小马,今天官宣在千问首发灰测。
半个月前,一个没有官方介绍,没有发布会,连名字听起来都有点随意的 AI 视频模型:HappyHorse 1.0,快乐小马,在 Artificial Analysis 榜单的无音频文生视这个分类里 Elo 达到了 1349,图生视频是 1403,惊艳了众人。

全网开始猜这是谁做的,讨论甚至蔓延到了 Reddit 和 X 上,大家都在翻它生成出来的案例,一边看一边猜,直到阿里巴巴 ATH 出来认领。
今天,HappyHorse 1.0 终于正式官宣灰测了。
🚥
「十字路口」团队拿到了灰测资格,第一时间测评了 HappyHorse 1.0,并分享我们的实测体验和观察。
实测完,先说结论 我们在千问上跑了很多测试,先说结论:HappyHorse 1.0 给我们最直接的感受是「稳」。
在我们设计的几个不同场景里,反复跑了好几次,结果都比较稳定。
说一下它的基本参数:支持文生视频和图生视频两种模式,分辨率最高 1080p,时长可以选 5 秒、10 秒或 15 秒,比例有 16:9、9:16 和 1:1,音频可以选要或者不要。
底层是150 亿参数的统一 Transformer 模型,音频和画面一体生成,和那种先出无声视频再单独配音的方案在架构上不一样。另外支持多语言的唇形同步,像普通话、粤语、英语、日语、韩语等都覆盖了。
千问有 2 个灰测入口:千问 APP、千问创作Web 端(c.qianwen.com),如果被灰测到了,就可以直接开始玩了。
下面用五个具体的场景,说说我们看到了什么。
五个测试,看到了什么
Case 1|镜头语言
HappyHorse 1.0 是音视频一体模型,可以直出带音频的视频,支持的语言种类也不少,中文、英语、日语都能跑。它在动态穿梭类的镜头里表现比较稳定,镜头推进过程中,人物形象的一致性能基本保持住。
提示词:
**「清晨的上海外滩,薄雾还没散,镜头从江面水平推进,经过正在晨练的中美老人,最终落在路边一杯冒着热气的咖啡上,全程有明显纵深感,光线从柔和过渡到逆光。1080p,16:9,有环境音」**
仔细看的话,最前面穿粉色衣服的老人在说话时,动作没有停下来,面部的动态衔接还算自然。右边那位老头开口之前,先停下来叉腰歇了一下,再转向左边的人说话。镜头切换之间,人物的动作跟着调整,整体形象的一致性基本保持住了。
外滩后面的江景,以及后面浦东的标志性建筑,整体符合现实世界里的空间关系。
Case 2|直播间带货
下面这个场景就比较抽象了,也是一个典型的场景:直播间带货。
提示词:
**固定镜头,一位穿着碎花裙的亚洲女主播坐在粉紫色霓虹灯装饰的直播间白色桌前,手持粉色护肤精华瓶,面带微笑直视镜头介绍产品,背景是粉色窗帘和霓虹火箭灯饰,桌上摆放着多款护肤品和化妆镜,整体画面呈现美妆博主直播风格,高清4K画质,光线柔和明亮。口播内容:"宝宝们,这款神仙精华真的绝!补水又提亮,用完皮肤水当当。今天直播间特价,赶紧去拍,手慢无哦!"**
这个场景对画面表现力的要求更高一些。因为女主播需要一边介绍产品,对应的动作和口型都需要有变换,但基本都呈现出来了,一致性保持的还不错。音画同步整体对得上。
如果仔细看的话会发现所有化妆品的 Logo 基本都保持了「Qwen」的英文,文字,直播灯光打在化妆品上的效果是比较有真实感的。
Case 3|David Fincher 风格
好莱坞商业电影的色调和质感要求比较具体,这次重点测它对色调指令的执行精度,以及音效的处理方式。
提示词:
「暗绿色主色调,高对比硬阴影,地下停车场,闪烁的冷白荧光灯,手持摄影 35mm 镜头,中近景跟拍。一名男子快速穿梭在车辆之间,脚步急促略有踉跄。音效:粗重呼吸贴近麦克风,脚步声强回响,男子低声自语断续压抑。1080p,16:9,带音频」
色调方向是对的,阴影里偏青绿,高光区偏冷白,整体对比度很强。荧光灯的闪烁有出来,不是稳定的常亮,有一两帧会轻微闪一下,停车场的质感比较到位。
手持抖动感有,人物奔跑时画面有轻微的上下颠簸,跟拍的紧张感能感受到。音效部分分了三层:呼吸声在前景,地面脚步的回响有空间感退在中景,男子偶尔低声说的几个字埋在底层,三层声音分得比较开。
仔细看男子头顶的发丝与身后灯光重叠后的光影效果,符合物理逻辑:

Case 4|港式风格
这次的 HappyHorse 1.0,其实挺适合拿来做港式风格的短片。尤其是老电影质感、或者偏真实的电视剧画面,它都能接得住。
一方面是画面风格比较稳,另一方面是它对现实世界的理解还可以,不太容易跑偏。所以我这次就直接让它去做一个经典的 TVB 刑侦无厘头短片,参考「法政先锋」。
提示词:
`经典 TVB 刑侦剧画面风格,可参考《法证先锋》《陀枪师姐》(严肃冷光,B拿记事本,A压低声音)
A:(严肃)收到线报,大明养小明。问你,边个养大明?
B:(认真记录)佢老豆?
A:(冷脸摇头)错。
B:(紧张)唔通系……凶手?
A:(一字一顿)系狗。
B:(愕然)吓?点解?
A:(憋笑破功)久仰(狗养)大明啊嘛!`
可以看出来,这次整体流程是比较顺的,成片效果也比较真实。
如果仔细看一些片段,会发现台词、语气,尤其是语音节奏,也贴近提示词中的经典 TVB刑侦剧画面风格,尤其是人物整体的形态、穿衣都比较符合「法证先锋」这类大热播经典剧集。
这说明它调用了一部分世界知识。它知道这种风格大概应该怎么说话、怎么表演、怎么塑造整体的故事走向。
Case 5|唐代国风群像
最后测的是多人群像场景。这对 AI 视频是个难点,人物多、动作多、光线复杂,容易出现人脸混在一起或者动作穿帮的情况。
提示词:
**「唐代风格客栈,木质结构,雕花窗棂,红灯笼悬挂,烛火与油灯混合光源,空气中轻微烟雾,光线层次分布。十余人围坐数桌,穿唐风长袍宽袖束腰,有人微醺,有人大笑,有人面无表情,他们在划拳。1080p,16:9,带音频」**
多人场景里,每个人物的状态有区分。镜头是逐步推进的,多镜头切换之间衔接顺畅,整体有一定的逻辑感。HappyHorse 1.0 比较适合用短提示词,让它自己去补全故事场景的展开。
服化道的细节也值得说一下。十多个人围坐数桌,每个人的长袍纹样、束腰位置、宽袖剪裁有差别,没有出现整桌人服装套用同一张贴图的情况。
仔细看其中一些人物的画面,HappyHorse 1.0 在人物拟真度上的表现比较稳定。
截了一张图,先不看动作,单看人物形象,还原度也比较高:

AI 视频阵营的「你上我下」
说回 AI 视频模型的发展速度,这件事本身挺值得停下来思考下。
把时间线列一下,节奏会更直观。
2025 年 5 月 20 日,Google 在 I/O 大会上发布 Veo 3,第一次把音画一体生成放进了主流视频模型里;同月底,快手 Kling 2.1 上线,主打 1080p 高清和性价比,Kling AI 在上线第十个月时年化收入就已经过亿美元。9 月 30 日,OpenAI 发布 Sora 2,iOS 应用上线五天下载量破百万,热度顶到了海外社交平台的前排,连带 Sora App 一起冲上美区 App Store 总榜。
10 月 15 日,Google 紧接着上了 Veo 3.1。进入 2026 年初,Kling 一口气推出了 2.5 Turbo、O1 和 2.6,把音视频同步生成做成了基础能力。
然后是 2026 年 2 月 12 日,字节 Seedance 2.0 在 Artificial Analysis 上以 Elo 1,269 登顶,HappyHorse 1.0 紧接着出现在同一张榜单上。从半年一次换位,到几个月一次,再到这次的几周,节奏在压缩。
每一次换位,中间的间隔越来越短。
不过有一点值得说清楚:这种「第一名」的换位,背后的分数差距其实没那么悬殊。各家头部模型在不同场景里各有侧重,有的在价格上更有优势。看起来像一代代的迭代,但更准确的描述可能是:
大家的能力都在一个水位线附近,你上我下,换位频繁,但差距在收窄。即便暂时被超越的「前辈」们,也依然会被认为随时会出现一个新的 SOTA 模型,重新夺回阵地。
所以,对用户来说,今天选哪个,很大程度上取决于你具体想做什么、愿意花多少时间和钱。而对内容创作者来说,这个节奏感受起来有点复杂。刚把手头的工具用熟,下个月可能又有更好的出来了;追着跑很累,不追又怕错过什么。
但好在有一件事也在同步发生:这些模型的接入门槛,真的在降,比如这回 HappyHorse 1.0 在千问的多端同时灰测。
好的模型能力,加上近的使用入口,这两件事叠在一起,才构成真正的影响力。AI 视频的竞争,demo 好看只是一部分。
对内容创作者来说,现在最实际的变化就是:打开手机就能试,不用等,不用付费,试完觉得有用再深入。AI 生成视频已经事实上成为了「人人都可以用一下」的阶段。
入口有多近,这个过程就走得多快。
🚥
「快乐小马」奔跑的故事,现在才刚到一半。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪
