京东618: 数字人又进化了吗?
一台没有真人的晚会,和一次数字人直播的系统性升级
一台没有真人的晚会,和一次数字人直播的系统性升级

👦🏻 作者: 一涛
🥷 编辑: Koji
🧑🎨 排版: NCon

6 月 1 日儿童节,京东办了一台没有真人演员的晚会——「京东 618 赛博联欢会」,全网首档全数字人 AI 购物直播晚会。

晚会集结多代经典 IP,美猴王、阿凡提、大头儿子在音乐剧《时光书卷》里同台,几代人的童年记忆被塞进了同一个舞台。
卡皮巴拉上台讲脱口秀,JDG 电竞选手伞兵以数字人形态破次元壁唠嗑;海尔兄弟与 Joy 同台开嗓,京东物流小哥数字人跳了一段街舞《极速送达》。
结尾是经典环节大合唱,多个数字人同时登台,演唱《AI 在一起》。
这场没有真人演员参与的纯数字人晚会,最终交出了远超市场预期的商业成绩单,晚会当晚超 490 万人次观看,并成功带动品牌销售同比增长 300%。
背后提供技术支持的,是京东的数字人平台 JoyStreamer。
比如海尔兄弟出演歌舞《绿茵狂想曲》的时候,他们不但嘴上在唱着雷欧之歌,还会配合着剧情和音乐节奏同步表演出各种足球动作,角色的语气、表情和肢体动作能形成连贯、统一的反馈,完全没有生硬的脱节感。

再比如赛博走秀环节,数字人的能力远不止于基础的"对口型"。从模特自信流畅的台步、定点转身的张力,到服装材质在光影下的细腻折射,以及裙摆随步伐摇曳的真实动态,都展现出了极高水准的视觉表现力,让整场大秀极具沉浸感。
以土象那组为例,场景是巴洛克水景秀场,白色 T 台蜿蜒在水面上,数字人模特穿大地色系的西装套装、风衣缓步走来。

画面摆在这里,第一反应是好看。
往回拨两年,不光是京东,整个行业的数字人直播都还困在一个尴尬的起点上:主播只能端坐在镜头前念脚本,转头都带着机械感,更不用说做动作、换场景、配合商品展示。
彼时的数字人,解决的是「有没有人播」的问题,至于播得好不好、像不像,还谈不上。从「坐着念稿」到走秀级的表现力,两年时间,数字人跨过了一道技术鸿沟。
但一台晚会再好看,终归是一次集中展示。走秀证明了京东数字人有驾驭复杂场景的表现力,而真正承载数字人价值的地方,是几万个普通商家的直播间。
如果说过去十年的电商竞争,是围绕「人、货、场」的效率优化展开的,那京东数字人代表的这轮数字人升级,正在把「人、货、场」本身变成可以被系统化生成和调度的数字资产。
一个主播,一支团队
在电商直播这个行当里,有一道隐形的分水岭:能不能把直播间经营好,很多时候不只看你投了多少流量,根基在于你有没有组建一支靠谱的团队。
传统数字人直播,核心解决的是直播场景的「有无问题」:补足商家直播空档、降低人力成本、避免直播间断播冷场,仅实现了基础的开播功能。
但直播竞争到了今天,商家需要的早已不只是「有人在播」就行。他们需要讲清商品,留住用户,做好互动,最终能够持续优化经营效率。
今年 618,京东数字人 JoyStreamer 围绕电商直播的核心转化链路做了一次系统性升级。从「会播、会答」的数字主播,变成了一整支 AI 直播团队。
播前:先把准备工作交给 AI
开播之前,系统从选品、装修、文案等维度做播前诊断,提醒商家哪里需要优化。
脚本也不用人写,智能写稿功能根据商品信息自动生成口播脚本。
中粮集团的案例比较典型。今年 5 月西洽会期间,京东数字人为中粮旗下的 13 家自营店铺打造了 24 小时在线直播间。从安达露西到梅林,每家店的商品不一样,系统为每家各自生成了一套脚本。
构建一个数字人主播的门槛也非常低。 商家只需上传一段正面人像照片、或者一段真人直播视频素材,系统就能快速生成一个与真人主播高度一致的「数字分身」。
做过电商直播的人都知道,一场直播的效果好坏,有很大的偶然性。主播那天状态好,可能就特别戳中用户。但人的状态总有起伏,昨天的最佳表现,今天未必能再来一遍,观众不会等你调整好了再来。
现在,一次成功的直播可以被「固定」下来,变成随时可调用、反复可打磨的数字资产。 直播运营从「播完即逝」开始转向「可持续沉淀」。
播中:编排和场控,是这次升级的核心
先说编排:
之前数字人在直播间里基本是对着脚本念,画面固定,节奏单一,讲完一个品接下一个品。
但对应现实,一个头部达播的直播间背后通常有一整支团队:导播切画面,助播盯弹幕,运营管节奏,场控调氛围。
升级之后,京东数字人 JoyStreamer 做的事相当于把整支团队的活都压进了一套系统里:统一调度数字人动作、商品展示画面、特色音效、副播话术和营销视觉内容,声、形、意都结合到了一起。
从一场美妆品类的直播间实录可以具体感受这种编排落地之后的样子。
主播讲到核心卖点时,画面会同步切到商品特写。

甚至系统还能自动生成展示关键参数的背景 KT 板视觉卡片,并且根据当前讲解的商品动态切换内容。

进入促销节点的时候,红包雨特效和弹幕特效准时触发,完整复刻真人直播间氛围感。

看完这段直播的感受是:如果不提前说这是 AI 在播,你都未必能马上反应过来。
以前一个中小商家想搭出这种水准的直播间,至少需要 3-5 个人的团队,还得磨合很久。
问题不只是在成本,更深一层的壁垒在于经验。 头部直播间的编排能力,靠的是导播、运营、场控在成百上千场直播里磨出来的经验和默契,这种人力和经验的储备,不是花钱临时招人就能解决的。
想象一个夫妻店的美妆品牌,老板娘本人就是最好的主播。她懂产品、懂用户、有感染力。但她一天只能播四五个小时,因为下了播还要打包、回消息、对接供应链。她雇不起一个专业的直播团队,更养不起一个懂促单转化的场控。她的直播能力,被困在了她一个人能保持清醒的时间里。
现在,一套系统跑起来就行了,商家不用自己组团队,也能拿到接近头部直播间的编排水准。
再说场控
关键变化在这里:数字人不再等人问,它开始主动经营直播间了。
举个例子,一个用户进了直播间,没问任何问题,只是在看。以前的数字人不会管,因为没有关键词触发就没有回应。
现在系统会判断这个用户可能在犹豫,主动引导一句,或者直接切到主推品的核心卖点。
弹幕里同时涌进来好几个问题,系统也会自己判断哪个是高转化问题,并优先回答。
流量突然上来了,它也能调整节奏。而且不只是调整话术,画面切换、商品展示顺序、促单策略都在同步联动。整个直播间从固定脚本播放,升级为一个能实时响应的智能直播场。
这种全局调度能力,需要真人场控在直播间泡很久才能练出来,而且真人再有经验,也做不到同时盯着几百条弹幕实时做决策。
这套场控能力,放在行业里看,是京东数字人最不容易被复制的部分。
会做主动场控的 AI 直播工具,市面上不是没有。但京东这套系统的调度逻辑,建立在两个独特的基础上。
一是京东对用户购买决策的理解深度。 京东自营模式意味着平台掌握的不只是用户「逛了什么、点了什么」
而是从浏览、加购、下单到配送、退换、复购的完整交易链路,能够形成完整的洞察。
比如一个用户在京东买过三次某品牌的洗面奶,每次大促前一周开始比价,客单价集中在 150-200 元区间。这种结构化的消费履历,让系统判断「这个用户可能在犹豫」时,依据的不是流量标签,而是真实的决策习惯。
二是京东采销体系的经验注入。 京东采销既管选品定价,也管促销节奏,对直播间的销售节奏,有千万次真实交易积累出来的手感。这就不仅仅是大模型的能力,更加是京东十几年电商经营经验的数据化表达。
基于这两层积累,京东数字人正在把头部达播的关键能力转化为商家可低成本调用、可规模化复制、可持续优化的 AI 能力。
有一个细节值得单独说。
数字人讲到一半会停下来喝口水。 这个动作没有任何功能意义,但它是数字人「自由态」生成的一个缩影。

能够支持超长时间不间断直播、身份保持一致,再加上这些看似没有实际功能、但很有人味的小动作,构成了观众觉得「这是个真人在播」的自然体验。
这些能力背后有一个架构层面的变化。京东数字人JoyStreamer 从单一 AI 主播升级为多 AI Agent 协同的体系,不同的 Agent 各自负责一个环节:有的负责脚本节奏和商品讲解,有的盯弹幕互动和用户行为,有的管场控策略、促销节点和成交时机。
你在画面里看到的是一个主播,但背后是一组 Agent 在协同运转。
播后:经营闭环的最后一环
直播结束后,系统自动生成经营报表,基于开播效果与既定目标做分析,提供策略建议。
对很多中小商家来说,「复盘」是最容易被跳过的环节。往往忙完一场直播已经精疲力竭,已经没有人力再回头看数据、想策略。
系统把这件事自动化之后,每一次复盘的结论都会反馈到下一次开播的诊断里。从播前诊断到播后复盘,一条链路走完,形成一个持续优化的循环。
这一整套能力都导向了一个目标:让普通商家的直播间拿到「头部达播级」的体验。
少数人的能力,多数人的工具
京东数字人的进化路径,浓缩了整个行业的变化。
-
最早是闲时补位。商家没有主播的时段,数字人顶上去,解决的是「有没有人在播」的问题。
-
后来是创始人 IP 数字人、品牌总裁数字人,数字人开始承载品牌形象和流量入口的角色。
-
再后来是高商业可用数字人,服务规模扩大,越来越多的商家把数字人当成常态化的经营工具。
到了今年,是 AI 原生数字人。随着多 Agent 协同、主动场控、智能诊断这些能力的提升,数字人的角色从「补时长」变成了「管经营」。
今年 618 开门红的数据印证了这一点:京东数字人服务商家规模突破 8 万家,累计开播时长超 80 万小时,整体带货成交额超 2.4 亿元。
这些数字背后,有一个值得看清的行业变化。
过去几年,电商直播行业有一个结构性矛盾:直播被证明是最高效的转化场景之一,但它对人力的依赖程度也是最高的。
一个头部达播能撑起一场千万级的 GMV,但这个能力和人高度绑定,很难复制,也没法规模化。大量中小商家明知道直播重要,却卡在「没有好主播、养不起团队」这道门槛上。
京东数字人JoyStreamer 这次升级触碰的,正是这个矛盾的核心:**它第一次把头部达播的隐性 know-how 变成了显性的、可调用的系统能力。**把编排节奏、场控判断、用户洞察这些过去只有少数专家才有的能力,开始沉淀到平台里。
对商家而言,直播能力的门槛在下降。大品牌可以低成本铺开多个直播间,不必为每个直播间都配专业团队。中小商家则第一次有机会用上过去只属于头部的经营能力。
对用户来说,直播间的观看体验会趋向一致。他在任何一个直播间都能得到清晰的商品讲解、及时的互动回应和合理的促销节奏,不需要碰运气进直播间。
对整个行业来说,当直播的「播」这一环被 AI 拉平之后,竞争会回到更本质的地方,比拼的是谁的商品更好、供应链更强、服务更扎实。
京东曾凭借「多模态交互式数字人关键技术及产业应用」拿下 2024 年度吴文俊人工智能科学技术奖特等奖。这是中国 AI 领域的最高技术荣誉,也是当年唯一的特等奖。从基础技术到产业落地,这个奖是对 JoyStreamer 背后整套技术积累的一次集中认可。
放眼更远一步,数字人直播正在完成一次身份转变:从早期的「降本工具」,进化为电商的「经营基础设施」。编排、场控、诊断这些过去只存在于头部团队的隐性能力,正在被抽象为标准化的 AI 模块,有了规模化复制的可能。
赛博联欢会是一次极端压力测试。90 分钟不间断,多个 IP 同台,说明这套能力的上限足够。
回到日常直播间,还需要更多品类和更长时间的验证。但方向已经很清楚了:头部达播的经验正在被系统化,变成一种基础设施。当这些能力不再是少数人的专属,更多商家的机会就来了。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪