虎牙WAIC 2026发布实时多模态数字人VAM 1.0-新华网
新华网 > > 正文
2026 07/18 19:04:35
来源:新华网

虎牙WAIC 2026发布实时多模态数字人VAM 1.0

字体:

  7月18日,2026世界人工智能大会(WAIC)腾讯AI 应用创新论坛在上海举办。虎牙公司董事长林松涛出席论坛并致辞,他表示,真实场景是AI价值的第一现场,终端是AI普及的最后一公里。当前模型能力的差距在收窄,但工程化的差距在拉开;AI普惠的标志不是最强的人变得更强,而是普通人用AI不再普通。随后,虎牙公司CEO黄俊洪的演讲则为这一理念提供了来自游戏娱乐场景的具体注脚,虎牙自研的实时多模态数字人VAM1.0,正是在一个真实的、7×24小时运转的场景中生长出来的AI应用。

虎牙公司董事长 林松涛

  一张照片生成一个虚拟人,每一帧都在线生成

  黄俊洪认为,数字人从展示型产品走向实时交互型应用,需要同时解决稳态、拟态和动态三类问题,即长时间生成不崩、表情动作足够自然,以及能够实时聆听、实时反馈、实时互动。

  此次亮相的VAM1.0,正是虎牙围绕上述行业痛点打造的最新技术成果。作为基于DiT架构的实时多模态数字人基础模型,黄俊洪一句话概括其能力:“给它一张静态照片,它还你一个能实时说话、实时聆听、实时反应的虚拟人。不是预渲染,不是录播,是每一帧都在线生成。”

虎牙公司CEO 黄俊洪

  VAM采用三段式训练体系,一阶让它稳,通过多参考帧加运动帧锚定形象;二阶让它真,利用偏好优化算法在多目标间找到平衡;三阶让它快,推理步骤大幅压缩并引入自纠错机制。“总结来说,就是让它不崩,让它好看,让它省钱”,黄俊洪表示。性能方面,在同等推理集群下,VAM达到36.4帧每秒、首帧1.3秒。

  黄俊洪特别强调了VAM的交互特性,原生覆盖静默、聆听、说话三种状态。用户说话时数字人点头注视,停下来它自然接话,打断它立刻反应,弹幕和语音双通道驱动。

  据悉,VAM后续将分阶段持续迭代,在推理效率、模型表现力和成本优化三个方向同步推进,最终实现多模型融合与低成本人物风格定制。

  技术杠杆撬动增长,从“看别人玩”到“和AI一起玩”

  虎牙深耕直播十数年,弹幕、打赏、语音连麦等交互基础设施与海量主播的视听数据每天都在反哺模型。从2019年HERO平台一路走到VAM 1.0,公司已在游戏发行、直播、广告等场景实现全业务线闭环。“为了实现今天的能力,我们也是一直在做时间的朋友”,黄俊洪表示。

  目前,VAM已在虎牙平台落地多个核心场景:基于AI实时生成的唱跳互动,不用固定模板,换装不黑屏;数字人原生狼人杀、塔罗牌等陪伴式互动内容,切换游戏模式全程无缝;真人主播的数字分身或数字助手,帮主播接弹幕、带气氛;以及24小时不间断游戏道具带货。

  在黄俊洪看来,过去十年直播内容全靠真人主播撑起来,但多模态数字人更深地融入全天候直播、赛事解说、才艺陪伴这些场景后,内容供给将从线性走向指数,边际成本随规模持续下降,“成本结构随之改善,利润空间自然打开。这是技术杠杆,一旦撬动,增长就不再是加法,是乘法”。

  在游戏发行层面,VAM将通过超拟真的数字人生态直播矩阵,凝聚全网海量用户,为虎牙内容营销驱动游戏发行的模式提供更大基础支撑,覆盖从获量到留存的完整链路。

  从直播间到游戏产业链,从成本结构到增长方式,黄俊洪表示,过去十年虎牙是"看别人玩游戏"的地方,未来十年要成为"和AI一起玩游戏"的地方。

  

【纠错】 【责任编辑:冉晓宁】