科大讯飞首发全链路实时生成数字人,表情动作毫秒级刷新告别机械播报
科大讯飞推出数字人全系列产品升级,首次实现从“提前生成”到“全链路实时生成”的跨越。仅需单张照片即可生成超拟人数字人,语义直接驱动台词、表情与肢体变化,在长时间运行中保持画面不畸变、形象不崩坏。
科大讯飞推出数字人全系列产品升级,首次实现从“提前生成”到“全链路实时生成”的跨越。仅需单张照片即可生成超拟人数字人,语义直接驱动台词、表情与肢体变化,在长时间运行中保持画面不畸变、形象不崩坏。
传统数字人往往只在屏幕里,采用分段处理技术。这导致它们在遇到随机提问时,经常出现反应延迟、音画不同步,甚至表情五官偏移等崩坏现象。
科大讯飞此次跨越的核心在于:让数字人像真人主播一样临场应变。
依赖固定话术机械讲解,长时在线易出现形象漂移、画面卡顿,交互不自然。
单张照片生成,语义直接驱动台词、表情与肢体变化,毫秒级同步联动不穿帮。
在直播演示中,数字人主播“寻笙”展现了真人的松弛感:自然手势、低头刷手机、随手撩拨头发。当弹幕刷屏变少时,她甚至能主动抛出话题盘活直播间气氛。
这标志着数字人正式从“虚拟形象展示”迈入“可感知、沉浸式交流”阶段。
想要复刻真人级流畅自然的对话体验,需实现语义理解、肢体动作规划、实时视频渲染、编解码传输、大模型推理整套环节的并行运转与毫秒级同步联动。
解决长时间运行画面不畸变。构建携带状态记忆的时空序列,短期记忆守住相邻帧连贯性,长期记忆锁定人物样貌与场景基底,抑制长线推演中的误差累积。
平衡高画质和低延时。针对视频扩散模型完成少步蒸馏改造,教师模型基于真实样本打分校准。异构流水线优先输出首帧,后续帧在播放间隙异步运算。
让数字人摆脱机械播报。搭建囊括文本、语音、图像、视频、动作的全域评测体系,围绕语义-动作对齐度、视听自然度等指标,转化为强化学习奖励信号。
补齐最后一块拼图的是超拟人语音合成技术。支持70多种语言,通过多模态预训练与多任务强化学习,让合成语音由单纯复刻音色,升级为贴合语义意图的真实情感表达。
当核心技术打磨成熟,产业重心便从技术攻坚转向应用普惠。科大讯飞搭建了底层基座+上层应用的产品体系,让数字人真正走出屏幕。
数字人行业的竞争本质正在切换。早年行业玩家扎堆比拼虚拟形象精致度、面部渲染效果,如今单点算法优势已不再构成长期壁垒。
真正的护城河,是整套闭环能力。
科大讯飞的做法是:用硬核技术拉高体验上限,用普惠化平台拓宽市场边界。AI虚拟人交互平台作为底座,结合语音合成、识别、星火大模型,1小时即可0代码配置创建对话应用。
这套软硬一体、工具齐全的方案,历经多行业真实项目落地打磨,已具备成熟的交付与运维经验。
数字人赛道的淘汰赛已正式开启。单点算法优势不再构成壁垒,底层自研技术、一站式交付平台与垂直场景落地经验的闭环,才是企业跳出同质化低价竞争泥潭的唯一通行证。
讯飞智作、AI虚拟人交互平台与讯飞绘文已全面更新,面向企业与开发者开放。
访问讯飞智作平台 → 体验数字分身