首发实时生成超拟人数字人:像真人主播一样临场应变,表情动作实时刷新
科大讯飞今日推出数字人全系列产品升级,首发实时生成超拟人数字人,从"提前生成"跨越到"全链路实时生成"。数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换外形与声音,让数字人从屏幕真正走向现实。
科大讯飞今日推出数字人全系列产品升级,首发实时生成超拟人数字人,从"提前生成"跨越到"全链路实时生成"。数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换外形与声音,让数字人从屏幕真正走向现实。
传统数字人大多被困在屏幕里——念固定话术、做预设动作,遇到用户随机提问就反应延迟、音画不同步。升级的核心变化,是让数字人从"展示品"变成"在场者"。
升级到底有多大?直接对比:
固定话术机械讲解,遇到随机提问反应延迟、音画不同步;形象需高成本定制,部署后难以迭代;只能在屏幕内活动,无法与现实空间交互。
全链路实时生成,表情、动作、语音毫秒级联动;一张照片即可生成数字分身,形象可灵活切换;移动数字人可自主引路、躲障、追踪声源,虚实同步。
四项核心能力对比:实时生成、多语种、低门槛创建、快速部署,每一项都对应着行业长期存在的落地痛点。
数字人从"看起来像"到"用起来真",需要翻越三座技术大山:长时间运行不崩坏、高画质与低延时兼得、自然交互不机械。讯飞此次的升级,恰好对应三项技术创新。
第一,双时域记忆驱动的长时视频生成技术。将连续视频构建为携带状态记忆的时空序列,短期记忆守住相邻帧连贯性,长期记忆锁定人物样貌与场景基底,配合动态状态压缩与跨片段一致性约束,抑制长线推演中的误差累积。数字人直播数小时,画面依然稳定不畸变。
第二,数据引导式低步数流式蒸馏技术。针对视频扩散模型做少步蒸馏时容易失真、闪烁的问题,引入教师模型基于真实视频样本打分校准,引导学生模型贴合真实画面分布。推理时复用历史时序信息,首帧优先输出,后续帧异步运算,把模型生成能力转化为稳定的长时间实时播出能力。
第三,基于多模感知评价体系的强化学习。搭建囊括文本、语音、图像、视频、动作信号的全域评测体系,围绕语义-动作对齐度、视听自然度、指令跟随能力等多项指标核验生成内容,并将其转化为强化学习奖励信号。训练流程形成"高质量数据→SFT能力学习→多模态感知评价→RL偏好优化→效果回流"的闭环。
三大技术合力,让数字人突破了"看起来还行"的瓶颈。
好看的数字人 Demo 并不稀缺,但扛得住真实业务打磨的数字员工,才算跨过商业化及格线。讯飞这套方案已经在多个行业跑通。
「中储粮等企业已基于数字人进行直播带货。」——标准化话术输出,不疲劳、不失误,配合图文工具同步生成宣传物料,补齐直播之外的图文需求。
「单日之内解析全部学习资料,生成体系化培训课程。」——数字人扮演"企业培训师",面向员工开展一对一针对性教学,实时解答个性化疑问,替代传统统一授课模式。
「一台设备包揽带路、讲解、一对一接待。」——移动数字人自主引路、躲障、声源追踪,多语种无缝切换,适合展馆、门店、展会等场景。
「1 小时在平台配置就能创建对话应用。」——AI虚拟人交互平台无需开发、无需复杂接口对接,选择形象、声音、人设、技能即可上线,支持接入知识库获取专业数据。
答案藏在一条 20 多年的技术链条里:讯飞在语音合成、语音识别、语义理解上积累了超过 20 年。数字人想要"能听能看、能聊能互动",底层依赖的正是这些核心能力。
从架构逻辑看,数字人的交互链路与讯飞的核心技术栈高度重合:
变化的只是交互形态:输入从语音扩展到视频、图像、动作信号,输出从单一语音升级为表情、肢体、语音的实时协同。底层逻辑一脉相承。
更重要的是,讯飞没有只做技术研发,而是同步搭建了SaaS 化产品矩阵——AI虚拟人交互平台作为技术底座,讯飞智作做音视频创作,讯飞绘文做图文生产。企业不需要自研底层技术,1 小时就能配置出一个可用的数字人应用。
一个诚实的注脚:数字人行业的竞争焦点已经变了。
早年行业扎堆比拼虚拟形象精致度、面部渲染效果,但单点算法优势不再构成长期壁垒。底层自研技术、一站式交付平台、垂直场景落地经验的整套闭环能力,才是企业站稳市场的核心护城河。
数字人竞争已从"形象比拼"切换到"系统闭环能力"——谁能把技术、平台、场景三者无缝咬合,谁才能真正跨过商业化的及格线。
核心技术已全面应用于讯飞智作、AI虚拟人交互平台等产品,登录官网即可体验实时生成超拟人数字人,创建你的专属数字分身。
讯飞智作平台 → 创建数字人