🤖 数字人 · 技术突破

首发实时生成超拟人数字人:像真人主播一样临场应变,表情动作实时刷新

科大讯飞今日推出数字人全系列产品升级,首发实时生成超拟人数字人,从"提前生成"跨越到"全链路实时生成"。数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换外形与声音,让数字人从屏幕真正走向现实

综合公开信息整理 2026-07-28 全文约 4 分钟读完
#科大讯飞 #超拟人数字人 #实时生成 #AI交互 #移动数字人
⚡ 实时生成 全链路实时生成 · 告别提前预制
70+ 语言 超拟人语音合成 · 多语种丝滑切换
3大技术 双时域记忆 · 流式蒸馏 · 强化学习

⚡ 30 秒速览

  • 核心升级:从"实时驱动、提前生成"跨越到"全链路实时生成",数字人表情、动作、语音实时联动,不再机械卡顿。
  • 三大技术:双时域记忆驱动长时视频生成(画面不畸变)、数据引导式低步数流式蒸馏(低延时高画质)、多模感知强化学习(自然交互)。
  • 超拟人语音:支持 70+ 种语言,合成语音从复刻音色升级为贴合语义的真实情感表达。
  • 移动数字人:自带自动引路、躲障避行、声源追踪,配合透明屏实现虚实同步,从屏幕走到现实场景。
  • 产品矩阵:AI虚拟人交互平台(技术底座)+ 讯飞智作(SaaS 音视频创作)+ 讯飞绘文(图文生产),1 小时可配置对话应用。

01从"屏"到"场" 数字人首次走出屏幕

传统数字人大多被困在屏幕里——念固定话术、做预设动作,遇到用户随机提问就反应延迟、音画不同步。升级的核心变化,是让数字人从"展示品"变成"在场者"

升级到底有多大?直接对比:

传统数字人

固定话术机械讲解,遇到随机提问反应延迟、音画不同步;形象需高成本定制,部署后难以迭代;只能在屏幕内活动,无法与现实空间交互。

实时生成超拟人数字人

全链路实时生成,表情、动作、语音毫秒级联动;一张照片即可生成数字分身,形象可灵活切换;移动数字人可自主引路、躲障、追踪声源,虚实同步。

实时全链路生成
70+语言支持
1 张照片生成分身
1 小时配置对话应用

四项核心能力对比:实时生成、多语种、低门槛创建、快速部署,每一项都对应着行业长期存在的落地痛点。

02三大技术支柱 让数字人"活"起来的底层能力

数字人从"看起来像"到"用起来真",需要翻越三座技术大山:长时间运行不崩坏、高画质与低延时兼得、自然交互不机械。讯飞此次的升级,恰好对应三项技术创新。

第一,双时域记忆驱动的长时视频生成技术。将连续视频构建为携带状态记忆的时空序列,短期记忆守住相邻帧连贯性,长期记忆锁定人物样貌与场景基底,配合动态状态压缩与跨片段一致性约束,抑制长线推演中的误差累积。数字人直播数小时,画面依然稳定不畸变。

第二,数据引导式低步数流式蒸馏技术。针对视频扩散模型做少步蒸馏时容易失真、闪烁的问题,引入教师模型基于真实视频样本打分校准,引导学生模型贴合真实画面分布。推理时复用历史时序信息,首帧优先输出,后续帧异步运算,把模型生成能力转化为稳定的长时间实时播出能力。

第三,基于多模感知评价体系的强化学习。搭建囊括文本、语音、图像、视频、动作信号的全域评测体系,围绕语义-动作对齐度、视听自然度、指令跟随能力等多项指标核验生成内容,并将其转化为强化学习奖励信号。训练流程形成"高质量数据→SFT能力学习→多模态感知评价→RL偏好优化→效果回流"的闭环。

三大技术合力,让数字人突破了"看起来还行"的瓶颈。

03它真的能干活 三个已经上岗的数字人

🎙️ 寻笙 · 7×24 旅游直播达人 全天候在线

  • 自然松弛:开口聊天配上自然手势、脑袋轻晃,低头刷手机、撩头发、拿杯子喝水等细节一气呵成,起身热舞画面也不穿帮。
  • 弹幕互动:主动答谢粉丝礼物,弹幕变少时主动抛出话题盘活气氛,分享旅行好物和打卡景点,拿捏资深主播的营业精髓。
  • 技术底牌:全链路实时生成 + 双时域记忆,长时间直播形象不崩、交互不卡。
实际运营数据:观众留存率与真人主播差距明显缩小,互动率提升显著。

🟡 Chacky · 洽洽瓜子首位 AI 代言人 已出单曲 MV

  • 唱跳在线:专属 MV 中表情灵动不呆板,情绪卡点精准适配曲风,抬手、回眸等肢体动作行云流水。
  • 品牌 IP 化:数字人成为品牌长期资产,可随营销需求灵活迭代形象与内容,不必每次重新拍摄。
  • 成本优势:相比真人代言 + 拍摄团队,长期复用折算成本大幅降低。
品牌方反馈:数字人 IP 的消费者认知度与好感度均超预期,已规划第二支 MV。

🤖 移动数字人 · 展厅里的智能向导 虚实同步

  • 自主移动:配备高清透明屏 + 移动底座,自动引路、躲障避行、声源追踪,设备移动时数字人同步迈步。
  • 多模态感知:高噪环境下也能通过摄像头和麦克风阵列锁定对话人,支持多语种丝滑切换。
  • 一键换装:形象可根据场景切换,一台设备包揽展厅、门店、展馆的带路、讲解、一对一接待。
实测数据:单台设备日均服务时长可达 12 小时,接待效率较人工提升 3 倍以上。

04不是 Demo,是能扛营收的数字员工

好看的数字人 Demo 并不稀缺,但扛得住真实业务打磨的数字员工,才算跨过商业化及格线。讯飞这套方案已经在多个行业跑通。

🛒

电商直播 · 7×24 不间断带货

「中储粮等企业已基于数字人进行直播带货。」——标准化话术输出,不疲劳、不失误,配合图文工具同步生成宣传物料,补齐直播之外的图文需求。

🎓

企业培训 · 一对一专属讲师

「单日之内解析全部学习资料,生成体系化培训课程。」——数字人扮演"企业培训师",面向员工开展一对一针对性教学,实时解答个性化疑问,替代传统统一授课模式。

🏛️

展厅导览 · 移动接待 + 多语种讲解

「一台设备包揽带路、讲解、一对一接待。」——移动数字人自主引路、躲障、声源追踪,多语种无缝切换,适合展馆、门店、展会等场景。

💼

企业客服 · 0 代码配置对话应用

「1 小时在平台配置就能创建对话应用。」——AI虚拟人交互平台无需开发、无需复杂接口对接,选择形象、声音、人设、技能即可上线,支持接入知识库获取专业数据。

05为什么是科大讯飞做出来了?

答案藏在一条 20 多年的技术链条里:讯飞在语音合成、语音识别、语义理解上积累了超过 20 年。数字人想要"能听能看、能聊能互动",底层依赖的正是这些核心能力。

从架构逻辑看,数字人的交互链路与讯飞的核心技术栈高度重合:

语音识别语义理解多模态决策语音合成动作生成

变化的只是交互形态:输入从语音扩展到视频、图像、动作信号,输出从单一语音升级为表情、肢体、语音的实时协同。底层逻辑一脉相承。

更重要的是,讯飞没有只做技术研发,而是同步搭建了SaaS 化产品矩阵——AI虚拟人交互平台作为技术底座,讯飞智作做音视频创作,讯飞绘文做图文生产。企业不需要自研底层技术,1 小时就能配置出一个可用的数字人应用。

一个诚实的注脚:数字人行业的竞争焦点已经变了。

早年行业扎堆比拼虚拟形象精致度、面部渲染效果,但单点算法优势不再构成长期壁垒。底层自研技术、一站式交付平台、垂直场景落地经验的整套闭环能力,才是企业站稳市场的核心护城河。

编辑核心判断

数字人竞争已从"形象比拼"切换到"系统闭环能力"——谁能把技术、平台、场景三者无缝咬合,谁才能真正跨过商业化的及格线。

现在就能用

核心技术已全面应用于讯飞智作、AI虚拟人交互平台等产品,登录官网即可体验实时生成超拟人数字人,创建你的专属数字分身。

讯飞智作平台 → 创建数字人