🎵 AI 音乐 · 行业观察

AI 音乐日产 7.5 万首,播放不足 3%——音潮 V4.0 从中文底座自研,走最难的路

当 AI 音乐从「能不能做」走到「该怎么做」,音潮团队选择了一条更难的路:从底层自研中文底座,而非在英语底座上优化。这条路更慢、更贵,但让「味道」长在骨子里。

综合公开信息整理 2026-08-14 全文约 4 分钟读完
#AI音乐 #音潮V4.0 #中文底座 #AI创作
7.5 万首/日 AI 歌曲涌入 Deezer 平台
1–3% 实际播放占比,产能严重过剩
10 V4.0 支持语种全覆盖

⚡ 30 秒速览

  • 行业困境:Deezer 数据显示 AI 歌曲日增 7.5 万首,占当日新增上传的 44%,但播放占比仅 1%–3%。产能爆炸,耳朵却越来越挑剔。
  • 路线分野:音潮没有走 Suno 的英语底座优化路线,而是从零自研中文底座——更慢、更贵,但中文「味道」自然生长,无需转译。
  • 实力证明:连续两年拿下 WAIC 世界人工智能大会官方主题曲,V4.0 在指令理解、情绪落地、曲风细分三个维度全面重构。
  • 国产底气:算法与算力均自主可控,使用壁仞国产 GPU 完成训练迭代,整条链路不依赖海外,不受断供与涨价影响。

01产能过剩时代 每天 7.5 万首 AI 歌,听过的不到 3%

流媒体平台 Deezer 最新披露了一组值得深思的数据:AI 歌曲每天涌入平台的速度,已经从 2025 年初的 1 万首 飙升至 7.5 万首,占当日新增上传的 44%。但实际播放占比,只有 1%–3%

7.5 万首进去,不到 3% 能被听见。剩下的,沉默地沉在平台底层。

7.5 万日增 AI 歌曲(首)
44%占当日新增上传
1–3%实际播放占比
3 年从「能不能做」到「该怎么做」

注:数据来自 Deezer 公开披露,反映 AI 音乐产能与消费之间的巨大鸿沟。柱形不设零起点,标注数字为准。

产能炸了,产品却过不了耳朵这一关。更深层的问题是,听众越来越能分辨 AI 作品和人类创作,平台也开始用质量而非数量来筛选——TIDAL 上线了 AI 透明度标签,IFPI 要求「人类实质性参与」才能进入官方榜单。

当所有人都能一键生成,「生成」本身不再是价值。什么才是?

02两条路,两种哲学 英语底座 vs 中文自研

AI 音乐赛道上的公司,大致面临两个选择。音潮团队选择了后者——那条更慢、更难、更贵,但更深的路。

英语底座优化(Suno 路线)

在英语底座上做优化,快速出产品,抢占全球市场。覆盖面广,但对单一文化的理解浅。英文歌能打,中文歌「咬字发飘、情绪空虚」,绕不开英语底座的天花板。

估值 5 亿美元(2024)

中文底座自研(音潮路线)

从底层重新训练,把中文语境的「味道」写进模型骨子里。训练数据、模型架构、优化目标全部重新设计。中文是声调语言,与英语重音节奏体系完全不同。

算法算力均自主可控

中文是声调语言,跟英语的重音节奏体系根本不是一套系统。如果选择英语底座缝缝补补,永远差着那种味道。音潮一开始就基于中文底座,从训练数据到模型架构到优化目标,都重新设计。

这条路的代价是:更长的研发周期,更高的训练成本,更晚的市场窗口。

收益也很明确:当 AI 音乐的产能过剩到日产 7 万首、播放不到 3% 的时候,「广覆盖」的红利消退,「有深度」的价值浮现。一条从底层自研、对音乐理解从里面长出来的路线,赢得了听众——因为人听得出区别。

03连续两年 WAIC 主题曲 V4.0 让「读懂」先于「生成」

2025 年和 2026 年,WAIC 世界人工智能大会的官方主题曲,都出自音潮团队之手。连续两年卫冕,含金量不必多说。

但 V3.5 已经能拿 WAIC 了,V4.0 还升级什么?

🎵 WAIC 主题曲:证明「下限」已过专业关 V3.5 → V4.0

  • V3.5 能过「普通人关」:在最严格的评审标准下,交出合格答卷。主题曲需求明确,模型按流程执行。
  • V4.0 要过「专业评审关」:让每一个普通用户都能被「读懂」,输入模糊、感性的需求(「深夜 emo」「慵懒调调」「治愈风」),模型精准执行。
  • 三大升级维度:指令理解、情绪落地、曲风细分——底层架构全方位重构。
核心转变:从「帮你做」到「帮你做你想做的」。V4.0 把「读懂」放在了「生成」前面。

不止 WAIC,2025 年乌镇互联网大会、阿里云栖峰会等多个顶流峰会的主题曲也出自音潮之手。模型还拿下了国际音乐 AI 赛事全球亚军,技术实力兼具国产化价值与全球认可度。

04「一键生成」不如「人人都能创作」 四个场景看懂 V4.0

💝

给重要的人做一首专属纪念曲

「想给妻子做一首专属纪念歌曲,但传统制作成本上万、周期数周。」——V4.0 理解情感意图,15 秒出旋律,1 分钟生成带完整人声的成品。

🌙

深夜情绪:模糊的感性输入

「想写一首深夜 emo 的歌,要那种慵懒的调调,来点治愈。」——旧版模型容易机械套用参数,V4.0 把模糊的感性输入翻译成精准的内部表征,成品不跑偏。

🌍

10 语种全覆盖:从中文出发,全球都能打

「用西班牙语写一首轻快的夏日歌。」——V4.0 解锁 10 语种全覆盖,纯音乐生成全面开放。不是「中文翻译成英文」,而是从底层理解每种语言的音乐逻辑。

⚙️

企业级 API:批量创作与定制

歌词生成、歌曲生成、仿写、扩写四大核心能力全部开放。API 平台限时免费试用,接入后即可调用全量接口。

05为什么是音潮做出来了?

答案藏在三个选择里。

第一,团队基因。音潮的配置很特别:算法技术团队和科班音乐人跨界搭配。程序员深耕乐理、吃透音乐逻辑,音乐人深度参与模型迭代。每一轮迭代都要过「人耳关」——不是技术指标达标就行,而是听上去得「活」。

第二,国产算力,不受制于人。音潮团队从第一天起就选择了壁仞国产 GPU 完成训练与迭代,算法和算力都不依赖海外。别人算力一断供,迭代节奏就被打乱;别人 GPU 一涨价,成本结构就得重新算。音潮不需要担心这些,整条链路握在自己手里,可控、可解释。

算法自研中文底座壁仞国产 GPU人耳审听V4.0 全链路自主

第三,产品闭环跑通。从 C 端到 B 端到出海,四条线同时推进:音潮 APP(百万用户)、音潮 Studio(专业工具)、Hitto(出海)、API 平台(企业)。不是只靠一首主题曲「出圈」,而是真正跑通了从技术到产品到商业的闭环。

编辑核心判断

AI 音乐的下一个阶段,不是谁生成得更快、谁参数更大,而是谁更懂「创作」这件事本身的重量。当产能过剩到日产 7.5 万首、播放不足 3% 时,「读懂」比「生成」更稀缺——能真正理解一个人脑子里那段旋律,比一秒生成一万首没人听的歌,更有价值。

现在就能用

音潮 V4.0 已于 8 月 14 日全平台上线,音潮 APP、音潮 Studio、Hitto 及 API 平台同步更新。API 平台目前处于限时免费试用阶段。

音潮 APP → 立即体验