AI 音乐日产 7.5 万首,播放不足 3%——音潮 V4.0 从中文底座自研,走最难的路
当 AI 音乐从「能不能做」走到「该怎么做」,音潮团队选择了一条更难的路:从底层自研中文底座,而非在英语底座上优化。这条路更慢、更贵,但让「味道」长在骨子里。
当 AI 音乐从「能不能做」走到「该怎么做」,音潮团队选择了一条更难的路:从底层自研中文底座,而非在英语底座上优化。这条路更慢、更贵,但让「味道」长在骨子里。
流媒体平台 Deezer 最新披露了一组值得深思的数据:AI 歌曲每天涌入平台的速度,已经从 2025 年初的 1 万首 飙升至 7.5 万首,占当日新增上传的 44%。但实际播放占比,只有 1%–3%。
7.5 万首进去,不到 3% 能被听见。剩下的,沉默地沉在平台底层。
注:数据来自 Deezer 公开披露,反映 AI 音乐产能与消费之间的巨大鸿沟。柱形不设零起点,标注数字为准。
产能炸了,产品却过不了耳朵这一关。更深层的问题是,听众越来越能分辨 AI 作品和人类创作,平台也开始用质量而非数量来筛选——TIDAL 上线了 AI 透明度标签,IFPI 要求「人类实质性参与」才能进入官方榜单。
当所有人都能一键生成,「生成」本身不再是价值。什么才是?
AI 音乐赛道上的公司,大致面临两个选择。音潮团队选择了后者——那条更慢、更难、更贵,但更深的路。
在英语底座上做优化,快速出产品,抢占全球市场。覆盖面广,但对单一文化的理解浅。英文歌能打,中文歌「咬字发飘、情绪空虚」,绕不开英语底座的天花板。
估值 5 亿美元(2024)从底层重新训练,把中文语境的「味道」写进模型骨子里。训练数据、模型架构、优化目标全部重新设计。中文是声调语言,与英语重音节奏体系完全不同。
算法算力均自主可控中文是声调语言,跟英语的重音节奏体系根本不是一套系统。如果选择英语底座缝缝补补,永远差着那种味道。音潮一开始就基于中文底座,从训练数据到模型架构到优化目标,都重新设计。
这条路的代价是:更长的研发周期,更高的训练成本,更晚的市场窗口。
收益也很明确:当 AI 音乐的产能过剩到日产 7 万首、播放不到 3% 的时候,「广覆盖」的红利消退,「有深度」的价值浮现。一条从底层自研、对音乐理解从里面长出来的路线,赢得了听众——因为人听得出区别。
2025 年和 2026 年,WAIC 世界人工智能大会的官方主题曲,都出自音潮团队之手。连续两年卫冕,含金量不必多说。
但 V3.5 已经能拿 WAIC 了,V4.0 还升级什么?
不止 WAIC,2025 年乌镇互联网大会、阿里云栖峰会等多个顶流峰会的主题曲也出自音潮之手。模型还拿下了国际音乐 AI 赛事全球亚军,技术实力兼具国产化价值与全球认可度。
「想给妻子做一首专属纪念歌曲,但传统制作成本上万、周期数周。」——V4.0 理解情感意图,15 秒出旋律,1 分钟生成带完整人声的成品。
「想写一首深夜 emo 的歌,要那种慵懒的调调,来点治愈。」——旧版模型容易机械套用参数,V4.0 把模糊的感性输入翻译成精准的内部表征,成品不跑偏。
「用西班牙语写一首轻快的夏日歌。」——V4.0 解锁 10 语种全覆盖,纯音乐生成全面开放。不是「中文翻译成英文」,而是从底层理解每种语言的音乐逻辑。
歌词生成、歌曲生成、仿写、扩写四大核心能力全部开放。API 平台限时免费试用,接入后即可调用全量接口。
答案藏在三个选择里。
第一,团队基因。音潮的配置很特别:算法技术团队和科班音乐人跨界搭配。程序员深耕乐理、吃透音乐逻辑,音乐人深度参与模型迭代。每一轮迭代都要过「人耳关」——不是技术指标达标就行,而是听上去得「活」。
第二,国产算力,不受制于人。音潮团队从第一天起就选择了壁仞国产 GPU 完成训练与迭代,算法和算力都不依赖海外。别人算力一断供,迭代节奏就被打乱;别人 GPU 一涨价,成本结构就得重新算。音潮不需要担心这些,整条链路握在自己手里,可控、可解释。
第三,产品闭环跑通。从 C 端到 B 端到出海,四条线同时推进:音潮 APP(百万用户)、音潮 Studio(专业工具)、Hitto(出海)、API 平台(企业)。不是只靠一首主题曲「出圈」,而是真正跑通了从技术到产品到商业的闭环。
AI 音乐的下一个阶段,不是谁生成得更快、谁参数更大,而是谁更懂「创作」这件事本身的重量。当产能过剩到日产 7.5 万首、播放不足 3% 时,「读懂」比「生成」更稀缺——能真正理解一个人脑子里那段旋律,比一秒生成一万首没人听的歌,更有价值。
音潮 V4.0 已于 8 月 14 日全平台上线,音潮 APP、音潮 Studio、Hitto 及 API 平台同步更新。API 平台目前处于限时免费试用阶段。
音潮 APP → 立即体验