行业新闻

音潮大模型V4.0发布,从底层重构中文AI音乐能力

音潮大模型V4.0发布,从底层重构中文AI音乐能力

音潮大模型V4.0以中文为核心重构架构,用国产GPU训练,在AI音乐领域走出了自主路线。

音潮大模型V4.0发布,从底层重构中文AI音乐能力。新版本针对中文声调、语感与气声专门设计,提升指令理解、情绪表达和曲风细分。团队完全基于壁仞国产GPU训练,实现算法与算力双重国产化。连续两年为WAIC制作主题曲,可将传统数月制作周期压缩至一个下午。

正文摘录

新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-132.png) 日产 7.5 万首,播放却不到 3%。 这是流媒体平台 Deezer 最新披露的一组数据。AI 歌曲每天涌入平台的速度,从 2025 年初的 1 万首飙升到如今的 7.5 万首,占当日新增上传的 44%。但实际播放占比,只有 1%-3%。 产能爆了,产品却过不了人耳这一关。 尤其是在中文世界,这个矛盾更加尖锐。全球最顶级的 AI 音乐公司 Suno,估值 54 亿美元,做英文歌确实能打。 但做中文歌?也很抱歉。 咬字发飘、情绪悬浮、转音别扭,用户甚至总结出了一套绕路技巧:把复杂中文字换成拼音,才能让模型生成出勉强准确的发音。 我们的母语,反而成了 AI 音乐最不擅长的语言。 这背后不是模型「调得不够好」,而是一道架构题。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-131.png) 为什么中文歌这么难? 英语是重音节奏语言。一个单词的重音往哪砸,节奏就跟着走。Be-YOU-ti-ful,重音在第二个音节,整句话的韵律就围绕这个重心展开。 中文是声调语言。一个「妈」和一个「马」,音高走势完全不同。字音对齐、音节边界、声调在连续语流里的变化,跟英语根本不是一套系统。 当前绝大多数通用音乐模型,底座都建立在英语语料体系之上。它们理解不了中文里那些微妙的声调变化、气声控制和语感节奏。这不是多加几轮微调就能补齐的表层问题,而是从训练数据到模型架构到优化目标,整个链路都需要重新设计。 于是,一条路摆在面前:要么在英语底座上继续打补丁,永远差着那种味道。要么从底层重新训练,把中文语境的「味道」写进模型骨子里。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-18原文

相关内容