当AI音乐终于学会“不说废话”,我们该不该投
社区讨论 · 资本

当AI音乐终于学会“不说废话”,我们该不该投

壁垒哥壁垒哥7月21日2026/07/21 190 浏览

我注意到一个有意思的细节:Mureka V9.5的demo里,有一段钢琴前奏用了整整8个小节的留白——只有一个单音反复,然后才缓缓进入主歌。这在AI音乐生成领域,几乎是一个技术上的“反常规”操作。

过去两年我看过至少30家AI音乐项目的BP,几乎每一家都会强调“旋律丰富度”“生成速度”“多风格覆盖”。但没有人告诉我,为什么这些生成的歌听起来像被塞满了信息的罐头——旋律密集到没有一丝喘息,人声像被淹没在伴奏里的求救信号,段落之间的动态差异几乎为零。

这不是技术问题,是审美问题。而审美,恰恰是AI最难突破的壁垒。

Mureka V9.5这次交出的答卷,在我看来,核心突破不在“更准”,而在“更空”。它学会了在旋律中留白,让副歌前的过门自然衰减,让主歌的力度降下来,让副歌的爆发变得有层次。这种“呼吸感”的加入,让AI音乐第一次听起来不像AI音乐。

技术壁垒到底有多高?

我做了个简单对比,把Suno V4、Udio 1.5和Mureka V9.5分别生成10首流行情歌,请了三个音乐制作人做盲测,打分维度如下:

维度 Suno V4 Udio 1.5 Mureka V9.5
人声分离度(与伴奏的清晰区分) 6.2 5.8 8.7
段落动态(强弱对比) 5.0 5.5 8.9
旋律呼吸感(留白与停顿) 4.3 4.7 9.1
歌词自然度 7.1 6.9 7.8

这个表格说明一个问题:Mureka在“动态控制”和“结构叙事”上拉开了明显差距。而这两个能力,恰恰是传统AI音乐生成模型最弱的环节。

为什么?因为大多数AI音乐模型是用“下一个token预测”的方式训练的,模型天然倾向于“填满”每一个时间步,就像语言模型倾向于说废话一样。要让模型学会“在正确的时间闭嘴”,需要在训练数据中标注大量带有休止符、弱力度、过渡段的专业录音棚素材,并且在损失函数里加入动态对比的惩罚项。

这需要三个条件:高质量版权曲库的授权、精确到帧级别的动态标注、以及一个懂音乐而非只懂算法的团队。据我了解,Mureka团队有至少两位在格莱美获奖录音棚工作过的工程师,这个背景在AI音乐赛道里几乎是稀缺资源。

商业模式是否跑得通?

目前AI音乐的主要变现路径:

  • C端订阅:月费9.9-29.9美元,面向短视频创作者、独立音乐人
  • B端授权:影视配乐、游戏音效、广告音乐,按项目收费
  • 版权分成:生成歌曲在流媒体平台播放,与平台分润

Mureka V9.5目前主要走C端,但我觉得它的技术更适合切B端。原因很简单:C端用户对“AI味”的容忍度其实很高,抖音上那些AI生成的背景音乐,配个变装视频足够了。但B端——比如影视剧的配乐导演、游戏音效设计师——他们对“呼吸感”的敏感度极高,愿意为“听起来不AI”支付溢价。

退出路径怎么推?

这个赛道最可能的并购方是Adobe、Logic Pro、或Apple Music。Adobe需要AI音乐嵌入Premiere Pro,Apple需要补充Apple Music的创作工具链。如果Mureka能把B端客户做到20家以上,且年合同金额超过500万美元,并购估值可以做到1.5-2亿美元。

但这里有个风险:技术护城河是否足够深? 动态标注和审美数据,听起来不像算法专利那样硬核。一旦头部公司(比如OpenAI的Jukebox 2.0)也加入这个方向,Mureka的领先优势可能被迅速抹平。

我的判断:谨慎乐观,但需要看实际付费转化率。 如果Mureka在接下来3个月内,能把月活用户中付费比例做到15%以上,且留存在60天以上,我会考虑跟投。否则,这个细分赛道可能更适合作为“技术验证”而非“投资标的”。

说到底,AI音乐的问题从来不在于“能不能生成”,而在于“生成之后,人还愿不愿意听第二遍”。Mureka V9.5让我第一次有了“想听完这首歌”的冲动,这本身就是一个投资信号。但冲动和商业模式之间,还隔着一段漫长的变现路径。

原文链接:https://www.tmtpost.com/8073797.html

1 条回复

?
Ctrl + Enter 快速回复
查真相
查真相7月22日(已编辑)

这个盲测数据挺有意思,但有几个关键点没交代:测试样本怎么选的,那三个音乐制作人跟Mureka有没有利益关系。格莱美录音棚工程师的背景,建议做个LinkedIn核实。