社区讨论 · 资本

阿里上线AI作曲,玩了两天我想说几句

冯sir冯sir8月17日2026/08/17 444 浏览

我花了两天试了一下阿里刚放出来的AI音乐生成模型HappyShrimp,beta版,目前走网页端。先说结论:靠它出成品不现实,但用来找灵感、搭demo,已经比我之前试过的同类工具强了一截。

阿里ATH业务集团近日放出的这个平台,主打text-to-music,就是给一段描述或者几句歌词,模型直接出整首歌。

我对音乐这块其实是外行,带的学生做计算机视觉,实验室里没几个懂编曲的。但这几年AI画图、AI视频都追过了,音乐一直没太碰。正好这周手上项目收尾,就抽了两天正经跑了跑。

第一天主要试纯文本生成。我在输入框里写了「傍晚的海边,一个老人独自拉着小提琴」,等了一两分钟,出来一首一分半的曲子。说实话,开头十几秒的弦乐质感有点超出预期,音色不算糊,动态也过得去。但到中段就开始露馅,主旋律反复绕一个动机,和声基本没变化,听起来像是把同一句话换着方式重复了三遍。我又试了「咖啡馆背景爵士」「雨夜电子乐」「唢呐配摇滚」几组,最稳妥的倒是唢呐那组,可能因为音色辨识度高,模型不太容易跑偏。总的感觉,生成质量和prompt的精确程度强相关,越具体越好,写抽象情绪词容易出来一堆不痛不痒的白噪音垫底。

第二天测歌词生成。输入了一段中文词,押韵工整,模型能给出旋律和节奏,但有几个明显问题。一是副歌的最高音处理得很平,没有爆发感;二是中文发音的咬字偏「汉化腔」,平仄处理不够自然,唱起来有点朗诵腔。我顺手把同一段词丢给豆包比了一下,豆包出的版本更顺耳,但结构上HappyShrimp更完整,有明确的段落递进。只能说各有取舍。

优点方面,最让我意外的是它不需要任何音乐知识就能上手,窗口里直接打字,没有轨、没有midi概念,门槛低到可以忽略。适合我这种想表达情绪但不懂乐理的人。

缺点也很明显。可控性太差,你不能指定BPM、调式、乐器配置,只能靠自然语言里碰运气。昨天想做一个「90BPM的慢速钢琴曲」,出来的速度大概在110左右,怎么描述都没用。另外生成的作品有没有版权、能不能商用,页面里没写清楚,这点和之前Spotify给AI歌曲标标签的事连起来看,平台这边对版权的边界还没想明白。

总的下来,我的判断是:适合想快速听个响的人,尤其适合做视频配乐、游戏开发前期demo这类场景。 不适合对编曲有要求的人,你想让它改一个鼓点,它连鼓在哪个位置告诉不了你。我实验室有个学生说想拿它给论文的演示视频配背景音乐,我觉得这个用法倒是挺对的。

最后留个问题。这种AI生成音乐的工具以后要是普及了,创作的门槛是降了,但音乐的「灵性」怎么定义,靠prompt写出来的作品算不算创作,我还没想好。你们觉得呢?


:pushpin: 本文编译自 Bloomberg Tech,原文:https://www.bloomberg.com/news/articles/2026-08-17/alibaba-launches-ai-music-generation-model-happyshrimp-in-beta
版权归原作者所有,本文为基于公开报道的编译与独立分析。

3 条回复

?
Ctrl + Enter 快速回复
小风
小风8月17日

前两天我也拿它试了试,写prompt比调参数还累,改来改去最后出来的还是那种“midi钢琴+电子鼓”的味儿,感觉这模型对风格的理解还是太有限了。

刷题中
刷题中8月17日

哈哈我也试了一耳朵,中段开始确实原地打转……感觉模型挺会开头骗人的,前15秒天花板后面全是地板。

币圈逃兵
币圈逃兵8月17日

跟我在用的信息抽取模板一个道理……越具体越能用,给个抽象词出来就是一堆废数据。这个AI作曲听着也是这德行,prompt写不细就别指望它干活。