深度 | 万字访谈Suno CEO:如何用AI打破创作边界;用美学评估AI音频模型
先说几个核心判断:Suno正在做的事情,本质上是在重塑人类与音乐之间的关系。不是简单地把一个老旧的工具升级,而是创造一种全新的体验——让音乐创作的门槛降到几乎为零。这背后涉及的技术框架、美学评估体系、商业模式思考,都非常值得深入拆解。

Z Highlights:
- Suno利用AI音乐生成工具,通过简单的文本提示即可创作完整歌曲,彻底碘伏了传统音乐创作流程。
创新的音乐创作方式:
- 通过Suno,用户可以体验到与他人合作创作音乐的乐趣,推动了音乐创作的社交化和个性化发展。
促进音乐的社交化和个性化:
- :Suno的许多创新集中在音频Token化上。音频不像文本那样易于离散化,其采样速度快且为连续信号。因此,Suno必须使用启发式算法或模型将其转换为可管理的Tokens。
Suno的音频Token化创新
- 美学在AI音频模型评估中至关重要。虽然AI领域常依赖度量标准,但在现实中这些并不够用,尤其在新兴的音频领域。因此,Suno依靠听觉进行评估,通过听大量音乐和A-B测试,不断加深对人类情感的理解。
用美学评估AI音频模型:
背景与介绍
听众朋友们好,欢迎来到本期访谈。今天邀请到的嘉宾是Suno的联合创始人兼CEO Mikey Schulman。Suno是一个AI音乐生成工具,使命是普及音乐创作。用户只需输入一个文本提示,就能生成一首带有歌词的歌曲——听起来像是科幻片里的桥段,但今天早上主持人Sarah试了一下,真的生成了一首带有复杂节奏的lo-fi风格的“Kodo Boom Bop”。
歌词片段:‘Beak with trees and this spring embraces nature, wea ves tales, and its gentle race. Material petals fall, time toes its base, retreating cherry plume, a hint of grace.’
这家公司成立不到两年就已经在AI音乐行业引起轰动。值得注意的是,他们是在去年年底才正式公开亮相的。
从科学到音乐的跨界之旅
Mikey的背景很有意思。他从小喜欢音乐,四岁开始弹钢琴,高中和大学期间参加了不少乐队。但坦率讲,他自认音乐天赋并不出众,于是选择了更擅长的物理学。一路读到哈佛博士,研究方向是量子计算——一个他后来坦言“不该进入”的领域。
“我的博士学位相对成功,不是因为我擅长物理。我研究的量子力学大部分在50年代就已经解决了。”Mikey坦言,“低温微波工程非常复杂,而这对于实际应用来说至关重要。我很幸运,在这方面比较擅长。这算是两个学科交界处的研究,我非常享受这个过程。”
毕业后他没有成为理论物理学家或学者,而是偶然加入了Kentro公司——当时只有大约10人。入职大约一个月后,机器学习的机会出现了。在2014年,物理学博士转行做机器学习工程师是可行的路径。他抓住了这个机会,组建团队,开发产品,最终在2018年随公司被S&P Global收购。可以说是偶然进入AI领域,但从此深深爱上了它。
AI与音乐的结合
Suno的起点是开源模型Bark,但最初团队做的其实是文本处理。被S&P Global收购后,他们接了第一个音频项目——学习转录财报电话会议。这些转录工作以前都是手动完成,非常耗时。引入自动化后大大提高了速度和规模,团队也因此爱上了音频AI。
值得注意的是,一个看似枯燥的“财报电话会议转录”项目,却让团队发现了自己的真正热情所在。当时的判断是:
音频技术相比图像和文本确实落后很多
发布Bark之前,团队就决定不专注于语音技术。很多人建议“去做一家语音公司吧,这条路更简单,B2B产品一定会受欢迎的”,但他们实在太热爱音乐了。至于为什么不做语音?Mikey的解释很直白:
语音技术本身有趣,但团队追求的内在创造力并不在语音领域
技术与创意的平衡
关于技术架构,外界常问Suno究竟采用了哪种模型——传统模型、扩散模型,还是Transformer?Mikey的回答很直接:不避讳,模型就是Transformer。一方面团队有处理文本的背景,另一方面Transformer确实能很好地扩展。开源文本社区已经完成了大量基础工作,团队可以在创新领域上非常挑剔。
真正投入大量精力的地方在于如何将音频Token化
模型质量的评估也是一大挑战。团队当然不是完全依赖人工评估,但美学确实至关重要。
在所有AI领域,人们往往过于依赖度量标准
美学很重要,意味着必须用耳朵来评估
好消息是团队里每个人都热爱音乐,所以
评估模型时,他们会听大量的音乐,进行很多A-B测试
拿Midjourney来类比,早期人们觉得它与众不同,正是因为展示了更好的品味和美学,而不仅仅是因为优化了评估函数。音乐背景对Suno发展的影响不止于此——
在设计模型时,团队非常努力地避免加入太多个人音乐偏见
那么,AI在音乐领域有哪些难点?有一些容易描述的方面,比如立体声效果是否正确、比特率是否足够高等等。但
音乐的特别之处在于它能引发某种情感反应,而这点没有人能完全理解
社交化与个性化音乐体验
Suno很早就推出了免费服务,允许用户每天最多创作10首歌,同时也有订阅模式。如何看待不同类型的用户——普通消费者、准专业用户和企业用户?现在还太早做出判断吗?
Mikey认为,
目标是改变全球与音乐互动的方式,为人们带来新的体验
在尝试创造一种全新的模式,需要了解什么会真正促使人们愿意花钱购买
坦率地说,现在生成式AI的商业模式大多沿用SaaS的定价方式,而且做得比较粗糙。很多现在从事和投资生成式AI的人,都是五年前从事和投资SaaS公司的那批人。这种定价方式有点像延续下来的惯例,还没有完全解决问题。
关于未来的商业模式方向,其实非常有趣。比如微交易、在市场上转售物品、让人们从订阅者中分成——有点像下一代的Spotify。这些未来的发展方向值得深入思考。
在用户使用产品的过程中,团队看到了一些令人惊喜的行为。
人们喜欢感受到创造力,并且喜欢与他人分享
但当向人们开放这种机会时,他们也会关心最终的作品,但他们更享受创作的过程
就像视频游戏一样:自己玩音乐很有趣,但多人模式可能更有趣。比如共同写歌词、轮流写词句、一个人写主歌另一个人写副歌,或者写歌词、选风格、互相做歌给对方。人类进化过程中与音乐产生了强烈的共鸣,喜欢一起做音乐——每个文化都有自己的音乐。
关于创作与消费的比例问题,历史数据显示,在创作平台上,创作者和观众的比例通常很不平衡。虽然有很多人创作音乐,但你听到的作品却来自相对少数人。Suno这样的平台会有多大改变?Mikey认为改变会很大。现在还处于非常早期阶段,但已经开辟了几个重要途径。首先是
小众的微分享
顺便试玩一下,创作一首歌,选择特别的流派和乐器——比如夏威夷R&B和锡塔尔。这个组合听起来有点新奇,但Suno上已经有很多很棒的锡塔尔Trap,两者确实非常搭配。这种尝试让人学习和探索新的音乐流派,带来很多乐趣和惊喜。
歌词片段:‘Numerous crunching stats in my statistical paradise. Where the beats are fat, priors in the game is all about probability. Got my Hawaiian shirt feeling real fly, you see? Simple data flowing like wa ves on the shore. I'm diving deep beneath the score. Probability's the law.’
还有一件意想不到的事:Suno推出了编辑歌曲标题的功能。结果人们开始在流行页面的歌曲标题中加入自己的名字,展示他们的创作——这让人们对自己的作品感到自豪。回到创作与消费的讨论,TikTok是一个创作活跃的平台,但大多数用户还是在消费内容。这项技术能极大地改变这种比例,因为创作过程本身非常愉快。把方向做对,将来人们不会用“创作”或“消费”来描述这些活动——它们会相互融合,最终人们只会说:“大家都在享受这些音乐。”
未来展望与愿景
如果提供一些未被广泛接触的音乐体验,可以让十亿人更深入地参与音乐——无论是花的钱还是时间都会大幅增加。具体形式还有待讨论。音乐是充满情感的,人们不会失去与喜欢的艺术家的联系。实际上,如果你了解音乐创作过程,会对艺术家有更深的连接。
DAW(数字音频工作站)已经让很多以前无法创作音乐的人开始创作——只要有好耳机、好听觉,并且愿意学习,就可以在宿舍里创作音乐。
如果给更多人这种机会,文化和音乐风格的变化速度都会加快,新音乐风格的出现也会更多
不必每个听众都使用Ableton进行混音,可以在宿舍或公寓里生成音乐,低成本地创建声音。
当你不再需要50万美元的混音器和10人团队来制作专辑时,这确实是一个革命性的变化
过去十年音乐的变化主要是在声学上产生有趣的声音,而在让歌曲本身更有趣方面的进展稍少。这是技术解锁的结果——比如很多东西的数字化。AI可以产生从未听过的有趣声音,但将这些工具交到人们手中,可以解锁新的歌曲结构和和弦变化,借鉴并混合不同风格,制作出不仅在声学上新颖,而且在旋律上也新颖的作品。这真的能让人们持续听音乐。希望音乐可以“去TikTok化”,让人们一次听超过30秒的内容——虽然可能有点天真和乐观,但这是完全可能的。
作为结尾,播放一首展示榜首的歌曲,由艺术家Oliver McCann创作。这首歌非常有趣,播放量很高。
歌词片段:‘Oh my love my friend you know it's been a while without thinking of you but the thoughts make me smile I know it but what am I to do I need some space to breathe so give me some room’
为了让听众了解,这首歌的歌声、音乐和歌词都是完全由机器生成的——真的是一首合成歌曲,非常惊人。每天做这件事确实容易忽视这一点,但确实令人难以置信。进一步来说,机器甚至不知道声音的概念,它只是处理所有的声音,然后能够产生让我们共鸣的声音。这一切让团队觉得拥有世界上最酷的工作。
对于一个量子物理学家来说,这不算太糟糕——虽然可能是个“失败的量子物理学家”。
关于团队规模,Suno正在寻找最优秀的人才:热爱技术、热爱音乐,并且对将更多音乐带给世界感到兴奋的人。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名