最近开车接送孩子的路上,澳洲电台几乎每天都会播放同一首歌。听了几次之后发现,它非常"洗脑",连五岁的女儿都说这是她最喜欢的一首歌。
后来查了一下才知道,这首歌是 Josh Fawaz 改编的麦当娜(Madonna)1989 年的经典作品《Like a Prayer》,而且制作过程中使用了 AI 辅助。
这让我产生了一个问题:到底是因为 AI,所以这首歌更好听了?还是它本身就符合人类喜欢音乐的一些规律?
于是,我和 AI 讨论了一下这个问题。
AI 给出的第一个分析,并不是关于 AI,而是关于歌曲的开头。
它认为,这首歌一开始就能抓住人,并不是偶然,而是符合现代流媒体音乐的制作思路。过去很多歌曲会花十几秒甚至更长时间慢慢铺垫,但今天,大多数听众几秒钟内就会决定要不要继续听。所以制作人通常会把最有辨识度的声音、节奏或者音色放在最前面,在最短时间内建立吸引力。
第二个让我印象最深的是 Bass(低音)。
以前一直觉得只是低音比较有力量,但 AI 提到,人类本身就对低频特别敏感。自然界中的雷声、风暴、大型动物的脚步,甚至胎儿时期听到的母亲心跳,都属于低频信息,因此我们的神经系统会下意识提高注意力。
更重要的是,高频主要是耳朵在听,而低频很多时候是身体在感受。尤其是在车里,低音会透过座椅和车身传递振动,所以不仅听得到,还能"感觉得到"。这也是为什么很多电子音乐、电影配乐和游戏音乐都会特别强调 Bass,因为它能够带来更强的沉浸感。
还有一个吸引我的地方,后半段的地方,女声沿着音阶一路向上攀升,最后拉出一个极高、极通透的延长音。这种写法在音乐里属于Counter Melody(对旋律),也就是在主旋律之外,再创造一条独立发展的旋律线。两条旋律彼此呼应,却又互不重复,因此音乐一下子从平面的旋律,变成了具有空间感的立体结构。
更有意思的是,这并不是 Josh Fawaz 凭空创造出来的新旋律,而是来自麦当娜 1989 年原版歌曲的灵魂元素。原曲结尾本来就有福音女声自由发挥(Ad-lib)的高音应答,只不过更多隐藏在背景之中。而这次改编,把这一段背景人声单独"提纯"了出来,不仅把频段处理得更加明亮,也把它放到了整首歌最关键的位置。
就在女声不断向高处攀升的时候,制作人反而把伴奏做了减法。原本厚重的低音和鼓点在这一刻突然抽离,只留下几乎纯净的人声空间。听觉上会产生一种不断向天空飞升的感觉,而就在最高点停留片刻之后,重低音、鼓点和所有伴奏同时重新进入(Drop),整个能量瞬间释放。
这种设计其实在现代电子音乐里非常经典。它利用了人类听觉对于"对比"的敏感:先让声音越来越轻、越来越高、越来越空,再突然回到厚重、低沉、充满能量的状态。从极高音到极低音,从安静到爆发,从留白到饱满,这种巨大的反差,往往比一直维持强烈的情绪更容易让人产生情绪冲击。
这也解释了为什么这一段会特别容易让人反复播放。真正吸引人的,并不是某一个音符,而是制作人对于张力(Tension)和释放(Release)的控制。什么时候留白,什么时候堆叠,什么时候让声音飞起来,什么时候让 Bass 再次落地,这些细节共同决定了最后的听感。
讨论到这里,我又想到另一个问题:为什么连五岁的孩子都会喜欢这首歌?
AI 的解释是,儿童并不会分析和声、编曲或者制作技巧,但他们会天然喜欢几个元素:稳定的节奏、容易记住的重复旋律、能够感受到身体振动的低频,以及音乐中适度的新变化。这些都是人类大脑比较容易产生愉悦感的刺激,因此成年人和孩子虽然理解方式不同,却可能喜欢同一首歌。
最后,我们又回到了最初的问题:AI 在这首作品里到底扮演了什么角色?
看了一些制作过程之后发现,它并不是完全由 AI 自动生成。制作人仍然需要自己设计 Bass、调整旋律、修改编曲、决定不同乐器什么时候进入、什么时候留白。AI 更像是一个效率很高的创作助手,可以快速提供大量方案,但最后决定作品品质的,依然是人的判断和审美。
聊到最后,答案其实并不新鲜。AI 可以创造无限可能,但真正让作品打动人的,依然是那些老生常谈的能力:审美、判断和选择。

