跳到正文
音乐科技前沿

生成式音乐:模型、控制与评估

14 分钟

生成模型可预测下一个音符、学习潜空间或从文本生成音频。输出像音乐不等于理解创作,也不等于拥有训练素材权利。评价需要技术、音乐、来源与使用场景多个维度。

符号与音频生成

MIDI式符号模型处理音高、时值和力度,易编辑却不含完整音色;音频模型直接生成波形或潜表示,能表达音色但计算大、结构控制难。选择由作品目标决定。

条件控制

和弦、节拍、曲式、文本或参考音频可约束生成。控制有效性要测输出是否真正遵循条件,而不是只挑成功例子展示。

长期结构

局部几秒连贯不保证数分钟有发展。可分层生成段落计划与细节,或由人先给形式再让模型填充。模型不是必须接管全部决策。

评估

损失或自动分数与音乐价值不等价。做响度匹配盲听,评价连贯、控制、音质和新颖,同时报告失败率与人工筛选量。

记忆与复制

检查输出是否与训练样本过度相似,尤其罕见歌词、旋律与音色。过滤不能替代合法数据来源、授权和适当披露。

随机种子、模型版本、提示和后期编辑都应保存,使作品贡献可追踪。人类评审者要避免知道模型名称造成品牌偏见,并允许评价“都不可用”而非强迫二选一。

练习:给同一音乐条件生成多份结果,建立盲评表并记录筛选前全部输出分布。

小纸条

生成音乐为什么不能只展示人工挑出的最好样例来评价模型?