受 Dick Hyman 的《In the Styles of… The Great Jazz Pianists》启发,这项研究探讨生成模型能否复现 individual jazz pianists 个体化的爵士钢琴演奏风格,而不只是识别演奏者。作者使用十二位 PiJAMA 钢琴家的独奏录音,对钢琴 MIDI Transformer 模型 Aria 进行微调。他们在 Aria 上半部分加入门控交叉注意力层,使模型能够根据所选钢琴家的学习嵌入来控制生成内容。
研究使用钢琴家分类器而非困惑度来评估风格,因为困惑度几乎无法区分条件生成模型与无条件生成模型。在滑动长度为 300 个音符的窗口中,条件生成的续奏有 70% 被归因于目标钢琴家,而无条件模型仅为 37%。一项仅使用生成音乐训练的分类器,能够以 95% 的歌曲级准确率识别真实录音,这表明生成出的风格可以迁移到原始分类器之外。
不同钢琴家的结果差异显著:Hank Jones 和 Dick Hyman 的归因准确率达到 96%,而 Cedar Walton 仅为 29%。交互式示例包括基于共同提示生成的多个版本、按钢琴家分别生成的续奏,以及对典型风格片段的可视化。由于自动转录只能近似还原力度和踏板信息,并且示例是依据分类器筛选的,因此仍需开展人工听辨研究作为下一步。