Présentation

Le projet décrit dans la page Learning Jazz Pianist Style with Cross‑Attention Conditioning part du modèle Aria, un transformeur de 16 couches pré‑entraîné sur un large corpus de fichiers MIDI de piano. Douze pianistes de jazz, sélectionnés dans le jeu de données PiJAMA, sont utilisés pour affiner le modèle. L’objectif est de générer des continuations musicales qui conservent les signatures stylistiques propres à chaque pianiste, à l’instar des études de Dick Hyman publiées en 1994.

Architecture du modèle

Le raffinement consiste à insérer, dans les huit dernières couches d’Aria, un bloc de cross‑attention conditionné. Ce bloc reçoit, à chaque pas de génération, un embedding dédié au pianiste, composé de quatre vecteurs appris. Un gate g, initialisé à 0,1, module l’influence du bloc avant son addition au flux résiduel. Le schéma suivant provient du papier :

One transformer layer with the added gated cross‑attention block
x  Self‑attention      Add & norm
Cross‑attention ×g    Add & norm
Feed‑forward          Add & norm
x' keys, values pianist embedding 4 learned vectors

Parce que l’embedding est consulté à chaque étape, le conditionnement persiste tout au long de la génération, contrairement à un préfixe de prompt qui s’estompe.

Évaluation du style

Le style est mesuré à l’aide d’un classifieur de pianistes appliqué en fenêtre glissante sur les séquences générées (environ 300 notes par fenêtre). Les résultats montrent que, sans conditionnement, le modèle affiné atteint une accord de 37 % avec le pianiste cible, alors que le modèle conditionné atteint 70 %, contre 25 % pour le modèle pré‑entraîné. Le taux de hasard est de 8 %.

Le perplexité, indicateur de prédictibilité, passe de 11,41 (pré‑entraîné) à 6,96 (affiné sans conditionnement) puis à 6,82 (avec conditionnement). Cette variation marginale indique que le perplexité ne reflète pas la capacité stylistique.

Un second classifieur, entraîné uniquement sur les morceaux générés, identifie les enregistrements réels avec 87 % de précision sur des segments de 1024 tokens et 95 % au niveau de la chanson, proche du 98,8 % atteint par le classifieur initial sur des morceaux réels.

Les performances varient selon les pianistes : 96 % d’accord pour Hank Jones et Dick Hyman, mais seulement 29 % pour Cedar Walton, ce qui reflète la diversité de la signature rythmique et harmonique.

Limites et perspectives

Le modèle travaille sur des fichiers MIDI issus de transcriptions automatiques ; les dynamiques et la pédale sont donc approximatives, et le rendu sonore reste synthétique. Le choix des douze pianistes repose sur leur séparabilité par un modèle pré‑existant, ce qui peut biaiser l’évaluation vers des artistes aux caractéristiques les plus distinctes. Enfin, le conditionnement repose sur un petit nombre de vecteurs (quatre) par pianiste, ce qui limite la granularité possible des nuances stylistiques. Des extensions pourraient explorer des embeddings plus riches ou des mécanismes de mémoire à plus long terme pour capturer des structures musicales plus étendues.