Contexte du reward modeling
Les modèles de récompense classiques produisent un scalaire r_θ(x,a)∈ℝ pour un contexte x et une réponse a. Ce scalaire ne possède aucune signification absolue : la valeur 0.8 varie selon le problème, le pool de candidats ou la version du modèle. Ainsi, le signal exploité reste une préférence relative, masquée par le format scalaire.
Le Pairwise Preference Reward Model (PPRM) de LLaMA‑Berry rend explicite cette comparaison en estimant la probabilité que a₁ soit meilleure que a₂ :
P(a₁ ≻ a₂ | x) = σ(u_θ(x,a₁) - u_θ(x,a₂))
Le modèle est entraîné sur 7,8 M de paires de solutions mathématiques et utilise la méthode DPO pour affiner la tâche de prédiction binaire. Cette étape transforme le reward modeling en preference‑probability modeling, mais ne dépasse pas le cas binaire.
Architecture RLCD et modèle Plackett–Luce
RLCD (Reward Learning with Calibrated Decisions) étend le PPRM à un choix multi‑candidats. Pour un ensemble A={a₁,…,a_K}, chaque candidat reçoit une utilité contextuelle u_i = u_θ(x,a_i). Le modèle Plackett–Luce normalise ces utilités :
P(a_i | x, A) = exp(u_i) / Σ_j exp(u_j)
Lorsque K=2, on retrouve exactement le modèle de Bradley‑Terry du PPRM. Si la supervision fournit un classement complet a_{π₁} ≻ a_{π₂} ≻ … ≻ a_{π_K}, la vraisemblance Plackett‑Luce s’écrit :
L_PL = - Σ_t=1^K log( exp(u_{π_t}) / Σ_{j=t}^K exp(u_{π_j}) )
Cette fonction de perte constitue le « cœur mathématique » de RLCD : elle transforme la préférence binaire en une distribution de décision multi‑voie.
Calibration probabiliste et fonctions de perte
Une distribution softmax normalisée ne garantit pas la calibration. RLCD impose que la probabilité annoncée p corresponde à la fréquence empirique d’erreur, c’est‑à‑dire P(Y=ĤY | Ŝ=p) ≈ p. Deux scores strictement propres sont proposés :
- Log‑loss (NLL) :
L_NLL = -log p_y - Brier score :
BS(p,y) = (p - y)²
Le Brier score pénalise fortement les prévisions confiantes mais erronées : pour p=0.8, l’erreur vaut 0.04 si l’événement se réalise, mais 0.64 sinon, soit un facteur 16. Cette propriété rend le Brier score adapté à un modèle de décision où la confiance doit être fiable.
Implications pour Jev et limites
Jev intègre RLCD en ajoutant des sorties typées et une inférence parallèle, ce qui fait du modèle de récompense le modèle même, au lieu d’être encapsulé derrière un générateur. Le système renvoie directement une décision et une probabilité calibrée, facilitant l’utilisation de TypeSafe comme contrat de fiabilité.
Cependant, RLCD repose sur la disponibilité de rankings complets ou partiels ; en l’absence de telles annotations, le modèle doit se contenter du loss L_choice = -log( exp(u_y) / Σ_j exp(u_j) ), ce qui peut réduire la précision de la calibration. De plus, la complexité de l’inférence croît linéairement avec K, limitant le nombre de candidats traités en temps réel.
En résumé, RLCD fournit une passerelle rigoureuse entre le reward modeling scalaire et la prise de décision multi‑candidats calibrée, tout en exposant clairement les exigences de données et les coûts computationnels associés.