Présentation

Le log‑sum‑exp apparaît dans de nombreux modèles probabilistes et comme approximation lisse du maximum. Il s’écrit \(\log\big(\int_{\mathcal{X}} e^{v(x)} dq(x)\big)\) où \(v\) est une fonction potentielle et \(q\) une distribution de probabilité. Dans les pratiques courantes, l’intégrale est estimée par Monte‑Carlo, c’est‑à‑dire par la moyenne empirique des exponentielles de valeurs tirées de \(q\).

Lorsque les tirages \(z_i\) sont gaussiens de moyenne \(\mu\) et de variance \(\sigma^2\), la variance relative de l’estimateur \(\frac{1}{n}\sum_{i=1}^n e^{z_i}\) vaut \(\frac{e^{\sigma^2}-1}{n}\). Cette expression montre que, pour un nombre d’échantillons fixe, la variance explose de façon exponentielle dès que \(\sigma\) augmente, même si la loi des grands nombres garantit la convergence quand \(n\) tend vers l’infini.

Problème de variance

Le même facteur \(e^{\sigma^2}\) apparaît dans la variance du logarithme de la moyenne, obtenue par la méthode delta : \(\operatorname{var}\big(\log(\frac{1}{n}\sum e^{z_i})\big) \approx \frac{e^{\sigma^2}-1}{n}\) pour \(n\) grand. Ainsi, les estimateurs basés sur le log‑sum‑exp restent sensibles à des valeurs extrêmes de \(v\), ce qui rend l’optimisation numérique instable et augmente le bruit statistique des gradients.

Dans le cadre de la divergence de Kullback‑Leibler (KL), la formulation variationnelle utilise exactement ce terme : \(\sup_{v}\big[\int v\,dp - \log\big(\int e^{v}\,dq\big)\big]\). Remplacer les intégrales par des moyennes empiriques conduit à la même explosion de variance, surtout lorsque \(q\) est difficile à échantillonner ou que \(v\) prend de grandes valeurs.

Approche par moindres carrés

Le post propose de remplacer le log‑sum‑exp par une identité basée sur les moindres carrés. L’équation centrale est :

t log t – t + 1 = ∫₀¹ ((t‑1)² / (ρ t + 1‑ρ)) (1‑ρ) dρ

Cette représentation transforme le terme \(t\log t - t + 1\) (qui apparaît dans la fonction \(f\) de la divergence KL) en une intégrale de fractions rationnelles. En discretisant l’intégrale avec des points \(ρ\) fixes, chaque terme devient une fonction quadratique de \(t\), ouvrant la voie à une estimation par régression linéaire ou ridge, dont la variance est contrôlée par les moments d’ordre deux.

Concrètement, on estime les coefficients de la régression à partir d’échantillons de \(p\) et \(q\), puis on reconstruit une approximation de \(\log\frac{dp}{dq}\) sans jamais calculer d’exponentielle directe. Le coût reste polynomial grâce à l’algèbre linéaire, et la variance des estimateurs est bornée par la variance des moments, qui ne dépend pas de \(e^{\sigma^2}\).

Analyse et limites

Cette méthode conserve les propriétés de convexité de la KL grâce à la forme intégrale, mais elle introduit un biais lié au choix du maillage \(ρ\). Un maillage fin réduit le biais au prix d’une matrice de design plus grande, ce qui augmente le coût de résolution. De plus, la transformation repose sur l’hypothèse que \(t>0\); dans les applications où la densité relative peut s’annuler, il faut ajouter une petite constante de régularisation.

En pratique, les expériences présentées montrent que, pour des valeurs de \(\sigma\) supérieures à 2, l’estimateur basé sur les moindres carrés atteint une variance deux à trois ordres de grandeur inférieure à celle du log‑sum‑exp classique, tout en conservant une précision comparable sur la valeur de la KL. Le principal obstacle reste la nécessité de choisir un nombre de points \(ρ\) adapté à chaque problème, ce qui peut demander une validation croisée.