← Semaine 2 — Estimation

La log-vraisemblance normalisée converge vers \(M_{\theta^\star} = M_{\theta^\star}(\theta^\star) - \mathrm{KL}\), maximale en \(\theta^\star\)

Dans le modèle de Bernoulli \(\ber(\vartheta)\), les observations sont tirées sous \(\theta^\star\). Pour chaque valeur candidate \(\vartheta\), la log-vraisemblance normalisée \(\ell_n(\vartheta) = \bar X_n\log\vartheta + (1-\bar X_n)\log(1-\vartheta)\) est une moyenne empirique, qui converge vers \(M_{\theta^\star}(\vartheta) = \theta^\star\log\vartheta + (1-\theta^\star)\log(1-\vartheta)\). Cette limite s'écrit \(M_{\theta^\star}(\theta^\star) - \mathrm{KL}(\ber(\theta^\star), \ber(\vartheta))\) : elle atteint son maximum en \(\theta^\star\) seulement, et le maximum de \(\ell_n\), atteint en \(\bar X_n\), s'en rapproche quand \(n\) augmente.

anim-s2-kl-contraste
Observations \(x_1, x_2, \ldots, x_n\) (\(n = \) ; 40 premières valeurs) — nombre de \(1\) observés : \(S_n = \)

La log-vraisemblance normalisée \(\ell_n\) et sa limite \(M_{\theta^\star}\)

En trait noir, \(M_{\theta^\star}\) ; au point \(\vartheta\), l'écart vertical entre le maximum \(M_{\theta^\star}(\theta^\star)\) et \(M_{\theta^\star}(\vartheta)\) est la divergence de Kullback-Leibler. Les courbes des tailles précédentes restent tracées, de la plus pâle (\(n = 1\)) à la plus soutenue (taille courante), sur le même échantillon emboîté.

\(M_{\theta^\star}(\theta^\star)\), maximum de \(M_{\theta^\star}\)
\(M_{\theta^\star}(\vartheta)\)
\(\ell_n(\vartheta)\)

La divergence \(\vartheta \mapsto \mathrm{KL}(\ber(\theta^\star), \ber(\vartheta))\)

\(\mathrm{KL}(\ber(\theta^\star), \ber(\vartheta)) = \theta^\star\log\frac{\theta^\star}{\vartheta} + (1-\theta^\star)\log\frac{1-\theta^\star}{1-\vartheta} = M_{\theta^\star}(\theta^\star) - M_{\theta^\star}(\vartheta)\), positive, nulle en \(\vartheta = \theta^\star\) seulement.

\(\mathrm{KL}(\theta^\star, \vartheta)\)
\(\hat\theta_n^{\mathrm{MV}}\), maximum de \(\ell_n\)
\(\ell_n(\hat\theta_n^{\mathrm{MV}}) - \ell_n(\vartheta)\)
fonction limite \(M_{\theta^\star}\) et divergence \(\mathrm{KL}(\theta^\star, \vartheta)\) log-vraisemblances normalisées \(\ell_n\), de \(n = 1\) (pâle) à la taille courante (soutenu), et écart \(\ell_n(\hat\theta_n^{\mathrm{MV}}) - \ell_n(\vartheta)\) (tirets) maximum de \(\ell_n\) pour la taille courante, atteint en \(\hat\theta_n^{\mathrm{MV}}\) valeur candidate \(\vartheta\) et divergence en ce point vraie valeur \(\theta^\star\) (pointillés)

On illustre ici la convergence de la log-vraisemblance normalisée \(\ell_n\) vers sa limite \(M_{\theta^\star}\), et le rôle de la divergence de Kullback-Leibler \(\mathrm{KL}(\ber(\theta^\star), \ber(\vartheta)) = M_{\theta^\star}(\theta^\star) - M_{\theta^\star}(\vartheta)\) dans le fait que cette limite est maximale en \(\theta^\star\) seulement. L'écart \(\ell_n(\bar X_n) - \ell_n(\vartheta)\) est lui-même une telle divergence, entre \(\ber(\bar X_n)\) et \(\ber(\vartheta)\). Voir les résultats « Limite de la log-vraisemblance normalisée » et « Positivité de la divergence de Kullback-Leibler ».