La log-vraisemblance normalisée converge vers \(M_{\theta^\star} = M_{\theta^\star}(\theta^\star) - \mathrm{KL}\), maximale en \(\theta^\star\)
Dans le modèle de Bernoulli \(\ber(\vartheta)\), les observations sont tirées sous \(\theta^\star\). Pour chaque valeur candidate \(\vartheta\), la log-vraisemblance normalisée \(\ell_n(\vartheta) = \bar X_n\log\vartheta + (1-\bar X_n)\log(1-\vartheta)\) est une moyenne empirique, qui converge vers \(M_{\theta^\star}(\vartheta) = \theta^\star\log\vartheta + (1-\theta^\star)\log(1-\vartheta)\). Cette limite s'écrit \(M_{\theta^\star}(\theta^\star) - \mathrm{KL}(\ber(\theta^\star), \ber(\vartheta))\) : elle atteint son maximum en \(\theta^\star\) seulement, et le maximum de \(\ell_n\), atteint en \(\bar X_n\), s'en rapproche quand \(n\) augmente.
Dans le modèle exponentiel \(\expo(\vartheta)\), de densité \(q_\vartheta(x) = \vartheta\,\rme^{-\vartheta x}\indi{\rset_+}(x)\), les observations sont tirées sous \(\theta^\star\). Pour chaque valeur candidate \(\vartheta\), la log-vraisemblance normalisée \(\ell_n(\vartheta) = \log\vartheta - \vartheta\,\bar X_n\) est une moyenne empirique, qui converge vers \(M_{\theta^\star}(\vartheta) = \log\vartheta - \vartheta/\theta^\star\). Cette limite s'écrit \(M_{\theta^\star}(\theta^\star) - \mathrm{KL}(\expo(\theta^\star), \expo(\vartheta))\) : elle atteint son maximum en \(\theta^\star\) seulement, et le maximum de \(\ell_n\), atteint en \(1/\bar X_n\), s'en rapproche quand \(n\) augmente.
Dans le modèle uniforme \(\unif([0,\vartheta])\), de densité \(q_\vartheta(x) = \vartheta^{-1}\indi{[0,\vartheta]}(x)\), les observations sont tirées sous \(\theta^\star\). Pour chaque valeur candidate \(\vartheta\), la log-vraisemblance normalisée \(\ell_n(\vartheta)\) vaut \(-\log\vartheta\) si \(\vartheta \geq X_{n:n} = \max_i X_i\), et \(-\infty\) sinon ; elle converge vers \(M_{\theta^\star}(\vartheta) = -\log\vartheta\) si \(\vartheta \geq \theta^\star\), et \(-\infty\) sinon. Cette limite s'écrit \(M_{\theta^\star}(\theta^\star) - \mathrm{KL}(\unif([0,\theta^\star]), \unif([0,\vartheta]))\) : elle atteint son maximum en \(\theta^\star\) seulement, et le maximum de \(\ell_n\), atteint en \(X_{n:n}\), s'en rapproche quand \(n\) augmente — non pas en un point critique, mais au bord du domaine où \(\ell_n\) est finie.
anim-s2-kl-contrasteLa log-vraisemblance normalisée \(\ell_n\) et sa limite \(M_{\theta^\star}\)
En trait noir, \(M_{\theta^\star}\) ; au point \(\vartheta\), l'écart vertical entre le maximum \(M_{\theta^\star}(\theta^\star)\) et \(M_{\theta^\star}(\vartheta)\) est la divergence de Kullback-Leibler. Les courbes des tailles précédentes restent tracées, de la plus pâle (\(n = 1\)) à la plus soutenue (taille courante), sur le même échantillon emboîté.
Pour \(\vartheta < \theta^\star\), le support \([0,\vartheta]\) ne contient pas \([0,\theta^\star]\) : la vraie loi n'y est pas dominée par \(P_\vartheta\), et \(M_{\theta^\star}(\vartheta) = -\infty\). La zone grisée et hachurée marque ce domaine.
La divergence \(\vartheta \mapsto \mathrm{KL}(\ber(\theta^\star), \ber(\vartheta))\)
La divergence \(\vartheta \mapsto \mathrm{KL}(\expo(\theta^\star), \expo(\vartheta))\)
La divergence \(\vartheta \mapsto \mathrm{KL}(\unif([0,\theta^\star]), \unif([0,\vartheta]))\)
\(\mathrm{KL}(\ber(\theta^\star), \ber(\vartheta)) = \theta^\star\log\frac{\theta^\star}{\vartheta} + (1-\theta^\star)\log\frac{1-\theta^\star}{1-\vartheta} = M_{\theta^\star}(\theta^\star) - M_{\theta^\star}(\vartheta)\), positive, nulle en \(\vartheta = \theta^\star\) seulement.
\(\mathrm{KL}(\expo(\theta^\star), \expo(\vartheta)) = \log\frac{\theta^\star}{\vartheta} + \frac{\vartheta}{\theta^\star} - 1 = M_{\theta^\star}(\theta^\star) - M_{\theta^\star}(\vartheta)\), positive, nulle en \(\vartheta = \theta^\star\) seulement.
\(\mathrm{KL}(\unif([0,\theta^\star]), \unif([0,\vartheta])) = \log\frac{\vartheta}{\theta^\star}\) si \(\vartheta \geq \theta^\star\), et \(+\infty\) sinon : le support \([0,\vartheta]\) doit contenir \([0,\theta^\star]\) pour que la divergence reste finie. Positive, nulle en \(\vartheta = \theta^\star\) seulement.
Pour la même raison, la zone grisée et hachurée, pour \(\vartheta < \theta^\star\), marque le domaine où \(\mathrm{KL} = +\infty\).
Pour \(n = \) : le maximum de \(\ell_n\) est atteint en \(\hat\theta_n^{\mathrm{MV}} = \) , à de \(\theta^\star\) ; au point \(\vartheta\), l'écart \(|\ell_n(\vartheta) - M_{\theta^\star}(\vartheta)|\) vaut . Quand \(n\) augmente, \(\ell_n\) se rapproche de \(M_{\theta^\star}\) et son maximum se rapproche de \(\theta^\star\). Ce maximum est atteint au bord du domaine où \(\ell_n\) est finie, en \(X_{n:n}\), et non en un point critique.
On illustre ici la convergence de la log-vraisemblance normalisée \(\ell_n\) vers sa limite \(M_{\theta^\star}\), et le rôle de la divergence de Kullback-Leibler \(\mathrm{KL}(\ber(\theta^\star), \ber(\vartheta)) = M_{\theta^\star}(\theta^\star) - M_{\theta^\star}(\vartheta)\) dans le fait que cette limite est maximale en \(\theta^\star\) seulement. L'écart \(\ell_n(\bar X_n) - \ell_n(\vartheta)\) est lui-même une telle divergence, entre \(\ber(\bar X_n)\) et \(\ber(\vartheta)\). Voir les résultats « Limite de la log-vraisemblance normalisée » et « Positivité de la divergence de Kullback-Leibler ».
On illustre ici la même convergence de \(\ell_n\) vers \(M_{\theta^\star}\), cette fois dans le modèle exponentiel, où la divergence \(\mathrm{KL}(\expo(\theta^\star), \expo(\vartheta)) = \log(\theta^\star/\vartheta) + \vartheta/\theta^\star - 1\) commande l'écart entre les deux fonctions. L'estimateur du maximum de vraisemblance, \(\hat\theta_n^{\mathrm{MV}} = 1/\bar X_n\), est défini dès que \(\bar X_n > 0\), ce qui a lieu presque sûrement. Voir la proposition « Limite de la log-vraisemblance normalisée ».
On illustre ici un modèle non régulier, dont le support dépend du paramètre : la log-vraisemblance normalisée vaut \(-\infty\) dès que \(\vartheta\) est trop petit pour contenir les observations, si bien que son maximum, atteint en \(X_{n:n}\), se trouve au bord du domaine et non en un point critique. La divergence \(\mathrm{KL}(\unif([0,\theta^\star]), \unif([0,\vartheta])) = \log(\vartheta/\theta^\star)\) est infinie sur ce même domaine. Voir l'exemple des compléments sur le modèle uniforme.