Coefficient de mélange : maximum de vraisemblance et moments, avec ou sans seuillage
Dans le modèle de mélange de l'exercice 2, de densité \(f_\theta(x) = \frac\theta a\,\indi{[0,a]}(x) + \frac{1-\theta}{b}\,\indi{[0,b]}(x)\) avec \(a = 1\), \(b = 3\) et \(\theta \in\ ]0,1[\), le maximum de vraisemblance conduit à \(\hat\theta_n = (b\,N_a/n - a)/(b-a)\), où \(N_a\) est le nombre d'observations dans \([0,a]\), et la méthode des moments à \(\tilde\theta_n = (b - 2\bar X_n)/(b-a)\). Ces deux estimateurs sont sans biais mais sortent de \(]0,1[\) ; les versions seuillées \(\hat\theta_n^{(1)} = \max(\hat\theta_n, 0)\) et \(\hat\theta_n^{(2)}\), ramenée dans \([0,1]\), restent dans le paramètre mais sont biaisées. On répète 5 000 fois le tirage d'un jeu de 200 observations sous \(\theta^\star\) et l'on compare les boîtes à moustaches des estimateurs calculés sur les \(n\) premières observations, puis sur les 200.
anim-s2-melange-emm-emv\(n = \) observations
Boîtes à moustaches des 5 000 valeurs de chaque estimateur, calculé sur les \(n\) premières observations de chaque jeu.
| moyenne | biais | écart-type | hors de \(]0,1[\) | |
|---|---|---|---|---|
| \(\hat\theta_n\) | ||||
| \(\hat\theta_n^{(1)}\) | ||||
| \(\tilde\theta_n\) | ||||
| \(\hat\theta_n^{(2)}\) |
\(n = 200\) observations
Les mêmes 5 000 jeux de données, chaque estimateur étant calculé sur les 200 observations ; l'échelle des ordonnées est la même qu'à gauche.
| moyenne | biais | écart-type | hors de \(]0,1[\) | |
|---|---|---|---|---|
| \(\hat\theta_n\) | ||||
| \(\hat\theta_n^{(1)}\) | ||||
| \(\tilde\theta_n\) | ||||
| \(\hat\theta_n^{(2)}\) |
Aucun estimateur n'est encore calculé : seules la vraie valeur \(\theta^\star\) et les bornes de \(\Theta = ]0,1[\) sont représentées.
Les estimateurs non seuillés \(\hat\theta_n\) et \(\tilde\theta_n\) sont sans biais, \(\PE_\theta[\hat\theta_n] = \PE_\theta[\tilde\theta_n] = \theta\), mais prennent des valeurs hors de \(]0,1[\) : dans des jeux pour \(n = \) , et dans pour \(n = 200\) (estimateur ).
L'estimateur seuillé \(\hat\theta_n^{(1)} = \max(\hat\theta_n, 0)\) vaut \(0\) dans des jeux pour \(n = \) et dans pour \(n = 200\) : le seuillage ramène l'estimateur dans \([0,1]\) et crée un biais strictement positif, d'autant plus faible que \(n\) est grand.
L'estimateur des moments seuillé \(\hat\theta_n^{(2)}\) vaut \(0\) ou \(1\) dans des jeux pour \(n = \) et dans pour \(n = 200\) ; il reste plus dispersé que \(\hat\theta_n^{(1)}\), la moyenne empirique n'utilisant pas le fait que la vraisemblance ne dépend des observations que par \(N_a\).
On illustre ici deux estimateurs du coefficient de mélange, par maximum de vraisemblance et par la méthode des moments, tous deux sans biais mais susceptibles de sortir de \(]0,1[\) ; leurs versions seuillées restent dans le paramètre au prix d'un biais strictement positif, d'autant plus faible que \(n\) est grand. Voir l'exercice 2 (PC2) « Estimation d'un coefficient de mélange » et son corrigé.