Soit [formule] un [formule]-échantillon de loi [formule] avec [formule] et [formule] inconnus. Déterminer les estimateurs du maximum de vraisemblance de [formule] et [formule]. L'estimateur de [formule] est-il sans biais ?
Écrire la log-vraisemblance et annuler les dérivées partielles.
Le calcul des deux estimateurs est une optimisation à deux variables, sans difficulté. La vraie question est la dernière : pourquoi l'estimateur naturel de la variance est-il biaisé, de combien, et faut-il pour autant le corriger ? La réponse n'est pas celle qu'on attend. La log-vraisemblance. L'échantillon étant indépendant, la vraisemblance est un produit, et son logarithme une somme : [formule] On maximise le logarithme plutôt que la vraisemblance elle-même : le logarithme étant strictement croissant, les points de maximum sont les mêmes, et la somme est infiniment plus commode à dériver qu'un produit. Estimation de [formule]. [formule] Le résultat ne dépend pas de [formule], ce qui permet de traiter les deux paramètres séparément. Et l'on reconnaît le problème des moindres carrés : [formule] est minimale en la moyenne empirique, c'est un fait purement algébrique. Estimation de [formule]. En dérivant par rapport à [formule] vu comme une seule variable : [formule] Le biais, et sa raison profonde. On montre que [formule], donc [formule] sous-estime systématiquement la variance. La raison n'est pas un accident de calcul : les écarts sont mesurés à [formule], qui est le point qui minimise [formule]. Comparés aux écarts à la vraie moyenne [formule], inconnue, ils sont donc nécessairement plus petits. On a exactement [formule] et le second terme, d'espérance [formule], est précisément ce qui manque. L'estimateur sans biais est donc [formule] : on divise par [formule] parce qu'un degré de liberté a été consommé pour estimer [formule]. ⚠️ Le maximum de vraisemblance n'est PAS conçu pour être sans biais, et le lui reprocher est un contresens. Ses propriétés garanties sont asymptotiques — convergence, normalité asymptotique, efficacité — et non le non-biais à [formule] fini. Deuxième contresens fréquent : croire que [formule] est meilleur en tout. Il est sans biais, mais [formule] a une erreur quadratique moyenne plus faible, le gain sur la variance de l'estimateur l'emportant sur le carré du biais. Sans biais et précis sont deux critères distincts, et ils ne désignent pas le même estimateur ici. ⚠️ Le non-biais ne se transporte pas par une fonction non linéaire. [formule] est un estimateur sans biais de [formule], mais [formule] est un estimateur biaisé de [formule] — et par l'inégalité de Jensen appliquée à la racine, qui est concave, il sous-estime : [formule]. Il n'existe pas de correction universelle analogue au [formule] ; celle qui existe pour la gaussienne fait intervenir des fonctions gamma. 💡 À retenir. La méthode est invariable : log-vraisemblance, dérivées partielles annulées, et vérification qu'il s'agit bien d'un maximum. Retenir aussi l'interprétation du [formule] en degrés de liberté, qui se généralise — en régression linéaire à [formule] paramètres, l'estimateur sans biais de la variance résiduelle divise par [formule], pour exactement la même raison.