library(tidyverse)
library(extrafont)
require(ggsci)
library(ggpubr)
library(knitr)
library(ggfortify)
library(ggrepel)
library(corrplot)ANOVA à un facteur
2eme-FA-EMS - BUT SD - E. Anakok
1 Introduction
1.1 Ce qu’il faut retenir de ce cours
\[ X = \begin{bmatrix} \text{Groupe 1} \\ \text{Groupe 2} \\ \text{Groupe 1} \\ \text{Groupe 3} \\ \text{Groupe 2} \\ \text{Groupe 3} \end{bmatrix} \quad \text{en} \quad X^{(1)} = \left[\begin{array}{ccc} \text{Groupe 1} & \text{Groupe 2} & \text{Groupe 3} \\ 1 & 0 & 0 \\ 0 & 1 & 0 \\ 1 & 0 & 0 \\ 0 & 0 & 1 \\ 0 & 1 & 0 \\ 0 & 0 & 1 \end{array}\right] \]
Problème : Le modèle ainsi défini n’est pas identifiable.
\[Y = X^{(1)}\theta + E\]
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.
\(X^{(1)}\) est la matrice encodée du facteur sans l’intercept.
\(\theta = [\mu_1,\dots,\mu_p]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
\[Y = X^{(1)}\theta + E\]
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.
\(X^{(1)}\) est la matrice encodée du facteur sans le groupe 1.
\(\theta = [\beta,\alpha_2,\dots,\alpha_p]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
1.2 Introduction
Expliquer une variable continue en fonction d’une variable catégorielle (appelée facteur).
Généralisation du test d’égalité de deux espérances (vu en cours sur les tests) à \(p\) espérances, si le facteur a \(p\) modalités
- Les valeurs (continues) \(y_i\) pour \(1\leq i \leq n\)
- Une classe pour chaque individu \(i\)
1.3 Exemple
Étude de la prise de poids d’individus en fonction de leurs régime
Pour \(n= 76\) individus on a :
Une variable réponse à expliquer :
- Leur prise de poids (mesurée en kg)
Un facteur explicatif à \(p= 3\) niveau (modalités):
- Régime 1
- Régime 2
- Régime 3
1.4 Les données
diet <- read.table(file = "Diet.txt", header = TRUE, sep =";" )
diet$Diet <- as.factor(diet$Diet)
kable(head(diet))| Diet | Diff_poid |
|---|---|
| 1 | 1.5 |
| 3 | 4.5 |
| 3 | 3.5 |
| 2 | 2.0 |
| 1 | 1.1 |
| 1 | 3.5 |
1.5 Étude univariées des données
summary(diet$Diff_poid) Min. 1st Qu. Median Mean 3rd Qu. Max.
-2.100 2.300 3.700 3.946 5.650 9.200
Les individus perde jusqu’à 2,1 kg et gagne jusqu’à 9,2 kg.
table(diet$Diet)
1 2 3
24 25 27
24 individus ont fait le régime 1, 25 ont fait le régime 2, et 27 ont fait le régime 3
library(ggbeeswarm)
ggplot(diet, aes(x= Diet, y = Diff_poid, color = Diet))+
geom_boxplot()+
geom_beeswarm(alpha = 0.5)1.6 Exemple
Étude de l’effet du régile sur la variable différence de poids (mesuré en kg).
Une variable réponse continue : “la prise” de poids
Un facteur explicatif à \(p=3\) niveaux (modalités) codé en
- Régime 1
- Régime 2
- Régime 3
Comment analyser ces données ?
- On va calculer une estimation moyenne de prise de poids par régime.
1.7 Écriture du modèle
Pour \(1\leq i \leq n\) et \(1\leq j \leq p\)
\(y_{i,j}\) l’observation de la variable réponse du \(i\)-ème individu qui a la modalité \(j\)
On suppose que \(y_{i,j}\) est la réalisation d’une variable aléatoire \(Y_{i,j}\) telle que
\[Y_{i,j} \sim \mathcal{N}(\mu_j,\sigma^2) \] où \(Y_{i,j}\) est la variable aléatoire liée à l’individu \(i\) de la modalité \(j\), les \(Y_{i,j}\) sont indépendants.
- \(p\) paramètres d’espérance (1 par modalité)
- 1 paramètre de variance
1.8 Trouver les paramètres (\(\mu_j\) et \(\sigma^2\))
Trouver les paramètres d’espérance \(\theta\) tel que
\[Y = X\theta + E,\quad E \sim \mathcal{N}(0,\sigma^2 I_n)\]
- Pour le modèle linéaire, \(X\) doit être numérique (quantitatif).
- Ici, \(X\) est une catégorie (qualitatif).
1.9 Encodage one-hot ou encodage 1 parmi \(p\)
Transformer la variable qualitative à \(p\) modalité \(\Longrightarrow\) \(p\) variables 0/1
\[ R = \begin{bmatrix} \text{Régime 1} \\ \text{Régime 2} \\ \text{Régime 1} \\ \text{Régime 3} \\ \text{Régime 2} \\ \text{Régime 3} \end{bmatrix} \quad \text{en} \quad X^{(1)} = \left[\begin{array}{ccc} \text{Régime 1} & \text{Régime 2} & \text{Régime 3} \\ 1 & 0 & 0 \\ 0 & 1 & 0 \\ 1 & 0 & 0 \\ 0 & 0 & 1 \\ 0 & 1 & 0 \\ 0 & 0 & 1 \end{array}\right] \]
1.10 Notations
- \(y_i\) la valeur de la variable réponse.
- \(X^{(1)}_{i,1}\) est égale à 1 si l’individu \(i\) à fait le régime 1 et 0 sinon.
- \(X^{(1)}_{i,2}\) est égale à 1 si l’individu \(i\) à fait le régime 2 et 0 sinon.
- \(X^{(1)}_{i,3}\) est égale à 1 si l’individu \(i\) à fait le régime 3 et 0 sinon.
Dans un premier temps, on pourra écrire :
\[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \]
Attention ! Ce modèle présente un problème, qu’on verra plus tard…
1.11 Interprétation du modèle
\[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \] Pour un \(i \in \{1,\dots,n\}\), il n’y a qu’un seul des \(X^{(1)}_{i,1},X^{(1)}_{i,2},X^{(1)}_{i,3}\) qui est égale à 1 et les autres valent 0.
Si l’individu \(i\) fait le régime 1 : \(X^{(1)}_{i,1}= 1\) et \(X^{(1)}_{i,2}=0,X^{(1)}_{i,3}=0\), donc \[Y_i = \beta + \alpha_1 + E_i \]
Si l’individu \(i\) fait le régime 2 : \(X^{(1)}_{i,2}= 1\) et \(X^{(1)}_{i,1}=0,X^{(1)}_{i,3}=0\), donc \[Y_i = \beta + \alpha_2 + E_i \]
Si l’individu \(i\) fait le régime 3 : \(X^{(1)}_{i,3}= 1\) et \(X^{(1)}_{i,1}=0,X^{(1)}_{i,2}=0\), donc \[Y_i = \beta + \alpha_3 + E_i \]
La prise de poid de l’individu \(i\) est modélisée par une valeur globale plus une valeur dépendant de son régime et d’une erreur
On notant \(\mu_j = \beta + \alpha_j\) on retrouve bien \(Y_{i,j} \sim \mathcal{N}(\mu_j,\sigma^2)\)
1.12 Écriture matricielle
\[ Y = X\theta + E\]
\[ X = \left[\begin{array}{cccc}\text{intercept} & \text{Régime 1} & \text{Régime 2} & \text{Régime 3} \\ 1 & 1 & 0 & 0 \\ 1 & 0 & 1 & 0 \\1 & 1 & 0 & 0 \\1 & 0 & 0 & 1 \\1 & 0 & 1 & 0 \\1 & 0 & 0 & 1 \\ \vdots &\vdots &\vdots &\vdots \end{array}\right] \]
- \(E\sim \mathcal{N}(0,\sigma^2I_n)\)
- Problème ? Les collones de \(X\) sont colinéaires. En effet, on a \(X^{(1)}_{i,1}+X^{(1)}_{i,2} + X^{(1)}_{i,3} = 1\). La somme des trois dernières colonnes de \(X\) est égale à la première
1.13 Identifiabilité
Le modèle \[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \] n’est pas identifiable.
Il y a 4 paramètres d’espérance alors qu’il n’y a que 3 groupes.
1.14 Solution
Pour résoudre ce problème, on va retirer une colonne de \(X\).
\(\iff\) mettre une contrainte obligeant un des paramètres à ếtre égale à 0.
Deux possibilités :
On retire la première colonne de \(X\)
\(\iff \beta = 0\)
\[Y_i = \mu_1X^{(1)}_{i,1}+ \mu_2X^{(1)}_{i,2}+ \mu_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \]
On retire une autre colonne de \(X\), par exemple la seconde
\(\iff \alpha_1 = 0\) On dira alors que le groupe 1 est le groupe de référence.
\[Y_i =\beta + \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2)\]
2 Modèle sans intercept
2.1 Notation matricielle dans l’exemple
\[Y = X^{(1)}\theta + E\] où
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. liées à la prise de poids de l’individu \(\{1, \dots,n\}\).
\(X^{(1)}\) est la matrice encodée du facteur “type de régime”.
\(\theta = [\mu_1,\mu_2,\mu_3]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
La prise de poid de l’individu \(i\) est modélisée par une valeur dépendant de son régime et une erreur
2.2 Notation matricielle
\[Y = X^{(1)}\theta + E\] où
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.
\(X^{(1)}\) est la matrice encodée du facteur sans l’intercept.
\(\theta = [\mu_1,\dots,\mu_p]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
On retombe bien sur le modèle
\[Y_{i,j} = \mu_j + E_i, \quad E_i\overset{i.i.d.}{\sim}\mathcal{N}(0,\sigma^2)\]
\[\iff Y_{i,j}\sim\mathcal{N}(\mu_j,\sigma^2)\]
2.3 Estimation des \(\mu_j\)
Dans le cadre du modèle linéaire multivarié \(Y = X\theta +E\)
L’estimateur de \(\theta\) est \(\widehat{\theta} = (X^tX)^{-1}X^tY\)
Dans le cadre de l’ANOVA à un facteur, \(Y = X^{(1)}\theta +E\)
L’estimateur de \(\theta\) est \(\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY\)
2.4 Calcul de \(\widehat{\theta}\) dans l’exemple
\[{X^{(1)}}^tX^{(1)} = \begin{bmatrix}n_1 & 0 & 0 \\0 & n_2 & 0\\ 0 & 0 & n_3 \end{bmatrix}\]
\[\left({X^{(1)}}^tX^{(1)}\right)^{-1} = \begin{bmatrix}\frac{1}{n_1} & 0 & 0 \\0 & \frac{1}{n_2} & 0\\ 0 & 0 & \frac{1}{n_3} \end{bmatrix}\]
\[{X^{(1)}}^tY = \begin{bmatrix}\sum_{i=1}^{n_1} Y_{i,1} \\ \sum_{i=1}^{n_2} Y_{i,2}\\ \sum_{i=1}^{n_3} Y_{i,3} \end{bmatrix}\]
\[\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY = \begin{bmatrix}\frac{1}{n_1}\sum_{i=1}^{n_1} Y_{i,1} \\ \frac{1}{n_2}\sum_{i=1}^{n_2} Y_{i,2}\\ \frac{1}{n_3}\sum_{i=1}^{n_3} Y_{i,3} \end{bmatrix}\]
2.5 Interprétation
Finalement, pour \(j\in \{1,\dots,p\}\) (dans l’exemple \(p=3\)) on a
\[\widehat{\mu}_j = \frac{1}{n_j}\sum_{i=1}^{n_j}Y_{i,j} = \overline{Y_j} \]
Il s’agit de la moyenne empirique de \(Y\) dans la modalité \(j\)
library(ggbeeswarm)
ggplot(diet, aes( x = Diet, y = Diff_poid, color = Diet)) +
geom_boxplot() +
geom_beeswarm(alpha = 0.5) +
stat_summary(size = 2, shape = 4, fun = mean)2.6 ANOVA sans intercept sur R
mod_ssinter <- lm(Diff_poid~ Diet - 1, data = diet)
summary(mod_ssinter)
Call:
lm(formula = Diff_poid ~ Diet - 1, data = diet)
Residuals:
Min 1Q Median 3Q Max
-5.3680 -1.4420 0.1759 1.6519 5.7000
Coefficients:
Estimate Std. Error t value Pr(>|t|)
Diet1 3.3000 0.4840 6.818 2.26e-09 ***
Diet2 3.2680 0.4742 6.891 1.66e-09 ***
Diet3 5.1481 0.4563 11.282 < 2e-16 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared: 0.7519, Adjusted R-squared: 0.7417
F-statistic: 73.76 on 3 and 73 DF, p-value: < 2.2e-16
2.7 Estimation du paramètre de variance
Comme en regression linéaire multiple. Par contre, on divise par \(n-p\) et non pas \(n-p-1\) car on a retiré l’intercept.
\[\begin{align} S^2_{(M_p)} &= \frac{SCR(M_p)}{n-p} = \frac{||Y - X\theta||^2}{n-p}\\ & = \frac{1}{n-p} \sum_{j=1}^{p}\sum_{i=1}^{n_j}(Y_{i,j} - \overline{Y_j})^2 \end{align}\]
2.8 Loi de \(\widehat\theta\)
\(\widehat\theta\) est un vecteur gaussien d’espérance \(\theta\) et de matrice de covariance
\[\mathbb{V}(\widehat\theta) = \sigma^2(X^tX)^{-1}\text{ estimée par } S^2_{(M_p)}(X^tX)^{-1}\]
On montre que \[\widehat{\theta}\sim \mathcal{N}(\theta,\sigma^2(X^tX)^{-1} ) \]
En particulier, pour tout \(k = 1, \cdots, p + 1\), si \(c_{kk} = (X^t X )^{−1}_{k,k}\) désigne le \(k\)-ème élément diagonal de \((X^tX)\)^{−1}, et \(\widehat{\theta}_k\) désigne le \(k\)-ème élément du vecteur \(\widehat{\theta}\), on a
\[\overline{Y}_k = \widehat{\theta}_k \sim \mathcal{N}(\theta_k,\sigma^2 c_{kk})\]
En remplaçant \(\sigma^2\) par son estimateur, on a :
\[ \frac{(\overline{Y}-\mu_k)}{\sqrt{S^2_{(M_p)}c_{kk}}} \sim \mathcal{T}(n-p)\]
2.9 Forme explicite de \(c_{kk}\)
\[\left({X^{(1)}}^tX^{(1)}\right)^{-1} = \begin{bmatrix}\frac{1}{n_1} & 0 & 0 \\0 & \frac{1}{n_2} & 0\\ 0 & 0 & \frac{1}{n_3} \end{bmatrix}\]
\[c_{kk} = \frac{1}{n_k}\] \[\overline{Y}_k = \widehat{\theta}_k \sim \mathcal{N}\left(\theta_k,\frac{\sigma^2}{n_k}\right)\]
En remplaçant \(\sigma^2\) par son estimateur, on a :
\[ \frac{(\overline{Y}-\mu_k)}{\sqrt{\frac{S^2_{(M_p)}}{n_k}}} \sim \mathcal{T}(n-p)\]
2.10 Intervalle de confiance du modèle sans intercept
\[ IC_{1-\delta}(\mu_k) = \left[\overline{y}_i - t_{1-\frac{\delta}{2}}\frac{s_{M_p}}{\sqrt{n_i}};\;\overline{y}_i + t_{1-\frac{\delta}{2}}\frac{s_{M_p}}{\sqrt{n_i}} \right] \]
où \(t_{1-\frac{\delta}{2}}\) est le quantile \(1-\frac{\delta}{2}\) de la loi \(\mathcal{T}(n-p)\)
confint(mod_ssinter, level = 0.95) 2.5 % 97.5 %
Diet1 2.335407 4.264593
Diet2 2.322895 4.213105
Diet3 4.238721 6.057575
2.11 Test de Student
\[H_0 : \mu_k = 0 \text{ contre } H_1 : \mu_k \neq 0\]
Il s’agit d’un test de conformité de moyenne, on regarde si la moyenne de chaque groupe est significativement différente de 0.
Sous \(H_0\), on a \[T_n = \frac{(\overline{Y}-\mu_k)}{\sqrt{\frac{S^2_{(M_p)}}{n_k}}}\sim\mathcal{T}(n-p)\]
À part l’estimation de \(\sigma^2\) c’est comme le test de Student vu en test paramétrique.
2.12 ANOVA sans intercept sur R
mod_ssinter <- lm(Diff_poid~ Diet - 1, data = diet)
summary(mod_ssinter)
Call:
lm(formula = Diff_poid ~ Diet - 1, data = diet)
Residuals:
Min 1Q Median 3Q Max
-5.3680 -1.4420 0.1759 1.6519 5.7000
Coefficients:
Estimate Std. Error t value Pr(>|t|)
Diet1 3.3000 0.4840 6.818 2.26e-09 ***
Diet2 3.2680 0.4742 6.891 1.66e-09 ***
Diet3 5.1481 0.4563 11.282 < 2e-16 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared: 0.7519, Adjusted R-squared: 0.7417
F-statistic: 73.76 on 3 and 73 DF, p-value: < 2.2e-16
2.13 Test de Fisher
\(H_0\): On est dans le modèle \(M_0 : Y_i = E_i\)
contre
\(H_1\): On est dans le modèle \(M_p : Y_{i,j} = \mu_j + E_i\)
\(H_0\): On est dans le modèle \(M_0 : \mu_1 = \mu_2 = \dots = \mu_p = 0\)
contre
\(H_1\): On est dans le modèle \(M_p : \exists j \in \{1,\dots,j\}, \mu_j \neq 0\)
m0 <- lm(Diff_poid~0, data = diet)
anova(m0, mod_ssinter)Analysis of Variance Table
Model 1: Diff_poid ~ 0
Model 2: Diff_poid ~ Diet - 1
Res.Df RSS Df Sum of Sq F Pr(>F)
1 76 1654.3
2 73 410.4 3 1244 73.755 < 2.2e-16 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
2.14 Remarques
- Le test de Student : compare les moyennes des groupes à 0.
- Le test de Fisher test si au moins une des moyennes est à 0.
\(\Longrightarrow\) Il n’y a pas de comparaison des moyennes entre elles !
3 ANOVA avec groupe de référence
3.1 Notation non matricielle dans l’exemple
\[Y_i = \beta + \alpha_ 2X_{i,2}^{(1)}+ \alpha_ 3X_{i,3}^{(1)} + E_i \]
Si l’individu \(i\) a fait le régime 1, qui est le régime de référence, alors \(X_{i,2}^{(1)} = 0\) et \(X_{i,3}^{(1)} = 0\) donc
\[Y_i = \beta + E_i \]
Si l’individu \(i\) a fait le régime 2, alors \(X_{i,2}^{(1)} = 1\) et \(X_{i,3}^{(1)} = 0\) donc
\[Y_i = \beta +\alpha_2+ E_i \]
Si l’individu \(i\) a fait le régime 3, alors \(X_{i,2}^{(1)} = 0\) et \(X_{i,3}^{(1)} = 1\) donc
\[Y_i = \beta +\alpha_3+ E_i \]
La prise de poid de l’individu \(i\) est modélisée par une valeur de référence plus une valeur dépendant de son régime et une erreur
3.2 Notation matricielle dans l’exemple
\[Y = X^{(1)}\theta + E\] où
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. liées à la prise de poids de l’individu \(\{1, \dots,n\}\).
\(X^{(1)}\) est la matrice encodée du facteur “type de régime” sans la première colonne.
\[X^{(1)} = \left[\begin{array}{ccc}\text{intercept} & \text{Régime 2} & \text{Régime 3} \\ 1 & 0 & 0 \\ 1 & 1 & 0 \\1 & 0 & 0 \\1 & 0 & 1 \\1 & 1 & 0 \\1 & 0 & 1 \\ \vdots &\vdots &\vdots \end{array}\right]\]
\(\theta = [\beta,\alpha_2,\alpha_3]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
La prise de poid de l’individu \(i\) est modélisée par une valeur de référence plus une valeur dépendant de son régime et une erreur
3.3 Interprétation des paramètres
Pour le régime 1 : \[Y_{i,1}\sim\mathcal{N}(\beta,\sigma^2)\]
donc \(\beta = \mu_1\), il s’agit de la moyenne du groupe de référence.
Pour le régime 2 : \[Y_{i,1}\sim\mathcal{N}(\beta + \alpha_2,\sigma^2)\]
\(\mu_2 = \mu_1+ \alpha_2\), donc \(\alpha_2 = \mu_2 - \mu_1\) \(\Longrightarrow\alpha_2\) représente l’écart en moyenne entre le régime 2 et le régime de référence 1.
Pour le régime 3 : \[Y_{i,1}\sim\mathcal{N}(\beta + \alpha_3,\sigma^2)\]
\(\mu_3 = \mu_1+ \alpha_3\), donc \(\alpha_3 = \mu_3 - \mu_1\) \(\Longrightarrow\alpha_3\) représente l’écart en moyenne entre le régime 3 et le régime de référence 1.
3.4 Notation matricielle
\[Y = X^{(1)}\theta + E\] où
\(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.
\(X^{(1)}\) est la matrice encodée du facteur sans le groupe 1.
\(\theta = [\beta,\alpha_2,\dots,\alpha_p]^t\).
\(E \sim \mathcal{N}(0,\sigma^2 I_n)\).
En posant comme contrainte \(\alpha_1=0\) et \(\mu_j = \beta + \alpha_j\), on retombe bien sur le modèle
\[Y_{i,j} = \beta + \alpha_j + E_i =\mu_j + E_i, \quad E_i\overset{i.i.d.}{\sim}\mathcal{N}(0,\sigma^2)\]
\[\iff Y_{i,j}\sim\mathcal{N}(\mu_j,\sigma^2)\]
3.5 Estimateur
En refaisant les calculs avec \(\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY\) on trouve
\[\widehat{\beta} = \overline{Y_1} \]
\[\widehat{\alpha}_j = \overline{Y_j} - \overline{Y_1} = \left(\frac{1}{n_j}\sum_{i=1}^{n_j}Y_{i,j} \right) - \overline{Y_1}\]
3.6 Lecture sur R
Par défaut c’est le premier facteur qui est le groupe de référence dans R
mod_c1 <- lm(Diff_poid~Diet, diet)
summary(mod_c1)
Call:
lm(formula = Diff_poid ~ Diet, data = diet)
Residuals:
Min 1Q Median 3Q Max
-5.3680 -1.4420 0.1759 1.6519 5.7000
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 3.3000 0.4840 6.818 2.26e-09 ***
Diet2 -0.0320 0.6776 -0.047 0.96246
Diet3 1.8481 0.6652 2.778 0.00694 **
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared: 0.1285, Adjusted R-squared: 0.1047
F-statistic: 5.383 on 2 and 73 DF, p-value: 0.006596
3.7 Loi de l’estimateur
\(\widehat{\beta} \sim \mathcal{N}\left(\beta,\frac{\sigma^2}{n_1}\right)\)
Pour \(j\neq 1\), on a \(\widehat{\alpha}_j \sim \mathcal{N}\left(\alpha_i,\frac{\sigma^2}{n_i}+\frac{\sigma^2}{n_1}\right)\)
Pour \(j\neq 1\): \[T = \frac{\widehat{\alpha_j}}{\sqrt{S^2(M_p)\left(\frac{1}{n_1} + \frac{1}{n_j}\right)}}\sim\mathcal{T}(n-p)\] où \[S^2_{(M_p)} = \frac{SCR(M_p)}{n-p}\]
On retrouve la statistique de test de Student de comparaison de deux moyennes.
3.8 Interprétation du test de Student dans l’exemple
- Test de \(H_0 : \beta = 0\) contre \(H_1 : \beta \neq 0\)
\(\iff H_0 :\mu_1 = 0\) contre \(H_1 : \mu_1 \neq 0\)
Est-ce que le groupe de référence a une moyenne significativement différente de 0 ?
- Test de \(H_0 : \alpha_2 = 0\) contre \(H_1 : \alpha_2 \neq 0\)
\(\iff H_0 :\mu_2 - \mu_1 = 0\) contre \(H_1 : \mu_2- \mu_1 \neq 0\)
Est-ce que le groupe 2 a une moyenne significativement différente du groupe de référence ?
- Test de \(H_0 : \alpha_3 = 0\) contre \(H_1 : \alpha_3 \neq 0\)
\(\iff H_0 :\mu_3 - \mu_1 = 0\) contre \(H_1 : \mu_3 - \mu_1 \neq 0\)
Est-ce que le groupe 3 a une moyenne significativement différente du groupe de référence ?
3.9 Test sur R
Par défaut c’est le premier facteur qui est le groupe de référence dans R
mod_c1 <- lm(Diff_poid~Diet, diet)
summary(mod_c1)
Call:
lm(formula = Diff_poid ~ Diet, data = diet)
Residuals:
Min 1Q Median 3Q Max
-5.3680 -1.4420 0.1759 1.6519 5.7000
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 3.3000 0.4840 6.818 2.26e-09 ***
Diet2 -0.0320 0.6776 -0.047 0.96246
Diet3 1.8481 0.6652 2.778 0.00694 **
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared: 0.1285, Adjusted R-squared: 0.1047
F-statistic: 5.383 on 2 and 73 DF, p-value: 0.006596
- Le Régime 1 fait gagner en moyenne de 3.3kg, ce qui est significativement différent de 0.
- L’écart entre le Régime 1 et 2 vaut en moyenne -0.03kg et n’est pas significativement différent de 0 : les régimes 1 et 2 ont des espérance semblable.
- L’écart entre le Régime 1 et 3 vaut en moyenne 1.8481kg, cet écart est significativement différent de 0.
Conclusion : Comparé au régime 1 , le régime 2 n’est pas significativement différent, et le régime 3 fait gagner plus de poids.