Aller au contenu
Se connecter

Statistiques à deux variables

1 cours · 10 exercices corrigés disponibles

Ressources par notion

NotionCoursExercices
Statistiques à deux variablesDisponible10

Fiche de révision

  • Nuage de points : L'ensemble des points (x,y)(x, y) représentant les deux variables pour chaque individu.
  • Point moyen $G(\bar{x}, \bar{y})$ : Le centre de gravité du nuage, calculé avec la moyenne des xx et la moyenne des yy.
  • Droite de régression : La droite y=ax+by = ax + b qui passe le plus près possible de tous les points du nuage.
  • Coefficient de corrélation $r$ : Un nombre entre −1-1 et 11 qui mesure si le nuage est bien aligné. Plus il est proche de 11 ou −1-1, plus le lien est fort.

Statistiques à deux variables

L'idée, c'est de voir si deux choses liées à un même groupe évoluent ensemble. Par exemple, est-ce que plus on révise d'heures, plus on a une bonne note ? On appelle ça l'étude de la corrélation.

Pour ça, on place chaque individu comme un point (x,y)(x, y) dans un graphique. Ce dessin s'appelle le nuage de points. Si les points semblent former une ligne, on peut tracer une droite pour prédire des valeurs futures.

Attention, ce n'est pas parce que deux chiffres montent ensemble que l'un cause l'autre. C'est le piège de la causalité : le nombre de ventes de glaces et les coups de soleil montent ensemble, mais ce n'est pas la glace qui cause le coup de soleil, c'est le soleil.

À retenir

Nuage de points

L'ensemble des points (x,y)(x, y) représentant les deux variables pour chaque individu.

Point moyen $G(\bar{x}, \bar{y})$

Le centre de gravité du nuage, calculé avec la moyenne des xx et la moyenne des yy.

Droite de régression

La droite y=ax+by = ax + b qui passe le plus près possible de tous les points du nuage.

Coefficient de corrélation $r$

Un nombre entre −1-1 et 11 qui mesure si le nuage est bien aligné. Plus il est proche de 11 ou −1-1, plus le lien est fort.

Méthode

  1. Calcule la moyenne des xx et la moyenne des yy pour trouver le point moyen GG
  2. Calcule la pente aa de la droite de régression avec la formule du cours
  3. Trouve l'ordonnée à l'origine bb en utilisant les coordonnées de GG car la droite passe forcément par ce point
  4. Écris l'équation finale y=ax+by = ax + b
  5. Calcule rr pour vérifier si la droite est vraiment utile ou si c'est juste du hasard

Exemple expliqué

On étudie le lien entre l'âge xx et le prix yy de 3 voitures : (2,5000),(4,3000),(6,1000)(2, 5000), (4, 3000), (6, 1000). Trouve l'équation de la droite de régression.

  1. Moyenne de xx : (2+4+6)/3=4(2+4+6)/3 = 4. Moyenne de yy : (5000+3000+1000)/3=3000(5000+3000+1000)/3 = 3000. Le point moyen est G(4,3000)G(4, 3000).

  2. Calcul de la pente aa : on utilise la formule ∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2\frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}. Ici : (2−4)(5000−3000)+(4−4)(3000−3000)+(6−4)(1000−3000)(2−4)2+(4−4)2+(6−4)2=−4000+0−40004+0+4=−80008=−1000\frac{(2-4)(5000-3000) + (4-4)(3000-3000) + (6-4)(1000-3000)}{(2-4)^2 + (4-4)^2 + (6-4)^2} = \frac{-4000 + 0 - 4000}{4 + 0 + 4} = \frac{-8000}{8} = -1000.

  3. On cherche bb avec y=ax+by = ax + b au point GG : 3000=−1000(4)+b3000 = -1000(4) + b, donc 3000=−4000+b3000 = -4000 + b.

  4. On obtient b=7000b = 7000. Bien vu.

L'équation est y=−1000x+7000y = -1000x + 7000

Points à surveiller

  • Confondre le point moyen GG avec un point quelconque du nuage. GG n'est pas forcément un point du tableau.
  • Oublier que rr ne peut jamais dépasser 11 ou être plus petit que −1-1. Si tu trouves 1,21{,}2, c'est qu'il y a une erreur.
  • Croire que si r=0,9r=0{,}9, alors xx provoque yy. C'est une corrélation, pas forcément une cause.

Exercice 1

Pour 25 élèves d'une même école, on a relevé le nombre d'heures xx consacrées chaque semaine à la lecture et la note yy obtenue à un test de vocabulaire. Le nuage de points obtenu a la forme d'une bande étroite dont les points montent de la gauche vers la droite, presque alignés.
Parmi les valeurs suivantes, laquelle est la plus vraisemblable pour le coefficient de corrélation linéaire de ce nuage ? (justifier)

  • r = 0,96
  • r = 0,45
  • r = -0,96
  • r = 1,4
Voir la correction
  1. Le nuage monte de la gauche vers la droite : la relation linéaire est croissante, donc r>0r > 0. On écarte r=−0,96r = -0{,}96.

  2. Les points sont presque alignés, dans une bande étroite : ∣r∣|r| est proche de 11. Une valeur comme 0,450{,}45 correspondrait à un nuage beaucoup plus dispersé.

  3. Le coefficient de corrélation linéaire est toujours compris entre −1-1 et 11 : la valeur 1,41{,}4 est impossible.

r = 0,96

Barème de cet exercice

  • Le sens du nuage (les points montent) justifie que r est positif (1 point)
  • Points presque alignés : la valeur absolue de r est proche de 1, donc r = 0,45 est écarté (1 point)
  • Écarte aussi r = 1,4 (r reste compris entre -1 et 1) et conclut r = 0,96 (1 point)

Exercice 2

Un loueur de vélos de Namur relève, pendant six semaines d'été, la température maximale moyenne xx (en °C) de la semaine et le nombre yy de vélos loués.
Température xx : 12 ; 15 ; 18 ; 21 ; 24 ; 27
Vélos loués yy : 14 ; 21 ; 25 ; 34 ; 38 ; 48
Calculer les coordonnées du point moyen GG de ce nuage. Écrire tous les calculs.

  1. a.

    Abscisse xˉ\bar{x} de GG

  2. b.

    Ordonnée yˉ\bar{y} de GG

Voir la correction
  1. Il y a n=6n = 6 points. Somme des abscisses : 12+15+18+21+24+27=11712 + 15 + 18 + 21 + 24 + 27 = 117, donc xˉ=1176=19,5\bar{x} = \dfrac{117}{6} = 19{,}5.

  2. Somme des ordonnées : 14+21+25+34+38+48=18014 + 21 + 25 + 34 + 38 + 48 = 180, donc yˉ=1806=30\bar{y} = \dfrac{180}{6} = 30.

  3. Le point moyen est G(19,5;30)G(19{,}5 ; 30) : c'est le point par lequel passent les droites d'ajustement du chapitre.

G(19,5 ; 30)

Barème de cet exercice

  • a : Moyenne des abscisses : somme 117 divisée par 6, soit 19,5 (1 point)
  • b : Moyenne des ordonnées : somme 180 divisée par 6, soit 30 (1 point)

Exercice 3

Un club de kayak de Dinant note, pour ses six premiers mois d'activité, le nombre yy de sorties organisées (en dizaines) le mois de rang xx.
Rang du mois xx : 1 ; 2 ; 3 ; 4 ; 5 ; 6
Sorties yy (en dizaines) : 2 ; 4 ; 3 ; 7 ; 6 ; 8
On ajuste ce nuage par la droite de Mayer, en le partageant en deux groupes de trois points (les trois premiers, puis les trois derniers).

  1. a.

    Déterminer les coordonnées du point moyen G1G_1 du premier groupe.

  2. b.

    Déterminer les coordonnées du point moyen G2G_2 du second groupe.

  3. c.

    En déduire l'équation réduite de la droite de Mayer (coefficients sous forme de fractions irréductibles).

  4. d.

    Estimer, à l'aide de cette droite, le nombre de dizaines de sorties au mois de rang 7 (au centième près).

Voir la correction
  1. Points moyens des deux groupes

    Groupe 1 (rangs 11, 22, 33) : G1(1+2+33;2+4+33)=G1(2;3)G_1\left(\dfrac{1+2+3}{3} ; \dfrac{2+4+3}{3}\right) = G_1(2 ; 3).

  2. Groupe 2 (rangs 44, 55, 66) : G2(4+5+63;7+6+83)=G2(5;7)G_2\left(\dfrac{4+5+6}{3} ; \dfrac{7+6+8}{3}\right) = G_2(5 ; 7).

  3. Équation de la droite de Mayer

    Coefficient directeur de (G1G2)(G_1G_2) : a=7−35−2=43a = \dfrac{7 - 3}{5 - 2} = \dfrac{4}{3}. La droite passe par G1G_1 : 3=43⋅2+b3 = \dfrac{4}{3} \cdot 2 + b, donc b=13b = \dfrac{1}{3}. La droite de Mayer est y=43 x+13y = \dfrac{4}{3}\,x + \dfrac{1}{3}.

  4. Contrôle : le point moyen du nuage est G(3,5;5)G(3{,}5 ; 5) et 43⋅3,5+13=5\dfrac{4}{3} \cdot 3{,}5 + \dfrac{1}{3} = 5. La droite passe bien par GG.

  5. Estimation

    Pour x=7x = 7 : y=43⋅7+13=293≈9,67y = \dfrac{4}{3} \cdot 7 + \dfrac{1}{3} = \dfrac{29}{3} \approx 9{,}67, soit environ 9797 sorties au septième mois.

G_1(2 ; 3), G_2(5 ; 7), y = 4/3 x + 1/3, environ 9,67 dizaines de sorties

Barème de cet exercice

  • a : Coordonnées de G1 obtenues par les moyennes des trois premiers points (1 point)
  • b : Coordonnées de G2 obtenues par les moyennes des trois derniers points (1 point)
  • c : Coefficient directeur de (G1G2) calculé avec les deux points moyens (1 point)
  • c : Ordonnée à l'origine et équation de la droite de Mayer (1 point)
  • d : Estimation en x = 7 avec l'équation trouvée (résultat au centième) (1 point)

Exercice 4

Le tableau donne, pour cinq salles de sport de la région liégeoise, le nombre xx d'appareils de musculation (en dizaines) et le nombre yy d'abonnés (en dizaines).
Appareils xx : 2 ; 3 ; 5 ; 6 ; 9
Abonnés yy : 30 ; 41 ; 42 ; 55 ; 68
On veut mesurer la force de la relation linéaire entre xx et yy. Les résultats sont donnés au centième près. Écrire tous les calculs.

  1. a.

    Calculer la covariance de xx et de yy.

  2. b.

    Calculer l'écart type σx\sigma_x.

  3. c.

    Calculer l'écart type σy\sigma_y.

  4. d.

    Calculer le coefficient de corrélation linéaire rr et conclure.

Voir la correction
  1. Moyennes

    n=5n = 5 ; xˉ=255=5\bar{x} = \dfrac{25}{5} = 5 ; yˉ=2365=47,2\bar{y} = \dfrac{236}{5} = 47{,}2.

  2. Covariance et variances

    ∑xiyi=2⋅30+3⋅41+5⋅42+6⋅55+9⋅68=1335\sum x_i y_i = 2 \cdot 30 + 3 \cdot 41 + 5 \cdot 42 + 6 \cdot 55 + 9 \cdot 68 = 1335, donc cov⁡(x,y)=13355−5⋅47,2=31\operatorname{cov}(x, y) = \dfrac{1335}{5} - 5 \cdot 47{,}2 = 31.
    ∑xi2=155\sum x_i^2 = 155, donc V(X)=1555−(5)2=6V(X) = \dfrac{155}{5} - (5)^2 = 6.
    ∑yi2=11 994\sum y_i^2 = 11\,994, donc V(Y)=11 9945−(47,2)2=170,96V(Y) = \dfrac{11\,994}{5} - (47{,}2)^2 = 170{,}96.

  3. Écarts types

    Écarts types : σx=6≈2,45\sigma_x = \sqrt{6} \approx 2{,}45 et σy=170,96≈13,08\sigma_y = \sqrt{170{,}96} \approx 13{,}08.

  4. Coefficient de corrélation

    r=cov⁡(x,y)σx σy=316⋅170,96≈0,97r = \dfrac{\operatorname{cov}(x, y)}{\sigma_x \, \sigma_y} = \dfrac{31}{\sqrt{6} \cdot \sqrt{170{,}96}} \approx 0{,}97.

  5. Conclusion : rr est très proche de 11, la relation linéaire entre xx et yy est forte et positive : un ajustement linéaire est pertinent.

cov(x, y) = 31 ; sigma_x = 2,45 et sigma_y = 13,08 ; r = 0,97

Barème de cet exercice

  • a : Moyennes et somme des produits x_i y_i détaillées (1 point)
  • a : Covariance cov(x, y) = 31 (1 point)
  • b : Variance V(X) (moyenne des carrés moins carré de la moyenne) et écart type sigma_x = 2,45 (1 point)
  • c : Variance V(Y) et écart type sigma_y = 13,08 (1 point)
  • d : Formule r = cov(x, y) / (sigma_x sigma_y) écrite et valeur 0,97 (1 point)
  • d : Conclusion : relation linéaire forte et positive (1 point)

Exercice 5

Un fournisseur d'énergie étudie la consommation annuelle d'électricité yy (en kWh) de 40 logements en fonction de leur surface habitable xx (en m²). Les surfaces vont de 60 m² à 140 m². Un tableur fournit les résultats suivants :
xˉ=96\bar{x} = 96 ; yˉ=3 840\bar{y} = 3\,840 ; V(X)=400V(X) = 400 ; cov⁡(x,y)=3 200\operatorname{cov}(x, y) = 3\,200 ; σy=180\sigma_y = 180.
Écrire tous les calculs.

  1. a.

    Calculer le coefficient de corrélation linéaire.

  2. b.

    Déterminer la droite d'ajustement de yy en xx par la méthode des moindres carrés.

  3. c.

    Estimer la consommation d'un logement de 110 m² (en kWh).

  4. d.

    L'estimation de la consommation d'un logement de 180 m² est-elle une interpolation ou une extrapolation ? (justifier)

Voir la correction
  1. Coefficient de corrélation

    σx=V(X)=400=20\sigma_x = \sqrt{V(X)} = \sqrt{400} = 20, donc r=cov⁡(x,y)σx σy=320020⋅180≈0,89r = \dfrac{\operatorname{cov}(x, y)}{\sigma_x \, \sigma_y} = \dfrac{3200}{20 \cdot 180} \approx 0{,}89. La relation linéaire est forte et positive.

  2. Droite des moindres carrés

    Coefficient directeur : a=cov⁡(x,y)V(X)=3200400=8a = \dfrac{\operatorname{cov}(x, y)}{V(X)} = \dfrac{3200}{400} = 8.

  3. La droite passe par le point moyen (96;3840)(96 ; 3840) : 3840=8⋅96+b3840 = 8 \cdot 96 + b, donc b=3840−768=3072b = 3840 - 768 = 3072. La droite est y=8x+3072y = 8x + 3072.

  4. Estimation

    Pour x=110x = 110 : y=8⋅110+3072=3952y = 8 \cdot 110 + 3072 = 3952 kWh. Comme 60≤110≤14060 \le 110 \le 140, c'est une interpolation.

  5. Pour x=180x = 180, la surface sort de l'intervalle [60;140][60 ; 140] des données : c'est une extrapolation, moins fiable car rien ne garantit que la relation reste linéaire en dehors des données observées.

r = 0,89 ; y = 8x + 3072 ; 3952 kWh ; extrapolation

Barème de cet exercice

  • a : Écart type sigma_x = 20 et formule r = cov / (sigma_x sigma_y) (1 point)
  • a : Valeur r = 0,89 (1 point)
  • b : Coefficient directeur a = cov(x, y) / V(X) = 8 (1 point)
  • b : Droite passant par le point moyen : calcul de b = 3072 (1 point)
  • b : Équation y = 8x + 3072 (1 point)
  • c : Estimation 3952 kWh pour 110 m² (1 point)
  • d : Reconnaît une extrapolation (180 m² est hors de l'intervalle 60 à 140 m²) (1 point)

Exercice 6

Une étude menée dans 50 villes belges relève, entre le nombre de glaces vendues chaque été et le nombre de coups de soleil soignés en pharmacie, un coefficient de corrélation linéaire r=0,87r = 0{,}87. Un journal en conclut que les glaces provoquent les coups de soleil.
Cette conclusion est-elle justifiée ? Expliquer en distinguant corrélation et causalité.

Voir la correction
  1. La valeur r=0,87r = 0{,}87 est proche de 11 : il existe une forte relation linéaire positive entre les deux nombres. Quand les ventes de glaces augmentent, les coups de soleil aussi.

  2. Une corrélation n'est pas une causalité : deux variables peuvent varier ensemble sans que l'une agisse sur l'autre. Manger une glace n'expose à aucun coup de soleil.

  3. Ici une cause commune explique les deux variables : le beau temps. Un été très ensoleillé fait vendre plus de glaces et pousse plus de monde à s'exposer au soleil.

  4. Conclusion : le calcul de rr ne permet pas d'affirmer que les glaces provoquent les coups de soleil. La conclusion du journal n'est pas justifiée.

La conclusion du journal n'est pas justifiée : corrélation n'est pas causalité, une cause commune (le beau temps) explique les deux variables.

Barème de cet exercice

  • r = 0,87 traduit une forte corrélation linéaire positive entre les deux variables (1 point)
  • Précise qu'une corrélation n'est pas une causalité (aucun lien de cause à effet prouvé) (1 point)
  • Identifie une cause commune (ensoleillement, chaleur) qui explique les deux variables (1 point)
  • Conclut que le titre du journal n'est pas justifié (1 point)

Exercice 7

Le tableau ci-dessous donne le nombre de billets vendus (en centaines) par un festival de musique wallon de 2015 à 2021. Le rang xx d'une année est son écart avec 2015 (2015 a pour rang 0).
Rang de l'année xx : 0 ; 1 ; 2 ; 3 ; 4 ; 5 ; 6
Billets vendus yy (en centaines) : 11 ; 15 ; 18 ; 24 ; 21 ; 30 ; 28
Calculer le coefficient de corrélation linéaire, déterminer la droite de régression de yy en xx par les moindres carrés et s'en servir pour estimer le nombre de billets vendus en 2022, puis l'année à partir de laquelle le festival dépasserait 4 000 billets si la tendance se poursuivait. Écrire tous les calculs.

  1. a.

    Coefficient de corrélation linéaire rr

  2. b.

    Droite de régression de yy en xx

  3. c.

    Nombre de billets vendus en 2022 (en centaines)

  4. d.

    Première année où le festival dépasserait 4 000 billets

Voir la correction
  1. Moyennes

    n=7n = 7 ; xˉ=217=3\bar{x} = \dfrac{21}{7} = 3 ; yˉ=1477=21\bar{y} = \dfrac{147}{7} = 21.

  2. Covariance et variances

    ∑xiyi=0⋅11+1⋅15+2⋅18+3⋅24+4⋅21+5⋅30+6⋅28=525\sum x_i y_i = 0 \cdot 11 + 1 \cdot 15 + 2 \cdot 18 + 3 \cdot 24 + 4 \cdot 21 + 5 \cdot 30 + 6 \cdot 28 = 525, donc cov⁡(x,y)=5257−3⋅21=12\operatorname{cov}(x, y) = \dfrac{525}{7} - 3 \cdot 21 = 12.
    ∑xi2=91\sum x_i^2 = 91, donc V(X)=917−(3)2=4V(X) = \dfrac{91}{7} - (3)^2 = 4.
    ∑yi2=3371\sum y_i^2 = 3371, donc V(Y)=33717−(21)2=2847V(Y) = \dfrac{3371}{7} - (21)^2 = \dfrac{284}{7}.

  3. Coefficient de corrélation

    r=cov⁡(x,y)σx σy=124⋅2847≈0,94r = \dfrac{\operatorname{cov}(x, y)}{\sigma_x \, \sigma_y} = \dfrac{12}{\sqrt{4} \cdot \sqrt{\dfrac{284}{7}}} \approx 0{,}94.

  4. Droite de régression

    a=cov⁡(x,y)V(X)=3a = \dfrac{\operatorname{cov}(x, y)}{V(X)} = 3 et b=yˉ−a xˉ=12b = \bar{y} - a\,\bar{x} = 12. La droite de régression de yy en xx est y=3x+12y = 3x + 12.

  5. Estimation pour 2022

    2022 a pour rang 77 : y=3⋅7+12=33y = 3 \cdot 7 + 12 = 33, soit environ 3 3003\,300 billets. Le rang 77 est proche des données : l'extrapolation reste raisonnable si la tendance se poursuit.

  6. Année où 4 000 billets sont dépassés

    4 0004\,000 billets correspondent à y=40y = 40 centaines. 3x+12>40  ⟺  x>283≈9,333x + 12 > 40 \iff x > \dfrac{28}{3} \approx 9{,}33. Le premier rang entier est 1010, soit l'année 2015+10=20252015 + 10 = 2025. Cette extrapolation est très éloignée des données : elle n'est fiable que si la tendance reste linéaire pendant dix ans.

r = 0,94 ; y = 3x + 12 ; 33 centaines de billets en 2022 ; 2025

Barème de cet exercice

  • a : Moyennes, sommes des produits et des carrés détaillées (1 point)
  • a : Covariance et variances calculées (1 point)
  • a : Coefficient de corrélation r = 0,94 (formule écrite) (1 point)
  • b : Coefficient directeur a = cov / V(X) = 3 (1 point)
  • b : Ordonnée à l'origine b = 12 (point moyen sur la droite) (1 point)
  • b : Équation de la droite y = 3x + 12 (1 point)
  • c : Estimation 2022 : rang 7, y = 33 centaines de billets (1 point)
  • d : Résolution de 3x + 12 > 40 (x > 28/3) et année 2025 (1 point)

Exercice 8

Une entreprise de livraison suit, depuis sa création, le nombre yy de colis livrés (en milliers) le mois de rang xx (le premier mois a pour rang 0).
Rang xx : 0 ; 1 ; 2 ; 3 ; 4 ; 5
Colis livrés yy (en milliers) : 18 ; 20 ; 22 ; 29 ; 33 ; 34
On ajuste ce nuage de deux façons : par la droite de Mayer (deux groupes de trois points) et par la droite de régression des moindres carrés. Écrire tous les calculs.

  1. a.

    Déterminer l'équation réduite de la droite de Mayer.

  2. b.

    Déterminer l'équation réduite de la droite de régression de yy en xx (au centième près).

  3. c.

    Estimer, avec la droite de Mayer, le nombre de colis livrés au mois de rang 6 (en milliers).

  4. d.

    Estimer, avec la droite de régression, le nombre de colis livrés au mois de rang 6 (en milliers).

  5. e.

    Calculer le coefficient de corrélation linéaire rr et conclure sur la pertinence de l'ajustement.

Voir la correction
  1. Droite de Mayer

    Groupe 1 (rangs 00, 11, 22) : G1(1;20)G_1(1 ; 20). Groupe 2 (rangs 33, 44, 55) : G2(4;32)G_2(4 ; 32). Coefficient directeur : a=32−204−1=4a = \dfrac{32 - 20}{4 - 1} = 4. La droite passe par G1G_1 : b=20−4⋅1=16b = 20 - 4 \cdot 1 = 16. La droite de Mayer est y=4x+16y = 4x + 16.

  2. Moyennes

    n=6n = 6 ; xˉ=156=2,5\bar{x} = \dfrac{15}{6} = 2{,}5 ; yˉ=1566=26\bar{y} = \dfrac{156}{6} = 26.

  3. Covariance et variances

    ∑xiyi=0⋅18+1⋅20+2⋅22+3⋅29+4⋅33+5⋅34=453\sum x_i y_i = 0 \cdot 18 + 1 \cdot 20 + 2 \cdot 22 + 3 \cdot 29 + 4 \cdot 33 + 5 \cdot 34 = 453, donc cov⁡(x,y)=4536−2,5⋅26=10,5\operatorname{cov}(x, y) = \dfrac{453}{6} - 2{,}5 \cdot 26 = 10{,}5.
    ∑xi2=55\sum x_i^2 = 55, donc V(X)=556−(2,5)2=3512V(X) = \dfrac{55}{6} - (2{,}5)^2 = \dfrac{35}{12}.
    ∑yi2=4294\sum y_i^2 = 4294, donc V(Y)=42946−(26)2=1193V(Y) = \dfrac{4294}{6} - (26)^2 = \dfrac{119}{3}.

  4. Droite de régression

    a=cov⁡(x,y)V(X)=3,6a = \dfrac{\operatorname{cov}(x, y)}{V(X)} = 3{,}6 et b=yˉ−a xˉ=17b = \bar{y} - a\,\bar{x} = 17. La droite de régression de yy en xx est y=3,6x+17y = 3{,}6x + 17.

  5. Coefficient de corrélation

    r=cov⁡(x,y)σx σy=10,53512⋅1193≈0,98r = \dfrac{\operatorname{cov}(x, y)}{\sigma_x \, \sigma_y} = \dfrac{10{,}5}{\sqrt{\dfrac{35}{12}} \cdot \sqrt{\dfrac{119}{3}}} \approx 0{,}98.

  6. Estimations au mois de rang 6

    Avec la droite de Mayer, pour x=6x = 6 : y=4⋅6+16=40y = 4 \cdot 6 + 16 = 40. Avec la droite de régression : y=3,6⋅6+17=38,6y = 3{,}6 \cdot 6 + 17 = 38{,}6. Les deux ajustements donnent des estimations proches, la droite de régression étant un peu plus basse.

  7. Conclusion : rr est très proche de 11, l'ajustement linéaire est pertinent.

Mayer : y = 4x + 16 ; régression : y = 3,6x + 17 ; 40 et 38,6 milliers de colis ; r = 0,98

Barème de cet exercice

  • a : Points moyens G1 et G2 calculés (1 point)
  • a : Coefficient directeur de la droite de Mayer (1 point)
  • a : Ordonnée à l'origine et équation y = 4x + 16 (1 point)
  • b : Covariance, variance de X et coefficient directeur a = 3,6 (1 point)
  • b : Ordonnée à l'origine b = 17 (point moyen) et équation y = 3,6x + 17 (2 points)
  • c : Estimation avec la droite de Mayer : 40 (1 point)
  • d : Estimation avec la droite de régression : 38,6 (1 point)
  • e : Coefficient de corrélation r = 0,98 avec sa formule (1 point)
  • e : Conclusion sur la pertinence de l'ajustement linéaire (1 point)

Exercice 9

Un laboratoire mesure la hauteur yy (en cm) d'une plante en fonction de son âge xx (en semaines). Une tache d'encre rend illisible la mesure de la deuxième semaine.
Âge xx : 1 ; 2 ; 3 ; 4 ; 5. Hauteur yy : 6,6 ; (illisible) ; 11,5 ; 14,2 ; 16,4.
Le compte rendu indique que la droite de régression de yy en xx, obtenue par la méthode des moindres carrés avec les cinq mesures, est y=2,5x+4y = 2{,}5x + 4.

  1. a.

    Justifier que le point moyen du nuage appartient à la droite de régression.

  2. b.

    Calculer la moyenne yˉ\bar{y} des hauteurs mesurées.

  3. c.

    Retrouver la mesure illisible de la deuxième semaine.

  4. d.

    Estimer la hauteur de la plante à 6 semaines (en cm).

Voir la correction
  1. Le point moyen est sur la droite

    La droite des moindres carrés a pour coefficient directeur a=cov⁡(x,y)V(X)a = \dfrac{\operatorname{cov}(x, y)}{V(X)} et pour ordonnée à l'origine b=yˉ−a xˉb = \bar{y} - a\,\bar{x}. On en tire yˉ=a xˉ+b\bar{y} = a\,\bar{x} + b : le point moyen (xˉ;yˉ)(\bar{x} ; \bar{y}) appartient à la droite.

  2. Moyenne de y

    xˉ=1+2+3+4+55=3\bar{x} = \dfrac{1+2+3+4+5}{5} = 3. Donc yˉ=2,5⋅3+4=11,5\bar{y} = 2{,}5 \cdot 3 + 4 = 11{,}5.

  3. Mesure manquante

    Notons y2y_2 la mesure illisible. yˉ=6,6+y2+11,5+14,2+16,45=11,5\bar{y} = \dfrac{6{,}6 + y_2 + 11{,}5 + 14{,}2 + 16{,}4}{5} = 11{,}5, donc 6,6+y2+11,5+14,2+16,4=57,56{,}6 + y_2 + 11{,}5 + 14{,}2 + 16{,}4 = 57{,}5, soit y2+48,7=57,5y_2 + 48{,}7 = 57{,}5 et y2=8,8y_2 = 8{,}8.

  4. À 66 semaines : y=2,5⋅6+4=19y = 2{,}5 \cdot 6 + 4 = 19 cm. Le rang 66 est proche des données : l'estimation est raisonnable.

y_2 = 8,8 cm ; environ 19 cm à 6 semaines

Barème de cet exercice

  • a : Justifie que le point moyen appartient à la droite (b = moyenne de y moins a fois moyenne de x) (2 points)
  • b : Calcule la moyenne de x égale à 3 puis la moyenne de y égale à 11,5 (2 points)
  • c : Écrit l'équation sur la moyenne de y avec l'inconnue y2 (1 point)
  • c : Résout correctement : y2 = 8,8 (2 points)
  • d : Estimation à 6 semaines : 19 cm (1 point)

Exercice 10

Un club d'athlétisme note, pour six coureurs, le nombre xx d'entraînements par semaine et le temps yy (en minutes) gagné sur 10 km après trois mois.
Entraînements xx : 1 ; 2 ; 3 ; 4 ; 5 ; 6
Temps gagné yy (en minutes) : 3 ; 5 ; 6 ; 8 ; 9 ; 3
Le sixième coureur s'est blessé en cours de préparation. Écrire tous les calculs.

  1. a.

    Calculer le coefficient de corrélation linéaire des six coureurs (au centième près).

  2. b.

    Calculer le coefficient de corrélation linéaire des cinq premiers coureurs (au centième près).

  3. c.

    Déterminer la droite de régression des cinq premiers coureurs (au centième près).

  4. d.

    Comparer les deux valeurs de rr, expliquer la différence et dire quelle droite utiliser pour prévoir le gain d'un coureur en bonne santé.

Voir la correction
  1. Avec les six coureurs

    Avec les six coureurs : xˉ=3,5\bar{x} = 3{,}5 et yˉ=173\bar{y} = \dfrac{17}{3}, cov⁡(x,y)=76\operatorname{cov}(x, y) = \dfrac{7}{6}, V(X)=3512V(X) = \dfrac{35}{12}, V(Y)=479V(Y) = \dfrac{47}{9} et r=763512⋅479≈0,30r = \dfrac{\dfrac{7}{6}}{\sqrt{\dfrac{35}{12}} \cdot \sqrt{\dfrac{47}{9}}} \approx 0{,}30.

  2. Sans le sixième coureur

    Sans le sixième coureur (n=5n = 5) : xˉ=3\bar{x} = 3, yˉ=6,2\bar{y} = 6{,}2, cov⁡(x,y)=3\operatorname{cov}(x, y) = 3, V(X)=2V(X) = 2, V(Y)=4,56V(Y) = 4{,}56 et r=32⋅4,56≈0,99r = \dfrac{3}{\sqrt{2} \cdot \sqrt{4{,}56}} \approx 0{,}99.

  3. Droite sans le sixième coureur

    Droite de régression des cinq premiers coureurs : a=32=1,5a = \dfrac{3}{2} = 1{,}5 et b=6,2−1,5⋅3=1,7b = 6{,}2 - 1{,}5 \cdot 3 = 1{,}7, soit y=1,5x+1,7y = 1{,}5x + 1{,}7.

  4. Le point (6;3)(6 ; 3) est très éloigné de la tendance des cinq autres points : c'est une donnée aberrante. Il fait chuter la valeur absolue de rr de 0,990{,}99 à 0,300{,}30 et modifie beaucoup la droite (coefficient directeur 0,400{,}40 au lieu de 1,51{,}5). Un seul point atypique peut masquer une relation linéaire très nette, et rr seul ne suffit pas : il faut aussi regarder le nuage.

  5. Ici, la blessure explique l'écart : le point ne représente pas le même phénomène que les autres. Pour prévoir le gain d'un coureur en bonne santé, on utilisera la droite des cinq premiers coureurs, en précisant la raison de l'exclusion.

r = 0,30 avec les six coureurs ; r = 0,99 sans le sixième ; y = 1,5x + 1,7 ; le point aberrant fait chuter |r|

Barème de cet exercice

  • a : Calcule r pour les six coureurs (covariance et variances détaillées) : 0,30 (1 point)
  • b : Calcule r sans le sixième coureur : 0,99 (1 point)
  • c : Droite de régression sans le sixième coureur : a = 1,5 et b = 1,7 (2 points)
  • d : Repère le sixième point comme donnée aberrante qui fait chuter |r| (1 point)
  • d : Explique que la blessure justifie l'exclusion et que r seul ne suffit pas (regarder le nuage) (1 point)

Programme et consignes

Les consignes dépendent du cycle. Vérifie celles de ton inscription ; les exemples officiels ne couvrent pas tout le programme.