Probabilités et statistiques : le hasard maîtrisé, la société mesurée
Notion
8 min de lecture1654 - aujourd'huiUn sondage annonce 52 % pour un candidat « à plus ou moins 3 points » ; un médecin dit qu'un dépistage est « fiable à 99 % » ; un assureur fixe une prime ; un juré doit évaluer une preuve ADN : partout, la vie moderne demande de raisonner sur l'incertain. Les probabilités (la théorie mathématique du hasard) et les statistiques (la science des données) sont les outils de ce raisonnement, et l'ignorance de leurs principes est l'une des sources les plus courantes d'erreurs, de manipulations et d'injustices.
Les deux disciplines ont des origines distinctes. Les probabilités naissent en 1654 de la correspondance entre Pascal et Fermat sur les jeux de hasard, puis se développent avec Bernoulli (la loi des grands nombres, 1713), Laplace (1812) et Gauss (la courbe « en cloche », loi normale), avant d'être axiomatisées par Kolmogorov en 1933. Les statistiques viennent de l'État (statistik, la science de l'État) : recensements, tables de mortalité (Graunt, 1662), puis, au XIXe siècle, ambition de faire une « physique sociale » avec Quetelet et son « homme moyen » (1835). Les deux se rejoignent avec la statistique inférentielle (Fisher, Neyman, Pearson, années 1920-1930) : tirer d'un échantillon des conclusions sur une population, avec une marge d'erreur calculée.Le XXe siècle en fait l'infrastructure de la décision publique et privée : sondages (Gallup, 1936), essais cliniques randomisés (1948), contrôle qualité, économétrie, et aujourd'hui big data et intelligence artificielle, qui sont des statistiques à très grande échelle. Elles nourrissent aussi une méfiance tenace : « il y a trois sortes de mensonges : les mensonges, les sacrés mensonges et les statistiques ». Pour le candidat, le sujet croise mathématiques, épistémologie, sociologie et esprit critique, et il est une compétence citoyenne autant qu'un objet de culture.Définition
La probabilité d'un événement est un nombre entre 0 et 1 qui mesure sa chance de se produire. Deux interprétations coexistent : fréquentiste (la probabilité est la fréquence limite de l'événement quand on répète l'expérience un grand nombre de fois) et bayésienne (la probabilité est un degré de croyance, révisé à mesure que l'on reçoit des informations, selon le théorème de Bayes, 1763). Le calcul des probabilités est la théorie mathématique qui en découle, axiomatisée par Kolmogorov (1933).La statistique est la science de la collecte, du traitement et de l'interprétation des données. La statistique descriptive résume des données (moyenne, médiane, écart-type, graphiques) ; la statistique inférentielle utilise les probabilités pour tirer des conclusions sur une population à partir d'un échantillon, avec une marge d'erreur et un niveau de confiance. Un sondage est une enquête sur un échantillon représentatif ; sa précision dépend de la taille de l'échantillon (environ 1 000 personnes pour ± 3 points), non de celle de la population.La loi des grands nombres (Jacques Bernoulli, 1713) affirme que la moyenne d'un grand nombre de tirages indépendants se rapproche de l'espérance : c'est ce qui rend le hasard prévisible en masse (le casino gagne toujours à long terme, l'assureur peut calculer ses primes). La loi normale (Gauss, Laplace) décrit la répartition « en cloche » que suivent de nombreuses grandeurs (tailles, erreurs de mesure) : c'est le pont entre le hasard individuel et la régularité collective, popularisé par Quetelet avec l'« homme moyen ».La corrélation mesure le lien statistique entre deux variables ; elle n'implique pas la causalité : la vente de glaces et les noyades sont corrélées (par l'été), sans que l'une cause l'autre. C'est la distinction la plus importante et la plus souvent violée.
Contexte
Le hasard a longtemps été pensé comme le domaine des dieux ou de la Fortune, indigne de la science ; les dés et les cartes existent depuis l'Antiquité, mais leur mathématique attend 1654. Pascal et Fermat résolvent le problème des partis ; Huygens (1657) écrit le premier traité ; Jacques Bernoulli (Ars conjectandi, posthume, 1713) démontre la loi des grands nombres et imagine l'application à la « morale et la politique ». Au XVIIIe siècle, les probabilités servent aux rentes viagères, à l'inoculation (D'Alembert contre Daniel Bernoulli, 1760) et à la justice (Condorcet, Essai sur la probabilité des décisions rendues à la pluralité des voix, 1785). Laplace (Théorie analytique des probabilités, 1812) en fait une science achevée et formule le déterminisme (« le démon de Laplace ») : le hasard n'est que l'expression de notre ignorance.La statistique naît ailleurs : John Graunt dresse en 1662 les premières tables de mortalité à partir des registres de Londres ; les États des Lumières multiplient les recensements ; Napoléon crée un bureau de statistique (1800). Le Belge Adolphe Quetelet (Sur l'homme et le développement de ses facultés, ou Essai de physique sociale, 1835) découvre que les crimes, les mariages, les suicides se répètent avec une régularité de loi naturelle et invente l'« homme moyen » ; Durkheim s'en inspirera pour Le Suicide (1897). Galton (cousin de Darwin) invente la régression et la corrélation (1886), Karl Pearson les tests, avec un arrière-plan eugéniste qui fait aujourd'hui débat.Les années 1920-1950 fondent la statistique moderne : Ronald Fisher (plans d'expérience, tests de signification, 1925 ; l'expérience de la « dame qui goûte le thé »), Neyman et Pearson (intervalles de confiance), Kolmogorov (axiomes, 1933), puis le premier essai clinique randomisé (streptomycine, 1948), les sondages électoraux (Gallup prédit Roosevelt en 1936 contre le sondage géant mais biaisé du Literary Digest). L'Insee est créée en 1946. Depuis les années 2000, l'informatique transforme la statistique en data science : apprentissage automatique, big data, algorithmes de recommandation, et une « crise de la reproductibilité » en sciences (2011-2015) liée au mésusage des tests.
Mécanismes
- Le dénombrement : la probabilité élémentaire est le rapport des cas favorables aux cas possibles, quand ceux-ci sont équiprobables (un dé : 1/6). Les combinaisons (triangle de Pascal) permettent de compter les cas complexes.
- L'indépendance et la loi des grands nombres : si les tirages sont indépendants, les fréquences convergent vers les probabilités. D'où le paradoxe : le hasard est imprévisible à l'unité et prévisible en masse. D'où aussi l'« illusion du joueur » : après dix « rouge », le noir n'est pas plus probable.
- L'échantillonnage : un échantillon aléatoire de taille suffisante représente la population avec une marge d'erreur en 1/√n : 1 000 personnes donnent ± 3 points, 10 000 en donnent ± 1. Les sondages français utilisent la méthode des quotas (échantillon construit pour ressembler à la population selon sexe, âge, CSP, région).
- Le test statistique : on suppose une hypothèse (« le médicament n'a pas d'effet ») et on calcule la probabilité d'observer les données si elle était vraie (valeur-p) ; en dessous d'un seuil (5 %), on la rejette. Le seuil est conventionnel et le résultat souvent mal compris (une valeur-p n'est pas la probabilité que l'hypothèse soit vraie).
- Le raisonnement bayésien : on révise une probabilité initiale à la lumière d'une observation. Exemple classique : un test à 99 % fiable pour une maladie touchant 1 personne sur 10 000 donne, en cas de résultat positif, moins de 1 % de chance d'être malade, parce que les faux positifs sont plus nombreux que les vrais malades.
- La visualisation et ses pièges : échelles tronquées, moyennes sans dispersion, corrélations sans cause, échantillons biaisés (le Literary Digest interrogeait des propriétaires de téléphones en 1936). Savoir lire un graphique est une compétence statistique de base.
Enjeux & débats
1) Le hasard existe-t-il ? Pour Laplace, le hasard n'est qu'ignorance : une intelligence connaissant toutes les positions et vitesses prévoirait tout. La mécanique quantique (années 1920) introduit un hasard fondamental (Einstein : « Dieu ne joue pas aux dés »), et la théorie du chaos (Lorenz, 1963, « l'effet papillon ») montre que des systèmes déterministes sont pratiquement imprévisibles. Le hasard est-il dans le monde ou dans notre tête ? Le débat fréquentiste/bayésien en est la version mathématique.2) La statistique, science de l'État ou outil d'émancipation ? Michel Foucault et Alain Desrosières (La Politique des grands nombres, 1993) ont montré que la statistique est une technologie de gouvernement : recenser, catégoriser, normaliser (l'« homme moyen », les « populations à risque »). Elle sert aussi la critique sociale : sans l'Insee, pas de mesure des inégalités ; Thomas Piketty a bâti son œuvre sur des séries statistiques. La question est celle de l'indépendance des statisticiens (Insee) face au pouvoir et de l'accès aux données.3) Mentir avec les statistiques. La formule attribuée à Disraeli (« mensonges, sacrés mensonges et statistiques ») et le livre de Darrell Huff (Comment mentir avec les statistiques, 1954) rappellent que les chiffres se manipulent : choix de la base, du périmètre, de l'échelle, corrélations trompeuses, sondages biaisés. La réponse n'est pas le rejet des chiffres mais la culture statistique : une démocratie a besoin de citoyens capables de lire un intervalle de confiance.4) Les sondages font-ils l'élection ? On leur reproche d'influencer les électeurs (vote utile, effet bandwagon), de rater des résultats (Brexit et Trump en 2016, quoique les marges d'erreur soient souvent oubliées), et d'orienter la campagne. La France interdit leur publication la veille du scrutin ; d'autres pays vont plus loin. Le débat porte sur la mesure de l'opinion comme construction (Bourdieu, « L'opinion publique n'existe pas », 1973).5) La crise de la reproductibilité. Une grande partie des résultats publiés en psychologie, en médecine, en économie ne se reproduisent pas (projet de réplication en psychologie, 2015 : 36 % seulement). Cause principale : le mésusage des tests (« p-hacking », petits échantillons). La statistique est en cause, mais elle est aussi le remède (pré-enregistrement, transparence des données).
Exemples
- La loi des grands nombres (Bernoulli, 1713) : Jacques Bernoulli met vingt ans à démontrer que la fréquence converge vers la probabilité ; il y voit une loi « morale » applicable aux affaires humaines.
- Quetelet et l'homme moyen (1835) : le tour de poitrine de 5 738 soldats écossais suit une courbe en cloche ; les statistiques criminelles se répètent d'année en année ; Quetelet fonde la « physique sociale » et l'indice de masse corporelle (IMC) porte toujours son nom.
- Le *Literary Digest* contre Gallup (1936) : le magazine interroge 2,4 millions de lecteurs et prédit la défaite de Roosevelt ; Gallup, avec 50 000 personnes bien choisies, prédit sa victoire ; naissance du sondage scientifique et leçon sur les biais d'échantillonnage.
- La dame qui goûte le thé (Fisher, 1935) : une dame affirme reconnaître si le lait a été versé avant ou après le thé ; Fisher conçoit une expérience à huit tasses pour tester son affirmation ; exemple fondateur du test statistique et du plan d'expérience.
- L'essai randomisé de la streptomycine (1948) : premier essai clinique tirant au sort les patients traités et non traités ; devient la norme de la « médecine fondée sur les preuves » ; le prix Nobel d'économie 2019 (Duflo, Banerjee, Kremer) récompense son transfert à l'économie du développement.
- L'affaire Sally Clark (1999-2003) : mère britannique condamnée pour le meurtre de ses deux bébés sur la foi d'un expert affirmant qu'une double mort subite avait 1 chance sur 73 millions (calcul erroné supposant l'indépendance) ; libérée après la mobilisation des statisticiens ; cas d'école du « sophisme du procureur ».
- La pandémie de Covid-19 (2020-2022) : courbes épidémiques, taux de reproduction R, efficacité vaccinale, essais en double aveugle ; jamais la culture statistique n'a été aussi nécessaire ni ses lacunes aussi visibles.
Pièges & confusions
- Confondre probabilités et statistiques : les premières vont de la théorie aux fréquences attendues, les secondes des données observées aux conclusions.
- Prendre la corrélation pour une cause : l'erreur la plus fréquente en dissertation comme dans la presse ; cherchez la variable cachée.
- Croire qu'un grand échantillon garantit la justesse : le Literary Digest avait 2,4 millions de réponses biaisées ; la représentativité compte plus que la taille.
- L'illusion du joueur : le hasard n'a pas de mémoire ; une pièce n'est jamais « due ».
- Confondre moyenne et médiane : le salaire moyen en France est supérieur au salaire médian parce que les hauts revenus tirent la moyenne ; utiliser l'une pour l'autre est un contresens ou une manipulation.
Usage concours / oral
Ce sujet est utile bien au-delà des mathématiques : sur le hasard, la décision, la vérité, l'opinion, la mesure, l'égalité (comment mesure-t-on les inégalités ?), et pour toute épreuve où l'on vous donne des chiffres à commenter. La distinction corrélation/causalité et la différence moyenne/médiane sont deux réflexes qui, bien placés, signalent immédiatement un esprit critique.Les repères à retenir : 1654 (Pascal-Fermat), 1713 (loi des grands nombres), 1835 (Quetelet, l'homme moyen), 1936 (Gallup contre le Literary Digest), 1948 (premier essai randomisé). L'affaire Sally Clark et le paradoxe du test médical (99 % fiable, moins de 1 % de malades parmi les positifs) sont des exemples qui marquent un jury et illustrent la puissance et les pièges du raisonnement probabiliste.Pour la réflexion, Laplace (le hasard comme ignorance) contre la mécanique quantique et le chaos donne un débat philosophique solide ; Desrosières et Foucault (la statistique comme pouvoir) permettent une approche critique sans tomber dans le rejet des chiffres. À l'oral, on vous demandera peut-être si vous croyez aux sondages ou comment vous lisez un graphique : répondez en technicien modeste (marge d'erreur, échantillon, méthode des quotas) et en citoyen (la statistique publique indépendante est un bien commun).
Sources
Questions d'oral
1Quelle différence entre probabilités et statistiques ?2Qu'est-ce que la loi des grands nombres et pourquoi le casino gagne-t-il toujours ?3Pourquoi un sondage de 1 000 personnes peut-il représenter 50 millions d'électeurs ?4Pourquoi corrélation n'est-elle pas causalité ? Donnez un exemple.5Le hasard existe-t-il vraiment ?
+ 2 autres questions
Continuez votre exploration
Fiches du même thème
- Qu'est-ce que les mathématiques ? Du comptage à la science des structures8 min
- Pythagore, Euclide, Archimède : le miracle grec de la démonstration8 min
- Le XVIIe siècle : Descartes, Pascal, Newton et la mathématisation du monde8 min
- L'infini et la crise des fondements : Cantor, Hilbert, Gödel8 min
