Les grands modèles de langage et la question du sens : de Turing à ChatGPT

    Science/Théorie
    8 min de lecture1950 – aujourd'hui

    Depuis 2022, des machines produisent un langage fluide, cohérent et souvent juste, sans grammaire explicite ni compréhension évidente : les grands modèles de langage prédisent le mot suivant à partir de milliards de textes. Comprennent-ils ? Le test de Turing, la chambre chinoise de Searle et le « perroquet stochastique » de Bender encadrent le débat. Pour la linguistique, c'est une révolution : la question de l'inné, du sens et de la référence est posée à neuf, et l'usage du langage humain lui-même change.

    Définition

    Un grand modèle de langage (LLM, large language model) est un réseau de neurones artificiels, fondé sur l'architecture Transformer (Google, 2017), entraîné sur des corpus de textes gigantesques (des milliers de milliards de mots) à une tâche unique : prédire le mot suivant (plus précisément le token, fragment de mot). Cette tâche simple, appliquée à une échelle massive (des centaines de milliards de paramètres), produit une capacité générale à résumer, traduire, raisonner, coder et dialoguer. Une phase d'alignement (apprentissage par renforcement à partir de retours humains) rend le modèle utile et poli. Ses défauts structurels : les hallucinations (énoncés faux mais plausibles), les biais des données, l'absence de mémoire durable et d'accès direct au monde.
    Trois notions philosophiques encadrent le débat :
    • le test de Turing (1950) : si un juge ne distingue pas la machine d'un humain par écrit, la machine « pense » ; critère comportemental ;
    • la chambre chinoise (John Searle, 1980) : un homme qui manipule des symboles chinois selon un manuel, sans les comprendre, produit des réponses correctes ; la syntaxe (manipulation de formes) ne suffit pas à la sémantique (le sens) ;
    • l'ancrage (symbol grounding, Harnad, 1990) : un symbole n'a de sens que rattaché à une expérience du monde ; un modèle nourri de textes seuls n'a que des mots renvoyant à des mots.
    Le perroquet stochastique (Emily Bender et al., 2021) désigne un système qui recombine des formes linguistiques selon des probabilités sans intention ni compréhension.

    Contexte

    Le rêve d'une machine parlante est ancien (le Turc mécanique, Vaucanson) ; Alan Turing le rend scientifique en 1950 (« Computing Machinery and Intelligence ») en remplaçant la question « les machines pensent-elles ? » par un jeu d'imitation. Le premier dialogueur, ELIZA (Joseph Weizenbaum, 1966), simule un psychothérapeute en reformulant les phrases de l'utilisateur ; son auteur est effrayé de voir des gens se confier à elle (« effet ELIZA »). L'IA symbolique des années 1970-1980 tente de coder les règles de la langue (grammaires formelles, inspirées de Chomsky) et échoue devant la complexité et l'ambiguïté du langage naturel.
    Le tournant statistique (années 1990, IBM : « chaque fois que je licencie un linguiste, les performances augmentent », Frederick Jelinek) remplace les règles par l'apprentissage sur corpus. Les plongements de mots (word embeddings, word2vec, 2013) représentent chaque mot par un vecteur tel que « roi » moins « homme » plus « femme » donne « reine » : le sens devient position dans un espace, réalisation de l'intuition saussurienne que le sens est différentiel et de l'hypothèse distributionnelle (« on connaît un mot par ses fréquentations », Firth, 1957). Le Transformer (2017) et son mécanisme d'attention permettent de traiter le contexte long ; GPT-2 (2019), GPT-3 (2020) montrent que la taille change la nature des capacités (émergence) ; ChatGPT (30 novembre 2022) atteint 100 millions d'utilisateurs en deux mois, suivi de Claude, Gemini, Llama, Mistral (champion français), DeepSeek (Chine, 2025).
    La linguistique réagit : Chomsky (New York Times, mars 2023) juge ces modèles inutiles pour comprendre le langage humain, puisqu'ils apprennent aussi bien des langues impossibles que possibles ; d'autres (Steven Piantadosi, 2023) y voient la réfutation de la grammaire universelle ; les travaux de « linguistique des modèles » testent leurs connaissances grammaticales et trouvent des compétences réelles mais fragiles. Le prix Nobel de physique 2024 (Hinton, Hopfield) consacre les réseaux de neurones ; le règlement européen sur l'IA (2024) encadre les modèles à usage général.

    Mécanismes

    Comment un modèle « comprend » un mot. Il n'a accès qu'à des cooccurrences : « chien » apparaît près de « aboie », « laisse », « fidèle ». En compressant des milliards de contextes, il construit une représentation qui capture une grande part de ce que les humains savent des chiens, sans jamais en avoir vu un. C'est une sémantique distributionnelle poussée à l'extrême : le sens est entièrement dans le réseau des mots. Les modèles multimodaux (texte + image + son) tentent de répondre au problème de l'ancrage.
    Ce que les modèles réussissent. Grammaire, style, registres, traduction, résumé, reformulation, dialogue, code, questions de culture générale ; ils réussissent le baccalauréat, le barreau américain, des examens de médecine. Ils sont d'excellents modèles de la forme linguistique.
    Ce qu'ils ratent. Les faits (hallucinations : ils inventent des références, des citations, des dates), le raisonnement long et la planification (améliorés mais fragiles), la nouveauté radicale, l'humour fin, la cohérence sur la durée, et surtout la référence : ils ne savent pas de quoi ils parlent au sens où ils n'ont ni corps, ni perception, ni intention. Leur « confiance » est une propriété statistique, non un jugement. Comme le résume Bender, ils produisent du texte, non du sens, et c'est le lecteur humain qui projette le sens (effet ELIZA à grande échelle).
    Ce qu'ils changent pour la linguistique. Ils montrent qu'une grammaire complexe peut être apprise à partir des seules données (argument contre la pauvreté du stimulus, mais avec cent mille fois plus de données qu'un enfant) ; ils fournissent des outils d'analyse de corpus sans précédent ; ils font de la traduction, de la correction et de la production de texte des tâches banales. Ils posent aussi la question de l'homogénéisation : un style standard, des tournures récurrentes, une langue « moyenne » qui pourrait à son tour contaminer l'écrit humain.

    Enjeux & débats

    1) Comprennent-ils ? Trois positions. Les sceptiques (Searle, Bender, Chomsky) : manipulation de formes, aucune compréhension. Les fonctionnalistes (Dennett, une partie des chercheurs en IA) : si le comportement est indiscernable, la question de la compréhension « intérieure » est vide ; il n'y a pas de fantôme dans la machine humaine non plus. Les intermédiaires (Melanie Mitchell) : les modèles ont une forme de compréhension partielle, différente de la nôtre, qu'il faut décrire sans anthropomorphisme ni dénigrement. L'argument de la chambre chinoise a lui-même une réplique classique (« la réponse du système » : c'est la chambre entière, non l'homme, qui comprend).
    2) La fin de la grammaire universelle ? Si une machine apprend le langage par statistiques, l'enfant le peut aussi : c'est la thèse empiriste renforcée. Chomsky répond que l'enfant apprend avec des données infimes et n'apprendrait pas une langue « impossible », ce que le modèle fait sans peine : le modèle n'est donc pas une théorie de la faculté humaine. Le débat porte au fond sur ce qu'est une explication en science cognitive.
    3) Vérité, autorité, confiance. Un producteur de textes plausibles sans rapport à la vérité est un « bullshitter » au sens de Harry Frankfurt (Hicks et al., 2024) ; l'inondation d'Internet par des textes synthétiques menace l'écosystème informationnel (et les données d'entraînement futures, « effondrement du modèle »). Les usages scolaires (dissertations, mémoires) posent la question de ce qu'évaluent les examens : la production de texte ou la pensée ?
    4) Langues et pouvoir. Les modèles sont entraînés majoritairement en anglais ; les langues à faibles ressources sont mal servies, et le style, les valeurs et les références des modèles sont ceux de leurs données (américaines) et de leurs concepteurs. La France et l'Europe (Mistral, Bloom) cherchent une souveraineté linguistique et technique.
    5) L'humain après la machine. Si l'écriture courante est déléguée, que devient la compétence d'écrire, et avec elle celle de penser (l'écriture comme pensée, selon la tradition de Montaigne à Orwell) ? Certains parlent d'une nouvelle « oralité », d'autres d'une occasion de recentrer l'humain sur le jugement, l'intention et la responsabilité, que la machine n'a pas.

    Exemples

    • Turing (1950) : prédit qu'en 2000 une machine tromperait 30 % des juges en cinq minutes ; en 2024, des études rapportent que GPT-4 passe le test à 54 %.
    • ELIZA (1966) : « Parlez-moi de votre mère » ; Weizenbaum publie Puissance de l'ordinateur et raison de l'homme (1976), critique de la confiance dans la machine.
    • La chambre chinoise (1980) : l'expérience de pensée la plus discutée de la philosophie de l'esprit.
    • word2vec (2013) : roi − homme + femme = reine ; Paris − France + Italie = Rome.
    • ChatGPT (30 novembre 2022) : 100 millions d'utilisateurs en deux mois, record d'adoption ; 1 milliard de requêtes hebdomadaires en 2025.
    • Chomsky, « The False Promise of ChatGPT » (mars 2023) : « une immoralité et une banalité du mal » intellectuelles.
    • Les hallucinations judiciaires : en 2023, un avocat new-yorkais cite six affaires inventées par ChatGPT et est sanctionné ; cas répétés depuis.
    • Mistral AI (Paris, 2023) : licorne française, symbole de la souveraineté européenne en IA.

    Pièges & confusions

    • Dire que le modèle « ne fait que » prédire le mot suivant. C'est vrai mécaniquement, mais le « que » cache l'émergence de capacités inattendues ; il faut tenir les deux.
    • Dire que le modèle « comprend » ou « pense » sans guillemets ni précaution. Le jury attend la chambre chinoise et le perroquet stochastique.
    • Croire que ChatGPT est une base de données. Il ne stocke pas de faits mais des probabilités ; d'où les hallucinations.
    • Confondre test de Turing et preuve d'intelligence. Turing proposait un critère pragmatique, non une définition.
    • Ignorer la dimension linguistique. La fiche est là pour montrer que ces modèles sont d'abord une théorie implicite du langage (distributionnelle) qui dialogue avec Saussure, Firth et Chomsky.

    Usage concours / oral

    Sujets où mobiliser cette fiche : « Une machine peut-elle penser ? », « Le langage est-il le propre de l'homme ? », « Qu'est-ce que comprendre ? », « Faut-il avoir peur de l'intelligence artificielle ? », « La vérité a-t-elle encore un avenir ? », « L'école doit-elle interdire ChatGPT ? ». C'est la fiche de linguistique la plus attendue en 2026, et une passerelle vers l'informatique, la philosophie et les médias.
    À l'oral, tenez la chronologie (Turing 1950, ELIZA 1966, Searle 1980, word2vec 2013, Transformer 2017, ChatGPT 2022), le mécanisme (prédire le mot suivant, sémantique distributionnelle), les trois positions sur la compréhension, et le débat Chomsky/empiristes. Un jury vous demandera presque sûrement si vous utilisez ces outils : répondez avec précision (pour quoi, avec quelles vérifications, quelles limites), sans culpabilité ni naïveté.
    Angle d'attaque conseillé : partir de Firth (« on connaît un mot par ses fréquentations », 1957) pour montrer que l'idée au cœur de ChatGPT a soixante-dix ans et vient de la linguistique.

    Sources

    • Alan Turing, Computing Machinery and Intelligence (1950)
    • John Searle, Minds, Brains and Programs (1980)
    • Emily Bender et al., On the Dangers of Stochastic Parrots (2021)
    • Melanie Mitchell, Intelligence artificielle : triomphes et déceptions (2019)
    • Dossier intelligence artificielle

    Questions d'oral

    + 2 autres questions

    Continuez votre exploration