Retour à la fiche
    Question d'oral

    Comment fonctionne un grand modèle de langage ?

    Réponse d'oral

    Un grand modèle de langage fonctionne en apprenant, à partir d’immenses quantités de données, à prédire le token suivant, c’est-à-dire un mot ou un fragment de mot. Pendant son entraînement, il ajuste des milliards de paramètres pour améliorer ses prédictions. Son architecture, appelée Transformer et présentée en 2017, lui permet de tenir compte des relations entre les éléments d’une phrase, même éloignés. Par exemple, dans « Les pommes que Marie a achetées sont… », il peut proposer « mûres » en reliant la fin de la phrase aux pommes. Pour rédiger une réponse, il répète cette opération : chaque fragment produit rejoint le contexte qui sert à calculer la suite.
    À grande échelle, cet apprentissage permet de traduire, résumer, écrire du code et résoudre certains problèmes. Le modèle ne se contente donc pas de recopier des phrases : il apprend des régularités qu’il peut réutiliser dans des situations nouvelles. Un entraînement complémentaire, notamment à partir de préférences humaines, l’aide à suivre les consignes et à éviter certaines réponses dangereuses. Mais produire une suite plausible ne garantit pas qu’elle soit vraie. Le modèle peut inventer une référence bibliographique parfaitement crédible : c’est une hallucination. Des outils de recherche ou de calcul peuvent limiter ces erreurs, sans les supprimer.
    Reste la question du sens. En 1950, Turing propose d’évaluer la machine par sa conversation. En 1980, Searle rappelle, avec la chambre chinoise, que manipuler correctement des symboles ne prouve pas qu’on les comprend. Ces performances invitent donc à préciser ce que nous appelons comprendre : réussir à répondre, ou relier les mots à une expérience du monde ?