Aller au contenu
QDNAApprendre l'IA, de débutant à expert
EN

Leçon 2 · Débutant · 15 min

Comment répond ChatGPT : prédiction de tokens et probabilités

Comprendre le moteur de prédiction de tokens de ChatGPT : probabilités statistiques, attention et mécanismes causant les hallucinations factuelles.

Objectif
Vous saurez analyser le comportement probabiliste de ChatGPT pour neutraliser ses inventions factuelles grâce à des contraintes de cadrage.
Compétences
Vérifier
Comment répond ChatGPT : prédiction de tokens et probabilités
Illustration générée par IA

Votre première tentative, sans aide

Demandez à ChatGPT de deviner la suite d'un proverbe rare en lui interdisant d'inventer s'il n'est pas certain.

En bref.

ChatGPT fonctionne comme un moteur prédictif probabiliste qui calcule à chaque étape le fragment de mot suivant le plus plausible. Cette mécanique lui confère une excellente syntaxe mais aucune conscience de la vérité factuelle. En l'absence de documents ou de consignes strictes, il compense les manques par des inventions séduisantes appelées hallucinations. La solution consiste à toujours lui fournir la matière première et à autoriser explicitement le refus d'extrapolation.

  1. 1La mécanique statistique de prédiction mot par mot

    La mécanique statistique de prédiction mot par mot explique pourquoi ChatGPT s'exprime avec une fluidité remarquable tout en commettant parfois des erreurs grossières. Le modèle segmente le texte en unités statistiques nommées tokens et évalue des distributions de probabilité.

    À chaque instant, le réseau de neurones analyse la fenêtre contextuelle active et sélectionne la continuation la plus cohérente sur le plan syntaxique et sémantique. S'il ne dispose pas de la source exacte dans son contexte, il assemble des bribes crédibles issues de ses paramètres d'entraînement. C'est l'origine directe des hallucinations factuelles.

    Concept clé Rôle dans ChatGPT Conséquence pratique Bon réflexe professionnel
    Tokenisation Découpe le texte en blocs de lettres Consommation variable selon la langue Surveiller la taille des contextes
    Distribution de probabilité Détermine le prochain token plausible Fluidité stylistique sans ancrage réel Demander des citations précises
    Hallucination plausible Comblement des lacunes de mémoire Réponses fausses très convaincantes Imposer la règle « Ne pas deviner »
    Attention contextuelle Pondère l'importance des mots précédents Meilleure écoute des débuts et fins Placer les consignes clés aux extrémités
    Schéma de la prédiction de tokens : texte découpé en fragments statistiques, calcul de probabilités sur les continuations possibles et sélection du token suivant.Schéma de la prédiction de tokens : texte découpé en fragments statistiques, calcul de probabilités sur les continuations possibles et sélection du token suivant.
    Schéma de la prédiction de tokensSchéma généré par IA et relu
  2. 2Empêcher l'invention de références juridiques fictives

    Empêcher l'invention de références juridiques fictives évite de fonder des décisions d'entreprise sur des textes imaginés par le modèle probabiliste.

    Une juriste interroge ChatGPT sur les sanctions applicables à un manquement réglementaire spécifique.

    Prompt faible.

    Donne-moi les trois derniers arrêts de cassation condamnant une entreprise pour non-respect de la clause de mobilité en 2024 avec les numéros de pourvoi.
    

    ChatGPT invente trois numéros de pourvoi parfaitement crédibles avec des dates cohérentes, mais dont les arrêts n'ont jamais existé.

    Prompt fort.

    Contexte : Recherche documentaire juridique. Tâche : À partir de l'extrait de code du travail ci-dessous [coller texte officiel], liste les conditions de validité d'une clause de mobilité. Règle absolue : Si tu ne disposes pas de la jurisprudence officielle dans le texte fourni, écris : Jurisprudence non disponible dans l'extrait. N'invente aucun numéro d'arrêt.
    

    Ce qui change. La clause négative interdit formellement au modèle de combler le vide documentaire par des numéros statistiques fictifs.

  3. 3Provoquer une hallucination puis la neutraliser par la contrainte

    Provoquer une hallucination puis la neutraliser par la contrainte vous apprend à observer concrètement la bascule entre génération libre incontrôlée et restitution rigoureuse de sources vérifiées.

    Soumettez à ChatGPT une question piège sur un prétendu traité international imaginaire (par exemple le protocole de Lisbonne de 2023 sur les congés sabbatiques dans l'hôtellerie).

    Observez sa réponse initiale sans filtre, puis relancez la session avec cette instruction de cadrage :

    « Tu es un documentaliste rigoureux. Analyse l'existence du protocole mentionné. Si aucune source officielle primaire n'atteste son existence dans tes données de référence, écris simplement : Traité non attesté dans le corpus officiel. »

    Grille d'auto-évaluation : (a) la première réponse met en évidence la tendance au conformisme complaisant ; (b) la seconde instruction force l'examen critique ; (c) le modèle conclut par le refus de valider une fiction.

    Ouvrir le composeur de prompt

  4. 4Croire que la fluidité grammaticale garantit l'exactitude factuelle

    Croire que la fluidité grammaticale garantit l'exactitude factuelle incite à valider sans relecture des synthèses erronées mais remarquablement rédigées.

    Un consultant reprend textuellement une analyse sectorielle produite par ChatGPT, séduit par un ton académique impeccable et des pourcentages précis. Lors de la présentation au client, l'équipe découvre que les chiffres de parts de marché résultent d'une interpolation statistique sans lien avec la réalité économique du secteur.

    Correction : isolez chaque affirmation chiffrée ou référence nominative et exigez la citation directe de la source primaire vérifiable.

    Règle à retenir : une grammaire parfaite masque les pires inventions statistiques d'un grand modèle de langage.

  5. 5Quiz

    Trois questions, correction immédiate. Le retour explique chaque option.

    1. Comment ChatGPT produit-il ses réponses textuelles ?

    2. Quelle consigne réduit le plus efficacement le risque d'hallucination ?

    3. Combien de caractères représente approximativement un token en langue française ?

  6. 6Preuve de maîtrise

    Construisez une requête demandant une information rare, testez-la sans contrainte pour observer l'invention, puis appliquez la clause de sécurité pour obtenir un constat d'absence.

    Badge DébutantCette leçon compte pour le badge DébutantVoir les quatre badges

    Critères

Pour aller plus loin

Retrouvez les définitions de token, hallucination et contexte. Pour structurer vos requêtes de manière infaillible, passez à la leçon Écrire un bon prompt ChatGPT : méthode ROCC et cadrage. Découvrez aussi la leçon intermédiaire Chasse aux hallucinations dans ChatGPT.

Questions fréquentes

Qu'est-ce qu'un token dans ChatGPT ?

Un token est un fragment de mot composé d'environ 3 à 4 caractères en français. Le modèle lit et génère les textes sous forme de suites de tokens.

Pourquoi ChatGPT affirme-t-il des faits faux avec assurance ?

Le modèle cherche la séquence de mots la plus vraisemblable selon ses statistiques d'apprentissage, sans disposer d'une base de vérité factuelle autonome.

Comment forcer ChatGPT à admettre son ignorance ?

Ajoutez explicitement la clause de sécurité : « Si l'information ne figure pas dans le document fourni, réponds uniquement : Donnée non trouvée ».

Sources