Leçon 2 · Débutant · 15 min
Comment répond ChatGPT : prédiction de tokens et probabilités
Comprendre le moteur de prédiction de tokens de ChatGPT : probabilités statistiques, attention et mécanismes causant les hallucinations factuelles.
- Objectif
- Vous saurez analyser le comportement probabiliste de ChatGPT pour neutraliser ses inventions factuelles grâce à des contraintes de cadrage.
- Compétences
- Vérifier

Votre première tentative, sans aide
Demandez à ChatGPT de deviner la suite d'un proverbe rare en lui interdisant d'inventer s'il n'est pas certain.
ChatGPT fonctionne comme un moteur prédictif probabiliste qui calcule à chaque étape le fragment de mot suivant le plus plausible. Cette mécanique lui confère une excellente syntaxe mais aucune conscience de la vérité factuelle. En l'absence de documents ou de consignes strictes, il compense les manques par des inventions séduisantes appelées hallucinations. La solution consiste à toujours lui fournir la matière première et à autoriser explicitement le refus d'extrapolation.
1La mécanique statistique de prédiction mot par mot
La mécanique statistique de prédiction mot par mot explique pourquoi ChatGPT s'exprime avec une fluidité remarquable tout en commettant parfois des erreurs grossières. Le modèle segmente le texte en unités statistiques nommées tokens et évalue des distributions de probabilité.
À chaque instant, le réseau de neurones analyse la fenêtre contextuelle active et sélectionne la continuation la plus cohérente sur le plan syntaxique et sémantique. S'il ne dispose pas de la source exacte dans son contexte, il assemble des bribes crédibles issues de ses paramètres d'entraînement. C'est l'origine directe des hallucinations factuelles.
Concept clé Rôle dans ChatGPT Conséquence pratique Bon réflexe professionnel Tokenisation Découpe le texte en blocs de lettres Consommation variable selon la langue Surveiller la taille des contextes Distribution de probabilité Détermine le prochain token plausible Fluidité stylistique sans ancrage réel Demander des citations précises Hallucination plausible Comblement des lacunes de mémoire Réponses fausses très convaincantes Imposer la règle « Ne pas deviner » Attention contextuelle Pondère l'importance des mots précédents Meilleure écoute des débuts et fins Placer les consignes clés aux extrémités 

Schéma de la prédiction de tokensSchéma généré par IA et relu 2Empêcher l'invention de références juridiques fictives
Empêcher l'invention de références juridiques fictives évite de fonder des décisions d'entreprise sur des textes imaginés par le modèle probabiliste.
Une juriste interroge ChatGPT sur les sanctions applicables à un manquement réglementaire spécifique.
Prompt faible.
Donne-moi les trois derniers arrêts de cassation condamnant une entreprise pour non-respect de la clause de mobilité en 2024 avec les numéros de pourvoi.ChatGPT invente trois numéros de pourvoi parfaitement crédibles avec des dates cohérentes, mais dont les arrêts n'ont jamais existé.
Prompt fort.
Contexte : Recherche documentaire juridique. Tâche : À partir de l'extrait de code du travail ci-dessous [coller texte officiel], liste les conditions de validité d'une clause de mobilité. Règle absolue : Si tu ne disposes pas de la jurisprudence officielle dans le texte fourni, écris : Jurisprudence non disponible dans l'extrait. N'invente aucun numéro d'arrêt.Ce qui change. La clause négative interdit formellement au modèle de combler le vide documentaire par des numéros statistiques fictifs.
3Provoquer une hallucination puis la neutraliser par la contrainte
Provoquer une hallucination puis la neutraliser par la contrainte vous apprend à observer concrètement la bascule entre génération libre incontrôlée et restitution rigoureuse de sources vérifiées.
Soumettez à ChatGPT une question piège sur un prétendu traité international imaginaire (par exemple le protocole de Lisbonne de 2023 sur les congés sabbatiques dans l'hôtellerie).
Observez sa réponse initiale sans filtre, puis relancez la session avec cette instruction de cadrage :
« Tu es un documentaliste rigoureux. Analyse l'existence du protocole mentionné. Si aucune source officielle primaire n'atteste son existence dans tes données de référence, écris simplement : Traité non attesté dans le corpus officiel. »
Grille d'auto-évaluation : (a) la première réponse met en évidence la tendance au conformisme complaisant ; (b) la seconde instruction force l'examen critique ; (c) le modèle conclut par le refus de valider une fiction.
4Croire que la fluidité grammaticale garantit l'exactitude factuelle
Croire que la fluidité grammaticale garantit l'exactitude factuelle incite à valider sans relecture des synthèses erronées mais remarquablement rédigées.
Un consultant reprend textuellement une analyse sectorielle produite par ChatGPT, séduit par un ton académique impeccable et des pourcentages précis. Lors de la présentation au client, l'équipe découvre que les chiffres de parts de marché résultent d'une interpolation statistique sans lien avec la réalité économique du secteur.
Correction : isolez chaque affirmation chiffrée ou référence nominative et exigez la citation directe de la source primaire vérifiable.
Règle à retenir : une grammaire parfaite masque les pires inventions statistiques d'un grand modèle de langage.
5Quiz
Trois questions, correction immédiate. Le retour explique chaque option.
6Preuve de maîtrise
Construisez une requête demandant une information rare, testez-la sans contrainte pour observer l'invention, puis appliquez la clause de sécurité pour obtenir un constat d'absence.
Cette leçon compte pour le badge DébutantVoir les quatre badges
Critères
Ce que vous écriviez au début de la leçon
Pour aller plus loin
Retrouvez les définitions de token, hallucination et contexte. Pour structurer vos requêtes de manière infaillible, passez à la leçon Écrire un bon prompt ChatGPT : méthode ROCC et cadrage. Découvrez aussi la leçon intermédiaire Chasse aux hallucinations dans ChatGPT.
Questions fréquentes
Qu'est-ce qu'un token dans ChatGPT ?
Un token est un fragment de mot composé d'environ 3 à 4 caractères en français. Le modèle lit et génère les textes sous forme de suites de tokens.
Pourquoi ChatGPT affirme-t-il des faits faux avec assurance ?
Le modèle cherche la séquence de mots la plus vraisemblable selon ses statistiques d'apprentissage, sans disposer d'une base de vérité factuelle autonome.
Comment forcer ChatGPT à admettre son ignorance ?
Ajoutez explicitement la clause de sécurité : « Si l'information ne figure pas dans le document fourni, réponds uniquement : Donnée non trouvée ».