Aller au contenu
QDNAApprendre l'IA, de débutant à expert
EN

Leçon 22 · Expert · 20 min

Évaluer un prompt sur un jeu de dix cas

Mesurer un prompt plutôt que le ressentir : dix cas avec réponse attendue, trois passages, une règle modifiée à la fois, et un score comparé.

Objectif
Vous saurez constituer un jeu de dix cas avec réponse attendue, mesurer un prompt sur trois passages et attribuer chaque gain à une modification isolée.
Compétences
Vérifier
Un tableau de dix lignes, une par cas de test, avec la réponse attendue et trois colonnes de résultats cochées ou barrées, à côté d'une fenêtre de Copilot Chat.
Illustration générée par IA

Votre première tentative, sans aide

Prenez un prompt dont vous êtes satisfait et lancez-le trois fois de suite dans Copilot Chat, en conversation neuve, sur trois cas différents. Comptez les fois où le résultat vous convient sans retouche.

En bref.

Un jeu de test est un tableau de dix cas réalistes, chacun avec la réponse attendue écrite avant de lancer quoi que ce soit. Vous passez votre prompt trois fois sur les dix cas, vous comptez les réponses justes, vous modifiez une seule règle, vous recommencez. Le score remplace l'impression. C'est ce qui permet de dire à un collègue « ce prompt réussit neuf cas sur dix » plutôt que « il marche bien ».

  1. 1Dix cas, trois passages, un score au lieu d'un avis

    Anthropic ouvre son guide de prompt engineering par un conseil que peu de gens suivent : définir d'abord un critère de succès et un moyen de le tester, puis seulement travailler le prompt. Sans mesure, chaque modification est un pari, et l'on garde celle qui a plu au dernier essai. Avec dix cas et un score, la discussion change de nature : on compare des chiffres.

    Constituer le jeu demande une heure. Choisissez dix entrées fictives ou anonymisées qui ressemblent aux vraies : six cas ordinaires, trois cas difficiles (deux sujets dans un message, une donnée manquante, une formulation ambiguë) et un cas piège dont la bonne réponse est « non trouvé ». Écrivez la réponse attendue avant tout passage, sinon vous jugerez la réponse de Copilot à son assurance plutôt qu'à sa justesse. Le score est simple : nombre de cas réussis sur dix.

    Pourquoi trois passages ? Parce qu'une même demande produit des réponses différentes d'une fois à l'autre. Wang et ses coauteurs ont construit une méthode entière, l'auto-cohérence, sur cette variabilité : plusieurs passages puis un vote améliorent nettement le résultat. Pour vous, trois passages donnent une fourchette (8, 9, 8) au lieu d'un chiffre trompeur.

    La règle d'or est l'isolement : une seule modification entre deux séries. Si vous changez la règle de doute et ajoutez un exemple en même temps, le gain est réel mais inexplicable. Microsoft recommande d'itérer et de régénérer ; le jeu de test dit lequel des essais garder. Dernier point : faites noter par un pair qui ignore quelle version a produit quelle réponse. Huang et ses coauteurs ont montré que les modèles se corrigent mal sans retour externe ; le même constat vaut pour l'auteur du prompt, trop content de sa dernière version.

    Schéma « Évaluer un prompt sur un jeu de test » : Dix cas réalistes ; Exécuter le prompt ; Noter chaque sortie ; Corriger le prompt ; Rejouer les dix cas. Note : Un prompt est bon quand il réussit huit cas sur dix, pas quand il réussit une foisSchéma « Évaluer un prompt sur un jeu de test » : Dix cas réalistes ; Exécuter le prompt ; Noter chaque sortie ; Corriger le prompt ; Rejouer les dix cas. Note : Un prompt est bon quand il réussit huit cas sur dix, pas quand il réussit une fois
    Schéma « Évaluer un prompt sur un jeu de test »Schéma généré par IA et relu
  2. 2Un classement de messages passé de 5 à 9 sur 10

    Une équipe support veut classer les messages d'une boîte générique dans cinq catégories.

    Prompt faible.

    Classe ces messages par catégorie. Messages : [dix messages fictifs]
    

    Sur trois passages, les scores sont 5/10, 6/10 et 5/10. Copilot invente des catégories différentes à chaque passage, classe un message dans deux catégories et attribue une catégorie au cas piège, qui n'en a aucune.

    Prompt fort.

    Classe chacun des messages ci-dessous dans une seule catégorie parmi : Facturation, Livraison, Réclamation produit, Demande d'information, Autre. Si un message relève de deux catégories, choisis celle qui demande une action et signale-le par un astérisque. Si tu hésites, classe en Autre et explique en cinq mots. Sortie : tableau Numéro, Catégorie, Justification en une phrase. Messages : [dix messages fictifs]
    

    Scores : 8/10, 9/10, 8/10. Les deux cas manqués sont ceux qui mêlent une question de livraison et une réclamation. Une seule modification, « en cas de double sujet, la réclamation l'emporte sur la question », fait monter à 9, 10, 9.

    Ce qui change. Les catégories fermées suppriment l'invention. La règle de doute donne au modèle une sortie honnête au lieu d'une devinette. Le score, mesuré avant et après une modification isolée, prouve que la règle ajoutée est la bonne, et le tableau devient la fiche de test que l'équipe conserve.

  3. 3Mesurez un prompt de tri avant et après une règle

    Prompt de départ, à mesurer puis à améliorer :

    « Résume ce mail client en une phrase et dis si c'est urgent. »

    Rédigez dix mails fictifs, avec pour chacun le résumé attendu et le verdict d'urgence, dont un mail sans aucun élément d'urgence et un mail qui mêle deux demandes. Lancez le prompt trois fois, notez les scores. Ajoutez une seule règle, par exemple la définition de « urgent » (« délai inférieur à 48 heures ou blocage d'une commande »), relancez trois fois, comparez. Le composeur ci-dessous vous aide à formuler la règle de vérification.

    Grille d'auto-évaluation : (a) les dix réponses attendues sont écrites avant le premier passage ; (b) six scores sont notés, trois avant et trois après ; (c) une seule règle a changé, et vous pouvez dire si elle a servi.

    Ouvrir le composeur de prompt

  4. 4Le jeu de test qui ne fait jamais échouer le prompt

    Une responsable support constitue son jeu de dix cas en prenant les dix derniers mails reçus, un mardi matin calme : dix demandes d'information courtes, polies, sur un seul sujet. Le prompt de classement obtient 10, 10 et 10 sur trois passages. Elle le publie dans la bibliothèque avec la mention « fiable ». Le premier jour d'usage réel, un mail qui mêle une réclamation et une question de livraison est classé deux fois, et un mail sans objet identifiable reçoit une catégorie inventée. Ce qu'il fallait voir : un jeu de test ne mesure que ce qu'il contient ; dix cas faciles produisent un score parfait qui ne dit rien de la vraie boîte de réception. Correction : composez le jeu comme la leçon l'indique, six cas ordinaires, trois cas difficiles (deux sujets dans un message, une donnée manquante, une formulation ambiguë) et un cas piège dont la réponse attendue est « Autre » ou « non trouvé ». Ajoutez chaque erreur rencontrée en usage réel au jeu, de sorte qu'un score de 10 sur 10 redevienne difficile à obtenir. Règle à retenir : un jeu de test qui ne fait jamais échouer le prompt ne teste rien.

  5. 5Quiz

    Trois questions, correction immédiate. Le retour explique chaque option.

    1. Pourquoi lancer le même prompt trois fois sur le jeu de test ?

    2. Votre prompt de classification passe de 7/10 à 9/10 après avoir modifié la règle de doute et ajouté un exemple en même temps. Que concluez-vous ?

    3. Un cas du jeu de test demande une date que le document fourni ne contient pas. Quelle réponse attendue inscrivez-vous, d'après la leçon sur la vérification d'une réponse ?

  6. 6Preuve de maîtrise

    Collez le tableau de dix cas avec la réponse attendue, le prompt testé, les scores des trois passages avant et après la modification, et la règle modifiée avec un extrait de réponse avant et après.

    Badge ExpertCette leçon compte pour le badge ExpertVoir les quatre badges

    Critères

Pour aller plus loin

Le jeu de test mesure la version retenue après un méta-prompt et sert de contrôle avant de partager un agent ; il révèle aussi les hallucinations que l'œil laisse passer.

Questions fréquentes

Dix cas, est-ce suffisant ?

Pour un prompt d'équipe, oui : dix cas suffisent à révéler les défauts fréquents, à condition d'y mettre deux ou trois cas difficiles et un cas piège dont la réponse attendue est « non trouvé ». Le jeu grandit ensuite avec chaque erreur rencontrée en usage réel.

Puis-je demander à Copilot de noter lui-même ses réponses ?

Avec prudence. La recherche montre que les modèles se corrigent mal sans retour externe. Copilot peut préremplir la comparaison entre sa réponse et l'attendu ; c'est un humain, de préférence un pair qui ignore quelle version a produit quoi, qui valide le score.

Où conserver le jeu de test ?

Dans un fichier Excel propre, une ligne par cas, à côté de la fiche de bibliothèque du prompt. Copilot Notebooks, ouvert aux utilisateurs de Copilot Chat depuis juin 2026, permet aussi de regrouper le jeu, le prompt et les résultats au même endroit.

Sources