Leçon 19 · Avancé · 20 min
Écrire une grille d'évaluation et la faire appliquer par Copilot
Écrire une grille d'évaluation à critères observables et la faire appliquer par Copilot Chat dans une conversation séparée, puis corriger et mesurer l'écart.
- Objectif
- Vous saurez rédiger une grille de cinq critères observables, la faire appliquer par Copilot Chat à un livrable dans une conversation séparée, appliquer les corrections proposées et mesurer le progrès entre deux versions.
- Compétences
- Vérifier

Votre première tentative, sans aide
Prenez un livrable que vous avez produit avec Copilot Chat et demandez-lui, dans une nouvelle conversation, de le noter sur dix. Regardez la note obtenue, puis demandez-vous ce qu'elle mesure exactement.
Demander « c'est bien ? » à Copilot donne un compliment. Lui donner une grille de cinq critères observables, dans une conversation séparée, donne un verdict par critère, une justification et des corrections applicables. La grille se rédige avant le prompt de production, comme un critère de succès, et se rejoue après correction pour mesurer le progrès. Elle ne remplace pas votre relecture : elle la rend plus rapide et plus régulière.
1Pourquoi un critère doit se constater, pas s'apprécier
Le guide d'Anthropic sur le prompt engineering commence par un conseil que la plupart des utilisateurs sautent : définir un critère de succès et un moyen de le tester avant de travailler le prompt. La grille d'évaluation est ce moyen. Elle liste cinq critères observables, chacun noté de 0 à 2 avec une justification d'une phrase, et s'applique à toute version du livrable. Un bon critère se constate : « le public cible est nommé dès la première phrase », « chaque affirmation chiffrée renvoie à une source », « aucune phrase de plus de 25 mots », « la recommandation dit qui fait quoi et quand », « les points en désaccord sont listés séparément des décisions ».
Pourquoi ne pas simplement demander à Copilot de vérifier son travail ? La recherche répond : Huang et ses coauteurs montrent que les modèles de langage ne s'autocorrigent pas de manière fiable sans retour externe, et que la performance peut baisser après une autocorrection. Ce qui fonctionne, c'est la vérification contre un élément extérieur à la production : une source jointe, ou une grille dont les critères ne dépendent pas de ce que le modèle vient d'écrire. D'où les deux règles de la leçon : la grille est rédigée avant, et l'évaluation se fait dans une conversation séparée, avec le seul texte à juger.
Le dispositif tient en quatre temps. Vous rédigez la grille. Vous produisez la version 1. Dans une nouvelle conversation, vous donnez à Copilot un rôle de relecteur, la grille, le texte, et vous demandez un score par critère, une justification, puis les trois corrections prioritaires formulées comme des instructions de réécriture. Vous appliquez celles que vous jugez fondées, refusez celles qui ne le sont pas, et rejouez la grille sur la version 2. Le mode « Think deeper », documenté par Microsoft, convient à l'étape d'évaluation. Le renfort de cette leçon, « critères d'auto-évaluation », ajoute au prompt de production une auto-notation en fin de réponse : une liste de contrôle utile, pas une preuve.


Schéma « Une grille pour juger une réponse »Schéma généré par IA et relu 2Une note de direction passée de 5 à 9 sur 10
Un manager a fait rédiger par Copilot une note d'une page pour proposer un changement d'organisation à sa direction.
Prompt faible, dans la même conversation :
C'est bien ?Copilot répond que la note est « claire et bien structurée » et propose de « renforcer l'introduction ». Rien n'est mesurable, rien n'est actionnable, et la note part telle quelle avec deux chiffres non sourcés.
Prompt fort, dans une nouvelle conversation :
Tu es relecteur. Évalue la note ci-dessous selon cette grille. Pour chaque critère, une note de 0 à 2 et une justification d'une phrase : 1) chaque affirmation chiffrée renvoie à une source nommée ; 2) le public cible et la décision demandée apparaissent dès la première phrase ; 3) la recommandation finale dit qui fait quoi et quand ; 4) aucune phrase ne dépasse 25 mots ; 5) les objections prévisibles sont listées avec une réponse chacune. Termine par les trois corrections prioritaires, formulées comme des instructions de réécriture. Ne réécris pas la note. Note : [texte collé]La grille sort avec un score de 5 sur 10 : deux chiffres sans source, une décision demandée absente de l'ouverture, quatre phrases trop longues. Le manager applique deux corrections, refuse la troisième qui supprimait une objection qu'il tient à garder, rejoue la grille : 9 sur 10.
Ce qui change : les critères observables produisent un verdict comparable entre les deux versions, au lieu d'un avis. Les corrections formulées comme instructions se réappliquent sans interprétation. Le refus argumenté d'une correction montre que l'arbitre reste le manager, pas le modèle.
3Écrivez cinq critères vérifiables en une minute
Choisissez un livrable courant de votre métier : mail client, note de synthèse, compte rendu, fiche produit. Voici le prompt de départ, à améliorer :
« Relis ma note et dis-moi ce que tu en penses. »
Rédigez d'abord votre grille de cinq critères observables, notés de 0 à 2. Produisez une version 1 avec Copilot. Dans une nouvelle conversation, réécrivez le prompt : rôle de relecteur, grille, score et justification par critère, trois corrections prioritaires en instructions, interdiction de réécrire. Le composeur ci-dessous structure le prompt d'évaluation ; activez le renfort « Lister les points à faire vérifier par un humain ». Appliquez les corrections que vous jugez fondées, rejouez la grille, comparez les scores.
Grille d'auto-évaluation : (a) les cinq critères se vérifient en moins d'une minute chacun ; (b) l'évaluation a eu lieu dans une conversation séparée ; (c) les scores avant et après sont notés et une correction au moins a été refusée avec une raison.
4La grille qui donne 10 sur 10 à tous les coups
Un chef de projet écrit sa grille en cinq critères : « le ton est professionnel », « la note est claire », « la structure est logique », « le contenu est pertinent », « le niveau de détail est adapté ». Il demande à Copilot d'évaluer une note de synthèse, de l'améliorer, puis de l'évaluer à nouveau. Deux fois de suite, 10 sur 10, avec une justification élogieuse par critère. Ce qu'il fallait voir : aucun critère n'est observable, donc le modèle, qui juge sa propre production, coche « OK » par complaisance. La grille mesure sa bonne volonté, pas la note. Correction : réécrivez chaque critère pour qu'un collègue pressé puisse le vérifier en moins d'une minute, sans avis personnel : « chaque chiffre renvoie à une source nommée », « aucune phrase ne dépasse 25 mots », « la recommandation dit qui fait quoi et quand ». Faites noter dans une conversation séparée, exigez pour chaque critère la citation du passage qui justifie la note, et vérifiez vous-même deux critères au hasard. Règle à retenir : un critère que le modèle ne peut pas contredire ne mesure rien.
5Quiz
Trois questions, correction immédiate. Le retour explique chaque option.
6Preuve de maîtrise
Collez votre grille de cinq critères, l'évaluation de la version 1 par Copilot avec les scores, les corrections que vous avez appliquées, puis les scores de la version 2.
Cette leçon compte pour le badge AvancéVoir les quatre badges
Critères
Ce que vous écriviez au début de la leçon
Pour aller plus loin
Cette grille est le prompt C de Décomposer une tâche en trois prompts chaînés, et elle a sa place dans chaque fiche de Construire la bibliothèque de prompts de votre équipe. Le glossaire rappelle ce qu'est une hallucination, que le critère de sourçage sert à attraper.
Questions fréquentes
Pourquoi une conversation séparée pour l'évaluation ?
Parce que dans la même conversation, le modèle défend ce qu'il vient d'écrire : il a tout le contexte de sa production et tend à la confirmer. Une nouvelle conversation, avec la grille et le seul texte à évaluer, produit un jugement plus indépendant. Ce n'est pas un juge impartial pour autant : vous restez l'arbitre.
Puis-je demander à Copilot de s'auto-évaluer dans le prompt de production ?
Oui, c'est le renfort « Critères d'auto-évaluation » de cette leçon, utile comme liste de contrôle en fin de réponse. Mais la recherche montre que l'autocorrection sans retour externe n'améliore pas le raisonnement, et peut le dégrader. L'auto-évaluation signale ; la grille appliquée à part, puis votre relecture, tranchent.
Combien de critères dans une grille ?
Cinq, rarement plus. Chaque critère doit être observable en moins d'une minute par un collègue : une longueur, une présence, une correspondance avec la source. « Le ton est bon » n'est pas un critère ; « aucune phrase de plus de 25 mots » et « chaque chiffre renvoie à une source » en sont.