Leçon 9 · Intermédiaire · 15 min
Vision et multimodalité : analyser graphiques et images
Exploiter la vision dans ChatGPT : lecture de graphiques, schémas, tableaux manuscrits et photos. Transcriptions et diagnostics visuels au bureau.
- Objectif
- Vous saurez soumettre des images, graphiques et tableaux visuels à ChatGPT pour en extraire des données fiables et interpréter des schémas.
- Compétences
- Vérifier

Votre première tentative, sans aide
Photographiez un schéma ou un tableau blanc de réunion et demandez à ChatGPT de le convertir en tableau Markdown ordonné.
La vision multimodale de ChatGPT permet de traiter simultanément du texte et des images dans une interface unifiée. Le modèle excelle dans la transcription de tableaux manuscrits, la description de schémas techniques et l'extraction de données à partir de graphiques d'activité. Pour éviter les erreurs d'interprétation, guidez l'IA en lui faisant d'abord expliciter les axes et les unités avant d'extraire les chiffres.
1L'encodage visuel et la compréhension multimodale native
L'encodage visuel et la compréhension multimodale native confèrent à ChatGPT la capacité de raisonner directement sur des pixels. L'image n'est pas traitée par un logiciel tiers séparé : elle est découpée en pavés visuels intégrés dans le réseau de neurones de GPT-4o.
Cette intégration native permet d'analyser conjointement une légende textuelle et une courbe visuelle. Cependant, le modèle ne dispose pas d'une règle millimétrique : il estime les proportions visuelles. Dès lors qu'un graphique ne comporte pas de valeurs chiffrées explicites sur les barres, l'estimation reste approximative.
Type de support visuel Usage professionnel recommandé Niveau de fiabilité Précaution requise Graphique avec chiffres Reconstitution de tableaux de bord Très élevé Vérifier la cohérence de l'échelle Graphique sans étiquettes Détection de tendances générales Moyen Ne pas prendre les valeurs au centime près Tableau blanc manuscrit Synthèse de réunions créatives Élevé Relire attentivement les acronymes métier Schéma d'architecture Explication de flux techniques Très élevé Préciser le sens des flèches et liaisons 

Schéma de la vision multimodaleSchéma généré par IA et relu 2Convertir un graphique financier complexe en données tabulaires
Convertir un graphique financier complexe en données tabulaires permet d'intégrer rapidement des données de veille concurrentielle dans un tableur sans ressaisie manuelle fastidieuse.
Un contrôleur de gestion dispose d'une capture d'écran d'un histogramme montrant l'évolution des marges de trois concurrents.
Prompt faible.
Regarde ce graphique et donne-moi les chiffres.Le modèle donne une liste vague de pourcentages sans préciser à quels trimestres ils correspondent.
Prompt fort.
Rôle : Analyste financier. Tâche : Extrais les données du graphique joint dans un tableau Markdown à 4 colonnes : Trimestre, Marge Entreprise A, Marge Entreprise B, Marge Entreprise C. Méthode : 1. Lis d'abord les libellés de l'axe horizontal et de l'axe vertical. 2. Si une barre ne porte pas d'étiquette chiffrée explicite, indique ton estimation précédée du signe environ (~). 3. Rédige une phrase de synthèse sur la tendance dominante du trimestre 4.Ce qui change. La méthode pas à pas sécurise la lecture des axes et distingue formellement les chiffres certains des estimations visuelles.
3Transcrire une note manuscrite ou un tableau blanc de réunion
Transcrire une note manuscrite ou un tableau blanc de réunion vous fait gagner un temps précieux lors de la rédaction de vos comptes rendus opérationnels.
Prenez en photo une note rédigée à la main sur un calepin ou les notes prises sur un tableau blanc lors d'une session d'équipe.
Téléversez l'image dans ChatGPT et lancez cette consigne :
« Rôle : Secrétaire de séance. Tâche : Transcris les notes de ce tableau blanc en deux livrables : 1. Liste ordonnée des décisions adoptées ; 2. Tableau des actions à mener (Action, Responsable, Échéance). Si un mot manuscrit est illisible ou douteux, place-le entre crochets avec un point d'interrogation [mot ?]. »
Grille d'auto-évaluation : (a) l'image est fidèlement décodée ; (b) la structure Actions/Responsables est respectée ; (c) les incertitudes éventuelles sont explicitement balisées.
4Supposer que l'IA mesure précisément des pixels ou lit des textes flous
Supposer que l'IA mesure précisément des pixels ou lit des textes flous entraîne des erreurs d'arbitrage sur des métriques opérationnelles critiques.
Un ingénieur demande à ChatGPT la cote exacte d'une pièce mécanique à partir d'un schéma scanné en basse résolution où les cotes sont partiellement illisibles. Le modèle invente un chiffre plausible pour satisfaire la demande.
Correction : fournissez toujours des recadrages nets en haute résolution et ordonnez au modèle d'indiquer « illisible » dès qu'un caractère présente une ambiguïté visuelle.
Règle à retenir : ChatGPT interprète des formes visuelles, il ne remplace pas un instrument de métrologie industrielle.
5Quiz
Trois questions, correction immédiate. Le retour explique chaque option.
6Preuve de maîtrise
Soumettez un graphique ou un schéma professionnel et obtenez une extraction tabulaire complète vérifiant les axes et les valeurs clés.
Cette leçon compte pour le badge IntermédiaireVoir les quatre badges
Critères
Ce que vous écriviez au début de la leçon
Pour aller plus loin
Découvrez les termes vision-multimodale et ocr dans le glossaire. Poursuivez avec la leçon 10 : Analyse avancée de données avec Python. Pour la création d'espaces partagés de travail, consultez ChatGPT Canvas : espace de travail collaboratif.
Questions fréquentes
Quels types d'images ChatGPT peut-il analyser ?
ChatGPT traite les fichiers PNG, JPEG, WEBP et GIF non animés représentant des captures d'écran, graphiques, photos techniques ou documents scannés.
ChatGPT peut-il identifier des personnes sur une photo ?
Non, OpenAI bride volontairement la reconnaissance faciale de personnes privées pour des motifs éthiques et de protection de la vie privée.
Comment améliorer la précision de lecture sur un graphique complexe ?
Fournissez une image nette en haute résolution, zoomez sur les axes clés et demandez au modèle d'expliciter d'abord les légendes avant de lire les valeurs.