Leçon 9 · Intermédiaire · 15 min
Multimodalité native : analyser des schémas, captures et factures
Exploiter la vision native de Gemini : extraire les données d'un schéma d'architecture, d'une facture scannée ou d'une infographie complexe.
- Objectif
- Vous saurez exploiter la compréhension visuelle de Gemini pour interpréter des diagrammes, transcrire des schémas et auditer des documents scannés.
- Compétences
- Vérifier

Votre première tentative, sans aide
Prenez une photo de notes manuscrites sur un tableau blanc ou une capture d'écran de schéma technique et demandez à Gemini d'en extraire le plan d'action.
Gemini traite les images de manière native sans passer par un module OCR externe : les pixels sont encodés conjointement au texte. Vous pouvez lui soumettre des schémas d'architecture, des photographies d'installations ou des formulaires manuscrits. Pour fiabiliser l'analyse, cadrez précisément la zone d'intérêt et exigez une transcription textuelle avant toute interprétation.
1La vision sans intermédiaire : les pixels traités comme du langage
La vision sans intermédiaire traite directement les pixels comme des composantes sémantiques du langage. Gemini ne sépare pas la reconnaissance visuelle du raisonnement logique, ce qui lui permet de corréler instantanément une forme graphique et un texte explicatif.
Contrairement aux solutions classiques qui superposent un module OCR mécanique à un grand modèle de langue, Gemini a été entraîné dès l'origine sur des flux multimodaux entrelacés. Il comprend les relations spatiales, la typographie manuscrite, les organigrammes et les diagrammes industriels complexes. Cette multimodalité native accélère l'analyse de pièces justificatives, de schémas techniques et de captures d'écran logicielles.
Support visuel Ce que Gemini perçoit Risque opérationnel Consigne recommandée Schéma d'architecture Flux, serveurs, protocoles et liaisons Mauvaise attribution d'une flèche ambiguë « Liste d'abord chaque composant et ses connexions » Formulaire manuscrit Écritures cursives et cases cochées Confusion sur les chiffres manuscrits proches « Transcris fidèlement la case avant d'interpréter » Capture d'écran UI Boutons, menus, textes et hiérarchie visuelle Omission des sous-menus repliés « Décris l'état de chaque zone de l'écran » 

Schéma « Multimodalité native de Gemini »Schéma généré par IA et relu 2Auditer un schéma d'architecture réseau et identifier un point de rupture
Auditer un schéma d'architecture réseau et identifier un point de rupture illustre comment la vision native de Gemini détecte immédiatement une anomalie de redondance sans aucune saisie textuelle manuelle.
Un ingénieur système doit valider la tolérance aux pannes d'un nouveau plan d'hébergement cloud transmis sous forme de schéma PNG.
Prompt faible.
Regarde ce schéma réseau et dis-moi s'il est bon.Gemini fournit un commentaire poli et superficiel, confirmant que l'architecture semble moderne sans identifier la vulnérabilité centrale.
Prompt fort.
Analyse le schéma d'architecture réseau ci-joint. Identifie chaque serveur, chaque répartiteur de charge et chaque lien de communication. Réponds à cette question précise : existe-t-il un composant unique dont la défaillance entraîne l'arrêt total du service ? Si oui, nomme-le et propose une liaison redondante en 80 mots.Ce qui change. La consigne ordonne un inventaire exhaustif des composants et focalise l'analyse sur le point de défaillance unique, permettant d'isoler une passerelle non redondée.
3Convertir une capture d'interface en spécifications fonctionnelles
Convertir une capture d'interface en spécifications fonctionnelles vous permet de tester la capacité de Gemini à transformer un croquis ou une maquette visuelle en livrable technique structuré.
Faites une capture d'écran d'un formulaire de saisie ou d'une page applicative interne. Téléversez l'image dans Gemini et demandez-lui d'en extraire la liste complète des champs et boutons avec leurs règles de validation déduites.
Lancez ce prompt :
« À partir de la capture d'écran de l'interface ci-jointe, rédige le tableau des spécifications fonctionnelles comprenant les colonnes : Élément visuel, Type de champ, Format attendu, et Règle de validation métier. 120 mots. »
Grille d'auto-évaluation : (a) tous les champs visibles de l'image sont répertoriés ; (b) le type de contrôle (texte, menu déroulant, case) est correctement identifié ; (c) le tableau de sortie est immédiatement exploitable par une équipe de développement.
4Déposer une image trop compressée où les petits chiffres deviennent flous
Déposer une image trop compressée où les petits chiffres deviennent flous produit des erreurs invisibles, car Gemini compense le flou des pixels par des valeurs statistiques probables mais fictives.
Lorsque vous photographiez un tableau d'affichage ou que vous compressez une capture d'écran en JPEG basse qualité, les petits caractères des légendes bavent. Gemini ne signale pas toujours que l'image est illisible : il complète les chiffres dégradés avec une assurance trompeuse.
Correction : zoomez sur la zone d'intérêt avant de capturer l'image, ou utilisez un format PNG sans perte garantissant la netteté parfaite des caractères.
Règle à retenir : si un œil humain hésite sur un chiffre d'une image, Gemini hallucine la valeur.
5Quiz
Trois questions, correction immédiate. Le retour explique chaque option.
6Preuve de maîtrise
Téléversez une image ou capture d'écran technique dans Gemini et partagez l'analyse structurée obtenue, en confirmant la justesse des éléments visuels retranscrits.
Cette leçon compte pour le badge IntermédiaireVoir les quatre badges
Critères
Ce que vous écriviez au début de la leçon
Pour aller plus loin
Consultez la définition de la multimodalité et de l'ancrage visuel. La leçon suivante, Calcul et données avec Python, montre comment neutraliser définitivement les erreurs de calcul. Découvrez aussi Analyser une vidéo pour étendre la vision aux médias animés.
Questions fréquentes
Gemini utilise-t-il un outil externe pour lire les images ?
Non. Contrairement aux systèmes qui appliquent un OCR tiers avant d'envoyer le texte à l'IA, Gemini a été entraîné nativement sur les pixels en même temps que le texte.
Peut-on lui soumettre plusieurs images à comparer ?
Oui. Vous pouvez déposer deux maquettes ou deux schémas et lui demander d'en lister les différences visuelles et structurelles point par point.
Quelle est la limite de résolution recommandée ?
Fournissez des images nettes d'au moins 1000 pixels de large pour que les légendes, petits caractères et chiffres de tableaux restent parfaitement lisibles.