Multimodal

  • Concept
  • Intermédiaire
  • Transversal
  • Toujours utilisé

En bref

Un système d'intelligence artificielle multimodal peut traiter et combiner plusieurs types de données à la fois, comme le texte, l'image, le son ou la vidéo.

Définition complète

Un système d’intelligence artificielle multimodal est capable de traiter, combiner et relier plusieurs types de données (texte, image, son, vidéo) au sein d’une même tâche, au lieu de se limiter à un seul type d’information comme le faisaient les premiers modèles.

Par exemple, un assistant multimodal peut recevoir en entrée une photo d’un frigo, comprendre visuellement les aliments présents, et répondre par écrit à la question « quelles recettes puis-je préparer avec ça ? ». Il combine ici la compréhension d’image et la génération de texte dans une seule réponse cohérente.

Attention : tous les outils d’intelligence artificielle ne sont pas multimodaux. Un modèle qui ne traite que du texte, aussi performant soit-il, ne peut ni analyser une image ni écouter un enregistrement audio : la multimodalité est une capacité technique spécifique, pas une caractéristique universelle de l’IA.

À quoi ça sert

La multimodalité sert à rapprocher l’usage de l’intelligence artificielle de la façon naturelle dont les humains communiquent, en mêlant naturellement parole, images, gestes et écrits, plutôt que de forcer l’utilisateur à tout traduire en texte pur.

Elle permet des usages professionnels concrets : analyser une photo de facture pour en extraire les montants, décrire à voix haute un problème technique en montrant une image, ou générer une présentation qui combine texte et visuels cohérents entre eux.

Elle réduit aussi la charge de travail liée à la conversion manuelle d’un format à un autre : au lieu de devoir décrire par écrit le contenu d’une image pour qu’un outil la comprenne, l’utilisateur peut simplement la transmettre telle quelle.

Cas d'usage typiques

– Diagnostiquer : envoyer la photo d’une panne (fissure, message d’erreur) et obtenir une explication écrite du problème.
– Documenter : transcrire et résumer automatiquement une réunion enregistrée en associant audio et texte.
– Contrôler : analyser des photos de contrôle qualité en usine et générer un rapport écrit associé.
– Accessibilité : décrire automatiquement le contenu d’une image pour une personne malvoyante.
– Créer : générer une présentation combinant un texte rédigé et des visuels cohérents avec ce texte.
– Assister : répondre à une question posée à l’oral en s’appuyant sur un document ou une image partagée en même temps.

Ce que tu sauras faire

Savoir reconnaître qu'un outil est multimodal lorsqu'il combine plusieurs formats (texte, image, son) dans une même interaction, et identifier les situations professionnelles où cette combinaison apporte un vrai gain de temps.

Mises en situation

Situation 1 : un artisan qui diagnostique une panne à distance

Contexte : Un électricien reçoit un appel d’un client qui décrit mal le problème rencontré sur son tableau électrique.

Application : Le client envoie une photo du tableau à un assistant multimodal, qui identifie visuellement un disjoncteur suspect et explique par écrit ce qu’il pourrait signifier.

Résultat attendu : L’électricien arrive sur place avec une meilleure idée du problème probable et du matériel à prévoir, ce qui réduit le temps d’intervention.

Situation 2 : une entreprise qui traite ses notes de frais

Contexte : Une PME reçoit chaque mois des dizaines de photos de tickets de caisse envoyées par ses commerciaux pour le remboursement de frais.

Application : Un outil multimodal lit automatiquement le texte présent sur chaque photo de ticket et extrait le montant, la date et le type de dépense.

Résultat attendu : Le service comptable gagne un temps important en ne ressaisissant plus les informations à la main depuis chaque photo.

Situation 3 : un cabinet médical qui documente ses consultations

Contexte : Un médecin souhaite garder une trace écrite fidèle de ses consultations sans passer du temps à taper ses notes après chaque rendez-vous.

Application : Un outil multimodal transcrit automatiquement l’enregistrement audio de la consultation (avec l’accord du patient) et en produit un résumé structuré.

Résultat attendu : Le médecin relit et valide le résumé généré plutôt que de le rédiger entièrement lui-même, ce qui lui laisse plus de temps pour ses patients.

Application guidée : choisir entre un outil texte seul et un outil multimodal

Contexte : Une agence immobilière hésite entre un outil qui ne traite que du texte pour décrire ses biens, et un outil multimodal capable d’analyser directement les photos des appartements.

Question : Quel outil choisir pour générer automatiquement une description attractive de chaque bien immobilier à partir des photos prises par l’agent ?

Résultat attendu : L’outil multimodal est plus adapté ici, car il peut analyser directement les photos (luminosité, agencement, état apparent) pour produire une description cohérente, sans que l’agent ait besoin de tout décrire par écrit au préalable.

Application guidée : évaluer les limites d’un outil multimodal

Contexte : Un outil multimodal analyse la photo d’un plat cuisiné dans un restaurant et propose une estimation de sa valeur calorique, mais se trompe largement car la photo ne montre pas la quantité réelle de sauce ajoutée sous le plat.

Question : Pourquoi cette estimation est-elle peu fiable, et que faut-il en conclure sur l’usage de cet outil ?

Résultat attendu : L’outil ne peut analyser que ce qui est visible sur l’image, pas ce qui est caché ou non mesurable visuellement ; il faut donc considérer son estimation comme indicative et non comme une mesure précise, surtout pour des usages sensibles comme la nutrition.

Pour bien le retenir

L'analogie

Un système multimodal ressemble à un guide touristique polyglotte et polyvalent, capable à la fois de lire une carte, d’écouter une question posée à l’oral et de regarder un monument pour en expliquer l’histoire. Un guide qui ne saurait que lire des textes serait bien plus limité : il ne pourrait ni observer ce que vous lui montrez du doigt, ni répondre à une question posée simplement à voix haute.

« Le multimodal, c'est voir, écouter et lire en même temps, comme un humain le fait naturellement. »

Pièges à éviter

À ne pas confondre avec

Le premier piège est de croire que tous les outils d'intelligence artificielle sont multimodaux par défaut : beaucoup de modèles restent spécialisés dans un seul type de données (texte seul, ou image seule), et il faut vérifier explicitement cette capacité avant de compter dessus.

Un deuxième piège est de surestimer la précision de l'analyse d'image ou de son : un modèle multimodal peut mal interpréter une image de mauvaise qualité, un bruit de fond, ou une information non visible, tout comme il peut se tromper en texte.

Enfin, il faut rester vigilant sur la confidentialité : transmettre des photos ou des enregistrements audio à un outil multimodal peut impliquer l'envoi de données sensibles (visages, documents, voix), ce qui demande d'être attentif à la politique de confidentialité de l'outil utilisé.

Évolution historique

Apparition : Recherche ancienne, usages professionnels concrets et accessibles depuis les années 2020

Quels changements depuis l’arrivée de l’IA ?

Avant

Les systèmes d’intelligence artificielle traitaient généralement un seul type de données à la fois : un modèle de reconnaissance d’image, un autre pour la voix, un autre encore pour le texte, sans lien direct entre eux.

Aujourd’hui

Les modèles multimodaux récents peuvent recevoir simultanément une image, un texte ou un son et produire une réponse cohérente qui tient compte de l’ensemble, ce qui a rendu les assistants d’intelligence artificielle beaucoup plus proches d’un usage naturel du quotidien.

Évolution historique

Années 2000-2010 : les recherches en reconnaissance d’image, de voix et en traitement du texte progressent séparément, chaque domaine ayant ses propres modèles spécialisés.

Milieu des années 2010 : premiers travaux de recherche associant explicitement image et texte, par exemple pour légender automatiquement une photo.

Début des années 2020 : apparition de modèles capables de relier texte et image de façon beaucoup plus flexible, ouvrant la voie à la génération d’images à partir d’une simple description.

2023-2024 : arrivée d’assistants grand public capables de traiter texte, image et voix dans une même conversation.

Depuis 2024 : intégration croissante de la multimodalité dans des outils professionnels courants (support client, contrôle qualité, documentation).