IA
Multimodal
Un modèle multimodal sait traiter plusieurs types d’entrées plutôt qu’un seul : texte, image, audio, vidéo. Là où un modèle classique ne lit que du texte, un modèle multimodal peut analyser une photo, écouter un extrait sonore ou commenter une vidéo.
Concrètement, cela change ce qu’on peut lui demander :
- décrire ou interpréter une image ;
- transcrire et comprendre de l’audio ;
- combiner plusieurs formats dans une même requête.
Pour le GEO, cela élargit les surfaces : un contenu visuel bien légendé devient lui aussi exploitable par l’IA.