Vision-Language Model (VLM)
Un modèle vision-langage (VLM) est un modèle multimodal capable d'analyser et de raisonner sur des images en combinant vision par ordinateur et traitement du langage naturel. Il peut décrire, interroger ou générer du texte à partir d'images.
GPT-4V peut analyser une radiographie et décrire les anomalies visibles, lire un graphique et extraire les données chiffrées, ou identifier des produits dans une photo pour alimenter un catalogue e-commerce.
Un modèle vision-langage (VLM) est un modèle multimodal capable d'analyser et de raisonner sur des images en combinant vision par ordinateur et traitement du langage naturel. Il peut décrire, interroger ou générer du texte à partir d'images.
GPT-4V peut analyser une radiographie et décrire les anomalies visibles, lire un graphique et extraire les données chiffrées, ou identifier des produits dans une photo pour alimenter un catalogue e-commerce.
Modèle vision-langage et Multimodal sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : Multimodal, Vision par ordinateur, LLM, IA générative.
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés