Microsoft met en open source Phi-4-Vision, un modèle d'IA multimodal léger
Microsoft a officiellement mis en open source son dernier modèle de raisonnement multimodal, Phi-4-reasoning-vision-15B. Avec ses 15 milliards de paramètres, ce modèle offre un équilibre idéal entre hautes performances et faible coût. Son architecture légère en fait une nouvelle option très intéressante pour traiter des tâches visuelles complexes dans des environnements aux ressources limitées.
Une « petite bombe » alimentée par des données raffinées
Contrairement aux modèles industriels classiques entraînés sur des milliers de milliards de tokens, Phi-4-reasoning-vision a été développé en utilisant seulement 200 milliards de tokens multimodaux. L'équipe a donné la priorité à la qualité des données en procédant à un nettoyage rigoureux des données open source, en générant des données synthétiques ciblées et en calibrant soigneusement les ratios de données spécifiques à chaque domaine — par exemple en augmentant le contenu mathématique pour renforcer le raisonnement computationnel. Cette approche permet d'obtenir d'excellentes performances dans le raisonnement scientifique et les tâches de localisation d'éléments à l'écran.

Une stratégie de raisonnement hybride innovante
Une innovation clé de ce modèle réside dans la conception de son « parcours de raisonnement hybride » :
Tâches de perception : pour les tâches simples telles que la légende d'images ou la reconnaissance optique de caractères (OCR), le modèle passe par défaut en mode de réponse directe, optimisé pour la vitesse et une latence réduite.
Tâches de raisonnement : lorsqu'il est confronté à une logique complexe, telle que l'interprétation de formules mathématiques ou de graphiques scientifiques, il engage automatiquement un processus structuré de chaîne de pensée (CoT) pour garantir la précision de la réponse.
Les utilisateurs peuvent également basculer manuellement entre ces deux modes à l'aide de phrases déclencheuses spécifiques, adaptant ainsi le comportement du modèle aux différents besoins des applications.
Grâce à l'intégration de l'encodeur à résolution dynamique SigLIP-2, le modèle excelle dans la perception des détails fins au sein de captures d'écran haute résolution. Cette capacité en fait une base idéale pour le développement d'agents d'utilisation informatique (CUA), capables d'identifier avec précision et d'interagir avec les boutons, les champs et autres éléments des interfaces numériques.
Phi-4-reasoning-vision-15B est désormais disponible sur les principales plateformes open source. Microsoft estime que ce modèle compact démontrera comment « plus petit et plus rapide » peut également signifier « plus performant » dans le domaine multimodal, contribuant ainsi à faire progresser l'adoption de l'intelligence spatiale et des technologies interactives en temps réel.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (1)
Microsoft a officiellement mis en open source son dernier modèle de raisonnement multimodal, Phi-4-reasoning-vision-15B. Avec ses 15 milliards de paramètres, ce modèle offre un équilibre idéal entre hautes performances et faible coût. Son architecture légère en fait une nouvelle option très intéressante pour traiter des tâches visuelles complexes dans des environnements aux ressources limitées.
Une « petite bombe » alimentée par des données raffinées
Contrairement aux modèles industriels classiques entraînés sur des milliers de milliards de tokens, Phi-4-reasoning-vision a été développé en utilisant seulement 200 milliards de tokens multimodaux. L'équipe a donné la priorité à la qualité des données en procédant à un nettoyage rigoureux des données open source, en générant des données synthétiques ciblées et en calibrant soigneusement les ratios de données spécifiques à chaque domaine — par exemple en augmentant le contenu mathématique pour renforcer le raisonnement computationnel. Cette approche permet d'obtenir d'excellentes performances dans le raisonnement scientifique et les tâches de localisation d'éléments à l'écran.

Une stratégie de raisonnement hybride innovante
Une innovation clé de ce modèle réside dans la conception de son « parcours de raisonnement hybride » :
Tâches de perception : pour les tâches simples telles que la légende d'images ou la reconnaissance optique de caractères (OCR), le modèle passe par défaut en mode de réponse directe, optimisé pour la vitesse et une latence réduite.
Tâches de raisonnement : lorsqu'il est confronté à une logique complexe, telle que l'interprétation de formules mathématiques ou de graphiques scientifiques, il engage automatiquement un processus structuré de chaîne de pensée (CoT) pour garantir la précision de la réponse.
Les utilisateurs peuvent également basculer manuellement entre ces deux modes à l'aide de phrases déclencheuses spécifiques, adaptant ainsi le comportement du modèle aux différents besoins des applications.
Grâce à l'intégration de l'encodeur à résolution dynamique SigLIP-2, le modèle excelle dans la perception des détails fins au sein de captures d'écran haute résolution. Cette capacité en fait une base idéale pour le développement d'agents d'utilisation informatique (CUA), capables d'identifier avec précision et d'interagir avec les boutons, les champs et autres éléments des interfaces numériques.
Phi-4-reasoning-vision-15B est désormais disponible sur les principales plateformes open source. Microsoft estime que ce modèle compact démontrera comment « plus petit et plus rapide » peut également signifier « plus performant » dans le domaine multimodal, contribuant ainsi à faire progresser l'adoption de l'intelligence spatiale et des technologies interactives en temps réel.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés





Maison






