DeepSeek a dévoilé DeepSeek-V4-Flash-Vision-Exp, une version multimodale expérimentale de son modèle phare. Cet outil inédit permet d’analyser des images et des captures d’écran tout en conservant les capacités textuelles de la base, atteignant des performances proches de celles de Claude Opus 4.8.
Le développeur chinois d’intelligence artificielle DeepSeek franchit une nouvelle étape en enrichissant son écosystème technologique. L’entreprise a officialisé le lancement d’une variante visuelle de son système de pointe, ouvrant de nouvelles perspectives pour l’analyse automatisée de documents graphiques et de requêtes mixtes.
L’arrivée de DeepSeek-V4-Flash-Vision-Exp et ses fonctionnalités
La nouvelle mouture, baptisée DeepSeek-V4-Flash-Vision-Exp, se distingue par sa capacité à traiter non seulement le texte, mais aussi les images, les captures d’écran et divers supports visuels. Cette déclinaison expérimentale dérive directement du modèle de base DeepSeek-V4-Flash. Dans les tâches textuelles, le système conserve l’ensemble des compétences de sa version d’origine, qu’il s’agisse des raisonnements logiques, de l’utilisation des connaissances sur le monde environnant ou du pilotage d’agents autonomes.
L’intégration de la vision permet à l’intelligence artificielle d’examiner en détail le contenu d’une image ou d’un écran afin d’exécuter des requêtes complexes sans intervention humaine constante. Les développeurs soulignent que cette approche favorise une exécution autonome de séquences d’actions par la machine.
Performances comparées et positionnement face à la concurrence
Les premiers tests menés sur les capacités des agents multimodaux révèlent des sauts qualitatifs importants par rapport à la version initiale non visuelle. Selon les informations communiquées par la firme, l’efficacité opérationnelle de cette nouveauté se situe sur un niveau proche de l’architecture d’Anthropic, surpassant parfois cette dernière dans des scénarios d’évaluation spécifiques.
Ces résultats placent l’expérimentation chinoise au centre de l’attention des spécialistes du secteur, désireux d’observer la réactivité des modèles légers face aux mastodondes du marché. La structure conserve son statut expérimental tout en s’intégrant immédiatement dans l’écosystème de la marque.
Disponibilité technique, tarification et outils associés
Pour accompagner le déploiement de ce modèle, l’entreprise a mis en circulation un utilitaire dédié, l’outil DeepSeek Harness 0.1.1, qui assure une prise en charge immédiate du système dès son acquisition. Les utilisateurs peuvent d’ores et déjà interagir avec la nouveauté en passant par l’interface de programmation d’application de la société.

Côté facturation, le traitement des images repose sur une conversion en jetons informatiques, à raison d’un maximum de 384 tokens par visuel soumis. Le coût de ces requêtes visuelles s’aligne directement sur la grille tarifaire en vigueur pour le modèle textuel de base DeepSeek V4-Flash.
Sur le même sujet