DeepSeek lance DeepSeek-V4-Flash-Vision-Exp, un modèle multimodal expérimental

DeepSeek a dévoilé DeepSeek-V4-Flash-Vision-Exp, une version multimodale expérimentale de son modèle phare. Cet outil inédit permet d’analyser des images et des captures d’écran tout en conservant les capacités textuelles de la base, atteignant des performances proches de celles de Claude Opus 4.8.

Le développeur chinois d’intelligence artificielle DeepSeek franchit une nouvelle étape en enrichissant son écosystème technologique. L’entreprise a officialisé le lancement d’une variante visuelle de son système de pointe, ouvrant de nouvelles perspectives pour l’analyse automatisée de documents graphiques et de requêtes mixtes.

L’arrivée de DeepSeek-V4-Flash-Vision-Exp et ses fonctionnalités

La nouvelle mouture, baptisée DeepSeek-V4-Flash-Vision-Exp, se distingue par sa capacité à traiter non seulement le texte, mais aussi les images, les captures d’écran et divers supports visuels. Cette déclinaison expérimentale dérive directement du modèle de base DeepSeek-V4-Flash. Dans les tâches textuelles, le système conserve l’ensemble des compétences de sa version d’origine, qu’il s’agisse des raisonnements logiques, de l’utilisation des connaissances sur le monde environnant ou du pilotage d’agents autonomes.

L’intégration de la vision permet à l’intelligence artificielle d’examiner en détail le contenu d’une image ou d’un écran afin d’exécuter des requêtes complexes sans intervention humaine constante. Les développeurs soulignent que cette approche favorise une exécution autonome de séquences d’actions par la machine.

Performances comparées et positionnement face à la concurrence

Les premiers tests menés sur les capacités des agents multimodaux révèlent des sauts qualitatifs importants par rapport à la version initiale non visuelle. Selon les informations communiquées par la firme, l’efficacité opérationnelle de cette nouveauté se situe sur un niveau proche de l’architecture d’Anthropic, surpassant parfois cette dernière dans des scénarios d’évaluation spécifiques.

Ces résultats placent l’expérimentation chinoise au centre de l’attention des spécialistes du secteur, désireux d’observer la réactivité des modèles légers face aux mastodondes du marché. La structure conserve son statut expérimental tout en s’intégrant immédiatement dans l’écosystème de la marque.

Disponibilité technique, tarification et outils associés

Pour accompagner le déploiement de ce modèle, l’entreprise a mis en circulation un utilitaire dédié, l’outil DeepSeek Harness 0.1.1, qui assure une prise en charge immédiate du système dès son acquisition. Les utilisateurs peuvent d’ores et déjà interagir avec la nouveauté en passant par l’interface de programmation d’application de la société.

DeepSeek lance DeepSeek-V4-Flash-Vision-Exp, un modèle multimodal expérimental
Photo: iPhones.ru

Côté facturation, le traitement des images repose sur une conversion en jetons informatiques, à raison d’un maximum de 384 tokens par visuel soumis. Le coût de ces requêtes visuelles s’aligne directement sur la grille tarifaire en vigueur pour le modèle textuel de base DeepSeek V4-Flash.

DeepSeek V4 Vision is HERE: Opus 4.8 Killer? (DeepSeek-V4-Flash-Vision-Exp Tested)

Sur le même sujet

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.