Alibaba Qwen lance Qwen3.8-Omni-Flash : un modèle omnimodal avec contexte de 1M pour la compréhension agentique audio et vidéo
Générée par IA
1. Contexte et points clés
L'équipe de recherche Qwen d'Alibaba a officiellement dévoilé Qwen3.8-Omni-Flash, son tout premier modèle omnimodal conçu autour de capacités agentiques natives. Rompant avec les approches disparates associant des encodeurs indépendants, Qwen3.8-Omni-Flash intègre nativement la compréhension du texte, des images, de l'audio et de la vidéo pour générer des réponses textuelles unifiées. Sa dynamique opérationnelle repose sur une chaîne d'action directe : analyser le contenu multimédia, planifier la tâche, exécuter des outils externes et restituer le résultat.
Le modèle est déployé immédiatement sous forme d'API hébergée sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, sans publication de poids ouverts lors du lancement. Doté d'une fenêtre de contexte d'un million de jetons (jusqu'à 991 000 jetons en entrée, 131 000 en sortie et un raisonnement maximal de 262 000 jetons) avec activation par défaut du mode de réflexion approfondie (reasoning_effort: xhigh), Qwen3.8-Omni-Flash cible le traitement en temps réel de flux multimédias massifs en entreprise.
2. Aspects techniques saillants
Qwen3.8-Omni-Flash s'appuie sur l'architecture Qwen3.8-Flash-Next, dont le modèle de base a été publié en poids ouverts en août 2026. Cette optimisation structurelle garantit une latence d'inférence minime tout en conservant une grande rigueur de raisonnement sur les flux de données volumineux. L'API prend en charge le protocole DashScope ainsi que les spécifications standard d'OpenAI (Chat Completions et Responses API), offrant un support direct des appels de fonctions, de la recherche web, de la mise en cache contextuelle et du traitement par lots.

En matière d'ingestion média, le modèle traite des vidéos d'une durée maximale de 2 heures et de 2 Go via URL, avec un échantillonnage stable jusqu'à 15 images par seconde. Côté audio, il gère des enregistrements allant jusqu'à 3 heures dans 113 langues et dialectes, intégrant la gestion native de l'audio spatial à quatre canaux (First-Order Ambisonics, FOA) et de la stéréo binaurale via le paramètre use_multichannel.
3. Répercussions sur le secteur et perception agentique vidéo
Les systèmes d'analyse vidéo conventionnels souffrent d'une inefficacité majeure : ils ingèrent séquentiellement chaque trame d'une vidéo longue, gaspillant des dizaines de milliers de jetons même lorsque la réponse recherchée se situe dans un passage de quelques secondes. Qwen3.8-Omni-Flash surmonte cet écueil grâce à un mécanisme de perception agentique guidé par la requête (coarse-to-fine) : le modèle explore les horodatages, sélectionne les extraits sonores et visuels cruciaux et concentre ses jetons sur les segments pertinents.
Sur le benchmark de référence OmniVideoBench, la précision s'élève de 63,4 % à 67,8 %, tandis que la consommation de jetons chute de 45,7 % (passant de 145 736 à 79 117 jetons). Cette économie drastique de calcul rend enfin rentable l'analyse systématique de longs webinaires, flux de caméras de sécurité et cours magistraux.
4. Perspectives de marché et benchmarks comparatifs
Dans les 29 évaluations techniques publiées par Alibaba, Qwen3.8-Omni-Flash enregistre un gain moyen de plus de 25 % par rapport à Qwen3.5-Omni-Plus. On observe notamment des bonds de 36,5 points sur WildClawBench-MM, de 22,3 points sur AgenticVBench, une note de 69,6 sur UniClawBench ainsi que des progrès sensibles sur LongAudioSpan (+8,3 points) et OmniVideoBench (+9,6 points). Les chercheurs d'Alibaba soulignent que ses capacités audiovisuelles rivalisent avec Gemini 3.8 Flash de Google, le devançant même en traitement acoustique pur.
Sur le plan tarifaire, QwenCloud applique une grille ultra-compétitive : 0,15 dollar par million de jetons d'entrée et 0,47 dollar par million de jetons de sortie, avec un coût de seulement 0,016 dollar par million de jetons en cache. Cela représente une baisse de coût horaire de plus de 98 % sur l'audio et de plus de 93 % sur les flux audiovisuels comparé à Qwen3.5-Omni-Plus (~89 % d'économie en vidéo).
5. Prochaines étapes et écosystème open source Qwen-MM-Plugins
Le modèle renvoyant du texte, la manipulation directe des fichiers multimédias repose sur des extensions d'outils. Alibaba a ainsi publié sous licence Apache-2.0 la suite Qwen-MM-Plugins et le banc d'exécution Qwen-Live. Conçu pour rendre tout agent nativement multimodal, ce projet propose des Skills et des serveurs MCP compatibles avec Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.
Parmi les démonstrateurs opérationnels figurent omni-memory (indexation mémorielle audiovisuelle de vidéos longues), omni-video2note (génération automatique de guides PDF illustrés à partir de vidéos) et omni-chatcut (montage vidéo, sous-titrage et traduction avec conservation vocale). Cet écosystème favorise une intégration industrielle immédiate sans barrières logicielles propriétaires.
6. Conclusion et évaluation
L'arrivée de Qwen3.8-Omni-Flash marque une étape charnière dans l'IA appliquée. En conjuguant une fenêtre d'un million de jetons avec un ciblage agentique sélectif, Alibaba démontre que l'avenir des modèles multimodaux repose sur l'efficience décisionnelle : regarder, écouter et agir avec pertinence plutôt que saturer aveuglément les architectures de calcul.
| Fonctionnalité | Qwen3.8-Omni-Flash (Alibaba) | Modèles Multimodaux Traditionnels |
|---|---|---|
| Modalités d’Entrée | Omnimodal Natif (Texte, Image, Audio, Vidéo) | Bimodal / Texte et Image (Décodeurs audio/vidéo externes) |
| Fenêtre de Contexte | 1 Million de Jetons (991k entrée / 131k sortie) | 128k – 1M Jetons (Ingestion séquentielle trame par trame) |
| Optimisation Vidéo Longue | Perception Coarse-to-Fine (-45,7 % jetons sur OmniVideoBench) | Ingestion linéaire exhaustive à coût élevé |
| Traitement Audio | 113 langues, Audio spatial FOA et stéréo (jusqu’à 3h) | Monocanal standard, couverture de 20 à 30 langues |
| Raisonnement et Outils | Thinking activé par défaut (xhigh) + Qwen-MM-Plugins (MCP) | Appels de fonctions basiques sans repères spatio-temporels |
| Tarification Entrée / Sortie | 0,15 $ / 0,47 $ par 1M jetons (>93 % d’économie vs 3.5-Omni) | Tarifs standard dépassant 1,50 $ / 5,00 $ par 1M jetons |
Español
English
Français
Português
Deutsch
Italiano