Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Technologie 18/09/2026

Alibaba Qwen lance Qwen3.8-Omni-Flash : un modèle omnimodal avec contexte de 1M pour la compréhension agentique audio et vidéo

Alibaba Qwen lance Qwen3.8-Omni-Flash : un modèle omnimodal avec contexte de 1M pour la compréhension agentique audio et vidéo Générée par IA

1. Contexte et points clés

L'équipe de recherche Qwen d'Alibaba a officiellement dévoilé Qwen3.8-Omni-Flash, son tout premier modèle omnimodal conçu autour de capacités agentiques natives. Rompant avec les approches disparates associant des encodeurs indépendants, Qwen3.8-Omni-Flash intègre nativement la compréhension du texte, des images, de l'audio et de la vidéo pour générer des réponses textuelles unifiées. Sa dynamique opérationnelle repose sur une chaîne d'action directe : analyser le contenu multimédia, planifier la tâche, exécuter des outils externes et restituer le résultat.

Le modèle est déployé immédiatement sous forme d'API hébergée sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, sans publication de poids ouverts lors du lancement. Doté d'une fenêtre de contexte d'un million de jetons (jusqu'à 991 000 jetons en entrée, 131 000 en sortie et un raisonnement maximal de 262 000 jetons) avec activation par défaut du mode de réflexion approfondie (reasoning_effort: xhigh), Qwen3.8-Omni-Flash cible le traitement en temps réel de flux multimédias massifs en entreprise.

2. Aspects techniques saillants

Qwen3.8-Omni-Flash s'appuie sur l'architecture Qwen3.8-Flash-Next, dont le modèle de base a été publié en poids ouverts en août 2026. Cette optimisation structurelle garantit une latence d'inférence minime tout en conservant une grande rigueur de raisonnement sur les flux de données volumineux. L'API prend en charge le protocole DashScope ainsi que les spécifications standard d'OpenAI (Chat Completions et Responses API), offrant un support direct des appels de fonctions, de la recherche web, de la mise en cache contextuelle et du traitement par lots.

Communauté Officielle IAExpertos
Actualités IA en direct et bons plans tech exclusifs.
🔥 -47%
Chargeur Rapide UGREEN Nexode Pro 100W USB-C GaN avec Écran TFT
RECOMMANDÉ POUR VOUS Chargeur Rapide UGREEN Nexode Pro 100W USB-C GaN avec Écran TFT

En matière d'ingestion média, le modèle traite des vidéos d'une durée maximale de 2 heures et de 2 Go via URL, avec un échantillonnage stable jusqu'à 15 images par seconde. Côté audio, il gère des enregistrements allant jusqu'à 3 heures dans 113 langues et dialectes, intégrant la gestion native de l'audio spatial à quatre canaux (First-Order Ambisonics, FOA) et de la stéréo binaurale via le paramètre use_multichannel.

3. Répercussions sur le secteur et perception agentique vidéo

Les systèmes d'analyse vidéo conventionnels souffrent d'une inefficacité majeure : ils ingèrent séquentiellement chaque trame d'une vidéo longue, gaspillant des dizaines de milliers de jetons même lorsque la réponse recherchée se situe dans un passage de quelques secondes. Qwen3.8-Omni-Flash surmonte cet écueil grâce à un mécanisme de perception agentique guidé par la requête (coarse-to-fine) : le modèle explore les horodatages, sélectionne les extraits sonores et visuels cruciaux et concentre ses jetons sur les segments pertinents.

Sur le benchmark de référence OmniVideoBench, la précision s'élève de 63,4 % à 67,8 %, tandis que la consommation de jetons chute de 45,7 % (passant de 145 736 à 79 117 jetons). Cette économie drastique de calcul rend enfin rentable l'analyse systématique de longs webinaires, flux de caméras de sécurité et cours magistraux.

4. Perspectives de marché et benchmarks comparatifs

Dans les 29 évaluations techniques publiées par Alibaba, Qwen3.8-Omni-Flash enregistre un gain moyen de plus de 25 % par rapport à Qwen3.5-Omni-Plus. On observe notamment des bonds de 36,5 points sur WildClawBench-MM, de 22,3 points sur AgenticVBench, une note de 69,6 sur UniClawBench ainsi que des progrès sensibles sur LongAudioSpan (+8,3 points) et OmniVideoBench (+9,6 points). Les chercheurs d'Alibaba soulignent que ses capacités audiovisuelles rivalisent avec Gemini 3.8 Flash de Google, le devançant même en traitement acoustique pur.

Sur le plan tarifaire, QwenCloud applique une grille ultra-compétitive : 0,15 dollar par million de jetons d'entrée et 0,47 dollar par million de jetons de sortie, avec un coût de seulement 0,016 dollar par million de jetons en cache. Cela représente une baisse de coût horaire de plus de 98 % sur l'audio et de plus de 93 % sur les flux audiovisuels comparé à Qwen3.5-Omni-Plus (~89 % d'économie en vidéo).

5. Prochaines étapes et écosystème open source Qwen-MM-Plugins

Le modèle renvoyant du texte, la manipulation directe des fichiers multimédias repose sur des extensions d'outils. Alibaba a ainsi publié sous licence Apache-2.0 la suite Qwen-MM-Plugins et le banc d'exécution Qwen-Live. Conçu pour rendre tout agent nativement multimodal, ce projet propose des Skills et des serveurs MCP compatibles avec Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.

Parmi les démonstrateurs opérationnels figurent omni-memory (indexation mémorielle audiovisuelle de vidéos longues), omni-video2note (génération automatique de guides PDF illustrés à partir de vidéos) et omni-chatcut (montage vidéo, sous-titrage et traduction avec conservation vocale). Cet écosystème favorise une intégration industrielle immédiate sans barrières logicielles propriétaires.

6. Conclusion et évaluation

L'arrivée de Qwen3.8-Omni-Flash marque une étape charnière dans l'IA appliquée. En conjuguant une fenêtre d'un million de jetons avec un ciblage agentique sélectif, Alibaba démontre que l'avenir des modèles multimodaux repose sur l'efficience décisionnelle : regarder, écouter et agir avec pertinence plutôt que saturer aveuglément les architectures de calcul.

Comparatif technique : Qwen3.8-Omni-Flash vs Modèles Multimodaux Traditionnels
Fonctionnalité Qwen3.8-Omni-Flash (Alibaba) Modèles Multimodaux Traditionnels
Modalités d’Entrée Omnimodal Natif (Texte, Image, Audio, Vidéo) Bimodal / Texte et Image (Décodeurs audio/vidéo externes)
Fenêtre de Contexte 1 Million de Jetons (991k entrée / 131k sortie) 128k – 1M Jetons (Ingestion séquentielle trame par trame)
Optimisation Vidéo Longue Perception Coarse-to-Fine (-45,7 % jetons sur OmniVideoBench) Ingestion linéaire exhaustive à coût élevé
Traitement Audio 113 langues, Audio spatial FOA et stéréo (jusqu’à 3h) Monocanal standard, couverture de 20 à 30 langues
Raisonnement et Outils Thinking activé par défaut (xhigh) + Qwen-MM-Plugins (MCP) Appels de fonctions basiques sans repères spatio-temporels
Tarification Entrée / Sortie 0,15 $ / 0,47 $ par 1M jetons (>93 % d’économie vs 3.5-Omni) Tarifs standard dépassant 1,50 $ / 5,00 $ par 1M jetons
Source Originale & Référence Technique
marktechpost.com
Vérification Éditoriale
Publication vérifiée sur marktechpost.com
Consulter la source officielle

Engagement éditorial d'IAExpertos.net

Cet article a été préparé par l'équipe éditoriale d'IAExpertos.net à partir de sources d'information et de documentation vérifiées. À partir de celles-ci, nous utilisons des outils d'intelligence artificielle pour structurer, développer et contextualiser l'information. Avant publication, tout le contenu est révisé et validé par l'équipe éditoriale.

Slot Unique Intelligent IAExpertos.net
Parrainage B2B Exclusif Banner
Watermark
IAExpertos Logo

Parrainage B2B Exclusif

Un seul sponsor. Espace publicitaire exclusif intégré à notre écosystème technologique auprès des professionnels et décideurs. 200 €/mois sans engagement.

Voir le Parrainage Exclusif
🔥

Offres Exclusives Tech sur Amazon

Réductions Actives
IAExpertos Logo

Canal Telegram Officiel

Rejoignez notre canal pour recevoir les dernières actualités sur l'IA et des offres exclusives de matériel et technologie.

IAExpertos Logo

Canal WhatsApp Officiel

Suivez notre canal WhatsApp pour recevoir des alertes IA en direct et des offres tech recommandées par IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.