Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Inteligencia Artificial 18/9/2026

Alibaba Qwen lanza Qwen3.8-Omni-Flash: modelo omnimodal con contexto de 1M para comprensión agéntica de audio y vídeo

Alibaba Qwen lanza Qwen3.8-Omni-Flash: modelo omnimodal con contexto de 1M para comprensión agéntica de audio y vídeo Generada con IA

1. Contexto y Puntos Clave

El equipo de investigación de Qwen en Alibaba ha presentado oficialmente Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado específicamente en torno a flujos agénticos autónomos. A diferencia de las aproximaciones convencionales que concatenan múltiples modelos especializados o codificadores desacoplados, Qwen3.8-Omni-Flash unifica la percepción de texto, imágenes, audio y vídeo dentro de una única arquitectura de inferencia con salida en texto. Su paradigma operativo redefine la automatización multimodal bajo una consigna directa: comprender el contenido, planificar la tarea, ejecutar mediante llamadas a herramientas y entregar el resultado final.

El modelo se encuentra disponible de forma inmediata exclusivamente como API alojada a través de QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, sin liberación de pesos abiertos en su lanzamiento inicial. Con una ventana de contexto masiva de 1 millón de tokens (hasta 991.000 tokens de entrada, 131.000 de salida y 262.000 tokens de longitud de razonamiento) y razonamiento en cadena (thinking) activado por defecto en modo intensivo (reasoning_effort: xhigh), Qwen3.8-Omni-Flash busca transformar la interacción en tiempo real con archivos multimedia extensos en entornos empresariales.

2. Aspectos Técnicos Destacados

Qwen3.8-Omni-Flash está construido sobre la arquitectura fundacional Qwen3.8-Flash-Next, cuyos pesos base fueron introducidos en agosto de 2026. Esta base optimizada le permite mantener una latencia ultrabaja en flujos interactivos mientras procesa secuencias masivas de audio y vídeo de alta fidelidad. La interfaz es totalmente compatible tanto con el protocolo nativo DashScope como con la API estándar de OpenAI (Chat Completions y Responses API), garantizando soporte directo para function calling estructurado, búsquedas web en vivo, context caching implícito y llamadas por lotes (batching).

Comunidad Oficial IAExpertos
Alertas de última hora en IA y chollos tech exclusivos en tiempo real.
🔥 -41%
Micrófono de Condensador USB Elgato Wave:3 para Streaming y Podcast
RECOMENDADO PARA TI Micrófono de Condensador USB Elgato Wave:3 para Streaming y Podcast

En el plano sensorial, el modelo admite vídeos de hasta 2 horas de duración y 2 GB transmitidos mediante URL con muestreo estable de hasta 15 fotogramas por segundo. En el procesamiento sonoro, admite archivos de audio de hasta 3 horas en 113 idiomas y dialectos globales, incorporando soporte nativo para audio espacial de cuatro canales (First-Order Ambisonics, FOA) y estéreo binaural mediante el parámetro use_multichannel, lo que abre la puerta a análisis acústicos y espaciales sin precedentes en la industria.

3. Percepción Agéntica y Eficiencia en Vídeo Largo

Uno de los mayores cuellos de botella en la IA multimodal tradicional radica en la ingesta lineal y forzada de cada fotograma de un vídeo largo, consumiendo decenas de miles de tokens de cálculo aun cuando la información requerida reside en unos pocos segundos de metraje. Frente a este desafío, Qwen3.8-Omni-Flash introduce una arquitectura de percepción agéntica guiada por la pregunta (coarse-to-fine): el modelo formula primero hipótesis exploratorias, decide qué segmentos temporales observar y escuchar con mayor granularidad, y asigna el presupuesto de computación exclusivamente a los fragmentos determinantes.

Los resultados empíricos reportados en el benchmark especializado OmniVideoBench confirman la superioridad de este enfoque: la precisión del modelo se incrementa de un 63,4% a un 67,8%, al tiempo que el consumo de tokens se desploma un 45,7% (pasando de 145.736 a solo 79.117 tokens). Esta eficiencia no solo acelera la velocidad de respuesta, sino que convierte en económicamente viable el análisis exhaustivo de conferencias, grabaciones de seguridad, transmisiones deportivas y tutoriales técnicos de larga duración.

4. Rendimiento en Benchmarks y Disrupción Económica

En las evaluaciones iniciales publicadas por Alibaba a lo largo de 29 bancos de pruebas, Qwen3.8-Omni-Flash logra una mejora media superior al 25% respecto a su predecesor Qwen3.5-Omni-Plus. Destacan incrementos notables de 36,5 puntos en WildClawBench-MM, 22,3 puntos en AgenticVBench, una puntuación consolidada de 69,6 en UniClawBench (+19,5 puntos de media en capacidades agénticas) y avances de 8,3 y 9,6 puntos en LongAudioSpan y OmniVideoBench respectivamente. Los equipos de Alibaba afirman que su rendimiento audiovisual se sitúa a la par de Gemini 3.8 Flash de Google, superándolo en tareas complejas de procesamiento acústico.

En términos de costes operativos, QwenCloud ha fijado tarifas extraordinariamente competitivas: 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida, con un coste de apenas 0,016 dólares por millón de tokens en aciertos de caché. Frente a Qwen3.5-Omni-Plus, esto representa una reducción de costes superior al 98% por hora de entrada de audio y más del 93% en entradas audiovisuales combinadas (~89% de ahorro en vídeo), redefiniendo la economía de escala para los proveedores de software empresarial.

5. Ecosistema Abierto: Qwen-MM-Plugins y Soporte MCP

Para complementar las capacidades del modelo en texto con acciones directas sobre medios locales, Alibaba ha liberado bajo licencia Apache-2.0 el proyecto Qwen-MM-Plugins junto con el harness de ejecución Qwen-Live. Diseñado bajo el lema de dotar a cualquier agente de capacidades multimodales nativas, el proyecto se distribuye como Skills y servidores MCP (Model Context Protocol) instalables mediante un asistente unificado compatible con Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.

Entre los módulos liberados destacan omni-memory (para estructurar memoria indexable audiovisual de vídeos de larga duración), omni-video2note (conversión automatizada de tutoriales de vídeo en manuales PDF ilustrados) y omni-chatcut (montaje audiovisual, sincronización musical y traducción con conservación de la voz del hablante). Esta apertura facilita que los desarrolladores orquesten agentes capaces de interactuar con hardware local y APIs en la nube con mínimas líneas de código.

6. Conclusión y Valoración Estratégica

El lanzamiento de Qwen3.8-Omni-Flash marca un punto de inflexión en la convergencia entre modelos de lenguaje, visión y audio. Al combinar un contexto de 1 millón de tokens con percepción agéntica selectiva, Alibaba demuestra que la verdadera ventaja competitiva de la IA no reside en procesar ciegamente terabytes de vídeo, sino en dotar a los agentes de la inteligencia necesaria para decidir dónde mirar, qué escuchar y cómo ejecutar herramientas de software con precisión quirúrgica.

Comparativa de Capacidades: Qwen3.8-Omni-Flash vs Modelos Multimodales Convencionales
Característica Qwen3.8-Omni-Flash (Alibaba) Modelos Multimodales Convencionales
Modalidades de Entrada Omnimodal Nativo (Texto, Imagen, Audio, Vídeo) Bimodal / Texto e Imagen (Audio/Vídeo desacoplado)
Ventana de Contexto 1 Millón de Tokens (991k entrada / 131k salida) 128k – 1M Tokens (ingesta frame a frame)
Optimización en Vídeo Largo Percepción Coarse-to-Fine (-45,7% tokens en OmniVideoBench) Ingesta secuencial exhaustiva y costosa
Capacidad de Audio 113 idiomas/dialectos, estéreo y audio espacial FOA (hasta 3h) Monocanal estándar, cobertura de 20-30 idiomas
Razonamiento y Herramientas Thinking por defecto (xhigh) + Qwen-MM-Plugins (MCP) Llamadas a funciones básicas sin memoria espacial
Precios de Entrada / Salida $0.15 / $0.47 por 1M tokens (>93% ahorro vs 3.5-Omni) Tarifas superiores a $1.50 / $5.00 por 1M tokens
Fuente Original y Referencia Técnica
marktechpost.com
Verificación Editorial
Publicación contrastada en marktechpost.com
Consultar fuente oficial

Compromiso editorial de IAExpertos.net

Este artículo ha sido elaborado por el equipo editorial de IAExpertos.net tomando como punto de partida fuentes informativas y documentación verificadas. A partir de ellas, utilizamos herramientas de inteligencia artificial para estructurar, ampliar y contextualizar la información. Antes de su publicación, todo el contenido es revisado y validado por el equipo editorial.

Partners IAExpertos.net
BuscoMovil.es Banner

BuscoMovil.es

El comparador inteligente de los smartphones más potentes del mercado. Encuentra las mejores ofertas de las marcas líderes.

Visitar Buscomovil.es
🔥

Ofertas Exclusivas de Tecnología en Amazon

Descuentos Activos
IAExpertos Logo

Canal Oficial de Telegram

Únete a nuestro canal para recibir las últimas noticias sobre IA y ofertas exclusivas de hardware y tecnología recomendadas por IAExpertos.

IAExpertos Logo

Canal Oficial de WhatsApp

Sigue nuestro canal de WhatsApp para recibir alertas en tiempo real y chollos tech exclusivos recomendados por IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.