Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Intelligenza Artificiale 18/09/2026

Alibaba Qwen lancia Qwen3.8-Omni-Flash: modello omnimodale con contesto da 1M per comprensione agentica di audio e video

Alibaba Qwen lancia Qwen3.8-Omni-Flash: modello omnimodale con contesto da 1M per comprensione agentica di audio e video Generata da IA

1. Contesto e Punti Chiave

Il team di ricerca Qwen di Alibaba ha presentato ufficialmente Qwen3.8-Omni-Flash, il suo primo modello omnimodale sviluppato nativamente attorno a capacità agentiche avanzate. Superando le architetture frammentate che collegano moduli visivi e audio separati, Qwen3.8-Omni-Flash elabora direttamente input testuali, visivi, vocali e video, generando risposte testuali strutturate. Il suo paradigma operativo stabilisce un flusso agentico continuo: comprendere il materiale multimediale, pianificare l'attività, richiamare strumenti esterni ed erogare il risultato verificato.

Il modello è accessibile immediatamente in modalità API ospitata su QwenCloud, Alibaba Cloud Model Studio e Qwen Studio, senza pesi aperti disponibili al momento del rilascio. Con un'ampia finestra di contesto di 1 milione di token (fino a 991.000 token di input, 131.000 di output e 262.000 token di lunghezza di ragionamento) e modalità di riflessione (thinking) attiva di default in modalità intensiva (reasoning_effort: xhigh), Qwen3.8-Omni-Flash è ottimizzato per carichi di lavoro multimediali complessi in ambito enterprise.

2. Aspetti Tecnici di Rilievo

Qwen3.8-Omni-Flash si basa sull'architettura Qwen3.8-Flash-Next, i cui pesi di base sono stati rilasciati ad agosto 2026. Tale struttura garantisce una latenza di inferenza eccezionalmente bassa, consentendo l'elaborazione di flussi audio e video prolungati senza degradazione del ragionamento. L'API supporta pienamente sia il protocollo DashScope sia lo standard OpenAI (Chat Completions e Responses API), garantendo compatibilità immediata con function calling, ricerca web in tempo reale, context caching implicito e chiamate in batch.

Community Ufficiale IAExpertos
Notizie IA in tempo reale e offerte tech esclusive.
🔥 -49%
Cuffie Wireless Cancellazione Attiva del Rumore Anker Soundcore Life Q30
CONSIGLIATO PER TE Cuffie Wireless Cancellazione Attiva del Rumore Anker Soundcore Life Q30

Per quanto riguarda l'ingestione multimediale, il modello gestisce video fino a 2 ore di durata e 2 GB via URL, mantenendo stabilità fino a 15 fps. Nel comparto acustico, elabora tracce fino a 3 ore in 113 lingue e dialetti, includendo il supporto nativo per l'audio spaziale a 4 canali (First-Order Ambisonics, FOA) e stereo tramite il parametro use_multichannel.

3. Impatto sul Settore e Percezione Agentica Video

I modelli di intelligenza artificiale convenzionali impiegati nell'analisi video soffrono di una forte inefficienza: leggono linearmente ogni singolo fotogramma di lunghe registrazioni, consumando decine di migliaia di token anche quando l'informazione richiesta risiede in una clip di pochi secondi. Qwen3.8-Omni-Flash supera questo limite introducendo una percezione agentica guidata dalla domanda (coarse-to-fine): l'agente individua i timestamp rilevanti, seleziona i segmenti audiovisivi da approfondire e concentra i token esclusivamente sulle sequenze decisive.

I risultati riportati sul benchmark OmniVideoBench confermano l'efficacia di questo approccio: l'accuratezza sale dal 63,4% al 67,8%, mentre il consumo di token crolla del 45,7% (passando da 145.736 a 79.117 token). Questo risparmio rende economicamente scalabile l'analisi di webinar, sistemi di videosorveglianza e lezioni prolungate.

4. Prospettive di Mercato e Benchmark

Nelle 29 valutazioni tecniche condotte da Alibaba, Qwen3.8-Omni-Flash fa registrare un miglioramento medio superiore al 25% rispetto a Qwen3.5-Omni-Plus. Spiccano incrementi di 36,5 punti su WildClawBench-MM, 22,3 punti su AgenticVBench, un punteggio di 69,6 su UniClawBench e progressi rilevanti su LongAudioSpan (+8,3 punti) e OmniVideoBench (+9,6 punti). I tecnici di Alibaba evidenziano come le performance audiovisive siano comparabili a Gemini 3.8 Flash di Google, superandolo nell'analisi acustica pura.

Sul fronte economico, QwenCloud ha annunciato tariffe molto aggressive: 0,15 dollari per milione di token in ingresso e 0,47 dollari per milione in uscita, con le letture in cache a soli 0,016 dollari. Rispetto a Qwen3.5-Omni-Plus, ciò si traduce in un abbattimento dei costi orari superiore al 98% per l'audio e oltre il 93% per i flussi audiovisivi combinati (~89% di risparmio su video).

5. Prossimi Passi ed Ecosistema Open Source Qwen-MM-Plugins

Poiché il modello fornisce output testuali, le operazioni dirette sui file multimediali sono affidate a tool esterni. Alibaba ha rilasciato sotto licenza Apache-2.0 la suite Qwen-MM-Plugins e l'harness di esecuzione Qwen-Live. Progettato con l'obiettivo di rendere qualsiasi agente nativamente multimodale, il progetto include Skill e server MCP (Model Context Protocol) compatibili con Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code e Gemini CLI.

Tra i plugin disponibili figurano omni-memory (memorizzazione audiovisiva indicizzabile di video lunghi), omni-video2note (trascrizione e generazione di dispense PDF illustrate) e omni-chatcut (montaggio, traduzione con clonazione vocale e sintesi di clip). Questo ecosistema aperto permette agli sviluppatori di implementare soluzioni agentiche senza vincoli proprietari.

6. Conclusione e Valutazione

Il lancio di Qwen3.8-Omni-Flash segna un momento decisivo nell'evoluzione dell'IA omnimodale. Unendo una finestra di contesto da 1 milione di token a una percezione agentica mirata, Alibaba dimostra che la vera leadership tecnologica risiede nell'efficienza: comprendere, selezionare ed eseguire strumenti software con precisione chirurgica.

Confronto delle Funzionalità: Qwen3.8-Omni-Flash vs Modelli Multimodali Tradizionali
Funzionalità Qwen3.8-Omni-Flash (Alibaba) Modelli Multimodali Tradizionali
Modalità di Input Omnimodale Nativo (Testo, Immagine, Audio, Video) Bimodale / Testo e Immagine (Decoder esterni per audio/video)
Finestra di Contesto 1 Milione di Token (991k input / 131k output) 128k – 1M Token (Ingestione sequenziale fotogramma per fotogramma)
Ottimizzazione Video Lunghi Percezione Coarse-to-Fine (-45,7% token su OmniVideoBench) Ingestione lineare completa con elevato consumo di token
Elaborazione Audio 113 lingue, Stereo e Audio Spaziale FOA a 4 canali (fino a 3h) Monocanale standard limitato a 20-30 lingue principali
Ragionamento e Tool Use Thinking attivo di default (xhigh) + Qwen-MM-Plugins (MCP) Chiamate a funzioni elementari prive di coordinate spaziali
Prezzi di Input / Output $0.15 / $0.47 per 1M token (>93% di risparmio vs 3.5-Omni) Tariffe standard superiori a $1.50 / $5.00 per 1M token
Fonte Originale & Riferimento Tecnico
marktechpost.com
Verifica Editoriale
Pubblicazione verificata su marktechpost.com
Consulta la fonte ufficiale

Impegno editoriale di IAExpertos.net

Questo articolo è stato preparato dal team editoriale di IAExpertos.net sulla base di fonti informative e documentazione verificate. A partire da queste, utilizziamo strumenti di intelligenza artificiale per strutturare, ampliare e contestualizzare le informazioni. Prima della pubblicazione, tutti i contenuti sono revisionati e validati dal team editoriale.

Slot Unico Intelligente IAExpertos.net
Sponsorizzazione B2B Esclusiva Banner
Watermark
IAExpertos Logo

Sponsorizzazione B2B Esclusiva

Un unico sponsor. Spazio pubblicitario esclusivo integrato nel nostro ecosistema tecnologico davanti a professionisti e decisori. 200 €/mese senza vincoli.

Vedi Sponsorizzazione Esclusiva
🔥

Offerte Esclusive Tech su Amazon

Sconti Attivi
IAExpertos Logo

Canale Telegram Ufficiale

Unisciti al nostro canale per ricevere le ultime notizie sull'IA e offerte esclusive su hardware e tecnologia.

IAExpertos Logo

Canale WhatsApp Ufficiale

Segui il nostro canale WhatsApp per avvisi IA in tempo reale e offerte tech esclusive consigliate da IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.