Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Inteligência Artificial 18/09/2026

Alibaba Qwen lança o Qwen3.8-Omni-Flash: modelo omnimodal com contexto de 1M para compreensão agêntica de áudio e vídeo

Alibaba Qwen lança o Qwen3.8-Omni-Flash: modelo omnimodal com contexto de 1M para compreensão agêntica de áudio e vídeo Gerada por IA

1. Contexto e Pontos-Chave

A equipe de pesquisa Qwen da Alibaba oficializou o lançamento do Qwen3.8-Omni-Flash, apresentado como seu primeiro modelo omnimodal estruturado nativamente em torno de recursos agênticos. Superando arquiteturas fragmentadas que acoplam módulos de visão e áudio desconectados, o Qwen3.8-Omni-Flash ingere diretamente texto, imagens, áudio e vídeo, gerando saídas de texto estruturadas. Seu princípio operacional consolida um ciclo direto: compreender o material multimídia, planejar a tarefa, acionar ferramentas externas e entregar o resultado final.

O modelo está disponível imediatamente de forma exclusiva como API hospedada no QwenCloud, Alibaba Cloud Model Studio e Qwen Studio, sem liberação de pesos abertos no lançamento inicial. Com uma janela de contexto ampla de 1 milhão de tokens (até 991.000 tokens de entrada, 131.000 de saída e limite de raciocínio de 262.000 tokens) e processamento deliberativo ativado por padrão em nível intensivo (reasoning_effort: xhigh), o Qwen3.8-Omni-Flash foi desenhado para fluxos de trabalho empresariais complexos.

2. Aspectos Técnicos Destacados

O Qwen3.8-Omni-Flash é desenvolvido sobre a arquitetura base Qwen3.8-Flash-Next, cujos pesos abertos foram introduzidos em agosto de 2026. Essa base confere ao modelo latência de inferência extremamente reduzida, processando grandes fluxos de áudio e vídeo sem perder o alinhamento lógico. A API segue tanto os padrões do DashScope quanto as especificações oficiais da OpenAI (Chat Completions e Responses API), garantindo suporte imediato a chamadas de funções (tool use), buscas na web, cache de contexto implícito e processamento em lote.

Comunidade Oficial IAExpertos
Notícias de IA em tempo real e ofertas tech exclusivas.
🔥 -78%
Capa Apple com MagSafe para iPhone Air - Gelo
RECOMENDADO PARA VOCÊ Capa Apple com MagSafe para iPhone Air - Gelo

Os limites de ingestão suportam arquivos de vídeo de até 2 horas de duração e 2 GB via URL, operando estavelmente com taxas de amostragem de até 15 fps. Na análise sonora, processa áudios de até 3 horas em 113 idiomas e dialetos, fornecendo suporte nativo para áudio espacial em quatro canais (First-Order Ambisonics, FOA) e estéreo binaural por meio do parâmetro use_multichannel.

3. Repercussão no Setor e Percepção Agêntica de Vídeo

A análise convencional de vídeos em inteligência artificial sempre esbarrou no alto custo de computação ao ler linearmente cada quadro de uma gravação extensa, consumindo dezenas de milhares de tokens mesmo quando o ponto crucial dura poucos segundos. O Qwen3.8-Omni-Flash supera essa limitação adotando uma percepção agêntica orientada pela pergunta (coarse-to-fine): o agente identifica os pontos temporais críticos, seleciona os trechos para assistir e ouvir com detalhe e direciona os tokens apenas para os segmentos relevantes.

No benchmark OmniVideoBench, a acurácia subiu de 63,4% para 67,8%, enquanto o uso de tokens despencou 45,7% (caindo de 145.736 para 79.117 tokens). Essa eficiência transforma a viabilidade econômica do monitoramento de conferências, câmeras corporativas e tutoriais técnicos de longa duração.

4. Perspectivas de Mercado e Resultados em Benchmarks

Nas 29 avaliações padronizadas reportadas pela Alibaba, o Qwen3.8-Omni-Flash exibe uma evolução média superior a 25% frente ao Qwen3.5-Omni-Plus. Destacam-se ganhos expressivos de 36,5 pontos no WildClawBench-MM, 22,3 pontos no AgenticVBench, nota de 69,6 no UniClawBench e progressos consistentes no LongAudioSpan (+8,3 pontos) e OmniVideoBench (+9,6 pontos). Os pesquisadores relatam desempenho audiovisual pareado ao Gemini 3.8 Flash da Google, superando-o em processamento auditivo avançado.

Em termos de custos, o QwenCloud estabeleceu preços altamente atrativos: 0,15 dólares por milhão de tokens de entrada e 0,47 dólares por milhão de tokens de saída, com o milhão de tokens em cache custando apenas 0,016 dólares. Em comparação com o Qwen3.5-Omni-Plus, a economia horária supera 98% no processamento de áudio e 93% em fluxos audiovisuais combinados (~89% de redução em vídeo).

5. Próximos Passos e Ferramentas Open Source Qwen-MM-Plugins

Como o modelo produz respostas em texto, as ações sobre mídias e arquivos locais são gerenciadas por extensões de software. A Alibaba disponibilizou sob licença Apache-2.0 a coleção Qwen-MM-Plugins e o harness de execução Qwen-Live. Criado sob o propósito de tornar qualquer agente multimodal de forma nativa, o projeto é distribuído como Skills e servidores MCP integráveis a ferramentas como Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code e Gemini CLI.

Os módulos disponibilizados incluem o omni-memory (construção de memória audiovisual indexável de vídeos longos), omni-video2note (geração de notas e relatórios em PDF ilustrado a partir de videoaulas) e omni-chatcut (tradução e edição de vídeo com preservação da voz original). Essa abertura capacita a comunidade técnica a criar agentes eficientes sem dependências proprietárias rígidas.

6. Conclusão e Avaliação

O lançamento do Qwen3.8-Omni-Flash consolida um marco na engenharia de modelos de IA. Ao unir uma janela de 1 milhão de tokens à capacidade de explorar mídias de maneira agêntica e seletiva, a Alibaba demonstra que o horizonte dos agentes inteligentes depende de saber exatamente onde olhar, o que escutar e quais ferramentas executar com máxima precisão computacional.

Comparativo de Recursos: Qwen3.8-Omni-Flash vs Modelos Multimodais Convencionais
Recurso Qwen3.8-Omni-Flash (Alibaba) Modelos Multimodais Convencionais
Modalidades de Entrada Omnimodal Nativo (Texto, Imagem, Áudio, Vídeo) Bimodal / Texto e Imagem (Decodificadores externos de áudio)
Janela de Contexto 1 Milhão de Tokens (991k entrada / 131k saída) 128k – 1M Tokens (Ingestão sequencial de quadros)
Otimização em Vídeo Longo Percepção Coarse-to-Fine (-45,7% tokens no OmniVideoBench) Ingestão sequencial exaustiva de alto custo
Capacidade de Áudio 113 idiomas/dialetos, Estéreo e Áudio Espacial FOA (até 3h) Monocanal padrão com suporte a 20-30 idiomas
Raciocínio e Ferramentas Thinking ativado por padrão (xhigh) + Qwen-MM-Plugins (MCP) Chamada de funções básica sem memória temporal ou espacial
Preços de Entrada / Saída $0.15 / $0.47 por 1M tokens (>93% economia vs 3.5-Omni) Valores superiores a $1.50 / $5.00 por 1M tokens
Fonte Original & Referência Técnica
marktechpost.com
Verificação Editorial
Publicação verificada em marktechpost.com
Consultar fonte oficial

Compromisso editorial do IAExpertos.net

Este artigo foi elaborado pela equipe editorial do IAExpertos.net com base em fontes informativas e documentação verificadas. A partir delas, utilizamos ferramentas de inteligência artificial para estruturar, ampliar e contextualizar as informações. Antes da publicação, todo o conteúdo é revisado e validado pela equipe editorial.

Parceiros IAExpertos.net
BuscoMovil.es Banner

BuscoMovil.es

O comparador inteligente dos smartphones mais potentes do mercado. Encontre as melhores ofertas em segundos.

Visitar Buscomovil.es
🔥

Ofertas Exclusivas de Tecnologia na Amazon

Descontos Ativos
IAExpertos Logo

Canal Oficial do Telegram

Junte-se ao nosso canal para receber as últimas notícias de IA e ofertas exclusivas de hardware e tecnologia.

IAExpertos Logo

Canal Oficial do WhatsApp

Siga o nosso canal do WhatsApp para alertas em tempo real e ofertas tech exclusivas recomendadas pela IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.