Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Tecnologia 07/09/2026

A H Company lança o NeoMME: A arquitetura de codificador multimodal de torre única que redefine a eficiência na recuperação visual

A H Company lança o NeoMME: A arquitetura de codificador multimodal de torre única que redefine a eficiência na recuperação visual Gerada por IA

1. Contexto e Pontos-Chave

A indústria de inteligência artificial tem sido dominada por arquiteturas multimodais complexas que dependem de torres de visão pré-treinadas e decodificadores causais pesados. A H Company quebrou esse molde com o lançamento do NeoMME, uma família de codificadores multimodais de torre única (260M e 800M) que processam texto multilíngue e patches de imagem brutos de 32x32 dentro de um único Transformer. Essa abordagem simplificada não apenas reduz a complexidade computacional, mas otimiza drasticamente a capacidade de recuperação de informação.

Para líderes tecnológicos e arquitetos de sistemas, o NeoMME representa uma mudança de paradigma em direção à eficiência extrema. Com uma capacidade de compressão de índice de 255x e um desempenho de 51,3 páginas por segundo em uma única GPU L40S, esta tecnologia é uma solução prática para empresas que buscam escalar sistemas de recuperação visual (V-RAG) sem incorrer nos custos proibitivos de infraestrutura associados aos modelos de visão-linguagem (VLM) de grande escala.

Comunidade Oficial IAExpertos
Notícias de IA em tempo real e ofertas tech exclusivas.
🔥 -57%
Coluna Portátil Bluetooth Skullcandy Terrain Mini IPX7
RECOMENDADO PARA VOCÊ Coluna Portátil Bluetooth Skullcandy Terrain Mini IPX7

2. Aspectos Técnicos Destacados

A inovação central do NeoMME reside em sua arquitetura minimalista. Diferente dos sistemas de recuperação tipo ColPali, que frequentemente exigem uma torre de visão externa para projetar patches de imagem no espaço latente de um LLM, o NeoMME integra o processamento de patches de imagem de 32x32 diretamente em seu Transformer bidirecional. Ao eliminar a torre de visão e o decodificador causal, o modelo se liberta da carga de gerar texto, focando exclusivamente na representação vetorial de alta fidelidade.

O objetivo de pré-treinamento do NeoMME utiliza uma técnica de difusão discreta mascarada. Essa abordagem permite que o modelo aprenda representações robustas tanto de texto quanto de dados visuais sem a necessidade de um alinhamento explícito por meio de camadas de projeção complexas. Ao tratar os patches de imagem como tokens dentro da sequência, o modelo alcança uma coerência semântica superior entre modalidades, facilitando uma recuperação mais precisa em ambientes multilíngues. Em termos de desempenho, os resultados no benchmark ViDoRe v3 são reveladores. O modelo de 260M alcança um nDCG@10 de 0,523. Essa eficiência se traduz em uma capacidade de indexação de 51,3 páginas por segundo em hardware de classe L40S, o que permite às organizações processar volumes massivos de documentos visuais com uma fração do custo energético e de computação habitual. Contudo, o NeoMME está otimizado para a recuperação multimodal e não como um substituto generalista para tarefas de processamento de linguagem natural (NLP) puro.

3. Repercussão no Setor

A chegada do NeoMME altera a economia dos sistemas de recuperação de documentos. Até o momento, as empresas que implementavam sistemas de recuperação visual precisavam gerenciar o custo de manter torres de visão pesadas e decodificadores que, frequentemente, permaneciam ociosos durante a fase de indexação. O NeoMME permite uma arquitetura de "apenas codificador" que é significativamente mais eficiente em termos operacionais e de implantação.

Para o mercado de IA empresarial, a barreira de entrada para implementar sistemas de busca visual sobre documentos complexos é reduzida drasticamente. A concorrência com modelos como os da família Claude (Claude Opus 5) ou GPT-5.6 Sol torna-se interessante. Enquanto esses modelos de linguagem de grande escala são excelentes para o raciocínio, o NeoMME se posiciona como o motor de busca especializado que alimenta esses modelos. As empresas que já utilizam Llama 4 ou modelos da série Qwen 3.8-Max para suas aplicações de IA encontrarão no NeoMME um componente complementar ideal, otimizando o custo total de propriedade (TCO) da solução completa.

4. Perspectivas de Mercado

O consenso técnico aponta que a tendência em direção à especialização de modelos é inevitável. A era dos modelos "tudo em um" está dando lugar a arquiteturas modulares onde cada componente é otimizado para uma tarefa específica. Recomenda-se que as organizações avaliem o NeoMME não como um substituto de seus modelos de linguagem atuais, mas como uma camada de indexação e recuperação. A estratégia técnica para o final de 2026 consiste em desacoplar a recuperação da geração. Utilizar o NeoMME para encontrar a informação relevante e, em seguida, passar esses fragmentos para um modelo de raciocínio de alto nível como Claude Mythos 5.1 ou GPT-6 Astra é a arquitetura de referência para sistemas RAG de próxima geração.

5. Roteiro e Predições

A curto prazo, esperamos ver uma adoção rápida do NeoMME em setores com alta densidade de documentos visuais, como o jurídico, o financeiro e o de engenharia. Para o início de 2027, é provável que vejamos uma integração mais profunda dessas técnicas de difusão discreta em outros modelos de codificação. Prevemos que a H Company lançará versões otimizadas para a borda (Edge) do NeoMME, aproveitando seu baixo consumo de recursos, o que permitiria capacidades de busca visual local em dispositivos móveis ou servidores locais, reduzindo a dependência da nuvem e melhorando a privacidade dos dados corporativos.

6. Conclusão e Avaliação

O NeoMME marca um ponto de inflexão na eficiência da IA multimodal. Para os CTOs, o imperativo é claro: a otimização da infraestrutura de recuperação é tão crítica quanto a escolha do modelo de linguagem. Ignorar a eficiência da indexação é aceitar custos operacionais desnecessários e uma latência subótima em ambientes de produção. A governança de dados deve priorizar arquiteturas modulares onde a recuperação de alta densidade seja delegada a codificadores especializados, garantindo que o throughput de tokens em modelos de raciocínio não seja desperdiçado em tarefas de busca vetorial ineficientes.

As organizações devem executar provas de conceito (PoC) com o NeoMME para avaliar seu desempenho em seus próprios conjuntos de dados. A capacidade de reduzir o tamanho do índice e aumentar a velocidade de processamento é uma vantagem competitiva direta. Em um mercado onde a eficiência econômica por token e a latência de acesso à informação são os fatores determinantes, a interoperabilidade entre codificadores de recuperação otimizados e modelos de raciocínio de elite define a resiliência arquitetônica de qualquer aplicação RAG escalável.

Fonte Original & Referência Técnica
marktechpost.com
Verificação Editorial
Publicação verificada em marktechpost.com
Consultar fonte oficial

Compromisso editorial do IAExpertos.net

Este artigo foi elaborado pela equipe editorial do IAExpertos.net com base em fontes informativas e documentação verificadas. A partir delas, utilizamos ferramentas de inteligência artificial para estruturar, ampliar e contextualizar as informações. Antes da publicação, todo o conteúdo é revisado e validado pela equipe editorial.

Parceiros IAExpertos.net
BuscoMovil.es Banner

BuscoMovil.es

O comparador inteligente dos smartphones mais potentes do mercado. Encontre as melhores ofertas em segundos.

Visitar Buscomovil.es
🔥

Ofertas Exclusivas de Tecnologia na Amazon

Descontos Ativos
IAExpertos Logo

Canal Oficial do Telegram

Junte-se ao nosso canal para receber as últimas notícias de IA e ofertas exclusivas de hardware e tecnologia.

IAExpertos Logo

Canal Oficial do WhatsApp

Siga o nosso canal do WhatsApp para alertas em tempo real e ofertas tech exclusivas recomendadas pela IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.