Anthropic lança Claude Opus 5.5: desempenho do Fable 5.1 com 40% menos custo
Gerada por IA
1. Resumo Executivo
A Anthropic apresentou o Claude Opus 5.5, o primeiro modelo da sua nova família Claude 5.5. A empresa considera que o seu desempenho está ao nível do Claude Fable 5.1 na maioria das tarefas e estima que a poupança nos custos de execução seja de 40 % em comparação com o Opus 5. Trata-se do primeiro lançamento da Anthropic desde o seu apelo público para «marcar o ritmo da fronteira», uma posição com a qual a empresa apela à moderação na velocidade de implementação dos modelos mais avançados.
O modelo foi avaliado antes da sua publicação por avaliadores externos, entre os quais a Frontier Design e a METR. Na auditoria automatizada de comportamento da Anthropic — o teste de alinhamento mais completo que a empresa realiza —, o Opus 5.5 obteve a melhor pontuação registada até à data por um modelo da Anthropic. A empresa implementa-o com as salvaguardas reservadas aos seus modelos mais avançados.
O lançamento inclui três eixos de melhoria declarados: desempenho, segurança e relação custo-velocidade. A Anthropic confirmou ainda que o Claude Sonnet 5.5 e o Claude Haiku 5.5 serão lançados nas próximas semanas com melhorias equivalentes em termos de eficiência e segurança.
2. Análise Técnica: Desempenho e Benchmarks
A Anthropic publica uma série de testes de desempenho em que o Opus 5.5 lidera as categorias de codificação agênica, utilização do computador e trabalho de conhecimento. A empresa salienta, no entanto, que, a estes níveis de capacidade, as diferenças entre os benchmarks deixaram de ser um indicador fiável das diferenças reais: na sua própria utilização interna, a diferença entre o Opus 5.5 e o Claude Fable 5.1 é menor do que as pontuações sugerem.
| Área e referência | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Codificação agênica · Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% | 57,9% |
| Codificação agênica · FrontierCode v1.1 | 54,4% | 50,3% | 48,0 % | 53,3% |
| Codificação agênica · CursorBench 4.0 | 57,8% | 51,8% | 46,6% | — |
| Trabalho de conhecimento · GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 |
| Fluxos de negócios · AutomationBench | 40,0% | 31,4% | 26,9% | 41,4% |
| Raciocínio multidisciplinar · O Último Exame da Humanidade | 67,7% | 65,6% | 63,6% | 57,2% |
| Investigação científica agênica · Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% |
| Utilização do computador · OSWorld 2.0 | 81,8% | 80,7% | 74,0% | — |
| Reconhecimento visual de gráficos · Cartografia | 89,0% | 88,4% | 83,4 % | — |
A Anthropic acompanha os números com casos de utilização relatados por utilizadores pioneiros. Um deles concluiu uma migração de código de 680 000 linhas em menos de um dia, um trabalho que a empresa estima que teria levado semanas a uma equipa de engenharia. Num teste de otimização dos tempos de carregamento em todas as páginas de uma aplicação web, o Opus 5.5 teve sucesso em 39 de 40 tentativas, enquanto o Opus 5 conseguiu melhorias menores que, além disso, alteraram o comportamento da aplicação. Num teste separado, no qual vários modelos do Claude tinham de construir um jogo a partir de uma única instrução, o Opus 5.5 obteve a pontuação mais elevada pela qualidade dos seus gráficos e do seu acabamento.
É importante salientar a nuance metodológica que a própria Anthropic apresenta: os resultados do OSWorld 2.0, do Humanity's Last Exam e do Chartography correspondem à modalidade «com ferramentas» ou parcial, consoante o caso, e não à execução sem assistência. Os dados do Terminal-Bench-Science 0.1 colocam o GPT-6 Astra à frente do Opus 5.5 nessa categoria específica, algo que a tabela oficial reflete sem o ocultar.
3. Segurança e Avaliação do Alinhamento
A secção dedicada à segurança constitui uma parte significativa da mensagem da Anthropic. O Opus 5.5 obteve a melhor pontuação até à data na auditoria automatizada de comportamento da empresa, um conjunto de testes de alinhamento que submete o modelo a milhares de cenários simulados. De acordo com a documentação publicada, o modelo é menos propenso do que os modelos recentes a executar ações difíceis de reverter ou a agir fora dos limites que lhe foram atribuídos, e apresenta maior resistência à injeção de instruções do que o Opus 5.
A Anthropic alargou o âmbito dos seus testes de alinhamento para abranger tarefas de maior duração, tarefas impossíveis e cenários modelados a partir de incidentes reais. A empresa reconhece explicitamente que o modelo «ainda tem limites» e remete para o System Card do Opus 5.5 para obter os detalhes completos da avaliação, que não foram divulgados sob a forma de resumo de números no anúncio.
Devido ao seu comportamento declarado nas áreas da biologia e da cibersegurança, comparável ao do Claude Mythos 5.1, a Anthropic lança o Opus 5.5 com salvaguardas semelhantes às do Claude Fable 5.1. As organizações verificadas podem solicitar, a partir de hoje, o acesso através do programa Life Sciences Verification Program para investigação biológica. A empresa irá alargar, nas próximas semanas, o «Cyber Verification Program», para que os profissionais de cibersegurança acreditados possam utilizar o Opus 5.5 no seu trabalho.
4. Custo, velocidade e disponibilidade
O argumento económico é explícito: o Opus 5.5 consome menos recursos computacionais do que o Opus 5 e o seu preço reflete isso. A Anthropic estima que a poupança em cargas de trabalho típicas, com a configuração predefinida, seja de 40%. Os tokens de entrada e saída são faturados a 4 e 20 dólares por milhão, 20% menos do que no Opus 5. A leitura da cache, que, segundo a empresa, representa a maior parte do custo em trabalho de agentes e de codificação, desce para 0,20 dólares por milhão de tokens, o que corresponde a uma redução de 60%.
| Preço por milhão de tokens | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Leitura da cache | 0,20 $ | 0,50 $ |
| Fichas de entrada | 4 $ | 5 $ |
| Tokens de saída | 20 $ | 25 $ |
| Gravação em cache | 5 $ | 6,25 $ |
Em termos de velocidade, a Anthropic afirma que o Opus 5.5 gera resultados mais de 30% mais rapidamente do que o Opus 5. A empresa anunciou ainda duas alterações comerciais que acompanham o lançamento: um aumento dos limites de utilização de cinco horas nos planos Pro, Max, Team e Enterprise com licença por posto, e a possibilidade de os assinantes guardarem uma reinicialização do limite de velocidade para a utilizarem quando considerarem oportuno.
O modelo incorpora também uma mudança de estilo na redação. Os primeiros utilizadores descrevem uma redação mais clara e fácil de acompanhar do que a do Opus 5, com as informações mais relevantes colocadas no início. A Anthropic associa essa mudança a uma vantagem não só prática, mas também de segurança: um texto mais organizado é mais fácil de rever e verificar.
5. Impacto no setor e roteiro
Esta medida reforça a estratégia da Anthropic de competir em termos de eficiência e não apenas em capacidade bruta. A redução do custo de leitura da cache é significativa para o segmento que mais consome: agentes autónomos e assistentes de código, onde o custo acumulado provém principalmente da releitura do contexto. Uma redução de 60% neste aspeto tem um impacto direto na economia das implementações em produção, mais do que uma melhoria pontual nos resultados dos benchmarks.
A comparação publicada pela Anthropic coloca o Opus 5.5 à frente do GPT-6 Astra e do GPT-5.6 Sol na maioria das categorias, embora com exceções notáveis: O GPT-6 Astra supera o Opus 5.5 no AutomationBench (41,4% contra 40,0%) e no Terminal-Bench-Science 0.1 (64,6% contra 58,7%). A empresa não oculta esses dados na sua própria tabela, o que reforça a credibilidade dos restantes números.
O plano de desenvolvimento anunciado prevê o lançamento do Claude Sonnet 5.5 e do Claude Haiku 5.5 nas próximas semanas, com melhorias equivalentes em termos de desempenho, eficiência e segurança. Com isto, a Anthropic alarga as capacidades do Opus 5.5 aos segmentos de preço médio e baixo do seu catálogo, que são os que sustentam o volume de utilização em aplicações comerciais.
O apelo da Anthropic para «marcar o ritmo da fronteira», juntamente com a avaliação externa realizada pela METR e pela Frontier Design, delineia uma postura diferenciada no setor: a empresa apresenta a moderação na implementação como parte da sua proposta de valor. O anúncio não especifica compromissos adicionais de transparência relativamente ao System Card, nem prazos concretos para além do lançamento das variantes Sonnet e Haiku.
6. Conclusão
O Claude Opus 5.5 é um lançamento orientado para a redução de custos sem comprometer o desempenho. A Anthropic coloca-o ao nível do Fable 5.1 na maioria das tarefas, com uma poupança declarada de 40% no custo de execução e uma melhoria superior a 30% na velocidade de geração. Os preços publicados — 4 dólares por milhão de tokens de entrada e 20 por saída, com a leitura da cache a 0,20 — são dados concretos e verificáveis na documentação oficial.
Para as equipas que já utilizam agentes ou assistentes de código em produção, o aspeto mais relevante deste anúncio não é a melhoria nos benchmarks, mas sim a redução do custo da leitura da cache, precisamente o que mais pesa na fatura nessas cargas. É a combinação de um custo mais baixo e uma maior velocidade de saída que poderá traduzir-se em decisões de adoção a curto prazo.
Há duas questões em aberto. A primeira: em que medida a vantagem do Astra em relação ao GPT-6 se mantém em cenários de utilização real: a própria Anthropic adverte que, a este nível de capacidade, os resultados dos benchmarks são pouco indicativos. A segunda: até que ponto as salvaguardas de acesso restrito condicionam a sua adoção nas áreas da cibersegurança e das ciências da vida, onde o modelo requer verificação prévia por parte da empresa.
Español
English
Français
Português
Deutsch
Italiano