Blog IAExpertos

Descubre las últimas tendencias, guías y casos de estudio sobre cómo la Inteligencia Artificial está transformando los negocios.

Künstliche Intelligenz 22.9.2026

Anthropic startet Claude Opus 5.5: Fable-5.1-Leistung bei 40% geringeren Kosten

Anthropic startet Claude Opus 5.5: Fable-5.1-Leistung bei 40% geringeren Kosten KI-generiert

1. Zusammenfassung

Anthropic hat Claude Opus 5.5 vorgestellt, das erste Modell seiner neuen Claude-5.5-Familie. Das Unternehmen stuft dessen Leistung bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1 ein und beziffert die Einsparungen bei den Ausführungs-Kosten auf 40 % im Vergleich zu Opus 5. Dies ist die erste Veröffentlichung von Anthropic seit seinem öffentlichen Aufruf, „das Tempo an der Grenze vorzugeben“ – eine Haltung, mit der das Unternehmen dazu aufruft, die Geschwindigkeit bei der Einführung der leistungsfähigsten Modelle zu drosseln.

Das Modell wurde vor seiner Veröffentlichung von externen Gutachtern bewertet, darunter Frontier Design und METR. Im automatisierten Verhaltensaudit von Anthropic – dem umfassendsten Alignment-Test, den das Unternehmen durchführt – erzielt Opus 5.5 die bisher beste Punktzahl, die jemals von einem Anthropic-Modell erreicht wurde. Das Unternehmen setzt es mit den Sicherheitsvorkehrungen ein, die seinen leistungsfähigsten Modellen vorbehalten sind.

Die Veröffentlichung umfasst drei erklärte Verbesserungsschwerpunkte: Leistung, Sicherheit und das Verhältnis von Kosten und Geschwindigkeit. Anthropic hat zudem bestätigt, dass Claude Sonnet 5.5 und Claude Haiku 5.5 in den kommenden Wochen mit entsprechenden Verbesserungen hinsichtlich Effizienz und Sicherheit erscheinen werden.

Offizielle IAExpertos Community
Echtzeit-KI-News und exklusive Tech-Angebote.

2. Technische Analyse: Performance und Benchmarks

Anthropic veröffentlicht eine Reihe von Benchmarks, in denen Opus 5.5 in den Kategorien agentenbasierte Kodierung, Computernutzung und Wissensarbeit führend ist. Das Unternehmen weist jedoch darauf hin, dass bei diesem Leistungsniveau die Abstände zwischen den Benchmarks kein verlässlicher Anhaltspunkt mehr für die tatsächlichen Unterschiede sind: Bei der internen Nutzung des Unternehmens ist der Abstand zwischen Opus 5.5 und Claude Fable 5.1 geringer, als die Punktzahlen vermuten lassen.

Bereich und Benchmark Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Agentenbasierte Kodierung · Terminal-Bench 4.0 66,4 % 55,8 % 52,3 % 57,9 %
Agentenbasierte Kodierung · FrontierCode v1.1 54,4 % 50,3 % 48,0 % 53,3 %
Agentenbasierte Kodierung · CursorBench 4.0 57,8 % 51,8 % 46,6 %
Wissensarbeit · GDPval-AA v2.1 1846 1735 1708 1542
Geschäftsabläufe · AutomationBench 40,0 % 31,4 % 26,9 % 41,4 %
Interdisziplinäres Denken · Die letzte Prüfung der Menschheit 67,7 % 65,6 % 63,6 % 57,2 %
Agentenbasierte wissenschaftliche Forschung · Terminal-Bench-Science 0.1 58,7 % 52,6 % 29,0 % 64,6 %
Computerbenutzung · OSWorld 2.0 81,8 % 80,7 % 74,0 %
Visuelle Erkennung von Grafiken · Chartography 89,0 % 88,4 % 83,4 %

Anthropic ergänzt die Zahlen durch Anwendungsbeispiele, die von Early Adopters berichtet wurden. Einer von ihnen schloss eine Code-Migration von 680.000 Zeilen in weniger als einem Tag ab – eine Aufgabe, für die ein Entwicklerteam nach Schätzungen des Unternehmens Wochen gebraucht hätte. In einem Test zur Optimierung der Ladezeiten aller Seiten einer Webanwendung war Opus 5.5 bei 39 von 40 Versuchen erfolgreich, während Opus 5 nur geringfügige Verbesserungen erzielte, die zudem das Verhalten der Anwendung beeinträchtigten. In einem separaten Test, bei dem verschiedene Claude-Modelle anhand einer einzigen Anweisung ein Spiel erstellen sollten, erzielte Opus 5.5 die höchste Punktzahl für die Qualität der Grafiken und die Ausführung.

Es sei auf die methodische Nuance hingewiesen, die Anthropic selbst einführt: Die Ergebnisse von OSWorld 2.0, „Humanity’s Last Exam“ und „Chartography“ beziehen sich auf die Modalität „mit Hilfsmitteln“ bzw. „teilweise“ – je nach Fall – und nicht auf eine Ausführung ohne Unterstützung. Die Zahlen von Terminal-Bench-Science 0.1 zeigen, dass GPT-6 Astra in dieser konkreten Kategorie vor Opus 5.5 liegt, was in der offiziellen Tabelle offen ausgewiesen wird.

3. Sicherheit und Überprüfung der Ausrichtung

Der Abschnitt zur Sicherheit nimmt einen Großteil der Botschaft von Anthropic ein. Opus 5.5 erzielt die bislang beste Punktzahl im automatisierten Verhaltensaudit des Unternehmens – einer Reihe von Alignment-Tests, bei denen das Modell Tausenden von simulierten Szenarien unterzogen wird. Laut der veröffentlichten Dokumentation neigt das Modell weniger als frühere Versionen dazu, schwer rückgängig zu machende Handlungen auszuführen oder außerhalb der ihm zugewiesenen Grenzen zu agieren, und weist eine höhere Widerstandsfähigkeit gegen das Einschleusen von Anweisungen auf als Opus 5.

Anthropic hat den Umfang seiner Alignment-Tests erweitert, um auch länger andauernde Aufgaben, unlösbare Aufgaben und Szenarien abzudecken, die auf realen Vorfällen basieren. Das Unternehmen räumt ausdrücklich ein, dass das Modell „noch Grenzen hat“, und verweist auf die System Card von Opus 5.5 für die vollständigen Details der Bewertung, die in der Ankündigung nicht in Form einer zusammenfassenden Zahlenübersicht veröffentlicht wurden.

Aufgrund seines in den Bereichen Biologie und Cybersicherheit beschriebenen Verhaltens, das mit dem von Claude Mythos 5.1 vergleichbar ist, stellt Anthropic Opus 5.5 mit Sicherheitsvorkehrungen bereit, die denen von Claude Fable 5.1 ähneln. Verifizierte Organisationen können ab heute über das „Life Sciences Verification Program“ Zugang für biologische Forschungszwecke beantragen. Das Unternehmen wird in den kommenden Wochen das „Cyber Verification Program“ ausweiten, damit akkreditierte Cybersicherheitsexperten Opus 5.5 für ihre Arbeit nutzen können.

4. Kosten, Geschwindigkeit und Verfügbarkeit

Das wirtschaftliche Argument ist eindeutig: Opus 5.5 benötigt weniger Rechenleistung als Opus 5, was sich auch im Preis widerspiegelt. Anthropic beziffert die Einsparungen bei typischen Workloads mit der Standardkonfiguration auf 40 %. Die Eingangs- und Ausgangstoken werden mit 4 bzw. 20 Dollar pro Million berechnet, was 20 % weniger ist als bei Opus 5. Das Auslesen des Caches, das laut Angaben des Unternehmens den größten Teil der Kosten für Agentenarbeit und Codierung ausmacht, sinkt auf 0,20 Dollar pro Million Token, was einer Senkung um 60 % entspricht.

Preis pro Million Token Claude Opus 5.5 Claude Opus 5
Cache-Lesezugriff 0,20 $ 0,50 $
Eintrittstoken 4 $ 5 $
Ausgangstoken 20 $ 25 $
Cache-Schreiben 5 $ 6,25 $

Was die Geschwindigkeit angeht, gibt Anthropic an, dass Opus 5.5 die Ausgabe um mehr als 30 % schneller generiert als Opus 5. Das Unternehmen kündigte zudem zwei kommerzielle Änderungen an, die mit der Einführung einhergehen: eine Anhebung der Nutzungslimits um fünf Stunden bei den Pro-, Max-, Team- und Enterprise-Tarifen mit Lizenz pro Arbeitsplatz sowie die Möglichkeit für Abonnenten, einen Neustart des Geschwindigkeitslimits zu speichern und diesen nach eigenem Ermessen einzusetzen.

Das Modell weist zudem eine Änderung im Schreibstil auf. Erste Tester beschreiben einen klareren und leichter verständlichen Schreibstil als bei Opus 5, wobei die wichtigsten Informationen gleich zu Beginn stehen. Anthropic führt diese Änderung sowohl auf einen Sicherheitsvorteil als auch auf einen praktischen Nutzen zurück: Ein übersichtlicherer Text lässt sich leichter überprüfen und verifizieren.

5. Auswirkungen auf die Branche und Fahrplan

Dieser Schritt untermauert die Strategie von Anthropic, im Wettbewerb vor allem auf Effizienz und nicht nur auf reine Rechenleistung zu setzen. Die Senkung der Kosten für das Lesen aus dem Cache ist für das Segment mit dem höchsten Verbrauch von großer Bedeutung: autonome Agenten und Code-Assistenten, bei denen die kumulierten Kosten größtenteils durch das erneute Einlesen von Kontext entstehen. Eine Senkung dieser Kosten um 60 % wirkt sich direkt auf die Wirtschaftlichkeit von Produktivbereitstellungen aus – mehr noch als eine punktuelle Verbesserung der Benchmark-Ergebnisse.

Der von Anthropic veröffentlichte Vergleich zeigt, dass Opus 5.5 in den meisten Kategorien vor GPT-6 Astra und GPT-5.6 Sol liegt, allerdings mit einigen bemerkenswerten Ausnahmen: GPT-6 Astra übertrifft Opus 5.5 bei AutomationBench (41,4 % gegenüber 40,0 %) und bei Terminal-Bench-Science 0.1 (64,6 % gegenüber 58,7 %). Das Unternehmen verschweigt diese Werte in seiner eigenen Tabelle nicht, was die Glaubwürdigkeit der übrigen Zahlen untermauert.

Der angekündigte Fahrplan sieht für die kommenden Wochen die Veröffentlichung von Claude Sonnet 5.5 und Claude Haiku 5.5 vor, die entsprechende Verbesserungen in Bezug auf Leistung, Effizienz und Sicherheit mit sich bringen. Damit erweitert Anthropic die Funktionen von Opus 5.5 auf die mittleren und unteren Preisklassen seines Sortiments, die das Nutzungsvolumen bei kommerziellen Anwendungen ausmachen.

Der Aufruf von Anthropic, „das Tempo an der Grenze vorzugeben“, sowie die externe Bewertung durch METR und Frontier Design zeichnen ein differenziertes Bild innerhalb der Branche: Das Unternehmen präsentiert die Zurückhaltung bei der Einführung als Teil seines Wertversprechens. Die Ankündigung enthält keine Angaben zu zusätzlichen Transparenzverpflichtungen bezüglich der System Card oder zu konkreten Zeitplänen über die Veröffentlichung der Varianten Sonnet und Haiku hinaus.

6. Schlussfolgerung

Claude Opus 5.5 ist eine Version, die auf Kosteneinsparungen abzielt, ohne dabei die Leistung zu beeinträchtigen. Anthropic stuft sie bei den meisten Aufgaben auf dem Niveau von Fable 5.1 ein, mit einer angegebenen Einsparung von 40 % bei den Ausführungskosten und einer Verbesserung der Generierungsgeschwindigkeit um mehr als 30 %. Die veröffentlichten Preise – 4 Dollar pro Million Eingabetoken und 20 Dollar pro Ausgabetoken, wobei das Auslesen aus dem Cache 0,20 kostet – sind konkrete und in der offiziellen Dokumentation nachprüfbare Angaben.

Für Teams, die bereits Code-Agenten oder -Assistenten in der Produktion einsetzen, ist der wichtigste Aspekt dieser Ankündigung nicht die Verbesserung der Benchmark-Ergebnisse, sondern die Senkung der Kosten für das Lesen aus dem Cache – genau der Kostenfaktor, der bei diesen Workloads den größten Anteil an den Gesamtkosten ausmacht. Die Kombination aus geringeren Kosten und höherer Ausgabegeschwindigkeit könnte kurzfristig zu Entscheidungen für die Einführung dieser Technologie führen.

Es stellen sich zwei offene Fragen. Erstens: Inwieweit lässt sich der Vorsprung von Astra gegenüber GPT-6 in realen Anwendungsszenarien aufrechterhalten? Anthropic selbst weist darauf hin, dass Benchmark-Ergebnisse auf diesem Leistungsniveau nur wenig Aussagekraft haben. Die zweite Frage lautet: Inwieweit schränken die Sicherheitsvorkehrungen mit eingeschränktem Zugriff die Einführung des Modells in den Bereichen Cybersicherheit und Biowissenschaften ein, wo das Modell einer vorherigen Überprüfung durch das Unternehmen bedarf?

Originalquelle & Technische Referenz
theverge.com
Redaktionelle Prüfung
Verifizierte Publikation auf theverge.com
Offizielle Quelle öffnen

Redaktionelles Engagement von IAExpertos.net

Dieser Artikel wurde vom Redaktionsteam von IAExpertos.net auf der Grundlage geprüfter Nachrichtenquellen und Dokumentation erstellt. Darauf aufbauend nutzen wir KI-Werkzeuge zur Strukturierung, Erweiterung und Kontextualisierung der Informationen. Vor der Veröffentlichung werden alle Inhalte vom Redaktionsteam geprüft und validiert.

Intelligenter Exklusiv-Slot IAExpertos.net
Exklusives B2B-Sponsoring Banner
Watermark
IAExpertos Logo

Exklusives B2B-Sponsoring

Ein einziger Sponsor. Exklusiver Werbeplatz in unserem Technologie-Ökosystem vor Fachkräften und Führungskräften. 200 €/Monat ohne Mindestlaufzeit.

Exklusiv-Sponsoring ansehen
🔥

Exklusive Tech-Angebote auf Amazon

Aktive Rabatte
IAExpertos Logo

Offizieller Telegram-Kanal

Treten Sie unserem Kanal bei, um die neuesten KI-Nachrichten sowie exklusive Hardware- und Tech-Angebote zu erhalten.

IAExpertos Logo

Offizieller WhatsApp-Kanal

Folgen Sie unserem WhatsApp-Kanal für Echtzeit-KI-Alerts und exklusive Tech-Angebote von IAExpertos.

¿Quieres ser el primero en leer nuestros artículos?

Suscríbete y te avisamos cuando publiquemos nuevo contenido.