KI-Modelle und Plattformen

Anthropic veröffentlicht Claude Sonnet 5.5 zu unverändertem Sonnet‑5‑Preis

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Anthropic hat Claude Sonnet 5.5 am 28. September 2026 veröffentlicht, das zweite Modell seiner Claude‑5.5‑Familie. Das Modell behält die Preisgestaltung von Claude Sonnet 5 bei: 2 $ pro Million Eingabetoken und 10 $ pro Million Ausgabetoken, und Anthropic sagt, dass es Ausgaben mehr als 30 % schneller erzeugt, während es in den Tests bis zu 30 % weniger pro Aufgabe kostet.

In seiner Veröffentlichungsankündigung beschrieb Anthropic Sonnet 5.5 als ein schnelleres, kostengünstigeres Ergänzungsmodell zu Claude Opus 5.5, das das Unternehmen als für komplexe Arbeiten konzipiert beschreibt, die sorgfältiges Urteilsvermögen erfordern. Sonnet 5.5 sei am stärksten bei klar abgegrenzten Alltagsaufgaben, beim Beheben von Fehlern und beim Erstellen von polierten Dokumenten, Folien und Tabellenkalkulationen, sagte Anthropic und fügte hinzu, dass es zudem ein gutes Gespür für Design habe.

Claude Sonnet 5.5 ist auf allen Plattformen verfügbar, einschließlich Amazon Web Services, Google Cloud und Microsoft Azure, unter der Modell‑ID claude-sonnet-5-5, und wird mit null Datenaufbewahrung angeboten, wie bei Opus 5.5 und Sonnet 5.

Berichtete Benchmark‑Ergebnisse

Anthropic berichtet, dass Sonnet 5.5 bei Terminal‑Bench 4.0, einer agentischen Codierungsbewertung, 70,6 % erzielt, gegenüber 10,3 % für Sonnet 5, wobei Opus 5.5 einen angegebenen Wert von 66,4 % hat, der das Xhigh‑Aufwandsergebnis widerspiegelt. Im Hauptdatensatz von FrontierCode 1.1 erreicht Sonnet 5.5 46,2 % bei Max‑Aufwand und 52,1 % bei Xhigh, verglichen mit 42,4 % für Sonnet 5, 54,4 % für Opus 5.5 und 49,3 % für OpenAI‑s GPT‑6 Sol. Die gemeldeten CursorBench‑4.0‑Ergebnisse betragen 55,5 % für Sonnet 5.5, 34,1 % für Sonnet 5 und 57,8 % für Opus 5.5.

Bei Bewertungen von Wissensarbeit berichtet das Unternehmen von einem GDPval‑AA‑v2.1‑Score von 1844 für Sonnet 5.5, zwei Punkte unter dem Wert von 1846 für Opus 5.5 und etwa 400 Punkte über dem Wert von 1449 für Sonnet 5, sowie einem AA‑Briefcase‑v1.1‑Score von 1811 gegenüber 1822 für Opus 5.5 und 1359 für Sonnet 5. Die Ankündigung listet zudem 64,5 % mit Werkzeugen im Humanity’s Last Exam, 80,1 % Teilpunkte in OSWorld 2.1 und 61,6 % ohne Werkzeuge bei Chartography, einem visuellen Diagrammerkennungstest, auf. Anthropic sagt, dass Sonnet 5.5 das erste Sonnet‑Modell ist, das Pokémon Red allein anhand von Screenshots übertrifft.

Das Unternehmen warnt, dass Benchmark‑Scores nur einen Aspekt der Fähigkeiten eines Modells abbilden, und sagt, dass Opus 5.5 in eigenen Tests sowie in denen externer Prüfer eindeutig stärker bei komplexer, offener Arbeit ist, die anhaltendes Urteilsvermögen erfordert. Eine Fußnote besagt, dass Artificial Analysis GDPval‑AA und AA‑Briefcase auf einer Vorab‑Bereitstellung mit einem Fehler bei strukturierten Ausgaben ausgeführt hat, der inzwischen behoben wurde und die Leistung von Sonnet 5.5 im Zweifel unterschätzt. Eine weitere Fußnote weist darauf hin, dass OpenAI kürzlich einen Bild‑Verstehens‑Fehler in GPT‑6 Sol behoben hat, den Drittanbieter‑Scores möglicherweise noch nicht widerspiegeln.

Erste Testergebnisse

Der Vizepräsident für KI bei CodeRabbit, David Loker, sagte, dass Sonnet 5.5 ein besseres Urteilsvermögen als Sonnet 5 über alle Komplexitätsstufen hinweg zeige und dabei deutlich weniger Ausgabetoken verbrauche, und dass CodeRabbit plant, einfache und mittlere Prüfungen jetzt auf das Modell zu verlagern, mit weiteren in den kommenden Wochen. Der Leiter der KI‑Entwicklung bei Base44 AI, Gabriel Grinberg, berichtete, dass Sonnet 5.5 bei 118 echten App‑Builds im Durchschnitt 3,6 Iterationen pro Build erreichte, verglichen mit 7,7 bei Opus 5, und die wenigsten fehlgeschlagenen Werkzeugaufrufe aller von Base44 getesteten Modelle hatte.

Der leitende Ingenieur bei Slack, Curtis Allen, berichtete von etwa 14 % weniger Ausgabetoken bei Offline‑Slackbot‑Bewertungen ohne Prompt‑Änderungen. Der KI‑Direktor von Zendesk, Abhinay Kathuria, sagte, dass Tickets 20 % schneller bearbeitet wurden als mit den Claude‑Modellen, die Zendesk im Produktivbetrieb einsetzt. Balyasny Asset Management meldete etwa 121 000 Token pro Antwort gegenüber 497 000 bei Sonnet 5 in einer privaten Suite von 2 441 Finanz‑Aufgaben. Box berichtete von Ergebnissen, die 2,4‑mal schneller waren bei 12 % weniger Gesamttoken, und Atlassian sagte, Kunden könnten Rovo‑Agents bis zu 30 % schneller ausführen als mit Sonnet 5.

Preisgestaltung, Geschwindigkeit und Migration

Die angegebenen Preise von Sonnet 5.5 entsprechen exakt denen von Sonnet 5: 2 $ pro Million Eingabetoken, 10 $ pro Million Ausgabetoken, 0,20 $ pro Million Cache‑Lese‑Token und 2,50 $ pro Million Cache‑Schreib‑Token. Opus 5.5 wird mit 4 $ für Eingaben, 20 $ für Ausgaben und 5 $ für Cache‑Schreibvorgänge angegeben. Anthropic sagt, dass Sonnet 5.5 typischerweise deutlich weniger Token für dieselbe Arbeit benötigt und das bislang schnellste Sonnet‑Modell ist.

Das Modell bietet fünf neu kalibrierte Aufwand‑Stufen: low, medium, high, xhigh und max. Vorgaben sind Medium in Claude Code und den Claude‑Apps sowie High auf der Claude Platform, die ebenfalls der API‑Standard ist.

Anthropic’s Migrationsleitfaden listet Breaking Changes für Entwickler, die von Sonnet 5 umsteigen. Adaptives Denken läuft jetzt standardmäßig, die deaktivierte Denk‑Einstellung liefert einen 400‑Fehler, und Entwickler, die Sonnet mit deaktiviertem Denken betrieben, müssen vor der Migration zur neuen Zwischen‑Werkzeug‑Einstellung, der niedrigsten verfügbaren, wechseln. Erzwungene Werkzeugwahl wird zugunsten automatischer Werkzeugwahl, gekoppelt mit strengen Werkzeugen, abgelehnt, und das minimale cache‑fähige Prompt wird von 1 024 auf 512 Token reduziert. Die Dokumentation listet außerdem fünf Ablehnungs‑Stop‑Grundkategorien auf, die Cyber, Bio, FrontierLLM, ArgumentationExtraktion und allgemeinSchäden, und weist darauf hin, dass serverseitige Fallback‑Wiederholungen nur Cyber‑ und Frontier‑LLM‑Ablehnungen bei Sonnet 5 erneut versuchen.

Sicherheitsbefunde und Schutzmaßnahmen

Weil die Cyber‑Fähigkeiten von Sonnet 5.5 mit denen von Opus 5 vergleichbar sind, sagte Anthropic, dass es das erste Sonnet‑Modell ist, das mit den Cyber‑Sicherheitsmaßnahmen und Rückfallmechanismen eingeführt wird, die bei den leistungsstärksten Modellen des Unternehmens zum Einsatz kommen. Der Systemkarte zufolge lag bei deaktivierten Schutzmaßnahmen die durchschnittliche Anzahl von Capability‑Flags bei 11,53 und die Erfassungsrate bei 80 % auf ExploitBench, wobei 178 vollständige Arbitrary‑Code‑Execution‑Exploits erzeugt wurden, im Vergleich zu einem bei Sonnet 5. Es bewältigte 46,1 % der CyScenarioBench‑Herausforderungen gegenüber 0,7 % bei Sonnet 5 und erzeugte 50 Control‑Flow‑Hijacks im Binary Exploitation Benchmark gegenüber 3 bei Sonnet 5.

Die Cyber‑Sicherheitsmaßnahmen laufen in drei Stufen ab: ein Probe‑Vorgang auf den internen Aktivierungen des Modells, ein leichter On‑Model‑Klassifikator und ein separater, trainierter LLM‑Klassifikator. Die Karte berichtet von einer Wiedererkennungsrate von 99,43 % im Cyber‑Harm‑Coverage‑Set und einer Angriffs‑Erfolgsrate von 21,0 % bei der Rewind‑Attacker‑Robustheitsbewertung, verbessert gegenüber 57,2 % für Sonnet 5, während die Nutzer darauf hingewiesen werden, vermehrte Ablehnungen selbst bei harmlosen Cyber‑Sicherheitsaufgaben zu erwarten. Anfragen mit höherem Risiko fallen sichtbar zurück auf Sonnet 5, und ein erweitertes Cyber Verification Program wird bald geprüften Verteidigern gestaffelten Zugriff auf erweiterte Fähigkeiten von Sonnet 5.5, Opus 5.5 und Claude Mythos‑Modellen bieten.

Biologie‑Sicherheitsmaßnahmen sind dieselben Schad‑Missbrauch‑Klassifikatoren, die für Opus 5 eingesetzt werden, ohne Rückfallmodell, und Anthropics Life Sciences Verification Program deckt den Zugriff für das gesamte Spektrum biologischer Arbeiten ab. Sonnet 5.5 ist zudem das erste Sonnet‑Modell mit Sicherheitsklassifikatoren, die die Extraktion von Denkprozessen blockieren, und es erweitert das erhaltene Denken, sodass das Denken eines Modells nicht vom Konto, das es erstellt hat, entkoppelt werden kann.

Bei Anthropics automatisierter Verhaltensprüfung von etwa 1 850 Szenarien berichtet das Unternehmen, dass Sonnet 5.5 bei den meisten Messgrößen für Ausrichtung, Missbrauchs‑Resistenz und Ehrlichkeit Sonnet 5 übertrifft oder zumindest erreicht, die niedrigste Rate von versuchten Sandbox‑Fluchten unter den getesteten Modellen verzeichnet und ein weniger lesbares Denken zeigt als viele frühere Modelle. Die Systemkarte gibt an, dass Sonnet 5.5 keine neuen Schwellenwerte der Responsible Scaling Policy überschreitet, als Erfüllung der CB‑1‑ und Autonomy‑1‑Schwellenwerte gilt und ein geringes, eingeschätztes Risiko einer katastrophalen Fehlanpassung aufweist. Der verlässliche Wissens‑Cutoff des Modells liegt im Juni 2026.

Anthropic sagte, Claude Haiku 5.5, das für Anwendungen mit hohem Volumen und kostenempfindlichen Anforderungen entwickelt wurde, werde in den kommenden Wochen zur Claude‑5.5‑Familie stoßen.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.