StartseiteArtikel

Sonnet 5.5 wurde veröffentlicht, sein Intelligenzniveau übertrifft GPT-6 Astra – wo ist die versprochene Verlangsamung?

字母AI2026-09-29 10:25
Sonnet 5.5 wurde veröffentlicht. Amodi redet von Verlangsamung, gibt aber tatsächlich Vollgas.

Amid, der ständig dazu aufruft, das Tempo zu drosseln, drückt das Gaspedal voll durch.

Am 26. September 2026 veröffentlichte Anthropic Sonnet 5.5. Es erreicht nicht nur eine Leistung, die sich der von Opus 5.5 nähert, sondern kostet auch nur die Hälfte von Opus 5.5.

In der Rangliste der Intelligenzwerte von Artificial Analysis übertrifft Sonnet 5.5 sogar GPT-6 Astra sowie das eigene Flaggschiffmodell von Anthropic, Claude Fable 5.1.

Der Schlüssel liegt im Preis-Leistungs-Verhältnis. Derzeit deckt Sonnet 5.5 fast alle Aufgaben mittlerer Schwierigkeit ab, insbesondere in den Bereichen Entwicklung, Wissenschaft und Mathematik. Abgesehen von sehr einfachen Aufgaben gibt es kein einziges Modell, das Sonnet 5.5 in Bezug auf das Preis-Leistungs-Verhältnis einholen kann.

Also, wo bleibt das versprochene Tempo der Drosselung?

Warum ist es so leistungsstark und trotzdem so günstig?

Die Leistung von Sonnet 5.5 ist sehr stark. Es erreicht einen Wert von 70,6 % im Terminal-Bench 4.0, während die vorherige Generation Sonnet 5 nur 10,3 % erzielte.

Auf GDPval-AA v2.1 erreicht es 1844 Punkte, nur 2 Punkte weniger als die 1846 Punkte von Opus 5.5. Bei CursorBench 4.0 liegt der Wert bei 55,5 % gegenüber 57,8 % und nähert sich damit ebenfalls dem von Opus 5.5.

Anthropic gibt an, dass obwohl die Leistung von Sonnet 5.5 der von Opus 5.5 nahekommt, Opus 5.5 bei komplexen Arbeiten, die kontinuierliche Urteile erfordern und keine klar definierten Ziele haben, bessere Ergebnisse liefert.

Sonnet 5.5 eignet sich besser für alltägliche Aufgaben, z. B. das Beheben von Fehlern, das Iterieren von Funktionen sowie das Erstellen von Dokumenten, Folien und Tabellen.

Sonnet ist das leichtgewichtige Modell in der Claude-Familie. Seine Leistung sollte eigentlich deutlich hinter der des Flaggschiffmodells zurückbleiben. Warum ist Sonnet 5.5 plötzlich so leistungsfähig?

Aus den veröffentlichten Materialien geht hervor, dass die offensichtlichste Änderung nicht darin besteht, dass es mehr Wissen gespeichert hat, sondern dass seine Fähigkeit, Aufgaben abzuschließen, gestärkt wurde.

Seit Sonnet 5 hat Anthropic die Schlussfolgerung, die Nutzung von Werkzeugen und die Programmierung verstärkt, sodass das Modell bei der Arbeit eher Werkzeuge aufruft und die Ergebnisse überprüft. Bei Version 5.5 konzentrieren sich die Verbesserungen auf Bereiche, die fortlaufende Aktionen erfordern, wie die Programmierung von Agenten, die Bedienung von Computern und das visuelle Verständnis.

Es verbesserte sich bei OSWorld 2.1 von 57,0 % der vorherigen Generation auf 80,1 % und bei dem Diagrammerkennungstest Chartography ohne Werkzeugnutzung von 15,6 % auf 61,6 %.

Das heißt, Sonnet 5.5 beherrscht es bereits, Informationen aus dem Bildschirm zu sammeln und die Aufgabe darauf aufbauend voranzutreiben.

Nehmen wir das Beheben von Fehlern als Beispiel: Das Lesen des Codes ist nur der erste Schritt. Damit das Modell die gesamte Aufgabe der Fehlerbehebung abschließen kann, muss es auch die zugehörigen Dateien finden, beurteilen, welche Auswirkungen die Änderungen haben werden, Werkzeuge zur Modifikation aufrufen und dann überprüfen, ob das Problem behoben ist.

Wenn ein einziger Schritt fehlschlägt, kann die gesamte Aufgabe scheitern.

Aus diesem Grund konnte die Punktzahl von Sonnet 5.5 im Terminal-Bench stark steigen. Es handelt sich nicht um eine einfache Explosion des „Code-IQ“, sondern durch diese Fähigkeit zur Informationssammlung kann das Modell die gesamte Kette von Schritten abschließen.

Eine Vermutung lautet, dass Sonnet 5.5 möglicherweise auch eine Destillation von Opus 5.5 durchlaufen hat. Während der Tests wurde festgestellt, dass Sonnet 5.5 einige Slogans verwendet, die bisher nur bei Opus 5.5 auftraten, wie zum Beispiel „You are right!“.

Als Anthropic Opus 5.5 veröffentlichte, erklärte es ausdrücklich, dass es den Schreib- und Kommunikationsstil verbessert habe, wobei „You are right!“ das repräsentativste Beispiel ist. Fable 5.1 hat diesen Slogan nie verwendet, aber Sonnet 5.5 beginnt nun, ihn zu nutzen.

Warum ist es also günstig? Sehen wir uns zuerst die Preise an: Sonnet 5.5 kostet 2 USD pro Million Eingabe-Token und 10 USD pro Million Ausgabe-Token, genau die Hälfte von Opus 5.5. Die 5-Minuten-Cache-Schreibung kostet 2,50 USD gegenüber 5 USD, und das Cache-Lesen kostet beide 0,20 USD.

Die sogenannte 5-Minuten-Cache-Schreibung bezieht sich darauf, dass beim ersten Senden eines wiederverwendbaren Prompt-Inhalts über die API das System diesen zwischenspeichert, wobei dieser Schreibvorgang nach dem Tarif „5 Minuten mit Cache“ abgerechnet wird.

Gleichzeitig gibt Anthropic an, dass „jede Aufgabe um bis zu 30 % günstiger“ ist, da für die Erledigung derselben Aufgabe in der Regel weniger Token verbraucht werden. Bei gleichem Preis und weniger Umwegen wird die Rechnung natürlich geringer.

Nehmen wir wieder die Programmierung als Beispiel.

Frühe Tester haben beobachtet, dass Sonnet 5.5 im Vergleich zu Sonnet 5 eher dazu neigt, Werkzeugaufrufe in Stapelverarbeitung zu bündeln. Dadurch gibt es insgesamt weniger Schritte, was wiederum Token spart.

Anthropic gibt an, dass es im High-Bereich von FrontierCode etwa 10 % besser abschneidet als die vorherige Generation im gleichen Bereich, während die Kosten pro Aufgabe nur etwa 1/15 des Wertes der vorherigen Generation betragen.

Bei einigen Bewertungen übertrifft Sonnet 5.5 mit dem Low- oder Medium-Bereich die beste Leistung von Sonnet 5 bei etwa einem Zehntel der Aufgabenkosten.

Der Schlüssel zur Günstigkeit liegt nicht nur im Preis pro Token, sondern auch darin, wie viele Token das Modell tatsächlich für die Erledigung der Aufgabe verbraucht und wie oft es Umwege über Werkzeuge macht.

Darüber hinaus ist die Ausgabegeschwindigkeit von Sonnet 5.5 um mehr als 30 % höher als die von Sonnet 5.

Im Folgenden werden Geschwindigkeit und Leistung von Sonnet 5.5 und Sonnet 5 verglichen.

Was gibt es noch außer dem Modell?

Im Vergleich zur Leistung legt Anthropic heute mehr Wert auf Verbesserungen im technischen Bereich.

Zum Beispiel hat Fable 5.1 bereits Preserved Thinking eingeführt, das die Extraktion von Schlussfolgerungsinhalten verhindert. Heute ist dieser Mechanismus auch in Sonnet 5.5 integriert und wurde weiterentwickelt.

Anthropic hat Sonnet 5.5 einen Sicherheitsklassifikator hinzugefügt, der die Extraktion von Schlussfolgerungen verhindert, und gleichzeitig die erzeugten Denkblöcke an das Konto oder zugehörige Konten bindet, die sie erstellt haben.

Wenn Sie die Wiedergabe mit einem nicht zugehörigen Konto durchführen, verwirft die API den Denkblock, und das Modell kann die vorherigen Schlussfolgerungen nicht sehen. Normale Entwickler müssen sich um dieses Schutzsystem nicht kümmern, da es das Lesen des gesamten Denkprozesses nicht beeinträchtigt. Anthropic möchte hauptsächlich Unternehmen abwehren, die in großem Maßstab Destillation durchführen und wiederholt aufrufen, um die Fähigkeiten des Modells zu extrahieren.

Die Signatur des Denkblocks ist außerdem an die vorherige Unterhaltung gebunden.

Wenn Entwickler bereits erfolgte Systemprompts, Werkzeugdefinitionen oder historische Nachrichten ändern und dann den alten Denkblock wieder einfügen, kann das neue Konto standardmäßig einen 400-Fehler erhalten.

Das normale Ergänzen von Unterhaltungen ist in der Regel nicht betroffen, aber Agenten-Frameworks, die es gewohnt sind, den Verlauf im Hintergrund stillschweigend zu ändern, müssen die Sitzung neu verarbeiten.

Die Sicherheitsleitplanken haben sich von „Soll ich die übermäßige Anfrage des Benutzers ablehnen?“ zu „Wem soll ich diese Frage zur Beantwortung weiterleiten?“ gewandelt.

Die Cybersicherheitsfähigkeiten von Sonnet 5.5 wurden verbessert, sodass hohe Risiko-Cybersicherheitsanforderungen den Klassifikator auslösen und deutlich an Sonnet 5 zurückgegeben werden können.

Das normale Suchen und Beheben von Fehlern kann weiterhin mit Sonnet 5.5 durchgeführt werden.

Die serverseitige automatische Rückfallfunktion in der Claude-API befindet sich derzeit in der Testphase und muss von Entwicklern aktiviert werden.

Wenn Sonnet 5.5 auf einige Anfragen stößt, die vom Sicherheitssystem blockiert werden, beendet es den Vorgang nicht unbedingt sofort. Wenn der Entwickler die Funktion „Automatischer Rückfall“ aktiviert hat, versucht das System, Sonnet 5 zur Beantwortung zu verwenden.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Buchstaben-KI“, Autor: Miao Zheng, von 36Kr mit Genehmigung veröffentlicht.