Claude Sonnet 5.5 tauchte überraschend mitten in der Nacht auf, schlägt Opus zum halben Preis, und Entwickler stellen bei praktischen Tests einen massiven Anstieg der Rechnungsbeträge fest.
Meldung von ZhiDongXi am 29. September: In den frühen Morgenstunden heute hat Anthropic das zweite Modell der Claude 5.5-Serie Claude Sonnet 5.5 veröffentlicht, das vor allem für Schnelligkeit und hohes Preis-Leistungs-Verhältnis steht.
Anthropic gab in seinem Blog bekannt, dass das neue Modell im Vergleich zu Claude Sonnet 5 eine um mehr als 30% höhere Geschwindigkeit und um fast 30% niedrigere Kosten aufweist und besser für alltägliche Aufgaben geeignet ist, wie das Beheben von Fehlern, das Erstellen von Dokumenten, das Anfertigen von Folien und Tabellen.
Werfen wir zunächst einen Blick auf einige wichtige Kennzahlen: Sonnet 5.5 ist in vielen Punkten vergleichbar mit Opus 5.5 und hat im Vergleich zu Sonnet 5 eine mehrfache Leistungssteigerung erzielt. Laut Anthropic ist es das erste Sonnet-Modell, das das Spiel *Pokémon Rot* nur anhand von Screenshots gewinnen kann. Auf Artificial Analysis erreicht Sonnet 5.5 einen Wert von 56 im AI-Analyseindex, nur knapp hinter Opus 5.5 mit 58 Punkten – die Claude-Modellreihe belegt die ersten drei Plätze dieser Liste.
Was die Preise angeht, ist die Preisgestaltung von Claude Sonnet 5.5 identisch mit der Vorgängerversion: 2 US-Dollar pro Million Eingabe-Token (ca. 13,4 Yuan), 10 US-Dollar pro Million Ausgabe-Token (ca. 60,1 Yuan) und 0,20 US-Dollar pro Million Token für Cache-Leseoperationen (ca. 1,34 Yuan). In seinem Blog wird jedoch erwähnt, dass die Kosten für eine einzelne Aufgabe bei der tatsächlichen Ausführung durch das Modell um 30% niedriger liegen als bei Claude Sonnet 5.
Aus den von der offiziellen Seite veröffentlichten Beispielen geht hervor, dass Sonnet 5.5 nur 10 Sekunden und 0,11 US-Dollar (ca. 0,74 Yuan) benötigt, um einen Zauberwürfel zu lösen.
Aus der Liste von Artificial Analysis geht hervor, dass Sonnet 5.5 bei einer einzelnen Aufgabe mehr Ausgabe-Token erzeugt, die Kosten pro Aufgabe betragen 7,60 US-Dollar (ca. 51 Yuan), was etwa 50 % höher liegt als die Kosten pro Aufgabe von Sonnet 5 und nahe an den Werten von Opus 5.5 mit 7,63 US-Dollar (ca. 51,2 Yuan) liegt.
Viele Entwickler haben in praktischen Tests festgestellt, dass die Kosten von Sonnet 5.5 sehr hoch sind, und empfehlen, weiterhin Opus 5.5 zu verwenden.
Claude Sonnet 5.5 ist jetzt auf allen Plattformen verfügbar, einschließlich AWS, Google Cloud und Microsoft Azure. Entwickler können es auf der Claude-Plattform über die Modellkennung claude-sonnet-5-5 verwenden. Wenn die Denkfunktion zuvor bei Sonnet-Modellen deaktiviert war, muss vor der Migration zu Sonnet 5.5 auf die neue Parameterkonfiguration between_tools umgestellt werden, damit die vorherige Denkfunktion deaktiviert bleibt.
Anthropic gab außerdem bekannt, dass Claude Haiku 5.5, das speziell für Anwendungen mit hoher Parallelverarbeitung und kostensensitiven Anforderungen entwickelt wurde, in den kommenden Wochen veröffentlicht wird.
01. Praktischer Vergleich mehrerer Entwickler: Beeindruckende Leistung, aber die Kosten sind nicht tragbar – ein Schießspiel kostet mehr als tausend Yuan
Viele Entwickler haben Sonnet 5 und Sonnet 5.5 praktisch verglichen, und die Leistungssteigerung zwischen den beiden Generationen von Modellen ist deutlich sichtbar.
Der bekannte Entwickler @_re_pete hat die Effekte von Sonnet 5 und Sonnet 5.5 bei der Generierung eines Laubfall-Simulators verglichen. Man erkennt, dass der Laubfall-Effekt von Sonnet 5.5 natürlicher ist und das gesamte Bild harmonischer wirkt.
In weniger als einer Minute ließ der Entwickler @kevin_t_ngo Sonnet 5.5 die Geschichte der Dinosaurier durch JavaScript-Animationen darstellen, und er verglich die Generierungsergebnisse von Sonnet 5 und Sonnet 5.5. Die von Sonnet 5.5 generierte Animation hat klare thematische Figuren, kann zudem passenden Text hinzufügen und vollständige Illustrationen mit narrativer Wirkung erzeugen.
Ein anderer Entwickler verglich die Effekte von Sonnet 5.5 mit GPT-6 Sol und GPT-6 Astra – der Unterschied zu GPT-6 Astra ist nicht sehr groß. Bei der Generierung von Bewegungen beim Fahrradfahren weisen Sonnet 5.5 und GPT-6 Astra keine größeren Mängel auf.
Hinter der beeindruckenden Leistung haben Benutzer in praktischen Tests jedoch festgestellt, dass die Kosten von Sonnet 5.5 nicht niedrig sind.
BridgeMind hat mit Sonnet 5.5 ein Schießspiel erstellt. Es gibt an, dass das neue Modell hervorragende Leistungen zeigt und das generierte Spiel als Meisterwerk bezeichnet werden kann, aber die Erstellungskosten betragen 177 US-Dollar (ca. 1187 Yuan) und die Erstellung dauerte 49 Minuten.
In dem unten gezeigten Beispiel eines von einem Entwickler erstellten Stadtsimulators ist die Leistung von Sonnet 5.5 deutlich besser als die von Sonnet 5. Sonnet 5.5 erzeugt 380.000 Ausgabe-Token und kostet 9,23 US-Dollar (ca. 61,94 Yuan), Sonnet 5 erzeugt 120.000 Ausgabe-Token und kostet 4,85 US-Dollar (ca. 32,55 Yuan).
Ein anderer Entwickler hat mit Sonnet 5.5 eine Browser-Animation mit Marmelade-Wassermelone erstellt. Die endgültigen Kosten für die API-Nutzung betragen ca. 8,20 US-Dollar (ca. 55 Yuan), davon 2,80 US-Dollar für Code und Inferenz (ca. 19 Yuan), 3,6 US-Dollar für zwischengespeicherte Kontextdaten (ca. 24,16 Yuan), 1,8 US-Dollar für Cache-Schreiboperationen (ca. 12,08 Yuan) und 0,02 US-Dollar für reguläre Eingabe-Token (ca. 0,13 Yuan). Zwei Drittel der Ressourcen werden für die Verarbeitung kontextbezogener Aufgaben verwendet.
02. Viele Tests sind mit Opus 5.5 vergleichbar, Anthropic empfiehlt Entwicklern, die Stufe anzupassen, um die Kosten zu senken
Aus den von Anthropic veröffentlichten Benchmark-Tests geht hervor, dass Sonnet 5.5 in vielen Kennzahlen das leistungsstärkere Modell Opus 5.5 bereits übertrifft.
Im Einzelnen vergleicht dieser Benchmark die Leistung von vier Modellen – Sonnet 5.5, Sonnet 5, Opus 5.5 und GPT-6 Sol – in Bereichen wie Agenten-Programmierung, Wissensarbeit, multidisziplinäres Schlussfolgern, Computeroperationen und Diagrammerkennung.
Im Vergleich zum Vorgänger Sonnet 5 hat Sonnet 5.5 die Punktzahlen bei der Programmierung und Diagrammerkennung um ein Mehrfaches gesteigert. Im Vergleich zu GPT-6 Sol ist Sonnet 5.5 bei der Agenten-Programmierung, Wissensarbeit und Diagrammerkennung leistungsfähiger. Die Punktzahl von Sonnet 5.5 im Bereich der aktiven Programmierung übertrifft sogar die von Claude Opus 5.5, und die Werte in anderen Bereichen sind vergleichbar.
Das folgende Diagramm zeigt die Vergleichskurven der Punktzahlen und der Kosten pro Aufgabe der verschiedenen Modelle bei unterschiedlichen Eingabestufen. Je näher der Datenpunkt an der oberen linken Ecke des Diagramms liegt, desto stärker ist die Modellkapazität, die pro ausgegebenem US-Dollar erzielt werden kann.
In vielen Benchmark-Tests übertrifft Sonnet 5.5 bei niedrigen/mittleren Eingabestufen die Höchstpunktzahl von Sonnet 5, während die Kosten pro Aufgabe nur etwa 1/10 des letzteren betragen. Wenn Sonnet 5.5 bei einer niedrigeren Eingabestufe ausgeführt wird, sind die Kosten pro Aufgabe niedriger, was eine Ergänzung zu Opus 5.5 darstellt. Wenn die Eingabestufe erhöht wird, erreicht es eine Leistung nahe an Opus, während die Kosten auf ähnlichem Niveau liegen.
Die Programmierung ist ein herausragender Bereich, in dem die Leistung von Sonnet 5.5 gesteigert wurde. Bei der hohen Eingabestufe des Agenten-Programmier-Benchmarks FrontierCode liegt seine Punktzahl um etwa 10 Punkte höher als die von Sonnet 5 in derselben Stufe, und die Kosten pro Aufgabe betragen nur etwa 1/15 des letzteren.
CursorBench führt Tests auf der Grundlage echter Programmiersitzungsaufgaben von Cursor durch. In diesem Benchmark liegt der Unterschied zwischen der Höchstpunktzahl von Sonnet 5.5 und Opus 5.5 nur bei etwa 2 Punkten.
Viele frühe Tester berichten, dass Sonnet 5.5 in direkten Vergleichstests Tool-Aufrufe zusammenführen kann, wodurch die Anzahl der Arbeitsschritte reduziert und die Kosten gesenkt werden.
Sonnet 5.5 hat Leistungssteigerungen bei vielen Wissensarbeitsaufgaben erzielt. Der Benchmark GDPval-AA deckt echte Geschäftsaufgaben aus 44 Berufen und 9 Branchen ab. In diesem