Wir haben Kimi K3, Qwen 3.8-Max und GLM 5.2 gemeinsam die Kontrolle über einen riesigen Code-Shitberg übernommen lassen.
Als Anthropic sein „gefährlichstes“ Modell Mythos vorstellte, urteilte sein CEO, der überzeugte anti-chinesische Hardliner Dario Amodei: Chinesische Modelle werden noch 6 bis 12 Monate brauchen, um diese Fähigkeiten zu erreichen.
Aber das, was danach passierte, ist allen bekannt: Zhipu hat sofort GLM-5.2 auf den Markt gebracht, um die Spitzenposition in der Programmierung einzuholen, und Kimi hat wiederum K3 mit 2,8 Billionen Parametern vorgestellt, sodass an der Wall Street zeitweise eine „DeepSeek-Moment“-Szene wiederholt wurde.
Unmittelbar danach hat Alibaba Qwen3.8-Max-Preview mit 2,4 Billionen Parametern vorgestellt. Laut offiziellen Angaben liegt seine Gesamtleistung nur hinter Fable 5 zurück und kann in der Full-Stack-Entwicklung, der Datenanalyse und den Office-Workflows bereits mit Spitzenmodellen konkurrieren.
Kann Qwen3.8-Max-Preview die Erzählung der chinesischen Open-Source-Modelle weiterführen?
Wir haben uns entschieden, einen Test durchzuführen: Lassen Sie drei Flaggschiff-chinesische Open-Source-Modelle der letzten Monate – GLM-5.2, K3 und Qwen3.8-Max-Preview – zusammenarbeiten, um die neue Website von SiliconStars/PingWest zu entwickeln, die gerade überarbeitet wird.
Um den Einfluss von Harness zu schwächen, haben wir den Arbeitsstil der Kombination aus „Modell + Open-Code“ angewendet.
Es ist hervorzuheben, dass die überarbeitete SiliconStars-Website ein Halbfabrikat ist. Das Website-Projekt umfasst bereits das Next.js-Frontend, Payload CMS, Animationseffekte von Anime.js usw. und verfügt bereits über fertige Designspezifikationen, historischen Code und Arbeitsdokumente.
Diese Website hat große Probleme: In der Vergangenheit wurde die Frontend- und Backendentwicklung und -wartung mehrmals durchgeführt, sodass sich schlecht geschriebener Code angesammelt hat, die Struktur überladen ist, die Frontend-Interaktion chaotisch ist und es viele falsche, nicht nutzbare Funktionen gibt … Die Probleme sind überall verstreut, und die Frontend- und Backend-Fehler sind miteinander verflochten. Kurz gesagt, die historische PingWest-Website ist das schlechteste Beispiel für Website-Entwicklung, das Sie sich vorstellen können.
Sie muss geändert werden. Für Modelle können leere Projekte ohne historische Belastung und schlecht geschriebenen Code oft frei funktionieren; während Projekte, die mitten in der Entwicklung übernommen werden, normalerweise der strengste Vater für Modelle sind. Sie erfordern, dass das Modell den aktuellen Zustand des Projekts versteht und genaue Änderungen vornimmt, ohne die vorhandenen Funktionen zu zerstören – das ist eine schwierige Aufgabe, bei der man auf schlechtem Code exzellente Ergebnisse erzielen muss.
Als Nächstes überlassen wir es GLM 5.2, K3 und Qwen 3.8-Max-Preview. Bei dieser Website-Überarbeitung müssen derzeit sechs Probleme gelöst werden, und wir testen sie nacheinander.
Wer hat den aktuellen Fortschritt des Projekts verstanden?
Ergebnis:
- Nr.1 Qwen 3.8-Max
- Nr.2 Kimi K3
- Nr.3 GLM 5.2
Diese Runde entspricht der ersten Anforderung der Website-Überarbeitung: Unterscheiden Sie klar zwischen „was jetzt vorhanden ist“ und „was in den Dokumenten früher geplant war“.
Wenn man ein Projekt mitten in der Entwicklung übernimmt, ist das Schlimmste nicht der viele Code, sondern dass das Modell alte Dokumente als aktuelle Anforderung betrachtet und die bereits abgeschlossenen Funktionen neu erstellt. Deshalb habe ich die drei Modelle nicht sofort den Code ändern lassen, sondern zuerst das Projekt analysieren lassen, um zu sehen, wer schneller den aktuellen Zustand verstehen kann.
Was die Generierungsgeschwindigkeit betrifft, ist Qwen 3.8-Max-Preview unbestritten der Schnellste, der die Aufgabe innerhalb von 10 Sekunden erledigt, gefolgt von GLM-5.2 und zuletzt Kimi K3. Schauen wir uns die Analyseergebnisse an: Die drei Modelle sind wie drei Entwickler mit unterschiedlichen Stilen.
GLM-5.2 ist wie ein erfahrener alter Meister. Es prüft die tragenden Wände, Wasser- und Stromleitungen sowie die früheren Konstruktionszeichnungen und findet genau 14 CMS-Sammlungen, die Payload-Versionssperre und den Datenbankprüfmechanismus. Es hat das tiefste Verständnis für die zugrunde liegende Struktur des Projekts. Aber dieser alte Meister hat die Zeichnungen zu sorgfältig durchgesehen und den alten Plan vom April in der Schublade auch als aktuellen Konstruktionsplan betrachtet. GLM-5.2 hat die Volltextsuche als Aufgabe zur Erledigung aufgeführt, tatsächlich sind Suche, Filterung und Hervorhebung der Ergebnisse bereits abgeschlossen.
Qwen 3.8-Max ist eher wie ein Aufseher, der täglich vor Ort ist. Es hat nicht jede Leitung des Hauses gründlich untersucht, aber es weiß, welche Wand das Bauteam kürzlich geändert und welche Fliese es verlegt hat. Es hat die schnellste Generierungsgeschwindigkeit und erfasst auch am genauesten, was das Projekt kürzlich macht.
Kimi K3 ist dagegen wie ein Makler, der Ihnen das Haus in einer Minute zeigt. Es erklärt die Raumaufteilung in sehr kurzem Umfang, was sauber und präzise klingt, aber es zählt die 14 CMS-Sammlungen zu 15 und stellt den Arbeitsordner des Nachbarn als „Dokumentenlager“ vor.
Bei der Klärung der aktuellen Anforderungen hat Qwen 3.8-Max die höchste Punktzahl. Sein Gesamtbild ist etwas unvollständig, aber es findet die Probleme am schnellsten und genauesten. Gefolgt von Kimi K3: Es weiß, was es tun soll, aber seine Geschwindigkeit ist zu langsam (das ist der am meisten kritisierte Punkt von K3). Es kann den Gesamtüberblick sehen, ist aber zu nachlässig und macht oft Fehler. Das Problem von GLM 5.2 ist schwerwiegender: Nur es betrachtet alte Dokumente als aktuelle Anforderung und erstellt die bereits abgeschlossenen Funktionen neu, was bedeutet, dass es den aktuellen Zustand nicht versteht.
Lösen von Website-Fehlermeldungen
Ergebnis:
- Nr.1 Qwen 3.8-Max
- Nr.2 GLM 5.2
- Nr.3 Kimi K3
Diese Runde entspricht der zweiten Anforderung: Kann das Modell die Diagnose in Aktion umwandeln?
Ich habe die Frontend-Seite gestartet, aber nicht gleichzeitig das CMS geöffnet, sodass die Webseite eine Fehlermeldung angezeigt hat. Ich habe die Fehlermeldung direkt an die drei Modelle übergeben und sie gebeten, damit umzugehen.
Alle drei Modelle haben das Problem lokalisiert, aber die nachfolgenden Aktionen sind offensichtlich unterschiedlich:
Qwen 3.8-Max ist einen Schritt voraus und hilft mir direkt, das CMS zu starten. Kimi K3 gibt nur eine Lösung an, führt sie aber nicht tatsächlich aus. Die Verarbeitungsgeschwindigkeit von GLM-5.2 ist langsamer. Als es bereit war, das CMS zu starten, wurde der öffentliche Port bereits von Qwen 3.8-Max belegt, sodass es direkt den von Qwen 3.8-Max gestarteten Dienst wiederverwendet hat.
Bei der Lösung der Fehlermeldungsanforderung belegt Qwen 3.8-Max immer noch den ersten Platz: Es startet das CMS und ist der Schnellste, es gibt nichts zu streiten. GLM-5.2 belegt den zweiten Platz: Es ist einen Schritt langsamer, was Punkteabzug wert ist, aber nachdem es festgestellt hat, dass der Port belegt ist, wählt es, den vorhandenen Dienst wiederzuverwenden, anstatt mit einem Fehler abzubrechen oder den Prozess anderer zu beenden und neu zu starten – das ist eine korrekte und ausgereifte technische Entscheidung. Kimi K3 hingegen liefert nur Lösungen, führt sie aber nicht aus, also hat es die Aufgabe nicht erledigt und kann nur den dritten Platz belegen.
Implementierung des Karusselleffekts
Ergebnis:
- Nr.1 GLM 5.2
- Nr.2 Kimi K3
- Nr.3 Qwen 3.8-Max
Als Nächstes haben wir die drei Modelle auf unabhängige Ports umgestellt, um ihre Fähigkeit zu testen, das Frontend präzise zu ändern.
Zuerst geht es um den Bereich der Kurzmeldungen. Ich möchte, dass er automatisches Karussell und nahtloses zirkuläres Abspielen realisiert, aber der aktuelle Animationseffekt lässt die Karten nacheinander nach links verschieben, und wenn die letzte Karte abgespielt ist, gleitet die gesamte Liste nach rechts zurück zum Anfang.
Prompts: Ändern Sie den Bereich „Was gerade passiert“ auf der Homepage, um nahtloses unendliches Karussell zu realisieren: Alle Karten bewegen sich kontinuierlich nach links. Nachdem die 08. Karte herausbewegt wurde, schließt sich die 01. Karte natürlich von rechts an, und das Abspielen läuft zirkulär. Es darf nicht vorkommen, dass die gesamte Liste nach rechts zurück zum Anfang gleitet, nachdem die letzte Karte abgespielt ist; beim Übergang des Zyklus darf keine Pause, kein Sprung und keine Leerstelle auftreten. Ändern Sie nur den Frontend-Karusselleffekt, nicht die Daten und das Backend.
Das Karussell ist eine gängige Webseiten-Komponente zur Informationsdarstellung. Können wir mit einem Satz das große Sprachmodell dazu bringen, es auf unsere eigene Website zu übertragen? Das Ergebnis ist eher enttäuschend: Alle drei Modelle haben am Ende mehr oder weniger Probleme:
Schauen wir uns zuerst Qwen 3.8-Max an. Es hat eigenmächtig die Funktion des Ziehens mit der Maus gelöscht, was zu einem schweren Punkteabzug führt. Qwen 3.8-Max hat einen kleinen Trick angewendet, um den Zyklus durch die Länge zu vortäuschen, und hat das zirkuläre Abspielen nur oberflächlich realisiert: Es hat die Gerade nicht in eine Ringbahn umgewandelt, sondern einfach einige identische Straßen hinter dem Ende hinzugefügt. Wenn der Benutzer geduldig bis zum Ende schaut, wird er feststellen, dass es nur mehrere Kopien des Inhalts erstellt hat, um die Karussellspur gewaltsam zu verlängern. Wenn die letzte Runde abgespielt ist, springen die Karten trotzdem wieder zurück zum Anfang.
Kimi K3 hat die gegenteilige Wahl getroffen. Es hat die Gerade in eine Ringbahn umgewandelt, aber die automatische Karussellfunktion gelöscht. Nur wenn der Benutzer mit der Maus zieht, bewegen sich die Karten weiter. Außerdem sind die Animationsdetails nicht fein genug: Bevor die nächste Gruppe von Karten vollständig in den Bildschirm eintritt, verschwindet die vorherige Gruppe bereits, sodass der Bildschirm Frames verliert und plötzlich stockt.
GLM-5.2 hat die vollständigste Implementierung realisiert, alle erforderlichen Funktionen sind vorhanden: Es behält sowohl das automatische Karussell als auch das Ziehen mit der Maus bei und unterstützt kontinuierlichen Zyklus. Allerdings hat es das gleiche Problem wie Kimi K3: Die alten Karten verschwinden zu schnell, und beim Übergang des Zyklus tritt immer noch ein plötzlicher Sprung auf – es fehlt nur noch der letzte Schliff für ein echtes nahtloses Zyklus.
GLM 5.2 kann den ersten Platz belegen, es ist das einzige Modell mit einer vollständigen Funktionsliste: automatisches Abspielen, ziehbar, echter Zyklus. Aber wir fordern, dass beim Übergang keine Pause, kein Sprung und keine Leerstelle auftreten darf, und an der Verbindungsstelle tritt trotzdem ein Sprung auf. Die Anforderung ist nicht vollständig erfüllt, aber das Ergebnis ist schon ziemlich gut.
Kimi K3 hat den schwierigsten Teil richtig gemacht: Es hat auch echtes automatisches Karussell realisiert, aber die Probleme – Löschen des automatischen Abspielens und Frame-Verlust beim Übergang – sind offensichtlich, dass die Entwicklung nicht abgeschlossen ist. Es ist ein ehrliches Halbfabrikat, sodass es den zweiten Platz belegen kann.
Qwen 3.8 Max hat dieses Mal schwerwiegende Probleme: Es hat das Ziehen mit der Maus gelöscht und eigenmächtig die Anforderung geändert, was in einer echten Zusammenarbeit ein Vertrauensproblem darstellt. Noch schwerwiegender ist, dass seine Lösung vorgetäuscht ist und architektonisch eine Sackgasse ist. Um echtes nahtloses Zyklus zu realisieren, muss es von Grund auf neu erstellt werden. Eine scheinbar funktionierende falsche Antwort ist viel gefährlicher als ein Halbfabrikat, von dem man auf einen Blick sieht, dass es nicht abgeschlossen ist.
Ändern vorhandener Funktionen
Ergebnis:
- Nr.1 Qwen 3.8 Max
- Nr.2 GLM 5.2
- Nr.3 Kimi K3
Als Nächstes habe ich die Hervorhebungsfarbe und den Kartenanimationseffekt im Bereich „Neueste Meinungen“ geändert. Das ursprüngliche Ergebnis ist in der folgenden Abbildung dargestellt.
Prompts: Ändern Sie den Bereich „Neueste Meinungen“ auf der Homepage: Ändern Sie die Hervorhebungsfarbe in Technologieblau (#3157FF), die auf den Titel des Bereichs, die Seriennummer und den Hover-Zustand angewendet wird. Fügen Sie den Karten einen hellblauen Rand und abgerundete Ecken hinzu. Wenn die Maus darüber schwebt, heben sich die Karten leicht an und der Rand wird blau. Andere Layouts und Inhalte bleiben unverändert, ändern Sie nur das Frontend.
Dieser Test prüft nicht, ob das Modell die Farbe korrekt erkennen kann, sondern ob der Änderungsbereich vollständig und konsistent ist. Heutige Modelle machen normalerweise keine so niedrigen Fehler wie „es soll blau geändert werden, aber es wird rot“. Das wirklich Schwierige ist, ob es verstehen kann, welche Stellen genau geändert werden müssen, und eine relativ weit gefasste Designempfehlung in eine genaue Änderungs