StartseiteArtikel

Gerade hat Xiaohongshu dots3-note als Open Source veröffentlicht, das Modell aus derselben Serie mit der vollen Punktzahl von 42 bei der IMO ist da.

机器之心2026-08-14 11:05
KI ist in der Lage, Mathematikolympiade-Aufgaben zu lösen, und muss zudem lernen, das alltägliche Leben zu meistern.

Endlich ist die gleichnamige Version des Goldmedaillen-Modells von Xiaohongshu für perfekte Punkte bei der IMO als Open Source veröffentlicht!

Im vergangenen Monat hat das selbst entwickelte große Sprachmodell von Xiaohongshu „dots-note-3.0“ einen historischen Rekord aufgestellt: Zum ersten Mal hat eine KI bei der Internationalen Mathematik-Olympiade den offiziell anerkannten perfekten Punktestand von 42 Punkten erzielt. Seitdem war die am häufigsten in der Community gestellte Frage, wann das Modell als Open Source veröffentlicht wird.

Adina Yakup, verantwortliche Person für KI-Forschung und Community-Ökosystem bei HuggingFace. Bildquelle: X Post

Heute kündigt das Dots-Modell-Labor von Xiaohongshu (im Folgenden als Dots-Labor bezeichnet) die Open-Source-Veröffentlichung von dots3-note preview an! Es ist auch die erste Open-Source-Version der dots3-Modellreihe, die auf langfristige Aufgaben abzielt, die der Realität näher sind und schwieriger zu bewerten sind.

Was die Parameter betrifft, beträgt die Gesamtparameterzahl von dots3-note preview 280B, davon sind 16B aktive Parameter. Es unterstützt ein außergewöhnlich langes Kontextfenster von 512K, verfügt über multimodale Verständnisfähigkeiten für Text, Bild und Sprache und ist für komplexes Schlussfolgern, Agenten und multimodale Wahrnehmung optimiert.

API-Zugang: https://dots.ai/platform/

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

GitHub:https://github.com/studio-dots-ai/dots3-note-prev

Der perfekte Punkt bei der IMO bestätigt die Fähigkeit dieser Modellreihe bei mathematischem Schlussfolgern und Beweisen. Diese Open-Source-Veröffentlichung stellt die Herausforderung in eine andere Kategorie von Szenarien, die schwerer zu standardisieren sind: Reiseplanung, Hochzeitsvorbereitung, Betrieb eines Ladens. Für diese Aufgaben gibt es keine eindeutige Antwort, und die Dauer kann sich auf mehrere Stunden, Tage oder sogar noch länger erstrecken.

dots3-note preview konzentriert sich auf langfristige Aufgaben und trifft gleichzeitig eine Hauptlinie der aktuellen Entwicklung von Agenten: Sie werden zunehmend dazu aufgefordert, immer längere und vollständigere Arbeiten selbstständig zu übernehmen. OpenAI hat offengelegt, dass im Mai dieses Jahres mehr als 70 % der Nutzer Codex Aufgaben zugewiesen haben, die ein Mensch mehr als eine Stunde zur Erledigung benötigt; bis Juni erzeugten die 1 % der aktiven Nutzer mit der höchsten internen Nutzungsrate bei OpenAI täglich mehr als 60 Stunden an Agenten-Aktionen.

Wenn die Aufgaben aber in verschiedene Szenarien übertragen werden, öffnet sich schnell die Kluft im Schwierigkeitsgrad. Im Gegensatz zu Szenarien wie Mathematik, Code und Ingenieurwesen, in denen die Leistung von Agenten bereits ausgereift ist, ist die reale Lebensumgebung offener und die Anforderungen unschärfer. dots3-note preview wählt diesen Ort als „Prüfungsort“ und stellt höhere Anforderungen an seine eigenen Fähigkeiten zur langfristigen Planung, Urteilsbildung und Fehlerkorrektur.

Aus den Daten mehrerer gängiger Benchmarks geht hervor, dass das Modell bei mehreren Schlussfolgerungs- und Agentenaufgaben mit großen Modellen mithalten oder diese sogar übertreffen kann, deren Parameterumfang ein Mehrfaches seines eigenen beträgt, und seine Bildverarbeitungsfähigkeiten in seinem Größenbereich herausragend sind.

Bildquelle: Offizieller technischer Blog

Bildquelle: Offizieller technischer Blog

Zuvor hat Xiaohongshu bereits nacheinander das Text-Großmodell dots.llm1, das mehrsprachige Dokumentenlayout-Analysemodell dots.ocr und das multimodale Bildverständnis-Großmodell dots.vlm1 als Open Source veröffentlicht. Die neueste Open-Source-Veröffentlichung schließt das fehlende Puzzleteil im Bereich der Agenten ab.

Praxis-Test aus erster Hand:

Kann es wirklich komplexe Aufgaben erledigen?

Die tatsächliche Leistungsfähigkeit des Modells lässt sich nicht allein anhand der Ranglisten beurteilen. Im Folgenden betrachten wir anhand mehrerer Fälle, wie dieses Modell Aufgaben mit verstreuten Informationen, zahlreichen Schritten und sich ständig ändernden Umständen selbstständig vorantreibt und Ergebnisse liefert.

Steuerung von Slay the Spire II

Lassen Sie dots3-note preview zunächst eine Partie von Slay the Spire II übernehmen.

Die Schwierigkeit dieses Spiels liegt darin, dass die Wahl der Route, die Auswahl der Karten, die Entscheidung, einen Elite-Gegner herauszufordern, die Verwendung von Münzen und die Wahl zwischen Ruhe oder Verbesserung im Lager die Überlebenschancen nach Dutzenden von Runden beeinflussen. Eine lokal optimale Entscheidung kann leicht zu Problemen im anschließenden Boss-Kampf führen.

Das Modell wurde nicht speziell für dieses Spiel trainiert, kann aber anhand der Kampfrückmeldungen die Mechanismen von Karten und Gegnern erlernen, gleichzeitig Lebenspunkte, Kartensatz, Münzen und Tränke verwalten, ständig zwischen Laden, Lager und Elite-Kampf abwägen und bis zur 33. Ebene spielen.

ARC-AGI 3 von Grund auf lösen

Bei der langfristigen Schlussfolgerungsaufgabe ARC-AGI 3 sind die Regeln völlig unbekannt. Das Modell muss die Bilder beobachten, Hypothesen aufstellen und diese dann durch Operationen überprüfen.

dots3-note preview entdeckt schrittweise die Regeln der synchronen vertikalen Bewegung und der horizontalen Spiegelung von zwei Blöcken und erlernt Mechanismen wie gefährliche Felder, bewegliche Markierungen, Druckschalter und Tore.

Jedes Mal, wenn eine Hypothese fehlschlägt, aktiviert es den Self-Critiquing-Mechanismus zur Neubewertung und schreibt die korrigierten Regeln in memory.md. Diese Datei ähnelt einem Notizbuch des Modells und speichert kontinuierlich das dynamische Verständnis der Umgebung.

Schließlich löst das Modell alle 6 Level in 320 Schritten.

Schwierige Renovierungsprobleme anhand von Bildern lösen

Die Fähigkeit zum kontinuierlichen Lernen und Schlussfolgern kehrt letztendlich zum realen Leben zurück.

Nehmen Sie zum Beispiel das folgende typische Renovierungsproblem: Laden Sie gleichzeitig den Grundriss der Wohnung und die Screenshots der Parameter von zwei Kühlschränken hoch und ergänzen Sie die Information: An der Wand der Küche, die dem Arbeitszimmer zugewandt ist, wurde bereits eine 1,5 Meter lange Arbeitsplatte installiert. Jetzt soll der Kühlschrank an dieser Wand aufgestellt werden – passt er überhaupt dorthin?

Die Schlüsselinformationen sind auf verschiedene Bilder und Textaussagen verteilt. Das Modell muss den verbleibenden Platz an der Wand anhand des Grundrisses, der Größe der vorhandenen Arbeitsplatte und der Spezifikationen der beiden Kühlschränke berechnen und eine passende Schlussfolgerung ziehen. Es erinnert den Nutzer auch aktiv daran, die Maße vor Ort noch einmal zu überprüfen.

Der gesamte Prozess umfasst räumliches Bildverständnis, komplexes Schlussfolgern und den Aufruf von Tools und zeigt die Fähigkeit des Modells, individuelle Antworten basierend auf der tatsächlichen Umgebung des Nutzers zu generieren.

Unter Verwendung desselben Grundrisses lassen Sie das Modell weiterhin mehrere Renovierungslösungen im Massivholzstil für das Arbeitszimmer entwerfen.

Das Modell behält die zuvor erkannten Größen und Lichtverhältnisse bei, durchsucht relevante Notizen auf Xiaohongshu, fasst vier Lösungen im Massivholzstil zusammen und generiert eine Webseite. Es erledigt nacheinander Bildverarbeitung, Berechnung, Informationsabruf und Inhaltserstellung.

End-to-End-Entwicklung einer visionOS-Anwendung erfolgreich durchführen

Zum Schluss prüfen wir, ob dots3-note preview eine vollständige End-to-End-Softwareentwicklungsaufgabe selbstständig erledigen kann, indem wir es auffordern, „unter Bezugnahme auf das Design von Xiaohongshu eine native Anwendung für Apple Vision Pro zu entwickeln“.

Nach Erhalt der Aufgabe beginnt das Modell nicht sofort mit dem Schreiben von Code. Zuerst versteht es die Produktanforderungen, bezieht sich auf 9 Oberflächenbilder und bestimmt selbstständig den Entwicklungsplan, einschließlich der Verwendung der SwiftUI+RealityKit-Technologie und der Planung verschiedener Module wie Fenster, immersiver Raum und 3D-Produktpräsentation. Nachdem der Plan festgelegt ist, bereitet es weiter Materialien wie lokale Bilder und 3D-Modelle vor und realisiert dann den Code schrittweise.

Das gesamte Projekt erzeugt 12 Swift-Dateien mit 1876 Codezeilen, realisiert Oberflächen für Informationsfluss, persönliche Homepage, private Nachrichten und Produkte und bindet USDZ-3D-Modelle ein. Anschließend generiert das Modell selbstständig das Xcode-Projekt, ruft xcodebuild zum Kompilieren auf und führt die Überprüfung im visionOS Simulator durch, was schließlich zu der Anzeige „BUILD SUCCEEDED“ führt.

Der gesamte Entwicklungsprozess von der Anforderungsanalyse über die Technologieauswahl, die Code-Implementierung, die Kompilierung bis zur Überprüfung wurde vollständig erfolgreich durchgeführt.

Das fertige Produkt verfügt bereits über eine relativ vollständige räumliche Interaktion: Der Informationsfluss kann scrollen, Notizen können zur Detailseite aufgerufen werden, und die persönliche Homepage sowie private Nachrichten können als separate Fenster geöffnet werden.

Nutzer können in der Einkaufsoberfläche direkt verschiedene 3D-Produkte anzeigen und wechseln.

Es gibt keine Standardantwort –

Das Modell muss kontinuierlich lernen und sich selbst korrigieren

Aus mehreren Praxistests geht hervor, dass die herausragendste Fähigkeit von dots3-note preview darin besteht, neue Informationen während der Erkundung zu merken und sich dann anzupassen, wenn sich Bedingungen ändern oder Fehlentscheidungen getroffen werden, bis das Ergebnis geliefert wird. Wie erreicht es das? Der Schlüssel liegt in zwei Dingen: Nützliche Informationen lernen und merken sowie Abweichungen in der eigenen Urteilsbildung rechtzeitig erkennen und korrigieren.

Ein erstes Problem, das das Dots-Labor lösen muss, ist: Kann das Modell nach Abschluss des Trainings kontinuierlich aus der Umgebung und von den Nutzern lernen?

Um diese Fähigkeit zu trainieren, hat das Dots-Labor Tausende von außergewöhnlich langfristigen