StartseiteArtikel

Gerade hat Ant auf den Schultern von Kimi ein neues Open-Source-Modell veröffentlicht.

智东西2026-08-12 08:34
Mit 1,3 Milliarden aktivierten Parametern tritt es direkt gegen die 31B-Modelle an! Ant hat ein neues lokales Open-Source-Agent-Modell veröffentlicht, das auf MacBook ausgeführt werden kann.

Bericht von Zhidx am 11. August: Das große Sprachmodell Ant Ling hat ein leichtgewichtiges MoE-Modell mit gemischter Inferenz als Open-Source veröffentlicht – Ling-3.0-tiny.

Dieses Modell hat eine Gesamtparameteranzahl von 7,9B, und die Anzahl der aktivierten Parameter während der Inferenz beträgt 1,3B. Es ist hauptsächlich für die effiziente lokale Bereitstellung konzipiert. Gleichzeitig werden drei Versionen BF16, FP8 und INT4 bereitgestellt, die auf Geräten wie DGX Spark, MacBook, Mac mini validiert wurden und Leistung, Effizienz und Bereitstellbarkeit miteinander verbinden.

Im Bewertungssystem des Artificial Analysis Intelligence Index erreicht Ling-3.0-tiny 25 Punkte, nur 1 Punkt weniger als Gemma-4-26B-A4B, und liegt gleichzeitig über den Werten von gpt-oss-120B (high), Qwen3.5-9B, Gemma-4-12B und Gemma-4-E4B.

Die wichtigsten Punkte dieses Modells sind wie folgt zusammengefasst:

1. Effiziente gemischte lineare Architektur: Ling-3.0-tiny verwendet eine 3:1 abwechselnd gestapelte Struktur aus KDA (Kimi Incremental Attention), die von Moonshot AI selbst entwickelt wurde, und MLA (Multi-head Latent Attention), die von DeepSeek selbst entwickelt wurde, und ist mit einem spärlichen MoE-Feedforward-Netzwerk ausgestattet, das aus 128 Routing-Experten besteht, um eine effiziente gemischte lineare Architektur aufzubauen.

Jedes Token aktiviert nur 8 Routing-Experten und 1 gemeinsamen Experten, sodass das Modell ein Gleichgewicht zwischen der Fähigkeit zur Modellierung langer Kontexte, der Parametereffizienz und den Berechnungskosten erreicht.

2. Native gemischte Inferenz und Agent-Fähigkeiten: Ling-3.0-tiny verbindet die Fähigkeiten zur schnellen Antwort und zur mehrstufigen Inferenz. Es kann der Denkmodus über den Parameter enable_thinking in einer einzelnen Anfrage flexibel aktiviert oder deaktiviert werden. Das Modell zeigt ausgewogene Leistungen in Szenarien wie allgemeinen Agent-Aufgaben, Codegenerierung, mathematischer und naturwissenschaftlicher Inferenz sowie Befolgung von Anweisungen.

3. Lokale und Edge-Bereitstellung: Bei FP8-Genauigkeit erreicht der Inferenzdurchsatz von Ling-3.0-tiny auf DGX Spark 100–105 Tokens/s, während er auf M4 Pro MacBook 86–90 Tokens/s beträgt. Bei einer Kontextlänge von 8K liegt die maximale Speicherauslastung nur bei 8,34 GiB.

Wie im folgenden Video gezeigt, reproduziert Ling das Kern-Erlebnis von Infinite Wiki auf einem MacBook Pro mit 36 GB Speicher. Wenn Benutzer beim Lesen auf Wörter klicken, werden Kontexterklärungskarten generiert, die mehrstufiges Wissensdrilldown unterstützen.

Diese Demo läuft vollständig lokal mit lokaler Inferenz, ohne Cloud-Aufrufe. Die gemessene Antwortzeit für das erste Token liegt unter 100 Millisekunden. Alle Daten verbleiben auf dem Gerät, es entstehen keine Cloud-API-Kosten, was einem lokalen Wissensmotor mit nativer Geschwindigkeit nahekommt.

Hugging Face Adresse:

https://huggingface.co/inclusionAI/Ling-3.0-tiny

https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8

https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4

ModelScope Adresse:

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4

01.

1,3B aktivierte Parameter: "Kleiner Einsatz für große Wirkung"

Bewertung liegt dicht an großen 26B-Modellen

Im Bewertungssystem des Artificial Analysis Intelligence Index erreicht Ling-3.0-tiny 25 Punkte. Dieser Index misst die übergreifende Aufgabenfähigkeit des Modells umfassend aus neun Richtungen wie realen Aufgaben, Werkzeugnutzung, Code, wissenschaftlicher Inferenz, Wissenszuverlässigkeit und langen Kontexten.

Die von Ling veröffentlichten Vergleichsergebnisse zeigen, dass die Gesamtpunktzahl von Ling-3.0-tiny nur 1 Punkt weniger als die von Gemma-4-26B-A4B beträgt, was größeren MoE-Modellen mit etwa 4B aktivierten Parametern nahekommt, und gleichzeitig über den Werten von gpt-oss-120B (high), Qwen3.5-9B, Gemma-4-12B und Gemma-4-E4B liegt.

Ling-3.0-tiny hat insgesamt 7,9B Parameter, aber jedes Token aktiviert nur 1,3B Parameter. Das bedeutet, dass es mit geringerem tatsächlichem Berechnungsumfang den Bereich der umfassenden Fähigkeiten von Mainstream-Modellen der 4B- bis 12B-Klasse erreicht.

Einzelne Punktzahlen können nicht alle Fähigkeiten des Modells abdecken, und Tiny-Modelle können nicht alle großen Modelle ersetzen. Aber aus den relevanten Bewertungen geht hervor, dass Ling-3.0-tiny bereits die grundlegende Fähigkeit hat, in Code-Unterstützung, Wissensworkflows, Werkzeugaufrufe und lokale Agent-Anwendungen einzugehen. Seine Positionierung geht über kleine Modelle hinaus, die nur darauf abzielen, "auf dem Gerät Platz zu finden".

02.

Agent-Bewertung übertrifft große 31B-Modelle

Ausgabegeschwindigkeit über 160 Tokens/s

Die herausragenden Richtungen von Ling-3.0-tiny sind reale Aufgaben und Agent-Ausführung.

Seine Punktzahl im Artificial Analysis Agentic Index beträgt 16 und liegt über der von Gemma-4-31B. Dabei erreicht GDPval-AA v2 772 Elo, und τ³-Banking erreicht 20,80, was die Fähigkeit des Modells in Aufgabenverständnis, Werkzeugaufruf und Fortschritt von Prozessen widerspiegelt.

Unter den von Ling dieses Mal aufgelisteten Vergleichsmodellen erzielt Ling-3.0-tiny Spitzenleistungen bei den Indikatoren IMO-AnswerBench und Nicht-Halluzinationsrate, und seine Leistungen bei Aufgaben wie Mathematik, wissenschaftlicher Inferenz, Code-Agent, Befolgung von Anweisungen und langen Kontexten sind ebenfalls relativ ausgewogen.

Bei einem umfassenden Intelligenzindex von 25 Punkten überschreitet die Ausgabegeschwindigkeit von Ling-3.0-tiny 160 Tokens/s. Die End-to-End-Zeit für die Ausgabe von 500 Tokens beträgt etwa 18 Sekunden, einschließlich des Denkprozesses des Modells.

Der kleinere Aktivierungsumfang führt somit zu kürzeren Aufgabenwartezeiten und trägt auch dazu bei, die Antworteffizienz bei der kontinuierlichen Ausführung von Aufgaben durch den Agent zu verbessern.

03.

Innovative Architektur auf den Schultern von DeepSeek und Kimi

Senkung der Hürden für die lokale Bereitstellung

Ling-3.0-tiny setzt die technische Linie der nativen gemischten linearen Aufmerksamkeit der Ling-3.0-Serie fort und wird weiter für die Leichtgewichtigkeit und die Bereitstellung mit niedrigen Hürden optimiert. Seine Gesamtparameteranzahl wird auf 7,9B begrenzt, und die Anzahl der aktivierten Parameter pro Token beträgt 1,3B.

Das Modell verwendet eine 3:1-KDA-MLA-Architektur, d. h. jede 4 Schichten enthalten 3 Schichten KDA und 1 Schicht MLA, um die Verarbeitungseffizienz langer Kontexte zu verbessern.

Im MoE-Teil legt Ling-3.0-tiny 128 spärliche Experten fest. Jedes Token aktiviert 8 Routing-Experten und 1 gemeinsamen Experten, um mit einer kleineren Anzahl aktivierter Parameter vollständigere Modellfähigkeiten zu tragen.

Dieses Modell verwendet auch einen nativen gemischten Inferenzmechanismus, sodass schnelle Antworten für reguläre Aufgaben und mehrstufiges Denken für komplexe Aufgaben von demselben Modell erledigt werden. Das Trainingsziel Multi-Token Prediction bildet die Grundlage für eine effizientere Token-Vorhersage und eine anschließende Beschleunigung der Inferenz.

Diese Architekturdesigns zielen hauptsächlich auf drei praktische Werte ab: Reduzierung der für die Inferenz erforderlichen Berechnungsressourcen, Senkung der Hürden für die lokale Bereitstellung und die sekundäre Entwicklung, und Ermöglichung, dass das leichtgewichtige Modell die Fähigkeit hat, an echten Agent-Workflows teilzunehmen.

04.

Von DGX Spark bis MacBook

Drei Genauigkeitsversionen decken verschiedene Geräte ab

Ling-3.0-tiny veröffentlicht dieses Mal gleichzeitig drei Open-Source-Versionen: BF16, FP8 und INT4. Entwickler können das Bereitstellungsschema entsprechend den Hardwarebedingungen, Leistungsanforderungen und Kosten auswählen.

Dabei eignet sich die BF16-Version für Forschungsbewertungen und Produktionsanwendungen, die auf vollständige Genauigkeit Wert legen; die FP8-Version sucht ein Gleichgewicht zwischen Modelleffekt, Laufgeschwindigkeit und Ressourcenauslastung; die INT4-Version senkt den Ressourcenbedarf weiter und zielt auf lokale Umgebungen mit relativ begrenzter Rechenleistung und Speicher ab.

Die Einführung der drei Versionen ermöglicht es dem Modell, verschiedene Geräte von professionellen lokalen AI-Workstations bis zu PCs abzudecken. Entwickler können es in Workflows wie lokales Wissensdatenbank, Code-Assistent, UI-Automatisierung und Unternehmensaufgaben-Agent einbinden und das Modell sowie die Geschäftsdaten in der lokalen Umgebung behalten.

1. DGX Spark: Ein einzelner Server kann kleine lokale Dienste unterstützen

Ling-3.0-tiny kann FP8-Inferenz auf einem einzelnen NVIDIA DGX Spark ausführen, und die Modellgewichtdatei ist etwa 7,85 GB groß.

Bei 2K-Eingabetests beträgt die stabile Decodierungsgeschwindigkeit pro Anfrage etwa 100 bis 105 Tokens/s; bei gleichzeitiger Ausführung von zwei Anfragen beträgt der aggregierte Decodierungsdurchsatz etwa 161 Tokens/s.

Gemäß den oben genannten Testergebnissen müssen Entwickler und kleine bis mittlere Teams keine großen Rechencluster aufbauen. Mit nur einem DGX Spark können sie einen unabhängig betriebenen lokalen Modelldienst einrichten, um Inferenzfähigkeiten für eine kleine Anzahl von Benutzern bereitzustellen. Potenzielle Anwendungen umfassen unternehmensinterne Wissensassistenten, Code-Assistenten für Entwicklerteams und Aufgaben-Agenten für spezifische Geschäftsprozesse.

Ling hat Ling-3.0-tiny auch auf DGX Spark bereitgestellt und damit mobile Geräte angetrieben, um den Prozess zu demonstrieren, in dem das Modell Aufgaben versteht, Werkzeuge aufruft, automatisierte Operationen ausführt und die Validierung abschließt. Diese Demo richtet sich an Szenarien für Massenversuche und Regressionsvalidierung in der Entwicklungs- und Testphase und bestätigt das Anwendungspotenzial des lokalen Modells in Bezug auf Betriebskosten, Datenkontrollierbarkeit und Ausführungszuverlässigkeit.

2. MacBook: Antwortzeit des ersten Tokens unter 100 Millisekunden

Derzeit wurde Ling-3.0-tiny für die lokale Ausführung auf MacBook (Apple Silicon) angepasst, und sowohl die BF16- als auch die FP8-Version können ausgeführt werden.

Auf dem MacBook kann