StartseiteArtikel

Je länger Verträge, Akten und Due-Diligence-Berichte sind, desto stärker wird der Videospeicher belastet und desto leichter gehen Schlüsselklauseln verloren: APS möchte mit „topologiebewusster Kompression“ die semantische Struktur langer Texte bewahren.

氪友IBNF2026-10-09 16:39
Das Langtext-Komprimierungsschema APS hat die rechtliche Anerkennung erhalten und sucht eine Zusammenarbeit für die Seed-Runde.

Widerspruch zwischen dem Grafikkartenspeicherdruck bei der Langtext-Inferenz und der Genauigkeit in professionellen Szenarien

Bei der Verarbeitung langer Dokumente wie Verträge, Akten und Due-Diligence-Berichte durch große Sprachmodelle steigen mit zunehmender Kontextlänge der Inferenz-Grafikkartenspeicherbedarf und der Rechenaufwand. Für Szenarien wie Recht, Finanzen und öffentliche Verwaltung besteht die eigentliche Schwierigkeit nicht nur darin, dass das Modell „laufen kann“, sondern dass „nach der Kompression keine Schlüsselfakten verloren gehen dürfen“. Viele vorhandene Kompressionsansätze wirken bei normalem Text effektiv, aber bei langen Verträgen, komplexen Eigentumsverhältnissen und der Rückverfolgung von Fakten über mehrere Absätze hinweg neigen die Modelle dazu, wichtige Klauseln zu übersehen oder die Beziehungen zwischen Subjekten zu verwechseln.

Die Nutzer in solchen Szenarien interessieren sich nicht für ausgefallene Fähigkeiten des Modells, sondern nur für drei Dinge: Sind die Schlüsselinformationen vorhanden? Ist die Inferenzgrundlage korrekt? Lassen sich die Kosten senken? Daher wird die Langtext-Inferenzkompression von einem technischen Optimierungsproblem zu einer Voraussetzung für die Skalierbarkeit professioneller KI-Anwendungen.

Topologie-bewusster Kompressionsansatz von APS und überprüfte Ergebnisse

Das APS-Projekt verfolgt einen eher unterlagernden Ansatz für die Langtext-Inferenzkompression: Es betrachtet nicht die „Aufmerksamkeitswerte“ als einzige Grundlage, sondern identifiziert nach Abschluss der Kontextkodierung durch das Modell die Bereiche mit deutlichen Änderungen der Informationsdichte auf der Repräsentationsebene, behält dann den zentralen Kontext in Blöcken bei und reserviert notwendige Pufferbereiche, sodass der komprimierte Kontext die ursprüngliche semantische Strukturbeziehung so weit wie möglich beibehält.

Bei der technischen Umsetzung hält APS an drei sehr „harten“ Maßnahmen fest: Der komprimierte Key-Value-Cache muss physisch neu organisiert werden; jeder beibehaltene Kontextausschnitt muss die tatsächliche Positionsinformation im ursprünglichen Text enthalten; die Positionskodierung und die Aufmerksamkeitsmaske in der Generierungsphase müssen streng ausgerichtet sein. Der einzige Zweck dieser Vorgehensweise ist, dass das Modell auch dann noch weiß, „an welcher Stelle des Dokuments welcher Satz ursprünglich stand“, wenn der Kontext um die Hälfte gekürzt wird, sodass die Beziehungen im Langtext nicht durch die Kompression zerstört werden.

Unter den experimentellen Bedingungen von Qwen2.5-7B, 32K-Kontext und 50% Key-Value-Cache-Kompression erzielte APS ein Ergebnis von 9/9 bei der Aufgabe zur Abfrage von Schlüsselinformationen in Langtexten; bei fünfzehn rechtlichen Sondentests lag die Leistung von APS auf dem Niveau des vollständigen unkomprimierten Basiswerts und war besser als das Verfahren mit zufälligem Kürzen. Noch wichtiger ist das Feedback aus den Anwendungszenarien: Nach Tests mit echten rechtlichen Korpora durch das technische Team des Ökosystemdienstleisters Tongyi Farui wurde festgestellt, dass APS einen „absoluten Vorteil“ bei der Extraktion von Schlüsselinformationen aus langen Dokumenten aufweist, und es wurde mitgeteilt, dass bei Kooperationsbereitschaft der Projektseite die Kooperationsformen weiter erörtert werden können.

Hintergrund des Teams, technischer Schutz und aktueller Fortschritt

APS wird von einem Team mit interdisziplinärem Hintergrund in Recht und künstlicher Intelligenz vorangetrieben. Der Gründer absolvierte sein Studium an der Juristischen Fakultät der Indiana University in den USA, war früher Rechtsdirektor mehrerer Unternehmen der Fortune-500-Liste und befasste sich langfristig mit häufigen Langtextaufgaben wie Vertragsprüfung, geistiges Eigentum, Compliance und Streitbeilegung, sodass er direkt damit vertraut ist, „welche Informationen in rechtlichen Szenarien nicht verloren gehen dürfen“.

Beim technischen Schutz wird der Kernalgorithmus von APS nicht über öffentliche Patentwege geschützt, sondern als Geschäftsgeheimnis. Die Projektseite geht davon aus, dass in der sehr frühen Phase eine zu frühe Offenlegung der Implementierungsdetails der Aufrechterhaltung der technischen Barrieren abträglich ist; ob in Zukunft Patente angemeldet werden, wird je nach Kooperationsmodus, Lizenzumfang und Kommerzialisierungspfad festgelegt.

Derzeit hat APS die technische Überprüfung des Kernansatzes und die erste Bewertung abgeschlossen, es wurde noch keine Finanzierungsgesellschaft gegründet, und auf der Grundlage der technischen Verifizierungsergebnisse und des Feedbacks aus den Anwendungszenarien wird nach Unterstützung für die Seed-Runde gesucht. Wenn die Mittel zur Verfügung stehen, werden sie hauptsächlich für die technische Kapselung, die Vervollständigung des Bewertungssystems, die gemeinsame Überprüfung mit den Szenarienpartnern und die Gründung der Gesellschaft verwendet. Der Projektseite ist es wichtiger, nicht einfach eine Finanzierung zu erhalten, sondern Industriepartner oder Frühphaseninvestoren zu finden, die den Wert der Infrastruktur für Langtext-Inferenz verstehen und bereit sind, die Technologie zunächst gemeinsam mit echten Geschäftskorpora zu überprüfen.

Die Langtext-Inferenzkompression wird nicht „eine weitere KI-Geschichte“ im Rahmen kurzfristiger Trends sein. Wenn sich unternehmensweite Anwendungen von Chats zu echten langen Dokumenten wie Verträgen, Akten, Forschungsberichten und Aufsichtsdokumenten weiterentwickeln, werden die Inferenzkosten und die Informationserhaltung zum Trennungsfaktor dafür, ob KI in Produktionssysteme integriert werden kann. Was APS derzeit zeigt, ist kein bereits abgeschlossener geschlossener Wirtschaftszyklus, sondern ein technischer Ansatz, der von den Szenarienpartnern als „mit absolutem Vorteil“ eingestuft wird, sowie eine Methodik, die dafür sorgt, dass die semantische Struktur auch bei hohem Kompressionsverhältnis möglichst nicht zusammenbricht.