722 mathematische Manuskripte, OpenAI hat 10 Details versteckt, die es wert sind, verstanden zu werden.
Ein einziges Minuszeichen hat drei Nachweise in Mitleidenschaft gezogen.
Am 7. Oktober nach Peking-Zeit veröffentlichte OpenAI auf GitHub eine Reihe mathematischer Ergebnisse, die von internen Modellen erzeugt wurden. Das erste Verzeichnis umfasste 722 Manuskripte, die 372 Ergebnisfamilien zugeordnet waren. In dem von uns am 8. Oktober überprüften Verzeichnis sank die Zahl der aufgeführten Manuskripte auf 719, während die Anzahl der Familien weiterhin 372 betrug.
Die drei reduzierten Manuskripte wurden zurückgezogen.
Unter ihnen befindet sich ein geometrisches Manuskript mit dem Datum 18. September, das die Algebraizität von Weil-Klassen behandelt. In der Rückzugsnotiz steht: „The proof contains a sign error“, was bedeutet, dass der Nachweis einen Vorzeichenfehler aufweist.
Dieser Nachweis erfordert, dass die positive und negative Zählung geometrischer Schnittpunkte auf Null ergänzt wird, um die nachfolgenden Theoreme aufrufen zu können. Man ging ursprünglich davon aus, dass eine bestimmte Operation positive Zahlen hinzufügt, tatsächlich fügt sie jedoch negative Zahlen hinzu. Um es mit vereinfachten Zahlen zu veranschaulichen: Man wollte „−2+2=0“ durchführen, hat aber stattdessen „−2−2=−4“ ausgeführt. Die Anwendungsbedingungen des Theorems sind nicht erfüllt, sodass zwei weitere Manuskripte, die diese Konstruktion verwenden, keine Stützung mehr haben.
Diese Ergebnisse haben sehr hohe Bewertungen erhalten.
Am 7. Oktober bezeichnete der Kombinatoriker Gil Kalai diese Veröffentlichung als „einen erstaunlichen Meilenstein für die Mathematik“ (an amazing milestone for mathematics). Unmittelbar danach wies er darauf hin, dass die Nachweise noch von menschlichen Mathematikern überprüft und verarbeitet werden müssen.
Die Diskussion um mathematische Forschung mit KI hat schon lange begonnen.
Im September löste die Behauptung von Claude zum Nachweis der kritischen Perkolation Diskussionen aus; am 11. September veröffentlichten 25 Preisträger der Fields-Medaille, darunter Terence Tao, als ursprüngliche Unterzeichner eine Erklärung, in der sie die Fortschritte der mathematischen Fähigkeiten von KI anerkennen und gleichzeitig die Praxis von Unternehmen kritisieren, das Lösen von Problemen als Bewertungswettbewerb zu nutzen und Verständnis sowie Wissenstransfer zu vernachlässigen.
Auf der einen Seite stehen wichtige Ergebnisse, die das Fachgebiet verändern könnten, auf der anderen Seite die bereits erfolgten Rückzüge. Was genau „durchbrechen“ diese Manuskripte? Warum kann KI diese Probleme, die einst mathematische Genies in Schwierigkeiten brachten, in großen Mengen lösen?
1
Was hat die KI der mathematischen Gemeinschaft vorgelegt?
Diesmal hat OpenAI auf einen Schlag reichhaltige mathematische Materialien veröffentlicht.
Wenn man das öffentliche Repository auf GitHub öffnet, sieht man die PDF-Dateien der Arbeiten und die Quelldateien für den Satz, und Fachkollegen können die Argumentation schrittweise überprüfen. Einige Manuskripte sind mit Lean-Beweismaterial versehen – dabei werden mathematische Sätze und Schlussfolgerungen in strengen Code geschrieben, der von Programmen überprüft wird. Interessanterweise gibt es darunter auch 10 gekürzte Zusammenfassungen der Schlussfolgerungen, die einen Teil des Forschungsprozesses zeigen, einschließlich der Versuche, die nicht zum Ziel geführt haben.
Diese Manuskripte können auch als „Preprints“ bezeichnet werden. In der Regel veröffentlichen Autoren ihre Forschungstexte zuerst, damit andere sie lesen, diskutieren und überprüfen können. Preprints können wichtige Ergebnisse enthalten, was jedoch nicht bedeutet, dass sie einer externen Prüfung unterzogen wurden.
OpenAI gibt an, dass die überwiegende Mehrheit der Ergebnisse aus demselben Prozess und demselben internen Modell stammt. Wenn die wichtigen Behauptungen darin bestätigt werden, bedeutet dies, dass die Fähigkeiten desselben Modells an Forschungen in mehreren mathematischen Fachgebieten beteiligt waren.
In der Ankündigung wird auch der durchschnittliche Rechenaufwand für jedes Ergebnis umgerechnet in das Äquivalent von „etwa drei Stunden Denkzeit“ (roughly three hours) von ChatGPT Pro.
2
722, 719, 372: Drei Zahlen mit drei Bedeutungen
722 und 719 zählen die Manuskripte, 372 zählen die Gruppen, die verwandte Manuskripte zusammenfassen. OpenAI nennt solche Gruppen „Ergebnisfamilien“.
In der Repository-Beschreibung wird der Begriff „related papers“ verwendet, also „verwandte Arbeiten“.
Man kann sich eine Familie als einen Forschungsordner vorstellen. In diesem Forschungsordner erfüllen sie unterschiedliche Funktionen: Einige Artikel beweisen die Hauptschlussfolgerung, andere ergänzen einen entscheidenden Schritt, wiederum andere verallgemeinern die Schlussfolgerung auf andere Bedingungen. Gleichzeitig hat jede von ihnen ein eigenes Manuskript und teilt sich im Verzeichnis eine Familiennummer.
Das heißt, ein Artikel kann mehrere Schlussfolgerungen enthalten, und ein Ordner kann auch verschiedene Fragen beantworten.
3
Die größte Familie hat insgesamt 14 Artikel – was ist ihre Beziehung zueinander?
Die Familie 034 hat 14 Manuskripte und ist die derzeit größte Familie, die zur Algebra und komplexen Geometrie gehört. Im Verzeichnis gibt es sowohl allgemeine Argumentationen als auch Versionen, die sich speziell mit vierdimensionalen Objekten befassen.
Um zu verstehen, warum die entsprechende Forschung in mehrere Artikel unterteilt ist, kann man zuerst die Familie 088 mit nur zwei Artikeln betrachten. Die beiden Artikel untersuchen denselben geometrischen Index, der grob gesagt mit den „Schatten“ zusammenhängt, die eine Form in alle Richtungen wirft.
Eines der Studien befasst sich damit, welche Form diesen Index minimieren kann. Das andere liefert ein Gegenbeispiel, das zeigt, dass das ursprünglich vermutete Maximum nicht tatsächlich das Maximum ist. Sie konzentrieren sich auf denselben Index, beantworten aber unterschiedliche Fragen, weshalb sie derselben Familie zugeordnet und jeweils als eigenes Manuskript verfasst sind.
Diese Gruppierung ist weit verbreitet. Von den 372 Familien haben 205 nur einen einzigen Artikel, 167 mehrere Artikel. Die Familien mit mehreren Artikeln machen weniger als die Hälfte der Gesamtzahl aus, enthalten aber 514 Manuskripte, was etwa 71 % der aktuellen Manuskripte entspricht.
4
Über 17 Fachgebiete hinweg, 60 % der Familien konzentrieren sich auf sieben Gruppen
Bei der statistischen Auswertung nach der Gebietsklassifizierung im OpenAI-Verzeichnis verteilen sich die 372 Familien auf 17 Fachgebiete. Die sieben größten Gruppen umfassen insgesamt 227 Familien, was etwa 61 % ausmacht. Die theoretische Informatik steht mit 40 Familien an der Spitze, gefolgt von der Kombinatorik mit 37 Familien und der Algebra und komplexen Geometrie mit 36 Familien.
Was untersuchen diese Fachgebiete jeweils? Zum Beispiel untersucht die theoretische Informatik, wie viel Rechenleistung Algorithmen benötigen. Die Kombinatorik befasst sich hauptsächlich damit, wie diskrete Objekte angeordnet und gezählt werden. Die Algebra und komplexe Geometrie erforscht hauptsächlich die Eigenschaften von Formen, die durch Gleichungen definiert werden.
Unter den diesmal veröffentlichten Manuskripten gibt es 40 Familien mit 73 Manuskripten in der theoretischen Informatik und 29 Familien mit 105 Manuskripten in der Wahrscheinlichkeitstheorie und statistischen Mechanik. Ersteres hat mehr Familien, Letzteres mehr Manuskripte. Wenn man nur die Anzahl der Artikel und die Gruppierung nach verwandten Ergebnissen betrachtet, erhält man unterschiedliche Zahlen.
5
„Durchbrüche“ gibt es in mindestens fünf Formen
Was bedeutet der „Durchbruch“ bei den 722 Manuskripten, die OpenAI diesmal veröffentlicht hat?
Aufgrund der von uns gelesenen Manuskripte können wir fünf Arten von Beiträgen unterscheiden. Dies ist keine von OpenAI vorgegebene Klassifizierung, und ein Artikel kann mehrere davon gleichzeitig aufweisen.
(1) Eine Antwort auf eine unbekannte Frage geben. Zum Beispiel kann π ständig durch Brüche angenähert werden. Hier wird untersucht: Wie schnell kann der Fehler im Vergleich zum Nenner unendlich oft abnehmen? Das neue Manuskript behauptet, dass der Index für die Messung dieser Geschwindigkeit, der sogenannte „Irrationalitätsgrad“, gleich 2 ist.
(2) Die Schlussfolgerung auf mehr Fälle anwendbar machen. Bei der Untersuchung von Teilchen und elektromagnetischen Feldern erfordern viele vorhandene Ergebnisse, dass der Ausgangszustand ausreichend klein ist oder eine spezielle Symmetrie aufweist. Das neue Manuskript behauptet, dass unter dem im Artikel festgelegten Modell und anderen Bedingungen für die Ausgangszustände diese beiden Einschränkungen entfernt werden können, während die langfristige Glattheit der Lösung weiterhin gewährleistet ist.
(3) Eine Grenze überschreiten, von der man vermutet hat, dass sie nicht durchbrochen werden kann. Zum Beispiel erfordert die Multiplikation von längeren ganzen Zahlen normalerweise mehr Rechenschritte. Das neue Manuskript behauptet, dass unter demselben festen Maschinenmodell die Anzahl der Schritte langsamer wachsen kann als die seit langem vermutete Grenze.
(4) Die Voraussetzung ergänzen, von der viele Schlussfolgerungen gemeinsam abhängen. Zum Beispiel gehen viele Studien zunächst davon aus, dass die Unique-Games-Vermutung gilt, und beweisen dann, dass bestimmte algorithmische Aufgaben eine bestimmte Näherungsgenauigkeit nicht erreichen können. Wenn das neue Manuskript gültig ist, müssen diese Schlussfolgerungen es nicht mehr als unbewiesene Annahme auflisten.
(5) Einen anderen Nachweis für eine bekannte Antwort liefern. Zum Beispiel erkennt ein Manuskript über geometrische Gegenbeispiele zunächst an: „Their result already gives a negative answer“, was bedeutet, dass das Ergebnis früherer Forscher bereits eine negative Antwort geliefert hat, und schlägt dann eine direkte Konstruktion vor. Das Neue hier ist der Weg des Nachweises – es muss sich zeigen, ob er klarere Erklärungen oder Methoden liefern kann, die für andere Forschungen verwendbar sind.
6
Seven Highlights: Sehen Sie zuerst, welchen Satz sie verändert haben
Was genau hat diese Veröffentlichung „durchbrochen“?
Bei einem einzelnen Ergebnis kann man drei Dinge vergleichen: Wie weit die Vorgänger bereits bewiesen haben, wohin das neue Manuskript die Forschung voranzubringen behauptet, und welche Bedingungen es noch beibehält.
Die folgenden sieben Fälle werden in dieser Reihenfolge vorgestellt.
Nehmen wir die Multiplikation als Beispiel: Die Arbeit vergleicht, wie schnell die Anzahl der Rechenschritte steigt, wenn die Anzahl der Stellen ganzer Zahlen ständig zunimmt. Das neue Manuskript behauptet, diese Wachstumsgeschwindigkeit weiter zu senken.
Wenn es gültig ist, fördert es die theoretische Forschung zur Recheneffizienz. Ob reale Geräte dadurch schneller werden können, hängt jedoch davon ab, wie der Algorithmus implementiert wird und wie lang die zu berechnenden ganzen Zahlen sind.
Es ist zu beachten, dass der „Quasi-Riemann-Hypothese“ und „CM-Hodge“ im Tisch noch klarer definiert werden müssen. Ersteres erreicht noch nicht die vollständige Riemann-Hypothese, Letzteres ist auf CM-Abelmannigfaltigkeiten beschränkt.
7
Welche drei Manuskripte wurden zurückgezogen und welche Auswirkungen hat das?
Die drei zurückgezogenen Manuskripte lauten „Algebraizität von Weil-Klassen auf geteilten abelschen achtdimensionalen Mannigfaltigkeiten“, „Algebraizität der Kuga–Satake-Korrespondenz für K3-Oberflächen“ und „Die rationale Hodge-Vermutung für Produkte von K3-Oberflächen“.
Die letzten beiden befassen sich beide mit einer Art von Oberflächen namens K3 und verwenden beide die überarbeitete Version der fehlerhaften Konstruktion aus dem ersten Manuskript.
Die Rückzugsnotiz erklärt jedoch nicht, dass die ursprüngliche Aussage falsch ist: Eine Lücke in der Argumentation bedeutet nicht, dass die Aussage widerlegt wurde, und es wird nicht ausgeschlossen, dass es einen anderen gültigen Nachweis gibt.
Die drei zurückgezogenen Manuskripte gehören alle zur Familie 032. Nach dem Rückzug schrumpft diese Familie von