Kurz gesagt

  • OpenAI veröffentlichte 722 mathematische Manuskripte in 372 Ergebnisgruppen auf GitHub aus einem nicht veröffentlichten internen Modell.
  • Nur 162 der 722 Arbeiten haben ein Lean-formalisiertes Hauptergebnis, und OpenAI warnt, dass einige nicht formalisierte Ergebnisse Probleme haben könnten.
  • Andrew Sutherland vom MIT sagt, die Behauptung eines einzigen Prompts und eines einzigen Agenten sei unbestätigt, bis das Modell veröffentlicht wird, und die Veröffentlichung lasse die Prompts weg, deren Offenlegung eine Beratergruppe am Institute for Advanced Study empfohlen hatte.

OpenAI veröffentlichte am Dienstag 722 mathematische Manuskripte auf GitHub, alle von einem internen Modell erstellt, das das Unternehmen nicht veröffentlicht hat. Ein Sprecher von OpenAI sagte, fast alles stamme von einem einzigen Prompt, der einem einzigen KI-Agenten übergeben wurde, obwohl einige mehrere Versuche erfordert haben könnten.

Es ist eine kühne Behauptung und ein potenziell bedeutender Durchbruch auf dem Gebiet der Mathematik. Aber nicht jeder ist ein Fan oder kauft den Hype.

Myriad: Wie hoch wird Nvidia steigen? Klicken Sie, um Ihre Vorhersage zu treffen.
Myriad: Wie hoch wird Nvidia steigen? Klicken Sie, um Ihre Vorhersage zu treffen.

„Solange und es sei denn, sie veröffentlichen das Modell und die Leute können ihre Ergebnisse reproduzieren, denke ich, sollte man alle Behauptungen über das Lösen von Problemen mit einem einzigen Agenten in einem Durchgang als unbestätigt betrachten“, Andrew Sutherland, ein Mathematiker am MIT, sagte gegenüber Scientific American. „Wir sollten Belege verlangen“, sagte er.

Die Arbeiten sind in 372 „Familien“ verwandter Ergebnisse gruppiert, und eine Familie kann ein Haupttheorem mit begleitenden Argumenten, Konsequenzen oder alternativen Beweisen bündeln. Das macht 722 zu einer Zählung von Manuskripten, nicht von gelösten Problemen. OpenAI sagt, es habe dem Modell etwa 4.000 Probleme gestellt und die Ergebnisse behalten, die es für bedeutend genug hielt, um sie zu veröffentlichen.

Das durchschnittliche Ergebnis verbrauchte das Äquivalent von etwa drei Stunden ChatGPT Pro Denk-Rechenleistung, laut OpenAI. Die Navier-Stokes-Behauptung letzten Monat sah ganz anders aus, mit 10.000 koordinierenden Agenten, die 88 Stunden lang arbeiteten.

OpenAI veröffentlichte gekürzte Begründungszusammenfassungen für 10 der Ergebnisse. Allerdings kommen nur 162 der 722 Arbeiten mit einem computergestützten Hauptergebnis, laut einem Formalisierungskatalog im Repository. Das sind etwa 22 % der Sammlung, übersetzt in Lean, eine Software, die jeden logischen Schritt mechanisch überprüft.

OpenAI selbst sagt, dass nicht alle Manuskripte Lean-Formalisierungen haben und dass „einige der nicht formalisierten Ergebnisse Probleme haben könnten“. Mit anderen Worten: Vieles von dem, was sie veröffentlicht haben, könnte falsch sein.

Eine bestandene Lean-Prüfung bestätigt nur, dass der Beweis aus der Aussage folgt, wie sie in Lean geschrieben steht. Sie zeigt nicht, dass die Aussage mit dem ursprünglichen Problem übereinstimmt oder dass das Ergebnis neu oder wichtig ist – das ist der Teil, den Mathematiker jetzt beurteilen müssen.

Und genau hier ziehen Forscher die Augenbrauen hoch.

„Es ist jetzt der Fall, dass KI mathematische Argumente in Situationen ausgeben kann, in denen der Mensch, der sie angestoßen hat, nicht in der Lage ist, die Argumente zu verstehen, sie zu überprüfen oder die Verantwortung für sie zu übernehmen“, erklärte das Institute for Advanced Study in Princeton, New Jersey, in einer Stellungnahme. „Wir glauben, dass das menschliche Verständnis der Mathematik von größter Bedeutung bleibt. Wie können wir in dieser neuen Ära auf ein neues Paradigma hinarbeiten, das das menschliche Verständnis der Mathematik als Teil verantwortungsvoller wissenschaftlicher Arbeit einschließt?“

Andere jedoch, wie Professor Abhishek Saha, sind ziemlich begeistert. „Es ist ein sehr großer Tag für die Mathematik“, schrieb er, merkte aber an, dass die meisten der Probleme in die Kategorien „außergewöhnliche Fortschritte innerhalb eines bestehenden Programms“ oder „überraschende Durchbrüche“ fallen.

Das bedeutet, dass die meisten der Probleme in dem Set interessant sind, aber nicht unmöglich oder bahnbrechend wie die Millennium-Probleme. Dieser Platz ist für genau ein Problem von den 722 reserviert: die Quasi-Riemann-Hypothese.

Die Veröffentlichung bleibt auch hinter dem zurück, was eine Beratergruppe am Institute for Advanced Study am 29. September empfohlen hatte: der Modellname, die Prompts, eine zusammengefasste Gedankenkette, die benötigte Zeit und die Rechenkosten für jedes Ergebnis. OpenAI veröffentlichte durchschnittliche Rechenwerte und 10 Zusammenfassungen von Denkprozessen, aber keine Prompts, und erklärt, dass man noch daran arbeite, das Modell verantwortungsvoll zu veröffentlichen.

Daniel Litt, ein Mathematiker an der University of Toronto, vertrat die entgegengesetzte Auffassung und argumentierte, es gebe keinen Grund, das Unternehmen zu bitten, die Antworten auf diese Mathematikfragen geheim zu halten.

Anthropic ging letzten Monat mit seinem Lean-geprüften Beweis des Großen Fermatschen Satzes einen anderen Weg und veröffentlichte alle 13 Millionen Zeilen öffentlich auf GitHub. Dieser Beweis formalisierte einen Satz, den Andrew Wiles 1995 veröffentlicht hatte, anstatt neue Ergebnisse zu beanspruchen.

OpenAI sagt, dass es Lean-Formalisierungen hinzufügen werde, sobald es sie erhalte; derzeit hat 162 der 722 Manuskripte eine.