Коротко

  • OpenAI опублікувала 722 математичні рукописи у 372 групах результатів на GitHub від невипущеної внутрішньої моделі.
  • Лише 162 з 722 статей мають формалізований у Lean основний результат, і OpenAI попереджає, що деякі неформалізовані результати можуть мати проблеми.
  • Ендрю Сазерленд з MIT каже, що твердження про один запит і одного агента не підтверджено, доки модель не випущено, а реліз не містить запитів, які консультативна група в Інституті перспективних досліджень рекомендувала розкрити.

У вівторок OpenAI опублікувала 722 математичні рукописи на GitHub, усі створені внутрішньою моделлю, яку компанія не випустила. Речник OpenAI сказав, що майже все походить від одного запиту, переданого одному ШІ-агенту, хоча деякі могли вимагати кількох спроб.

Це сміливе твердження й потенційно значний прорив у галузі математики. Але не всі захоплюються цим або вірять у цей ажіотаж.

Myriad: Як високо підніметься Nvidia? Натисніть, щоб зробити свій прогноз.
Myriad: Як високо підніметься Nvidia? Натисніть, щоб зробити свій прогноз.

«Допоки й якщо вони не випустять модель і люди не зможуть відтворити їхні результати, я вважаю, що будь-які твердження про розв'язання проблем з одного пострілу за допомогою єдиного агента слід вважати неперевіреними», — сказав Ендрю Сазерленд, математик з MIT, в інтерв'ю Scientific American. «Ми повинні вимагати підтверджень», — сказав він.

Статті згруповано у 372 «родини» пов'язаних результатів, і родина може об'єднувати основну теорему з супутніми аргументами, наслідками або альтернативними доведеннями. Тож 722 — це кількість рукописів, а не розв'язаних задач. OpenAI каже, що поставила моделі приблизно 4 000 задач і залишила ті результати, які визнала достатньо значущими для публікації.

Середній результат використав еквівалент приблизно трьох годин обчислювального мислення ChatGPT Pro, за даними OpenAI. Твердження щодо Нав'є — Стокса минулого місяця виглядало зовсім інакше: 10 000 координованих агентів працювали 88 годин.

OpenAI опублікувала скорочені підсумки міркувань для 10 результатів. Водночас, згідно з каталогом формалізації в репозиторії, лише 162 з 722 статей мають основний результат, перевірений комп'ютером. Це близько 22% колекції, перекладених на Lean — програмне забезпечення, яке механічно перевіряє кожен логічний крок.

Сама OpenAI каже, що не всі рукописи мають формалізації Lean і що «деякі неформалізовані результати можуть мати проблеми». Іншими словами, багато з того, що вони опублікували, може бути неправильним.

Успішна перевірка Lean підтверджує лише те, що доведення випливає з твердження, як воно записане в Lean. Вона не показує, що твердження відповідає початковій задачі, або що результат є новим чи важливим, — саме це математикам тепер доведеться оцінювати.

І саме тут дослідники піднімають брови.

«Тепер склалася ситуація, коли ШІ може видавати математичні аргументи в ситуаціях, коли людина, яка його запитала, не здатна зрозуміти ці аргументи, перевірити їх або взяти за них відповідальність», — заявив у своїй заяві Інститут перспективних досліджень у Принстоні, штат Нью-Джерсі. «Ми вважаємо, що людське розуміння математики залишається надзвичайно важливим. Як у цю нову епоху ми можемо працювати над новою парадигмою, яка включає людське розуміння математики як частину відповідальної наукової продукції?»

Інші ж, як-от професор Абхішек Саха, досить схвильовані. «Це дуже великий день для математики», — написав він, але зазначив, що більшість задач належать до категорій «виняткових досягнень у межах наявної програми» або «несподіваних проривів».

Це означає, що більшість задач у наборі є цікавими, але не неможливими чи такими, що змінюють правила гри, як проблеми тисячоліття. Це місце зарезервоване рівно для однієї задачі з 722: квазі-гіпотези Рімана.

Цей випуск також не відповідає тому, що консультативна група в Інституті перспективних досліджень рекомендувала 29 вересня: назва моделі, підказки, узагальнений ланцюжок міркувань, витрачений час і обчислювальна вартість для кожного результату. OpenAI опублікувала середні показники обчислень і 10 підсумків міркувань, але без підказок, і заявляє, що все ще працює над відповідальним випуском моделі.

Даніель Літт, математик з Університету Торонто, дотримується протилежної думки, стверджуючи, що немає жодних підстав просити компанію тримати відповіді на ці математичні питання в таємниці.

Anthropic обрала інший шлях зі своїм перевіреним у Lean доведенням Великої теореми Ферма минулого місяця, опублікувавши всі 13 мільйонів рядків публічно на GitHub. Це доведення формалізувало теорему, яку Ендрю Вайлз опублікував у 1995 році, а не заявляло про нові результати.

OpenAI заявляє, що додаватиме формалізації Lean у міру їх отримання; наразі 162 з 722 рукописів мають таку.