OpenAIが未公開AIの数学論文722本を一挙公開、約4,000問に挑み1件あたり平均3時間

3行でわかる
- OpenAIは10月6日、未公開の社内AIが数学の未解決問題に取り組んだ論文722本を、372のテーマに分けてGitHubで公開した
- AIには約4,000問を出し、成果1件あたり平均3時間分を考えさせた。一部は計算機で正しさを自動確認できる形の証明も付いている
- 9月にはフィールズ賞受賞者25人が「AIによる証明の量産は数学を損なう」と声明を出しており、査読前の大量公開に賛否が分かれている
OpenAIは現地時間10月6日、まだ一般公開していない社内のAIモデルが数学の未解決問題に取り組んだ論文722本を、GitHub上のリポジトリ「openai/math」で公開しました。AIに出した問題は約4,000問で、成果1件あたり平均3時間分の計算を使ったとしています。
何が公開されたか
openai/mathとは、OpenAIの社内モデルが書いた数学の原稿と、その証明を裏付ける資料をまとめた公開の保管庫です。722本の原稿は、主な結果と関連する補足や別証明をひとまとめにした372の「ファミリー」に分けられ、数学の分野ごとに分類されています。
公開の経緯について、OpenAIは説明文で次のように書いています。
As part of model development, we evaluate our models on open research problems. We expanded these evaluations after performance on our existing mathematical evaluations saturated.
モデル開発の一環として、未解決の研究課題でモデルを評価している。既存の数学の評価ではモデルの成績が頭打ちになったため、この評価を広げた。
原文を読む(github.com)つまり、これまでの数学の試験ではAIがほぼ満点を取るようになり、力を測れなくなったため、答えのわかっていない本物の研究課題を試験代わりに使い始めた、ということです。
手順はほぼ共通で、未公開のモデルに有料プラン「ChatGPT Pro」の考える機能で平均3時間ずつ取り組ませました。約4,000問の出力を、関連する結果ごとにまとめ、一定の重要度に届いたものだけを残した結果が今回の一覧です。例外として、素数の分布に関わるリーマンゼータ関数の研究など一部は別の手順で作られ、うち1本は読みやすさのために人が文章を手直ししたと明記しています。
10件については、AIがどう考えて答えにたどり着いたかの要約も添えました。円周率πの性質、物理学の磁石のモデル、計算の難しさを扱う理論など、分野は幅広くなっています。
まだ「確定した成果」ではない
公開された結果は、検証の段階がばらばらです。一部には「Lean(リーン)」と呼ばれる証明支援ソフトで、計算機が論理の正しさを1行ずつ確かめられる形の証明が付いていますが、全部ではありません。OpenAI自身も説明文でこう断っています。
Some of the unformalized results could have issues. We will endeavor to fix any such issues quickly.
計算機による検証用の形にしていない結果の一部には、問題があるかもしれない。そうした問題は速やかに直すよう努める。
原文を読む(github.com)訂正や改訂は新しい版として記録し、以前の版も見られるように残す方針です。論文誌の査読(専門家による審査)を経た結果ではない点は、数字の大きさとは分けて受け止める必要があります。
背景
OpenAIは9月、流体の動きを表す「ナビエ–ストークス方程式」の難問を社内システムで解いたと発表しました。100万ドルの懸賞金がかかる7つの「ミレニアム懸賞問題」の1つで、約1万のAIエージェントを動かしたとSmithsonian Magazineなどが報じています。この件では、同じ問題に取り組んでいた人間の研究者の成果がAIの学習に使われていないかをめぐり、手柄の帰属が争点になったとも伝えられています。
その直後、数学のノーベル賞と呼ばれるフィールズ賞の受賞者25人が声明「A Severe Misalignment of AI in Mathematics」を出しました。Scientific Americanによると、声明は、数学者が大事にしているのは答えそのものより理解や洞察を深める過程だと強調し、AI企業と数学界では目指すものが大きく食い違っていると訴えています。テレンス・タオ氏も署名者の1人です。今回の722本は、その声明から1カ月足らずでの公開でした。
反応と論点
The Decoderは、OpenAIが著名な数学者らの助言グループと協議したものの、その役割は「結果をどう伝えるか」に限られ、公開するかどうかや速さは対象外だったと報じています。数学界からは、AIが一度に大量の結果を出すと、人間の研究者が確認しきれないという懸念が出ています。
開発者が集まる掲示板Hacker Newsでも投稿は900ポイントを超え、800件以上のコメントが付きました。人間なら数十年分の前進だと評価する声がある一方、博士課程の途中で同じテーマの論文を書いている学生はどうすればいいのかという戸惑いや、20年以上取り組んできた問題が一覧に「解決済み」として載っていたという投稿もありました。少なくとも人が目を通したことを示すため、確認者の名前を原稿に載せるべきだという提案も出ています。
成果の数そのものより、「誰が確かめるのか」「誰の手柄か」という研究の仕組みの問いが前に出てきた、というのが今回の一番の論点です。
日本のビジネスへの影響
- 使えるか: 公開された原稿と証明は誰でもGitHubで読めます。ただし成果を出したモデルは未公開で、いつ一般向けに出るかは示されていません。現時点では「この性能のAIを明日から仕事で使える」という話ではありません
- 誰にどう効くか: 研究開発部門を持つメーカーや製薬、金融の数理担当者、大学と組む事業の企画担当者に関係があります。AIが「答えのない問い」に数時間かけて取り組み、検証可能な形で結果を出す使い方が、数学以外の研究にも広がる可能性があります
- 今すぐやれること: 自社の研究や分析で「人が数日かけて検討している問い」を1つ選び、いま使える上位のAIに時間をかけて考えさせ、結果を担当者が検証する小さな試行をしてみてください
- 注意点: OpenAI自身が一部の結果に誤りがありうると認めています。AIの出した結論は、検証の手段(計算機による確認や専門家の審査)とセットで扱い、そのまま社外の資料や意思決定に使わないことが大切です
AIに調べものや検討をさせるときのサービスの選び方は、調べもの・リサーチに強いAIのおすすめにまとめています。
一次情報
- 公式ドキュメントOpenAI(GitHub)openai/math README
- コミュニティHacker NewsSharing AI progress in mathematics(議論)
参考にした報道(3件)
AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。