数学テストは、ChatGPTやClaudeといったAIモデルの能力を測る基準となってきた。OpenAIは、自社のモデルが非常に優れた成績を上げており、従来の数学テストが有効な指標ではなくなってきたと指摘する。そこで研究者らは、さらに難解な課題に取り組ませた。
未公開モデルに約4000問の未解決数学問題を与えた。その結果は驚きと懸念を呼ぶものだった。
AIは722本の論文草稿を作成し、これらは372の関連する研究グループに分類された。OpenAIによると、各成果は平均して約3時間の推論演算を要した。
「数学コミュニティにとって、非常に刺激的な日々が待っている!」とBeInCryptoのFuture Tech and AI Experts Councilメンバー、ステファノ・ゴジョーソ氏は述べた
AIの進化が急速すぎるのか
これがより大きな問題と言える。最先端のAIは既知の問題への回答を超え、未知の問いに対する新たな解答を生み出し始めている。
これにより、研究者、エンジニア、アナリストが取り組める知的作業量は飛躍的に増加する可能性がある。
しかし、アウトプットが必ずしも真実とは限らない。OpenAIの論文の多くには、コンピューターで検証可能なLeanによる証明が付されているが、未検証のものもある。OpenAIは、一部の未確認成果には「問題が含まれている可能性がある」と警告している。
その結果、人間による検証がAIの研究生産スピードについていけないという新たなボトルネックが浮上する。
AIはすでに予測分析や投資判断も担えるのか
可能性はあるが、金融分野は別の難しさがある。
数学的証明はやがて正誤を明らかにできるが、市場はノイズが多く、絶えず変動する。
直近の金融分野でのベンチマークでは、最先端AIでも複雑な投資リサーチで苦戦しており、市場タイミング技術の予測的な優位性についても限定的との分析が示されている。
短期的な活用余地としては、完璧な予測ではなく、より深い分析能力の発揮が挙げられる。
複数時間にわたる持続的な推論が可能なAIであれば、開示資料や決算会見、マクロ経済データ、複数のシナリオを同時に検証し、アナリスト1人では考えつかないほど多くの仮説をテストできる。
OpenAIの今回の実験が示す最大のシグナルはこの点である。AIは極めて膨大な量の本格的な分析業務を行える時代へと突入した。今後は、その成果のどれを信用に値するものと判断するかが次の課題となる。









