P-03ランキング・候補

OpenAI o1はARC-AGIのような抽象推論ベンチマークで他の主要モデルと比べてどのような位置づけですか?

AI推論能力の評価に特化した独立研究組織ARC Prize Foundationが2024年9月13日に公開した検証結果によると、OpenAIのo1-preview・o1-miniモデルをARC-AGIベンチマークで評価したところ、o1-previewは公開評価セットで21.2%、準非公開評価セットで18%のスコアを記録しました。これはAnthropicのClaude 3.5 Sonnet(同程度の約21%)とほぼ同水準でしたが、同程度の精度を得るために約10倍の時間を要したとされています。一方、GPT-4o(9%)やGemini 1.5(8%)は明確に下回りました。同組織は400件の公開タスクについて、o1では70時間、GPT-4oやClaude 3.5 Sonnetでは30分程度を要したとしており、o1は数学など他のベンチマークでは高い性能を示す一方、ARC-AGIでの改善は「控えめ」であり、モデルが依然として学習分布内での処理に主に依存している可能性を示唆していると分析しています。

実績・根拠

情報ソース