P-03ランキング・候補

Phi-4-reasoningは推論ベンチマークにおいて、OpenAIやDeepSeekのモデルとどのように比較されますか?

Phi-4-reasoningのベンチマーク上の位置づけについて、Microsoft Azure公式ブログの記事(One year of Phi、2025年5月1日付)で確認できます。同記事によると、Phi-4-reasoningおよびPhi-4-reasoning-plusは、数学的推論や博士課程レベルの科学問題を含む大半のベンチマークにおいて、OpenAIのo1-miniおよびDeepSeek-R1-Distill-Llama-70Bを上回る性能を達成しています。特筆すべき点として、2025年のAIME(全米数学オリンピック予選)テストでは、パラメータ数が671億の完全版DeepSeek-R1モデルよりも高い性能を達成したとされています。Phi-4-reasoningはわずか140億パラメータであり、DeepSeek-R1の約48分の1という小型モデルでこの性能を実現している点が強調されています。

実績・根拠

情報ソース