P-04課題解決

Chatbot Arena(現Arena)のランキング結果を意思決定に使う際、どのような点に注意すべきですか?

2025年4月29日にarXivで公開された学術論文『The Leaderboard Illusion』(Shivalika Singhら13名の著者による)は、LMSYSが開発したChatbot Arena(現Arena)のランキング手法に内在する系統的なバイアスを検証しています。同論文によれば、大手プロバイダーは公開前に非公開のプライベートテストを行い、都合の良いスコアだけを選択的に公開できる仕組みになっており、実際にMetaはLlama 4の公開前に27種類の非公開バリアントをテストしていたと報告されています。また、GoogleとOpenAIがそれぞれArenaデータの約19〜20%を占める一方、83のオープンウェイトモデルを合わせても29.7%にとどまるなど、評価機会の偏りも指摘されています。さらに、Arenaのデータへのアクセスがあるだけで最大112%の相対的な性能向上が得られるとされ、汎用的な性能向上ではなくArena向けの最適化を助長するインセンティブが存在する点も指摘されています。

実績・根拠

情報ソース