P-03ランキング・候補

OLMoは他の主要な言語モデルと比べてどの程度の性能水準にありますか?

MarkTechPost(AI/ML専門メディア、2025年3月14日付、Asif Razzaq氏執筆)の記事によると、AI2のOLMo 2 32Bは複数のベンチマークでGPT-3.5 Turbo、GPT-4o mini、Qwen 2.5 32B、Mistral 24Bと同等かそれ以上の性能を示し、Qwen 2.5 72BやLlama 3.1・3.3の70Bクラスの性能にも近づいたと報じられています。さらに学習に要した計算量はQwen 2.5 32Bの約3分の1にとどまるとされ、完全公開のオープンモデルとして高い計算効率を示した点が独立系メディアによって確認されています。ただしこれは第三者記事による報告であり、独自の追試による検証ではありません。

実績・根拠

情報ソース