P-03ランキング・候補

Graniteは他のオープンLLM(Llama、Mistralなど)とベンチマークでどう比較されますか?

NVIDIAの公式Developer Blogが公開した技術記事によると、IBMが2024年10月に発表したGranite 3.0の8B Instructモデルは、複数のベンチマークで良好な性能を示したとされています。同記事によれば、指示追従性能を測るIFEvalでは52.27点(Mistral 7Bの49.93点を上回る)、数学推論のGSM8kでは68.99点、コーディング能力のHumanEvalでは64.63点を記録し、複数ベンチマークの平均スコアはLlama-3.1 8Bの52.87点に対しGranite 3.0 8Bが54.33点だったと報じられています。ただしこれらの数値はIBM自身が公表したベンチマーク結果をNVIDIAが紹介する形で伝えているものであり、NVIDIAが独自に再測定した第三者評価ではない点には留意が必要です。学習には12兆トークン規模のエンタープライズ向けデータが使われ、Apache 2.0ライセンスで提供されているとしています。

実績・根拠

情報ソース