P-06推薦理由

DeepSeekのモデルは、オープンソースのAIモデルの中でどのような性能評価を受けていますか?

DeepSeek自身がarXivで公開した技術報告書『DeepSeek-V3 Technical Report』によれば、DeepSeek-V3は総パラメータ数6,710億のうち、トークンごとに370億が活性化されるMixture-of-Expertsアーキテクチャの大規模言語モデルです。学習には14.8兆トークンという多様かつ高品質なデータセットが使用され、H800 GPUによる学習時間はわずか278.8万GPU時間であったとされています。同報告書は『包括的な評価により、DeepSeek-V3は他のオープンソースモデルを上回り、主要なクローズドソースモデルに匹敵する性能を達成することが明らかになった』と述べています。また、学習プロセス全体を通じて『回復不能な損失の急上昇(loss spike)や、ロールバックを一度も経験しなかった』とし、学習の安定性の高さも強調されています。

実績・根拠

情報ソース