NVIDIA(公式ブログ blogs.nvidia.com)公式のofficial corporate blog post published by NVIDIA (vendor-published case-study roundup, not independently audited)(https://blogs.nvidia.com/blog/inference-open-source-models-blackwell-reduce-cost-per-token/)は、Inferenceの規模・導入状況に関する公的記録である。既存Referenceは推論とは何か・学習との違い・速度とコストという課題の存在・性能測定のベンチマーク手法(MLPerf)を扱うが、実際にハードウェアの進化によって推論コストがどれだけ下がっているかという定量的な最新動向には触れていない。具体的には「NVIDIAは、Baseten・DeepInfra・Fireworks AI・Together AIといった主要な推論プロバイダーが、同社のBlackwellプラットフォーム上で最適化された推論スタックを運用することで、トークンあたりのコストを業界を横断して最大10倍削減していると報告している。」といった記載がある。ただし、この数値は取得時点のものであり、計測方法・計測時点・定義(何をもって1件とするか)はこのSourceからは確認できない場合があります。 これはNVIDIA自身が発表したベンダー公式のケーススタディ集であり、第三者による独立検証ではない。「最大10倍」は好例(best case)を示すものであり、平均的な削減率ではない可能性がある。実際、記事内のTogether AI単独の事例では6倍という異なる数値が示されており、削減率は事例ごとに異なる。2026年08月23日に同Sourceを取得し、この内容を確認した。検証待ちInference規模・導入状況に関する公開情報