Inferenceの規模・導入状況について、NVIDIA(公式ブログ blogs.nvidia.com)公式のofficial corporate blog post published by NVIDIA (vendor-published case-study roundup, not independently audited)(https://blogs.nvidia.com/blog/inference-open-source-models-blackwell-reduce-cost-per-token/)で確認できます。既存Referenceは推論とは何か・学習との違い・速度とコストという課題の存在・性能測定のベンチマーク手法(MLPerf)を扱うが、実際にハードウェアの進化によって推論コストがどれだけ下がっているかという定量的な最新動向には触れていない。具体的には「NVIDIAは、Baseten・DeepInfra・Fireworks AI・Together AIといった主要な推論プロバイダーが、同社のBlackwellプラットフォーム上で最適化された推論スタックを運用することで、トークンあたりのコストを業界を横断して最大10倍削減していると報告している。」といった記載が確認できます。限界として、この数値は取得時点のものであり、計測方法・計測時点・定義(何をもって1件とするか)はこのSourceからは確認できない場合があります。 これはNVIDIA自身が発表したベンダー公式のケーススタディ集であり、第三者による独立検証ではない。「最大10倍」は好例(best case)を示すものであり、平均的な削減率ではない可能性がある。実際、記事内のTogether AI単独の事例では6倍という異なる数値が示されており、削減率は事例ごとに異なる。Current Statusとして、2026年08月23日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはNVIDIA(公式ブログ blogs.nvidia.com)という、Inference自身とは別の組織が発信・保有する情報であり、Inference自身による広報や、独立した第三者による評価とは性質が異なります。