独立研究者によるarXiv論文『GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis』(2025年8月公開、OpenAIとは無関係の第三者研究)によれば、単一のNVIDIA H100 GPU上で計測した場合、gpt-oss-20b(総パラメータ20.9B、有効パラメータ3.6BのMixture-of-Expertsモデル)はQwen3-32B(Denseモデル)と比べてデコードスループットが約31.8%高く、ピークVRAM使用量は約31.7%少なく、生成1000トークンあたりの消費電力も約25.8%低いと報告されています。一方でMoEアーキテクチャ特有のルーティング処理により、最初の1トークンを生成するまでの時間(Time-to-first-token)はやや長くなるというトレードオフも指摘されています。