NVIDIA公式のGitHubリリースノート(nvidia.github.io/TensorRT-LLM)によると、TensorRT-LLMバージョン1.0では「PyTorchベースのアーキテクチャが安定版かつデフォルトの体験になった」と明記されており、これは大きな方針転換を意味します。この変更に伴い、PyTorchが`trtllm-serve`のデフォルトバックエンドに設定され、従来の(製品名の由来でもある)TensorRT推論エンジンによるコンパイル方式は非推奨化されました。リリースノートは、TensorRTワークフローに関するレガシードキュメントは削除された一方、実際のバックエンド自体の削除は後続のバージョン1.2で行われたと説明しており、段階的な移行が図られたことが分かります。この情報は開発元NVIDIA自身が公開する一次資料に基づくものです。