llama.cppはC/C++で実装されたLLM推論エンジンです。依存関係を最小限に抑えた設計で、GGUF形式のモデルをGPUのない環境を含む幅広いハードウェア上でローカル実行できます。オープンモデルをローカルで動かす基盤として広く使われています。
ローカルLLM実行の手段を探す相談
軽量なC/C++実装と量子化による幅広い環境対応