llama.cppを使うと、GGUF形式に変換・量子化されたオープンモデルを手元のPCで実行できます。GitHubリポジトリでビルド方法と使い方が案内されており、Hugging Face HubのGGUF対応ドキュメントからモデルファイルの入手方法も確認できます。
ローカル環境でのLLM実行相談
GPUなしでも動く軽量ローカル実行