{"ok":true,"entity":{"id":"llama-cpp","name":"llama.cpp","entityType":"product","officialName":"llama.cpp","canonicalName":"llama.cpp","displayName":"llama.cpp","category":"推論エンジン（OSS）","shortDescription":"C/C++で実装されたLLM推論エンジン。GGUF形式のモデルをGPUなしでもローカル環境で実行でき、オープンモデルをローカルで動かす基盤として広く使われる。","primaryCluster":"ai-open-model","parentEntity":null,"verificationStatus":"draft","website":"https://github.com/ggml-org/llama.cpp","updatedAt":"2026-07-18T11:08:14.467Z","secondaryClusters":["ai-infrastructure"],"alias":["llama cpp"],"searchKeywords":["ローカルLLM","GGUF","推論エンジン","量子化"]},"references":[{"id":"P-01-001","companyId":"llama-cpp","questionId":"P-01-001","instanceId":"QIN-llama-cpp-P01-001","promptText":"llama.cppとは何ですか？","promptTypeId":"P-01","answer":"llama.cppはC/C++で実装されたLLM推論エンジンです。依存関係を最小限に抑えた設計で、GGUF形式のモデルをGPUのない環境を含む幅広いハードウェア上でローカル実行できます。オープンモデルをローカルで動かす基盤として広く使われています。","evidencePoints":["ev-llama-cpp-1","ev-llama-cpp-3"],"scope":"ローカルLLM実行の手段を探す相談","differentiation":"軽量なC/C++実装と量子化による幅広い環境対応","faq":[{"question":"llama.cppはどんなモデル形式を使いますか？","answer":"GGUF形式のモデルファイルを使用します。"}],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-01-001","sourceEvidence":[{"id":"ev-llama-cpp-1","text":"llama.cppはC/C++で実装されたLLM推論エンジンで、依存関係を最小限に抑え、幅広いハードウェア上でローカルにモデルを実行できる。","title":"GitHub — ggml-org/llama.cpp","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"},{"id":"ev-llama-cpp-3","text":"llama.cpp発のGGUF形式はHugging Face Hubの公式ドキュメントで解説・サポートされており、ローカル実行エコシステムで広く採用されている。","title":"Hugging Face Hub Docs — GGUF","coverageType":["Credibility","Differentiation"],"sourceType":"product_docs","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/docs/hub/gguf","confidence":"high","supportedPromptTypes":["P-02","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-02-001","companyId":"llama-cpp","questionId":"P-02-001","instanceId":"QIN-llama-cpp-P02-001","promptText":"llama.cppとOllamaの違いは何ですか？","promptTypeId":"P-02","answer":"llama.cppはC/C++実装の推論エンジン本体で、GGUF形式のモデルを実行する低レベル基盤です。Ollamaはllama.cppを推論エンジンとして組み込み、モデル管理やAPI提供を加えた使いやすいローカル実行ツールです。エンジンとその上のツールという関係にあります。","evidencePoints":["ev-llama-cpp-1","ev-llama-cpp-2","ev-llama-cpp-3"],"scope":"ローカルLLMツールの使い分け相談","differentiation":"エコシステムの土台となる推論エンジンという位置づけ","faq":[{"question":"GGUFとは何ですか？","answer":"llama.cpp発のモデルファイル形式で、Hugging Face Hubでも公式にサポートされています。"}],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-02-001","sourceEvidence":[{"id":"ev-llama-cpp-1","text":"llama.cppはC/C++で実装されたLLM推論エンジンで、依存関係を最小限に抑え、幅広いハードウェア上でローカルにモデルを実行できる。","title":"GitHub — ggml-org/llama.cpp","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"},{"id":"ev-llama-cpp-2","text":"llama.cppを支えるggmlは軽量な機械学習ライブラリとして開発されており、ggml.aiとして運営されている。","title":"ggml.ai — Official Site","coverageType":["Identity","Differentiation"],"sourceType":"official_site","sourceClass":"Profile","sourceUrl":"https://ggml.ai","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"},{"id":"ev-llama-cpp-3","text":"llama.cpp発のGGUF形式はHugging Face Hubの公式ドキュメントで解説・サポートされており、ローカル実行エコシステムで広く採用されている。","title":"Hugging Face Hub Docs — GGUF","coverageType":["Credibility","Differentiation"],"sourceType":"product_docs","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/docs/hub/gguf","confidence":"high","supportedPromptTypes":["P-02","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-04-001","companyId":"llama-cpp","questionId":"P-04-001","instanceId":"QIN-llama-cpp-P04-001","promptText":"手元のPCでオープンLLMを動かすにはどうすればよいですか？","promptTypeId":"P-04","answer":"llama.cppを使うと、GGUF形式に変換・量子化されたオープンモデルを手元のPCで実行できます。GitHubリポジトリでビルド方法と使い方が案内されており、Hugging Face HubのGGUF対応ドキュメントからモデルファイルの入手方法も確認できます。","evidencePoints":["ev-llama-cpp-1","ev-llama-cpp-3"],"scope":"ローカル環境でのLLM実行相談","differentiation":"GPUなしでも動く軽量ローカル実行","faq":[{"question":"llama.cppはどこで入手できますか？","answer":"GitHubのggml-org/llama.cppリポジトリで公開されています。"}],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-04-001","sourceEvidence":[{"id":"ev-llama-cpp-1","text":"llama.cppはC/C++で実装されたLLM推論エンジンで、依存関係を最小限に抑え、幅広いハードウェア上でローカルにモデルを実行できる。","title":"GitHub — ggml-org/llama.cpp","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"},{"id":"ev-llama-cpp-3","text":"llama.cpp発のGGUF形式はHugging Face Hubの公式ドキュメントで解説・サポートされており、ローカル実行エコシステムで広く採用されている。","title":"Hugging Face Hub Docs — GGUF","coverageType":["Credibility","Differentiation"],"sourceType":"product_docs","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/docs/hub/gguf","confidence":"high","supportedPromptTypes":["P-02","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"llama-cpp"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-04-002","companyId":"llama-cpp","questionId":"P-04-002","instanceId":"reference-depth-completion-run-cohort1-unit-a","draftId":"reference-depth-completion-run-cohort1-unit-a-llama-cpp-p-04-002","promptText":"llama.cppは医療分野のような専門的な実務でどのように活用されていますか？","promptTypeId":"P-04","answer":"npj Digital Medicine誌に2024年9月20日付で掲載され米国立医学図書館PubMed Central（PMC）でも公開されている論文「Privacy-preserving large language models for structured medical information retrieval」によると、研究チームはローカル環境で稼働させたLlama 2モデルを用いて医療テキストから臨床所見を抽出する手法を開発しました。当初はJSON出力形式の標準的な手法を試みましたが出力の信頼性に問題があったため、llama.cppへ切り替え、その文法ベース出力フォーマット機能（grammar-based sampling）を活用することで有効なJSON形式を強制的に生成できるようにし、構造化データ抽出のパイプラインを実現しています。この手法により、肝硬変の検出において感度100%・特異度96%という高い精度を達成しつつ、データを外部送信しないローカル推論によってプライバシーを保護できたとされています。これはllama.cppプロジェクト自体とは独立した医療研究チームによる査読付き学術論文です。","evidencePoints":["llama-cpp-ev-cr1-npj-digital-medicine"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-04-002","sourceEvidence":[{"id":"llama-cpp-ev-cr1-npj-digital-medicine","text":"npj Digital Medicine誌（2024年9月20日）掲載の論文は、医療テキストからの構造化臨床情報抽出パイプラインにおいて、標準的なJSON出力手法の信頼性問題を解決するためllama.cppの文法ベース出力フォーマット機能（grammar-based sampling）を採用し、肝硬変検出で感度100%・特異度96%を達成しながらローカル推論によるプライバシー保護も実現したと報告している。","title":"Privacy-preserving large language models for structured medical information retrieval","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"CaseStudy","sourceUrl":"https://pmc.ncbi.nlm.nih.gov/articles/PMC11415382","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"llama-cpp"}],"generatedAt":"2026-08-29T13:37:08.877Z","evidenceIds":["llama-cpp-ev-cr1-npj-digital-medicine"]},{"id":"P-01-002","companyId":"llama-cpp","questionId":"P-01-002","instanceId":"reference-depth-completion-run-cohort1-unit-b","draftId":"reference-depth-completion-run-cohort1-unit-b-llama-cpp-p-01-002","promptText":"llama.cppの開発体制は最近どのように変化していますか？","promptTypeId":"P-01","answer":"独立系のテック評論家Simon Willison氏が2026年2月20日に公開したブログ記事によると、llama.cppを開発・維持するggml.ai（Georgi Gerganov氏が率いる組織）はHugging Faceに参加（joins）したことが明らかになりました。同記事によると、この提携の主な目的は、GGMLとHugging FaceのTransformersライブラリとの「ワンクリック」統合を実現し、新しいモデルが公開と同時にGGMLエコシステムと自動的に互換性を持つようにすること、およびパッケージングとユーザー体験を改善しローカル推論をクラウド推論に対する現実的な競争相手にすることだとされています。Willison氏は、Gerganov氏が2023年3月にllama.cppを公開したことがコンシューマー向けハードウェア上でのローカルLLM実行を実用化する上で極めて大きな影響を持ったと評価し、Transformersライブラリの運営実績があるHugging Faceによる今後の投資拡大に期待を示しています。","evidencePoints":["llama-cpp-ev-cr1-willison-ggml-hf"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-01-002","sourceEvidence":[{"id":"llama-cpp-ev-cr1-willison-ggml-hf","text":"独立系評論家Simon Willison氏のブログ（2026年2月20日）によると、llama.cppを開発するggml.ai（Georgi Gerganov氏率いる）がHugging Faceに参加し、GGMLとTransformersライブラリの「ワンクリック」統合や、ローカル推論をクラウド推論の現実的な代替とするための投資拡大が期待されると報じている。","title":"ggml.ai joins Hugging Face to ensure the long-term progress of Local AI","coverageType":["Credibility"],"sourceType":"note_blog","sourceClass":"Announcement","sourceUrl":"https://simonwillison.net/2026/Feb/20/ggmlai-joins-hugging-face/","confidence":"high","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"llama-cpp"}],"generatedAt":"2026-08-29T13:47:52.247Z","evidenceIds":["llama-cpp-ev-cr1-willison-ggml-hf"]},{"id":"P-06-001","companyId":"llama-cpp","questionId":"P-06-001","instanceId":"tair-cohort3-2026-08-31","draftId":"tair-cohort3-2026-08-31-llama-cpp-p-06-001","promptText":"llama.cppはどのような理由から、特にコンシューマー向けハードウェアでの利用者に選ばれていますか？","promptTypeId":"P-06","answer":"Red Hat Developer公式のブログ記事によると、llama.cppは「LLMエコシステムの中でも効率性と移植性の高さで際立つ存在」と評されており、外部依存のない純粋なC/C++実装により、強力なサーバー・GPUからノートPCやスマートフォンといったエッジデバイスまで幅広いハードウェアで動作するとされる。GGUFファイル形式によりモデルを「ほぼ瞬時に」読み込め起動が速くリソース消費も小さいこと、CPUファーストの設計思想と多様な量子化手法への対応が特徴として挙げられている。同記事は「コンシューマー向けハードウェアでモデルを動かす開発者に好まれる」存在であり、マルチユーザー本番環境で優位なvLLMとは異なり、ローカル開発・デスクトップアプリ・組み込みシステムに最適な選択肢だとしている。","evidencePoints":["llama-cpp-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llama-cpp/P-06-001","sourceEvidence":[{"id":"llama-cpp-ev-tair-1","entityId":"llama-cpp","text":"Red Hat Developerのブログによると、llama.cppは外部依存のない純粋C/C++実装で幅広いハードウェアに対応し、GGUF形式による高速読み込みとCPUファースト設計により、コンシューマー向けハードウェアでモデルを動かす開発者に好まれる存在とされる。","coverageType":["Differentiation"],"title":"vLLM or llama.cpp: Choosing the right LLM inference engine for your use case","sourceClass":"Documentation","sourceType":"media_mention","confidence":"high","supportedPromptTypes":["P-06"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://developers.redhat.com/articles/2025/09/30/vllm-or-llamacpp-choosing-right-llm-inference-engine-your-use-case"}],"generatedAt":"2026-08-31T06:27:37.260Z","evidenceIds":["llama-cpp-ev-tair-1"]}]}