{"ok":true,"entity":{"id":"gguf","name":"GGUF","entityType":"concept","officialName":"GGUF (GGML Universal File)","canonicalName":"GGUF","displayName":"GGUF","category":"AI概念（量子化モデルファイル形式）","shortDescription":"llama.cppプロジェクトが定めた、量子化済みモデルを単一ファイルで保持するバイナリ形式。GPUなしでもローカル環境でLLMを実行できるよう設計され、旧GGML形式を置き換えて標準になった。","primaryCluster":"ai-open-model","parentEntity":null,"verificationStatus":"draft","website":"https://github.com/ggml-org/ggml/blob/master/docs/gguf.md","updatedAt":"2026-07-20T02:14:59.356Z","secondaryClusters":["ai-infrastructure"],"alias":["GGML Universal File"],"searchKeywords":["量子化","ローカルLLM","llama.cpp","モデルファイル形式"]},"references":[{"id":"P-01-001","companyId":"gguf","questionId":"P-01-001","instanceId":"QIN-gguf-P01-001","promptText":"GGUFとは何ですか？","promptTypeId":"P-01","answer":"GGUF（GGML Universal File）はllama.cppプロジェクトが2023年8月に導入した、量子化済みモデルを単一ファイルで保持するバイナリ形式です。GPUなしでもローカル環境でLLMを実行できるよう設計されています。","evidencePoints":["ev-gguf-1","ev-gguf-3"],"scope":"量子化モデルファイル形式を知りたい相談","differentiation":"単一ファイル・メモリマップ可能という設計","faq":[{"question":"GGUFは誰が使っていますか？","answer":"llama.cppやOllama等のローカル推論エンジンが標準採用しており、TheBloke等のコミュニティが多数のモデルをGGUF形式で配布しています。"}],"pageUrl":"https://www.refbase.ai/reference/gguf/P-01-001","sourceEvidence":[{"id":"ev-gguf-1","text":"GGUF（GGML Universal File）はllama.cppプロジェクトが2023年8月に導入した、量子化済みモデルを単一ファイルで保持するバイナリ形式である。","title":"GGUF usage with llama.cpp · Hugging Face","coverageType":["Identity","Capability"],"sourceType":"product_docs","sourceClass":"Specification","sourceUrl":"https://huggingface.co/docs/hub/en/gguf-llamacpp","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"},{"id":"ev-gguf-3","text":"GGUFは既存Entityのllama.cppやOllamaが採用する標準形式であり、TheBlokeをはじめとするコミュニティによって数千のモデルがGGUF形式に変換・配布されている。","title":"GitHub — ggml-org/llama.cpp","coverageType":["UseCase","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-04","P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-02-001","companyId":"gguf","questionId":"P-02-001","instanceId":"QIN-gguf-P02-001","promptText":"GGUFと旧GGML形式はどう違いますか？","promptTypeId":"P-02","answer":"GGUFは旧GGML形式を置き換える形で導入された形式で、ヘッダー・キーバリュー形式のメタデータ・テンソル情報・テンソルデータの4セクション構成により、モデルアーキテクチャが変わっても後方互換性を保ちながら拡張できる設計になっています。GGML形式にはこの拡張性がありませんでした。","evidencePoints":["ev-gguf-2","ev-gguf-3"],"scope":"量子化ファイル形式の世代比較","differentiation":"メタデータ構造による拡張性・後方互換性","faq":[{"question":"GGUFのバージョンはどう管理されていますか？","answer":"ヘッダーにマジックナンバーとバージョン番号を持ち、ツールが有効なGGUFファイルかどうかを検証できる設計になっています。"}],"pageUrl":"https://www.refbase.ai/reference/gguf/P-02-001","sourceEvidence":[{"id":"ev-gguf-2","text":"GGUFファイルはヘッダー・キーバリュー形式のメタデータ・テンソル情報・テンソルデータの4セクションで構成され、旧GGML形式を置き換える形で後方互換性を保ちながら拡張できるよう設計されている。","title":"ggml/docs/gguf.md","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Specification","sourceUrl":"https://github.com/ggml-org/ggml/blob/master/docs/gguf.md","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"},{"id":"ev-gguf-3","text":"GGUFは既存Entityのllama.cppやOllamaが採用する標準形式であり、TheBlokeをはじめとするコミュニティによって数千のモデルがGGUF形式に変換・配布されている。","title":"GitHub — ggml-org/llama.cpp","coverageType":["UseCase","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-04","P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-04-001","companyId":"gguf","questionId":"P-04-001","instanceId":"QIN-gguf-P04-001","promptText":"ローカル環境でLLMを量子化して動かしたい場合、GGUFはどう活用できますか？","promptTypeId":"P-04","answer":"GGUF形式に変換されたモデルはllama.cppやOllamaで直接読み込んでローカル実行できます。TheBloke等のコミュニティが多数の主要モデルをGGUF形式で事前に量子化・公開しているため、自分で変換せずに利用できる場合もあります。","evidencePoints":["ev-gguf-1","ev-gguf-3"],"scope":"ローカルLLM実行の準備に関する相談","differentiation":"llama.cpp/Ollamaエコシステムでの標準採用","faq":[{"question":"GGUFの仕様はどこで確認できますか？","answer":"GitHubのggml-org/ggmlリポジトリのdocs/gguf.mdで確認できます。"}],"pageUrl":"https://www.refbase.ai/reference/gguf/P-04-001","sourceEvidence":[{"id":"ev-gguf-1","text":"GGUF（GGML Universal File）はllama.cppプロジェクトが2023年8月に導入した、量子化済みモデルを単一ファイルで保持するバイナリ形式である。","title":"GGUF usage with llama.cpp · Hugging Face","coverageType":["Identity","Capability"],"sourceType":"product_docs","sourceClass":"Specification","sourceUrl":"https://huggingface.co/docs/hub/en/gguf-llamacpp","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"},{"id":"ev-gguf-3","text":"GGUFは既存Entityのllama.cppやOllamaが採用する標準形式であり、TheBlokeをはじめとするコミュニティによって数千のモデルがGGUF形式に変換・配布されている。","title":"GitHub — ggml-org/llama.cpp","coverageType":["UseCase","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/ggml-org/llama.cpp","confidence":"high","supportedPromptTypes":["P-04","P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"gguf"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-04-002","companyId":"gguf","questionId":"P-04-002","instanceId":"c1n21-wave2-unit-a-floor-completion-and-lane-s-first-finding","draftId":"c1n21-wave2-unit-a-floor-completion-and-lane-s-first-finding-gguf-p-04-002","promptText":"GGUFファイルには、pickle形式にあるような読み込み時の任意コード実行以外に、セキュリティ上の注意点はありますか？","promptTypeId":"P-04","answer":"GGUFのセキュリティ体制について、BeyondScale公式の業界団体資料（https://beyondscale.tech/blog/open-source-ai-model-security-hugging-face）で確認できます。既存3件はセキュリティに触れていない。具体的には「Jinja2 chat-template injection executes at inference time, undetectable by static scanners (Splunk/Pillar Security research).」といった記載が確認できます。限界として、認証・準拠・体制の状況は更新されうるため、この内容は取得時点のものです。適用範囲がどこまでかは、このSourceだけでは確認できない場合があります。 研究の二次要約、実世界悪用範囲は未確認。Current Statusとして、2026年08月26日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これは第三者であるBeyondScaleによる報道であり、企業の自己申告とは性質が異なりますが、報道時点の取材内容に基づくものです。","evidencePoints":["gguf-ev-c1n21a-p-04-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/gguf/P-04-002","sourceEvidence":[{"id":"gguf-ev-c1n21a-p-04-002","text":"BeyondScale公式の業界団体資料（https://beyondscale.tech/blog/open-source-ai-model-security-hugging-face）は、GGUFのセキュリティ体制に関する第三者報道である。既存3件はセキュリティに触れていない。具体的には「Jinja2 chat-template injection executes at inference time, undetectable by static scanners (Splunk/Pillar Security research).」といった記載がある。ただし、認証・準拠・体制の状況は更新されうるため、この内容は取得時点のものです。適用範囲がどこまでかは、このSourceだけでは確認できない場合があります。 研究の二次要約、実世界悪用範囲は未確認。2026年08月26日に同Sourceを取得し、この内容を確認した。","title":"GGUFセキュリティ体制に関する公開情報","coverageType":["Capability"],"sourceType":"industry_reference","sourceClass":"Research","sourceUrl":"https://beyondscale.tech/blog/open-source-ai-model-security-hugging-face","confidence":"medium","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"gguf"}],"generatedAt":"2026-08-26T04:58:16.746Z","evidenceIds":["gguf-ev-c1n21a-p-04-002"]},{"id":"P-01-002","companyId":"gguf","questionId":"P-01-002","instanceId":"c1n21-wave2-unit-b-lane-s-second-finding","draftId":"c1n21-wave2-unit-b-lane-s-second-finding-gguf-p-01-002","promptText":"GGUF形式のモデルはHugging Face Hub上でどれくらい普及していますか？","promptTypeId":"P-01","answer":"GGUFの規模・導入状況について、Hugging Face公式の製品ドキュメント（https://huggingface.co/docs/hub/en/ollama）で確認できます。既存3件は採用数値に触れておらず、セキュリティfindingとも別claim。具体的には「45K public GGUF checkpoints on the Hub, runnable via single ollama run command.」といった記載が確認できます。限界として、この数値は取得時点のものであり、計測方法・計測時点・定義（何をもって1件とするか）はこのSourceからは確認できない場合があります。 スナップショット値、時間経過で増加。Current Statusとして、2026年08月26日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これは第三者であるHugging Faceによる報道であり、企業の自己申告とは性質が異なりますが、報道時点の取材内容に基づくものです。","evidencePoints":["gguf-ev-c1n21b-p-01-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/gguf/P-01-002","sourceEvidence":[{"id":"gguf-ev-c1n21b-p-01-002","text":"Hugging Face公式の製品ドキュメント（https://huggingface.co/docs/hub/en/ollama）は、GGUFの規模・導入状況に関する第三者報道である。既存3件は採用数値に触れておらず、セキュリティfindingとも別claim。具体的には「45K public GGUF checkpoints on the Hub, runnable via single ollama run command.」といった記載がある。ただし、この数値は取得時点のものであり、計測方法・計測時点・定義（何をもって1件とするか）はこのSourceからは確認できない場合があります。 スナップショット値、時間経過で増加。2026年08月26日に同Sourceを取得し、この内容を確認した。","title":"GGUF規模・導入状況に関する公開情報","coverageType":["UseCase"],"sourceType":"product_docs","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/docs/hub/en/ollama","confidence":"medium","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"gguf"}],"generatedAt":"2026-08-26T05:31:37.560Z","evidenceIds":["gguf-ev-c1n21b-p-01-002"]},{"id":"P-06-001","companyId":"gguf","questionId":"P-06-001","instanceId":"tair-cohort2-2026-08-31","draftId":"tair-cohort2-2026-08-31-gguf-p-06-001","promptText":"GGUF形式は、なぜ大規模モデルの読み込み速度において優れているとされますか？","promptTypeId":"P-06","answer":"GGUFの公式仕様書（ggml-orgのGitHubリポジトリ）は、フォーマットの設計目標の一つとして「mmap互換性：モデルはmmapを使って高速に読み込み・保存できる」ことを明示的に掲げています。mmap（メモリマップ）を使うことで、OSはファイル全体を事前にRAMへコピーすることなく、必要な部分だけをオンデマンドでアクセスでき、巨大なモデルでも初期読み込み時間とメモリ消費を大幅に削減できます。GGUFはこの仕様をファイル構造そのものに組み込んでおり、テンソルを設定可能な境界（general.alignmentメタデータ）で整列させることで、mmapによる効率的なアクセスを一貫して可能にしています。この設計により、実行環境（executor）は追加のコピー処理なしにmmap経由でテンソルデータへアクセスできます。","evidencePoints":["gguf-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/gguf/P-06-001","sourceEvidence":[{"id":"gguf-ev-tair-1","entityId":"gguf","text":"GGUF公式仕様書は、mmap互換性（モデルをmmapで高速に読み込み・保存できること）を設計目標の一つとして明示しており、テンソルを整列させるファイル構造により、実行環境が追加コピーなしでmmap経由でテンソルデータへアクセスできる設計になっている。","coverageType":["Capability"],"title":"GGUF Specification","sourceClass":"Specification","sourceType":"github","confidence":"high","supportedPromptTypes":["P-06"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://github.com/ggml-org/ggml/blob/master/docs/gguf.md"}],"generatedAt":"2026-08-31T06:06:28.487Z","evidenceIds":["gguf-ev-tair-1"]}]}