{"ok":true,"entity":{"slug":"synthetic-data","entityType":"concept","name":"Synthetic Data","officialName":"Synthetic Data","canonicalName":"Synthetic Data","displayName":"Synthetic Data","category":"合成データ","shortDescription":"AIモデル自体を用いて生成された、AIモデルの学習・評価に使うデータ。人間によるラベリングコストを削減し、低リソース言語・領域への適応や知識蒸留に用いられる。","alias":[],"searchKeywords":["合成データ","synthetic data","データ生成"],"website":null,"primaryCluster":"ai-concepts","secondaryClusters":[],"verificationStatus":"draft","id":"synthetic-data","updatedAt":"2026-07-20T11:04:59.119Z"},"references":[{"id":"P-01-001","companyId":"synthetic-data","questionId":"P-01-001","instanceId":"QIN-synthetic-data-P01-001","promptText":"合成データ（Synthetic Data）とは何ですか？","promptTypeId":"P-01","answer":"合成データとは、AIモデルの学習・評価に使うために、AIモデル自体やアルゴリズムによって人工的に生成されたデータのことです。NVIDIAはこれを、実世界のデータを模倣するよう作成されたデータと定義しています。","evidencePoints":["ev-synthetic-data-1"],"scope":"AIによって人工的に生成される学習用データの定義","differentiation":"人間が収集・ラベリングした実データではなく、モデル自身が生成するデータという点が特徴","faq":[],"pageUrl":"https://www.refbase.ai/reference/synthetic-data/P-01-001","sourceEvidence":[{"id":"ev-synthetic-data-1","text":"NVIDIAの公式Glossaryは、合成データ生成（Synthetic Data Generation）を、実世界のデータを模倣するようアルゴリズムによって人工的に作成されたデータを生成するプロセスと定義している。","title":"What is Synthetic Data Generation (SDG)? | NVIDIA Glossary","coverageType":["Identity","Capability"],"sourceType":"product_docs","sourceClass":"Documentation","sourceUrl":"https://www.nvidia.com/en-us/glossary/synthetic-data-generation/","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"synthetic-data"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-02-001","companyId":"synthetic-data","questionId":"P-02-001","instanceId":"QIN-synthetic-data-P02-001","promptText":"合成データは人手によるデータ収集とどう違いますか？","promptTypeId":"P-02","answer":"人手によるデータ収集は人間がラベリングを行う必要がありますが、合成データはAIモデル自身がデータを生成するため、ラベリングコストを削減できます。NVIDIAのNemotron-4 340Bはこの生成をベース・指示・報酬モデルのパイプラインで実現しています。","evidencePoints":["ev-synthetic-data-2"],"scope":"データ収集方法（人手か、モデル生成か）の違い","differentiation":"コスト構造と生成プロセスの主体が人間かAIモデルかという点で異なる","faq":[],"pageUrl":"https://www.refbase.ai/reference/synthetic-data/P-02-001","sourceEvidence":[{"id":"ev-synthetic-data-2","text":"NVIDIAは、大規模言語モデルの商用利用向け合成データを生成できるオープンモデル群Nemotron-4 340Bを発表した。同モデル群はベース・指示・報酬モデルからなるパイプラインを構成し、人間によるラベリングに依存する従来のデータ収集とは異なる、モデル自身によるデータ生成という方法を提供する。","title":"NVIDIA Releases Open Synthetic Data Generation Pipeline for Training Large Language Models | NVIDIA Blog","coverageType":["Differentiation"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://blogs.nvidia.com/blog/nemotron-4-synthetic-data-generation-llm-training/","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"synthetic-data"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-04-001","companyId":"synthetic-data","questionId":"P-04-001","instanceId":"QIN-synthetic-data-P04-001","promptText":"合成データはどのような用途で使われますか？","promptTypeId":"P-04","answer":"合成データは、低リソース言語・領域へのAIモデルの適応や、大規模モデルから小規模モデルへの知識蒸留を行う際のデータソースとして使われます。","evidencePoints":["ev-synthetic-data-3"],"scope":"低リソース領域適応・知識蒸留という具体的な用途","differentiation":"実データの入手が困難な状況を補う手段として使われる点が特徴","faq":[],"pageUrl":"https://www.refbase.ai/reference/synthetic-data/P-04-001","sourceEvidence":[{"id":"ev-synthetic-data-3","text":"NVIDIAは、合成生成されたデータが低リソース言語・領域へのモデル適応や、他モデルからの知識蒸留の実施に有用であると説明している。","title":"How NVIDIA Builds Open Data for AI","coverageType":["UseCase"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/blog/nvidia/open-data-for-ai","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"synthetic-data"}],"generatedAt":"2026-07-20T11:04:59.119Z"}]}