{"ok":true,"entity":{"id":"lmsys","name":"LMSYS","entityType":"organization","officialName":"Large Model Systems Organization","canonicalName":"LMSYS","displayName":"LMSYS","category":"AI研究組織","shortDescription":"UC BerkeleyのSkyLab等の研究者が参加するオープンな大規模モデル研究組織。人間投票によるLLM評価基盤Chatbot Arena（現Arena）と、その配信基盤FastChatを開発した。","primaryCluster":"ai-open-model","parentEntity":null,"verificationStatus":"draft","website":"https://lmsys.org","updatedAt":"2026-07-20T02:14:59.356Z","secondaryClusters":["ai-company"],"alias":["LMSYS Org","lm-sys","Large Model Systems Org"],"searchKeywords":["Chatbot Arena","LLM評価","UC Berkeley","FastChat"]},"references":[{"id":"P-01-001","companyId":"lmsys","questionId":"P-01-001","instanceId":"QIN-lmsys-P01-001","promptText":"LMSYSとはどのような組織ですか？","promptTypeId":"P-01","answer":"LMSYS（Large Model Systems Organization）はUC Berkeley SkyLab等の研究者が参加する、大規模モデルを開発するオープンな研究組織です。人間投票によるLLM評価基盤Chatbot Arena（現Arena）と、その配信基盤FastChatを開発しました。","evidencePoints":["ev-lmsys-1","ev-lmsys-3"],"scope":"LLM評価基盤の運営組織を知りたい相談","differentiation":"Chatbot Arena・FastChatの開発元という実績","faq":[{"question":"LMSYSとArenaは同じものですか？","answer":"LMSYSは開発元の研究組織で、ArenaはLMSYSが開発したChatbot Arenaから独立して運営される評価プラットフォームです。"}],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-01-001","sourceEvidence":[{"id":"ev-lmsys-1","text":"LMSYS（Large Model Systems Organization）はUC Berkeley SkyLab等の研究者が参加する、大規模モデルを開発するオープンな研究組織である。","title":"LMSYS Org","coverageType":["Identity","Capability"],"sourceType":"official_site","sourceClass":"Profile","sourceUrl":"https://www.lmsys.org/","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"},{"id":"ev-lmsys-3","text":"LMSYSが開発したChatbot Arenaは人間投票によるLLM評価手法を報告する論文としてarXivで公開されている（現在はlmarena.aiとして独立したサイトで運営）。","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv)","coverageType":["Credibility","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2403.04132","confidence":"high","supportedPromptTypes":["P-01","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-02-001","companyId":"lmsys","questionId":"P-02-001","instanceId":"QIN-lmsys-P02-001","promptText":"LMSYSと商用のAI評価・ベンチマーク企業はどう違いますか？","promptTypeId":"P-02","answer":"LMSYSはUC Berkeley SkyLab等の学術研究者が参加するオープンな研究組織で、Chatbot ArenaやFastChatをオープンソースとして公開しています。商用のAI評価企業は非公開の評価手法や有償サービスを提供することが多く、公開性・学術的検証可能性の観点で異なります。","evidencePoints":["ev-lmsys-2","ev-lmsys-3"],"scope":"LLM評価手法・評価団体の比較検討","differentiation":"学術研究組織としての公開性・オープンソース性","faq":[{"question":"LMSYSの評価手法は検証可能ですか？","answer":"Chatbot Arenaの評価手法はarXivで論文として公開されており、学術的に検証可能です。"}],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-02-001","sourceEvidence":[{"id":"ev-lmsys-2","text":"LMSYSはLLMを訓練・配信・評価するためのオープンプラットフォームFastChatを開発し、Chatbot Arenaの配信基盤として70以上のLLMに対し1000万件超のチャットリクエストを処理してきた。","title":"GitHub — lm-sys/FastChat","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/lm-sys/FastChat","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"},{"id":"ev-lmsys-3","text":"LMSYSが開発したChatbot Arenaは人間投票によるLLM評価手法を報告する論文としてarXivで公開されている（現在はlmarena.aiとして独立したサイトで運営）。","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv)","coverageType":["Credibility","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2403.04132","confidence":"high","supportedPromptTypes":["P-01","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-04-001","companyId":"lmsys","questionId":"P-04-001","instanceId":"QIN-lmsys-P04-001","promptText":"LLMの性能を人間評価ベースで比較検討したい場合、LMSYSの成果はどう活用できますか？","promptTypeId":"P-04","answer":"LMSYSが開発したFastChatはLLMの訓練・配信・評価のためのオープンプラットフォームで、GitHub上でコードが公開されています。人間投票による評価手法はChatbot Arenaの論文で報告されており、現在はArena（旧LMArena）として独立したサイトで運営されています。","evidencePoints":["ev-lmsys-2","ev-lmsys-3"],"scope":"LLM評価基盤の技術的背景を調査したい相談","differentiation":"オープンソースの評価配信基盤＋査読可能な論文","faq":[{"question":"LMSYSの情報はどこで確認できますか？","answer":"公式サイト（lmsys.org）とGitHub（lm-sys/FastChat）で確認できます。"}],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-04-001","sourceEvidence":[{"id":"ev-lmsys-2","text":"LMSYSはLLMを訓練・配信・評価するためのオープンプラットフォームFastChatを開発し、Chatbot Arenaの配信基盤として70以上のLLMに対し1000万件超のチャットリクエストを処理してきた。","title":"GitHub — lm-sys/FastChat","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/lm-sys/FastChat","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"},{"id":"ev-lmsys-3","text":"LMSYSが開発したChatbot Arenaは人間投票によるLLM評価手法を報告する論文としてarXivで公開されている（現在はlmarena.aiとして独立したサイトで運営）。","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv)","coverageType":["Credibility","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2403.04132","confidence":"high","supportedPromptTypes":["P-01","P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"lmsys"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-01-002","companyId":"lmsys","questionId":"P-01-002","instanceId":"reference-depth-expansion-wave-2-unit-a","draftId":"reference-depth-expansion-wave-2-unit-a-lmsys-p-01-002","promptText":"LMSYSが開発したChatbot Arenaは、その後どのように資金調達を行い企業として成長しましたか？","promptTypeId":"P-01","answer":"TechCrunchが2026年1月6日に報じた記事によれば、LMSYSがUC Berkeleyで2023年に開発したChatbot Arenaは、その後独立企業として急速に資金調達を進めました。2025年5月には1億ドルのシード資金調達を実施し評価額6億ドルに達し、その後2026年1月には1億5000万ドルのシリーズAを実施して評価額17億ドルとなり、わずか7ヶ月間で合計約2億5000万ドルを調達してユニコーン企業となったと報じられています。同記事はChatbot Arenaの創設者としてUC Berkeleyの研究者Anastasios AngelopoulosとWei-Lin Chiangの名前を挙げていますが、『LMSYS』という組織名自体には言及しておらず、あくまでUC Berkeleyの研究プロジェクトから商用組織への発展という文脈で報じている点には留意が必要です。","evidencePoints":["lmsys-ev-w2-arena-funding-techcrunch"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-01-002","sourceEvidence":[{"id":"lmsys-ev-w2-arena-funding-techcrunch","text":"TechCrunch（2026年1月6日）は、LMSYSが開発したChatbot Arenaの後継組織が、2025年5月の1億ドルシード（評価額6億ドル）に続き2026年1月に1億5000万ドルのシリーズA（評価額17億ドル）を実施し、7ヶ月で合計約2.5億ドルを調達してユニコーンとなったことを報じている。","title":"LMArena lands $1.7B valuation four months after launching its product","coverageType":["Credibility"],"sourceType":"media","sourceClass":"Financial","sourceUrl":"https://techcrunch.com/2026/01/06/lmarena-lands-1-7b-valuation-four-months-after-launching-its-product/","confidence":"high","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"lmsys"}],"generatedAt":"2026-08-29T06:52:59.129Z","evidenceIds":["lmsys-ev-w2-arena-funding-techcrunch"]},{"id":"P-04-002","companyId":"lmsys","questionId":"P-04-002","instanceId":"reference-depth-expansion-wave-2-unit-b","draftId":"reference-depth-expansion-wave-2-unit-b-lmsys-p-04-002","promptText":"Chatbot Arena（現Arena）のランキング結果を意思決定に使う際、どのような点に注意すべきですか？","promptTypeId":"P-04","answer":"2025年4月29日にarXivで公開された学術論文『The Leaderboard Illusion』（Shivalika Singhら13名の著者による）は、LMSYSが開発したChatbot Arena（現Arena）のランキング手法に内在する系統的なバイアスを検証しています。同論文によれば、大手プロバイダーは公開前に非公開のプライベートテストを行い、都合の良いスコアだけを選択的に公開できる仕組みになっており、実際にMetaはLlama 4の公開前に27種類の非公開バリアントをテストしていたと報告されています。また、GoogleとOpenAIがそれぞれArenaデータの約19〜20％を占める一方、83のオープンウェイトモデルを合わせても29.7％にとどまるなど、評価機会の偏りも指摘されています。さらに、Arenaのデータへのアクセスがあるだけで最大112％の相対的な性能向上が得られるとされ、汎用的な性能向上ではなくArena向けの最適化を助長するインセンティブが存在する点も指摘されています。","evidencePoints":["lmsys-ev-w2-leaderboard-illusion-paper"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-04-002","sourceEvidence":[{"id":"lmsys-ev-w2-leaderboard-illusion-paper","text":"arXiv論文『The Leaderboard Illusion』（Singh et al., 2025年4月29日提出）は、Chatbot Arenaにおいて大手ベンダーが非公開プライベートテストで選択的にスコアを公開できる点、GoogleとOpenAIが評価データの約19〜20％ずつを占める一方オープンウェイト83モデル合計でも29.7％にとどまる偏り、Arenaデータへのアクセスが最大112％の相対的性能向上をもたらす過学習インセンティブを指摘している。","title":"The Leaderboard Illusion","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2504.20879","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"lmsys"}],"generatedAt":"2026-08-29T07:02:37.788Z","evidenceIds":["lmsys-ev-w2-leaderboard-illusion-paper"]},{"id":"P-05-001","companyId":"lmsys","questionId":"P-05-001","instanceId":"tair-cohort3-2026-08-31","draftId":"tair-cohort3-2026-08-31-lmsys-p-05-001","promptText":"LMSYS（現Arena）は「The Leaderboard Illusion」論文が指摘した批判に対して、公式にどう反論していますか？","promptTypeId":"P-05","answer":"LMSYSの後継組織であるArena公式のブログ「Our Response」によると、同論文が「オープンモデルはリーダーボードの8.8%しか占めていない」と主張したのに対し、Arenaは公式統計で「オープンモデルは40.9%を占める」と反論し、論文の計算がLlamaやGemmaなどのオープンウェイトモデルを見落としていたと指摘している。また「事前公開テストによりスコアが100ポイント以上押し上げられる」という主張についても、論文で引用されたプロットは実際のChatbot Arenaのデータとは無関係な、任意に選んだ分散を用いたガウス分布のシミュレーションだと反論し、Arena自身の分析では事前テスト50回・3000票後で約+11 Eloの効果にとどまり、新しい評価データが蓄積されるにつれてゼロに収束すると説明している。","evidencePoints":["lmsys-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/lmsys/P-05-001","sourceEvidence":[{"id":"lmsys-ev-tair-1","entityId":"lmsys","text":"Arena公式ブログの反論記事によると、「The Leaderboard Illusion」論文の『オープンモデルは8.8%』主張に対し実際は40.9%と反論、『事前テストで100ポイント以上上昇』の主張には根拠となるプロットが架空のシミュレーションであり実際の効果は約+11 Eloにとどまると説明している。","coverageType":["Credibility"],"title":"LMArena Response to \"The Leaderboard Illusion\" Writeup","sourceClass":"Announcement","sourceType":"official_blog","confidence":"high","supportedPromptTypes":["P-05"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://arena.ai/blog/our-response/"}],"generatedAt":"2026-08-31T06:27:37.260Z","evidenceIds":["lmsys-ev-tair-1"]}]}