P-04課題解決

Reasoning Modelには限界があると指摘する研究はありますか?

Apple機械学習研究部門が公開した論文「The Illusion of Thinking」(machinelearning.apple.com掲載)によると、o1・DeepSeek-R1・Claudeの思考モデルなど、回答前に詳細な思考過程を生成するLarge Reasoning Models(LRM)は「一定の複雑さを超えると完全な精度崩壊に直面する」ことが実験で示された。同論文は、問題の複雑さが増すとLRMの推論に使うトークン量(思考の労力)は一定の水準までは増加するが、その後はトークン予算が十分にあるにもかかわらず減少に転じるという逆説的な現象を報告している。また、低複雑度のタスクでは通常のLLMがLRMを上回り、中複雑度のタスクでは追加の推論が有効に働くが、高複雑度のタスクでは両タイプとも完全に失敗するという3つの性能レジームが観察されたとし、LRMは「明示的なアルゴリズムを一貫して適用できず、パズル間で推論に一貫性がない」と結論づけている。

実績・根拠

情報ソース