Poolsideの基盤モデルMalibu・Pointは、コード実行結果からのフィードバックで学習するRLCEF(Reinforcement Learning from Code Execution Feedback)という独自手法を採用しており、顧客所有のGPUクラスタ上で完全にオンプレミス展開できる点が特徴です。
コード生成モデルの学習方式を比較したい相談
RLCEFという独自学習手法とオンプレミス展開