Imbueは2026年4月23日、自社ブログで独自のエージェント評価ベンチマーク「Keystone-Eval」を公開しました。このベンチマークは、AIエージェントが約200のリポジトリを対象に、Dockerfileやテスト実行スクリプトを自ら生成して開発環境を構築・適応できるかを測定するもので、Dockerfileがビルドされテストが成功するかを示す「Completed %」、コードの破壊的変更(ミューテーション)を検知できるかを示す「Mutation Win %」、推論コストと所要時間、という3つの主要指標で評価します。結果として、Claude Opus 4.6が完了率93%で最高スコアを記録した一方、Codex GPT-5.4はミューテーション検知率75%で最も優れた成績を示しました。この結果は、Imbueが自社のエージェント研究に加え、AIエージェントの信頼性を測る評価手法そのものを独自に開発・公開している研究機関であることを裏付けています。