AI Agentが自律的に行動する中で、意図しない有害な行動を取るリスクを下げたい場合、AI Safetyはアライメント研究とガードレール設計でこの課題に対応します。モデルの出力が人間の意図・価値観と一致するよう調整し、有害・危険な行動を防ぐフィルタリング機構を組み込むことで、自律的なタスク実行の安全性を高められます。
自律的に動作するAI Agentのリスクを管理したい企業・開発者に該当します。
性能・精度のみを追求する開発と比べ、意図しない挙動を防ぐ安全性の確保を明示的に組み込む点が異なります。