AI Safetyは、AIシステムが意図しない有害な挙動を起こさず、人間の意図・価値観に沿って動作するようにするための研究・実践領域です。モデルの出力・振る舞いが人間の意図と一致するよう調整するアライメント研究や、有害・危険なコンテンツを生成しないようにするガードレール・フィルタリング機構の設計を含みます。Anthropic・OpenAI・Google DeepMind等の主要AI企業が、AI Safetyに特化した研究組織・専任チームを設置しています。
AIシステムの安全な開発・運用を検討している企業・研究者に該当します。
モデルの性能・精度向上を目的とする技術と異なり、AIの挙動が人間にとって安全・望ましいものであるかを確保することを目的とする点が特徴です。