Güvenlik

Hizalama Alignment

Modelin davranışını insan değerleri ve niyetiyle uyumlu hâle getirme çalışması.

Hizalama (alignment); modelin yararlı, dürüst ve zararsız davranmasını sağlamayı amaçlar. İnsan geri bildirimiyle pekiştirmeli öğrenme (RLHF) yaygın bir yöntemdir.

← Tüm sözlük