🔗Jan Leike ve ark. — 2018

(103) Scalable Agent Alignment via Reward Modeling

[T4 · Hizalama, güvenlik, etik ve yönetişim]

Orijinal kaynağı aç ↗