🔗Long Ouyang ve ark. — 2022

(68) Training language models to follow instructions with human feedback

[T3 · Transformer, büyük dil modelleri ve sınır araştırması | ★ birincil kanon] InstructGPT; RLHF'in kanonik metni.

Orijinal kaynağı aç ↗