Long Ouyang ve ark. — 2022
(68) Training language models to follow instructions with human feedback
[T3 · Transformer, büyük dil modelleri ve sınır araştırması | ★ birincil kanon] InstructGPT; RLHF'in kanonik metni.
Orijinal kaynağı aç ↗[T3 · Transformer, büyük dil modelleri ve sınır araştırması | ★ birincil kanon] InstructGPT; RLHF'in kanonik metni.
Orijinal kaynağı aç ↗