🔗Jared Kaplan ve ark. — 2020

(66) Scaling Laws for Neural Language Models

[T3 · Transformer, büyük dil modelleri ve sınır araştırması | ★ birincil kanon] Kayıp, parametre ve hesaplama arasındaki güç yasası.

Orijinal kaynağı aç ↗