🔗Rafael Rafailov ve ark. — 2023

(70) Direct Preference Optimization

[T3 · Transformer, büyük dil modelleri ve sınır araştırması | ★ birincil kanon] RLHF'i tek adıma indirgeyen yöntem.

Orijinal kaynağı aç ↗