John Schulman ve ark. — 2017
(53) Proximal Policy Optimization Algorithms
[T2 · Derin öğrenme | ★ birincil kanon] RLHF'in altındaki algoritma.
Orijinal kaynağı aç ↗[T2 · Derin öğrenme | ★ birincil kanon] RLHF'in altındaki algoritma.
Orijinal kaynağı aç ↗