🔗John Schulman ve ark. — 2017

(53) Proximal Policy Optimization Algorithms

[T2 · Derin öğrenme | ★ birincil kanon] RLHF'in altındaki algoritma.

Orijinal kaynağı aç ↗