DPO Reference Implementations
Open implementations of direct preference optimization methods.
About DPO Reference Implementations
DPO tooling supports preference-based alignment without reward models.
Open implementations of direct preference optimization methods.