safe-rlhf

★ 1,612 Open GitHub ↗

Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback

// repository documentation