RLHF(Reinforcement Learning From Human Feedback)
4 posts
[ML] RIDE: 교사가 도달한 곳이 아니라 움직인 방향을 증류하다
[ML] DPO 손실의 절반을 차지하는 69개 토큰: Frequency-Hard DPO
[LLM] 00. Introduction: LLM 밑바닥부터 이해하기
[LLM] 10. RLHF와 DPO — 사람의 선호를 학습시키는 법
Home