DPO(Direct Preference Optimization)
3 posts
[ML] DPO 손실의 절반을 차지하는 69개 토큰: Frequency-Hard DPO
[LLM] 00. Introduction: LLM 밑바닥부터 이해하기
[LLM] 10. RLHF와 DPO — 사람의 선호를 학습시키는 법
Home