머신러닝DPO: 선호도 쌍을 이용한 모델 정렬 — 보상 모델 없음, 강화학습 없음DPO는 RLHF의 단계 중 두 가지를 생략하여, 선호도 쌍만으로 모델을 정렬하는 방법을 제시합니다.AI Agent#DPO#RLHF#강화학습#모델 정렬