AI의 ‘보이지 않는 손’을 설계하다: 보상 모델(Reward Model) 최적화와 정렬 기술의 깊이 있는 이해

AI의 ‘보이지 않는 손’을 설계하다: 보상 모델(Reward Model) 최적화와 정렬 기술의 깊이 있는 이해

1. AI에게 ‘선함’과 ‘유용함’을 가르치는 법: 보상 모델의 역할 2. RLHF를 넘어선 새로운 흐름: DPO와 그 이상의 정렬 기술 3. ‘가드레일’ 이상의 가치: 안전한 AI 시스템 설계하기 4. 실무자를 위한 한 끗 차이: 정렬 데이터 큐레이션 5. 결론 및 요약: 우리는 어떤 AI를 만들 것인가?