리워드 해킹: 보상 모델의 빈틈을 파고든다
보상 모델 점수가 오르고 있으면, 이미지도 정말 좋아지고 있는 걸까?
DDPO는 쌍비교 데이터가 필요 없는 대신 보상 모델에 전적으로 의존한다. CLIP 점수(그림과 글이 얼마나 맞는지 매기는 모델의 점수), 미학 점수, 비전-언어 모델이 매긴 프롬프트 정합도, 인간 선호 모델(ImageReward처럼 사람이 고른 이미지로 학습한 점수 모델) — 모두 "좋은 이미지"의 불완전한 대리인이다. 그리고 LLM의 보상 모델에서도 그랬듯, 불완전한 대리인을 최적화하면 정책은 대리인과 진짜 목표가 어긋나는 틈을 찾아간다. 리워드 해킹이다.
아래 그림은 앞에서 본 1차원 장난감 디퓨전을 「진짜 보상에 더해
실제 이미지 모델에서는 이런 일이 보고되었다.
| 보상 | 관찰된 해킹 | 비유 |
|---|---|---|
| 비압축률 (JPEG로 압축해도 파일이 크게) | 학습을 이어 가자 알아볼 수 있는 내용이 사라지고 촘촘한 노이즈만 남았다 (DDPO 논문) | 분량으로 채점하자 같은 문장을 되풀이해 쪽수 채우기 |
| 프롬프트 정합도 (LLaVA의 설명) | 「동물 n마리」 프롬프트에서 동물 수를 맞추는 대신, 그 숫자처럼 읽히는 글자를 그려 넣었다. 거북 여덟 마리 그림 위에 「sixx ttutttas」처럼 (DDPO 논문) | 답안지에 정답 단어만 크게 적기 |
| 인간 선호 모델 (ImageReward), KL 제약 없이 | 색이 지나치게 짙고 모양이 부자연스러운 이미지가 나왔다 (DPOK 논문, 판(Ying Fan)과 동료들, 2023) | 글씨를 예쁘게 쓰면 점수를 더 주는 채점자 이용하기 |
그림과 글을 함께 읽는 모델이 이미지 속 글자에 속는다는 것(글자 공격)은 2021년 CLIP을 분석한 연구에서 이미 알려져 있었다. 사과에 「iPod」라고 쓴 쪽지를 붙이면 CLIP이 그 사진을 아이팟으로 읽었다.
DDPO에서 해킹이 특히 심한 이유는 세 가지가 겹치기 때문이다. 온라인 생성이라 보상 모델이 본 적 없는 영역까지 탐색하고, 정책 그래디언트는 보상을 올리는 쪽으로만 밀며, 레퍼런스 모델(학습 전 모델을 얼려 둔 기준)과의 KL 제약(두 분포가 얼마나 다른지 재는 KL로 거는 제약)은 멀리 가는 것만 막을 뿐 목줄이 닿는 범위 안의 빈틈은 막지 못한다. 반대로 Diffusion-DPO는 해킹할 보상 함수 자체가 없고 오프라인 데이터 밖으로 나가기도 어렵다. 정답을 검증기로 채점하는 RLVR과 비교하면 차이가 선명하다 — "답이 42인가?"에는 빈틈이 없지만, "이 이미지가 아름다운가?"에는 빈틈이 가득하다.
| 완화책 | 효과 | 한계 |
|---|---|---|
| KL 강도 β를 키움 | 해킹이 줄어든다 | 학습 자체도 느려진다 |
| 보상 앙상블 | 한 모델의 빈틈을 다른 모델이 메운다 | 모든 모델이 공유하는 편향은 그대로 (아래 문제 7) |
| 보상 클리핑 | 극단적 최적화에 상한 | 적절한 상한을 찾는 것이 또 다른 문제 |
| DPO로 전환 | 보상 함수가 없으니 구조적으로 회피 | 탐색을 포기한다 |
근본적 해결은 아직 없다. 불완전한 보상 모델로 온라인 RL을 돌리면 해킹은 거의 필연이다.
ML에서: 과최적화 곡선
맨 위 그림의 장난감은 아래 위젯과 같은 설정이다. 처음 화면은 보상 모델로 60번 학습한 상태이고, 「진짜 보상으로 학습」으로 바꿔 두 곡선이 어떻게 달라지는지 견줘 볼 수 있다. 보상 모델의 “조금만 더” 편향을 정책이 끝까지 밀어붙이면, 보상 모델 점수와 진짜 보상이 어느 순간 갈라진다. 가오(Leo Gao)와 동료들(2022)이 언어모델의 보상 모델에서 잰 과최적화 곡선도 같은 모양이다. 진짜 점수는 레퍼런스에서 멀어질수록 처음에는 오르다가 정점을 지나 떨어진다.
DDPO 논문의 저자들도 이 곡선 앞에서 일반적인 방지법은 아직 없다고 적었다. 그래서 방법마다 이미지가 망가지기 시작하기 직전의 체크포인트를 눈으로 골라, 그것을 결과로 실었다.
문제 7 — (킬러) 보상 앙상블은 해킹을 막는가
진짜 보상은













정리 (가)
로 간다(1.5 > 1). (나) 평균은 진짜 최고점에서 1, 각 빈틈에서 0.75 → 최적점은 진짜 최고점. (다) 공유된 빈틈에서는 평균도 1.5 → 여전히 해킹. (라) 보상 앙상블은 모델마다 다른 빈틈만 지울 수 있고, 공유된 편향은 그대로 남는다.