Chapter 12: 다차원 보상 — 스칼라를 넘어서
의문
쌍비교로 학습한 Bradley-Terry(BT — 두 응답의 점수 차를 시그모이드로 승률로 바꾸는 모델) 보상 모델은 응답마다 점수 하나만 준다. 정책(응답을 뽑는 모델)을 학습하는 정책 그래디언트 속 보상
파레토 프론티어: 모든 축에서 이기는 응답은 없다
선호 데이터를 만드는 사람은 같은 프롬프트에 나온 두 응답을 놓고 하루에도 수백 번 둘 중 하나를 고른다. 그런데 한 응답은 더 정확하고 다른 응답은 더 간결한 경우가 흔하다. 이 둘 중 어느 쪽이 "더 좋다"고 말할 수 있을까? 말할 수 없다면, 적어도 “확실히 나쁜” 응답은 어떻게 가려낼까?
역사: 더할 수 없는 만족을 더하지 않고 비교하기
이 물음에 이름을 준 사람은 이탈리아의 빌프레도 파레토(Vilfredo Pareto)다. 그는 원래 토목 기사였다. 1869년 토리노의 공과대학에서 공학 박사 학위를 받고 국영 철도 회사와 제철소에서 일했고, 경제학에 본격적으로 뛰어든 것은 마흔 중반이 되어서였다.
그 무렵 경제학은 사람마다의 만족(효용)을 숫자로 재어 더할 수 있다고 보았다. 공리주의 철학이 내건 「최대 다수의 최대 행복」도 모두의 만족을 더한 합을 키우자는 말이다. 파레토는 이 덧셈을 버렸다. 한 사람이 무엇을 무엇보다 더 좋아하는지 그 순서만 알면 경제를 다룰 수 있고, 그 좋음이 몇 점인지는 잴 필요가 없다고 처음으로 짚은 사람이 그였다. 좋음은 잴 수 없다고 본 그는 1906년 『정치경제학 교본(Manuale di economia politica)』에서, 점수를 더하지 않고도 내릴 수 있는 판정만 남겼다. 누군가의 처지를 나쁘게 하지 않고는 다른 누구의 처지도 더 낫게 할 수 없는 상태라면, 거기서 모두가 동의할 만큼 나아질 길은 없다. 이 판정에는 사람 사이의 만족을 바꿔 주는 환율이 필요 없다.
사람 대신 평가 기준을 놓으면 그대로 여러 목표를 동시에 다루는 최적화의 언어가 된다. 정확성 1점과 간결성 1점을 어떻게 바꿀지 정하지 않고도, “확실히 나쁜” 응답은 가려낼 수 있다.
자동차 고르기: 지배와 프론티어
자동차를 고른다고 하자. 성능과 연비 두 가지만 10점 만점으로 매긴다(설명을 위해 정한 점수다).
| 차 | 스포츠카 | 세단 | 하이브리드 | 경차 |
|---|---|---|---|---|
| 성능 | 10 | 8 | 5 | 2 |
| 연비 | 2 | 6 | 8 | 9 |
성능이 오를수록 연비는 떨어진다. 넷 중 누구도 다른 차보다 두 가지 모두에서 낫지는 않다. 이런 차들을 파레토 최적이라 하고, 그 점들을 이은 경계를 파레토 프론티어라 한다. 프론티어 위의 어느 점이 "최고"인지는 차가 아니라 운전자의 가중치(기준마다 곱하는 수 — 신경망 파라미터가 아니다)가 정한다. 연비를 아주 중시하면 경차, 성능을 아주 중시하면 스포츠카.
어느 날 성능 6, 연비 8.5인 신차가 나왔다. 하이브리드(5, 8)보다 성능도 연비도 좋으므로, 신차는 하이브리드를 지배(dominate)한다. 하이브리드는 더 이상 파레토 최적이 아니다. 프론티어가 바깥으로 밀려난 것이다.
파란 계단이 신차가 나온 뒤의 프론티어다. 신차에서 왼쪽 아래로 칠한 곳에 든 차는 성능도 연비도 신차보다 낮다. 하이브리드가 그 안에 들어갔다. 경차는 연비 9가 신차의 8.5보다 높아 그 밖에 있고, 스포츠카와 세단은 성능이 신차보다 높아 그 밖에 있다.
LLM 응답도 똑같다. 정확성과 간결성을 두 축으로 놓자. 정확성을 올리면 설명이 길어져 간결성이 떨어지고, 안전성을 올리면 거절이 늘어 유용성이 떨어진다. 모든 차원을 동시에 최대로 만들 수는 없으니 프론티어가 생긴다. 하지만 모델 자체가 좋아지면 “짧으면서도 정확한” 응답이 가능해지고, 신차처럼 프론티어를 바깥으로 밀어낸다.
아래 위젯은 응답 아홉 개를 정확성·간결성 평면에 놓았다. 채운 점은 파레토 최적, 빈 점은 지배당한 응답이다. 「모델 개선」을 켜면 새 응답 E가 들어온다. 어느 점이 빈 점으로 바뀌는지 보라.
위젯의 응답 아홉 개의 좌표는 다음과 같다(정확성, 간결성 순. 위젯의 새 응답 E 는 「모델 개선」을 켤 때만 나타나므로 아래 문제에서는 뺀다).
| 응답 | A | B | C | D | F | G | H | I | J |
|---|---|---|---|---|---|---|---|---|---|
| 정확성 | 0.95 | 0.85 | 0.62 | 0.45 | 0.2 | 0.55 | 0.35 | 0.75 | 0.3 |
| 간결성 | 0.2 | 0.5 | 0.64 | 0.85 | 0.95 | 0.45 | 0.6 | 0.35 | 0.3 |
ML에서: 프리트레인은 프론티어를, RL은 자리를 정한다
이 그림을 학습 단계의 언어로 옮기면, 프리트레인이 프론티어의 위치를 정하고, RL은 프론티어 위의 어디에 설지를 정한다. 까닭은 RL이 확률을 옮기는 방식에 있다. 정책 그래디언트는 모델이 직접 뽑아 본 응답에만 보상을 매기고, 그 응답들의 확률을 올리거나 내린다. 지금 모델이 거의 뽑지 않는 응답, 이를테면 아직 쓸 줄 모르는 “짧으면서도 정확한” 답은 보상을 받을 기회부터 드물다. 그래서 RL은 대개 이미 뽑히는 응답들 사이에서 비중을 옮기고, 프론티어 자체를 밀어내는 일은 더 좋은 프리트레인이 맡는다.
실험도 이 그림과 맞는다. 같은 문제를
문제 1 — 장학금 후보는 누구인가
같은 학과 친구 넷의 (전공 평점, 교양 평점)이 가 (4.2, 3.0), 나 (3.8, 3.9), 다 (3.5, 3.6), 라 (3.0, 4.3)이다. 장학금 심사는 먼저 「다른 누구에게도 두 평점 모두에서 밀리지 않는 사람」만 후보로 올린다. 후보는 누구인가?







정리 후보는 가, 나, 라. 다는 나에게 두 평점 모두에서 밀린다. 평균 1등 하나만 고르면 두 과목의 비중(반반)을 미리 정한 셈이다.
문제 2 — 새로 들어온 두 응답
위젯의 아홉 응답에 새 응답 둘이 더해진다: K(0.62, 0.60), L(0.90, 0.30). 각각 지배당하는가? 지배당한다면 누구에게인가?
위젯의 「문제 2의 새 응답 K, L 추가」를 켜면 자기 풀이와 견줄 수 있다.











정리 L은 누구에게도 지배당하지 않는다. A와 B를 이은 선분 아래에 있지만, 그 선분 위의 점은 실제 응답이 아니다. K는 C에게 지배당한다(정확성이 같고 간결성이 낮다). 지배는 실제로 있는 응답끼리 「모든 차원에서 같거나 낫고, 적어도 하나에서 낫다」로 가린다.