Chapter 12: 다차원 보상 — 스칼라를 넘어서

의문

쌍비교로 학습한 Bradley-Terry(BT — 두 응답의 점수 차를 시그모이드로 승률로 바꾸는 모델) 보상 모델은 응답마다 점수 하나만 준다. 정책(응답을 뽑는 모델)을 학습하는 정책 그래디언트 속 보상 RR 도 스칼라다. 그런데 좋은 답은 여러 면에서 좋다 — 정확하고, 간결하고, 안전하고, 친절하다. 보상이 숫자 하나가 아니라 벡터라면, "이 응답이 좋다"는 판단을 어떻게 내리는가?

파레토 프론티어: 모든 축에서 이기는 응답은 없다

선호 데이터를 만드는 사람은 같은 프롬프트에 나온 두 응답을 놓고 하루에도 수백 번 둘 중 하나를 고른다. 그런데 한 응답은 더 정확하고 다른 응답은 더 간결한 경우가 흔하다. 이 둘 중 어느 쪽이 "더 좋다"고 말할 수 있을까? 말할 수 없다면, 적어도 “확실히 나쁜” 응답은 어떻게 가려낼까?

역사: 더할 수 없는 만족을 더하지 않고 비교하기

이 물음에 이름을 준 사람은 이탈리아의 빌프레도 파레토(Vilfredo Pareto)다. 그는 원래 토목 기사였다. 1869년 토리노의 공과대학에서 공학 박사 학위를 받고 국영 철도 회사와 제철소에서 일했고, 경제학에 본격적으로 뛰어든 것은 마흔 중반이 되어서였다.

그 무렵 경제학은 사람마다의 만족(효용)을 숫자로 재어 더할 수 있다고 보았다. 공리주의 철학이 내건 「최대 다수의 최대 행복」도 모두의 만족을 더한 합을 키우자는 말이다. 파레토는 이 덧셈을 버렸다. 한 사람이 무엇을 무엇보다 더 좋아하는지 그 순서만 알면 경제를 다룰 수 있고, 그 좋음이 몇 점인지는 잴 필요가 없다고 처음으로 짚은 사람이 그였다. 좋음은 잴 수 없다고 본 그는 1906년 『정치경제학 교본(Manuale di economia politica)』에서, 점수를 더하지 않고도 내릴 수 있는 판정만 남겼다. 누군가의 처지를 나쁘게 하지 않고는 다른 누구의 처지도 더 낫게 할 수 없는 상태라면, 거기서 모두가 동의할 만큼 나아질 길은 없다. 이 판정에는 사람 사이의 만족을 바꿔 주는 환율이 필요 없다.

사람 대신 평가 기준을 놓으면 그대로 여러 목표를 동시에 다루는 최적화의 언어가 된다. 정확성 1점과 간결성 1점을 어떻게 바꿀지 정하지 않고도, “확실히 나쁜” 응답은 가려낼 수 있다.

자동차 고르기: 지배와 프론티어

자동차를 고른다고 하자. 성능과 연비 두 가지만 10점 만점으로 매긴다(설명을 위해 정한 점수다).

차 스포츠카 세단 하이브리드 경차
성능 10 8 5 2
연비 2 6 8 9

성능이 오를수록 연비는 떨어진다. 넷 중 누구도 다른 차보다 두 가지 모두에서 낫지는 않다. 이런 차들을 파레토 최적이라 하고, 그 점들을 이은 경계를 파레토 프론티어라 한다. 프론티어 위의 어느 점이 "최고"인지는 차가 아니라 운전자의 가중치(기준마다 곱하는 수 — 신경망 파라미터가 아니다)가 정한다. 연비를 아주 중시하면 경차, 성능을 아주 중시하면 스포츠카.

어느 날 성능 6, 연비 8.5인 신차가 나왔다. 하이브리드(5, 8)보다 성능도 연비도 좋으므로, 신차는 하이브리드를 지배(dominate)한다. 하이브리드는 더 이상 파레토 최적이 아니다. 프론티어가 바깥으로 밀려난 것이다.

0 5 10 0 5 10 성능 → ↑ 연비 파레토 프론티어 신차가 지배하는 곳 스포츠카 세단 하이브리드 경차 신차

파란 계단이 신차가 나온 뒤의 프론티어다. 신차에서 왼쪽 아래로 칠한 곳에 든 차는 성능도 연비도 신차보다 낮다. 하이브리드가 그 안에 들어갔다. 경차는 연비 9가 신차의 8.5보다 높아 그 밖에 있고, 스포츠카와 세단은 성능이 신차보다 높아 그 밖에 있다.

LLM 응답도 똑같다. 정확성과 간결성을 두 축으로 놓자. 정확성을 올리면 설명이 길어져 간결성이 떨어지고, 안전성을 올리면 거절이 늘어 유용성이 떨어진다. 모든 차원을 동시에 최대로 만들 수는 없으니 프론티어가 생긴다. 하지만 모델 자체가 좋아지면 “짧으면서도 정확한” 응답이 가능해지고, 신차처럼 프론티어를 바깥으로 밀어낸다.

아래 위젯은 응답 아홉 개를 정확성·간결성 평면에 놓았다. 채운 점은 파레토 최적, 빈 점은 지배당한 응답이다. 「모델 개선」을 켜면 새 응답 E가 들어온다. 어느 점이 빈 점으로 바뀌는지 보라.

위젯의 응답 아홉 개의 좌표는 다음과 같다(정확성, 간결성 순. 위젯의 새 응답 E 는 「모델 개선」을 켤 때만 나타나므로 아래 문제에서는 뺀다).

응답 A B C D F G H I J
정확성 0.95 0.85 0.62 0.45 0.2 0.55 0.35 0.75 0.3
간결성 0.2 0.5 0.64 0.85 0.95 0.45 0.6 0.35 0.3
ML에서: 프리트레인은 프론티어를, RL은 자리를 정한다

이 그림을 학습 단계의 언어로 옮기면, 프리트레인이 프론티어의 위치를 정하고, RL은 프론티어 위의 어디에 설지를 정한다. 까닭은 RL이 확률을 옮기는 방식에 있다. 정책 그래디언트는 모델이 직접 뽑아 본 응답에만 보상을 매기고, 그 응답들의 확률을 올리거나 내린다. 지금 모델이 거의 뽑지 않는 응답, 이를테면 아직 쓸 줄 모르는 “짧으면서도 정확한” 답은 보상을 받을 기회부터 드물다. 그래서 RL은 대개 이미 뽑히는 응답들 사이에서 비중을 옮기고, 프론티어 자체를 밀어내는 일은 더 좋은 프리트레인이 맡는다.

실험도 이 그림과 맞는다. 같은 문제를 kk 번 풀게 해 한 번이라도 맞히는 비율로 베이스 모델(RL을 하기 전의 모델)과 RL 모델을 견준 연구(Yue et al. 2025)에서, kk 가 작을 때는 RL 모델이 앞섰지만 kk 를 수십~수백으로 늘리면 베이스 모델이 따라잡고 앞질렀다. RL이 새 답을 만들기보다 이미 뽑을 수 있던 답에 확률을 모았다는 뜻이다.

문제 1 — 장학금 후보는 누구인가

같은 학과 친구 넷의 (전공 평점, 교양 평점)이 가 (4.2, 3.0), 나 (3.8, 3.9), 다 (3.5, 3.6), 라 (3.0, 4.3)이다. 장학금 심사는 먼저 「다른 누구에게도 두 평점 모두에서 밀리지 않는 사람」만 후보로 올린다. 후보는 누구인가?

김민준 (평상)
김민준
평균을 내 봤어요. 가 3.6, 나 3.85, 다 3.55, 라 3.65. 나가 1등이니까 후보는 나예요.
선생님 (질문)
선생님
민준 학생, 가는 전공에서 누구에게 지나요?
김민준 (당황)
김민준
전공 4.2면… 아무한테도 안 지네요. 가는 두 평점 모두에서 밀린 적이 없어요.
이서연 (평상)
이서연
하나씩 견줘 보면 돼. 다는 나한테 전공 3.5 대 3.8, 교양 3.6 대 3.9로 둘 다 져. 나머지 셋은 서로 한 과목씩 이기고 지고.
선생님 (평상)
선생님
그럼 후보는요?
이서연 (평상)
이서연
가, 나, 라 셋이에요. 다만 빠져요.
김민준 (깨달음)
김민준
평균은 "두 과목을 반반으로 친다"고 비중을 미리 정해 버린 거네요. 후보를 고르는 단계에서는 그 비중을 아직 안 정했는데요.

정리 후보는 가, 나, 라. 다는 나에게 두 평점 모두에서 밀린다. 평균 1등 하나만 고르면 두 과목의 비중(반반)을 미리 정한 셈이다.

문제 2 — 새로 들어온 두 응답

위젯의 아홉 응답에 새 응답 둘이 더해진다: K(0.62, 0.60), L(0.90, 0.30). 각각 지배당하는가? 지배당한다면 누구에게인가?

위젯의 「문제 2의 새 응답 K, L 추가」를 켜면 자기 풀이와 견줄 수 있다.

김민준 (평상)
김민준
L부터 볼게요. A(0.95, 0.2)와 B(0.85, 0.5)를 직선으로 이으면 정확성 0.90에서 높이가 0.5−0.3×0.050.1=0.350.5 - 0.3 \times \frac{0.05}{0.1} = 0.35 예요. L은 0.30이라 그 선 아래에 있어요. 프론티어 안쪽이니까 지배당했어요.
선생님 (질문)
선생님
그 선 위의 점 (0.90, 0.35)는 실제로 있는 응답이에요?
김민준 (당황)
김민준
아뇨, 선 위에 있는 응답은 A랑 B뿐이고 그 사이는 비어 있어요.
선생님 (평상)
선생님
그럼 실제 응답 가운데 L을 두 축 모두에서 이기는 게 있는지 보죠.
김민준 (평상)
김민준
A는 정확성 0.95로 이기지만 간결성 0.2로 지고, B는 간결성 0.5로 이기지만 정확성 0.85로 져요. 나머지는 정확성에서 다 L한테 지고요. 아무도 없네요. L은 지배당하지 않아요.
이서연 (평상)
이서연
그럼 K도 쉬워. C(0.62, 0.64)랑 정확성이 0.62로 똑같으니까, C가 K를 두 축 "모두"에서 이긴 건 아니잖아. K도 지배당하지 않아.
선생님 (질문)
선생님
서연 학생, K 대신 C를 받으면 잃는 게 있어요?
이서연 (생각)
이서연
정확성은 그대로고 간결성은 0.60에서 0.64로 오르니… 잃는 건 없고 얻는 것만 있어요. K를 고를 까닭이 없네요.
선생님 (평상)
선생님
그래서 지배는 "모든 차원에서 같거나 낫고, 적어도 하나에서 낫다"로 정해요. 같은 축이 있어도 돼요.
이서연 (깨달음)
이서연
그럼 K는 C에게 지배당해요. "두 축 모두에서 낫다"를 엄격한 부등호로만 읽어서 동점을 놓쳤어요. 해석학에서 ≤\le 를 << 로 잘못 써서 증명이 틀어지는 거랑 같네요.
김민준 (평상)
김민준
아까 장학금 문제에서 평균이 높다고 후보가 되는 게 아니었던 것처럼, 선 아래에 있다고 지배당하는 것도 아니네요. 지배는 실제로 있는 응답하고만 견주는 거고요.

정리 L은 누구에게도 지배당하지 않는다. A와 B를 이은 선분 아래에 있지만, 그 선분 위의 점은 실제 응답이 아니다. K는 C에게 지배당한다(정확성이 같고 간결성이 낮다). 지배는 실제로 있는 응답끼리 「모든 차원에서 같거나 낫고, 적어도 하나에서 낫다」로 가린다.