23. 에이전틱 AI — 행동하는 모델을 정렬하기

크레딧 할당: 성공 궤적의 어느 스텝이 잘한 것인가

에이전트가 20스텝에 걸쳐 버그를 고쳤고, 마지막에 테스트 통과로 r=1r = 1을 받았다. 20스텝 중 무엇이 잘한 것이고 무엇이 헛수고였나? 보상이 끝에 한 번만 오면, 그 점수를 스텝마다 나눠 주는 일 — 크레딧 할당(credit assignment) — 이 학습의 핵심이 된다.

역사: 이기고 지는 것만으로는 배울 정보가 모자라다

이 물음을 「크레딧 할당 문제」라는 이름으로 또렷이 적은 이른 글이 마빈 민스키(Marvin Minsky)의 1961년 글 「Steps Toward Artificial Intelligence」다. 민스키는 체스나 체커처럼 승패가 분명한 게임을 예로 들었다. 이기든 지든 한 판에는 수많은 결정이 들어 있는데, 이겼다면 그 공을 결정들 사이에 어떻게 나눌 것인가. 민스키는 앨런 뉴얼(Allen Newell)의 말을 옮겨 적었다. 한 판 전체에 붙은 「이김, 짐, 비김」만으로는 쓸 만한 시간 안에 무엇이든 배울 만큼의 정보가 있을지 극히 의심스럽고, 배우려면 한 판이 훨씬 많은 정보를 내놓아야 한다는 것이다. 민스키는 결정이 백만 개면 각자에게 백만분의 일씩 공을 나눠 줄 수 있느냐고 묻고, 결정들이 서로 거의 독립인 특별한 기계에서만 그렇게 할 수 있으며 그런 기계는 문제를 푸는 힘도 그만큼 약하다고 답했다. 끝에 한 번 성공 여부만 받는 에이전트의 20스텝 궤적이 같은 처지다.

궤적 하나에 어드밴티지 하나

아래 그림의 궤적을 보자. 핵심 기여는 9번 스텝 하나이고, 탐색 12스텝과 실수 2스텝이 섞여 있다. GRPO는 궤적 전체에 어드밴티지 하나를 주므로 핵심이 아닌 스텝도 핵심 기여와 똑같이 강화된다. 비평가(가치 함수)가 원래 들어온 이유가 바로 이것이다. 상태마다 앞으로 기대되는 보상을 알면, 한 스텝 뒤의 예측으로 지금 예측을 고친 차이로 어느 스텝이 기대를 넘었는지 가를 수 있다.

δt=rt+γ Vϕ(st+1)−Vϕ(st) \textcolor{#8e44ad}{\delta_t} = \textcolor{#d9670b}{r_t} + \textcolor{#536020}{\gamma}\, \textcolor{#00897b}{V_\phi}(\textcolor{#0093b8}{s_{t+1}}) - \textcolor{#00897b}{V_\phi}(\textcolor{#0093b8}{s_t})
δtTD 오차(시간차 오차). 양수면 스텝 t가 기대를 넘었다rt스텝 t에서 받은 보상. 끝에만 보상이 오면 마지막 스텝 말고는 0γ할인율(0과 1 사이). 한 스텝 뒤의 값을 얼마나 깎아 셀지Vϕ(st)가치 함수: 상태 st에서 앞으로 받을 보상의 예측. ϕ(파이, phi)는 그 신경망의 파라미터st스텝 t의 상태(프롬프트 + 지금까지의 관찰⋅행동) \small\begin{array}{ll} \textcolor{#8e44ad}{\delta_t} & \text{TD 오차(시간차 오차). 양수면 스텝 } t \text{가 기대를 넘었다} \\ \textcolor{#d9670b}{r_t} & \text{스텝 } t \text{에서 받은 보상. 끝에만 보상이 오면 마지막 스텝 말고는 0} \\ \textcolor{#536020}{\gamma} & \text{할인율(0과 1 사이). 한 스텝 뒤의 값을 얼마나 깎아 셀지} \\ \textcolor{#00897b}{V_\phi}(\textcolor{#0093b8}{s_t}) & \text{가치 함수: 상태 } s_t \text{에서 앞으로 받을 보상의 예측. } \phi \text{(파이, phi)는 그 신경망의 파라미터} \\ \textcolor{#0093b8}{s_t} & \text{스텝 } t \text{의 상태(프롬프트 + 지금까지의 관찰·행동)} \end{array}

중간 스텝에서는 rt=0\textcolor{#d9670b}{r_t} = 0이므로 δt\textcolor{#8e44ad}{\delta_t}는 「이 스텝 뒤에 성공 가능성의 예측이 얼마나 올랐나」가 된다. GRPO가 비평가를 버리며 포기한 것이 정확히 이 해상도다. 단일 응답에서는 싼 대가였지만 수십 턴짜리 궤적에서는 비싸진다(아래 문제 5).

크레딧 할당 문제: 20스텝 중 핵심은 어디? 1 파일 2 검색 3 검색 4 읽기 5 6 7 8 9 원인 발견 10 수정 11 12 13 14 15 16 오수정 17 18 되돌림 19 테스트 20 커밋 r = +1 · 테스트 통과 탐색·삽질 (12) 핵심 기여 (1) 후속 작업 (5) 실수 (2) GRPO: 궤적 전체에 같은 어드밴티지 → 핵심이 아닌 스텝도 똑같이 강화 가치 함수·과정 보상: 스텝마다 다른 값 → 핵심 기여만 골라 강화할 여지
ML에서: 스텝 단위 학습 신호(시그널)를 얻는 방법들

궤적 모방 + 궤적 DPO. 전문가 궤적을 모아 SFT(전문가 궤적을 그대로 따라 하는 지도 미세조정, 곧 행동 클로닝)하고, 성공 궤적과 실패 궤적을 쌍으로 DPO를 돌린다. 로보틱스의 행동 클로닝과 같은 구조라 한계도 같다 — 분포 밖(전문가 궤적에 없던 상황)에서 무너지고, 궤적 단위의 쌍비교는 거칠다. 성공 궤적에도 나쁜 스텝이 있고 실패 궤적에도 좋은 스텝이 있다.

스텝 단위의 판단을 RL로 — ACT. Agentic Critical Training(arXiv:2603.08706, 2026년 3월)은 스텝마다 전문가 행동과 모델 자신의 행동을 나란히 놓고, 모델이 어느 쪽이 나은지 판단하게 한 뒤 판단이 맞으면 보상을 준다. 미리 만든 "반성 텍스트"를 SFT로 흉내 내는 대신, 행동의 질을 따지는 추론 자체를 RL로 기른다는 것이다. 모방 학습 대비 평균 5.07점, 일반 RL 대비 4.62점 향상을 보고했다. 남의 답을 흉내 내는 SFT만으로는 판단력이 길러지지 않는다는 문제가 에이전트 스텝 단위로 다시 나타난 셈이다.

검증 가능한 에이전트 태스크에 RL. 코드 수정 → 테스트 실행 → 통과 여부는 이진 보상이다. 검증기로 보상을 매기는 RLVR의 에이전틱 확장이고, 크레딧 할당이 거칠다는 문제는 그대로 남는다.

문제 5 — 성공 궤적 안의 삽질

위 그림의 20스텝 궤적이 성공(r=1\textcolor{#d9670b}{r} = 1)했고, 같은 태스크의 다른 세 궤적은 실패(r=0\textcolor{#d9670b}{r} = 0)했다. GRPO(평균·표준편차 정규화)의 어드밴티지는 얼마이며, 이 성공 궤적에서 “쓸모없거나 해로웠던” 스텝 중 몇 개가 강화되는가?

김민준 (평상)
김민준
보상 [1, 0, 0, 0]이면 평균 0.25, 표준편차 0.433. 성공 궤적은 (1 − 0.25)/0.433 ≈ +1.73이에요. 그림의 탐색 12스텝과 실수 2스텝, 14스텝이 전부 +1.73으로 강화되고요.
이서연 (의심)
이서연
그래도 괜찮지 않아? 삽질 스텝이 성공과 무관하다면 실패 궤적에도 비슷하게 나올 거고, 거기선 −로 눌리잖아. 결과와 무관한 행동은 기대값으로 상쇄된다고 배웠잖아.
선생님 (질문)
선생님
서연 학생, 그 "기대값으로"는 궤적을 몇 개 모았을 때 성립하죠? 여기 궤적은 몇 개예요?
이서연 (생각)
이서연
무한히 많을 때요. 여기선 네 개뿐이고, 실패한 세 궤적이 성공 궤적과 똑같은 삽질을 했을 리도 없고요.
이서연 (깨달음)
이서연
한 번의 업데이트에서는 상쇄가 안 되고, 그 차이가 분산으로 남네요. 무관한 스텝이 많을수록 분산이 커지고요. 비평가가 스텝마다 기준을 주면 그 분산이 줄어드는 거고요.
선생님 (평상)
선생님
그래요. 틀린 말은 아니지만 "언젠가는 상쇄된다"와 "이번 업데이트에서 상쇄된다"는 달라요. 궤적이 길수록 그 간극이 커지죠.
이서연 (평상)
이서연
대수의 법칙이 "n이 충분히 크면"을 전제로 한다는 걸, 확률론 첫 시간에 배워 놓고 또 잊었네요.

정리 A^=(1−0.25)/0.433≈+1.73\hat A = (1 - 0.25)/0.433 \approx +1.73. 탐색 12스텝 + 실수 2스텝 = 14스텝(70%)이 핵심 기여와 똑같은 크기로 강화된다. 결과와 무관한 스텝은 기대값으로는 상쇄되지만, 궤적 네 개로 하는 한 번의 업데이트에서는 상쇄되지 않고 분산으로 남는다. 궤적이 길수록 커지는 이 분산을 줄이는 것이 스텝별 가치의 역할이다.