자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 평균이 가장 높은 하나만 후보로 봄 | 1 | 후보는 누구에게도 모든 기준에서 밀리지 않는 것 모두다. 평균은 기준마다의 비중을 미리 정한 것이다 |
| 다른 점들을 이은 선 아래에 있으면 지배당했다고 봄 | 2 | 지배는 실제로 있는 응답과만 견준다. 두 응답을 이은 선 위의 점은 응답이 아니다 |
| 한 축이 같으면 지배가 아니라고 봄 | 2 | 지배는 "모든 차원에서 같거나 낫고, 적어도 하나에서 낫다"다. 같은 축이 있어도 된다 |
| 비중이 큰 축의 1등이 가중합에서 뽑힌다고 봄 | 3 | 축마다 차이에 비중을 곱해 더한 값끼리 겨룬다 |
| 점들이 놓인 모양이 대칭이라고 보고 계산 없이 답을 냄 | 4 | 가중합이 고르는 점은 실제 좌표로 계산해야 한다. 답이 맞아도 이유가 틀릴 수 있다 |
| 파레토 최적이면 어떤 가중치에서는 뽑힌다고 봄 | 5 | 가중합은 프론티어 가운데 볼록 껍질에 걸린 점만 고른다. 오목하게 들어간 곳의 타협안은 뽑히지 않는다 |
| 섞은 점수가 높으면 더 좋은 것이라고 봄 | 6 | 섞은 점수는 어느 항목에서 왔는지 보지 않는다. 늘리기 쉬운 항목에서 점수를 벌 수 있다 |
| 가중치를 고치면 해킹이 사라진다고 봄 | 7 | 가중치를 바꾸면 해킹은 자리를 옮긴다. 차원별 제약, 항목별 평가, 검증기가 필요하다 |
| 최솟값을 보상으로 쓰면 해킹이 없다고 봄 | 7 | 최솟값은 가장 약한 축 하나만 보고 나머지 차이를 버린다. 이것도 못 보는 방향이 있다 |
요약
좋은 응답은 여러 면에서 좋고, 차원마다 이기는 쪽이 다르면 "최고의 응답"은 하나로 정해지지 않는다. 다른 실제 응답에 모든 차원에서 같거나 밀리고 적어도 하나에서 밀리는 응답은 지배당한 것이고, 지배당하지 않는 응답들의 경계가 파레토 프론티어다. 프론티어 위의 어디에 설지는 가중치가 정한다. 프리트레인이 프론티어의 위치를 정하고, RL은 대개 그 위에서 자리를 옮긴다. 정책 그래디언트에는 숫자 하나가 필요해 흔히 가중합을 쓰지만, 가중합은 볼록 껍질 위의 점만 고를 수 있어 오목한 곳의 타협안을 놓친다. 더 근본적으로, 벡터를 스칼라로 줄이는 어떤 식이든 그 식이 못 보는 방향이 생기고 최적화는 그쪽으로 간다. 그래서 차원별로 평가하는 기준표, 차원별 제약, 검증기로 옮겨 가는 흐름이 생겼다.