자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 결과를 확정한 마지막 단계가 가장 크게 기여했다고 봄 | 1 | 기여는 예상(가치)이 얼마나 바뀌었나로 잰다. 마지막 단계는 이미 높던 예상을 확정했을 뿐일 수 있다 |
| 한 경로의 증분이나 반반으로 갈리는 자리를 보고 결말을 정한 자리를 판단 | 2 | 결말을 정한 몫은 모든 경로에 걸친 |
| 결과를 기다린 오차가 언제나 더 믿을 만하다고 봄 | 3 | 결과를 기다리면 그 뒤의 운이 모두 섞인다(분산). 다음 예측을 믿으면 다음 예측의 버릇이 섞인다(치우침) |
| 모델 밖의 무작위가 끼어도 |
4 | 고른 토큰이 다음 상태를 정할 때만 그렇다. 사용자·도구가 끼면 |
| 종료 상태의 가치 |
5 | 끝난 응답은 |
| 학습 메모리를 파라미터 크기(fp16 2바이트)로만 셈 | 6 | 혼합 정밀도 Adam은 파라미터당 약 16바이트(파라미터 값·그래디언트·옵티마이저 상태) |
| 5% 쿠폰 20장이면 100% 깎인다고 봄 | 7 | 할인은 곱해진다. |
| 억울한 토큰의 개수로 치우침을 판단 | 8 | 오류가 행동에 붙으면 치우침, 상태에 붙으면 분산만 는다 |
| 8 | 치우침은 |
요약
REINFORCE는 응답 전체에 숫자 하나를 주므로 좋은 수와 나쁜 수가 함께 벌을 받는다. 가치함수