답만 외우던 AI가 이해로 넘어가는 순간, 공식으로 예측하다
핵심 요약 (1-2줄): 미국 프린스턴 대학 연구자가, AI가 답만 외우는 상태에서 새 문제를 푸는 이해로 넘어가는 시각을 정하는 공식을 찾았습니다. 데이터를 늘리는 편이 모형을 키우는 것보다 여덟 배 강한 지렛대였습니다.
이게 뭐예요?
답만 외우던 친구
신경망(두뇌를 흉내 내어 배우는 계산기)에 나머지 계산 문제를 냈습니다.
답을 어떤 수로 나눈 나머지로 내놓는 덧셈과 나눗셈 문제입니다.
처음에는 보던 문제의 답만 통째로 외워 만점을 만듭니다.
그런데 계속 훈련하다 보면, 어느 순간 새 문제도 풀어냅니다.
일반화(외운 것 말고 새 문제도 풀어내는 것)입니다.
이 늦고 갑작스러운 전환이 그로킹(한참 답만 외우다가 갑자기 원리를 익히는 현상)입니다.
2022년에 처음 발견된 현상이고, 전환까지의 간격은 설정에 따라 천 배 가까이 벌어집니다.
384가지 조합의 큰 실험
하이퍼파라미터(훈련 전에 정해 두는 설정값)를 넓게 훑었습니다.
문제는 나머지 덧셈과 나눗셈 두 종류입니다.
모형 크기는 세 단계, 다른 설정은 각각 네 단계입니다.
도합 384가지 조합을 모두 훈련했습니다.
356개가 완주했고, 297개가 그로킹에 성공했습니다.
각 조합마다 두 시각을 재었습니다.
외움 완성은 보던 문제를 99% 넘기는 순간입니다.
이해 도달은 새 문제를 95% 넘기는 순간입니다.
발견한 큰 공식
이해 도달 시각은 네 설정값의 거듭제곱으로 잘 맞았습니다.
설명력은 100점 만점에 73점이었습니다.
가장 큰 손잡이는 데이터 양이었습니다(지수 −2.04).
모형 크기의 지수는 −0.27에 불과했습니다.
차이는 약 여덟 배입니다.
데이터를 두 배 늘리면 이해가 약 4배 빨라집니다.
크기를 두 배 늘리면 겨우 1.2배 빨라집니다.
학습 속도(−0.50)와 답안 벌점(−0.64)이 그 사이에 섭니다.
지수는 문제가 바뀌어도 거의 그대로였습니다.
벌점의 문턱
가중치 감쇠(모형 안의 연결 세기를 점점 줄여 주는 훈련 규칙)에는 관문이 있습니다.
벌점이 1.0 이상이면 거의 모든 조합이 그로킹합니다.
벌점이 0.1이면 60%도 넘지 못합니다.
전환은 완만하지 않고, 3배 범위에서 뚝 갈라집니다.
외운 답안은 푹신한 소파 같아, 벌점이 약하면 도무지 일어나지 않습니다.
벌점이 세지면 소파가 불편해져, 깔끔한 풀이로 자리를 옮깁니다.
벌점을 키우면 낭비되는 시간도 열 배 이상 줄어듭니다.
가벼워지는 배낭
전환 동안 모형의 무게, 즉 힘의 총량이 꾸준히 줄어듭니다.
이해 시점의 무게는 외움 시점의 평균 42%였습니다.
절대 무게는 예측에 도움이 없고, 줄어드는 속도가 예측합니다.
두꺼운 답안지 다발을 정리해 얇은 규칙책으로 바꾸는 셈입니다.
왜 중요한가요?
기존 연구는 전환에서 '무엇이' 일어나는지를 밝혔습니다.
이번 연구는 '언제' 일어나는지를 처음 수치로 예측합니다.
'큰 모형이 빨리 일반화한다'는 통념을 뒤집었습니다.
이해를 앞당기는 더 저렴한 지렛대는 데이터입니다.
설정만 보고 빠를지 느릴지 미리 가늠할 수 있습니다.
이미지 생성 AI의 암기 문제에도 같은 틀을 써 볼 수 있습니다.
검증 가능한 예측 세 개를 남겼습니다.
실제 예시
이번에 짚어볼 발견은, "이해로 넘어가는 시각은 모형의 크기보다 데이터 양이 좌우한다"는 점입니다.
시험 준비를 하는 두 가지 방법을 비교해 봅시다. 문제를 두 배 많이 풀어 보면, 풀이 원리를 4배 빨리 알아차립니다. 반면 답을 적어 두는 노트를 두 배 두껍게 만들면, 겨우 조금 빨라집니다. 노트가 두꺼우면 외우기는 편하지만, 원리 알아차림에는 별 도움이 없습니다. 연구의 모형도 똑같았습니다. 데이터를 늘리는 편이 크기를 키우는 것보다 여덟 배 강한 지렛대였습니다.
여기서 '더 많은 문제'는 데이터 양에 해당합니다. '두꺼운 답안 노트'는 모형의 크기에 해당합니다. '원리를 알아차리는 시각'은 이해 도달 시각에 해당합니다.
아직 남은 숙제
공식은 작은 신경망과 모듈러 산술에서 나왔습니다.
큰 언어 모형에서 같은 지수가 나올지는 아직 미지수입니다.
모형 크기의 지수는 세 단계뿐에서 추정했습니다.
공식이 설명 못 하는 27%의 흔들림이 남아 있습니다.
경계 근처에서는 초기값 운이 개입해 흔들림이 18%까지 커집니다.
관문의 존재는 관측일 뿐, 원리에서 유도된 것은 아닙니다.
정리하면
AI가 진짜 이해로 넘어가는 시각은 모형의 크기가 아니라, 데이터와 벌점이 정합니다.
원본: "Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking", 국제 기계학습 학회(ICML 2026, 서울) 게재, 2026https://arxiv.org/abs/2609.10657
관련 논문:
A. Kataria, "Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking", ICML 2026 학회지(PMLR 306), 2026 — 본 요약의 원문
A. Power 등 5인, "Grokking: Generalization beyond overfitting on small algorithmic datasets", ICML 수학적 딥러닝 워크숍, 2022 — 그로킹을 처음 발견한 논문
N. Nanda 등 5인, "Progress measures for grokking via mechanistic interpretability", ICLR, 2023 — 전환의 내부 원리를 밝힌 논문
Z. Liu, E. J. Michaud, M. Tegmark, "Omnigrok: Grokking beyond algorithmic data", ICLR, 2023 — 무게 압축 메커니즘을 제안한 논문

댓글 4