핵심 요약 (1-2줄): 미국 프린스턴 대학 연구자가, AI가 답만 외우는 상태에서 새 문제를 푸는 이해로 넘어가는 시각을 정하는 공식을 찾았습니다. 데이터를 늘리는 편이 모형을 키우는 것보다 여덟 배 강한 지렛대였습니다.

​

​

이게 뭐예요?

답만 외우던 친구

신경망(두뇌를 흉내 내어 배우는 계산기)에 나머지 계산 문제를 냈습니다.

답을 어떤 수로 나눈 나머지로 내놓는 덧셈과 나눗셈 문제입니다.

처음에는 보던 문제의 답만 통째로 외워 만점을 만듭니다.

​

그런데 계속 훈련하다 보면, 어느 순간 새 문제도 풀어냅니다.

일반화(외운 것 말고 새 문제도 풀어내는 것)입니다.

이 늦고 갑작스러운 전환이 그로킹(한참 답만 외우다가 갑자기 원리를 익히는 현상)입니다.

2022년에 처음 발견된 현상이고, 전환까지의 간격은 설정에 따라 천 배 가까이 벌어집니다.

​

384가지 조합의 큰 실험

하이퍼파라미터(훈련 전에 정해 두는 설정값)를 넓게 훑었습니다.

문제는 나머지 덧셈과 나눗셈 두 종류입니다.

모형 크기는 세 단계, 다른 설정은 각각 네 단계입니다.

도합 384가지 조합을 모두 훈련했습니다.

356개가 완주했고, 297개가 그로킹에 성공했습니다.

​

각 조합마다 두 시각을 재었습니다.

외움 완성은 보던 문제를 99% 넘기는 순간입니다.

이해 도달은 새 문제를 95% 넘기는 순간입니다.

​

발견한 큰 공식

이해 도달 시각은 네 설정값의 거듭제곱으로 잘 맞았습니다.

설명력은 100점 만점에 73점이었습니다.

가장 큰 손잡이는 데이터 양이었습니다(지수 −2.04).

모형 크기의 지수는 −0.27에 불과했습니다.

차이는 약 여덟 배입니다.

데이터를 두 배 늘리면 이해가 약 4배 빨라집니다.

크기를 두 배 늘리면 겨우 1.2배 빨라집니다.

학습 속도(−0.50)와 답안 벌점(−0.64)이 그 사이에 섭니다.

지수는 문제가 바뀌어도 거의 그대로였습니다.

​

벌점의 문턱

가중치 감쇠(모형 안의 연결 세기를 점점 줄여 주는 훈련 규칙)에는 관문이 있습니다.

벌점이 1.0 이상이면 거의 모든 조합이 그로킹합니다.

벌점이 0.1이면 60%도 넘지 못합니다.

전환은 완만하지 않고, 3배 범위에서 뚝 갈라집니다.

​

외운 답안은 푹신한 소파 같아, 벌점이 약하면 도무지 일어나지 않습니다.

벌점이 세지면 소파가 불편해져, 깔끔한 풀이로 자리를 옮깁니다.

벌점을 키우면 낭비되는 시간도 열 배 이상 줄어듭니다.

​

가벼워지는 배낭

전환 동안 모형의 무게, 즉 힘의 총량이 꾸준히 줄어듭니다.

이해 시점의 무게는 외움 시점의 평균 42%였습니다.

절대 무게는 예측에 도움이 없고, 줄어드는 속도가 예측합니다.

두꺼운 답안지 다발을 정리해 얇은 규칙책으로 바꾸는 셈입니다.

​

​

왜 중요한가요?

기존 연구는 전환에서 '무엇이' 일어나는지를 밝혔습니다.

이번 연구는 '언제' 일어나는지를 처음 수치로 예측합니다.

'큰 모형이 빨리 일반화한다'는 통념을 뒤집었습니다.

​

이해를 앞당기는 더 저렴한 지렛대는 데이터입니다.

설정만 보고 빠를지 느릴지 미리 가늠할 수 있습니다.

이미지 생성 AI의 암기 문제에도 같은 틀을 써 볼 수 있습니다.

검증 가능한 예측 세 개를 남겼습니다.

​

​

실제 예시

이번에 짚어볼 발견은, "이해로 넘어가는 시각은 모형의 크기보다 데이터 양이 좌우한다"는 점입니다.

​

시험 준비를 하는 두 가지 방법을 비교해 봅시다. 문제를 두 배 많이 풀어 보면, 풀이 원리를 4배 빨리 알아차립니다. 반면 답을 적어 두는 노트를 두 배 두껍게 만들면, 겨우 조금 빨라집니다. 노트가 두꺼우면 외우기는 편하지만, 원리 알아차림에는 별 도움이 없습니다. 연구의 모형도 똑같았습니다. 데이터를 늘리는 편이 크기를 키우는 것보다 여덟 배 강한 지렛대였습니다.

​

여기서 '더 많은 문제'는 데이터 양에 해당합니다. '두꺼운 답안 노트'는 모형의 크기에 해당합니다. '원리를 알아차리는 시각'은 이해 도달 시각에 해당합니다.

​

​

아직 남은 숙제

공식은 작은 신경망과 모듈러 산술에서 나왔습니다.

큰 언어 모형에서 같은 지수가 나올지는 아직 미지수입니다.

모형 크기의 지수는 세 단계뿐에서 추정했습니다.

공식이 설명 못 하는 27%의 흔들림이 남아 있습니다.

경계 근처에서는 초기값 운이 개입해 흔들림이 18%까지 커집니다.

관문의 존재는 관측일 뿐, 원리에서 유도된 것은 아닙니다.

​

​

정리하면

AI가 진짜 이해로 넘어가는 시각은 모형의 크기가 아니라, 데이터와 벌점이 정합니다.


원본: "Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking", 국제 기계학습 학회(ICML 2026, 서울) 게재, 2026https://arxiv.org/abs/2609.10657

관련 논문:

A. Kataria, "Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking", ICML 2026 학회지(PMLR 306), 2026 — 본 요약의 원문

A. Power 등 5인, "Grokking: Generalization beyond overfitting on small algorithmic datasets", ICML 수학적 딥러닝 워크숍, 2022 — 그로킹을 처음 발견한 논문

N. Nanda 등 5인, "Progress measures for grokking via mechanistic interpretability", ICLR, 2023 — 전환의 내부 원리를 밝힌 논문

Z. Liu, E. J. Michaud, M. Tegmark, "Omnigrok: Grokking beyond algorithmic data", ICLR, 2023 — 무게 압축 메커니즘을 제안한 논문


출처) https://cafe.naver.com/ingsfriends/217514