이 논문은 “LLM이 arithmetic ICL(In-Context Learning)을 할 때 실제로 무엇을 배우는가?” 를 mechanistic interpretability 관점에서 분석한 연구입니다. 특히 기존 연구가 주로 2-operand arithmetic (a+b) 를 분석한 반면, 본 논문은 3-operand arithmetic (a+b+c) 를 대상으로 합니다.
논문의 핵심 결론은 다음 한 문장으로 요약됩니다.
LLM은 ICE(In-Context Example)의 산술적 정답을 배우기보다는 ICE의 패턴(format, structure) 을 학습하여 문제를 푸는 경향이 있다.
1. 연구 질문
예를 들어 다음과 같은 prompt가 있다고 하자.
1 + 3 + 4 = 8
2 + 2 + 6 =
왜 두 번째 문제를 맞출 수 있을까?
가능한 가설은 두 가지이다.
가설 1: Arithmetic Transfer
모델이
1+3+4=8
의 계산 과정을 이해하고
그 arithmetic knowledge를 두 번째 문제에 활용한다.
가설 2: Pattern Transfer
모델은
a+b+c=d
라는 패턴만 학습한다.
즉
입력 → 결과
형태의 포맷을 보고 arithmetic mode가 활성화된다.
논문은 이 둘 중 어느 쪽이 실제 mechanism인지 분석한다.
2. 데이터셋 구축
Arithmetic-20
숫자를 모두 single token으로 만들기 위해
0~20
범위만 사용한다.
예시:
1 + 3 + 4 = 8
2 + 2 + 6 =
또는
one + three + four = eight
형태.
Prompt 종류
p1 (one-shot)
1+3+4=8
2+2+6=
p0 (zero-shot)
2+2+6=
데이터는
p1에서는 맞고 p0에서는 틀리는 샘플만 선택
한다.
즉,
ICE 때문에 성능 향상이 발생한 사례
만 남긴다.
3. 전체 분석 프레임워크
논문은 네 가지 MI(Mechanistic Interpretability) 기법을 결합한다.
- Activation Patching
- Information Flow Routes
- Automated Circuit Discovery
- Function Vector
- Logit Lens
이를 통해
ICE
↓
어떤 layer
↓
어떤 neuron/head
↓
Task answer
로 정보가 전달되는지 분석한다.
4. Activation Patching
논문의 핵심 방법론이다.
Step 1
ICE가 있는 prompt 실행
1+3+4=8
2+2+6=
특정 위치의 activation 저장
Step 2
ICE 없는 prompt 실행
2+2+6=
Step 3
저장한 activation 삽입
또는 를 강제로 복사한다.
Step 4
정답 logit이 얼마나 증가하는지 측정
Patching Effect:
여기서
이다.
PE가 크면 해당 activation이 정답 생성에 중요하다는 뜻이다.
5. Experiment 1: Information Flow Analysis
Residual Stream Patching
모든 token 위치와 layer를 patching.
결과:
ICE Result Token
1+3+4=8
↑
의 activation이 가장 중요.
초기 layer에서 매우 큰 PE가 관측된다.
이후 정보 이동
ICE result token
↓
middle layer
↓
Task “=” token
↓
답 생성.
즉,
ICE Result
↓
Task Equal Sign
↓
Answer
경로가 핵심 회로다.
6. Experiment 2: MLP vs Attention
MLP patching
가장 큰 효과:
Layer 1 MLP
+
ICE Result Token
PE ≈ 3.16
Attention patching
효과는 훨씬 작다.
주로
Layer 2
부근에서만 나타남.
해석
초기 MLP가
ICE의 의미를 encoding하고
Attention은 routing 역할을 수행한다.
논문의 회로 관점:
MLP = information encoding
Attention = information transport
7. 가장 중요한 실험: Symbol vs Pattern
논문의 핵심.
Exp 3
ICE 정답을 틀리게 바꿈.
원래:
1+3+4=8
변형:
1+3+4=15
format은 유지.
결과
정확도
100%
→ 37.4%
PE 감소.
산술적 correctness는 중요하다.
하지만 아직 끝이 아니다.
Exp 4
정답은 맞지만 format을 깨뜨림.
1+3+4=8
↓
1+3+4=eight
결과
Accuracy = 30.6%
Exp 3보다 더 나빠진다.
즉, 정답 여부보다 포맷 일관성이 더 중요하다는 의미.
Exp 5
둘 다 깨뜨림.
1+3+4=fifteen
Accuracy
29.2%
더 극단적으로
1+3+4=beta
처럼 랜덤 심볼 사용.
결과
Accuracy = 0%
왜 중요한가?
Min et al.(2022)
“Demonstration labels are not important”
결론을 arithmetic 영역에서 mechanistic하게 재확인한 셈이다.
8. Operand는 얼마나 중요한가?
Exp 6
1+3+4=8
↓
alpha+house+x=8
결과
Accuracy = 69.4%
의외로 많이 유지된다.
즉, Operand symbol 자체는 크게 중요하지 않다.
9. Function Vector 분석
여기가 논문의 가장 흥미로운 부분이다.
논문의 가설:
ICE가 전달하는 것은
Arithmetic fact가 아니라
Arithmetic pattern이다.
그러면
ICE 전체를 넣지 말고
패턴만 추출한 vector를 넣어도
성능이 올라야 한다.
FV 생성
ICE prompt들을 여러 개 모음.
↓
특정 attention head 출력 평균
↓
Top-k head 선택
↓
Function Vector 생성
결과
Pythia-12B
Zero-shot
48.6%
FV 삽입
64.3%
One-shot과 거의 동일.
Llama-3.1-8B
30%
→ 55%
One-shot은
76.7%
즉
하나의 vector만으로도
ICE 대부분의 효과를 복원.
이는
ICE = task-specific arithmetic hint
보다는
ICE = arithmetic mode trigger
에 가깝다는 증거다.
10. Partial Sum 분석 (가장 해석학적으로 흥미로운 결과)
논문은 Logit Lens를 사용한다.
예:
a+b+c=d
에서
다음 중간 결과를 probe.
a+b
b+c
a+b+c
질문
ICE 내부에서
1+3+4=8
을 처리할 때
정말 partial sum을 계산하는가?
결과
partial sum representation은
주로
=
token 주변의 후반 layer에서 나타남.
반면 Information Flow 분석에서는
ICE result token
→
Task "=" token
으로 정보가 거의 바로 전달된다.
즉
ICE 내부에서
partial sum 계산
→ 전달
이 아니다.
논문 해석:
ICE는 arithmetic content를 전달하지 않는다.
ICE structure를 전달한다.
논문의 최종 결론
저자들은 다음 메커니즘을 제안한다.
ICE 입력
↓
초기 MLP가 패턴 추출
↓
Attention이 전달
↓
Task "=" 토큰에 주입
↓
후반 layer에서 실제 계산
↓
정답 생성
즉,
ICE는 계산 방법을 알려주는 것이 아니라
"지금은 arithmetic task를 수행해야 한다"
라는 고수준 패턴 신호를 제공한다.
논문의 Automated Circuit Discovery (ACD) 부분은 본문에서는 간략히 언급되고, 자세한 내용은 Appendix J에 있습니다. 하지만 본문의 실험 결과와 저자들의 설명을 종합하면, 이 논문에서 ACD는 “ICE result token → Task ‘=’ token” 경로를 구성하는 실제 circuit을 자동으로 찾는 역할을 수행합니다.
1. 왜 ACD를 사용하는가?
앞선 실험에서 이미 다음 사실이 밝혀졌습니다.
Activation Patching
ICE Result
↓
Early MLP
↓
Task "="
↓
Answer
경로가 중요함.
문제점
Activation patching은
Layer 1 MLP 중요
Layer 2 Attention 중요
정도만 알려준다.
하지만
어떤 MLP
↓
어떤 Head
↓
어떤 Head
↓
어떤 MLP
가 연결되어 있는지는 알려주지 못한다.
즉,
Component importance는 알 수 있지만
Circuit structure는 알 수 없다.
그래서 ACD를 사용한다.
2. Automated Circuit Discovery (Conmy et al., 2023)
기본 아이디어는 Transformer를 그래프로 보는 것이다.
노드
각 Transformer component
Attention Head
MLP
Residual Stream
예시
L1H3
L1H7
L2MLP
L5H12
Edge
정보 전달 경로
L1H3
↓
L2MLP
같은 연결
결국 Transformer = Directed Graph로 본다.
3. Edge Attribution Patching (EAP)
이 논문은 Syed et al. (2023)의
Edge Attribution Patching(EAP)
기반으로 circuit을 찾는다.
기존 activation patching은 Node 단위이다.
예:
Layer 1 MLP
전체를 patch
EAP는 Edge 단위이다.
예:
Layer1 MLP
↓
Layer2 Head5
만 평가
그래서 중요한 연결을 찾을 수 있다.
4. EAP 수식
Forward pass 중
어떤 downstream node v
activation:
upstream node u
activation:
정답 logit: L
Edge 중요도:
즉, gradient × activation difference 이다.
직관적으로는 “이 edge를 제거하면 정답이 얼마나 변하는가?”를 근사한다.
5. 이 논문에서의 사용 목적
저자들은 이미
Exp.1에서
ICE Result
↓
Task "="
정보 흐름을 관찰했다.
하지만, 그 중간에
어떤 head
어떤 MLP
가 실제로 관여하는지는 모른다.
ACD는 이 경로를 자동 추출한다.
결과적으로 발견된 구조는
ICE Operand
↓
Early MLP
↓
ICE Result
↓
Attention Heads
↓
Task "="
↓
Late MLP
↓
Answer
이다.
저자들은 Appendix J 결과를 요약하면서
early-layer MLP와 attention module이 핵심 회로로 반복적으로 발견된다
고 보고한다.
6. 논문의 중요한 해석
ACD 결과는
Activation Patching과 일치한다.
Activation Patching
발견:
Layer1 MLP
PE 최대
Information Flow
발견:
ICE Result
↓
Task "="
ACD
발견:
Early MLP
+
Attention Heads
가 중심 circuit
세 방법이 같은 결론을 준다.
Early MLP
↓
Attention Routing
↓
Task "="
7. 왜 EAP를 썼는가?
사실 이 논문에서 ACD는 주요 발견을 만드는 도구라기보다
Validation 역할
에 가깝다.
논리 흐름은
Activation Patching
↓
Information Flow Route
↓
EAP Circuit Discovery
이다.
즉, “우리가 patching으로 찾은 경로가 실제 circuit인가?”를 확인하는 용도.
답글 남기기