* Interpretability Analysis of Arithmetic In-Context Learning in Large Language Models (EMNLP 2025)

이 논문은 “LLM이 arithmetic ICL(In-Context Learning)을 할 때 실제로 무엇을 배우는가?” 를 mechanistic interpretability 관점에서 분석한 연구입니다. 특히 기존 연구가 주로 2-operand arithmetic (a+b) 를 분석한 반면, 본 논문은 3-operand arithmetic (a+b+c) 를 대상으로 합니다.  

논문의 핵심 결론은 다음 한 문장으로 요약됩니다.

LLM은 ICE(In-Context Example)의 산술적 정답을 배우기보다는 ICE의 패턴(format, structure) 을 학습하여 문제를 푸는 경향이 있다.  


1. 연구 질문

예를 들어 다음과 같은 prompt가 있다고 하자.

1 + 3 + 4 = 8
2 + 2 + 6 =

왜 두 번째 문제를 맞출 수 있을까?

가능한 가설은 두 가지이다.

가설 1: Arithmetic Transfer

모델이

1+3+4=8

의 계산 과정을 이해하고

그 arithmetic knowledge를 두 번째 문제에 활용한다.

가설 2: Pattern Transfer

모델은

a+b+c=d

라는 패턴만 학습한다.

입력 → 결과

형태의 포맷을 보고 arithmetic mode가 활성화된다.

논문은 이 둘 중 어느 쪽이 실제 mechanism인지 분석한다.  


2. 데이터셋 구축

Arithmetic-20

숫자를 모두 single token으로 만들기 위해

0~20

범위만 사용한다.

예시:

1 + 3 + 4 = 8
2 + 2 + 6 =

또는

one + three + four = eight

형태.


Prompt 종류

p1 (one-shot)

1+3+4=8
2+2+6=

p0 (zero-shot)

2+2+6=

데이터는

p1에서는 맞고 p0에서는 틀리는 샘플만 선택

한다.

즉,

ICE 때문에 성능 향상이 발생한 사례

만 남긴다.  


3. 전체 분석 프레임워크

논문은 네 가지 MI(Mechanistic Interpretability) 기법을 결합한다.

  1. Activation Patching
  2. Information Flow Routes
  3. Automated Circuit Discovery
  4. Function Vector
  5. Logit Lens

이를 통해

ICE
 ↓
어떤 layer
 ↓
어떤 neuron/head
 ↓
Task answer

로 정보가 전달되는지 분석한다.  


4. Activation Patching

논문의 핵심 방법론이다.

Step 1

ICE가 있는 prompt 실행

1+3+4=8
2+2+6=

특정 위치의 activation 저장

mt(k),at(k)m_t^{(k)}, a_t^{(k)}


Step 2

ICE 없는 prompt 실행

2+2+6=

Step 3

저장한 activation 삽입

mt(k)m_t^{(k)} 또는 at(k)a_t^{(k)}를 강제로 복사한다.


Step 4

정답 logit이 얼마나 증가하는지 측정

Patching Effect:

PE=LDp0(r,r~)LDp0(r,r~)PE = LD_{p_0^*}(r,\tilde r)-LD_{p_0}(r,\tilde r)

여기서

LD(r,r~)=l(r)l(r~)LD(r,\tilde r)=l(r)-l(\tilde r)

이다.  

PE가 크면 해당 activation이 정답 생성에 중요하다는 뜻이다.


5. Experiment 1: Information Flow Analysis

Residual Stream Patching

모든 token 위치와 layer를 patching.

결과:

ICE Result Token

1+3+4=8
        ↑

의 activation이 가장 중요.

초기 layer에서 매우 큰 PE가 관측된다.  


이후 정보 이동

ICE result token

middle layer

Task “=” token

답 생성.

즉,

ICE Result
    ↓
Task Equal Sign
    ↓
Answer

경로가 핵심 회로다.  


6. Experiment 2: MLP vs Attention

MLP patching

가장 큰 효과:

Layer 1 MLP
+
ICE Result Token

PE ≈ 3.16


Attention patching

효과는 훨씬 작다.

주로

Layer 2

부근에서만 나타남.  


해석

초기 MLP가

ICE의 의미를 encoding하고

Attention은 routing 역할을 수행한다.

논문의 회로 관점:

MLP = information encoding

Attention = information transport

7. 가장 중요한 실험: Symbol vs Pattern

논문의 핵심.


Exp 3

ICE 정답을 틀리게 바꿈.

원래:

1+3+4=8

변형:

1+3+4=15

format은 유지.


결과

정확도

100%
→ 37.4%

PE 감소.  


산술적 correctness는 중요하다.

하지만 아직 끝이 아니다.


Exp 4

정답은 맞지만 format을 깨뜨림.

1+3+4=8

1+3+4=eight

결과

Accuracy = 30.6%

Exp 3보다 더 나빠진다.  


즉, 정답 여부보다 포맷 일관성이 더 중요하다는 의미.


Exp 5

둘 다 깨뜨림.

1+3+4=fifteen

Accuracy

29.2%

더 극단적으로

1+3+4=beta

처럼 랜덤 심볼 사용.


결과

Accuracy = 0%

왜 중요한가?

Min et al.(2022)

“Demonstration labels are not important”

결론을 arithmetic 영역에서 mechanistic하게 재확인한 셈이다.


8. Operand는 얼마나 중요한가?

Exp 6

1+3+4=8

alpha+house+x=8

결과

Accuracy = 69.4%

의외로 많이 유지된다.

즉, Operand symbol 자체는 크게 중요하지 않다.


9. Function Vector 분석

여기가 논문의 가장 흥미로운 부분이다.


논문의 가설:

ICE가 전달하는 것은

Arithmetic fact가 아니라
Arithmetic pattern이다.

그러면

ICE 전체를 넣지 말고

패턴만 추출한 vector를 넣어도

성능이 올라야 한다.


FV 생성

ICE prompt들을 여러 개 모음.

특정 attention head 출력 평균

Top-k head 선택

Function Vector 생성


결과

Pythia-12B

Zero-shot

48.6%

FV 삽입

64.3%

One-shot과 거의 동일.  


Llama-3.1-8B

30%
→ 55%

One-shot은

76.7%

하나의 vector만으로도

ICE 대부분의 효과를 복원.


이는

ICE = task-specific arithmetic hint

보다는

ICE = arithmetic mode trigger

에 가깝다는 증거다.


10. Partial Sum 분석 (가장 해석학적으로 흥미로운 결과)

논문은 Logit Lens를 사용한다.

예:

a+b+c=d

에서

다음 중간 결과를 probe.

a+b
b+c
a+b+c

질문

ICE 내부에서

1+3+4=8

을 처리할 때

정말 partial sum을 계산하는가?


결과

partial sum representation은

주로

=

token 주변의 후반 layer에서 나타남.  


반면 Information Flow 분석에서는

ICE result token
→
Task "=" token

으로 정보가 거의 바로 전달된다.


ICE 내부에서
partial sum 계산
→ 전달

이 아니다.


논문 해석:

ICE는 arithmetic content를 전달하지 않는다.

ICE structure를 전달한다.

논문의 최종 결론

저자들은 다음 메커니즘을 제안한다.

ICE 입력
   ↓
초기 MLP가 패턴 추출
   ↓
Attention이 전달
   ↓
Task "=" 토큰에 주입
   ↓
후반 layer에서 실제 계산
   ↓
정답 생성

즉,

ICE는 계산 방법을 알려주는 것이 아니라

"지금은 arithmetic task를 수행해야 한다"

라는 고수준 패턴 신호를 제공한다.

논문의 Automated Circuit Discovery (ACD) 부분은 본문에서는 간략히 언급되고, 자세한 내용은 Appendix J에 있습니다. 하지만 본문의 실험 결과와 저자들의 설명을 종합하면, 이 논문에서 ACD는 “ICE result token → Task ‘=’ token” 경로를 구성하는 실제 circuit을 자동으로 찾는 역할을 수행합니다.  


1. 왜 ACD를 사용하는가?

앞선 실험에서 이미 다음 사실이 밝혀졌습니다.

Activation Patching

ICE Result
    ↓
Early MLP
    ↓
Task "="
    ↓
Answer

경로가 중요함.


문제점

Activation patching은

Layer 1 MLP 중요
Layer 2 Attention 중요

정도만 알려준다.

하지만

어떤 MLP
↓
어떤 Head
↓
어떤 Head
↓
어떤 MLP

가 연결되어 있는지는 알려주지 못한다.

즉,

Component importance는 알 수 있지만
Circuit structure는 알 수 없다.

그래서 ACD를 사용한다.


2. Automated Circuit Discovery (Conmy et al., 2023)

기본 아이디어는 Transformer를 그래프로 보는 것이다.


노드

각 Transformer component

Attention Head
MLP
Residual Stream

예시

L1H3
L1H7
L2MLP
L5H12

Edge

정보 전달 경로

L1H3
   ↓
L2MLP

같은 연결


결국 Transformer = Directed Graph로 본다.


3. Edge Attribution Patching (EAP)

이 논문은 Syed et al. (2023)의

Edge Attribution Patching(EAP)

기반으로 circuit을 찾는다.  


기존 activation patching은 Node 단위이다.

예:

Layer 1 MLP

전체를 patch


EAP는 Edge 단위이다.

예:

Layer1 MLP
    ↓
Layer2 Head5

만 평가


그래서 중요한 연결을 찾을 수 있다.


4. EAP 수식

Forward pass 중

어떤 downstream node v

activation: ava_v


upstream node u

activation: aua_u


정답 logit: L


Edge 중요도:

Score(uv)=LavΔauScore(u \rightarrow v)=\frac{\partial L}{\partial a_v}\cdot\Delta a_u


즉, gradient × activation difference 이다.


직관적으로는 “이 edge를 제거하면 정답이 얼마나 변하는가?”를 근사한다.


5. 이 논문에서의 사용 목적

저자들은 이미

Exp.1에서

ICE Result
↓
Task "="

정보 흐름을 관찰했다.


하지만, 그 중간에

어떤 head
어떤 MLP

가 실제로 관여하는지는 모른다.


ACD는 이 경로를 자동 추출한다.


결과적으로 발견된 구조는

ICE Operand
   ↓
Early MLP
   ↓
ICE Result
   ↓
Attention Heads
   ↓
Task "="
   ↓
Late MLP
   ↓
Answer

이다.

저자들은 Appendix J 결과를 요약하면서

early-layer MLP와 attention module이 핵심 회로로 반복적으로 발견된다

고 보고한다.  


6. 논문의 중요한 해석

ACD 결과는

Activation Patching과 일치한다.


Activation Patching

발견:

Layer1 MLP

PE 최대


Information Flow

발견:

ICE Result
↓
Task "="

ACD

발견:

Early MLP
+
Attention Heads

가 중심 circuit


세 방법이 같은 결론을 준다.

Early MLP
    ↓
Attention Routing
    ↓
Task "="

7. 왜 EAP를 썼는가?

사실 이 논문에서 ACD는 주요 발견을 만드는 도구라기보다

Validation 역할

에 가깝다.

논리 흐름은

Activation Patching
    ↓
Information Flow Route
    ↓
EAP Circuit Discovery

이다.


즉, “우리가 patching으로 찾은 경로가 실제 circuit인가?”를 확인하는 용도.



게시됨

카테고리

, ,

작성자

댓글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다