
이 논문은 최근 LLM 해석 가능성(Mechanistic Interpretability) 연구 중에서도 상당히 독창적인 논문입니다. 기존 연구들이 attention head, MLP neuron, circuit 등을 분석했다면, 이 논문은 훨씬 근본적인 현상을 발견합니다.
LLM 내부에는 다른 activation보다 수천~수만 배 큰 activation이 극히 소수 존재하며, 이들은 단순한 이상치(outlier)가 아니라 모델 전체가 사용하는 “고정 bias” 역할을 한다.
이 논문의 가장 중요한 기여는
- Massive activation이라는 새로운 현상 발견
- 이것이 attention sink의 원인임을 설명
- 사실상 self-attention의 bias term 역할을 한다는 것을 증명
- explicit bias를 넣으면 massive activation이 사라짐을 보인 것
입니다.
1. 문제의식 (Motivation)
Transformer에는 LayerNorm이 있으므로 hidden activation은 일반적으로 일정한 범위 안에 존재할 것으로 생각해 왔습니다.
그런데 저자들이 LLaMA2 hidden state를 시각화하자 매우 이상한 현상이 발견됩니다.
예를 들면,
평균 activation 0.2인데, 특정 activation은 2500까지 올라갑니다.
즉, 2500 / 0.2 = 12500배입니다.
이런 activation은 hidden state 전체(수만 개) 중 겨우 2~4개 정도밖에 없습니다. 저자들은 이를 Massive Activation이라 부릅니다.
2. 관련 연구 (Related Work)
논문에서 비교하는 기존 연구는 크게 네 가지입니다.
(1) Outlier Features (Dettmers et al., 2022)
대표 논문: LLM.int8()
여기서는 특정 feature dimension이 항상 큰 activation을 갖는다고 보고했습니다.
예를 들어, feature 512가
token1 : 9
token2 : 7
token3 : 10
...
처럼 대부분 token에서 크게 활성화됩니다.
이것이 quantization이 어려운 이유였습니다.
Massive Activation과 차이
Outlier feature:
feature vector 전체가 큽니다.
반면, Massive activation은 (feature, token) 한 점만 큽니다.
예를 들어,
feature 1415
token = "."
만 매우 큽니다.
즉,
Outlier Feature
↓
■■■■■■■■■■■■
Massive Activation
↓
.............
....█........
.............
논문은 실제 실험에서 둘이 전혀 겹치지 않음을 보였습니다.
(2) Attention Sink
Xiao et al., 2023
이 연구는 LLM이 첫 번째 token에 attention을 과도하게 준다는 것을 발견했습니다.
하지만 왜 그런지는 설명하지 못했습니다.
이 논문은 “massive activation 때문에 attention sink가 발생한다”는 원인을 설명합니다.
(3) Register Token (ViT)
Vision Transformer에서는 register token이라는 특별 token이 존재합니다.
기존 연구는 global information 저장이라고 설명했습니다.
하지만 이 논문은 register token 역시 bias 저장소라는 새로운 해석을 제시합니다.
(4) Outlier Weight
LayerNorm weight 중 일부가 매우 크다는 연구도 있었습니다.
하지만 weight가 큰 것과 activation이 큰 것은 다른 현상입니다.
3. Massive Activation의 정의
논문은 다음과 같이 정의합니다.
Massive activation은
- 절댓값 >100
- hidden state median보다 약 1000배 이상 큼
인 activation입니다.
예시
| Model | Top activation | Median |
|---|---|---|
| LLaMA2-7B | 2622 | 0.2 |
| LLaMA2-13B | 1264 | 0.4 |
| Mixtral | 7100 | 0.3 |
즉, 2622 vs 0.2 처럼 엄청난 차이를 보입니다.
4. 방법론(Methodology)
이 논문은 새로운 학습 알고리즘을 제안하는 것이 아니라, **체계적인 분석(methodology)**을 수행합니다.
전체 분석은 다음 네 단계입니다.
① Massive activation 발견
↓
② 위치 분석
↓
③ Intervention
↓
④ Attention 분석
Step 1. Massive Activation 탐색
100개의 RedPajama 문서(각 4096 token)를 모델에 입력하고 모든 hidden state를 저장합니다. 각 layer에서 activation magnitude를 조사해 상위 activation을 추적합니다.
Step 2. 어디에서 발생하는가?
(1) Layer
놀랍게도
Layer1
↓
Layer2
↓
갑자기 등장
합니다.
LLaMA2-7B에서는 Layer2에서 갑자기 나타나 Layer30까지 거의 일정하게 유지됩니다. 마지막 몇 개 layer에서만 감소합니다.
(2) Feature dimension
항상
1415
2533
처럼 고정된 feature index에서만 발생합니다.
입력이 달라도 동일합니다.
(3) Token 위치
모델마다 차이는 있지만 대부분
- 시작 토큰
- 첫 “.” 또는 줄바꿈
- 의미가 약한 토큰(and, of 등)
에 발생합니다. 저자들은 의미 전달에 덜 중요한 토큰을 bias 저장 공간으로 재활용한다고 해석합니다.
5. Intervention 분석
이 논문의 핵심 실험입니다.
저자들은 massive activation을 직접 조작합니다.
실험 1
activation → 0
결과:
Perplexity
5.47
↓
∞
Zero-shot accuracy
68.9%
↓
36%
모델이 사실상 붕괴합니다.
실험 2
activation → 평균값(mean)
즉,
2550
↓
2557
처럼 입력마다 조금씩 다른 값을 평균 상수로 치환합니다.
결과:
성능이 거의 변하지 않습니다.
Perplexity
5.47
↓
5.47
Accuracy
68.95
↓
68.94
입니다.
결론
이 실험은 매우 강력한 인과적 증거를 제공합니다.
Massive activation은 “입력 정보 × 고정 상수”에 가깝습니다.
즉, Bias 입니다.
6. Attention 분석
논문의 두 번째 핵심입니다.
Layer2 이전에는 attention이 일반적입니다.
Layer3 이후에는
모든 token
↓
Massive activation token
으로 attention이 집중됩니다.
즉,
Attention
A
B
C
D
↓
A
A
A
A
처럼 거의 특정 토큰으로 모입니다.
왜 그런가?
Massive activation이 있는 token은 Key vector가 특이해집니다.
그러면 QKᵀ 가 항상 약간 양수가 되고,
다른 token들은 대부분 음수가 됩니다.
Softmax에서는 “0.3 vs -5″의 차이만으로도 확률이 대부분 massive activation token에 몰립니다.
7. Attention Output 분석
Attention output은
입니다.
논문은 이를
Massive token + 나머지 token
으로 분해합니다.
놀랍게도 Massive token이 주는 value update는 모든 query token에서 거의 동일합니다.
즉, bias vector처럼 작동합니다.
8. Explicit Bias 실험
가장 흥미로운 실험입니다.
논문은 Transformer attention에 추가 key, 추가 value를 넣습니다.
즉,
기존 K, V를 K + bias key, V + bias value로 확장합니다.
그러면 모델은
bias 저장
↓
token 내부
를 할 필요가 없습니다.
실험 결과, Massive activation이 거의 사라졌습니다.
성능은 동일하게 유지됩니다.
9. ViT 분석
저자들은 Vision Transformer에도 동일한 분석을 적용했습니다.
발견한 사실은 다음과 같습니다.
- CLIP ViT-L과 DINOv2 ViT-L에서는 massive activation이 존재
- MAE ViT-L에서는 관찰되지 않음
- CLIP에서 activation을 0으로 만들면 ImageNet 정확도가 크게 하락
- 평균값으로 고정하면 성능 변화가 거의 없음
즉 ViT에서도 massive activation은 고정 bias 역할을 수행합니다.
또한 DINOv2-register 모델에서는 register token이 이러한 bias를 저장하는 역할을 수행한다는 해석을 제시합니다.
10. 실험 결과 요약
| 질문 | 결과 |
|---|---|
| Massive activation은 존재하는가? | 다양한 LLM(LLaMA2, Mixtral, GPT-2, Phi-2 등)에서 관찰됨 |
| 어디에 존재하는가? | 소수의 고정 feature 차원과 시작/구분 토큰 등 의미가 약한 토큰 |
| 입력에 따라 값이 달라지는가? | 거의 일정한 상수값 |
| 0으로 제거하면? | 모델 성능이 붕괴 |
| 평균값으로 대체하면? | 성능 변화 거의 없음 |
| 역할은? | Self-attention의 implicit bias |
| Explicit bias를 넣으면? | Massive activation이 사라짐 |
| ViT에서도 존재하는가? | 일부 ViT에서 동일한 현상 확인 |
11. 논문의 의의와 한계
장점
- 기존에 알려지지 않았던 Massive Activation이라는 현상을 최초로 체계적으로 규명했습니다.
- 단순한 관찰에 그치지 않고 intervention을 통해 인과적(causal) 역할을 검증했습니다.
- Attention Sink 현상의 원인을 설명하는 메커니즘을 제시했습니다.
- Explicit attention bias 설계를 통해 해당 현상이 모델 구조의 부산물임을 실험적으로 보여주었습니다.
한계
- 왜 특정 feature 차원(예: 1415, 2533)이 선택되는지에 대한 이론적 설명은 부족합니다.
- 주로 activation 수준의 분석에 머물며, 어떤 뉴런이나 회로(circuit) 가 이러한 massive activation을 생성하는지는 규명하지 않습니다.
- Mechanistic Interpretability의 최근 흐름인 SAE feature, EAP(Edge Attribution Patching), Activation Patching, Circuit Tracing 등과의 연결은 제시되지 않았습니다.
8. Explicit Bias 실험 (Section 4.3) 자세한 설명
이 실험은 논문의 가장 중요한 검증 실험입니다.
앞에서 저자들은 다음 사실을 발견했습니다.
- Massive activation은 attention을 특정 token으로 집중시킨다.
- 그 token의 value vector는 거의 모든 query에서 동일하게 더해진다.
- 따라서 사실상 self-attention 내부의 bias처럼 동작한다.
그러면 자연스러운 질문이 생깁니다.
“Transformer에 진짜 bias를 넣어주면, massive activation을 굳이 학습할 필요가 없어지는가?”
이 질문을 검증하는 것이 Section 4.3입니다.
1. 기존 Self-Attention
Transformer의 attention은 Q,K,V를 이용하여
를 계산합니다.
여기에는 bias token이 없습니다.
즉,
Sentence
A
B
C
D
↓
Key
Value
↓
Attention
모든 key/value는 반드시 실제 입력 token에서 만들어집니다.
2. 논문의 가설
논문의 해석은 다음과 같습니다.
LLM은 Bias가 필요하다
↓
Bias를 저장할 장소가 없다
↓
의미가 거의 없는 token에 Bias를 저장한다.
↓
Massive activation 발생
즉, Massive activation은 설계상 없는 bias를 우회적으로 구현한 것이라는 것입니다.
3. 제안하는 Explicit Bias
그러면 bias token을 직접 추가하면 됩니다.
저자들은 각 attention head마다 새로운 k’와 v’를 학습시킵니다.
이 둘은 실제 token이 아닙니다.
학습 가능한 parameter입니다.
기존
Key
K
=
k1
k2
k3
...
kT
Value
V
=
v1
v2
v3
...
vT
제안
Key
K'
=
k1
k2
...
kT
k_bias
Value
V'
=
v1
v2
...
vT
v_bias
즉, 맨 뒤에 bias key와 bias value를 하나 추가합니다.
논문의 식(Equation 3)은 다음과 같습니다.
입니다.
4. 이것이 의미하는 것
예를 들어
원래 token이
The
cat
sat
.
이라면
기존 attention은
The
cat
sat
.
사이에서만 attention합니다.
새 attention은
The
cat
sat
.
BIAS
라는 보이지 않는 token이 하나 더 생긴 것과 같습니다.
단, 이 bias token은
- position embedding 없음
- vocabulary 없음
그냥 학습 가능한 key, 학습 가능한 value입니다.
5. 왜 이것이 Bias가 되는가?
Attention output은 입니다.
여기에 bias value v’ 가 추가되면 가 됩니다.
여기서 v’ 는 모든 입력에서 동일합니다.
즉,
Attention output
=
원래 output
+
항상 같은 vector
가 됩니다.
이것이
Linear layer의 Wx+b 에서 +b 와 동일한 역할입니다.
6. 기존 Massive Activation과 비교
원래 LLM은
token
↓
massive activation 생성
↓
attention 집중
↓
value vector
↓
bias 생성
을 수행했습니다.
새 구조는
bias parameter
↓
attention
↓
bias 생성
으로 끝납니다.
따라서, Massive activation을 만들 이유가 없어집니다.
7. 학습 방법
특별한 loss는 없습니다.
그냥 GPT-2를 처음부터 다시 학습합니다.
비교 대상은
① 기본 GPT-2
② Sink Token 추가 GPT-2
③ Explicit Attention Bias GPT-2
입니다.
8. 결과
(1) 성능
세 모델 모두 최종 language modeling 성능은 거의 같습니다.
즉, Bias를 넣어도 성능은 유지됩니다.
(2) Massive Activation
논문의 Figure 9를 보면
기본 GPT-2
activation
|
| *
|
| *
|
+------------
큰 spike가 존재합니다.
Sink Token
|
|
| *
|
+---------
여전히 spike가 존재합니다.
즉, Sink Token만 추가해서는 Massive activation이 사라지지 않습니다.
Explicit Bias
|
|
|
|
+------------
Spike가 완전히 사라집니다.
Figure 10에서도 layer가 깊어질수록 activation이 부드럽게 증가할 뿐, 갑작스러운 massive activation은 나타나지 않습니다.
9. 왜 Sink Token은 실패하는가?
이 부분이 매우 중요합니다.
Sink Token은 새 token을 하나 넣은 것입니다.
하지만 그 token도
embedding
↓
attention
↓
MLP
↓
layernorm
을 계속 거칩니다.
즉, 여전히 입력 token입니다.
따라서, LLM은 그 token 내부에도 Massive activation을 만들어 버립니다.
반면, Explicit Bias는 QKV 계산 직전에 bias key, bias value 를 추가합니다.
즉, Transformer block 내부에 직접 bias를 삽입하는 것이므로 더 이상 token을 재활용할 필요가 없습니다.
10. Mechanistic Interpretability 관점에서의 의미
이 실험의 핵심은 다음과 같습니다.
저자들은 **Massive activation이 모델의 본질적인 계산에 필요한 것이 아니라, Transformer 구조가 self-attention에 명시적인 bias를 제공하지 않기 때문에 생긴 ‘구조적 보상(structural workaround)’**이라고 주장합니다.
즉,
Transformer 구조
│
▼
Attention에는 bias가 없음
│
▼
LLM이 자체적으로 bias를 만들어야 함
│
▼
의미가 약한 token에 massive activation 저장
│
▼
attention이 그 token에 집중
│
▼
constant value update 생성
│
▼
implicit attention bias 완성
그리고 explicit attention bias를 추가하면 이 우회 메커니즘 자체가 불필요해져 massive activation이 사라진다는 것을 실험적으로 입증한 것이 이 논문의 가장 중요한 결론입니다.
답글 남기기