** A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models (ICML 2026)

https://www.dropbox.com/scl/fi/growzuf1g10n23ycuh1rn/icml26_Unmasking_the_ME_Layer.pdf?rlkey=zrdsdbrnkxtsjlycfcbklo82a&dl=0

논문 개요

A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models는 LLM의 중간 hidden state에서 특정 토큰의 activation norm이 다른 토큰보다 수백~수천 배 커지는 massive activation이 어디서, 어떻게 발생하는지를 분석한 논문입니다.

논문의 핵심 주장은 다음과 같습니다.

Massive activation은 여러 층에 걸쳐 점진적으로 누적되는 것이 아니라, 모델마다 특정한 단 하나의 Transformer layer에서 갑자기 생성된다.

저자들은 이 층을 ME Layer, Massive Emergence Layer라고 부릅니다. ME Layer에서 생성된 massive activation은 residual connection을 통해 이후 모든 층으로 전달됩니다. 또한 이 activation은 입력이 달라져도 거의 동일한 방향을 유지하여 self-attention의 입력 적응성을 감소시킵니다.

이를 완화하기 위해 저자들은 RMSNorm weight를 이용해 일부 hidden-state dimension을 제거하는 WeMask, Weight-guided Masking을 제안합니다. WeMask는 별도의 학습 없이 inference 시 적용할 수도 있고, SFT·DPO·GRPO 학습 중 적용할 수도 있습니다.


1. 배경: Massive activation이란?

Transformer의 특정 중간층에서 토큰별 hidden state를

H(l)=[h0(l),,hT1(l)],ht(l)dH^{(l)}=\left[h^{(l)}_0,\ldots,h^{(l)}_{T-1}\right],\qquad h^{(l)}_t\in \mathbb{R}^{d}

라고 하겠습니다.

일반적으로 토큰별 norm

ht(l)2\left\|h^{(l)}_t\right\|_2

은 어느 정도 유사한 범위를 보입니다. 그러나 일부 모델에서는 특정 토큰, 흔히 첫 번째 토큰의 norm이 나머지 토큰보다 압도적으로 커집니다.

h0(l)21T1t=1T1ht(l)2\left\|h^{(l)}_0\right\|_2\gg\frac{1}{T-1}\sum_{t=1}^{T-1}\left\|h^{(l)}_t\right\|_2

이처럼 특정 토큰 또는 특정 hidden dimension의 값이 다른 값보다 수백~수천 배 커지는 현상이 massive activation입니다.

기존 연구는 다음과 같은 개별 현상을 보고했습니다.

  • outlier feature가 양자화를 어렵게 만든다.
  • massive activation이 bias 또는 global reference와 비슷하게 작동한다.
  • 첫 토큰에 attention이 집중되는 attention sink와 관련된다.
  • FFN의 큰 weight가 activation outlier를 만들 수 있다.

그러나 어느 층에서 처음 생성되는지, RMSNorm·attention·FFN 중 무엇이 원인인지, attention sink와 어떤 인과적 관계가 있는지를 하나의 메커니즘으로 연결한 설명은 부족했습니다.


2. 핵심 발견: ME Layer

2.1 층별 activation 추적

저자들은 각 Transformer layer에서 다음 세 지점의 토큰별 2norm\ell_2 norm을 측정합니다.

  1. pre-FFN RMSNorm 출력
  2. FFN 출력
  3. 전체 decoder layer 출력

Pre-norm decoder block을 단순화하면 다음과 같습니다.

xl=xl+Attn(RMSNormattn(xl))x_l’=x_l+\operatorname{Attn}\left(\operatorname{RMSNorm}_{\text{attn}}(x_l)\right)

xl+1=xl+FFN(RMSNormffn(xl))x_{l+1}=x_l’+\operatorname{FFN}\left(\operatorname{RMSNorm}_{\text{ffn}}(x_l’)\right)

분석 결과, massive activation은 이전 층까지는 존재하지 않다가 특정 층의 FFN 경로에서 갑자기 발생합니다.

논문 Figure 1의 흐름은 다음과 같습니다.

ME Layer1:h0ht\text{ME Layer}-1:\quad\|h_0\|\approx\|h_t\|

ME Layer의 RMSNorm:h0가 특정 dimension에 집중\text{ME Layer의 RMSNorm}:\quad h_0\text{가 특정 dimension에 집중}

ME Layer의 FFN:h0가 수백 수천 배 증폭\text{ME Layer의 FFN}:\quad\|h_0\|\text{가 수백~수천 배 증폭}

이후 layer:h0가 residual stream을 통해 유지\text{이후 layer}:\quad h_0\text{가 residual stream을 통해 유지}

즉, 이후 층에서 보이는 massive activation은 각 층이 반복해서 새로 생성하는 것이 아니라, ME Layer에서 생성된 하나의 큰 residual component를 계속 전달받는 것입니다.


2.2 모델별 ME Layer 위치

ME Layer는 Qwen3 하나에만 존재하는 현상이 아닙니다. 저자들은 여러 모델에서 동일한 형태의 급격한 activation jump를 발견했습니다.

모델ME Layer
Phi-3-mini-4k-instruct2
Qwen3-4B-Instruct7
Qwen3-8B7
Qwen2.5-7B4
Qwen2.5-7B-Instruct4
Qwen2.5-32B-Instruct5
Llama-3.1-8B6
Llama-3.1-8B-Instruct7
Mistral-7B-v0.12
DeepSeek-LLM-7B-Chat2

같은 모델 family에서는 ME Layer 위치가 대체로 유사합니다. 예를 들어 Qwen3-4B와 Qwen3-8B 모두 layer 7에서 massive activation이 발생합니다.

다만 발생 이후의 양상은 모델마다 다릅니다.

  • Qwen3: ME Layer에서 norm이 급격히 peak를 만든 뒤 이후 층에서 거의 일정하게 유지
  • Llama/Mistral: ME Layer 이후에도 massive-token norm이 추가로 증가하는 경향

따라서 “ME Layer 이후 값이 완전히 불변”이라기보다는, massive activation의 질적 전환점이 특정 한 층에 존재한다는 것이 더 정확한 결론입니다.


3. ME Layer 내부에서 무엇이 activation을 만드는가?

논문은 massive activation의 원인을 다음 두 구성요소의 결합으로 설명합니다.

  1. pre-FFN RMSNorm
  2. FFN의 up, gate, down projection

핵심은 다음과 같습니다.

RMSNorm이 첫 토큰을 큰 scaling-weight dimension에 정렬시키고, FFN이 이 방향을 선택적으로 크게 증폭한다.


4. RMSNorm의 역할

4.1 RMSNorm 식

RMSNorm은 다음과 같습니다.

RMSNorm(h)=h1di=1dhi2+ϵw\operatorname{RMSNorm}(h)=\frac{h}{\sqrt{\frac{1}{d}\sum_{i=1}^{d}h_i^2+\epsilon}}\odot w

여기서 wdw\in\mathbb{R}^d는 학습되는 dimension별 scaling weight입니다.

RMS normalization 자체는 전체 norm을 정규화하지만, 마지막의 wiw_i가 dimension별로 서로 다르기 때문에 출력 방향과 dimension별 크기는 달라질 수 있습니다.

저자들은 layer l, token t의 RMSNorm 출력 norm을

WeightNorml(t)=h^l,t2,h^l,t=RMSNorm(hl,t)\operatorname{WeightNorm}_l(t)=\left\|\hat h_{l,t}\right\|_2,\qquad \hat h_{l,t}=\operatorname{RMSNorm}(h_{l,t})

으로 측정합니다.

Qwen3-4B에서는 ME Layer 이전까지 첫 토큰과 나머지 토큰의 RMSNorm 출력 norm이 비슷하지만, layer 7에서 첫 토큰만 크게 증폭됩니다.


4.2 큰 RMSNorm weight dimension에 집중되는가?

단순히 첫 토큰의 norm이 크다는 것만으로는 RMSNorm weight가 원인이라고 말하기 어렵습니다. 따라서 저자들은 첫 토큰의 energy가 큰 RMSNorm weight를 가진 dimension에 특별히 집중되는지 측정합니다.

RMSNorm weight가 큰 상위 K개 dimension의 집합을

𝒦=TopK(|w|,K)\mathcal{K}=\operatorname{TopK}\left(|w|,K\right)

라고 놓습니다.

토큰 t의 전체 squared energy는

Et=i=1dh^t,i2E_t=\sum_{i=1}^{d}\hat h_{t,i}^2

상위 weight dimension에 놓인 energy는

Et𝒦=i𝒦h^t,i2E_t^{\mathcal K}=\sum_{i\in \mathcal K}\hat h_{t,i}^2

입니다. 그 비율은

Fract=Et𝒦Et\operatorname{Frac}_t=\frac{E_t^{\mathcal K}}{E_t}

이고, 첫 토큰과 나머지 토큰 간 차이를

ΔFrac=Frac01T1t=1T1Fract\Delta\operatorname{Frac}=\operatorname{Frac}_0-\frac{1}{T-1}\sum_{t=1}^{T-1}\operatorname{Frac}_t

로 정의합니다.

ME Layer에서 ΔFrac\Delta\operatorname{Frac}가 크게 양수가 됩니다. 즉 첫 토큰은 다른 토큰보다 훨씬 더 많이, RMSNorm weight가 큰 dimension에 energy를 집중합니다.


4.3 RMSNorm weight 분포와 activation 분포의 KL divergence

저자들은 RMSNorm weight가 만드는 dimension 분포와 실제 activation energy 분포도 비교합니다.

토큰 t의 activation energy 분포:

pt,i=h^t,i2jh^t,j2p_{t,i}=\frac{\hat h_{t,i}^2}{\sum_j\hat h_{t,j}^2}

RMSNorm scaling weight 분포:

gi=wi2jwj2g_i=\frac{w_i^2}{\sum_j w_j^2}

그리고

ΔKL=DKL(p0g)1T1t=1T1DKL(ptg)\Delta \operatorname{KL}=D_{\mathrm{KL}}(p_0\|g)-\frac{1}{T-1}\sum_{t=1}^{T-1}D_{\mathrm{KL}}(p_t\|g)

를 측정합니다.

ME Layer에서 ΔKL<0\Delta\operatorname{KL}<0가 됩니다. 이는 첫 토큰의 energy distribution이 다른 토큰보다 RMSNorm weight distribution에 더 가깝다는 의미입니다.

따라서 두 결과를 함께 보면 다음과 같습니다.

ΔFrac>0,ΔKL<0\Delta\operatorname{Frac}>0,\qquad\Delta\operatorname{KL}<0

즉, ME Layer에서 첫 토큰은 큰 RMSNorm weight dimension에 특별히 정렬되어 있고, RMSNorm은 이를 선택적으로 강화합니다.


5. FFN의 역할

Qwen 계열의 gated FFN을 단순화하면 다음과 같습니다.

u=Wuphu=W_{\mathrm{up}}h

g=σ(Wgateh)g=\sigma(W_{\mathrm{gate}}h)

z=Wdown(ug)z=W_{\mathrm{down}}(u\odot g)

FFN은 up projection, gate projection, down projection으로 구성됩니다.

저자들은 FFN을 통과하면서 hidden representation이 소수 direction에 얼마나 집중되는지를 projection concentration으로 측정합니다.

Ct=i=1d(ht,i2j=1dht,j2)2C_t=\sum_{i=1}^{d}\left(\frac{h_{t,i}^2}{\sum_{j=1}^{d}h_{t,j}^2}\right)^2

이는 energy distribution의 squared concentration으로, 확률분포의 Herfindahl index 또는 inverse participation ratio와 비슷합니다.

  • 모든 dimension에 energy가 균등하면 CtC_t가 작음
  • 소수 dimension에 energy가 집중되면 CtC_t가 큼

저자들은 각 FFN projection 뒤에서

ΔC=C01T1t=1T1Ct\Delta C=C_0-\frac{1}{T-1}\sum_{t=1}^{T-1}C_t

를 측정합니다.

그 결과 ME Layer에서만 다음 세 projection 모두 첫 토큰의 concentration이 크게 증가합니다.

  • WupW_{\mathrm{up}}
  • WgateW_{\mathrm{gate}}
  • WdownW_{\mathrm{down}}

또한 첫 토큰에 대한 FFN magnification factor도 ME Layer에서 최대가 됩니다.


5.1 RMSNorm과 FFN 중 어느 것이 더 중요한가?

논문의 Appendix 분석에 따른 역할 분담은 다음과 같습니다.

  • FFN: massive activation을 실제로 생성하고 유지하는 주된 구성요소
  • pre-FFN RMSNorm: FFN에 들어가는 입력을 큰-weight dimension에 정렬하고 activation scale을 조절
  • 결합 효과: 첫 토큰을 다른 토큰보다 수백~수천 배 크게 증폭

이를 개념적으로 쓰면

h0RMSNormlarge-w dimensions에 집중FFN강한 선택적 증폭h_0\xrightarrow{\mathrm{RMSNorm}}\text{large-}w\text{ dimensions에 집중}\xrightarrow{\mathrm{FFN}}\text{강한 선택적 증폭}

입니다.

따라서 “RMSNorm이 massive activation을 만든다”거나 “FFN weight 하나가 전부 원인이다”라는 단일 원인 설명보다는, RMSNorm–FFN alignment가 원인이라는 것이 논문의 결론입니다.


6. 생성 이후 massive activation의 방향적 불변성

Massive activation의 큰 크기보다 논문이 더 중요하게 보는 것은 방향의 고정성입니다.

첫 토큰 hidden state를

h0(l)=h0(l)h^0(l)h_0^{(l)}=\left\|h_0^{(l)}\right\|\hat h_0^{(l)}

로 분해해 봅시다.

여기서

h^0(l)=h0(l)h0(l)\hat h_0^{(l)}=\frac{h_0^{(l)}}{\|h_0^{(l)}\|}

는 방향입니다.

저자들은 서로 다른 task와 input으로부터 다음을 측정합니다.

  1. 층별 첫 토큰의 2norm\ell_2 norm
  2. 층별 activation pattern
  3. 입력 간 첫 토큰 hidden state의 cosine similarity

결과는 다음과 같습니다.

ME Layer 이전

  • 첫 토큰의 hidden direction이 입력에 따라 다름
  • norm도 다른 토큰과 비교 가능한 수준

ME Layer 이후

  • 첫 토큰 norm이 매우 커짐
  • 후속 층에서 norm이 비교적 안정적으로 유지
  • 서로 다른 입력에서 나온 첫 토큰 hidden state 간 cosine similarity가 거의 1
  • 층이 바뀌어도 동일한 activation pattern이 유지

즉,

cos(h0(l)(xa),h0(l)(xb))1,llME\cos\left(h^{(l)}_0(x_a),h^{(l)}_0(x_b)\right)\approx 1,\qquad l\geq l_{\mathrm{ME}}

가 됩니다.

이는 massive activation token이 입력 내용에 따라 달라지는 표현이라기보다, 거의 고정된 global reference direction 또는 learned anchor vector처럼 작동한다는 의미입니다.


7. 왜 이것이 self-attention을 경직시키는가?

7.1 Key direction의 고정

Attention에서 첫 토큰의 key는

k0=h0WKk_0=h_0W_K

입니다. h0=h0h^0h_0=\|h_0\|\hat h_0로 분해하면

k0=h0(h^0WK)k_0=\|h_0\|\left(\hat h_0W_K\right)

입니다.

입력이 달라도 h^0\hat h_0가 거의 같다면,

h^0(xa)h^0(xb)\hat h_0(x_a)\approx\hat h_0(x_b)

이고 따라서

k0(xa)cabk0(xb)k_0(x_a)\approx c_{ab}k_0(x_b)

가 됩니다. 즉 첫 토큰 key는 입력에 관계없이 attention similarity space에서 거의 고정된 방향을 차지합니다.

Query qiq_i와 첫 토큰 key 사이의 attention logit은

si0=qik0dks_{i0}=\frac{q_i^\top k_0}{\sqrt{d_k}}

입니다.

k0k_0가 거의 고정된 큰 방향이라면 여러 입력에서 유사한 attention pattern이 반복될 수 있습니다. 저자들은 이를 다음과 같이 해석합니다.

  • 첫 토큰이 고정 reference point로 작동
  • 다양한 input에 대해 attention structure가 유사해짐
  • 표현의 effective rank 및 directional diversity 감소
  • attention이 문맥에 따라 조절되는 정도가 감소

8. 제안 방법: WeMask

8.1 기본 아이디어

Massive token activation 자체를 전부 제거하지 않고, 그 방향을 지나치게 고정시키는 dimension만 선택적으로 약화합니다.

선택 기준은 activation magnitude가 아니라 pre-attention RMSNorm의 weight magnitude입니다.

각 후속 layer l의 RMSNorm weight를 w(l)w^{(l)}라고 하면, 절댓값이 큰 상위 k개 dimension을

S(l)=TopK(|w(l)|,k)S^{(l)}=\operatorname{TopK}\left(|w^{(l)}|,k\right) 로 선택합니다.

여기서 k=rdk=r\cdot d 이며 r은 mask rate입니다.


8.2 Mask 정의

논문의 표기상 mask는

md(l)={1,dS(l)0,otherwisem_d^{(l)}=\begin{cases}1,&d\in S^{(l)}\\0,&\text{otherwise}\end{cases}

이고, attention에 들어가기 전 첫 토큰 hidden state를

h~0(l)=h0(l)(1m(l))\tilde h_0^{(l)}=h_0^{(l)}\odot\left(1-m^{(l)}\right)

로 변환합니다.

즉 RMSNorm weight가 큰 dimension만 0으로 만듭니다.

중요한 점은 모든 토큰이 아니라 massive-activation token, 주로 첫 토큰에만 적용한다는 것입니다.


8.3 어느 층에 적용하는가?

WeMask는 ME Layer부터 이후 층의 attention input에 적용됩니다.

개념적 구현은 다음과 같습니다.

for layer_idx, layer in enumerate(model.layers):
    residual = hidden_states

    normed = layer.input_layernorm(hidden_states)

    if layer_idx >= me_layer:
        normed[:, first_token_idx, top_weight_dims[layer_idx]] = 0

    attn_out = layer.self_attn(normed)
    hidden_states = residual + attn_out

    # 이후 FFN 수행

실제 모델 구조에 따라 mask가 residual state 자체에 적용되는지, RMSNorm 후 attention input에 적용되는지를 명확히 구분해야 합니다. 논문의 설명과 Figure 6은 attention에 전달되는 hidden representation의 선택된 dimension을 masking하는 구조입니다.


8.4 Training-free와 training-aware

WeMask는 두 형태로 평가됩니다.

Training-free, TF

기존에 SFT/DPO/GRPO가 완료된 모델의 inference 과정에서만 mask를 적용합니다.

θ=θ\theta’=\theta

이고 forward computation만 수정합니다.

Training-aware 또는 SFT

훈련 중에도 mask를 삽입한 상태로 parameter를 업데이트합니다.

minθ(fθ,WeMask(x),y)\min_{\theta}\mathcal{L}\left(f_{\theta,\mathrm{WeMask}}(x),y\right)

이 경우 모델이 masking된 representation에 적응할 수 있습니다.


9. 실험 설정

9.1 Base model과 학습 데이터

주 실험 모델은 Qwen3-4B입니다.

목적학습 데이터
Instruction tuningFLAN, OpenOrca
수학 추론GSM8K
Safety alignmentHH-RLHF
DPO safetyHH-RLHF 3,000 examples
GRPO mathGSM8K

Context length는 일반 SFT에서 4096입니다.

주요 hyperparameter

  • Instruction SFT: global batch size 256, learning rate 2×1052\times10^{-5}
  • Math SFT: global batch size 64
  • Safety SFT: global batch size 256
  • DPO: batch size 8, max length 1024, learning rate 5×1065\times10^{-6}
  • GRPO: batch size 256, max length 256, learning rate 10610^{-6}

평가는 대부분 zero-shot이며 세 개 random seed의 평균과 표준편차를 보고합니다.


10. Instruction tuning 결과

Qwen3-4B를 FLAN/OpenOrca로 SFT한 후 여러 일반화 benchmark에서 평가합니다.

10.1 Training-free WeMask

설정MMLUPIQAARC-CMathQAStrategyQA평균
SFT baseline53.7780.3086.6937.2564.1564.43
WeMask TF, 0.154.3280.6987.5437.7664.2464.91
WeMask TF, 0.354.2380.5287.2637.7664.6364.88
WeMask TF, 0.554.0181.0386.9237.6264.1964.74
WeMask TF, 0.754.1781.0186.2537.4964.2264.63
WeMask TF, 1.027.7249.4429.6620.8761.7537.89

Mask rate 0.1에서 평균은

64.4364.9164.43\rightarrow64.91

+0.48 point 개선됩니다.

개선 폭은 크지 않지만, parameter update 없이 inference-time intervention만 적용한 결과라는 점이 중요합니다.

반면 mask rate 1.0, 즉 RMSNorm dimension을 지나치게 많이 제거하면 성능이 붕괴합니다. 이는 massive activation 및 attention sink가 전적으로 해로운 것이 아니라, 일부 유용한 정보를 포함한다는 논문의 해석을 뒷받침합니다.


10.2 WeMask를 적용한 SFT

설정MMLUPIQAARC-CMathQAStrategyQA평균
SFT baseline53.7780.3086.6937.2564.1564.43
WeMask SFT, 0.155.0180.9686.6937.4264.5464.92
WeMask SFT, 0.354.6580.4786.9537.4564.0664.73
WeMask SFT, 0.554.3881.0187.1137.5563.7664.76
WeMask SFT, 0.755.0281.2387.0037.5263.6264.88
WeMask SFT, 1.052.4077.2085.0734.4762.0562.24

Training-aware 설정에서도 대체로 0.1~0.7 mask rate가 baseline보다 낫습니다.

다만 dataset별 최적 mask rate는 일관되지 않습니다.

  • MMLU·PIQA: 0.7
  • ARC-C·MathQA: 0.5
  • StrategyQA: 0.1

따라서 mask rate는 representation rigidity와 정보 보존 간 trade-off를 조절하는 hyperparameter입니다.


11. 수학 추론 및 Safety alignment 결과

11.1 Training-free 결과

설정GSM8K ↑AIME ↑Math500 ↑Sorry-Bench ↓XSTest ↑
SFT baseline20.265.9243.003.1866.22
WeMask TF 0.121.966.3043.603.1867.18
WeMask TF 0.322.017.6143.703.4867.78
WeMask TF 0.521.385.9343.603.2673.78
WeMask TF 0.722.087.4142.872.7474.00
WeMask TF 1.020.893.3338.333.0479.78

주목할 만한 결과는 XSTest입니다.

66.2274.0066.22\rightarrow74.00

즉 0.7 masking에서 +7.78 point 개선됩니다.

XSTest는 benign request를 불필요하게 거부하는 over-refusal을 측정하는 benchmark입니다. 저자들은 SFT가 safety representation을 지나치게 rigid하게 만들어 over-refusal을 발생시키며, WeMask가 그 rigidity를 줄여 helpfulness를 회복한다고 해석합니다.

다만 mask rate 1.0에서 XSTest가 79.78까지 증가한 것은 주의해서 해석해야 합니다. Safety 관련 direction을 과도하게 제거해 단순히 거부를 덜 하게 된 결과일 수도 있으므로, harmful-request 대응 지표와 반드시 함께 봐야 합니다.


11.2 WeMask SFT 결과

설정GSM8K ↑AIME ↑Math500 ↑Sorry-Bench ↓XSTest ↑
baseline20.265.9243.003.1866.22
WeMask SFT 0.121.054.0744.472.9668.82
WeMask SFT 0.320.528.1545.402.2269.63
WeMask SFT 0.521.916.6741.872.7467.60
WeMask SFT 0.722.145.9242.931.7170.59
WeMask SFT 1.014.591.4842.7310.4569.63

0.3 masking에서는

AIME:5.928.15\text{AIME}: 5.92\rightarrow8.15

Math500:43.0045.40\text{Math500}:43.00\rightarrow45.40

으로 개선됩니다.

0.7에서는

Sorry-Bench:3.181.71\text{Sorry-Bench}:3.18\rightarrow1.71

이지만 mask rate 1.0에서는 Sorry-Bench가 10.45로 크게 악화됩니다. 즉 안전 성능에서도 적당한 attenuation과 과도한 제거 사이에 명확한 non-monotonic trade-off가 있습니다.


12. DPO와 GRPO 결과

12.1 DPO safety alignment

방법XSTest ↑AdvBench ↓
Qwen3-4B71.9335.78
DPO72.3033.80
DPO + WeMask TF74.9632.81
DPO + WeMask TA74.7433.57

DPO 후 inference-time WeMask가 가장 좋습니다.

XSTest:72.3074.96\text{XSTest}:72.30\rightarrow74.96

AdvBench:33.8032.81\text{AdvBench}:33.80\rightarrow32.81

즉 benign request에 대한 over-refusal은 줄이면서 harmful request에 대한 방어도 소폭 개선합니다.

Training-aware보다 training-free가 더 좋은 것은 흥미로운 결과입니다. 이는 representation intervention이 반드시 재학습되어야 하는 것은 아니며, 오히려 학습 중 모델이 masking을 우회하거나 보상하는 방향으로 적응할 가능성도 시사합니다.


12.2 GRPO 수학 추론

방법AIME ↑Math500 ↑
Qwen3-4B5.9243.00
GRPO7.4043.67
GRPO + WeMask TF9.2743.47
GRPO + WeMask TA7.8043.33

AIME에서는 GRPO + training-free WeMask가

7.409.277.40\rightarrow9.27

로 개선됩니다.

반면 Math500에서는 일반 GRPO가 43.67로 가장 좋고 WeMask가 소폭 낮습니다. 따라서 “모든 benchmark에서 일관되게 개선한다”기보다는, 대부분의 조건에서 개선하거나 유사한 성능을 유지한다가 더 정확합니다.


13. Ablation: 아무 dimension이나 지워도 되는가?

저자들은 mask rate가 비슷한 여러 전략을 비교합니다.

  1. Random Mask: 무작위 dimension 제거
  2. Magnitude Mask: massive token에서 activation magnitude가 가장 큰 dimension 제거
  3. WeMask: RMSNorm weight가 가장 큰 dimension 제거
방법PIQAARC-CStrategyQA
SFT baseline80.3086.6965.15
Random Mask56.0257.5253.67
Magnitude Mask49.2429.1051.14
WeMask81.0387.5464.63

Random masking과 magnitude masking은 성능을 심각하게 훼손합니다.

특히 activation magnitude 기반 masking이 가장 나쁩니다. 이는 큰 activation dimension이 단순한 noise가 아니라 유용한 정보를 포함할 수 있음을 뜻합니다.

WeMask의 차이는 현재 activation이 큰 dimension을 제거하는 것이 아니라, RMSNorm이 반복적으로 지배적 방향을 강화하는 dimension을 선택한다는 것입니다.

다만 StrategyQA에서는 표의 baseline 65.15보다 WeMask 64.63이 낮습니다. 본문 Table 1의 baseline은 64.15로 제시되어 있어 부록 표와 숫자가 일치하지 않습니다. 이 부분은 논문의 재현성과 보고 정확도 측면에서 확인할 필요가 있습니다. 


14. 다른 모델에서의 결과

14.1 Llama-3.1-8B-Instruct

방법MMLUPIQAARC-COpenBookQAMathQA
Base46.3375.1474.4976.4024.69
SFT48.2284.6079.5280.0028.54
SFT + WeMask TF48.1584.2279.3579.2028.41
WeMask SFT47.6784.2279.6981.2030.12

Llama에서는 효과가 혼합되어 있습니다.

  • MMLU·PIQA는 일반 SFT가 더 좋음
  • ARC-C·OpenBookQA·MathQA는 WeMask SFT가 더 좋음

따라서 Qwen에서처럼 일관된 개선이라고 보기는 어렵습니다.

14.2 Qwen3-8B

방법MMLUPIQAARC-COpenBookQAMathQA
Base34.5663.1122.7827.6020.57
SFT60.0984.0691.3087.0041.27
SFT + WeMask TF59.6084.4491.3087.6041.64
WeMask SFT62.9684.1191.3087.2041.34

Qwen3-8B에서는 특히 MMLU가

60.0962.9660.09\rightarrow62.96

으로 +2.87 point 개선됩니다.

Qwen3 계열에서 ME Layer 위치가 동일하고 activation 형성 구조도 유사하기 때문에 WeMask가 더 잘 transfer되는 것으로 해석할 수 있습니다. 


15. Attention sink와의 관계

15.1 Attention sink 발생 시점

Attention sink는 여러 query가 특정 token, 흔히 첫 번째 token에 큰 attention weight를 주는 현상입니다.

Ai0AijA_{i0}\gg A_{ij}

논문은 attention map을 층별로 관찰하여 다음을 보고합니다.

  • ME Layer 이전: 첫 토큰으로의 sink가 비교적 약함
  • ME Layer 및 직후: 첫 토큰으로 attention이 강하게 집중
  • 이후 층: sink가 지속

다만 decoder block에서 attention은 FFN보다 먼저 계산됩니다. 따라서 ME Layer 자체의 attention sink가 동일 layer의 FFN output 때문에 생긴 것일 수는 없습니다.

저자들은 이를 다음과 같이 설명합니다.

  1. ME Layer에 들어가기 전 residual stream에 이미 방향적 편향이 형성됨
  2. ME Layer의 FFN이 이를 massive activation으로 명시적으로 증폭
  3. 생성된 massive activation이 다음 층 attention에 강한 sink를 유발

따라서 엄밀한 시간 순서는

pre-existing directional tendencyME Layer FFN amplificationstrong downstream attention sink\text{pre-existing directional tendency}\rightarrow\text{ME Layer FFN amplification}\rightarrow\text{strong downstream attention sink}

입니다.


15.2 저자들의 새로운 관점

기존 일부 연구는 attention sink를 softmax coupling 또는 attention-level artifact로 설명합니다.

이 논문은 다음의 representation-level 설명을 제시합니다.

massive activationinput-invariant hidden directionsimilar key representationsattention concentration\text{massive activation}\Rightarrow\text{input-invariant hidden direction}\Rightarrow\text{similar key representations}\Rightarrow\text{attention concentration}

즉 attention sink는 softmax만의 문제가 아니라, 그 전에 hidden representation이 저차원 방향으로 collapse된 결과라는 것입니다.

WeMask를 적용하면 첫 토큰으로 향하는 attention이 완전히 사라지지는 않지만 약화됩니다. 성능은 오히려 향상됩니다.

저자들의 결론은 다음과 같습니다.

Attention sink는 제거해야 할 순수한 결함이 아니라 유용한 structural anchor일 수 있다. 문제는 sink의 존재가 아니라 dominance가 지나치게 강하고 input-invariant하다는 것이다.


16. 논문의 가장 중요한 해석

이 논문은 massive activation을 단순한 “큰 수” 문제가 아니라, 다음과 같은 표현 기하학 문제로 재해석합니다.

Large magnitude+stable directiondominant low-rank reference\text{Large magnitude}+\text{stable direction}\Rightarrow\text{dominant low-rank reference}

첫 토큰이 입력마다 다른 정보를 표현하지 않고 거의 동일한 방향을 갖는다면, 모든 토큰이 attention을 계산할 때 이 고정된 방향을 reference로 사용하게 됩니다.

이는 어느 정도는 유용할 수 있습니다.

  • global anchor
  • null/default attention target
  • position-independent bias
  • residual stream의 안정화
  • 공통 routing signal

그러나 너무 강하면 다음이 발생합니다.

  • attention rank 감소
  • input sensitivity 감소
  • context-specific interaction 감소
  • over-refusal 또는 rigid reasoning pattern
  • representation anisotropy 증가

WeMask는 이 anchor를 제거하지 않고 일부 dominant dimension만 잘라내어

anchor 유지+directional flexibility 증가\text{anchor 유지}+\text{directional flexibility 증가}

를 목표로 합니다.


17. 장점

17.1 발생 위치를 구체적으로 localization

기존 연구의 “FFN large weight가 관계된다”는 수준을 넘어, massive activation이 처음 나타나는 단일 층을 ME Layer로 정의하고 RMSNorm→FFN→residual propagation을 추적했습니다.

17.2 모델 family 전반에서 관찰

Qwen, Llama, Mistral, Phi, DeepSeek 등 여러 구조에서 ME Layer를 발견한 것은 현상이 특정 checkpoint의 우연한 artifact가 아님을 보여줍니다.

17.3 분석과 intervention의 연결

단순한 descriptive analysis에 그치지 않고, 분석 결과인 “large RMSNorm weight가 dominant direction을 강화한다”를 바로 masking criterion으로 사용했습니다.

17.4 Training-free 적용 가능

추가 parameter, 별도 optimization objective 또는 model architecture 변경 없이 inference hook만으로 적용할 수 있습니다.


18. 한계와 비판적 평가

18.1 인과 증거가 충분히 강하지 않음

논문은 RMSNorm weight 정렬, FFN concentration, activation jump를 보여주지만, 이는 상당 부분 상관적 분석입니다.

더 강한 인과 검증은 다음과 같아야 합니다.

  • ME Layer의 RMSNorm weight permutation
  • ME Layer FFN의 특정 singular direction 제거
  • activation patching
  • weight patching
  • massive-token direction을 다른 token으로 이식
  • RMSNorm-only / FFN-only intervention
  • ME Layer를 다른 층의 parameter와 교환

이러한 실험이 있어야 “RMSNorm과 FFN이 jointly cause한다”는 주장이 더 확고해집니다.

18.2 WeMask가 실제로 directional diversity를 얼마나 회복하는지 정량화 부족

방법론의 핵심 목적은 directional rigidity 완화인데, 주요 결과는 downstream accuracy입니다.

다음 지표가 있으면 더 설득력이 높습니다.

Mean pairwise cosine similarity\text{Mean pairwise cosine similarity}

effective rank=exp(ipilogpi)\text{effective rank}=\exp\left(-\sum_i p_i\log p_i\right)

participation ratio=(iλi)2iλi2\text{participation ratio}=\frac{(\sum_i\lambda_i)^2}{\sum_i\lambda_i^2}

attention entropy=jAijlogAij\text{attention entropy}=-\sum_j A_{ij}\log A_{ij}

즉 WeMask가 정말로 representation rank와 contextual diversity를 높였는지를 직접 보여줘야 합니다.

18.3 첫 토큰 중심 분석의 일반성

Qwen3에서는 explicit BOS token이 없는데도 첫 토큰에 massive activation이 발생한다는 점은 흥미롭습니다. 그러나 다음 조건에 대한 분석이 제한적입니다.

  • chat template의 system token
  • padding 위치
  • multilingual input
  • long context
  • special-token 구성 변경
  • prefix가 다른 경우
  • massive token 위치가 첫 토큰이 아닌 모델

따라서 “massive activation token은 항상 첫 토큰”으로 일반화해서는 안 됩니다.

18.4 성능 개선이 대체로 작음

Instruction benchmark 평균 개선은 약 0.3~0.5 point 수준입니다. 일부 수학·safety benchmark에서는 크지만 표준편차가 상당히 크고 모든 benchmark에서 일관된 것은 아닙니다.

특히 AIME는 문제 수가 적기 때문에

5.92±2.575.92\pm2.57

처럼 분산이 큽니다. 통계적 유의성이나 paired evaluation이 보고되지 않아 실제 개선의 안정성은 불명확합니다.

18.5 RMSNorm weight mask의 실질적 의미

큰 RMSNorm weight dimension은 모델 전반에서 중요한 feature direction일 수 있습니다. 이를 hard zero masking하는 것은 비교적 거친 intervention입니다.

보다 원리적인 대안은 다음과 같습니다.

h~=hαP𝒮h\tilde h=h-\alpha P_{\mathcal S}h

처럼 projection strength α\alpha를 조절하거나,

h~=hαh,vmassivevmassive2vmassive\tilde h=h-\alpha\frac{\langle h,v_{\mathrm{massive}}\rangle}{\|v_{\mathrm{massive}}\|^2}v_{\mathrm{massive}}

처럼 massive direction만 soft subtraction하는 것입니다.

현재 방법은 “weight가 큰 coordinate”를 제거하기 때문에, representation basis에 의존한다는 한계도 있습니다.

18.6 Attention sink의 인과 방향은 아직 완전히 입증되지 않음

논문은 massive activation 이후 sink가 강화되는 시계열적 정합성을 보여주지만,

massive activationattention sink\text{massive activation}\rightarrow\text{attention sink}

의 인과성을 확정하려면 massive activation만 선택적으로 patch한 뒤 sink가 이동하거나 사라지는지 확인해야 합니다.

또한 ME Layer의 attention은 FFN보다 먼저 계산되므로, 논문 자체도 같은 층의 sink를 FFN output만으로 설명할 수 없음을 인정합니다. 따라서 “attention sink originates from the ME Layer”라는 표현은 다소 강합니다. 보다 정확하게는:

ME Layer는 이미 형성되고 있던 공통 방향을 크게 증폭하여, 후속 층의 attention sink를 강화하고 안정화한다.

라고 보는 것이 적절합니다.


19. 전체 방법론을 한 식으로 요약하면

논문의 발견은 다음 chain으로 정리할 수 있습니다.

h0(lME)RMSNormlarge-weight dimensions에 집중h_0^{(l_{\mathrm{ME}})}\overset{\mathrm{RMSNorm}}{\longrightarrow}\text{large-weight dimensions에 집중}

FFNh0의 급격한 증폭\overset{\mathrm{FFN}}{\longrightarrow}\|h_0\|\text{의 급격한 증폭}

residual후속 층으로 안정적으로 전달\overset{\mathrm{residual}}{\longrightarrow}\text{후속 층으로 안정적으로 전달}

WKinput-invariant key direction\overset{W_K}{\longrightarrow}\text{input-invariant key direction}

softmaxattention sink 및 낮은 표현 다양성\overset{\mathrm{softmax}}{\longrightarrow}\text{attention sink 및 낮은 표현 다양성}

WeMask는 이 chain 중 attention 직전 표현에 개입합니다.

S(l)=TopK(|w(l)|,rd)S^{(l)}=\operatorname{TopK}(|w^{(l)}|,rd)

h~0(l)=h0(l)𝟏[dS(l)]\tilde h_0^{(l)}=h_0^{(l)}\odot\mathbf 1[d\notin S^{(l)}]

그 결과 massive anchor는 일부 유지하면서 dominant coordinate의 영향만 줄입니다.


20. 최종 평가

이 논문의 가장 중요한 기여는 새로운 masking 기법 자체보다는 다음의 메커니즘적 관찰입니다.

LLM의 massive activation은 전체 depth에 걸친 점진적 현상이 아니라, family별로 비교적 고정된 단일 ME Layer의 RMSNorm–FFN 상호작용에서 생성되고 residual stream을 통해 전파된다.

또한 massive activation과 attention sink를

hidden-state directional collapse\text{hidden-state directional collapse}

라는 하나의 representation-level 현상으로 연결했다는 점이 흥미롭습니다.

다만 WeMask의 성능 향상은 전반적으로 소규모이고, causal intervention 및 representation-rank 분석이 충분하지 않습니다. 따라서 현재 결과는 설득력 있는 mechanistic hypothesis와 실용적 proof-of-concept로 보는 것이 적절하며, ME Layer가 massive activation의 완전한 단일 원인이라고 확정하기에는 추가적인 activation/weight patching 실험이 필요합니다.

댓글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다