
논문 개요
**Ting-Yun Chang et al., “Why Do Some Inputs Break Low-Bit LLM Quantization?” (EMNLP 2025)**는 다음 질문을 다룹니다.
동일한 LLM과 동일한 양자화 비트 수를 사용해도, 왜 일부 입력에서는 양자화 오차가 유난히 크게 발생하는가?
기존 양자화 연구는 주로 모델 전체 평균 성능, 예를 들어 WikiText perplexity나 downstream accuracy를 개선하는 데 집중했습니다. 반면 이 논문은 example-level quantization error를 분석합니다. 즉, 평균적으로 잘 작동하는 3–4 bit 모델에서도 특정 문서나 질문만 심하게 망가지는 원인을 찾습니다.
논문의 핵심 결론은 다음과 같습니다.
양자화에 취약한 입력은 특정 양자화 알고리즘 때문에 우연히 망가지는 것이 아니라, full-precision 모델 내부에서 이미 구별되는 activation dynamics를 가진다.
이 입력들은 상위 layer에서 residual magnitude가 작고, RMSNorm 이후에는 오히려 큰 activation을 생성한다. 이 큰 activation이 양자화된 weight의 오차를 증폭하고, 특히 MLP gate를 통해 누적되면서 최종 예측을 손상시킨다.
실제로 서로 다른 양자화 방법 50개 쌍의 example-level error 상관계수는 평균 였고, full-precision residual magnitude만으로 미래의 양자화 오차를 상당히 잘 예측할 수 있었습니다.
1. 연구 배경과 문제 설정
1.1 Weight-only low-bit quantization
이 논문은 activation까지 양자화하는 W4A4 같은 설정이 아니라, 주로 다음 설정을 다룹니다.
weight-only quantization은 모델 메모리를 크게 줄이면서도 비교적 양호한 성능을 유지합니다. 그러나 3-bit 부근부터 정확도 저하가 눈에 띄며, 특히 모든 입력이 균등하게 손상되는 것이 아니라 일부 입력에서 손실이 집중됩니다.
논문은 다음 세 질문을 제시합니다.
- 서로 다른 양자화 방법들이 같은 입력에서 실패하는가?
- 어떤 full-precision activation 특성이 양자화 오차를 예측하는가?
- 양자화 오차는 Transformer의 어느 component에서 주로 발생하는가?
2. 관련 연구
2.1 GPTQ: second-order post-training quantization
GPTQ는 weight를 하나씩 양자화하면서, 아직 양자화되지 않은 weight를 보정하는 approximate second-order PTQ 방법입니다.
한 layer의 weight matrix를 , 양자화된 weight를 , calibration activation을 라 하면 기본 목적은 대략 입니다.
GPTQ는 Hessian approximation을 사용하여 특정 weight의 양자화가 출력 reconstruction error에 미치는 영향을 추정하고, 이후 weight들을 업데이트하여 이를 보상합니다.
이 논문에서는 C4 calibration set, activation sorting, Hessian damping을 사용합니다. 3-bit에서는 group size 64, 4-bit에서는 128입니다.
이 논문과의 관계
GPTQ가 weight reconstruction error를 줄여도, 특정 입력이 가지는 activation pattern 때문에 같은 weight error가 크게 증폭될 수 있습니다. 즉, GPTQ의 평균 reconstruction 성능과 example-level robustness는 동일하지 않습니다.
2.2 AWQ: Activation-Aware Weight Quantization
AWQ의 핵심 관찰은 activation이 큰 input channel에 대응되는 weight quantization error가 출력에 더 큰 영향을 준다는 것입니다.
선형층 에서 양자화 오차를 라 하면 출력 오차는
입니다. 따라서 가 큰 channel에서는 작은 도 큰 출력 오차를 만듭니다.
AWQ는 channel-wise scaling 를 도입하여
로 바꾼 뒤, activation이 큰 channel의 weight를 양자화하기 쉽게 rescale합니다.
이 논문은 AWQ의 “large activation amplifies weight error” 관찰을 출발점으로 삼지만, 더 미묘한 현상을 발견합니다.
양자화 오차가 큰 입력은 RMSNorm 이전 residual은 작지만, RMSNorm 이후 activation은 더 크다.
즉, 단순히 raw residual outlier만 보는 것으로는 example-level failure를 설명할 수 없습니다. AWQ는 Pile calibration data와 group size 128을 사용합니다.
2.3 NormalFloat, NF4/NF3
NormalFloat는 weight가 대체로 정규분포를 따른다는 가정 아래, 균일한 quantization interval 대신 Gaussian quantile 기반의 비균일 codebook을 사용합니다.
일반적인 uniform quantization은 처럼 값의 구간을 균일하게 나누지만, NF는 중앙 영역에 더 많은 quantization level을 배치합니다.
논문은 다음 구현을 사용합니다.
- NF4:
bitsandbytes - NF3:
flute - group size: 64
Llama-3-70B의 NF3는 kernel incompatibility 때문에 포함하지 않았습니다.
2.4 EfficientQAT
EfficientQAT는 quantization-aware training을 효율화한 방법입니다. 양자화의 round 연산은 미분 불가능하므로, 학습 시 straight-through estimator를 사용합니다.
논문은 RedPajama로 학습된 공식 3-bit checkpoint를 사용하며, Llama 계열에 대해서만 결과를 포함합니다.
2.5 Activation outlier 연구
기존 연구들은 Transformer에서 매우 큰 activation 또는 weight dimension이 quantization을 어렵게 만든다고 보았습니다.
대표적인 방향은 다음과 같습니다.
- LLM.int8(): outlier dimension을 고정밀로 별도 처리
- SmoothQuant: activation outlier를 weight 쪽으로 이동
- AWQ: 중요 activation channel에 따라 weight scaling
- QuaRot / SpinQuant: rotation을 통해 outlier를 여러 dimension에 분산
- OWQ: outlier-sensitive weight를 고정밀로 유지
이 논문의 중요한 차별점은 다음입니다.
기존 연구는 “어떤 dimension이 outlier인가”를 분석한 반면, 본 논문은 “어떤 입력 example이 양자화에 취약한가”를 분석한다.
더 나아가 large-error input은 residual state에서 오히려 outlier가 더 적고 kurtosis가 낮다는 역설적인 결과를 제시합니다.
2.6 LayerNorm과 quantization
기존 BERT 압축 연구에서는 LayerNorm parameter의 outlier가 pruning 및 quantization에 문제를 일으킬 수 있음이 알려져 있었습니다.
이 논문은 LayerNorm 자체를 양자화하지 않습니다. 그럼에도 RMSNorm이 양자화 오차에서 핵심 역할을 합니다. 그 이유는 RMSNorm이 직접 오차를 만들기 때문이 아니라, residual activation의 상대적인 scale을 뒤집어 양자화된 MLP에 큰 입력을 공급하기 때문입니다.
2.7 모델 압축과 long-tail data
기존 pruning·quantization 연구에서는 low-resource language나 long-tail example이 압축으로 더 큰 피해를 받는다는 결과가 보고되었습니다.
그러나 본 논문은 오히려 다음을 발견합니다.
- FineWeb에서 full-precision NLL이 큰 long-tail 문서는 quantization error가 비교적 작음
- PopQA에서도 가장 unpopular한 entity는 상대적으로 덜 손상됨
- 중간에서 높은 popularity 영역이 더 크게 손상될 수 있음
따라서 “희귀 데이터일수록 양자화에 취약하다”는 단순한 가설을 반박합니다.
3. 실험 설정
3.1 모델
네 가지 크기와 architecture의 LLM을 사용합니다.
| 모델 | 크기 |
|---|---|
| Qwen2.5 | 7B |
| Llama 3 | 8B |
| Mistral-Nemo | 12B |
| Llama 3 | 70B |
양자화 방법은 GPTQ, AWQ, NF, EfficientQAT이며 3-bit와 4-bit 설정을 사용합니다.
3.2 FineWeb dataset
FineWeb에서 영어 문서 10,000개를 샘플링합니다.
- 긴 문서만 선택
- 각 문서를 512 tokens로 truncate
- calibration data와 겹치지 않도록 FineWeb을 평가 데이터로 사용
- aggressive 5-gram deduplication 적용
문서 의 token-average NLL은 입니다.
3.3 Example-level quantization error
full-precision model을 , 양자화 모델을 라 하면 example-level quantization error를 로 정의합니다.
- e(x)>0: 양자화로 성능 악화
- : 거의 영향 없음
- e(x)<0: 드물게 양자화 모델의 NLL이 더 낮음
이 정의는 full-precision distribution과 quantized distribution 사이의 KL divergence로 정의한 오차와도 의 높은 상관을 보였습니다. 따라서 계산량이 더 작은 NLL difference를 사용합니다.
3.4 Large-error set과 control set
각 양자화 모델에 대해: ,를 구성합니다.
main experiment에서는 주로 AWQ3로 구성한 를 사용합니다. 방법별 large-error set의 Jaccard overlap은 모델별로 다음과 같습니다.
| 모델 | 방법 간 Jaccard |
|---|---|
| Qwen2.5-7B | 0.30 |
| Llama-3-8B | 0.49 |
| Mistral-12B | 0.66 |
| Llama-3-70B | 0.66 |
모델이 커질수록 어떤 입력이 취약한지가 방법에 덜 의존하는 경향이 보입니다.
3.5 PopQA
factual knowledge에 대한 영향을 분석하기 위해 PopQA를 사용합니다.
- 약 14K 질문
- 각 질문에 subject entity popularity 제공
- 15-shot prompting
- greedy decoding
- exact-match accuracy
entity popularity의 값으로 8개 bucket을 구성합니다.
4. 연구 질문 1: 서로 다른 양자화 방법이 같은 입력에서 실패하는가?
4.1 방법
한 quantized model의 전체 dataset error vector를 로 정의합니다.
두 양자화 방법 에 대해 를 계산합니다.
4.2 결과
50개 method pair의 평균 Pearson correlation은 였습니다.
대표 결과:
- Mistral-12B AWQ3 vs. GPTQ3: 0.95
- Llama-3-70B GPTQ3 vs. AWQ3: 0.96
- Llama-3-70B AWQ4 vs. GPTQ4: 0.96
- Qwen2.5-7B는 상대적으로 낮지만 평균 0.66
large-error example set의 평균 Jaccard similarity도 약 0.51로, random overlap 기대치 약 0.05보다 훨씬 높았습니다.
GPTQ 내부 hyperparameter를 바꾸어도 결과는 유지됩니다.
- damping: 0.005, 0.01, 0.02
- activation sorting on/off
Qwen2.5-7B GPTQ3 variant 간 평균 상관은 약 0.93이며, 개별 pair는 입니다.
또한 FineWeb뿐 아니라 domain-specific corpus에서도 유사합니다.
- ArXiv: 평균 0.69
- OpenWebMath: 평균 0.89
해석
이 결과는 quantization failure가 단순히 GPTQ, AWQ 등의 알고리즘 특유의 artifact가 아님을 뜻합니다. ““이라고 볼 수 있습니다.
즉, 양자화 방법은 error의 절대 크기를 줄이거나 늘릴 수 있지만, 어떤 입력이 상대적으로 취약한지의 순위는 상당 부분 이미 결정되어 있습니다.
5. 연구 질문 2: 왜 특정 입력이 큰 오차를 가지는가?
5.1 Transformer residual 정의
Pre-LN Transformer layer를 다음처럼 나타냅니다. ,
논문은 MHA residual addition 이후의 를 주로 분석하며 이를 residual state라고 부릅니다.
문서 x에 대한 layer l의 residual magnitude는 token별 norm의 평균입니다.
dataset 전체의 residual magnitude vector는 입니다.
이를 최종 quantization error vector와 correlation합니다.
중요한 점은 S는 full-precision model에서만 측정된다는 것입니다.
5.2 예상과 반대인 결과: residual이 작을수록 양자화 오차가 크다
마지막 layer residual magnitude와 3-bit quantization error의 평균 correlation은 다음과 같습니다.
| 모델 | 평균 상관 |
|---|---|
| Qwen2.5-7B | -0.66 |
| Llama-3-8B | -0.76 |
| Mistral-12B | -0.78 |
| Llama-3-70B | -0.80 |
즉,입니다.
그리고 이 negative correlation은 깊은 layer로 갈수록 강해집니다. 부록의 layer-wise graph에서도 모든 모델과 거의 모든 양자화 방법이 상위 layer에서 더욱 음의 방향으로 내려갑니다.
왜 이상한가?
기존 AWQ 계열의 통상적인 설명은 입니다.
그런데 논문은 quantization에 취약한 example에서 raw residual magnitude가 더 작다고 보고합니다. 이 모순을 해결하는 핵심이 RMSNorm입니다.
6. RMSNorm reversal effect
6.1 RMSNorm
RMSNorm은 , 입니다.
MLP로 입력되는 activation을 라 하겠습니다.
6.2 Reversal 현상
논문의 Figure 1, page 5가 핵심 현상을 보여줍니다.
RMSNorm 이전:
RMSNorm 이후:
즉, input별 activation magnitude의 상대 순서가 뒤집힙니다.
이 현상은 특히 upper layers에서 반복적으로 나타납니다.
6.3 왜 magnitude가 뒤집히는가?
example은 residual state에서 outlier가 더 적습니다. 이를 kurtosis로 측정합니다.
큰 kurtosis는 소수의 극단적인 dimension이 존재함을 뜻합니다.
실험 결과:
즉, large-error example은 오히려 residual outlier가 더 적거나 약합니다. page 15의 Figure 6에서는 Qwen, Llama, Mistral 모두 대부분 layer에서 의 kurtosis가 더 낮습니다.
Control example
에서는 소수 outlier dimension이 residual norm을 크게 만듭니다.
하지만 RMSNorm parameter 는 이 outlier dimension에 매우 작은 weight를 부여합니다. 따라서 RMSNorm 이후에는 큰 dimension이 억제됩니다.
Large-error example
에서는 outlier가 적고 activation이 여러 dimension에 더 균일하게 퍼져 있습니다.
raw norm은 작지만 RMS normalization으로 전체가 rescale되고, 에 의해 특별히 억제되는 dimension도 상대적으로 적습니다. 그 결과 post-RMSNorm norm이 커집니다.
Llama-3-70B의 상위 layer에서는 가장 심한 outlier dimension들이 거의 항상 가 작은 최상위 억제 대상에 해당합니다. 예를 들어 layer 40의 median 는 0.1553인데, 주요 outlier dimension의 값은 약 0.0186–0.0413에 불과합니다.
7. Quantization error amplification과 accumulation
7.1 단일 선형층 관점
양자화된 weight를 라 하면 출력 차이는 입니다.
따라서 입니다.
즉, quantization noise 가 동일하더라도 post-RMSNorm activation 가 크면 출력 오차가 커집니다.
실제로 논문은 각 layer의 full-precision/quantized MLP 출력 간 MSE를 로 측정하고, post-RMSNorm magnitude와의 correlation이 대부분 upper layer에서 0.6 이상임을 확인합니다.
7.2 Layer를 거치며 누적
양자화 모델의 residual error를 라 하면, 다음 layer에서는 이 오차가 attention과 MLP의 입력으로 다시 들어갑니다.
개략적으로 가 됩니다.
따라서 각 layer의 quantization error는 독립적으로 사라지는 것이 아니라 residual stream에 누적됩니다.
논문의 전체 가설은 다음 chain으로 정리할 수 있습니다. \]
논문은 residual state와 error가 모두 layer를 따라 누적되기 때문에, 마지막 layer residual magnitude가 최종 quantization error와 가장 강한 상관을 보인다고 설명합니다.
8. 연구 질문 3: 오차는 어디에서 발생하는가?
논문은 두 가지 mechanistic localization 기법을 사용합니다.
- Early exiting / logit lens
- Cross-model activation patching
9. Early exiting 분석
9.1 방법
layer l의 residual 를 최종 RMSNorm 와 unembedding U를 통해 직접 decoding합니다.
그 layer에서의 NLL을 계산하면, 현재 residual state가 이미 정답 token을 예측할 준비가 되었는지 볼 수 있습니다.
- 중간 layer NLL이 최종 NLL과 비슷함: 일찍부터 prediction이 형성됨
- 중간 layer NLL이 높고 마지막 layer에서 급락: late-layer refinement에 의존
9.2 결과
의 full-precision NLL은 중후반 layer까지 높게 유지되다가 마지막 몇 layer에서 급격히 감소합니다.
반면 은 상대적으로 더 이른 layer부터 좋은 prediction을 형성합니다.
즉, ““합니다.
Mistral-12B에서는 의 quantized/full-precision trajectory가 layer 32까지 비슷하다가 layer 33 부근부터 분리됩니다. 따라서 처음 보면 “후반 layer weight의 정밀도가 중요하다”고 생각할 수 있습니다.
9.3 Late-layer weight만 FP16으로 복구
이를 검증하기 위해 layer 33 이후 7개 layer, 전체의 약 18%를 3-bit에서 16-bit로 복구합니다.
Mistral-12B perplexity:
- FP16: 5.60
- AWQ3: 8.67
- 후반 7개 layer FP16 복구: 8.05
개선은 있지만 FP16과의 gap 대부분이 남습니다.
해석
문제는 후반 layer의 weight 자체가 아닙니다.
초중반 layer에서 발생한 작은 activation error가 residual stream에 누적되어, 후반 layer에 도달했을 때 이미 representation이 오염되어 있다.
따라서 naive mixed precision, 즉 “마지막 몇 layer만 16-bit로 유지”하는 전략은 충분하지 않습니다.
10. Cross-model activation patching
10.1 기본 아이디어
같은 입력을 두 모델에 통과시킵니다.
- clean model: 16-bit full-precision
- corrupted model: 3-bit quantized
full-precision activation을 cache한 뒤, quantized model의 특정 module activation을 clean activation으로 대체합니다.
patch 후 perplexity가 크게 회복되면 해당 activation이 quantization failure에 중요한 원인이라는 뜻입니다.
이는 일반적인 activation patching과 거의 같지만, clean/corrupted input pair가 아니라 동일 input의 서로 다른 precision model pair를 사용한다는 점이 다릅니다.
10.2 패치 대상
Gated MLP는 다음과 같습니다.
패치 대상은 다음 네 가지입니다.
- : attention output
- : gate projection + activation output
- : up projection output
- : 전체 MLP output
upper half layer 전체에서 해당 component를 patch합니다.
10.3 주요 결과
Qwen2.5-7B, AWQ3
| 설정 | PPL |
|---|---|
| FP16 | 9.42 |
| AWQ3 | 12.26 |
| patch | 9.73 |
| patch | 10.20 |
| patch | 12.64 |
| patch attention | 11.12 |
Llama-3-8B, AWQ3
| 설정 | PPL |
|---|---|
| FP16 | 5.62 |
| AWQ3 | 10.68 |
| patch | 5.95 |
| patch | 6.42 |
| patch | 9.97 |
| patch attention | 9.27 |
Llama-3-70B, AWQ3
| 설정 | PPL |
|---|---|
| FP16 | 2.66 |
| AWQ3 | 5.25 |
| patch | 2.73 |
| patch | 2.94 |
| patch | 3.24 |
| patch attention | 4.73 |
전체적으로 MLP output 을 patch하면 FP16과의 perplexity gap이 0.5 이하로 줄어듭니다. 또한 gate output만 patch해도 거의 비슷한 수준으로 회복됩니다.
10.4 왜 MLP gate가 중요한가?
Gate는 up projection에서 생성된 feature를 얼마나 통과시킬지 결정합니다.
에서 gate activation의 작은 변화는 단순한 additive perturbation이 아닙니다.
예를 들어 어떤 gate dimension이 threshold 근처라면, 의 작은 quantization-induced perturbation이 nonlinear activation 를 통과하면서 해당 feature를 크게 켜거나 끌 수 있습니다. 는 가 민감한 구간에 있을 때 작지 않을 수 있습니다.
또한 그 차이가 과 곱해지므로, 가 됩니다. 자체가 크다면 gate 오차가 강하게 증폭됩니다.
10.5 Weight 문제가 아니라 input activation 문제
논문은 gate에 대해 추가로 비교합니다.
- 의 입력 activation을 patch
- 의 weight를 FP16으로 복구
Llama-3-8B NF3에서:
- gate input patch: PPL 6.53
- gate weight FP16 복구: PPL 10.45
즉, quantized gate weight만 복구해도 거의 해결되지 않습니다. 반면 gate로 들어가는 activation을 clean state로 바꾸면 크게 회복됩니다.
이는 논문의 핵심 주장을 강하게 지지합니다.
11. 어떤 데이터가 큰 양자화 오차를 만드는가?
11.1 Topic 분석
FineWeb topic classifier로 를 24개 topic으로 분류합니다.
Mistral-12B와 Llama-3-70B 모두 모든 24개 topic이 포함됩니다.
상위에는 대체로 다음이 포함됩니다.
- Entertainment
- Finance & Business
- Politics
- Health
- Science & Technology
그러나 어떤 topic도 전체의 12%를 넘지 않습니다.
따라서 large-error example은 특정 domain에 국한되지 않으며, 육안으로 보아도 특별히 비정상적인 문서가 아닙니다.
11.2 FineWeb long-tail 분석
full-precision Llama-3-70B의 NLL을 example rarity의 proxy로 사용합니다.
결과는 예상과 반대입니다.
Llama-3-70B에서 NLL 인 long-tail example의 평균 quantization error:
- AWQ3: 0.14
- GPTQ3: 0.30
반면 NLL 인 head-data example:
- AWQ3: 0.67
- GPTQ3: 1.00
즉, full-precision 모델이 잘 예측하는 데이터도 양자화 후 크게 손상될 수 있습니다. page 18의 Figure 16에서도 큰 quantization error를 가진 점들이 주로 낮은 NLL 영역에 넓게 분포합니다.
주의할 점
full-precision NLL은 엄밀한 데이터 frequency가 아닙니다. 다음 요인이 혼재합니다.
- 실제 training frequency
- 문장 구조의 난이도
- tokenization
- domain familiarity
- local predictability
따라서 “long-tail이 안전하다”기보다 “full-precision likelihood가 낮다고 반드시 quantization에 취약한 것은 아니다” 정도로 해석하는 것이 적절합니다.
11.3 PopQA 결과
PopQA entity popularity에 따른 quantization accuracy degradation을 분석합니다.
Mistral-12B NF3/AWQ3에서 가장 큰 degradation은 인 중간 popularity 영역에서 나타나며, accuracy가 10%p 이상 감소합니다.
반면:
- 가장 낮은 popularity bucket
- 가장 높은 popularity bucket
에서는 상대적으로 degradation이 작습니다.
page 18의 Figure 17을 보면 Qwen2.5-7B, Llama-3-8B, Llama-3-70B에서도 대체로 중간 또는 중상위 popularity bucket에서 손상이 커지는 비단조 패턴이 보입니다.
가장 높은 popularity bucket은 데이터의 약 6%에 불과하므로 표본 분포도 함께 고려해야 합니다.
12. 전체 quantization 성능
FineWeb과 WikiText의 perplexity는 다음과 같습니다.
| 모델 | FP16 | 대표 4-bit | 대표 3-bit |
|---|---|---|---|
| Qwen2.5-7B, FineWeb | 11.06 | AWQ4 11.35 | AWQ3 12.77 |
| Llama-3-8B, FineWeb | 9.57 | NF4 10.11 | AWQ3 12.13 |
| Mistral-12B, FineWeb | 8.67 | GPTQ4 9.02 | AWQ3 10.32 |
| Llama-3-70B, FineWeb | 7.15 | AWQ4 7.42 | AWQ3 8.40 |
대체로 4-bit는 FP16과 가까우나 3-bit에서 성능 저하가 뚜렷합니다. 다만 EfficientQAT3는 Llama-3-8B에서 FineWeb PPL 10.77로 AWQ3 12.13, NF3 12.45보다 우수합니다.
그럼에도 example-level error ordering은 서로 강하게 상관되므로, 평균 PPL이 좋은 방법도 동일한 vulnerable input subset에서 상대적으로 큰 오류를 낼 수 있습니다.
13. 논문의 주요 공헌
13.1 Aggregate metric에서 example-level analysis로 전환
기존 quantization 연구가 를 최소화하는 데 집중했다면, 이 논문은 error distribution의 tail과 input-conditioned vulnerability를 분석합니다.
이는 실제 deployment에서 중요합니다. 평균 PPL 저하가 작더라도:
- 특정 prompt
- 특정 factual query
- 특정 document
- 특정 high-stakes input
에서만 catastrophic degradation이 발생할 수 있기 때문입니다.
13.2 Full-precision model만으로 취약성을 예측할 가능성
마지막 layer residual magnitude만으로 quantization error와 수준의 correlation을 얻습니다.
이는 모든 quantized checkpoint를 실제로 실행하지 않고도 다음을 할 가능성을 제시합니다.
즉, full-precision forward pass에서 residual statistics를 추출해 quantization-risk predictor를 학습할 수 있습니다.
13.3 RMSNorm의 간접적 역할 발견
RMSNorm weight는 양자화되지 않지만, activation scale을 재배치함으로써 quantized layer의 sensitivity를 결정합니다.
이는 quantization-friendly architecture 설계에서 다음 요소를 함께 고려해야 함을 의미합니다.
- weight quantizer
- normalization
- gate nonlinearities
- residual accumulation
13.4 MLP gate의 causal localization
단순 correlation에서 멈추지 않고 activation patching을 사용하여 MLP gate activation의 causal importance를 보였습니다.
특히:
- MLP output patch: 거의 완전 회복
- gate output patch: 대부분 회복
- up projection patch: 효과 작음
- attention patch: 효과 작음
- gate weight FP16 복구: 효과 작음
- gate input patch: 큰 효과
라는 일관된 결과가 중요합니다.
14. 논문의 한계와 비판적 평가
14.1 NLL 중심의 intrinsic analysis
주요 분석은 FineWeb NLL에 집중합니다. downstream task는 PopQA 하나뿐입니다.
논문은 perplexity가 quantized LLM의 일반적 성능을 잘 반영한다는 선행연구를 근거로 들지만, 다음 task에서는 다른 현상이 나타날 수 있습니다.
- instruction following
- reasoning
- long-context retrieval
- code generation
- safety alignment
- multilingual generation
저자들도 이 점을 limitation으로 명시합니다.
14.2 Input sequence length가 512로 제한됨
FineWeb 문서를 512 token으로 truncate합니다.
긴 context에서는 residual error가 더 오랫동안 누적될 수 있으므로, 관계가 달라질 수 있습니다.
특히 KV-cache quantization이나 activation quantization에서는 context length가 훨씬 직접적인 변수가 됩니다.
14.3 Weight-only quantization에 한정
본 연구의 mechanism은
에서 large 가 weight error를 증폭하는 현상에 기반합니다.
activation도 양자화하는 W4A4, W8A8에서는 추가로 , 가 발생합니다. 따라서 본 논문의 설명이 그대로 충분하지 않을 수 있습니다.
14.4 Residual magnitude는 원인이라기보다 marker일 수 있음
논문은 RMSNorm과 MLP patching으로 상당한 causal evidence를 제공합니다. 그러나 small residual magnitude 자체를 직접 개입하여 quantization error가 변하는지를 검증하지는 않습니다.
예를 들어 다음 intervention이 추가되면 더 강한 인과 검증이 됩니다.
또는 residual direction은 유지하되 norm만 조작하는 실험입니다.
다만 RMSNorm에서는 단순 scalar scaling이 대부분 제거되므로, dimension-wise structure나 kurtosis를 조작하는 실험이 필요합니다.
14.5 Patching intervention의 범위가 넓음
upper half 모든 layer에서 특정 activation type을 동시에 patch합니다.
따라서 “어느 layer의 어떤 gate가 핵심인가?”까지 세밀하게 localization되지는 않습니다.
보다 정교한 후속 분석으로는 다음이 가능합니다.
을 layer/component별로 계산하고, sparse causal circuit를 추출할 수 있습니다.
14.6 방법별 configuration이 통일되지 않음
저자들은 각 방법의 원래 구현을 따르기 위해 calibration data, group size, training 여부를 통일하지 않았습니다.
- GPTQ: C4
- AWQ: Pile
- EQAT: RedPajama
- NF: calibration-free에 가까운 codebook quantization
이는 method diversity를 확보한다는 장점이 있지만, method 간 error correlation에 calibration data나 group size가 미치는 영향을 완전히 통제하지는 못합니다.
다만 GPTQ 내부 configuration을 바꾼 실험에서도 높은 correlation이 유지되어 핵심 결론은 어느 정도 보강됩니다.
14.7 2-bit 이하를 다루지 않음
저자들은 2-bit 이하에서 perplexity가 이상으로 폭증하고 commonsense QA가 거의 random 수준이 되어 세밀한 원인 분석이 어렵다고 설명합니다.
그러나 실제로는 2-bit·1.58-bit quantization이 중요한 연구 주제이므로, 본 mechanism이 extreme low-bit에서도 유지되는지는 별도 검증이 필요합니다.
15. 이 논문이 제안하는 후속 연구 방향
15.1 Quantization vulnerability predictor
full-precision activation에서 다음 feature를 추출할 수 있습니다.
이를 이용하여 를 학습하면, 특정 입력이 3-bit inference에서 위험한지 사전에 예측할 수 있습니다.
배포 시에는:
- 저위험 입력: 3-bit
- 고위험 입력: 4-bit 또는 FP16
- 고위험 token span만 higher precision
과 같은 dynamic precision routing이 가능합니다.
15.2 Input-adaptive mixed precision
논문은 “late layers만 FP16으로 복구”하는 naive mixed precision은 실패함을 보입니다.
더 적절한 접근은 입력별 activation risk를 보고 layer를 동적으로 선택하는 것입니다.
특히 MLP gate의 input 또는 gate projection만 높은 precision으로 처리하는 selective scheme이 유망합니다.
15.3 Gate-aware quantization objective
기존 layer reconstruction objective가 라면, gate의 downstream importance를 반영하여 를 직접 최소화할 수 있습니다.
또는 final MLP output을 기준으로 를 사용하면 gate interaction을 더 충실하게 보존할 수 있습니다.
15.4 RMSNorm-aware scaling
AWQ는 주로 pre-layer activation statistics를 사용합니다. 그러나 이 논문에 따르면 실제 quantized MLP input인 의 input-conditioned distribution을 고려해야 합니다.
따라서 calibration objective에 다음을 포함할 수 있습니다.
- post-RMSNorm channel magnitude
- example-level maximum risk
- residual kurtosis
- RMSNorm 와 outlier alignment
- tail quantile loss
평균 reconstruction error 대신 worst-case 또는 CVaR objective도 가능합니다.
이는 평균 PPL보다 large-error tail을 직접 줄이는 방식입니다.
16. 최종 요약
이 논문의 논리적 흐름은 다음과 같습니다.
- 서로 다른 양자화 방법이 같은 입력에서 실패한다.
method-pair error correlation 평균은 0.82이다. - 취약성은 full-precision model에서 이미 관찰된다.
upper-layer residual magnitude가 작을수록 최종 quantization error가 크며, correlation은 최대 약 -0.8이다. - 작은 residual이 곧 작은 MLP input을 뜻하지 않는다.
RMSNorm과 가 outlier dimension을 억제하면서 input 간 magnitude 순서를 뒤집는다. - large-error input은 post-RMSNorm activation이 크다.
이 activation이 quantized weight error 를 증폭한다. - 오차가 residual stream을 따라 누적된다.
late layer weight만 FP16으로 복구해도 거의 해결되지 않는다. - MLP, 특히 gate activation이 핵심이다.
gate output 또는 gate input activation을 patch하면 perplexity가 대부분 회복된다. - 취약한 데이터는 특정 topic이나 단순 long-tail 데이터가 아니다.
오히려 full-precision likelihood가 높은 head-data와 중간 popularity entity가 크게 손상되는 경우가 많다.
따라서 이 논문의 가장 중요한 메시지는 다음과 같습니다.
기존 양자화 연구가 “각 weight를 얼마나 정확히 근사하는가”에 초점을 맞췄다면, 이 논문은 앞으로는 어떤 입력에서 그 작은 weight error가 증폭되는가까지 고려해야 한다고 주장합니다.
답글 남기기