* Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation (IJCNLP 2025)

https://www.dropbox.com/scl/fi/tetc664rcpyjs0ei6jv2a/ijcnlp25_Multilingual_Neural_Topography.pdf?rlkey=z6p27xj789bwgqtfkandchnk7&dl=0

이 논문은 LLM 내부에서 특정 언어를 담당하는 language-specific neuron을 체계적으로 찾고, 그 뉴런을 조작해 출력 언어와 다국어 태스크 성능을 제어할 수 있는지를 분석합니다. 대상 모델은 Llama-3.1-8B, Mistral-Nemo-12B, Aya-Expanse-8B/32B이고, 21개 언어를 다룹니다.  

핵심 주장은 다음입니다.

특정 언어에 민감하게 반응하는 FFN 뉴런들이 존재하며, 이 뉴런들은 주로 후반 layer에 집중되어 있다. 이 뉴런들을 더하거나 끄는 방식의 language arithmetics를 적용하면 모델의 출력 언어를 조작하고, 일부 다국어 태스크 성능도 향상시킬 수 있다.


1. 문제의식

기존 연구들은 LLM이 다국어 능력을 보이는 이유를 설명하기 위해 language neuron을 분석했습니다. 하지만 한계가 있었습니다.

  1. 언어 수가 적음
  2. 특정 모델에만 집중
  3. neuron 식별은 했지만, 실제 조작 가능성은 제한적
  4. activation replacement 방식이 모델 내부 표현을 많이 훼손할 수 있음

이 논문은 이를 확장하여 다음을 수행합니다.

목적내용
Language neuron 식별LAPE로 언어별 특화 뉴런 찾기
Layer-wise 분석언어 정보가 어느 layer에서 나타나는지 logit lens로 분석
Neuron overlap 분석언어 계통·문자 체계별 공유 뉴런 분석
Language manipulation특정 언어 뉴런을 활성화/비활성화하여 출력 언어 제어
Downstream task 평가MT, QA, NLI, reading comprehension에서 성능 변화 측정

2. 방법론

2.1 Language-specific neuron 식별: LAPE

논문은 Tang et al.의 Language Activation Probability Entropy, LAPE를 사용합니다.

Transformer FFN의 특정 layer i, neuron j에 대해 언어 k 입력을 넣었을 때 해당 뉴런이 활성화되는 확률을 계산합니다.

pi,jk=𝔼[𝟏(act_fn(h~iWi1)j>0)|language k]p^k_{i,j}=\mathbb{E}[\mathbf{1}(\text{act\_fn}(\tilde{h}_i W_i^1)_j > 0)\mid \text{language } k]

즉, 어떤 뉴런이 특정 언어 입력에서 얼마나 자주 positive activation을 보이는지 측정합니다.

그다음 모든 언어에 대한 activation probability vector를 만듭니다.

pi,j=(pi,j1,pi,j2,...,pi,jl)p_{i,j} = (p^1_{i,j}, p^2_{i,j}, …, p^l_{i,j})

이를 L1 normalize한 뒤 Shannon entropy를 계산합니다.

LAPEi,j=k=1lpi,jklogpi,jk\text{LAPE}_{i,j}=-\sum_{k=1}^{l}p’^k_{i,j}\log p’^k_{i,j}

해석은 간단합니다.

LAPE 값의미
낮음특정 1~2개 언어에서만 강하게 활성화됨 → language-specific
높음여러 언어에서 고르게 활성화됨 → language-general

2.2 Neuron 선택 절차

논문은 3단계 필터링을 합니다.

  1. 약한 뉴런 제거
    어떤 언어에서도 activation probability가 95 percentile을 넘지 못하면 제거합니다.
  2. 낮은 LAPE 뉴런 선택
    남은 뉴런 중 LAPE가 낮은 bottom K%K\%를 선택합니다.
    K=1,2,3,4,5%K = 1, 2, 3, 4, 5\%
  3. 언어 할당
    선택된 뉴런이 특정 언어에서 activation probability 95 percentile 이상이면 그 언어의 뉴런으로 할당합니다.

중요한 점은 하나의 뉴런이 여러 언어에 할당될 수도 있다는 것입니다. 특히 유사한 언어군에서는 overlap이 발생합니다.


2.3 Per-layer output language 분석: Logit Lens

단순히 뉴런만 보는 것이 아니라, 각 layer의 hidden state를 vocabulary logit으로 투영한 뒤 FastText language classifier로 “이 layer가 어떤 언어를 생성하려 하는가”를 분석합니다.

측정한 값은 세 가지입니다.

분석 항목의미
Target language probability입력/목표 언어가 어느 layer에서 나타나는가
English probability영어가 얼마나 강한 prior로 유지되는가
Language entropy출력 언어 분포의 불확실성

이 분석을 통해 언어 결정이 주로 마지막 layer 부근에서 확정된다는 것을 보입니다.


3. Language Arithmetics: 뉴런 조작 방법

논문의 핵심 기여는 activation replacement가 아니라 additive intervention을 사용한다는 점입니다.

3.1 기존 방식: Replacement

기존 연구는 특정 언어 뉴런의 activation을 평균값이나 중앙값으로 대체했습니다.

예:

a:,iμitargeta_{:,i} \leftarrow \mu_i^{\text{target}}

문제는 원래 문맥 정보가 사라질 수 있다는 점입니다.


3.2 제안 방식: Additive Activation

논문은 target language neuron에 대해 평균 activation boost bib_i를 더합니다.

a:,ia:,i+bia_{:,i} \leftarrow a_{:,i} + b_i

여기서 aL×Da \in \mathbb{R}^{L \times D}는 FFN activation tensor이고, I는 target language-specific neuron 집합입니다.

즉, 원래 activation은 유지하면서 target language signal만 추가합니다.


3.3 Deactivation + Activation

Language forcing에서는 두 가지를 동시에 합니다.

  1. Source language neuron 비활성화

a:,i0a_{:,i} \leftarrow 0

  1. Target language neuron 활성화

a:,ia:,i+bia_{:,i} \leftarrow a_{:,i} + b_i

예를 들어 독일어 입력을 넣고 일본어 출력을 강제하려면:

  • German neurons deactivate
  • Japanese neurons activate

이 방식이 가장 좋은 성능을 냅니다.


4. 실험 설정

4.1 모델

모델특징
Llama-3.1-8Bbase model, 영어 중심, non-English pretraining 약 5%
Mistral-Nemo-12Bmultilingual 성능이 강한 base model
Aya-Expanse-8Binstruction-tuned multilingual model
Aya-Expanse-32B더 큰 multilingual instruction model

4.2 언어

총 21개 언어를 사용합니다.

  • Germanic: English, German, Dutch, Afrikaans, Swedish, Danish, Norwegian
  • Romance: French, Spanish, Italian, Portuguese
  • Slavic: Russian, Polish
  • Sino-Tibetan: Chinese, Tibetan
  • 기타: Korean, Japanese, Arabic, Hindi, Turkish, Maltese

4.3 데이터

Neuron identification

CulturaX corpus 사용.

  • 167개 언어
  • 6.3T tokens 규모
  • 각 언어당 500MB, 약 100M tokens로 제한

Downstream evaluation

TaskDatasetMetric
Language forcing자체 구성 6개 질문output language success rate
Machine translationFLORES-200BLEU
QAXQuADF1
NLIXNLIAccuracy
Reading comprehensionBelebeleAccuracy

5. 실험 결과

5.1 Language-specific neuron은 후반 layer에 집중됨

Llama-3.1, Mistral-Nemo, Aya-Expanse 모두에서 language-specific neuron은 주로 후반 layer에 집중됩니다.

특히 Llama-3.1에서는:

  • layer 0–15: language-specific activity가 작음
  • layer 17–28: 강한 집중
  • layer 27–28: peak

이는 이전 연구에서 보고된 “초반 layer와 후반 layer 모두에 language neuron이 있다”는 결과와 다릅니다.

논문은 최신 multilingual/large model에서는 언어 결정이 더 후반 layer에 집중될 수 있다고 해석합니다.


5.2 비라틴 문자 언어는 더 많은 language neuron을 가짐

Llama-3.1 top 1% 기준 language-specific neuron 수는 다음과 같습니다.

언어뉴런 수
Tibetan1492
Hindi781
Chinese681
Japanese638
Korean556
English61

흥미롭게도 영어는 매우 적은 language-specific neuron만 가집니다.

해석은 다음과 같습니다.

  • 영어는 base language 또는 default language처럼 넓게 분산되어 있을 수 있음
  • 비라틴 문자 언어는 orthography/script 차이 때문에 더 명확한 전용 뉴런이 필요할 수 있음
  • Tibetan, Chinese, Hindi 등은 Latin-script 언어와 neuron overlap이 작음

5.3 관련 언어끼리는 neuron overlap이 큼

Germanic language 사이의 overlap이 큽니다.

예를 들어 Llama-3.1 top 1% 기준:

언어 쌍Overlap
Swedish–Danish290 neurons
Dutch–Afrikaans250 neurons

이는 언어 계통, 어휘, orthography가 유사한 언어들이 내부 표현도 일부 공유한다는 것을 시사합니다.

즉, 모델 내부에는 어느 정도 linguistic proximity structure가 반영되어 있습니다.


5.4 Logit lens 결과: 언어 출력 결정은 마지막 layer에서 강해짐

Llama-3.1과 Mistral-Nemo 같은 영어 중심 모델에서는:

  • 영어 token probability가 초반부터 존재
  • target language token은 주로 후반 layer에서 급격히 증가
  • language entropy는 후반으로 갈수록 증가

Aya-Expanse 계열에서는:

  • 영어와 target language가 여러 layer에서 함께 약하게 존재
  • 마지막 layer로 갈수록 entropy가 감소
  • 최종 layer에서 특정 언어로 수렴

해석하면, 영어 중심 모델은 기본적으로 영어 prior가 강하고, 비영어 출력은 후반 layer에서 결정되는 경향이 있습니다.


6. Language Forcing 결과

Language forcing은 입력 언어와 무관하게 원하는 target language로 답하게 하는 실험입니다.

예:

Input: Q: Wie geht es dir heute? A:
Target: Japanese
Output: 今日は元気です。

6.1 Llama-3.1 결과

Top 5% neuron 기준 성공률은 다음과 같습니다.

방법Activate onlyDeactivate + Activate
Additive43.31%55.40%
Replacement32.80%42.78%
DiffMean37.49%51.17%

핵심 결과는 명확합니다.

Additive Deactivate + Activate가 가장 좋습니다.

즉, target language neuron만 켜는 것보다 source language neuron을 끄고 target language neuron을 켜는 것이 더 효과적입니다.


6.2 왜 Additive가 Replacement보다 좋은가?

논문의 해석은 다음과 같습니다.

Replacement는 원래 hidden activation을 평균값으로 덮어쓰기 때문에 문맥 정보가 손상됩니다.

반면 additive 방식은:

a:,ia:,i+bia_{:,i} \leftarrow a_{:,i} + b_i

이므로 원래 activation을 보존하면서 target language signal을 추가합니다.

따라서 모델의 기존 reasoning/context representation을 덜 파괴하고, 언어 방향만 조정할 수 있습니다.


6.3 고자원 언어일수록 조작이 잘 됨

Language forcing은 다음 언어에서 잘 됩니다.

  • Chinese
  • Korean
  • Japanese
  • German
  • French
  • Spanish 등

반면 저자원 또는 pretraining representation이 약한 언어는 제어가 어렵습니다.

이는 language neuron이 충분히 강하고 분리되어 있어야 조작이 잘 된다는 것을 의미합니다.


7. Downstream Task 결과

논문은 target language neuron을 활성화했을 때 downstream task 성능이 어떻게 변하는지 봅니다.

7.1 전체 경향

대부분의 경우 target language neuron 활성화는 성능을 향상시킵니다.

논문은 일반적으로 5–15% 정도의 성능 향상을 보고합니다.


7.2 Machine Translation: FLORES-200

  • Metric: BLEU
  • Target language neuron을 활성화하면 번역 출력 언어가 더 안정됨
  • 최대 약 10% 수준의 향상 보고

하지만 non-target language neuron을 활성화하면 오히려 출력이 그 언어로 끌려가서 성능이 떨어질 수 있습니다.

즉, 생성 태스크에서는 언어 조작이 강하게 작동하기 때문에 target language와 맞지 않으면 negative transfer가 발생합니다.


7.3 QA: XQuAD

  • Metric: F1
  • Target language neuron 활성화 시 성능 향상
  • 하지만 FLORES처럼 생성형 태스크라서 언어 혼동이 발생할 수 있음
  • Non-target activation은 종종 성능 저하를 유발

7.4 Reading Comprehension: Belebele

  • Metric: Accuracy
  • Target language activation이 성능 향상
  • 또한 같은 language family 내 cross-lingual transfer가 관찰됨

예를 들어 Romance language neuron을 켜면 다른 Romance language task에도 도움이 되는 경우가 있습니다.


7.5 NLI: XNLI

  • Metric: Accuracy
  • Llama-3.1에서 target language activation이 성능 향상
  • Discriminative task라서 generation language confusion이 덜함
  • Germanic, Romance language 내부에서 positive transfer가 나타남

즉, 분류 태스크에서는 언어 뉴런이 단순히 출력 언어만 바꾸는 것이 아니라, 해당 언어의 문장 이해에도 도움을 줄 수 있습니다.


8. Language fallback 실험

논문은 특정 고자원 언어 neuron을 순차적으로 비활성화하면 모델이 어떤 언어로 fallback하는지 봅니다.

실험 방식:

  • Vicuna English questions 70개 사용
  • high-resource language neuron을 하나씩 deactivate
  • 출력 언어를 FastText로 판별

결과:

DeactivationFallback 경향
English 제거Spanish, French, Russian 일부 증가
English + French 제거Russian, Italian, Spanish, Arabic
Spanish/Italian/Portuguese 추가 제거Russian, Arabic, Chinese
German/Russian/Arabic 제거Thai, Vietnamese, Chinese

중요한 점은 영어 neuron을 꺼도 영어 출력이 완전히 사라지지는 않는다는 것입니다.

이는 영어가 단순한 language-specific neuron 집합에만 저장된 것이 아니라, 모델 전체의 강한 prior로 분산되어 있음을 시사합니다.


9. 논문의 핵심 기여

기여 1: 대규모 language neuron 분석

21개 언어, 4개 모델에서 language-specific neuron을 분석했습니다.

기존 연구보다 언어 수와 모델 범위가 넓습니다.


기여 2: 언어 뉴런이 후반 layer에 집중됨을 보임

최신 LLM에서는 language-specific neuron이 주로 mid-to-late layer에 존재합니다.

이는 multilingual language selection이 후반부에서 결정된다는 logit lens 결과와도 일치합니다.


기여 3: Additive language arithmetic 제안

기존 replacement보다 덜 파괴적인 방식입니다.

a:,ia:,i+bia_{:,i} \leftarrow a_{:,i} + b_i

Language forcing에서 replacement와 DiffMean보다 더 좋은 성능을 보입니다.


기여 4: Downstream 성능 향상

단순히 출력 언어를 바꾸는 데 그치지 않고, MT, QA, NLI, comprehension에서도 target language neuron activation이 성능을 높입니다.


10. 한계와 비판적 평가

10.1 Neuron 단위 분석의 한계

논문은 FFN neuron을 중심으로 분석합니다. 하지만 실제 언어 표현은 다음처럼 더 복잡할 수 있습니다.

  • attention head
  • residual stream direction
  • SAE feature
  • neuron circuit
  • distributed subnetwork

따라서 language-specific neuron이 causal unit이라고 단정하기는 어렵습니다.


10.2 FastText 기반 언어 판별의 한계

Language forcing 성공률은 FastText classifier로 측정합니다.

하지만 짧은 생성문이나 코드스위칭이 있는 출력에서는 FastText 판별이 부정확할 수 있습니다.


10.3 품질 평가 부족

원하는 언어로 출력하는지는 평가하지만, 그 출력이 실제로 자연스럽고 의미적으로 정확한지는 충분히 평가하지 않습니다.

특히 저자원 언어 forced output의 fluency와 adequacy 평가는 부족합니다.


10.4 Activation boost 크기의 민감도

논문은 평균 activation b_i를 더합니다. 하지만 다음 요소에 따른 민감도 분석은 제한적입니다.

  • boost scale
  • layer별 scaling
  • token position별 intervention
  • neuron ratio K
  • source/target language similarity

10.5 Circuit-level 분석 부족

이 연구는 language neuron을 찾고 조작하지만, “언어 선택 회로” 전체를 밝히지는 않습니다.

향후에는 다음 방향이 중요합니다.

Language neuronlanguage featurelanguage circuitsteering subspace\text{Language neuron}\rightarrow\text{language feature}\rightarrow\text{language circuit}\rightarrow\text{steering subspace}

즉, EAP, SAE, circuit discovery와 결합하면 더 강한 해석 가능성이 있습니다.


11. 요약

이 논문은 language-specific neuron을 식별하고 조작하여 LLM의 다국어 행동을 제어할 수 있음을 보인 연구입니다.

가장 중요한 결론은 다음입니다.

  1. Language-specific neuron은 주로 후반 layer에 집중된다.
  2. 비라틴 문자 언어는 더 많은 특화 뉴런을 가진다.
  3. 관련 언어끼리는 neuron overlap이 크다.
  4. Additive activation 방식은 replacement나 DiffMean보다 효과적이다.
  5. Source language neuron을 끄고 target language neuron을 켜면 language forcing 성공률이 가장 높다.
  6. Target language neuron activation은 MT, QA, NLI, comprehension 성능을 향상시킬 수 있다.
  7. 고자원 언어 prior는 강해서 neuron deactivation 후에도 fallback 현상이 나타난다.


게시됨

카테고리

,

작성자

댓글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다