[카테고리:] Neuron
-

* Unraveling LLM Jailbreaks Through Safety Knowledge Neurons (EACL 2026)
https://www.dropbox.com/scl/fi/wz3fsywxso9q074mnd60a/eacl26_Mapping_LLM_Safety_Neurons.pdf?rlkey=204lilpoeoz69mpth0wgrl4bt&dl=0 논문 개요 핵심 질문: 정렬된 LLM이 유해 요청을 거부하거나 정상 요청에 응답하도록 만드는 내부 메커니즘을, MLP 뉴런 수준에서 찾고 조작할 수 있는가? 논문의 주장은 다음과 같습니다. 1. 논문의 전체 구조 논문은 크게 세 단계로 구성됩니다. 단계 목적 제안 방법 1 안전 관련 뉴런 탐색 및 해석 Safety Knowledge Neuron Identification 2 해당 뉴런의 인과적…
-

** The Achilles’ Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities (ICLR 2026)
https://www.dropbox.com/scl/fi/ghq9k5fbg9z6afwwac9t6/iclr26_The_Achilles_Heel_of_LLMs.pdf?rlkey=n3y4fj90q7eu1es2mmf83k06q&dl=0 아래 논문은 LLM 내부에 “극소수의 치명적 뉴런(critical neurons)”이 존재하며, 이 뉴런 몇 개를 0으로 마스킹하면 거대 모델도 언어 능력이 붕괴한다는 주장을 실험적으로 보이는 논문입니다. 1. 핵심 아이디어 논문의 질문은 다음입니다. LLM에도 인간 뇌처럼 핵심 기능을 좌우하는 소수의 critical neuron이 존재하는가? 저자들의 결론은 그렇다입니다. 특히 놀라운 주장은 다음입니다. 2. 문제 정의 모델 전체 뉴런 집합을…
-

* Style-Specific Neurons for Steering LLMs in Text Style Transfer (ArXiv 2024)
https://www.dropbox.com/scl/fi/461zskxov2ve5qi58l7yw/arxiv24_Precision_Neural_Style_Control.pdf?rlkey=0q95lefm357wr4h0c6vszlmck&dl=0 이 논문은 LLM 내부에 “문체(style)-특화 뉴런”이 존재한다고 보고, 이를 이용해 Text Style Transfer(TST) 를 디코딩 단계에서 제어하는 방법인 sNeuron-TST를 제안합니다. 목표는 입력 의미는 유지하면서, 예를 들어 informal→formal, toxic→neutral, impolite→polite처럼 문체만 바꾸는 것입니다. 기존 LLaMA-3는 zero-shot TST에서 입력을 그대로 복사하는 경향이 크며, polite→impolite 변환에서는 약 34% 출력이 입력과 동일했다고 보고합니다. 1. 문제의식 TST는 다음…
-

* Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation (IJCNLP 2025)
https://www.dropbox.com/scl/fi/tetc664rcpyjs0ei6jv2a/ijcnlp25_Multilingual_Neural_Topography.pdf?rlkey=z6p27xj789bwgqtfkandchnk7&dl=0 이 논문은 LLM 내부에서 특정 언어를 담당하는 language-specific neuron을 체계적으로 찾고, 그 뉴런을 조작해 출력 언어와 다국어 태스크 성능을 제어할 수 있는지를 분석합니다. 대상 모델은 Llama-3.1-8B, Mistral-Nemo-12B, Aya-Expanse-8B/32B이고, 21개 언어를 다룹니다. 핵심 주장은 다음입니다. 특정 언어에 민감하게 반응하는 FFN 뉴런들이 존재하며, 이 뉴런들은 주로 후반 layer에 집중되어 있다. 이 뉴런들을 더하거나 끄는 방식의…
-

*** Constructing Interpretable Features from Compositional Neuron Groups (ArXiv 2025)
https://www.dropbox.com/scl/fi/0k824k40lfp40ty5e577b/arxiv25_Decoding_LLM_Compositionality_with_SNMF.pdf?rlkey=35n0ah3ekwfss7etlwg1jxv6n&dl=0 이 논문은 최근 SAE(Sparse Autoencoder) 중심의 mechanistic interpretability 연구에 대해 상당히 흥미로운 문제 제기를 합니다. 핵심 질문은: “LLM 내부의 의미(concept)를 표현하는 진짜 단위(unit)는 무엇인가?” 입니다. 기존에는 등이 주로 사용되었는데, 저자들은 “실제로는 여러 neuron들이 조합(composition)되어 하나의 개념을 표현한다” 고 주장하며, MLP activation을 SNMF(Semi-Nonnegative Matrix Factorization)로 분해하여 neuron group 기반 feature를 찾는 방법을 제안합니다. 1.…
-

* Finding Neurons in a Haystack: Case Studies with Sparse Probing (ArXiv 2023)
https://www.dropbox.com/scl/fi/2xl6vrrw9zzoi0fcwi5wi/arxiv23_X-Raying_the_Black_Box.pdf?rlkey=3wnl2yjc5qoc3sxpebjvunfin&dl=0 이 논문은 **“LLM 내부에서 특정 개념(feature)이 몇 개의 뉴런에 의해 표현되는가?”**를 체계적으로 분석한 연구이다. 특히 기존 probing 연구를 확장하여 Sparse Probe를 사용함으로써 특정 feature와 관련된 뉴런을 매우 정밀하게 찾고, 이를 통해 monosemantic neuron, polysemantic neuron, superposition 현상을 실증적으로 분석한다. 1. 연구 배경 Mechanistic Interpretability 분야에서는 오래전부터 다음 질문이 존재했다. “특정 뉴런 하나가 하나의…
-

* On Relation-Specific Neurons in Large Language Models (EMNLP 2025)
https://www.dropbox.com/scl/fi/7pm0homk42j0ndddk25qy/emnlp25_Mapping_LLM_Relation_Neurons.pdf?rlkey=6hz21la0g3x4mti2fk4q23pt8&dl=0 이 논문은 **“LLM 내부에 특정 사실(fact)을 저장하는 neuron이 아니라, 특정 관계(relation) 자체를 처리하는 neuron이 존재하는가?”**를 분석한 연구입니다. 기존 연구의 Knowledge Neuron은 (NVIDIA, CEO, Jensen Huang) 이라는 사실 전체를 저장하는 뉴런을 찾으려 했습니다. 반면 이 논문은 CEO 관계 자체를 담당하는 neuron 즉, 처럼 entity가 달라도 공통적으로 활성화되는 Relation-Specific Neuron (RelSpec Neuron) 이 존재하는지를 탐구합니다.…
-

Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer (The Sixth Workshop on Insights from Negative Results in NLP 2025)
https://www.dropbox.com/scl/fi/w1wk2k686rdrnxflz4rpp/insights-acl25_The_Language_Switch_Myth.pdf?rlkey=2bs8h9089xa7c7rl91k2969uk&dl=0 이 논문은 다음 질문에 답하려는 연구입니다: “멀티링구얼 LLM 내부의 language-specific neuron(언어 특화 뉴런)을 조작하면 low-resource 언어의 cross-lingual 성능을 향상시킬 수 있는가?” 결론부터 말하면: 거의 효과가 없었다. 오히려 language neuron 조작이 task 성능을 망가뜨리는 경우가 많았으며,이는 뉴런이 단순히 “언어 정보만” 저장하는 것이 아니라task 정보까지 함께 담고 있기 때문이라고 분석합니다. 1. 핵심 배경 최근 multilingual LLM…
-

* Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models (Findings of EMNLP 2025)
https://www.dropbox.com/scl/fi/mctlhymhvdyayqn39o8uz/femnlp25_Surgical_Mitigation_of_LLM_Language_Confusion.pdf?rlkey=ll1e382d05a6z4rn4q5b686fo&dl=0 1. 문제 정의: Language Confusion 핵심 현상 유형 예시 (논문 Fig.1): 2. 핵심 개념: Confusion Point (CP) 정의 –> 매우 중요한 insight: 실험 결과 Table 2 (page 4) –> language confusion은 “local failure”임을 보여줌 3. Mechanistic Insight (핵심 기여) 3.1 Layer-wise 분석 (TunedLens 사용) 관찰 (page 5, Fig.2) 결론 language confusion =“latent → surface…
-

** Neuron-Level Knowledge Attribution in Large Language Models (EMNLP 2024)
https://www.dropbox.com/scl/fi/aqdb67mns9fzhmn3grtt9/emnlp24_LLM_-_.pdf?rlkey=zsjqywa861gc88il4s1tuvsdz&dl=0 아래는 EMNLP 2024 논문 “Neuron-Level Knowledge Attribution in Large Language Models” 의 핵심 내용을 정리한 설명입니다. 논문 개요 이 논문은 LLM 내부에서 특정 지식(facts)이 어떤 뉴런(neuron)에 저장되는지 정량적으로 찾아내는 뉴런 수준(neuron-level) attribution 방법을 제안합니다. 피쳐 단위(head, layer)보다 더 미세한 수준입니다. 기존 기법은 논문은 이를 해결하기 위해: 을 수행합니다. 배경 (왜 뉴런 수준인가?) 이전 연구들(Geva…
-

* Investigating Neuron Ablation in Attention Heads: The Case for Peak Activation Centering (ArXiv 2024)
https://www.dropbox.com/scl/fi/iusmemx5gcdeakmjdx1mf/arxiv24_Peak_Activation_Ablation_Refined.pdf?rlkey=vec9sbmc0suns5j1fu1jy5gh6&dl=0 논문 “Investigating Neuron Ablation in Attention Heads: The Case for Peak Activation Centering” (Pochinkov et al., 2024) 은 Transformer 기반 모델의 주의(attention) 뉴런 해석과 절제(ablation) 방법을 체계적으로 비교하고, 새로운 방식인 **Peak Ablation (정점 중심 절제)**을 제안한 연구입니다. 아래에 핵심 내용을 구조적으로 정리했습니다. 1. 연구 배경 및 문제의식 기존 절제 방식: 2. 제안 개념: Peak…
-

*** Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis (ACL 2025)
https://www.dropbox.com/scl/fi/50rg8jb42dmsn3z0ssd46/acl25_Shortcut_Neurons_for_Trust.pdf?rlkey=2ob5vxseeql874rys9zxu7d53&dl=0 논문 “Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis” (ACL 2025) 은 데이터 오염(data contamination) 문제로 인해 LLM 평가의 신뢰성이 손상되는 문제를 해결하기 위해, 모델 내부의 “지름길 뉴런(shortcut neurons)”을 분석하고 억제함으로써 공정하고 신뢰할 수 있는 평가를 수행하는 방법을 제안한 연구입니다. 아래는 주요 내용 요약입니다. 연구 배경 및 문제의식 따라서 이 논문은 모델 내부의 원인,…
-

** MicroEdit: Neuron-level Knowledge Disentanglement and Localization in Lifelong Model Editing (EMNLP 2025)
https://www.dropbox.com/scl/fi/3hq3upapbu6c5qtj837gu/emnlp25_Precision_Knowledge_Editing.pdf?rlkey=ntq0467im52fct5fxd8n4ralm&dl=0 논문 “MicroEdit: Neuron-level Knowledge Disentanglement and Localization in Lifelong Model Editing” (EMNLP 2025) 은 대형 언어모델(LLM)의 지속적인 지식 편집(lifelong model editing) 문제를 다루며, 기존 방법들이 가지는 두 가지 핵심 한계를 정량적으로 분석하고, 이를 해결하기 위해 Sparse Autoencoder(SAE) 기반의 뉴런 단위 최소 편집(neuron-level minimal editing) 기법을 제안합니다 . 1. 연구 배경 및 문제점 LLM은 대규모…
-

*** Investigating Neurons and Heads in Transformer-based LLMs for Typographical Errors (EMNLP 2025)
https://www.dropbox.com/scl/fi/gp6ndikwx0f5ixkh9zvfh/emnlp25_LLM_Anatomy_Typo_Repair.pdf?rlkey=8mw795n9div8ewi6uoju5vlqf&dl=0 다음은 **EMNLP 2025 논문 “Investigating Neurons and Heads in Transformer-based LLMs for Typographical Errors”**에 대한 핵심 정리입니다. 연구 동기 LLM 입력에는 종종 **오타(typo)**가 포함되며, 모델은 때때로 이를 내부적으로 보정해 올바른 의미를 복원합니다. 그러나 경우에 따라 오타는 모델의 성능 저하를 유발합니다. 이 연구는: 어떤 뉴런(neurons)과 어떤 어텐션 헤드(attention heads)가 오타를 감지·보정하는지 밝혀내는 것이 목표입니다. 주요…
-

*** Enhancing Chain-of-Thought Reasoning via Neuron Activation Differential Analysis (EMNLP 2025)
https://www.dropbox.com/scl/fi/fmyr93c30w305c6088txg/emnlp25_Mechanism_Intervention_for_Enhanced_Reasoning.pdf?rlkey=fnownx30hd5xp79fvn94m04nx&dl=0 논문 “Enhancing Chain-of-Thought Reasoning via Neuron Activation Differential Analysis” (EMNLP 2025) 은 LLM의 연쇄적 사고(Chain-of-Thought, CoT) 능력을 뉴런 수준에서 해석하고 향상시키는 방법을 제안한 연구입니다. 아래는 핵심 내용을 정리한 설명입니다. 연구 배경 제안 방법 1. 대비 데이터셋(Contrastive Dataset) 구축 2. 뉴런 활성도 차이 계산 3. 핵심(reasoning-critical) 뉴런 선택 4. 뉴런 개입(Intervention) 주요 결과 모델 평균…
-

** Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM Aggression (ACL 2025)
https://www.dropbox.com/scl/fi/shuzbhoyjjhmbchlaw3mt/acl25_AAPE_LLM_Internal_Aggression_Neuron_Threat.pdf?rlkey=nn4uol33bm5ug8s0xua1a59bm&dl=0 이 논문 “Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM Aggression” (ACL 2025) 은 대형 언어 모델(LLM) 내부의 “공격성(neural aggression)”을 제어하는 특정 뉴런이 존재하며, 이들을 조작하는 것만으로도 모델의 공격성이 급격히 변할 수 있음을 실험적으로 증명한 연구입니다 . 아래는 핵심 내용을 정리한 설명입니다. 1. 연구 목적과 문제의식 2. 연구 질문…
-

*** Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models (ACL 2024)
https://www.dropbox.com/scl/fi/kha58ikmznjczmoln5yhk/acl24_LAPE_LLM_Anatomy_Language_Neurons_And_Control.pdf?rlkey=lfdv7v6c4odwtcpg8n8e7jzby&dl=0 이 논문 **「Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models」 (ACL 2024)**은 대형 언어 모델(LLM)의 다국어 능력이 **특정한 언어 전용 뉴런(language-specific neurons)**에 의해 어떻게 형성되는지를 정량적으로 규명한 연구입니다 . 연구 배경 및 문제의식 대형 언어 모델(GPT-4, PaLM-2 등)은 주로 영어 데이터로 학습되었음에도 불구하고 여러 언어로 높은 수준의 이해 및 생성 능력을…