[태그:] mechanistic interpretability
-

* Unveiling Decision-Making in LLMs for Text Classification: Extraction of Influential and Interpretable Concepts with Sparse Autoencoders (Findings of EACL 2026)
https://www.dropbox.com/scl/fi/k3j815xwkwr0lo3z2jpyi/feacl26_Interpreting_LLM_Classification_Decisions.pdf?rlkey=64wt8eaxdzdk74w5klv4cr86a&dl=0 논문 개요 이 논문은 텍스트 분류 모델의 내부 표현에서 **분류 판단에 실제로 사용되는 문장 수준의 개념(concept)**을 추출하기 위해 ClassifSAE라는 지도학습형 Sparse Autoencoder를 제안한 논문입니다. EACL 2026 Findings에 게재되었습니다. 핵심 질문은 다음과 같습니다. 일반적인 SAE가 찾아낸 feature 중에서, 텍스트 분류 결정에 직접 관련되면서도 희소하고 의미적으로 일관된 feature를 어떻게 얻을 것인가? 기존 SAE는 원래 hidden state를…
-

AlignSAE: Concept-Aligned Sparse Autoencoders (ArXiv 2026)
https://www.dropbox.com/scl/fi/85qugzzkromfqz828fq38/arxiv25_The_AlignSAE_Control_Paradigm.pdf?rlkey=wfntedkpu0862gb92jb31lmyc&dl=0 논문 개요 이 논문은 기존 Sparse Autoencoder가 학습한 feature를 사후에 해석하는 데 그치지 않고, 사전에 정의한 ontology의 개념을 특정 SAE latent slot에 직접 정렬하여 이를 읽고 조작할 수 있는 인터페이스로 만드는 방법입니다. 핵심 발상은 다음과 같습니다. 일반 SAE 학습을 LLM의 pre-training에 대응시키고, 개념 supervision을 이용한 추가 학습을 LLM의 post-training에 대응시킨다. 먼저 일반 SAE처럼 비지도…
-

** When Attention Sink Emerges in Language Models: An Empirical View (ICLR 2025)
https://www.dropbox.com/scl/fi/77jzbfvnx6c1algovtd8z/iclr25_Attention_Sink_Anatomy.pdf?rlkey=2br6s5zfe1x8mj62v3q4eyi45&dl=0 이 논문은 Attention Sink가 왜 발생하는가?, 언제 발생하는가?, **무엇이 Attention Sink를 결정하는가?**를 체계적으로 분석한 최초의 empirical study이다. 기존 연구들이 “Attention Sink를 활용”하는 데 초점을 맞췄다면, 이 논문은 pretraining 과정에서 Attention Sink가 생성되는 메커니즘을 규명하는 것이 목표이다. 1. 논문의 핵심 질문 저자들은 다음 네 가지 질문을 던진다. 이를 위해 저자들은 등 다양한 autoregressive LM을 분석하였다.…
-

** Efficient Streaming Language Models with Attention Sinks (ICLR 2024)
https://www.dropbox.com/scl/fi/v1sl9gt0gjjchtq2z3d8l/iclr24_StreamingLLM_Unbound.pdf?rlkey=ekljkgijkqzzb2udnvcbnwbvc&dl=0 Efficient Streaming Language Models with Attention Sinks는 ICLR 2024에 발표된 논문으로, 장시간 대화나 지속적인 텍스트 스트림에서 LLM을 고정된 메모리와 안정적인 품질로 계속 실행하기 위한 StreamingLLM을 제안합니다. 핵심 발견은 Transformer가 의미적으로 중요하지 않은 초기 몇 개 토큰에 비정상적으로 큰 attention을 할당한다는 것이며, 저자들은 이를 attention sink라고 부릅니다. 논문의 핵심 아이디어는 매우 단순합니다. 최근 토큰만 남기는…
-

* Massive Activations in Large Language Models (COLM 2024)
https://www.dropbox.com/scl/fi/zglouvvur991wj0oxz3aw/arxiv24_Decoding_Massive_Activations.pdf?rlkey=r4ubxwtcm0z3y245uhjxzzq1m&dl=0 이 논문은 최근 LLM 해석 가능성(Mechanistic Interpretability) 연구 중에서도 상당히 독창적인 논문입니다. 기존 연구들이 attention head, MLP neuron, circuit 등을 분석했다면, 이 논문은 훨씬 근본적인 현상을 발견합니다. LLM 내부에는 다른 activation보다 수천~수만 배 큰 activation이 극히 소수 존재하며, 이들은 단순한 이상치(outlier)가 아니라 모델 전체가 사용하는 “고정 bias” 역할을 한다. 이 논문의 가장 중요한 기여는…
-

* Why Do Some Inputs Break Low-Bit LLM Quantization? (EMNLP 2025)
https://www.dropbox.com/scl/fi/6oqk3o2q9ylkxa3h9kj7q/emnlp25_Quantization_Collapse_Anatomy.pdf?rlkey=u0ovw9997s2v5fqxldvcwx409&dl=0 논문 개요 **Ting-Yun Chang et al., “Why Do Some Inputs Break Low-Bit LLM Quantization?” (EMNLP 2025)**는 다음 질문을 다룹니다. 동일한 LLM과 동일한 양자화 비트 수를 사용해도, 왜 일부 입력에서는 양자화 오차가 유난히 크게 발생하는가? 기존 양자화 연구는 주로 모델 전체 평균 성능, 예를 들어 WikiText perplexity나 downstream accuracy를 개선하는 데 집중했습니다. 반면 이 논문은…
-

* A is for Absorption: Studying Feature Splitting and Absorption in SAE (NIPS 2025)
https://www.dropbox.com/scl/fi/0mtfjv8lysul7hog16zbb/nips25-Unmasking_Feature_Absorption.pdf?rlkey=eitrlfufvvhdlyf3vwmv45q1v&dl=0 이 논문은 SAE(Sparse Autoencoder)가 “해석 가능한 feature”를 잘 찾는다는 믿음에 중요한 반례를 제시합니다. 핵심 주장은 다음입니다. SAE latent가 겉보기에는 “starts with S” 같은 단일 의미 feature처럼 보이지만, 실제로는 그 feature가 활성화되어야 할 일부 사례에서 꺼지고, 더 구체적인 child feature latent가 그 방향을 대신 포함하는 feature absorption이 발생한다. 즉, SAE가 feature hierarchy를 만나면 sparsity objective…
-

** A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models (ICML 2026)
https://www.dropbox.com/scl/fi/growzuf1g10n23ycuh1rn/icml26_Unmasking_the_ME_Layer.pdf?rlkey=zrdsdbrnkxtsjlycfcbklo82a&dl=0 논문 개요 A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models는 LLM의 중간 hidden state에서 특정 토큰의 activation norm이 다른 토큰보다 수백~수천 배 커지는 massive activation이 어디서, 어떻게 발생하는지를 분석한 논문입니다. 논문의 핵심 주장은 다음과 같습니다. Massive activation은 여러 층에 걸쳐 점진적으로 누적되는 것이 아니라, 모델마다 특정한 단 하나의…
-

* Unraveling LLM Jailbreaks Through Safety Knowledge Neurons (EACL 2026)
https://www.dropbox.com/scl/fi/wz3fsywxso9q074mnd60a/eacl26_Mapping_LLM_Safety_Neurons.pdf?rlkey=204lilpoeoz69mpth0wgrl4bt&dl=0 논문 개요 핵심 질문: 정렬된 LLM이 유해 요청을 거부하거나 정상 요청에 응답하도록 만드는 내부 메커니즘을, MLP 뉴런 수준에서 찾고 조작할 수 있는가? 논문의 주장은 다음과 같습니다. 1. 논문의 전체 구조 논문은 크게 세 단계로 구성됩니다. 단계 목적 제안 방법 1 안전 관련 뉴런 탐색 및 해석 Safety Knowledge Neuron Identification 2 해당 뉴런의 인과적…
-

** The Achilles’ Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities (ICLR 2026)
https://www.dropbox.com/scl/fi/ghq9k5fbg9z6afwwac9t6/iclr26_The_Achilles_Heel_of_LLMs.pdf?rlkey=n3y4fj90q7eu1es2mmf83k06q&dl=0 아래 논문은 LLM 내부에 “극소수의 치명적 뉴런(critical neurons)”이 존재하며, 이 뉴런 몇 개를 0으로 마스킹하면 거대 모델도 언어 능력이 붕괴한다는 주장을 실험적으로 보이는 논문입니다. 1. 핵심 아이디어 논문의 질문은 다음입니다. LLM에도 인간 뇌처럼 핵심 기능을 좌우하는 소수의 critical neuron이 존재하는가? 저자들의 결론은 그렇다입니다. 특히 놀라운 주장은 다음입니다. 2. 문제 정의 모델 전체 뉴런 집합을…
-

* Style-Specific Neurons for Steering LLMs in Text Style Transfer (ArXiv 2024)
https://www.dropbox.com/scl/fi/461zskxov2ve5qi58l7yw/arxiv24_Precision_Neural_Style_Control.pdf?rlkey=0q95lefm357wr4h0c6vszlmck&dl=0 이 논문은 LLM 내부에 “문체(style)-특화 뉴런”이 존재한다고 보고, 이를 이용해 Text Style Transfer(TST) 를 디코딩 단계에서 제어하는 방법인 sNeuron-TST를 제안합니다. 목표는 입력 의미는 유지하면서, 예를 들어 informal→formal, toxic→neutral, impolite→polite처럼 문체만 바꾸는 것입니다. 기존 LLaMA-3는 zero-shot TST에서 입력을 그대로 복사하는 경향이 크며, polite→impolite 변환에서는 약 34% 출력이 입력과 동일했다고 보고합니다. 1. 문제의식 TST는 다음…
-

* Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation (IJCNLP 2025)
https://www.dropbox.com/scl/fi/tetc664rcpyjs0ei6jv2a/ijcnlp25_Multilingual_Neural_Topography.pdf?rlkey=z6p27xj789bwgqtfkandchnk7&dl=0 이 논문은 LLM 내부에서 특정 언어를 담당하는 language-specific neuron을 체계적으로 찾고, 그 뉴런을 조작해 출력 언어와 다국어 태스크 성능을 제어할 수 있는지를 분석합니다. 대상 모델은 Llama-3.1-8B, Mistral-Nemo-12B, Aya-Expanse-8B/32B이고, 21개 언어를 다룹니다. 핵심 주장은 다음입니다. 특정 언어에 민감하게 반응하는 FFN 뉴런들이 존재하며, 이 뉴런들은 주로 후반 layer에 집중되어 있다. 이 뉴런들을 더하거나 끄는 방식의…
-

* Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers (ArXiv 2025)
https://www.dropbox.com/scl/fi/mrrrnwxysyt050xm6fecm/arxiv25_Decoding_the_LLM_Black_Box.pdf?rlkey=z2z515j3nhhjjj6octasmso33&dl=0 논문 핵심 요약 이 논문은 LLM의 activation을 자연어로 질의응답할 수 있는 모델, 즉 Activation Oracle(AO) 을 학습하고 평가한 연구입니다. 기존 mechanistic interpretability가 SAE, logit lens, circuit analysis처럼 특수한 도구를 요구했다면, 이 논문은 activation을 <ACT> 토큰에 주입한 뒤 “이 activation이 의미하는 것은 무엇인가?” 를 LLM에게 직접 묻는 방식입니다. 1. 문제 설정 기존 LatentQA는 다음처럼…
-

* Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition (ArXiv 2026)
https://www.dropbox.com/scl/fi/m8ydapea0118gu8r99wst/arxiv26_Mapping_the_70B_Neural_Labyrinth.pdf?rlkey=4p3na7fk0x9kjb6gxgr7kyetq&dl=0 이 논문은 최근 Sparse Feature Circuit 계열(SAE, Transcoder, Edge Pruning, EAP) 연구들을 모두 조합하여 70B 규모 LLM까지 회로(circuit)를 추출할 수 있는 scalable framework를 제안한 논문입니다. 새로운 알고리즘을 실제 구현하여 대규모 실험으로 검증했다기보다는 기존 연구들을 조합한 프레임워크 제안 성격이 강합니다. 특히 일부 실험 수치(70B까지의 결과 등)는 공개 코드나 재현성 정보가 부족하여 실제 구현 여부를 신중하게…
-

*** Scalable Circuit Learning for Interpreting Large Language Models (ArXiv 2026)
https://www.dropbox.com/scl/fi/mfx0toc5zfqfxpjumz9lr/arxiv26-CircuitLasso_Scalable_LLM_Interpretation.pdf?rlkey=ik0e38m6gbyiaj1ss7e6oxjdh&dl=0 아래 논문은 CircuitLasso라는 방법을 제안합니다. 핵심은 SAE feature 기반 circuit discovery를 intervention 없이 Lasso sparse regression으로 확장 가능하게 수행하는 것입니다. 1. 문제의식 기존 circuit discovery 방법들, 예를 들어 activation patching, EAP, EAP-IG, causal tracing은 edge나 node의 causal effect를 intervention으로 측정합니다. 문제는 두 가지입니다. 첫째, raw neuron은 polysemantic이라서 circuit을 찾더라도 해석이 어렵습니다. 둘째, SAE…
-

** Learning Multi-Level Features with Matryoshka Sparse Autoencoders (ICML 2025)
https://www.dropbox.com/scl/fi/lpykb1k7v8m9es34c17xk/icml25-Matryoshka_Sparse_Autoencoders.pdf?rlkey=lofqba7503u2mjkc5nypnkr4t&dl=0 이 논문은 최근 Sparse Autoencoder(SAE) 연구에서 **가장 중요한 문제인 “dictionary를 크게 만들면 오히려 feature quality가 나빠지는 현상”**을 해결하려는 논문입니다. 1. 연구 배경 기존 SAE는 dictionary size를 크게 만들수록 reconstruction은 좋아집니다. 예를 들어, dictionary를 계속 늘리면 activation reconstruction error는 감소합니다. 하지만 interpretability에서는 문제가 생깁니다. 논문에서는 이를 크게 3가지 pathology로 설명합니다. (1) Feature Splitting 원래 Punctuation…
-

** Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models (ArXiv 2025)
https://www.dropbox.com/scl/fi/bx0h5t4f407ku71fpttlf/arxiv25_Mapping_Neural_Constellations.pdf?rlkey=uph99bv60z7b03486pws0gb68&dl=0 이 논문은 **Sparse Autoencoder(SAE)의 feature를 개별적으로 보는 것이 아니라, 여러 layer에서 함께(co-activation) 활성화되는 feature들의 집합(component)**을 찾아 semantic module로 해석하는 논문입니다. 기존의 circuit discovery처럼 복잡한 edge attribution(EAP, ACDC, Transcoder Circuit)을 수행하지 않고도 상당히 의미 있는 semantic module을 발견할 수 있다는 것이 핵심입니다. 1. 연구 배경 Mechanistic Interpretability에서는 크게 두 가지 흐름이 있다. (1) Circuit…
-

** Data-driven Circuit Discovery for Interpretability of Language Models (ArXiv 2026)
https://www.dropbox.com/scl/fi/0obkn20zzc9calyuis42g/arxiv26_Data_Driven_Circuit_Discovery.pdf?rlkey=jdkjeb0x5ox1dblw6m58jy5lr&dl=0 이 논문의 핵심 메시지는 매우 간단합니다. 기존 Circuit Discovery는 “task → 하나의 circuit”이라는 가정을 깔고 있는데, 실제 LLM은 같은 task도 여러 메커니즘으로 풀 수 있다. 따라서 기존 방법은 task circuit이 아니라 dataset-specific circuit을 찾고 있으며, 심지어 서로 다른 메커니즘을 하나의 circuit에 섞어버릴 수 있다. 이를 해결하기 위해 Data-driven Circuit Discovery (DCD) 를 제안한다. …
-

*** Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models (ICLR 2025)
https://www.dropbox.com/scl/fi/fpby0tbud8g61trpxmnq8/iclr25_Decoding_Sparse_Feature_Circuits.pdf?rlkey=phvjko1aqiufqjn8u090x23uy&dl=0 이 논문은 최근 SAE(Sparse Autoencoder) 기반 해석가능성 연구와 Circuit Discovery 연구를 결합한 대표적인 논문이다. 기존 ACDC, Activation Patching, EAP 등의 circuit discovery는 attention head, neuron, MLP block 수준에서 회로를 찾았는데, 이들은 대부분 polysemantic해서 사람이 이해하기 어렵다. 본 논문의 핵심 아이디어는: “Circuit의 기본 단위를 neuron 대신 SAE feature로 바꾸자.” 즉, Neuron Circuit→Sparse Feature Circuit\text{Neuron Circuit}\rightarrow\text{Sparse Feature Circuit} 로…
-

** Transcoders Find Interpretable LLM Feature Circuits (NeurIPS 2024)
https://www.dropbox.com/scl/fi/hq8qpuladqivuc1hkqlbs/nips24_The_Transcoder_Blueprint.pdf?rlkey=pt2gdvoeh9cblbgkc61ch5cpk&dl=0 이 논문은 최근 Mechanistic Interpretability에서 매우 중요한 논문 중 하나입니다. 한 줄 요약하면: SAE가 “해석 가능한 feature”를 찾는 데는 성공했지만, feature들 사이의 circuit을 분석하기는 어려웠다.Transcoder를 사용하면 MLP를 sparse feature graph로 직접 근사할 수 있고, feature-level circuit을 input-invariant하게 분석할 수 있다. 특히 이후의 계열 연구에 큰 영향을 주었습니다. 1. 문제의식 기존 Circuit Discovery의 문제 Transformer…
-

Dictionary Learning Improves Patch-Free Circuit Discovery (ArXiv 2024)
https://www.dropbox.com/scl/fi/0eel4o3ae3qjkqt3micz5/arxiv24_Patch-Free_Neural_Circuit_Discovery.pdf?rlkey=xbhwhcwt7qunm28f86t0obv9o&dl=0 1. 논문 핵심 이 논문은 Sparse Dictionary Learning/SAE로 얻은 monosemantic feature들 사이의 circuit을 activation patching 없이 발견하는 방법을 제안한다. 대상 모델은 Othello-GPT, 즉 오델로 다음 합법 수 예측을 학습한 6-layer, hidden size 128의 작은 decoder-only Transformer이다. 핵심 주장은 다음이다: residual stream에 write하는 모든 module output, 즉 embedding, attention output, MLP output을 dictionary feature로 분해하면,…
-

*** RelP: Faithful and Efficient Circuit Discovery in Language Models via Relevance Patching (ArXiv 2025)
https://www.dropbox.com/scl/fi/7cprq891vrx52azmnoz5f/arxiv25_RelP_Scalable_LLM_Interpretability.pdf?rlkey=qdqeupatpstdd65fbgy8o0t26&dl=0 논문 개요 이 논문은 기존 Activation Patching과 Attribution Patching의 장단점을 결합하려는 논문입니다. 핵심 아이디어는 다음과 같습니다. Attribution Patching의 gradient 항을 Layer-wise Relevance Propagation, 즉 LRP 기반 propagation coefficient로 대체하면, Activation Patching에 더 가깝게 causal effect를 근사하면서도 계산 비용은 거의 그대로 유지할 수 있다. 논문에서 제안하는 방법 이름은 Relevance Patching, RelP입니다. 저자들은 RelP가 Activation Patching보다…
-

*** Constructing Interpretable Features from Compositional Neuron Groups (ArXiv 2025)
https://www.dropbox.com/scl/fi/0k824k40lfp40ty5e577b/arxiv25_Decoding_LLM_Compositionality_with_SNMF.pdf?rlkey=35n0ah3ekwfss7etlwg1jxv6n&dl=0 이 논문은 최근 SAE(Sparse Autoencoder) 중심의 mechanistic interpretability 연구에 대해 상당히 흥미로운 문제 제기를 합니다. 핵심 질문은: “LLM 내부의 의미(concept)를 표현하는 진짜 단위(unit)는 무엇인가?” 입니다. 기존에는 등이 주로 사용되었는데, 저자들은 “실제로는 여러 neuron들이 조합(composition)되어 하나의 개념을 표현한다” 고 주장하며, MLP activation을 SNMF(Semi-Nonnegative Matrix Factorization)로 분해하여 neuron group 기반 feature를 찾는 방법을 제안합니다. 1.…
-

*** Weight Patching: Toward Source-Level Mechanistic Localization in LLMs (ArXiv 2026)
https://www.dropbox.com/scl/fi/o7hyhxvr0bks8wfp0xtyq/arxiv26_Weight_Patching_and_Mechanistic_Hierarchies.pdf?rlkey=abrzybr8k62kmmrpn2mpq7w9f&dl=0 이 논문의 핵심 아이디어는 다음 한 문장으로 요약할 수 있습니다. 기존 Mechanistic Interpretability가 “어디에서 신호가 보이는가?”(activation)를 찾았다면, 이 논문은 “그 능력이 실제로 어느 파라미터에 저장되어 있는가?”(weight)를 찾으려 한다. 1. 왜 새로운 방법이 필요한가? 기존 Circuit Discovery 계열: 등은 모두 activation 공간에서 동작한다. 예를 들어: Activation Patching을 하면 → Head C가 중요하다고 판단 하지만…