LLM 논문에 관한 블로그입니다.
-

** Data-driven Circuit Discovery for Interpretability of Language Models (ArXiv 2026)
https://www.dropbox.com/scl/fi/0obkn20zzc9calyuis42g/arxiv26_Data_Driven_Circuit_Discovery.pdf?rlkey=jdkjeb0x5ox1dblw6m58jy5lr&dl=0 이 논문의 핵심 메시지는 매우 간단합니다. 기존 Circuit Discovery는 “task → 하나의 circuit”이라는 가정을 깔고 있는데, 실제 LLM은 같은 task도 여러 메커니즘으로 풀 수 있다. 따라서 기존 방법은 task circuit이 아니라 dataset-specific circuit을 찾고 있으며, 심지어 서로 다른 메커니즘을 하나의 circuit에 섞어버릴 수 있다. 이를 해결하기 위해 Data-driven Circuit Discovery (DCD) 를 제안한다. …
-

*** Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models (ICLR 2025)
https://www.dropbox.com/scl/fi/fpby0tbud8g61trpxmnq8/iclr25_Decoding_Sparse_Feature_Circuits.pdf?rlkey=phvjko1aqiufqjn8u090x23uy&dl=0 이 논문은 최근 SAE(Sparse Autoencoder) 기반 해석가능성 연구와 Circuit Discovery 연구를 결합한 대표적인 논문이다. 기존 ACDC, Activation Patching, EAP 등의 circuit discovery는 attention head, neuron, MLP block 수준에서 회로를 찾았는데, 이들은 대부분 polysemantic해서 사람이 이해하기 어렵다. 본 논문의 핵심 아이디어는: “Circuit의 기본 단위를 neuron 대신 SAE feature로 바꾸자.” 즉, Neuron Circuit→Sparse Feature Circuit\text{Neuron Circuit}\rightarrow\text{Sparse Feature Circuit} 로…
-

** Transcoders Find Interpretable LLM Feature Circuits (NeurIPS 2024)
https://www.dropbox.com/scl/fi/hq8qpuladqivuc1hkqlbs/nips24_The_Transcoder_Blueprint.pdf?rlkey=pt2gdvoeh9cblbgkc61ch5cpk&dl=0 이 논문은 최근 Mechanistic Interpretability에서 매우 중요한 논문 중 하나입니다. 한 줄 요약하면: SAE가 “해석 가능한 feature”를 찾는 데는 성공했지만, feature들 사이의 circuit을 분석하기는 어려웠다.Transcoder를 사용하면 MLP를 sparse feature graph로 직접 근사할 수 있고, feature-level circuit을 input-invariant하게 분석할 수 있다. 특히 이후의 계열 연구에 큰 영향을 주었습니다. 1. 문제의식 기존 Circuit Discovery의 문제 Transformer…
-

Dictionary Learning Improves Patch-Free Circuit Discovery (ArXiv 2024)
https://www.dropbox.com/scl/fi/0eel4o3ae3qjkqt3micz5/arxiv24_Patch-Free_Neural_Circuit_Discovery.pdf?rlkey=xbhwhcwt7qunm28f86t0obv9o&dl=0 1. 논문 핵심 이 논문은 Sparse Dictionary Learning/SAE로 얻은 monosemantic feature들 사이의 circuit을 activation patching 없이 발견하는 방법을 제안한다. 대상 모델은 Othello-GPT, 즉 오델로 다음 합법 수 예측을 학습한 6-layer, hidden size 128의 작은 decoder-only Transformer이다. 핵심 주장은 다음이다: residual stream에 write하는 모든 module output, 즉 embedding, attention output, MLP output을 dictionary feature로 분해하면,…
-

*** RelP: Faithful and Efficient Circuit Discovery in Language Models via Relevance Patching (ArXiv 2025)
https://www.dropbox.com/scl/fi/7cprq891vrx52azmnoz5f/arxiv25_RelP_Scalable_LLM_Interpretability.pdf?rlkey=qdqeupatpstdd65fbgy8o0t26&dl=0 논문 개요 이 논문은 기존 Activation Patching과 Attribution Patching의 장단점을 결합하려는 논문입니다. 핵심 아이디어는 다음과 같습니다. Attribution Patching의 gradient 항을 Layer-wise Relevance Propagation, 즉 LRP 기반 propagation coefficient로 대체하면, Activation Patching에 더 가깝게 causal effect를 근사하면서도 계산 비용은 거의 그대로 유지할 수 있다. 논문에서 제안하는 방법 이름은 Relevance Patching, RelP입니다. 저자들은 RelP가 Activation Patching보다…
-

*** Constructing Interpretable Features from Compositional Neuron Groups (ArXiv 2025)
https://www.dropbox.com/scl/fi/0k824k40lfp40ty5e577b/arxiv25_Decoding_LLM_Compositionality_with_SNMF.pdf?rlkey=35n0ah3ekwfss7etlwg1jxv6n&dl=0 이 논문은 최근 SAE(Sparse Autoencoder) 중심의 mechanistic interpretability 연구에 대해 상당히 흥미로운 문제 제기를 합니다. 핵심 질문은: “LLM 내부의 의미(concept)를 표현하는 진짜 단위(unit)는 무엇인가?” 입니다. 기존에는 등이 주로 사용되었는데, 저자들은 “실제로는 여러 neuron들이 조합(composition)되어 하나의 개념을 표현한다” 고 주장하며, MLP activation을 SNMF(Semi-Nonnegative Matrix Factorization)로 분해하여 neuron group 기반 feature를 찾는 방법을 제안합니다. 1.…
-

*** Weight Patching: Toward Source-Level Mechanistic Localization in LLMs (ArXiv 2026)
https://www.dropbox.com/scl/fi/o7hyhxvr0bks8wfp0xtyq/arxiv26_Weight_Patching_and_Mechanistic_Hierarchies.pdf?rlkey=abrzybr8k62kmmrpn2mpq7w9f&dl=0 이 논문의 핵심 아이디어는 다음 한 문장으로 요약할 수 있습니다. 기존 Mechanistic Interpretability가 “어디에서 신호가 보이는가?”(activation)를 찾았다면, 이 논문은 “그 능력이 실제로 어느 파라미터에 저장되어 있는가?”(weight)를 찾으려 한다. 1. 왜 새로운 방법이 필요한가? 기존 Circuit Discovery 계열: 등은 모두 activation 공간에서 동작한다. 예를 들어: Activation Patching을 하면 → Head C가 중요하다고 판단 하지만…
-

* A Mathematical Framework for Transformer Circuits (Transformer Circuits 2021)
https://www.dropbox.com/scl/fi/mmqtujkofh68ref3obbul/transformer_circuits21_Transformer_Circuit_Blueprint.pdf?rlkey=8hkvnezi1dhrmw3jlolcorrn4&dl=0 이 논문은 오늘날 Mechanistic Interpretability 분야의 출발점 중 하나로 평가받습니다. 특히 이후의 등의 연구들이 사실상 이 논문의 수학적 프레임워크 위에서 발전되었습니다. 1. 논문의 핵심 질문 Transformer 내부를 회로(circuit)처럼 해석할 수 있는가? 기존 Transformer 수식: Q=XWQQ=XW_Q K=XWKK=XW_K V=XWVV=XW_V A=softmax(QKT)A=\text{softmax}(QK^T) Y=AVWOY=AVW_O 은 학습과 구현에는 편하지만, “이 head가 실제로 무엇을 하는가?” 를 이해하기 어렵습니다. 저자들은 Transformer를…
-

* Circuit Breaking: Removing Model Behaviors with Targeted Ablation (ArXiv 2023)
https://www.dropbox.com/scl/fi/yjgk0u5i657adx5ub8633/arxiv23_Surgical_AI_Control.pdf?rlkey=39h35f7wx4hmekefdginb1hxx&dl=0 이 논문은 “모델의 특정 행동(behavior)만 제거할 수 있는가?” 라는 질문을 다룬다. 기존에는 Fine-tuning, RLHF, Model Editing 등이 주로 weight를 수정했는데, 이 논문은 훨씬 Mechanistic Interpretability 관점에서 접근한다. 핵심 아이디어는: “나쁜 행동을 만드는 circuit 전체를 찾는 대신, 그 circuit을 끊어버리는 최소 edge cut을 찾자.” 이다. 1. 문제 정의 논문은 “behavior removal”을 다음과 같이 정의한다.…
-

* IPE: Isolating Path Effects for Improving Latent Circuit Identification (BlackboxNLP 2025)
https://www.dropbox.com/scl/fi/bbgp8jxq3rqzki4hj11eg/blackboxnlp25_Isolating_Path_Effects.pdf?rlkey=9m7a2gec6dyfe4t5g2dqni5ee&dl=0 아래 논문은 IPE: Isolating Path Effects for Improving Latent Circuit Identification입니다. 핵심은 기존 circuit discovery가 edge 단위로 중요도를 계산하는 반면, 이 논문은 입력 임베딩 → 중간 컴포넌트들 → 최종 logits까지 이어지는 전체 computational path의 효과를 직접 분리해서 평가한다는 점입니다. 1. 문제의식 기존 방법들, 예를 들어 Activation Patching, Edge Activation Patching, ACDC, EAP는 보통…
-

* Circuit Component Reuse Across Tasks in Transformer Language Models (ICLR 2024)
https://www.dropbox.com/scl/fi/frg1w6t5gqipjmzmintg7/iclr24_Universal_Transformer_Circuit_Reuse.pdf?rlkey=bm2ytapv4bwgsq30q59tyl0lm&dl=0 논문: “Circuit Component Reuse Across Tasks in Transformer Language Models” (ICLR 2024) 1. 핵심 주장 이 논문은 Transformer LM 내부의 circuit component가 특정 task 전용이 아니라, 서로 다른 task에서도 재사용될 수 있다는 것을 보인다. 저자들은 두 task를 비교한다. Task 요구 행동 IOI: Indirect Object Identification 문장에서 indirect object 이름을 예측 Colored Objects 문맥에…
-

* Finding Neurons in a Haystack: Case Studies with Sparse Probing (ArXiv 2023)
https://www.dropbox.com/scl/fi/2xl6vrrw9zzoi0fcwi5wi/arxiv23_X-Raying_the_Black_Box.pdf?rlkey=3wnl2yjc5qoc3sxpebjvunfin&dl=0 이 논문은 **“LLM 내부에서 특정 개념(feature)이 몇 개의 뉴런에 의해 표현되는가?”**를 체계적으로 분석한 연구이다. 특히 기존 probing 연구를 확장하여 Sparse Probe를 사용함으로써 특정 feature와 관련된 뉴런을 매우 정밀하게 찾고, 이를 통해 monosemantic neuron, polysemantic neuron, superposition 현상을 실증적으로 분석한다. 1. 연구 배경 Mechanistic Interpretability 분야에서는 오래전부터 다음 질문이 존재했다. “특정 뉴런 하나가 하나의…
-

** Function Vectors in Large Language Models (ICLR 2024)
https://www.dropbox.com/scl/fi/hotaolcedy6yd2o5b48sc/iclr24_LLM_Function_Vector_Anatomy.pdf?rlkey=f4g9u2icoi4p79p8tiyu9xfon&dl=0 논문: Function Vectors in Large Language Models, ICLR 2024. 핵심은 ICL prompt가 유도한 “작업 함수”가 LLM 내부의 특정 attention head 출력들의 합으로 벡터화되어 있으며, 이 벡터를 다른 문맥에 삽입하면 모델이 해당 작업을 수행한다는 주장입니다. 1. 핵심 아이디어 논문은 LLM이 few-shot ICL을 할 때 단순히 예시를 복사하거나 표면 패턴을 따르는 것이 아니라, 예시들로부터 “입력→출력…
-
* Interpretability Analysis of Arithmetic In-Context Learning in Large Language Models (EMNLP 2025)
이 논문은 “LLM이 arithmetic ICL(In-Context Learning)을 할 때 실제로 무엇을 배우는가?” 를 mechanistic interpretability 관점에서 분석한 연구입니다. 특히 기존 연구가 주로 2-operand arithmetic (a+b) 를 분석한 반면, 본 논문은 3-operand arithmetic (a+b+c) 를 대상으로 합니다. 논문의 핵심 결론은 다음 한 문장으로 요약됩니다. LLM은 ICE(In-Context Example)의 산술적 정답을 배우기보다는 ICE의 패턴(format, structure) 을 학습하여 문제를…
-

syftr: Pareto-Optimal Generative AI (AutoML 2025)
https://www.dropbox.com/scl/fi/j642jzhb5ahmbo7aer7im/automl25_syftr_RAG_Pareto_Frontiers.pdf?rlkey=7exjl697o20qr4n18sqwiff92&dl=0 이 논문은 RAG(Retrieval-Augmented Generation) 시스템을 AutoML 관점에서 자동 설계하는 최초의 Multi-Objective Bayesian Optimization 프레임워크라고 볼 수 있습니다. 핵심 목표는: “주어진 데이터셋에서 정확도(Accuracy)와 비용(Cost)의 Pareto-optimal RAG flow를 자동으로 찾자”입니다. 1. 문제 정의 기존 RAG 구축 시 다음과 같은 선택들이 존재합니다. 예를 들어: 이들을 조합하면 수백~수천 개의 RAG flow가 생성됩니다. 논문에서는 총 1023개의 RAG Flow를…
-

* From Few to Many: Self-Improving Many-Shot Reasoners Through Iterative Optimization and Generation (ICLR 2025)
https://www.dropbox.com/scl/fi/85p6c9ai2o4w63u1ghxwb/iclr25_Bridge_Many-shot_ICL.pdf?rlkey=c1sihwwkgvpb48ygw012ckuou&dl=0 논문 개요 From Few to Many: Self-Improving Many-Shot Reasoners Through Iterative Optimization and Generation은 long-context LLM에서 many-shot ICL을 단순히 많이 넣는 방식으로 쓰는 것이 최적인가를 분석하고, 더 좋은 예제를 선택(optimize) 한 뒤 그 예제로 다시 reasoning path를 생성(generate) 하는 반복 알고리즘 BRIDGE를 제안한 논문입니다. 핵심 주장은 다음입니다. many-shot 성능 향상은 모든 예제가 균등하게 기여해서가…
-

* COM-BOM: Bayesian Exemplar Search for Efficiently Exploring the Accuracy-Calibration Pareto Frontier (EMNLP 2025)
https://www.dropbox.com/scl/fi/5tyhjah6me8xs20hmc0pa/emnlp25_COM-BOM_Multi-Objective_LLM_Reliability.pdf?rlkey=uo2mqaqkg1t01bax97w7ln0us&dl=0 논문 개요 이 논문은 ICL(In-Context Learning)에서 exemplar 선택 문제를 단순히 “정확도를 높이는 문제”가 아니라, 정확도와 calibration을 동시에 최적화하는 multi-objective combinatorial optimization 문제로 재정의합니다. 제안 방법은 COM-BOM으로, 전체 이름은 Combinatorial Bayesian Optimization of Multiple ICL Metrics입니다. 핵심 아이디어는 다음과 같습니다. 좋은 exemplar set은 단순히 정답률이 높은 것만으로는 부족하고,모델이 자신의 정답 가능성에 대해 얼마나 잘…
-
Pareto Front (파레토 프론트)
Pareto Front는 다목적 최적화(Multi-Objective Optimization) 에서 사용되는 개념으로, 서로 상충(trade-off)하는 여러 목표를 동시에 최적화할 때 등장한다. 예를 들어, 하지만 일반적으로 정확도를 높이면 모델이 커져서 추론 시간이 증가한다. 이처럼 하나의 목표를 개선하면 다른 목표가 악화되는 상황에서 Pareto Front를 사용한다. 1. Pareto Optimal Solution 해 x1,x2x_1, x_2가 있을 때, x1x_1이 x2x_2보다 x1x_1이 x2x_2를 지배(Dominate) 한다고 한다. 수학적으로…
-
Speculative Decoding이란?
Speculative Decoding은 LLM 추론(inference)을 가속화하기 위한 기법으로, 작은 모델이 여러 토큰을 먼저 예측하고 큰 모델이 이를 한 번에 검증(verification)하는 방식이다. 핵심 아이디어는 다음과 같다. “작은 모델이 초안을 쓰고(draft), 큰 모델이 맞는지 확인한다(verify).” 이 과정을 통해 큰 모델이 토큰을 하나씩 생성하는 autoregressive decoding의 병목을 줄일 수 있다. 1. 기존 Autoregressive Decoding의 문제 일반적인 LLM 생성은 다음과…
-

* On Relation-Specific Neurons in Large Language Models (EMNLP 2025)
https://www.dropbox.com/scl/fi/7pm0homk42j0ndddk25qy/emnlp25_Mapping_LLM_Relation_Neurons.pdf?rlkey=6hz21la0g3x4mti2fk4q23pt8&dl=0 이 논문은 **“LLM 내부에 특정 사실(fact)을 저장하는 neuron이 아니라, 특정 관계(relation) 자체를 처리하는 neuron이 존재하는가?”**를 분석한 연구입니다. 기존 연구의 Knowledge Neuron은 (NVIDIA, CEO, Jensen Huang) 이라는 사실 전체를 저장하는 뉴런을 찾으려 했습니다. 반면 이 논문은 CEO 관계 자체를 담당하는 neuron 즉, 처럼 entity가 달라도 공통적으로 활성화되는 Relation-Specific Neuron (RelSpec Neuron) 이 존재하는지를 탐구합니다.…
-

* Correlation-Aware Example Selection for In-Context Learning with Nonsymmetric Determinantal Point Processes (EMNLP 2025)
https://www.dropbox.com/scl/fi/mnk5s6y96toeexdcwrsqm/emnlp25-NDPP_ICL_Optimization.pdf?rlkey=nb4ckxz46o1b2xnl4j3vt57gp&dl=0 이 논문은 ICL(In-Context Learning) 예제 선택(example selection) 문제를 다루며, 기존 DPP 기반 방법의 한계를 극복하기 위해 NDPP (Nonsymmetric Determinantal Point Process) 를 도입한 연구이다. Compositional Exemplars (CEIL, ICML 2023) 의 후속 발전으로 볼 수 있다. 1. 문제의식 ICL에서는 어떤 demonstration(example)을 넣느냐에 따라 성능 차이가 매우 크다. 기존 방법들은 크게: (1) Query Similarity 기반…
-

* Effective Demonstration Annotation for In-Context Learning via Language Model-Based Determinantal Point Process (EMNLP 2024)
https://www.dropbox.com/scl/fi/ewqqgfashj2x90ox13owc/emnlp24-Ultra_Efficient_ICL_via_LM-DPP.pdf?rlkey=sdcs2fq2qt1xwi0lqwpnzo5ai&dl=0 이 논문은 **ICL(In-Context Learning)에서 어떤 데이터를 먼저 라벨링(annotation)해야 하는가?**를 다룬 연구입니다. 기존 ICL 연구는 보통 다음을 가정합니다. “이미 큰 labeled support set이 존재한다.” 그러나 실제 환경에서는 수만 개의 데이터에 라벨을 다는 비용이 매우 큽니다. 따라서 저자들은 다음 문제를 제기합니다. “라벨이 전혀 없는 데이터 풀(unlabeled pool)에서 극소수(16개~100개)만 라벨링할 수 있다면 어떤 샘플을 선택해야 ICL 성능이…
-

* Compositional Exemplars for In-context Learning (ICML 2023)
https://www.dropbox.com/scl/fi/lq5fhijrlhx26rv9ajef7/icml23_Optimizing_In-Context_Learning_with_CEIL.pdf?rlkey=nac8ahr5eqm9w08or97w74dgh&dl=0 이 논문은 **ICL(In-Context Learning)에서 어떤 예제(demonstration)를 선택할 것인가?**라는 문제를 다룹니다. 핵심 아이디어는 매우 간단합니다. 기존 방법은 “좋은 예제를 하나씩” 찾는다. CEIL은 “좋은 예제 집합(set)“을 찾는다. 이를 위해 Determinantal Point Process (DPP) 를 활용하여예제들 간의 다양성(diversity) 과 입력과의 관련성(relevance) 을 동시에 고려합니다. 1. 연구 배경 ICL에서는 다음과 같은 형태로 추론합니다. GPT-3 이후 알려진 사실은…
-
* Determinantal Point Process (DPP)
Determinantal Point Process (DPP) **Determinantal Point Process (DPP)**는 집합(Set)에서 다양성(Diversity) 을 고려하여 부분집합(subset)을 선택하기 위한 확률 모델이다. 직관적으로는: “품질이 좋은 항목들을 선택하되, 서로 비슷한 항목은 동시에 선택될 확률을 낮춘다.” 즉, Quality + Diversity를 동시에 고려하는 샘플링 기법이다. 1. 왜 필요한가? 예를 들어 문서 검색 결과가 다음과 같다고 하자. 문서 내용 D1 GPT 논문 D2 GPT-2…