500xCompressor (1) A-MEM (1) ACE (1) Activation Oracle (1) Activation Patching (2) Agentic Memory (1) AlignSAE (1) Angular Steering (1) attention map (2) Attention Sink (2) Bayesian Optimization (15) Benchmark (3) Circuit Discovery (18) CircuitLasso (1) ClassifSAE (1) COM-BOM (1) context-grounded faithfulness (1) Context Adaptation (1) Context Compression (1) Context Engineering (2) Contextual Faithfulness (1) Critical Component (7) Critical Neuron (1) Data-driven Circuit Discovery (1) Data Augmentation (2) data contamination (4) DCD (1) Defending LLM (8) Determinantal Point Process (4) Dictionary Learning (3) DoLa (2) DSPy (1) Dynamic Cheatsheet (1) EAP-IG (1) ERASER (1) FaithEval (1) Faithfulness of NLE (4) Feature Absorption (1) GEPA (1) Gradient-Based Activation Steering (1) HAGD (1) HbBoPs (1) HDBO (1) Head (3) Head-level steering (1) High-Dimensional BO (1) In-Context Learning (8) Jailbreak Attack (4) knowledge editing (4) Language-Specific Neurons (2) Language Confusion (2) Latent Bayesian Optimization (2) LLM-as-a-judge (3) LLM-as-a-jury (1) LLM-DCP (1) LLM Quantization (3) Massive Activation (2) Matryoshka SAE (1) mechanistic interpretability (34) MERA (1) MIPRO (1) Multi-Objective Optimization (3) Neuron (15) NMF (1) Ontology Generation (2) Ontology Learning (6) Optuna (1) orthogonal feature directions (1) Perplexity Filtering (1) Personalized LLM (3) Prompt Compression (9) Prompt Optimization (1) Prompt Selection (2) RAG (2) Rationale (1) ReAct (1) Relevance Patching (1) RelP (1) retrieval head (2) SAE (13) Safety Knowledge Neuron (1) Self-Critique + Refinement (1) Semi-NMF (1) Simple Adaptive Attacks (1) Size-Fidelity Paradox (1) SNMF (1) Sparse Feature Coactivation (1) Spherical Steering (1) SR-NLE (2) steering LM (27) Streaming LLM (1) Style Modulation Heads (1) Super Weight (1) Survey (1) Test-Time Training (2) TPE (2) Transcoder (1) Transformer Circuits (1) Tree-Structured Parzen Estimator (1) Weight Patching (1)

LLM 논문에 관한 블로그입니다.

  • ** The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions (ICML 2025)

    ** The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions (ICML 2025)

    https://www.dropbox.com/scl/fi/zr0s84zygykijwipxx6gq/icml25_Hidden_Dimensions_of_LLM_Alignment.pdf?rlkey=sz9vcdhjzbh027r33zhphuxxc&dl=0 이 논문의 핵심 문제의식은 기존의 refusal direction 연구가 alignment를 **하나의 선형 방향(single direction)**으로 설명하는 데 비해, 실제 safety fine-tuning은 여러 개의 서로 다른 orthogonal feature directions로 이루어진 저차원 subspace를 학습한다는 것입니다.  1. 논문의 핵심 아이디어 기존 연구의 전형적인 접근은 다음과 같습니다. vrefusal=𝔼[h|refusal]−𝔼[h|compliance]v_{\text{refusal}}=\mathbb{E}[h\mid \text{refusal}]-\mathbb{E}[h\mid \text{compliance}] 즉 harmful/safe 또는 refusal/compliance contrast pair를 이용해 하나의 safety direction을…

  • * Enhancing Instruction-Following Capabilities in Seq2Seq Models (ArXiv 2025)

    * Enhancing Instruction-Following Capabilities in Seq2Seq Models (ArXiv 2025)

    https://www.dropbox.com/scl/fi/oqbatf064r82nh0k30uz6/arxiv25_Steering_Seq2Seq_Beyond_Memorization.pdf?rlkey=4g8t4f86x12nsbrzhlqdsbpe0&dl=0 이 논문의 핵심은 **“decoder-only LLM에서 효과적이었던 DoLa를 FLAN-T5 같은 encoder–decoder(Seq2Seq) 모델에 적용하면 왜 잘 작동하지 않는가?”**를 분석하고, 그 분석을 바탕으로 gradient 기반 activation steering을 제안하는 것입니다. 논문의 가장 중요한 결과는 FLAN-T5-Large의 MemoTrap 정확도를 52.0% → 99.7%로 향상시켰다는 것입니다. 1. 연구 질문과 핵심 아이디어 FLAN-T5는 instruction tuning을 했음에도 다음과 같은 상황에서 instruction을 무시할 수 있습니다.…

  • * Unveiling Decision-Making in LLMs for Text Classification: Extraction of Influential and Interpretable Concepts with Sparse Autoencoders (Findings of EACL 2026)

    * Unveiling Decision-Making in LLMs for Text Classification: Extraction of Influential and Interpretable Concepts with Sparse Autoencoders (Findings of EACL 2026)

    https://www.dropbox.com/scl/fi/k3j815xwkwr0lo3z2jpyi/feacl26_Interpreting_LLM_Classification_Decisions.pdf?rlkey=64wt8eaxdzdk74w5klv4cr86a&dl=0 논문 개요 이 논문은 텍스트 분류 모델의 내부 표현에서 **분류 판단에 실제로 사용되는 문장 수준의 개념(concept)**을 추출하기 위해 ClassifSAE라는 지도학습형 Sparse Autoencoder를 제안한 논문입니다. EACL 2026 Findings에 게재되었습니다. 핵심 질문은 다음과 같습니다. 일반적인 SAE가 찾아낸 feature 중에서, 텍스트 분류 결정에 직접 관련되면서도 희소하고 의미적으로 일관된 feature를 어떻게 얻을 것인가? 기존 SAE는 원래 hidden state를…

  • AlignSAE: Concept-Aligned Sparse Autoencoders (ArXiv 2026)

    AlignSAE: Concept-Aligned Sparse Autoencoders (ArXiv 2026)

    https://www.dropbox.com/scl/fi/85qugzzkromfqz828fq38/arxiv25_The_AlignSAE_Control_Paradigm.pdf?rlkey=wfntedkpu0862gb92jb31lmyc&dl=0 논문 개요 이 논문은 기존 Sparse Autoencoder가 학습한 feature를 사후에 해석하는 데 그치지 않고, 사전에 정의한 ontology의 개념을 특정 SAE latent slot에 직접 정렬하여 이를 읽고 조작할 수 있는 인터페이스로 만드는 방법입니다. 핵심 발상은 다음과 같습니다. 일반 SAE 학습을 LLM의 pre-training에 대응시키고, 개념 supervision을 이용한 추가 학습을 LLM의 post-training에 대응시킨다. 먼저 일반 SAE처럼 비지도…

  • ** When Attention Sink Emerges in Language Models: An Empirical View (ICLR 2025)

    ** When Attention Sink Emerges in Language Models: An Empirical View (ICLR 2025)

    https://www.dropbox.com/scl/fi/77jzbfvnx6c1algovtd8z/iclr25_Attention_Sink_Anatomy.pdf?rlkey=2br6s5zfe1x8mj62v3q4eyi45&dl=0 이 논문은 Attention Sink가 왜 발생하는가?, 언제 발생하는가?, **무엇이 Attention Sink를 결정하는가?**를 체계적으로 분석한 최초의 empirical study이다. 기존 연구들이 “Attention Sink를 활용”하는 데 초점을 맞췄다면, 이 논문은 pretraining 과정에서 Attention Sink가 생성되는 메커니즘을 규명하는 것이 목표이다. 1. 논문의 핵심 질문 저자들은 다음 네 가지 질문을 던진다. 이를 위해 저자들은 등 다양한 autoregressive LM을 분석하였다.…

  • ** Efficient Streaming Language Models with Attention Sinks (ICLR 2024)

    ** Efficient Streaming Language Models with Attention Sinks (ICLR 2024)

    https://www.dropbox.com/scl/fi/v1sl9gt0gjjchtq2z3d8l/iclr24_StreamingLLM_Unbound.pdf?rlkey=ekljkgijkqzzb2udnvcbnwbvc&dl=0 Efficient Streaming Language Models with Attention Sinks는 ICLR 2024에 발표된 논문으로, 장시간 대화나 지속적인 텍스트 스트림에서 LLM을 고정된 메모리와 안정적인 품질로 계속 실행하기 위한 StreamingLLM을 제안합니다. 핵심 발견은 Transformer가 의미적으로 중요하지 않은 초기 몇 개 토큰에 비정상적으로 큰 attention을 할당한다는 것이며, 저자들은 이를 attention sink라고 부릅니다. 논문의 핵심 아이디어는 매우 단순합니다. 최근 토큰만 남기는…

  • * Massive Activations in Large Language Models (COLM 2024)

    * Massive Activations in Large Language Models (COLM 2024)

    https://www.dropbox.com/scl/fi/zglouvvur991wj0oxz3aw/arxiv24_Decoding_Massive_Activations.pdf?rlkey=r4ubxwtcm0z3y245uhjxzzq1m&dl=0 이 논문은 최근 LLM 해석 가능성(Mechanistic Interpretability) 연구 중에서도 상당히 독창적인 논문입니다. 기존 연구들이 attention head, MLP neuron, circuit 등을 분석했다면, 이 논문은 훨씬 근본적인 현상을 발견합니다. LLM 내부에는 다른 activation보다 수천~수만 배 큰 activation이 극히 소수 존재하며, 이들은 단순한 이상치(outlier)가 아니라 모델 전체가 사용하는 “고정 bias” 역할을 한다.  이 논문의 가장 중요한 기여는…

  • * The Super Weight in Large Language Models (ArXiv 2024)

    * The Super Weight in Large Language Models (ArXiv 2024)

    https://www.dropbox.com/scl/fi/985p2nb0mpnb14r2poljy/arxiv24_The_Super_Weight.pdf?rlkey=c82g5zqj9dfsoa1xbvyw83byk&dl=0 기존 연구들이 “수십만 개의 outlier weight가 중요하다“는 수준까지 밝혀냈다면, 이 논문은 그보다 훨씬 극단적인 결과를 제시합니다. LLM에는 단 하나(single scalar)의 weight만 제거해도 모델 전체가 붕괴되는 경우가 존재한다. 저자들은 이 weight를 Super Weight (SW) 라고 부르며, 이것이 생성하는 activation을 Super Activation (SA) 라고 정의합니다. 또한 이 현상을 이용하여 quantization 성능까지 향상시키는 방법을 제안합니다.  1. 논문의…

  • * Why Do Some Inputs Break Low-Bit LLM Quantization? (EMNLP 2025)

    * Why Do Some Inputs Break Low-Bit LLM Quantization? (EMNLP 2025)

    https://www.dropbox.com/scl/fi/6oqk3o2q9ylkxa3h9kj7q/emnlp25_Quantization_Collapse_Anatomy.pdf?rlkey=u0ovw9997s2v5fqxldvcwx409&dl=0 논문 개요 **Ting-Yun Chang et al., “Why Do Some Inputs Break Low-Bit LLM Quantization?” (EMNLP 2025)**는 다음 질문을 다룹니다. 동일한 LLM과 동일한 양자화 비트 수를 사용해도, 왜 일부 입력에서는 양자화 오차가 유난히 크게 발생하는가? 기존 양자화 연구는 주로 모델 전체 평균 성능, 예를 들어 WikiText perplexity나 downstream accuracy를 개선하는 데 집중했습니다. 반면 이 논문은…

  • Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat (ArXiv 2026)

    한 줄 요약 이 논문은 LLM이 사람처럼 질문 순서(question order)에 영향을 받는지를 QQ Equality(Quantum Question Equality)라는 인지과학의 정량적 법칙으로 분석한 첫 번째 연구이다. 그러나 가장 중요한 결론은 **LLM이 QQ를 만족하는지 여부보다, 현재의 next-token probability 측정 방식 자체가 거의 deterministic하여 이러한 분석에 적합하지 않다(saturation)**는 것이다. 즉, 논문의 가장 큰 기여는 **새로운 auditing framework와 “saturation caveat”**이다. 1.…

  • * A is for Absorption: Studying Feature Splitting and Absorption in SAE (NIPS 2025)

    * A is for Absorption: Studying Feature Splitting and Absorption in SAE (NIPS 2025)

    https://www.dropbox.com/scl/fi/0mtfjv8lysul7hog16zbb/nips25-Unmasking_Feature_Absorption.pdf?rlkey=eitrlfufvvhdlyf3vwmv45q1v&dl=0 이 논문은 SAE(Sparse Autoencoder)가 “해석 가능한 feature”를 잘 찾는다는 믿음에 중요한 반례를 제시합니다. 핵심 주장은 다음입니다. SAE latent가 겉보기에는 “starts with S” 같은 단일 의미 feature처럼 보이지만, 실제로는 그 feature가 활성화되어야 할 일부 사례에서 꺼지고, 더 구체적인 child feature latent가 그 방향을 대신 포함하는 feature absorption이 발생한다. 즉, SAE가 feature hierarchy를 만나면 sparsity objective…

  • ** A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models (ICML 2026)

    ** A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models (ICML 2026)

    https://www.dropbox.com/scl/fi/growzuf1g10n23ycuh1rn/icml26_Unmasking_the_ME_Layer.pdf?rlkey=zrdsdbrnkxtsjlycfcbklo82a&dl=0 논문 개요 A Single Layer to Explain Them All: Understanding Massive Activations in Large Language Models는 LLM의 중간 hidden state에서 특정 토큰의 activation norm이 다른 토큰보다 수백~수천 배 커지는 massive activation이 어디서, 어떻게 발생하는지를 분석한 논문입니다. 논문의 핵심 주장은 다음과 같습니다. Massive activation은 여러 층에 걸쳐 점진적으로 누적되는 것이 아니라, 모델마다 특정한 단 하나의…

  • * Unraveling LLM Jailbreaks Through Safety Knowledge Neurons (EACL 2026)

    * Unraveling LLM Jailbreaks Through Safety Knowledge Neurons (EACL 2026)

    https://www.dropbox.com/scl/fi/wz3fsywxso9q074mnd60a/eacl26_Mapping_LLM_Safety_Neurons.pdf?rlkey=204lilpoeoz69mpth0wgrl4bt&dl=0 논문 개요 핵심 질문: 정렬된 LLM이 유해 요청을 거부하거나 정상 요청에 응답하도록 만드는 내부 메커니즘을, MLP 뉴런 수준에서 찾고 조작할 수 있는가? 논문의 주장은 다음과 같습니다. 1. 논문의 전체 구조 논문은 크게 세 단계로 구성됩니다. 단계 목적 제안 방법 1 안전 관련 뉴런 탐색 및 해석 Safety Knowledge Neuron Identification 2 해당 뉴런의 인과적…

  • ** The Achilles’ Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities (ICLR 2026)

    ** The Achilles’ Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities (ICLR 2026)

    https://www.dropbox.com/scl/fi/ghq9k5fbg9z6afwwac9t6/iclr26_The_Achilles_Heel_of_LLMs.pdf?rlkey=n3y4fj90q7eu1es2mmf83k06q&dl=0 아래 논문은 LLM 내부에 “극소수의 치명적 뉴런(critical neurons)”이 존재하며, 이 뉴런 몇 개를 0으로 마스킹하면 거대 모델도 언어 능력이 붕괴한다는 주장을 실험적으로 보이는 논문입니다.  1. 핵심 아이디어 논문의 질문은 다음입니다. LLM에도 인간 뇌처럼 핵심 기능을 좌우하는 소수의 critical neuron이 존재하는가? 저자들의 결론은 그렇다입니다. 특히 놀라운 주장은 다음입니다. 2. 문제 정의 모델 전체 뉴런 집합을…

  • * Style-Specific Neurons for Steering LLMs in Text Style Transfer (ArXiv 2024)

    * Style-Specific Neurons for Steering LLMs in Text Style Transfer (ArXiv 2024)

    https://www.dropbox.com/scl/fi/461zskxov2ve5qi58l7yw/arxiv24_Precision_Neural_Style_Control.pdf?rlkey=0q95lefm357wr4h0c6vszlmck&dl=0 이 논문은 LLM 내부에 “문체(style)-특화 뉴런”이 존재한다고 보고, 이를 이용해 Text Style Transfer(TST) 를 디코딩 단계에서 제어하는 방법인 sNeuron-TST를 제안합니다. 목표는 입력 의미는 유지하면서, 예를 들어 informal→formal, toxic→neutral, impolite→polite처럼 문체만 바꾸는 것입니다. 기존 LLaMA-3는 zero-shot TST에서 입력을 그대로 복사하는 경향이 크며, polite→impolite 변환에서는 약 34% 출력이 입력과 동일했다고 보고합니다.   1. 문제의식 TST는 다음…

  • * Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation (IJCNLP 2025)

    * Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation (IJCNLP 2025)

    https://www.dropbox.com/scl/fi/tetc664rcpyjs0ei6jv2a/ijcnlp25_Multilingual_Neural_Topography.pdf?rlkey=z6p27xj789bwgqtfkandchnk7&dl=0 이 논문은 LLM 내부에서 특정 언어를 담당하는 language-specific neuron을 체계적으로 찾고, 그 뉴런을 조작해 출력 언어와 다국어 태스크 성능을 제어할 수 있는지를 분석합니다. 대상 모델은 Llama-3.1-8B, Mistral-Nemo-12B, Aya-Expanse-8B/32B이고, 21개 언어를 다룹니다.   핵심 주장은 다음입니다. 특정 언어에 민감하게 반응하는 FFN 뉴런들이 존재하며, 이 뉴런들은 주로 후반 layer에 집중되어 있다. 이 뉴런들을 더하거나 끄는 방식의…

  • * Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers (ArXiv 2025)

    * Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers (ArXiv 2025)

    https://www.dropbox.com/scl/fi/mrrrnwxysyt050xm6fecm/arxiv25_Decoding_the_LLM_Black_Box.pdf?rlkey=z2z515j3nhhjjj6octasmso33&dl=0 논문 핵심 요약 이 논문은 LLM의 activation을 자연어로 질의응답할 수 있는 모델, 즉 Activation Oracle(AO) 을 학습하고 평가한 연구입니다. 기존 mechanistic interpretability가 SAE, logit lens, circuit analysis처럼 특수한 도구를 요구했다면, 이 논문은 activation을 <ACT> 토큰에 주입한 뒤 “이 activation이 의미하는 것은 무엇인가?” 를 LLM에게 직접 묻는 방식입니다.   1. 문제 설정 기존 LatentQA는 다음처럼…

  • * Self-Critique and Refinement for Faithful Natural Language Explanations (EMNLP 2025)

    * Self-Critique and Refinement for Faithful Natural Language Explanations (EMNLP 2025)

    https://www.dropbox.com/scl/fi/i5vv8jdkavzfuvz83bcc8/emnlp25_Illuminating_the_LLM_Black_Box.pdf?rlkey=hepgxjcewg5xxyljt6w8xh9iv&dl=0 아래는 EMNLP 2025“Self-Critique and Refinement for Faithful Natural Language Explanations (SR-NLE)”논문에 대한 설명입니다. 특히 **방법론(Method)**과 **실험 결과(Experiments)**를 중심으로 설명하겠습니다.   1. 연구 배경 최근 LLM은 답뿐 아니라 Natural Language Explanation(NLE) 도 함께 생성한다. 예를 들어 NLI에서는 처럼 prediction은 맞지만 explanation은 전혀 prediction 이유를 설명하지 못하는 경우가 많다. 논문에서는 이것을 Unfaithful Explanation 이라고 부른다. 즉,…

  • * ERASER: A Benchmark to Evaluate Rationalized NLP Models (ACL 2020)

    * ERASER: A Benchmark to Evaluate Rationalized NLP Models (ACL 2020)

    https://www.dropbox.com/scl/fi/k3talej8kpav2wo35wgze/acl20_ERASER_NLP_Interpretability_Benchmark.pdf?rlkey=9an8act367vqsiv5x9ufn6cw0&dl=0 1. 논문 개요 ERASER는 NLP 모델의 rationale, 즉 “모델 예측을 뒷받침하는 입력 근거 구간”을 평가하기 위한 ACL 2020 벤치마크 논문입니다. 핵심 문제의식은 기존 해석가능성 연구들이 서로 다른 데이터셋과 지표를 사용해, 모델 간 비교와 발전 추적이 어렵다는 점입니다. 이 논문은 7개 데이터셋을 통합하고, human rationale과 모델 rationale을 비교하는 표준 평가 지표를 제안합니다. 2. ERASER 데이터셋…

  • * Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition (ArXiv 2026)

    * Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition (ArXiv 2026)

    https://www.dropbox.com/scl/fi/m8ydapea0118gu8r99wst/arxiv26_Mapping_the_70B_Neural_Labyrinth.pdf?rlkey=4p3na7fk0x9kjb6gxgr7kyetq&dl=0 이 논문은 최근 Sparse Feature Circuit 계열(SAE, Transcoder, Edge Pruning, EAP) 연구들을 모두 조합하여 70B 규모 LLM까지 회로(circuit)를 추출할 수 있는 scalable framework를 제안한 논문입니다. 새로운 알고리즘을 실제 구현하여 대규모 실험으로 검증했다기보다는 기존 연구들을 조합한 프레임워크 제안 성격이 강합니다. 특히 일부 실험 수치(70B까지의 결과 등)는 공개 코드나 재현성 정보가 부족하여 실제 구현 여부를 신중하게…

  • *** Scalable Circuit Learning for Interpreting Large Language Models (ArXiv 2026)

    *** Scalable Circuit Learning for Interpreting Large Language Models (ArXiv 2026)

    https://www.dropbox.com/scl/fi/mfx0toc5zfqfxpjumz9lr/arxiv26-CircuitLasso_Scalable_LLM_Interpretation.pdf?rlkey=ik0e38m6gbyiaj1ss7e6oxjdh&dl=0 아래 논문은 CircuitLasso라는 방법을 제안합니다. 핵심은 SAE feature 기반 circuit discovery를 intervention 없이 Lasso sparse regression으로 확장 가능하게 수행하는 것입니다.   1. 문제의식 기존 circuit discovery 방법들, 예를 들어 activation patching, EAP, EAP-IG, causal tracing은 edge나 node의 causal effect를 intervention으로 측정합니다. 문제는 두 가지입니다. 첫째, raw neuron은 polysemantic이라서 circuit을 찾더라도 해석이 어렵습니다. 둘째, SAE…

  • ** Learning Multi-Level Features with Matryoshka Sparse Autoencoders (ICML 2025)

    ** Learning Multi-Level Features with Matryoshka Sparse Autoencoders (ICML 2025)

    https://www.dropbox.com/scl/fi/lpykb1k7v8m9es34c17xk/icml25-Matryoshka_Sparse_Autoencoders.pdf?rlkey=lofqba7503u2mjkc5nypnkr4t&dl=0 이 논문은 최근 Sparse Autoencoder(SAE) 연구에서 **가장 중요한 문제인 “dictionary를 크게 만들면 오히려 feature quality가 나빠지는 현상”**을 해결하려는 논문입니다. 1. 연구 배경 기존 SAE는 dictionary size를 크게 만들수록 reconstruction은 좋아집니다. 예를 들어, dictionary를 계속 늘리면 activation reconstruction error는 감소합니다. 하지만 interpretability에서는 문제가 생깁니다. 논문에서는 이를 크게 3가지 pathology로 설명합니다. (1) Feature Splitting 원래 Punctuation…

  • ** Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models (ArXiv 2025)

    ** Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models (ArXiv 2025)

    https://www.dropbox.com/scl/fi/bx0h5t4f407ku71fpttlf/arxiv25_Mapping_Neural_Constellations.pdf?rlkey=uph99bv60z7b03486pws0gb68&dl=0 이 논문은 **Sparse Autoencoder(SAE)의 feature를 개별적으로 보는 것이 아니라, 여러 layer에서 함께(co-activation) 활성화되는 feature들의 집합(component)**을 찾아 semantic module로 해석하는 논문입니다. 기존의 circuit discovery처럼 복잡한 edge attribution(EAP, ACDC, Transcoder Circuit)을 수행하지 않고도 상당히 의미 있는 semantic module을 발견할 수 있다는 것이 핵심입니다.   1. 연구 배경 Mechanistic Interpretability에서는 크게 두 가지 흐름이 있다. (1) Circuit…

  • NMF, Semi-NMF, Sparse NMF, Dictionary learning

    NMF 계열은 최근 Mechanistic Interpretability에서도 SAE(Sparse Autoencoder)의 대안 또는 보완 기법으로 많이 주목받고 있습니다. 특히 최근의 SNMF (Sparse NMF, Semi-NMF) 기반 Circuit Discovery 논문들이 나오면서 구분이 중요해졌습니다. 1. NMF (Non-negative Matrix Factorization) 기본 아이디어 주어진 데이터 행렬 X∈ℝn×dX \in \mathbb{R}^{n\times d} 를 두 개의 저차원 행렬로 분해한다. X≈WHX \approx WH 여기서 W∈ℝn×kW \in \mathbb{R}^{n\times k},…