[태그:] CircuitLasso
-

*** Scalable Circuit Learning for Interpreting Large Language Models (ArXiv 2026)
https://www.dropbox.com/scl/fi/mfx0toc5zfqfxpjumz9lr/arxiv26-CircuitLasso_Scalable_LLM_Interpretation.pdf?rlkey=ik0e38m6gbyiaj1ss7e6oxjdh&dl=0 아래 논문은 CircuitLasso라는 방법을 제안합니다. 핵심은 SAE feature 기반 circuit discovery를 intervention 없이 Lasso sparse regression으로 확장 가능하게 수행하는 것입니다. 1. 문제의식 기존 circuit discovery 방법들, 예를 들어 activation patching, EAP, EAP-IG, causal tracing은 edge나 node의 causal effect를 intervention으로 측정합니다. 문제는 두 가지입니다. 첫째, raw neuron은 polysemantic이라서 circuit을 찾더라도 해석이 어렵습니다. 둘째, SAE…