[태그:] DCD
-

** Data-driven Circuit Discovery for Interpretability of Language Models (ArXiv 2026)
https://www.dropbox.com/scl/fi/0obkn20zzc9calyuis42g/arxiv26_Data_Driven_Circuit_Discovery.pdf?rlkey=jdkjeb0x5ox1dblw6m58jy5lr&dl=0 이 논문의 핵심 메시지는 매우 간단합니다. 기존 Circuit Discovery는 “task → 하나의 circuit”이라는 가정을 깔고 있는데, 실제 LLM은 같은 task도 여러 메커니즘으로 풀 수 있다. 따라서 기존 방법은 task circuit이 아니라 dataset-specific circuit을 찾고 있으며, 심지어 서로 다른 메커니즘을 하나의 circuit에 섞어버릴 수 있다. 이를 해결하기 위해 Data-driven Circuit Discovery (DCD) 를 제안한다. …