[태그:] Attention Sink
-

** When Attention Sink Emerges in Language Models: An Empirical View (ICLR 2025)
https://www.dropbox.com/scl/fi/77jzbfvnx6c1algovtd8z/iclr25_Attention_Sink_Anatomy.pdf?rlkey=2br6s5zfe1x8mj62v3q4eyi45&dl=0 이 논문은 Attention Sink가 왜 발생하는가?, 언제 발생하는가?, **무엇이 Attention Sink를 결정하는가?**를 체계적으로 분석한 최초의 empirical study이다. 기존 연구들이 “Attention Sink를 활용”하는 데 초점을 맞췄다면, 이 논문은 pretraining 과정에서 Attention Sink가 생성되는 메커니즘을 규명하는 것이 목표이다. 1. 논문의 핵심 질문 저자들은 다음 네 가지 질문을 던진다. 이를 위해 저자들은 등 다양한 autoregressive LM을 분석하였다.…
-

** Efficient Streaming Language Models with Attention Sinks (ICLR 2024)
https://www.dropbox.com/scl/fi/v1sl9gt0gjjchtq2z3d8l/iclr24_StreamingLLM_Unbound.pdf?rlkey=ekljkgijkqzzb2udnvcbnwbvc&dl=0 Efficient Streaming Language Models with Attention Sinks는 ICLR 2024에 발표된 논문으로, 장시간 대화나 지속적인 텍스트 스트림에서 LLM을 고정된 메모리와 안정적인 품질로 계속 실행하기 위한 StreamingLLM을 제안합니다. 핵심 발견은 Transformer가 의미적으로 중요하지 않은 초기 몇 개 토큰에 비정상적으로 큰 attention을 할당한다는 것이며, 저자들은 이를 attention sink라고 부릅니다. 논문의 핵심 아이디어는 매우 단순합니다. 최근 토큰만 남기는…