[카테고리:] Defending LLM
-

** The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions (ICML 2025)
https://www.dropbox.com/scl/fi/zr0s84zygykijwipxx6gq/icml25_Hidden_Dimensions_of_LLM_Alignment.pdf?rlkey=sz9vcdhjzbh027r33zhphuxxc&dl=0 이 논문의 핵심 문제의식은 기존의 refusal direction 연구가 alignment를 **하나의 선형 방향(single direction)**으로 설명하는 데 비해, 실제 safety fine-tuning은 여러 개의 서로 다른 orthogonal feature directions로 이루어진 저차원 subspace를 학습한다는 것입니다. 1. 논문의 핵심 아이디어 기존 연구의 전형적인 접근은 다음과 같습니다. vrefusal=𝔼[h|refusal]−𝔼[h|compliance]v_{\text{refusal}}=\mathbb{E}[h\mid \text{refusal}]-\mathbb{E}[h\mid \text{compliance}] 즉 harmful/safe 또는 refusal/compliance contrast pair를 이용해 하나의 safety direction을…
-

* Unraveling LLM Jailbreaks Through Safety Knowledge Neurons (EACL 2026)
https://www.dropbox.com/scl/fi/wz3fsywxso9q074mnd60a/eacl26_Mapping_LLM_Safety_Neurons.pdf?rlkey=204lilpoeoz69mpth0wgrl4bt&dl=0 논문 개요 핵심 질문: 정렬된 LLM이 유해 요청을 거부하거나 정상 요청에 응답하도록 만드는 내부 메커니즘을, MLP 뉴런 수준에서 찾고 조작할 수 있는가? 논문의 주장은 다음과 같습니다. 1. 논문의 전체 구조 논문은 크게 세 단계로 구성됩니다. 단계 목적 제안 방법 1 안전 관련 뉴런 탐색 및 해석 Safety Knowledge Neuron Identification 2 해당 뉴런의 인과적…
-

* Exploiting LLM Quantization (NeurIPS 2024)
https://www.dropbox.com/scl/fi/bq5prdt4kojy05xzjhm0j/nips24_The_Quantization_Trap.pdf?rlkey=w7se4r88bk3g1ahymacojr5u8&dl=0 이 논문은 LLM 양자화(quantization)가 단순한 압축/가속 기법이 아니라, 악성 행동을 숨겨 전달하는 공격 벡터가 될 수 있음을 최초로 체계적으로 보여준 논문입니다. 핵심 아이디어는 매우 강력합니다: Full-precision 모델은 정상처럼 보이지만, 사용자가 quantization을 수행하는 순간 악성 행동이 활성화된다. 즉, Hugging Face에 업로드된 FP32 모델은 안전해 보이는데, 사용자가 로컬에서 INT8/NF4/FP4로 양자화하면 갑자기: 1. 문제 설정 논문이 다루는…
-

*** Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks (ICLR 2025)
https://www.dropbox.com/scl/fi/g6gm2mxx83ltyv47nm702/iclr25_Shattering_AI_Safety.pdf?rlkey=lcz240n08cmichjgadn06yzmq&dl=0 이 논문은 다음의 핵심 메시지를 전달합니다: 현재의 대표적인 safety-aligned LLM들(GPT-4o, Claude 3.5, Llama-3, Gemma 등)은생각보다 훨씬 단순한 adaptive attack만으로도 거의 100% jailbreak 가능하다. 특히 중요한 점은: 없이도, 단순한: 조합만으로 frontier 모델들을 전부 jailbreak 했다는 점입니다. 1. 문제 설정 논문의 목표는 다음입니다. LLM이 원래는 거부(refusal)해야 하는 harmful request: 등에 대해 실제 harmful response를 생성하도록…
-

Baseline Defenses for Adversarial Attacks Against Aligned Language Models (ArXiv 2023)
https://www.dropbox.com/scl/fi/42xh1x464c0cw7gfxxm7d/arxiv23_LLM_Adversarial_Security.pdf?rlkey=c5j9qru9civdb6vsgtbh604u1&dl=0 이 논문은 LLM jailbreak 공격에 대해, 기존 adversarial machine learning(특히 computer vision)의 방어 기법들을 LLM에 적용하면 실제로 얼마나 효과가 있는지를 체계적으로 분석한 초기 대표 논문이다. 핵심은 **“완벽한 defense를 만들었다”가 아니라, 기존 baseline defense들이 LLM에서는 surprisingly 잘 동작할 수 있다”**는 점이다. 1. 논문 핵심 문제의식 기존 alignment된 LLM(ChatGPT, Vicuna 등)은 harmful query에 대해 refusal을…
-

*** GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs (ArXiv 2024)
https://www.dropbox.com/scl/fi/ya2axdo5gka9awivkp87w/arxiv24_GASP_Stealthy_LLM_Jailbreaking.pdf?rlkey=qbleaiprrmcu5tx83w4osrtck&dl=0 아래는 GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs (arXiv 2024) 논문의 핵심 내용을 정리한 설명입니다 1. 문제 정의 및 동기 LLM은 RLHF 등으로 안전 정렬(alignment)이 되어 있지만, adversarial prompt (jailbreak) 를 통해 유해 응답을 유도할 수 있습니다. 기존 jailbreak 방법의 한계: 방법 한계 Heuristic (role-play 등) 일반화 어려움, 수작업 의존 GCG류…
-

* Tree of Attacks: Jailbreaking Black-Box LLMs Automatically (NeurIPS 2024)
https://www.dropbox.com/scl/fi/jd0im5p82nhdytkkpqfd8/nips24_TAP_Automated_LLM_Jailbreaking.pdf?rlkey=5eo4v3cihdxd3mthswnxywiv9&dl=0 논문 개요 이 논문은 black-box 환경에서 자동으로 LLM을 jailbreak하는 방법인 TAP (Tree of Attacks with Pruning) 을 제안합니다. 핵심은 다음 세 가지 조건을 모두 만족하는 공격 방법입니다: 기존 black-box 방법(PAIR)을 확장하여, branching + pruning 구조를 도입해 성공률을 크게 개선합니다 . 1. 문제 정의 LLM alignment (RLHF, guardrail 등)에도 불구하고, “How to build a bomb?”…
-

*** AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs (ICML 2025)
https://www.dropbox.com/scl/fi/kwj2led25zucha4tf3xoe/icml25_AdvPrompter_Fast_Adaptive_Adversarial_Prompting.pdf?rlkey=5opk654xmgml6cl1bje1xrpzw&dl=0 논문 **“AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs” (ICML 2025)**는 자동화된 adversarial red-teaming을 위한 LLM 기반 기법인 AdvPrompter를 제안합니다. 이 모델은 human-readable한 adversarial suffixes를 빠르게 생성하여 Target LLM을 jailbreak하는 데 사용됩니다. 아래는 논문의 핵심 내용입니다. 배경 및 문제의식 핵심 기여 1. AdvPrompter 모델 2. AdvPrompterTrain (훈련 알고리즘) 3. AdvPrompterOpt (suffix 생성 알고리즘) 실험 및 결과 ✔ 공격…
-

* Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing (IJCNLP-AACL 2025)
https://www.dropbox.com/scl/fi/81t9oact4pis3a5fsgsqw/ijcnlp25_SemanticSmooth_LLM_Defense.pdf?rlkey=v7wypnwghb1yeg7xlm5szdynx&dl=0 다음 논문은 IJCNLP-AACL 2025에 게재된 “Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing” 입니다 1. 문제 설정: Jailbreak 공격과 기존 방어의 한계 Jailbreak 공격이란? 정렬(aligned)된 LLM이 유해하거나 금지된 내용을 생성하도록 우회시키는 공격입니다. 논문에서는 다음과 같이 정의합니다: 공격 목표: JUDGE(F(x′))=1\text{JUDGE}(F(x’)) = 1 즉, 원래는 거부해야 할 유해 프롬프트를 수정해 수락하게 만드는 것 공격…
-

** Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM Aggression (ACL 2025)
https://www.dropbox.com/scl/fi/shuzbhoyjjhmbchlaw3mt/acl25_AAPE_LLM_Internal_Aggression_Neuron_Threat.pdf?rlkey=nn4uol33bm5ug8s0xua1a59bm&dl=0 이 논문 “Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM Aggression” (ACL 2025) 은 대형 언어 모델(LLM) 내부의 “공격성(neural aggression)”을 제어하는 특정 뉴런이 존재하며, 이들을 조작하는 것만으로도 모델의 공격성이 급격히 변할 수 있음을 실험적으로 증명한 연구입니다 . 아래는 핵심 내용을 정리한 설명입니다. 1. 연구 목적과 문제의식 2. 연구 질문…