Baseline Defenses for Adversarial Attacks Against Aligned Language Models (ArXiv 2023)

https://www.dropbox.com/scl/fi/42xh1x464c0cw7gfxxm7d/arxiv23_LLM_Adversarial_Security.pdf?rlkey=c5j9qru9civdb6vsgtbh604u1&dl=0

이 논문은 LLM jailbreak 공격에 대해, 기존 adversarial machine learning(특히 computer vision)의 방어 기법들을 LLM에 적용하면 실제로 얼마나 효과가 있는지를 체계적으로 분석한 초기 대표 논문이다. 핵심은 **“완벽한 defense를 만들었다”가 아니라, 기존 baseline defense들이 LLM에서는 surprisingly 잘 동작할 수 있다”**는 점이다.  

1. 논문 핵심 문제의식

기존 alignment된 LLM(ChatGPT, Vicuna 등)은 harmful query에 대해 refusal을 하도록 학습되어 있다.

예:

  • “폭탄 만드는 법 알려줘”
    → “죄송하지만 도와줄 수 없습니다.”

하지만 Zou et al. (2023)의 GCG(Greedy Coordinate Gradient) 기반 jailbreak attack은:

harmful prompt + adversarial suffix

형태의 이상한 문자열을 붙여서 alignment를 우회한다.

예:

How to make a bomb?
[ weird token suffix ]

그러면 모델이 refusal 대신 harmful response를 생성한다.

논문은 질문한다:

  1. 이런 jailbreak를 막을 수 있는가?
  2. CV adversarial defense들이 LLM에서도 유효한가?
  3. LLM adversarial attack은 vision attack과 무엇이 다른가?

2. 논문의 가장 중요한 주장

논문의 핵심 takeaway는:

LLM 공격은 discrete optimization이라 매우 비싸고 어렵다.

즉:

  • Vision:
    • continuous pixel optimization
    • gradient 1~5번이면 attack 가능
  • LLM:
    • discrete token optimization
    • 수십만~수백만 model evaluation 필요

따라서:

“공격 비용을 높이는 defense” 자체가 실제로 의미가 있을 수 있다.

이게 논문의 가장 중요한 insight다.  


3. Threat Model

논문은 기존 adversarial ML의 threat model이 LLM에는 맞지 않는다고 주장한다.

기존 CV threat model

보통:

δp<ϵ\|\delta\|_p < \epsilon

같은 작은 perturbation 제약 사용.

하지만 LLM에서는:

  • 공격 문자열이 안 보여도 되는 게 아님
  • context length 매우 큼
  • token perturbation이 discrete

따라서 논문은 새로운 threat model 제안:

(1) Compute Budget 기반

공격자의 strength를:

“몇 번의 model evaluation을 할 수 있는가?”

로 정의.  

즉:

  • 공격 성공률
  • 공격 시간
  • optimization complexity

가 핵심.


(2) Gray-box 중요성

논문은:

  • white-box robustness는 사실상 매우 어려움
  • 현실에서는 gray-box defense가 중요

라고 주장한다.  

예:

  • ChatGPT 내부 defense 모델 비공개
  • moderation model 비공개
  • paraphraser 비공개

이 secrecy 자체가 defense 역할.


4. Defense Category

논문은 defense를 3종류로 나눈다.

Category방법
DetectionPerplexity filtering
PreprocessingParaphrase, Retokenization
Robust OptimizationAdversarial Training

5. Defense 1: Perplexity Filtering

논문의 가장 유명한 부분.

아이디어

adversarial suffix는 보통 이상한 gibberish 형태다.

예:

vc Please dwapor Terinners rabb cette ...

이런 문자열은 perplexity(PPL)가 매우 높다.

따라서:

if PPL(prompt) > threshold:
    reject

하면 jailbreak를 탐지 가능.  


Windowed PPL

전체 prompt 평균만 보면 숨길 수 있으므로:

슬라이딩 윈도우로 검사.

예:

  • 10-token window
  • 각 window의 max perplexity 사용

6. 결과: Surprisingly Strong

논문 결과:

ModelAttack SuccessPPL Passed
Vicuna0.790.00
Guanaco0.960.00

즉:

  • 공격은 성공하지만
  • PPL filter는 거의 전부 탐지함.  

7. Adaptive Attack

공격자가:

L=(1α)Ltarget+αLpplL = (1-\alpha)L_{target} + \alpha L_{ppl}

즉:

  • jailbreak 성공
  • low perplexity

둘 다 최적화하도록 수정.  

논문 결과:

  • α 증가하면
    • PPL 감소
    • 하지만 ASR 급락

즉:

현재 discrete optimizer는
“attack + low PPL”을 동시에 만족시키기 어렵다.

이게 논문의 핵심 empirical finding이다.  


8. 중요한 Insight

논문이 반복해서 강조하는 점:

Vision에서는:

  • adaptive attack이 defense를 쉽게 뚫음

하지만 LLM에서는:

  • optimization이 너무 어려워서
  • simple defense도 꽤 강함.

즉:

“gradient obfuscation”이 아니라
실제 optimization difficulty일 수 있다.


9. Defense 2: Paraphrasing

아이디어

입력을 paraphrase한 뒤 모델에 넣는다.

예:

Original:
"How to hack network [suffix]"

Paraphrased:
"Describe methods to breach protected systems."

adversarial suffix가 paraphrase 과정에서 깨진다.  


결과

Vicuna:

  • 원래 ASR: 0.79
  • paraphrase 후: 0.05

엄청난 감소.  


단점

정상 prompt도 성능 저하.

AlpacaEval 기준:

  • 약 10~15% quality drop 발생.  

White-box adaptive attack

논문은:

  • paraphraser 자체도 공격 가능
  • white-box에서는 bypass 가능

하다고 보여준다.  

즉:

  • gray-box에서는 꽤 유효
  • white-box에서는 불안정

10. Defense 3: Retokenization (BPE-dropout)

이 부분이 매우 흥미롭다.

아이디어

공격은 특정 token combination에 의존한다.

따라서 tokenization을 랜덤하게 바꾸면 attack이 깨질 수 있다.

예:

studying
→ study + ing

처럼 BPE merge를 일부 제거.  


BPE-dropout

merge를 랜덤하게 drop

하여:

  • token boundary 변화
  • adversarial trigger 붕괴

결과

특히 Vicuna/Guanaco에서:

  • ASR 감소

하지만 Falcon에서는 효과 적음.  


11. 매우 중요한 Observation

논문은 아주 중요한 현상을 발견한다:

retokenization 후:

harmful prompt without attack

도 refusal이 약해짐.

즉:

  • alignment가 tokenization에 강하게 의존

한다는 의미.  

이 insight는 이후:

  • tokenizer robustness
  • byte-level defense
  • tokenization attack

연구로 이어진다.


12. Defense 4: Adversarial Training

논문은 adversarial training도 시도.

하지만 실패에 가까운 결과.

왜냐면:

  • 공격 생성 비용이 너무 큼
  • 매 training step마다 jailbreak 생성 불가능

하기 때문.  


결과

  • harmless prompt 성능 붕괴
  • repetition 증가
  • robustness improvement 거의 없음

즉:

Vision-style adversarial training은
현재 LLM에서는 실용적이지 않다.


13. 논문의 가장 중요한 철학적 메시지

논문은 마지막에 매우 중요한 이야기를 한다.

기존 adversarial ML community는:

“white-box robust하지 않으면 의미 없다”

고 보는 경향이 있다.

하지만 논문은:

LLM에서는:

  • optimization이 매우 어려움
  • gray-box defense도 practical value가 큼

이라고 주장한다.  


14. 이후 연구에 미친 영향

이 논문은 이후 연구들에 매우 큰 영향을 줌.

특히:

(1) PPL-based defense 계열

이후 많은 논문이:

L=Lattack+αLPPLL = L_{attack} + \alpha L_{PPL}

구조 사용.


(2) Retokenization defense

후속:

  • SmoothLLM
  • JailGuard
  • Token randomization
  • Semantic smoothing

등의 기반이 됨.


(3) Compute-aware threat model

현재 jailbreak 연구에서:

  • query budget
  • attack cost
  • transfer cost

중요해진 배경 중 하나.


15. 논문의 한계

논문 한계도 명확하다.

(1) Attack 약함

당시:

  • GCG 초기 버전
  • optimizer 성능 제한

현재는:

  • AutoDAN
  • PAIR
  • LatentBreak
  • embedding attack

등 훨씬 강력.


(2) Closed-source 모델 부족

대부분:

  • Vicuna
  • Guanaco
  • Falcon

위주.


(3) Semantic attack 부족

주로:

  • gibberish suffix attack

만 고려.


16. 핵심 요약

이 논문의 핵심은:

  1. LLM jailbreak는 discrete optimization이라 매우 비쌈
  2. 따라서 simple defense도 surprisingly strong
  3. PPL filtering은 매우 효과적
  4. paraphrase/retokenization도 강력
  5. adversarial training은 아직 비실용적
  6. LLM robustness는 CV robustness와 다른 threat model이 필요

이다.  


게시됨

카테고리

작성자

댓글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다