원문 정보
Nahom Birhan, Mehrdad Rostamzadeh, Sidhant Narula, Mahmoud Nazzal, Mohammad Ghasemigol, Daniel Takabi, "COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers", arXiv:2610.04378 [cs.CR], 2026-10-03 제출, DOI 10.48550/arXiv.2610.04378. 소속: 올드 도미니언 대학교(Old Dominion University). 제3회 "Agents in the Wild: Safety, Security, and Beyond" 워크숍 제출본. 벤치마크·평가 코드 공개(github.com/inspire-center/copex).
동료심사를 완전히 거치지 않은 프리프린트입니다. 워크숍 제출본 표기가 있는데, 워크숍은 보통 학회 본회의보다 심사가 가볍고 수용률도 공개되지 않아 초고에 가깝게 읽어야 합니다. 저자 전원이 올드 도미니언 대학교 소속이고 자금 출처·이해상충 선언문은 따로 없습니다. 평가 대상 모델(Anthropic·OpenAI·Google·xAI 제품)을 만드는 기업으로부터 지원을 받았다는 언급도 없어, 제3자 학술기관 평가라는 점은 이해상충 우려를 줄이는 쪽입니다. 세션 egress 차단으로 원문 전문은 fetch_source_snapshot.py가 2026-10-06T22:10:52Z에 수집한 HTML 전문 스냅숏으로 대조했습니다.
연구 개요
질문은 단순합니다 — MCP(Model Context Protocol)로 도구를 호출하는 에이전트에서 공격이 성공했을 때, 그 책임이 모델에 있는지 아니면 모델이 보지 못하는 하부 계층(클라이언트·서버·전송)에 있는지를 가를 수 있는가입니다. 기존 벤치마크는 실배포 에이전트 제품을 평가해 가드레일·오케스트레이션·과제 수행력이 모델 자체의 취약성과 뒤섞입니다. 저자들은 에이전트 루프·오케스트레이션·도구 환경·실행 예산을 고정하고 도구 선택을 맡는 LLM만 바꾸는 통제 환경 COPEX를 만들었습니다. MCP 서버 16개·도구 75개·리소스 7개를 구성해 25개 공격 유형을 모델/에이전트·클라이언트·서버/툴·전송 4개 진입 표면에 배치하고, 유형마다 5개 시나리오 변형을 둬 125개 시나리오를 실행합니다.
핵심 결과
아홉 모델(Opus 4.7, Sonnet 4.6, GPT-5.5, GPT-5 Mini, GPT-4.1, Gemini 3.1, Grok 4.3, Llama-3.2:3b, Qwen-2.5:3b)에 걸쳐 3,375회 시행한 메인 벤치마크의 평균 공격성공률(ASR)은 64.4%였습니다. 표면별 평균도 모델/에이전트 58.3%부터 전송 71.4%까지 벌어집니다 — 사용자 프롬프트를 거치지 않는 경로의 공격이 오히려 더 잘 통한다는 뜻입니다.
| 모델 | 전체 평균 ASR | 클라이언트(cl) | 전송(tr) |
|---|---|---|---|
| Opus-4.7 | 44.3% | 38.1% | 73.3% |
| Sonnet-4.6 | 45.1% | 37.1% | 62.2% |
| Gemini-3.1 | 74.1% | 95.2% | 75.6% |
| Grok-4.3 | 81.6% | 98.1% | 80.0% |
| 9개 모델 평균 | 64.4% | 67.7% | 71.4% |
전체 ASR이 가장 낮은 Opus-4.7도 전송 공격에서는 73.3%로 뛰어오릅니다 — 모든 표면에서 안전한 모델은 없습니다. 특히 전송 표면의 MCP 리바인딩(제로-TTL DNS로 연결을 공격자 서버로 돌리는 공격)은 모델이 관찰할 수 있는 범위 밖에서 일어나 아홉 모델 전부 ASR 100%였습니다.
방어 효과는 판정 기준과 함께 봐야 합니다. 8개 공격 하위집합에서 입력 스캐너와 컨텍스트 스캐너를 함께 쓰면 평균 ASR이 81.6%에서 41.1%로 떨어집니다(−40.5%p, 상대 감소 49.6%). 그러나 같은 실험에서 MCP 리바인딩은 방어 4종 전부에서 여전히 100%입니다 — 스캐너가 보는 지점(사용자 과제, 도구 스키마·응답) 아래에서 일어나는 공격은 애초에 막을 수 없기 때문입니다.
| 방어 모드 | 평균 ASR | MCP 리바인딩 ASR |
|---|---|---|
| 스캐닝 없음 | 81.6% | 100% |
| 입력 스캐너만 | 48.4% | 100% |
| 컨텍스트 스캐너만 | 57.6% | 100% |
| 입력+컨텍스트 병용 | 41.1% | 100% |
판정 기준(오라클)을 바꾸면 수치도 바뀝니다. 같은 6개 공격을 결정론적 트레이스 판정으로 재면 평균 77.1%, LLM 판정(semantic)으로 재면 83.3%로 +6.3%p 올라갑니다. 추론 구조를 ReAct에서 자기반성을 더하는 Reflexion으로 바꾸면 평균 ASR은 86.2%에서 82.5%로 내려가지만(−3.7%p), 모델별로는 Sonnet 4.6 −9.9%p부터 Grok 4.3 +0.5%p까지 방향이 갈려 일관된 안전장치로 보기 어렵습니다.
신뢰도 평가
믿을 근거는 통제된 설계입니다 — 에이전트 스택을 고정하고 모델만 바꾸므로, 배포 제품의 가드레일·오케스트레이션 효과와 모델 자체의 취약성이 섞이지 않습니다. 아래 관련 연구에서 독립적으로 확인한 선행 MCP·에이전트 벤치마크들도 비슷한 규모의 공격성공률을 보고해, 이번 결과가 유독 튀는 값이 아님을 뒷받침합니다.
감안할 점도 뚜렷합니다. 워크숍 제출본으로 동료심사가 가볍고 이해상충 선언이 따로 없습니다. 방어·추론구조 실험은 변형당 1회만 실행해 저자들 스스로 "점 추정치로 해석해야 한다"고 밝혔고, 25개 공격 유형 중 15개는 LLM 판정자(Claude Haiku 4.5)에 의존해 판정 경계가 수치에 그대로 반영됩니다. ASR은 공격이 전달된 뒤의 취약성만 측정하므로, 실제 공격이 그만큼 자주 시도되거나 접근 가능한지는 별도 문제입니다.
관련 연구(학술 문헌 대조)
- Debenedetti et al.(2024). AgentDojo — NeurIPS 2024 D&B 트랙. 97개 실제 과제에서 공격 없이도 LLM 성공률이 66% 미만이라고 보고해, 과제 수행력과 보안 취약성을 분리해야 한다는 COPEX의 출발 전제와 같은 방향입니다(선행 연구).
- Zhang et al.(2025). Agent Security Bench(ASB) — ICLR 2025 채택. 시스템 프롬프트·메모리까지 10개 시나리오로 범위를 넓혀 최고 평균 ASR 84.30%를 보고했습니다. COPEX보다 범위는 넓지만 MCP 특유의 클라이언트·전송 계층을 분리하지 않는다는 점에서 이번 논문과 대비됩니다(선행 연구).
- Yang, Wu, Chen(2025). MCPSecBench — 17개 공격 유형을 Claude Desktop·Cursor 등 실배포 제품에 적용해 85% 이상이 하나 이상의 플랫폼을 뚫었다고 보고했습니다. COPEX가 논문 Table 1에서 직접 비교한 선행 연구로, "배포 제품 평가"와 "모델만 분리한 평가"의 차이를 보여주는 대조군입니다.
세 선행 연구 모두 LLM 에이전트의 공격성공률을 과반 안팎으로 보고한다는 점에서, 이번 수치(평균 64.4%)는 이례적으로 높은 값이 아니라 같은 계열의 반복된 관측입니다. 다만 COPEX는 그 책임을 모델/클라이언트/서버/전송으로 쪼갠 점이 다릅니다.
리뷰어 판단
첫째, 이 논문의 가장 실무적인 결론은 64.4%라는 평균이 아니라 "표면을 쪼개지 않으면 순위가 거짓말을 한다"는 점이라고 판단합니다. Opus-4.7은 전체 평균이 가장 낮지만 전송 공격에서는 73.3%로 전체 평균(64.4%)보다 높습니다. 모델 선택을 전체 ASR 한 줄로 하면 운영 환경에서 실제로 노출된 표면의 위험을 놓칩니다.
둘째, MCP 리바인딩이 방어 4종·모델 9종·추론구조 2종 전부에서 예외 없이 100%라는 사실은 이 논문에서 가장 과소평가된 결과라고 봅니다. 모델·프롬프트에 투자해도 전송 계층 통제(인증서 핀닝, DNS 응답 검증, mTLS) 없이는 이 공격이 줄어들 수 없다는 뜻인데, 저자들은 이를 한계가 아니라 "관찰 경계 밖"이라는 설계 설명으로만 다뤄 무게가 가볍게 느껴집니다.
실무 적용
- 표면별 ASR 보고 — 모델 평가에 전체 평균 대신 모델/클라이언트/서버/전송 표면별 수치를 함께 받아, 자사 배포 구조가 어느 표면에 노출되는지 먼저 따집니다.
- 전송 계층은 모델로 못 막는다 — DNS 리바인딩·엔드포인트 가로채기는 인증서 핀닝·mTLS 같은 네트워크 통제로 막아야 합니다. 프롬프트·모델 교체로는 ASR이 줄지 않습니다.
- 입력+컨텍스트 스캐너 병용 — 단일 스캐너보다 입력·컨텍스트를 함께 스캔할 때 ASR이 더 떨어집니다(81.6%→41.1%). 다만 스캐너가 보는 지점 아래의 공격은 여전히 통과합니다.
- 판정 기준을 명시 — 공격성공률을 외부에 보고할 때 결정론적 트레이스인지 LLM 판정인지 밝힙니다. 같은 공격도 판정 방식에 따라 +6.3%p 차이가 났습니다.
- Reflexion을 보안장치로 오인하지 않기 — 자기반성 추가는 모델별로 효과가 반대로 갈려(−9.9%p~+0.5%p) 일관된 방어 수단이 아닙니다.
결론
COPEX의 기여는 새로운 공격 기법이 아니라 "누구 책임인가"를 가르는 측정 설계에 있습니다. 평균 공격성공률 64.4%, 방어 병용으로 49.6% 감소, 그러나 전송 계층 공격은 방어 4종 전부에서 100%라는 조합은 모델 교체·프롬프트 튜닝만으로는 MCP 에이전트의 보안이 완성되지 않는다는 점을 숫자로 보여줍니다. 워크숍 제출본이라 동료심사가 가볍고 방어·구조 실험은 점 추정치이므로, 도입 전 자체 표면별 재현을 거치는 것이 맞습니다. 서드파티 MCP 서버를 들이는 운영 절차는 MCP 서버 신뢰·버전 게이트에서 이어집니다.
참고 링크
- COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers — arXiv 초록(원문)
- 같은 논문 HTML 전문 — 표·ASR 수치 대조에 사용
- AgentDojo(Debenedetti et al., 2024) — 관련 연구 원문
- Agent Security Bench(Zhang et al., 2025) — 관련 연구 원문
- MCPSecBench(Yang, Wu, Chen, 2025) — 관련 연구 원문
- MCP 서버 신뢰·버전 게이트 — sunny34.com 블로그
이 리뷰에 대해 AI와 대화하기
AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…