표면을 쪼개면 순위가 뒤집힌다

COPEX 벤치마크는 아홉 개 모델에 걸쳐 3,375회 시행을 돌려 평균 공격성공률(ASR) 64.4%를 기록했습니다. 표면별로 나누면 모델/에이전트 58.3%, 전송 71.4%까지 벌어지며, 전체 ASR이 가장 낮은 Opus-4.7(44.3%)도 전송 공격에서는 73.3%로 뛰어 전체 평균을 넘어섭니다.

이 결과가 운영팀에 주는 신호는 단순합니다. 모델 선택 보고서에 전체 평균 한 줄만 적으면 실제 배포 구조가 노출된 표면의 위험을 놓칩니다. 자사 MCP 배포가 클라이언트·서버·전송 중 어디에 주로 노출되는지부터 표로 확인해야 모델 간 비교가 의미를 갖습니다.

모델이 보지 못하는 전송 계층 공격

전송 표면의 MCP 리바인딩(제로-TTL DNS로 연결을 공격자 서버로 돌리는 수법)은 아홉 모델 전부, 스캐닝 없음·입력 스캐너·컨텍스트 스캐너·둘 다 병용까지 방어 네 가지 조합 전부에서 ASR 100%를 유지했습니다. 모델이 관찰하는 지점(사용자 과제, 도구 스키마와 응답) 아래에서 공격이 일어나기 때문입니다.

입력과 컨텍스트 스캐너를 함께 쓰면 다른 여덟 개 공격 유형의 평균 ASR은 81.6%에서 41.1%까지 떨어집니다. 그러나 이 개선은 전송 계층에는 닿지 않으므로, 인증서 핀닝·DNS 응답 검증·mTLS 같은 네트워크 통제 없이는 같은 숫자가 반복됩니다.

판정 기준에 따라 달라지는 숫자

같은 여섯 개 공격을 결정론적 트레이스로 판정하면 평균 77.1%, LLM 판정(semantic judge)으로 판정하면 83.3%로 6.3%p 차이가 납니다. 추론 구조를 ReAct에서 Reflexion으로 바꾸면 평균 ASR은 86.2%에서 82.5%로 내려가지만, Sonnet-4.6은 9.9%p 줄고 Grok-4.3은 0.5%p 늘어 방향이 갈립니다.

외부에 ASR을 보고하거나 벤더 간 수치를 비교할 때 판정 기준을 밝히지 않으면 같은 공격도 다른 숫자로 읽힙니다. Reflexion 같은 추론 구조 변경도 모델마다 반대로 작동하므로 일관된 방어 수단으로 전제할 수 없습니다.

설계에서 운영까지: MCP 레드팀·전송 게이트 체크리스트

입력+컨텍스트 스캐너 병용으로 평균 ASR을 상대 49.6% 이상 낮추는 것을 1차 목표로 삼고, 전송 계층은 모델 지표가 아니라 네트워크 지표로 따로 관리합니다. 인증서 핀 적용률 100%, 주간 DNS 응답 검증 실패 0건을 운영 합격선으로 선언합니다.

표면별 ASR을 모델 평가 보고서의 필수 항목으로 넣습니다. 전체 평균 한 줄로 모델을 고르면 Opus-4.7처럼 전체는 낮아도 전송에서 역전되는 사례를 놓칩니다.

가장 흔한 네 가지는 전체 평균만 보고 모델을 고정하는 것, 스캐너 통과를 보안 완료로 착각하는 것, Reflexion 같은 추론 구조 변경을 방어 수단으로 믿는 것, 판정 기준을 밝히지 않고 ASR을 비교하는 것입니다.

전송 계층에서 TTL이 0인 DNS 응답이나 등록된 핀과 다른 인증서가 잡히면 연결을 즉시 끊고 사람 승인으로 넘깁니다. 자동 재시도 대신 차단을 기본값으로 둬야, 공격자가 재시도 창을 그대로 악용하는 경로를 막습니다.

배포 전 COPEX가 쓴 25개 공격 유형·4개 표면 구성을 자사 MCP 서버 목록에 맞춰 재현합니다. 판정 기준(결정론적 트레이스인지 LLM 판정인지)을 보고서에 명시하고, 로그에는 표면 태그·공격 유형·판정 방식·인증서 핀 상태를 표준 필드로 남깁니다. 도구 응답에 섞여 들어오는 개인정보도 같은 로그 파이프라인에서 마스킹합니다.

표면별 ASR 추이를 주간 대시보드로 보고, 새 공격 유형이 학계나 벤더 공지에서 나오면 레드팀 세트에 추가합니다. 모델 교체 변경 이력과 네트워크 통제 변경 이력을 분리해 기록해야, 다음 분기 ASR이 움직였을 때 원인을 모델 쪽인지 인프라 쪽인지 구분할 수 있습니다.

한눈에 보는 적용 포인트

MCP 에이전트의 보안은 모델 교체나 프롬프트 조정만으로 끝나지 않습니다. 표면별 ASR을 모델 선택 기준에 넣고, 전송 계층은 인증서 핀닝·mTLS 같은 네트워크 통제로 별도 관리하며, 판정 기준을 명시한 레드팀 재현을 배포 전 체크리스트에 고정해야 숫자가 운영에 쓸모 있어집니다.

참고 링크

COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers — arXiv

공격 성공률 64.4%: MCP 에이전트의 모델 책임과 하부 계층 책임을 가른 COPEX 리뷰 — sunny34.com 리서치

이 글에 대해 AI와 대화하기

AI가 이 글을 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.

대화창을 불러오는 중…