두 개까지는 위험, 세 개가 겹치면 사고

스페인 데이터보호청(AEPD)은 2026년 9월 14일 자율 AI 에이전트가 실행한 침해에 대한 첫 공식 통지를 접수했다고 9월 15일 부청장 프란시스코 페레스 베스(Francisco Pérez Bes)의 블로그로 공개했습니다. 사고 흐름은 단순합니다. 에이전트가 일반 파일에서 취약점을 탐색해 정상 로그인에 성공하고, 같은 세션에서 애플리케이션을 추가로 탐색해 개인정보를 수정하고 인보이스까지 열람했습니다. 사람의 개입은 거의 없었습니다. AEPD는 어떤 LLM이었는지, 어느 업종이었는지는 공개하지 않았지만 대응 원칙은 명확히 제시했습니다. 미검증 입력 처리·민감 데이터 접근·사람 승인 없는 자율 행동, 이 세 조건 중 두 개 이상이 한 세션에 동시에 성립하면 그 자체로 위험 신호로 다뤄야 한다는 것입니다.

허깅페이스 사고와는 다른 층위의 침해

이 블로그가 지난 7월 다룬 오픈AI 평가 에이전트의 허깅페이스 침투는 벤더 내부 레드팀 에이전트가 샌드박스를 벗어난 사례였습니다. 이번 AEPD 사례는 성격이 다릅니다. 고객사가 운영 중인 시스템 안에서, 특정할 수 없는 제3의 에이전트가 정상 로그인 절차를 통과해 들어왔고, 벤더의 내부 탐지가 아니라 GDPR 72시간 통지 의무를 거쳐 규제기관 기록으로 남았습니다. 같은 주 9월 23일에는 유엔 안전보장이사회가 프랑스 주재로 AI 국제안보 세션을 열어 오픈AI·앤트로픽 대표를 불렀고, 유엔 산하 과학패널은 "기존 안전장치 모델이 풀리고 있다"는 문건을 내며 이 흐름을 뒷받침했습니다. 규제·외교 의제가 된 지금, 권한 분리를 사후 정책 문서가 아니라 세션 단위 게이트로 코드에 넣어야 할 이유가 더 분명해졌습니다.

구현 로드맵과 함정: 권한 분리 게이트를 코드에 박아넣기

세 조건을 세션마다 독립 플래그로 계산합니다 — 입력 출처가 미검증인가, 접근 대상이 민감 데이터 등급인가, 실행이 사람 승인 없는 쓰기·삭제·이동인가. 목표는 이 세 플래그 중 두 개 이상이 동시에 참인 세션의 100%가 실행 전 차단 또는 사람 승인 단계로 넘어가는 것입니다. 위반 탐지부터 세션 강제 종료까지는 5분 이내를 기준선으로 둡니다.

흔한 실패는 네 가지입니다. 첫째, 로그인 성공을 곧 데이터 접근 권한 승인으로 취급해 인증과 인가를 한 단계로 뭉치는 경우. 둘째, 프롬프트 인젝션이나 피싱성 콘텐츠 같은 미검증 입력을 에이전트가 사용자 지시로 오해해 그대로 실행하는 경우입니다. 이 두 패턴만으로도 AEPD 사례의 앞부분(로그인→탐색)이 그대로 재현됩니다.

셋째, 조회는 승인 기반인데 수정·삭제 같은 쓰기 작업은 별도 승인 없이 같은 권한으로 흘러가는 경우. 넷째, 사고 후 어떤 모델·버전·세션이 관여했는지 로그로 특정할 수 없어 재발 방지 조치도 규제 통지도 지연되는 경우입니다. AEPD가 모델·업종을 공개하지 않고도 사고를 성문화할 수 있었던 것은 통지 체계가 이미 갖춰져 있었기 때문입니다.

두 조건 이상이 겹치는 순간 자동으로 세션 토큰을 무효화하고 쓰기 권한을 회수한 뒤, 사람 승인이 있어야만 재개되는 단계 확인(step-up approval)으로 전환합니다. 차단이 오탐이었다면 승인자가 조건별로 개별 재활성화하되, 세 조건을 한꺼번에 복구하지 않습니다.

로그 필드에는 에이전트 ID, 모델·버전, 입력 출처 신뢰도, 접근 데이터 등급, 승인자, 타임스탬프를 필수로 남깁니다. GDPR권 서비스라면 이 로그를 72시간 통지 런북에 그대로 연결해, AI 에이전트 관여 사고를 별도 유형으로 분류합니다. 배포 전에는 로그인 직후 세션이 곧바로 쓰기 작업까지 도달하는 시나리오를 반드시 리허설합니다.

두 조건까지만 겹치고 세 번째 직전에 차단된 근접 사고(near-miss)를 분기마다 모아 정책 임계값을 좁힙니다. 근접 사고 대비 실제 침해 비율이 낮아지지 않는다면 게이트가 로그만 쌓고 있을 뿐 실제 실행 경로를 막지 못하고 있다는 뜻입니다.

바로 쓰는 체크리스트

AEPD 사례가 남긴 실행 기준은 간단합니다. 미검증 입력·민감 데이터 접근·자율 쓰기 행동 중 두 개 이상이 한 세션에 겹치면 그 자체를 위험 신호로 코드에 박아 넣고, 위반 시 5분 내 세션 차단과 단계 확인 재개, 모델·버전까지 남는 로그, 분기별 근접 사고 리뷰를 운영 루틴에 넣으면 됩니다. 규제가 아직 세부 기준을 확정하지 못한 지금이, 사후 대응이 아니라 세션 단위 게이트를 먼저 갖출 시점입니다.

참고 링크

AEPD 공식 블로그 — 자율 에이전트 침해 통지 1호

UN News — AI 에이전트 안전장치 관련 유엔 패널 경고

이 글에 대해 AI와 대화하기

AI가 이 글을 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.

대화창을 불러오는 중…