원문 정보

Chaoyu Zhang, Hexuan Yu, Heng Jin, Shanghao Shi, Ning Zhang, Yi Shi, Yulia R. Gel, Y. Thomas Hou, Wenjing Lou, "Skynet: Workflow-Level Anomaly Detection for Agentic AI via Semantic and Structural Modeling", arXiv:2609.06835 [cs.CR], 2026-09-06 제출, DOI 10.48550/arXiv.2609.06835. ACM MobiHoc 2026(2026년 11월 23~26일, 도쿄) 채택 논문. 소속: Virginia Tech, Washington University in St. Louis(WashU).

ACM MobiHoc는 모바일 네트워킹·컴퓨팅 분야의 유수 학회로, 이 논문은 심사를 거쳐 게재가 확정된 채택본입니다(정식 발표는 2026년 11월). 자금 출처는 논문 말미 감사의 글에 명시돼 있으며 미 해군연구청(ONR) 보조금 2건, 미국립과학재단(NSF) 보조금 6건, 버지니아주 사이버보안 이니셔티브(CCI)로 확인됩니다. 저자 9인 전원이 학계(버지니아공대·WashU) 소속이고 상용 벤더 후원이나 겸직은 명시돼 있지 않아 뚜렷한 이해상충은 확인되지 않았습니다. 이번 리뷰는 원문 전문을 2026-09-09T22:02:39Z 기준 스냅숏(1차 출처 HTML 사본)으로 대조했습니다 — 이번 실행 세션의 네트워크 접근이 무관 대조군(example.com)을 포함해 전면 차단돼(10분 간격 3회 재확인) 직접 WebFetch가 불가능했습니다.

연구 개요

연구 질문은 "에이전트 워크플로의 이상을 어느 단위에서 탐지해야 하는가"입니다. 기존 방어는 개별 프롬프트·행동·트레이스 조각을 따로 점검하지만, 저자들은 침해가 한 단계에서 시작해 하류로 전파되는 의존 구조 자체를 보지 않으면 놓친다고 주장합니다. Skynet은 계획·도구 호출(MCP 포함)·에이전트 간 메시지·시스템 이벤트를 방향성 워크플로 그래프로 재구성하고, 정상(양성) 워크플로만으로 의미(semantic) 분기와 구조(structural) 분기를 이중 대조학습시킵니다. 공격·실패 사례를 학습에서 전혀 보지 않고도 정상 다양체(manifold)를 벗어나는 실행을 단일 판정 규칙으로 잡는 제로데이 탐지 설계이며, 정상 워크플로의 다양성은 K=150개 모드의 K-평균 뱅크로 표현합니다.

평가는 서로 다른 연구팀이 독립적으로 공개한 세 벤치마크 — Agent-SafetyBench(적대적 조작 111건), AgentErrorBench(내재적 실행 실패 200건, AlfWorld·GAIA·WebShop), ATBench(광범위 안전 시나리오 497건, 위험 유형 8종·세부 유형 14종) — 를 합쳐 총 808건의 이상 사례로 진행됐습니다(111+200+497=808, 검산 일치). 정상 학습 데이터는 ETO 궤적을 AlfWorld·SciWorld·WebShop에서 수집해 4,494/562/562건으로 학습/검증/테스트 분할했고, 비교 대상은 텍스트 기반 모니터링(GuardAgent), 프로버넌스 방어(TraceAegis, Guardian), 그래프 이상탐지(F-GAE, CoLA, TopoGCL) 6종입니다.

핵심 결과

세 벤치마크를 합친 Combined 시나리오(이상 808건 + 정상 테스트 562건)에서 Skynet은 하나의 고정 임계값으로 6개 비교 탐지기 중 가장 균형 잡힌 성능을 냈습니다. 정밀도·재현율·오탐률(FPR)은 방법마다 트레이드오프가 커서 하나만 보면 오독하기 쉽습니다.

탐지기AccPrecRecF1FPR
Skynet93.3699.3189.3694.070.89
F-GAE90.8793.4486.9290.062.14
TraceAegis75.9278.4858.4266.983.38
Guardian70.2999.7549.7566.390.18

단일 벤치마크만 보면 순위가 뒤집힙니다. Guardian은 Agent-SafetyBench·AgentErrorBench에서 재현율 100%를 FPR 0.18%로 달성해 Skynet(FPR 0.89%)보다 낮은 오탐률을 냈지만, ATBench에서는 재현율이 18.31%(F1 30.90)로 무너지고 Combined에서도 49.75%까지 떨어집니다 — 위협 유형이 좁을 때만 통하는 탐지기라는 뜻입니다. Skynet 자체도 세부 재현율이 균일하지 않습니다. ATBench 내부에서 간접 프롬프트 주입은 재현율 74.03%, 내재적 에이전트 실패는 75.56%로, 정상 워크플로와 가장 비슷하게 보이는 유형에서 성능이 떨어집니다.

구성요소 기여도를 뜯어본 어블레이션은 같은 Combined 데이터를 쓰지만 별도 실행이라 위 표와 기준이 다릅니다 — Full Skynet 기준값 자체가 Acc 96.64%·FPR 0.71%로 위 표의 Combined 행(93.36%·0.89%)과 어긋납니다.

변형(어블레이션, Combined)AccPrecRecF1FPR
Full Skynet96.6499.4894.8097.080.71
구조 분기 제거94.0999.3290.5994.760.89
반사실 뷰 제거94.0999.1990.7294.761.07
워크플로 인지 증강 제거95.8499.3093.5496.330.98
단일 모드 추론79.4299.2565.5978.990.71

가장 큰 손실은 K=150개 정상 모드를 단일 기준점으로 축소했을 때 나타났습니다(재현율 약 1/3 감소, FPR은 비슷). 반대로 반사실 뷰를 빼면 재현율 손실은 작지만 FPR이 약 1.5배로 뛰어 1% 예산을 넘깁니다. 즉 재현율은 다중 모드 스코어링이, 오탐 억제는 반사실 학습과 워크플로 인지 증강이 각각 담당합니다. 지연시간은 큰 워크플로(30~121개 노드)에서도 평균 0.139초·P95 0.311초였고, 온라인 스텝 채점은 1단계 평균 4.8ms에서 20단계 부근 P95 0.573초까지 늘었다가 80단계에서 평균 48.8ms로 다시 줄었습니다(그래프 재구성 비용이 이후 상각).

신뢰도 평가

믿을 근거는 셋입니다. 첫째, 세 이상 벤치마크가 서로 다른 연구팀이 독립적으로 공개한 데이터라 훈련-평가 간 공동설계 편향이 작습니다. 둘째, 단일 고정 임계값을 네 시나리오 모두에 그대로 적용해 벤치마크별로 유리하게 조정하지 않았습니다. 셋째, 구성요소별 어블레이션으로 재현율원·오탐 억제원을 분리했습니다.

감안할 점도 뚜렷합니다. 비교 대상 6종은 각자 "균형 지향 검증 규칙"으로 자체 임계값을 튜닝한 반면 Skynet은 고정 분위수로 계산돼, Table 1의 직접 비교는 완전히 동일한 조건은 아닙니다(논문도 이를 인지해 ROC 곡선을 별도로 제시). 정상 학습 데이터가 ETO가 생성한 궤적이라 실제 프로덕션 트래픽과는 분포가 다를 수 있고, 세 이상 벤치마크 모두 정적 레드팀 데이터라 Skynet의 탐지 방식을 알고 회피를 시도하는 적응형 공격자는 평가에 없습니다. 프롬프트 주입 탐지 일반에서는 탐지기를 우회하도록 설계된 공격이 탐지율을 0%까지 낮춘 사례도 보고돼 있어(DataFlip 계열 연구), 워크플로 수준 탐지가 만능은 아니라는 배경 증거로 참고할 만합니다.

리뷰어 판단

이 논문에서 가장 실무적으로 중요한 결과는 Skynet의 최고 F1이 아니라 Guardian의 붕괴 패턴이라고 판단합니다. 좁은 벤치마크에 최적화된 정밀도·재현율은 위협 분포가 넓어지는 순간 무너지므로, 단일 벤치마크 성능만 보고 이상탐지기를 도입하는 것은 위험한 의사결정입니다.

또한 어블레이션에서 다중 모드 스코어링 제거가 가장 치명적이었다는 결과는 이 접근법의 핵심 가치가 '이상 탐지 알고리즘'이 아니라 '정상의 다양성을 정확히 모델링하는 능력'에 있다고 판단합니다. 파이프라인이 단조로운 조직에서는 K=150이 과설계일 수 있고, 반대로 매우 이질적인 프로덕션 환경에서는 부족할 수 있어 K값은 도메인별 재조정이 필요할 것으로 봅니다.

실무 적용

  • 워크플로 재구성 가능한 로깅 — MCP 도구 호출·에이전트 간 메시지·시스템 이벤트를 방향성 그래프로 되돌릴 수 있는 구조로 남깁니다.
  • 결합 시나리오로 탐지기 검증 — 단일 벤치마크 정밀도만 보고 채택하면 Guardian처럼 위협 범위가 넓어질 때 붕괴할 수 있습니다.
  • 정상 모드 수(K) 도메인별 튜닝 — 파이프라인이 단순하면 낮게, 이질적이면 높게 잡고 재현율 변화를 관찰합니다.
  • 중간 스텝 지연 버짓 확보 — 온라인 채점의 P95 지연이 중간 스텝 구간(약 0.57초)에서 가장 크므로 SLA에 반영합니다.
  • 콘텐츠 레벨 방어 병행 — 간접 프롬프트 주입·내재적 실패처럼 워크플로 수준에서 놓치는 유형은 별도 콘텐츠 검사로 보완합니다.

결론

Skynet은 공격과 실패를 한 번도 보지 않고 정상 워크플로만으로 학습해도, 서로 다른 세 공개 벤치마크를 합친 808건 이상 사례에서 하나의 고정 임계값으로 재현율 89.36%·오탐 0.89%를 냈습니다. 다만 이는 정적 레드팀 데이터에 대한 결과이며, 적응형 회피 공격이나 실제 프로덕션 분포에서의 재현은 아직 검증되지 않았습니다. 간접 프롬프트 주입처럼 정상과 닮은 위협에서는 재현율이 낮아지는 만큼, 도입 전 자체 트래픽으로 오탐률을 재측정하고 콘텐츠 레벨 방어와 병행하는 편이 안전합니다. 에이전트 실패를 운영 단계에서 어떻게 진단·귀속하는지는 에이전트 장애 원인 진단 파이프라인 운영 기준에서 이어집니다.

참고 링크