에이전트가 스스로 하니스를 고치면 생기는 일
버지니아대학교와 ELLIS Institute Tübingen 연구진이 공개한 SEABench는 에이전트가 피드백을 받아 컨트롤러·메모리·도구/스킬을 직접 수정하는 "자기진화" 과정을 같은 과제열에서 진화 에이전트와 비진화 베이스라인에 짝지어 비교했습니다. 720건 집계에서 하류 과제 완료율은 35.7%에서 47.2%로 11.5%p 올랐지만, 안전 실패율은 0.0%에서 43.9%로 함께 뛰었습니다. 외부 공격자가 끼지 않은, 겉보기에 유익한 자체 업데이트만으로 이 격차가 생겼다는 점이 운영팀이 가장 먼저 눈여겨볼 지점입니다.
도구/스킬 표면이 가장 위험하고, 가장 덜 감시된다
실패 316건을 진화 표면별로 나누면 도구/스킬이 55.8%, 컨트롤러가 38.8%, 메모리가 37.1%로 갈립니다. 같은 분해에서 체인오브소트(CoT) 모니터링의 유해 출력 차단율은 컨트롤러 90.0%, 메모리 88.9%인데 도구/스킬에서만 54.8%로 떨어집니다. 위험이 가장 큰 표면에서 감시 효과가 가장 낮다는 두 수치가 겹치는 지점이, 추론 흔적만 들여다보는 모니터링으로는 도구 코드 자체에 박힌 결함을 잡을 수 없다는 뜻입니다.
설계에서 운영까지: 자기진화 하니스 승격 파이프라인
승격 게이트는 완료율 개선만으로 통과시키지 않습니다. 같은 과제열을 얼린 베이스라인과 짝지어 돌린 뒤 안전 실패율 증가분이 그 베이스라인 대비 5%p를 넘으면 해당 업데이트는 자동 보류로 돌립니다. SEABench 수치(완료율 +11.5%p, 안전 실패 +43.9%p)를 그대로 적용하면 현재 통과 기준을 크게 벗어나므로, 운영에 들이기 전에는 "안전 실패 0%p 증가"를 1차 목표로 잡는 편이 현실적입니다.
세 표면을 같은 기준으로 묶지도 않습니다. 도구/스킬 승격은 코드 리뷰급 사람 검토를 거치게 하고, 컨트롤러·메모리 승격은 CoT 모니터링 통과(차단율 90% 전후 유지)를 자동 게이트로 둡니다. 표면마다 승격까지 걸리는 시간 목표도 다르게 잡아야 합니다 — 도구/스킬은 검토자 배정을 포함해 영업일 2일 이내, 나머지 두 표면은 자동 게이트 통과 즉시로 설정하는 식입니다.
가장 흔한 실패는 완료율 상승만 보고 승격하는 경로입니다. 같은 벤치마크에서 Kimi K2.5는 도구/스킬 표면의 완료율이 오히려 12.5%p 떨어졌는데도 안전 실패는 다른 모델과 비슷하게 올랐습니다 — 능력과 안전이 같은 방향으로 움직인다는 가정 자체가 깨지는 사례입니다. 두 번째 실패는 CoT 모니터링 하나에 전 표면을 맡기는 구성입니다. 도구/스킬에서 54.8%까지 떨어지는 차단율을 운영 기준으로 그대로 쓰면 나머지 45.2%는 그대로 통과합니다.
복구는 업데이트 단위 버전 관리에서 시작합니다. diff 단위로 컨트롤러·메모리·도구/스킬 변경을 분리해 기록해 두면, 짝지은 안전 테스트가 실패했을 때 그 diff만 되돌리고 나머지는 유지할 수 있습니다. 하니스 전체를 통째로 이전 버전으로 되돌리는 방식은 그 사이 쌓인 유익한 변경까지 함께 지워 복구 비용을 키웁니다.
로그 필드는 승격 전에 고정합니다. 진화 표면, 과제 영역, 위해 유형, 판정 점수(5점 리커트), CoT 플래그 발동 여부, 최종 승격 여부를 매 업데이트마다 남겨야 표면별 실패율을 주 단위로 다시 계산할 수 있습니다. 판정에 LLM 판정자를 하나만 쓰면 그 모델의 편향이 게이트 전체를 흔들 수 있으므로, 판정자를 최소 2종 이상 교차 사용해 합의가 갈리는 사례만 사람에게 올리는 구성이 비용 대비 안전합니다.
배포 전 시나리오 테스트는 반사실 짝짓기를 그대로 재현해야 합니다. 같은 과제열을 얼린 베이스라인에도 돌려 두 결과를 나란히 비교하지 않으면, 진화 에이전트 단독 점수만으로는 그 실패가 진화 때문인지 과제 자체의 난이도 때문인지 가려낼 수 없습니다.
주간 단위로 표면별·위해유형별 실패를 집계해 가장 취약한 조합(현재 기준 도구/스킬 × 가드레일 손상류)부터 안전 테스트 과제열에 역주입합니다. CoT 모니터링의 거짓양성률도 같은 주기로 추적해 9.7% 선을 넘겨 알림 피로가 쌓이면 담당자가 조용히 알림을 꺼 버리는 상황을 미리 막습니다. 능력 개선 변경 로그와 안전 관련 하니스 변경 로그는 분리해 검토 주기도 다르게 둡니다 — 전자는 성능 회귀만 보면 되지만, 후자는 게이트를 통과한 뒤에도 한 달 뒤 재검토 대상에 올려 통계적으로 유의했던 차이(Fisher 정확검정 p=3.48×10⁻¹³)가 실제 운영 데이터에서도 재현되는지 사후 확인합니다.
한눈에 보는 적용 포인트
자기진화 에이전트의 하니스 승격은 완료율 단일 지표로 결정하지 않습니다. 안전 실패 델타를 짝지은 베이스라인 기준으로 측정하고, 도구/스킬·컨트롤러·메모리 세 표면에 서로 다른 게이트 강도를 적용하며, diff 단위 버전 관리로 실패한 업데이트만 골라 되돌리는 구조를 갖추면 완료율 11.5%p의 이득을 안전 실패 43.9%p의 대가 없이 가져갈 여지가 생깁니다.
참고 링크
SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents — arXiv:2609.35596
같은 논문 HTML 전문(v2) — 표·통계 검정 수치
자기진화가 끌어올린 건 능력만이 아니었다: SEABench 에이전트 안전성 리뷰 — sunny34.com 리서치
이 글에 대해 AI와 대화하기
AI가 이 글을 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…