원문 정보

Linsen Zhu, Mengqing Cai, "From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments", arXiv:2609.04894 [cs.AI], 2026-09-04 제출, DOI 10.48550/arXiv.2609.04894, arXiv.org 영구 비독점 라이선스. 문헌 컷오프 2026년 8월 31일.

동료심사를 거치지 않은 cs.AI 프리프린트이며, 개별 실험이 아니라 2023~2026년 에이전트형 AI 문헌 전반을 종합하는 "비평적 리뷰(critical review)"입니다. 원문에 감사의 글·자금 출처 절이 없어 저자 2인의 소속과 재정 후원을 확인할 방법이 없었습니다(각주까지 살펴봤으나 표기 자체가 없음). 다만 원문은 생성형 AI가 문헌 조사·초안·번역에 관여했다는 점을 별도 절("Use of generative AI")로 직접 공개하고 있습니다. 원문 전문은 스냅숏(수집 2026-09-11T23:22:12Z, 2026-09-12 KST 라벨 — 오늘로부터 11일 전 발행된 논문의 사본)으로 대조했습니다. 오늘(2026-09-15 KST) 세션은 이그레스가 대조군(example.com)까지 막혀 있었고, 오늘자 스냅숏 수집도 예정된 자동 발화가 확인되지 않아 수동으로 두 차례(약 6분 간격) 발화했으나 모두 arXiv API HTTP 429로 실패해, 가장 최근의 미절단 스냅숏을 대신 썼습니다.

연구 개요

문제의식은 하나입니다 — 도구를 부르고, 컴퓨터를 조작하고, 다른 에이전트·사람에게 일을 위임하고, 상태를 유지하고, 생성된 세계에 머물고, 로봇·실험 장비를 제어하는 이 모든 변화를 "더 자율적이 됐다"는 단일 사다리로 묶어도 되는가. 저자들은 아니라고 답하며, 이를 모델(M)·하네스(H)·환경(E)·위임자(U)로 이뤄진 "구성된 시스템 S=(M,H,E,U)"로 분해합니다. 하네스는 프롬프트·컨텍스트 정책·메모리·도구 스키마·재시도 로직·자격증명 관리를 포함해, "모델 성능"이라 불리는 것의 상당 부분이 실은 시스템 속성임을 강조합니다.

방법론은 통계적 메타분석이 아니라 질문 주도적 비평 리뷰입니다. 위임된 권한(무엇을 허가받았나)·시간적 지속성(목표·자격이 단계를 넘어 유지되나)·환경 결합(행동이 어떤 상태를 바꾸나)이라는 세 독립 축으로 사례를 배치하고, 근거 유형별로 신뢰 등급을 다르게 매깁니다 — 동료심사 벤치마크·통제된 물리 실험을 상단에, 프리프린트·공개 스펙을 중간에, 회사의 퍼스트파티 프리뷰를 하단에 두되 "영구적 시스템 등급"이 아니라 "그 주장에 한해서만" 적용합니다.

핵심 결과

초기 실행형 벤치마크(WebArena·OSWorld)와 이후 퍼스트파티 시스템(OpenAI CUA)을 나란히 놓으면, 성능은 올랐어도 인간 기준에는 여전히 못 미칩니다.

벤치마크초기 최고 에이전트인간 기준이후 퍼스트파티 시스템
WebArenaGPT-4 기반, 14.41%78.24%OpenAI CUA 58.1%
OSWorld(369개 과제)12.2% 미만72.4%OpenAI CUA 38.1%

OpenAI 자체 시스템 카드도 38.1%를 "운영체제 자동화에 신뢰하기엔 불충분"하다고 명시하며 사람의 감독을 권고했습니다. 다른 영역의 수치도 같은 패턴을 보입니다.

사례수치함의
SWE-bench(SWE-agent, NeurIPS 동료심사)pass@1 12.5%모델을 고정해도 인터페이스 설계가 성능을 좌우
RT-2(로봇 비전-언어-행동, 동료심사)평가 시행 6,000회신규 물체·지시에 대한 일반화 개선을 관찰
OpenVLA(오픈소스 VLA)7B 파라미터 · 로봇 에피소드 970,000개공개 VLA 학습 규모의 참고선
RentAHuman 바운티(2026-02 프리프린트)303건 중 99건(32.7%) API·MCP 경로에이전트가 사람을 고용해 신원·물리 접근을 우회하는 경로가 이미 존재

같은 예산에서 비교한 실험은 "역할을 나누면 더 똑똑해진다"는 통념에도 제동을 겁니다 — 2026년 프리프린트는 추론 토큰 예산을 동일하게 맞추면 단일 에이전트가 여러 멀티에이전트 조직과 같거나 더 나은 성능을 냈다고 보고했고, 동료심사를 받은 별도 연구는 멀티에이전트 토론이 턴을 거듭할수록 원래 문제에서 벗어나는 경향을 관찰했습니다. 2025년 Nature Communications 연구(원자간력현미경 실험)는 도메인 질의응답 성능이 실험실 수행 능력으로 이어지지 않았고, 프롬프트 형식·지시 변형에 민감한 현상("sleepwalking")을 보고했습니다.

신뢰도 평가

믿을 근거: 근거 유형을 동료심사 벤치마크·통제된 물리 실험·프리프린트·공개 스펙·퍼스트파티 프리뷰로 나누고 "시스템 전체"가 아니라 "개별 주장"에 등급을 매기는 방법론이 명료합니다. 인용된 원 연구 다수도 동료심사(WebArena·OSWorld는 NeurIPS, RT-2는 로봇학습 학회, Coscientist는 Nature, ChemCrow는 Nature Machine Intelligence, AILA는 Nature Communications)를 거쳤습니다. 감안할 점: 리뷰 자체는 저자 2인의 동료심사 전 프리프린트이고 소속·자금이 미기재입니다. 인용된 벤치마크 수치 다수를 저자들 스스로 "역사적 기준선"이라 부릅니다 — 모델 버전이 계속 바뀌어 현재 순위표로 볼 수 없다는 뜻입니다. Genie 3·Project Eden·모델 하드웨어 표준(MHS) 같은 핵심 프론티어 사례 상당수가 동료심사 없는 회사 발표에 의존한다는 점도 저자들이 9.8절("현재 종합의 한계")에서 직접 인정합니다. 커버리지도 소프트웨어·웹·게임·로봇 실험실·영어권에 쏠려 있고, 고위험 기관·장기 운영 사례·비사용자 영향은 "공개적으로 감사 가능한 증거가 드물다"고 스스로 밝혀, 부재를 희소함의 증거로 삼지 않는다는 단서를 답니다. 명시적인 찬반 대립 문헌을 다루기보다는 "더 유능해졌다"는 낙관적 서사 자체를 비판 대상으로 삼는 구조입니다.

관련 연구(학술 문헌 대조)

세 문헌 모두 이번 리뷰의 핵심 주장과 어긋나지 않고 오히려 보강합니다. Arunkumar 외의 아키텍처 분류는 "구성요소는 이미 충분히 정리돼 있다"는 전제를 제공하고, Qwen-AgentWorld는 리뷰가 경계 지은 "세계모델≠에이전트" 구분이 여전히 유효함을 보여주며, Mittal의 장기 과제 붕괴 실증은 리뷰의 개념적 우려를 구체적 숫자로 확인시켜 줍니다.

리뷰어 판단

첫째, 이 리뷰의 가장 실용적인 기여는 "정책 역량"·"행동 커버리지"·"보증(인가·검증·복구)"을 서로 다른 개선 축으로 명시적으로 떼어놓은 프레임이라고 판단합니다. 벤더가 "에이전트가 더 똑똑해졌다"고 발표할 때 이 세 축 중 실제로 무엇이 좋아졌는지를 따지는 체크리스트로 쓰면, 마케팅 수치와 배포 가능 근거를 가르는 데 유용합니다.

둘째, 비평 리뷰라는 장르의 한계도 뚜렷합니다. 저자 2인이 소프트웨어 에이전트부터 로봇 실험실까지 8개 절을 넘나드는 만큼, 각 영역의 깊이는 원 논문 수준에 못 미칠 수밖에 없습니다. 예컨대 τ-bench의 반복시행 신뢰도 저하는 공식(p의 k제곱)만 제시될 뿐 구체적 수치가 없어, 실무 배포 판단에는 원 논문을 직접 확인해야 합니다 — 이 리뷰는 "종합 지도"로는 유용하지만 "수치 근거"로 쓰기엔 부족합니다.

셋째, RentAHuman 사례(바운티의 32.7%가 API·MCP 경로, 신원 사칭·자격증명 사기 확인)가 이 리뷰 전체에서 가장 시급한 실무 경고라고 판단합니다. 에이전트가 사람을 고용해 신원 확인·물리적 접근을 우회할 수 있다는 것은 프롬프트 인젝션 방어만으로는 막을 수 없는 새로운 공격면이기 때문입니다.

실무 적용

  • 세 가지 "더 나음" 분리 평가 — 신제품 발표를 볼 때 정책 역량(성공률)·행동 커버리지(도구·기기 수)·보증(인가·검증·복구)을 각각 따로 점수화해, 커버리지 확대를 신뢰성 향상으로 오인하지 않습니다.
  • 모델-하네스 결합 평가 — 벤치마크 점수를 모델 교체 효과로만 해석하지 말고, 인터페이스·컨텍스트 정책·재시도 로직을 고정한 채 비교했는지 확인합니다(SWE-agent 사례처럼 같은 모델도 인터페이스가 성능을 좌우).
  • 권한을 역량 기반·갱신 가능·회수 가능하게 설계 — 자연어 지시를 그대로 위임 범위로 쓰지 말고, 자원·연산·값 한도·만료 조건이 명시된 캡슐화된 권한 객체로 컴파일합니다.
  • 멀티에이전트 도입 전 동일 예산 비교 — 역할을 나누기 전에 같은 추론 토큰 예산에서 단일 에이전트 기준선과 비교해, 조직 구조가 실제로 이득인지 확인합니다.
  • 사람 개입을 희소자원으로 설계 — 모든 행동에 승인 프롬프트를 걸지 말고 판단 경계가 바뀌는 지점에만 개입을 트리거하며, 되돌릴 수 없는 행동은 사후 통보가 아니라 사전 승인으로 못박습니다.

결론

이 리뷰는 "에이전트가 더 자율적이 됐다"는 단일 서사를 모델·하네스·환경·위임자로 쪼개 다시 검사합니다. 도구 호출부터 로봇 제어까지, 행동을 취할 수 있는 인터페이스는 분명히 넓어졌지만, 그 행동이 의도대로 완료됐는지·되돌릴 수 있는지·누가 승인했는지를 독립적으로 확인하는 증거는 같은 속도로 늘지 않았다는 것이 핵심 결론입니다. WebArena·OSWorld의 초기 기준선이 퍼스트파티 시스템에서도 여전히 인간 기준에 못 미쳤고, RentAHuman처럼 에이전트가 사람을 고용하는 새로운 경로에서는 이미 오남용 사례가 관측됐습니다.

다만 동료심사 전 프리프린트이고 저자 2인이 넓은 영역을 개괄한 종합 문헌인 만큼, 개별 수치의 정밀도보다는 "행동 확장과 검증 확보를 같은 것으로 취급하지 말라"는 방법론적 경고로 읽는 편이 맞습니다. 하네스를 벤더에 맡기는 선택이 늘고 있는 만큼, 추가 요금 없이 하네스를 빌린다: OpenAI Agents API가 요구하는 자체 구축 재검토에서 이 리뷰가 말하는 "하네스는 인과 시스템의 일부"라는 경고를 운영 판단 게이트로 더 다룹니다.

참고 링크

이 리뷰에 대해 AI와 대화하기

AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.

대화창을 불러오는 중…