원문 정보
Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu, "ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs", arXiv:2609.10895 [cs.RO], 2026-09-09 제출, DOI 10.48550/arXiv.2609.10895, CC BY 4.0. 소속: 몬트리올 대학교, Mila(퀘벡 AI 연구소), 맥길 대학교, 맥마스터 대학교, Meta Platforms. 벤치마크 데이터셋 공개(Hugging Face: Alan123/reacthuman-benchmark-scaled).
동료심사를 거치지 않은 cs.RO 프리프린트입니다. 저자 대부분은 캐나다 대학·연구소(몬트리올 대학교, Mila, 맥길, 맥마스터) 소속이고 자금은 캐나다 NSERC Discovery Grant(공공 연구비)입니다. 공저자 한 명이 Meta Platforms 소속이라는 이해상충이 있으나, 평가 대상 일곱 모델 중 Meta 모델은 없어 유인은 제한적입니다. 원문 전문은 스냅숏(수집 2026-09-11T23:22:12Z, 2026-09-12 KST 라벨 — 오늘로부터 2일 전)으로 대조했습니다. 세션 이그레스가 대조군(example.com)까지 막혀 10분 간격 3회 재시도 후에도 접속이 안 됐고, 오늘자 스냅숏도 arXiv API HTTP 429로 자동·수동 시도 모두 실패해 가장 최근의 미절단 스냅숏을 대신 썼습니다.
연구 개요
연구 질문은 하나입니다 — 멀티모달 LLM(MLLM)이 갑작스러운 물리적 위험(미끄러지는 접시, 떨어지는 칼)을 보고 즉시 안전한 행동으로 옮길 수 있는가. 기존 벤치마크는 영상 질의응답으로 물리 이해를 수동적으로 묻거나 내비게이션·정리 같은 장기 과제만 다뤄 이 질문에 답하지 못했다는 것이 저자들의 문제의식입니다.
방법은 "정지 후 예측(freeze-and-predict)" 프로토콜입니다. Genesis 물리 엔진이 240Hz로 사건을 시뮬레이션하다가 판단 시점에 멈추면, 모델은 의도·확신도·이동 명령·손 궤적으로 된 반응 계획을 출력합니다. 계획은 그 자리에서 채점되지 않고 시뮬레이션 휴머노이드(Unitree G1)에 실제로 실행돼 캐치·회피의 성공·실패라는 물리적 결과를 남깁니다. 평가는 17개 돌발 사건 유형, 1,000개 이상의 재현 가능한 장면, 겉모습과 물성이 어긋나는 적대적 물체 14종(발포 모루, 강철 사과 등)을 포함합니다. 평가에 쓴 306개 장면의 Catch/Dodge/No_Action 라벨 분포는 141/156/9로, 항상 회피만 고르는 다수결 기준선이 51.0%입니다.
핵심 결과
일곱 개 MLLM(Claude Opus 4.8, GPT-5.5, Gemini 2.5 Flash, Kimi K2.6, Qwen3-VL-235B, Qwen3-VL-30B, Gemma-3-27B)을 OpenRouter로 동일 조건에서 평가했습니다. 306개 장면 × 7개 모델에서 API 오류로 4건이 빠져 총 2,138개 결정을 분석했습니다.
| 모델 | SAA(%) | 안전도(%) | 도달오차 d_end(m) | AIA(0~1) | 최근접거리 d_min(m) |
|---|---|---|---|---|---|
| Claude Opus 4.8 | 50.7 | 64.7 | 1.07 | 0.41 | 1.06 |
| GPT-5.5 | 63.7 | 86.3 | 1.23 | 0.47 | 1.21 |
| Gemini 2.5 Flash | 48.7 | 78.1 | 1.28 | 0.47 | 1.28 |
| Kimi K2.6 | 40.9 | 78.2 | 1.30 | 0.32 | 1.28 |
| Qwen3-VL-235B | 56.4 | 87.2 | 1.25 | 0.48 | 1.23 |
| Qwen3-VL-30B | 54.9 | 83.0 | 1.20 | 0.50 | 1.17 |
| Gemma-3-27B | 62.4 | 88.2 | 1.26 | 0.61 | 1.25 |
| 평균(7개 모델) | 54.0 | 80.8 | 1.23 | 0.47 | 1.21 |
세 패턴이 뚜렷합니다. 첫째, 회피가 정답인 상황의 안전 규칙 위반이 평균 35.9%(모델별 23~66%)이고, 실수의 다수(392건 중 253건, 64.5%)는 아예 움직이지 않은 것입니다. 둘째, 모델마다 고정된 성향이 있습니다 — Claude Opus 4.8은 캐치 장면에서 67%로 가장 잘하지만 회피해야 할 장면의 34%에서 위험에 다가가 안전도 최하위(64.7%)이고, 나머지 여섯 모델은 반대로 회피 쪽에 치우칩니다. 셋째, 크기가 안전을 보장하지 않습니다 — 27B의 Gemma-3-27B가 정확도 2위(62.4%)·안전도 1위(88.2%)로, 플래그십 Claude Opus 4.8보다 안전했습니다.
| 세부 항목 | 수치 |
|---|---|
| 단일 바운싱볼 캐치 성공률 | 66.7% |
| 캔 더미 붕괴 캐치 성공률 | 38.9% |
| 천장 조명 낙하 회피율 | 91.3% |
| 투척 물체 회피율(안전 위반율) | 54.8%(위반 44%) |
| 안전 위반 410건 중 정지(R3) | 162건(39.5%) |
| 안전 위반 410건 중 회피 대신 개입(R4) | 128건(31.2%) |
| 안전 위반 410건 중 위험물 캐치(R2) | 120건(29.3%) |
| 7개 모델 만장일치 시나리오 비율 / 그때 정답률 | 16% / 80% |
| 과반수 투표 SAA(평균 54.0%, 최고단일 63.7% 대비) | 62.1% |
| 위장 물체(폼 천장판) 회피율(진짜 천장판과 동일) | 87.5%(49/56) |
과반수 투표는 평균보다는 낫지만 최고 단일 모델을 넘지 못합니다 — 모델들이 같은 맹점을 공유하기 때문입니다. 적대적 물체 280개 결정에서는 어떤 모델도 겉모습과 다른 물성을 의심하지 않았습니다.
신뢰도 평가
믿을 근거: 정답이 240Hz 강체 시뮬레이션에서 결정론적으로 도출돼 주관적 라벨링이 없고, 시드 고정으로 장면이 완전히 재현 가능하며, 계획을 실제로 물리 실행해 "정답을 골랐지만 손이 닿지 않았다"처럼 객관식 시험으로는 드러나지 않는 실패를 포착합니다. 감안할 점: 동료심사 전 초고이고, 강체 시뮬레이션이라 변형·파손 물리는 다루지 않으며, 결정이 단발성(재계획 없음)이라는 한계를 저자들도 명시합니다. AIA 지표는 키워드 매칭으로 채점돼 다소 거칠고, 적대적 물체 실험은 280개 결정으로 표본이 크지 않으며, 평가 모델은 특정 시점의 API 스냅숏이라는 점도 한계입니다. "모델이 클수록 안전하다"는 통념과 반대되는 결과인데, 텍스트 유해성 거부 벤치마크에서 흔한 "스케일이 안전 정렬을 돕는다"는 결과와는 다른 축(신체 반응 안전성)을 잰다는 점에 유의해야 합니다 — 직접 상충이라기보다 다른 능력을 재는 것으로 보입니다.
관련 연구(학술 문헌 대조)
- Chow et al.(2025). PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding — 선행 연구. ReactHuman이 스스로 "가장 가까운 이웃"이라 밝힌 문헌으로, 객관식 질의응답으로 물리 이해를 측정합니다. ReactHuman은 실행되는 행동 계획으로 채점 대상을 바꿔 "정답은 골랐지만 손이 안 닿았다"는 실패를 처음 드러냅니다.
- Sferrazza et al.(2024). HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation — 선행 연구. 31개 과제로 휴머노이드 전신 제어를 평가하지만 모두 숙고형 장기 과제입니다. ReactHuman은 컨트롤러 품질을 고정하고 순간적 위험 반응이라는 의사결정 층만 분리해 측정합니다.
- Tung et al.(2023). Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties — 선행 연구. 질량·마찰 같은 잠재 물성을 관찰로 추론하는 능력을 수동적으로 측정합니다. ReactHuman은 그 추론이 안전한 행동으로 이어지는지까지 물리 실행으로 확인합니다.
세 문헌 모두 "이해했는가"를 질의응답·속성 추정으로 묻는 데 그치는 반면, ReactHuman은 그 이해가 안전한 실행으로 이어지는지를 직접 확인합니다. 고정된 성향·이분법적 속도 인지·도달 거리 오차 같은 발견은 선행 문헌의 방법으로는 관측할 수 없었던 실패이므로, 상반이 아니라 확장 관계입니다.
리뷰어 판단
첫째, 안전 위반 410건 중 다수(39.5%)가 "얼어붙어 정지"라는 점이 가장 실무적인 발견이라고 판단합니다. 잘못된 행동을 적극적으로 고르기보다 판단을 유예하는 쪽의 실패이므로, 대응은 추론 품질 개선보다 "일정 시간 안에 결정하지 못하면 안전한 기본 행동으로 전환"하는 타임아웃 설계에 가까워야 합니다.
둘째, "정답을 골랐지만 손이 닿지 않았다"는 결과는 언어적 판단과 로봇 제어에 필요한 기하 계산이 분리돼 있다는 신호로 읽습니다. 실패의 49%가 팔이 닿지 않는 거리(0.8m 밖)에 서 있었기 때문이라는 점은, 모델이 옳은 결론을 내고도 실행 가능한 궤적으로 바꾸지 못했다는 뜻입니다. MLLM 출력은 의도 신호로만 쓰고 도달 가능성 검증은 별도 기하 계층에 맡기는 편이 안전하다고 판단합니다.
셋째, Claude Opus 4.8이 일반 역량 평가에서 상위권일 모델임에도 이 벤치마크의 안전도에서 최하위라는 결과는, 범용 능력 순위를 신체 안전 배포의 대리 지표로 쓰면 안 된다는 근거로 받아들입니다. 안전이 걸린 배포라면 전용 반응성 평가를 별도 게이트로 둬야 합니다.
실무 적용
- 결정 타임아웃과 안전 기본값 — 확신도 있는 계획이 일정 시간 안에 안 나오면 정지 대신 사전 정의된 안전 동작(후퇴 등)으로 전환합니다.
- 계획의 기하학적 실행 가능성 사전 검증 — 손 궤적·이동 명령을 실행하기 전 거리·도달 범위를 별도 계산해, 말은 맞지만 물리적으로 불가능한 계획을 걸러냅니다.
- 속도를 이분법으로 취급하지 않는 프롬프트·후처리 — 완만한 위험도 인식하도록 속도·잔여 시간을 명시적 수치로 주입합니다.
- 겉모습만으로 물성을 판단하지 않게 하는 점검 — 재질·무게가 관찰 가능할 때 시각적 인상과 다른 판단을 내릴 수 있는지 별도 테스트셋으로 확인합니다.
- 범용 벤치와 안전 벤치의 분리 게이트 — 일반 역량 순위와 무관하게 신체 안전이 걸린 배포 전엔 전용 반응성 평가를 통과 조건으로 둡니다.
결론
ReactHuman은 "이해했다"와 "안전하게 실행했다" 사이의 간극을 처음 수치화한 벤치마크입니다. 최상위 모델이 가장 위험했다는 결과, 안전 위반 다수가 판단 유예에서 온다는 결과, 정답을 고르고도 손이 닿지 않는다는 결과는 모두 물리적 실행을 통해서만 드러났습니다. 다만 동료심사 전 초고이고 일부 지표가 거칠며 표본이 제한적이므로, 수치는 방향 신호로 읽고 실제 배포 전엔 자체 반응성 테스트를 거치는 것이 맞습니다. 능력과 안전 배포를 분리해 게이트하는 운영 원칙은 능력 벤치 통과가 안전 배포가 아니다에서 더 다룹니다.
참고 링크
- ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs — arXiv 초록(원문)
- 같은 논문 HTML 전문 — 표·수치 대조에 사용(스냅숏 경유)
- PhysBench — 관련 연구 원문
- HumanoidBench — 관련 연구 원문
- Physion++ — 관련 연구 원문
- 능력 벤치 통과가 안전 배포가 아니다 — sunny34.com 블로그
이 리뷰에 대해 AI와 대화하기
AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…