원문 정보

Md Jueal Mia, M. Hadi Amini, "Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI", arXiv:2608.26442 [cs.AI], 2026-08-26 제출, DOI 10.48550/arXiv.2608.26442. 소속: Knight Foundation School of Computing and Information Sciences, SOLID Lab, Florida International University(미국).

동료심사를 거치지 않은 프리프린트이며, 저자 스스로 "예비 연구(preliminary study)"로 규정했습니다. 자금 출처는 미국 교통부 산하 대학교통센터(TraCR), NAIRR Pilot, AWS CloudBank(NSF 지원)로 모두 연방 연구비 성격이며, 실험에 쓰인 세 모델(Qwen3.5-4B, Llama-3.1-8B-Instruct, Phi-4-reasoning)은 저자 소속 기관이나 후원사의 자체 모델이 아니어서 특정 모델을 띄우려는 이해상충은 낮습니다. 세션 egress 장애(10분 간격 3회 재시도로 확인)로 원문 전문은 WebFetch 대신 2026-08-30T22:03:27Z 기준 스냅숏으로 대조했습니다.

연구 개요

질문은 단순합니다 — 에이전트가 추론을 너무 많이 하거나(over-reasoning) 너무 적게 하면(under-reasoning) 실제로 무엇이 달라지는가. 저자들은 LangGraph 기반 에이전트 프레임워크에 Qwen3.5-4B를 툴 라우터로 고정하고, 최종 응답 모델을 Qwen3.5-4B·Llama-3.1-8B-Instruct·Phi-4-reasoning 세 종으로 바꿔가며 MATH-500(수학 문제 500개)과 GAIA 검증셋(범용 어시스턴트 과제 165개)에서 평가했습니다. 온도 0의 결정적 디코딩과 최대 4,096토큰 제한을 공통 적용했고, GPT-4.1이 각 실행 궤적을 과다·과소·적정 추론으로 독립 분류했습니다.

핵심 결과

정확도와 비용은 벤치마크에 따라 다른 그림을 보였습니다. 수학 문제(MATH-500)에서는 추론을 늘릴수록 정확도가 오르지만 대가가 컸고, 실세계 과제(GAIA)에서는 추론을 늘려도 정확도가 거의 오르지 않았습니다.

데이터셋(표본 수)모델정확도평균 최종응답 시간평균 출력 토큰토큰 한도 도달
MATH-500 (500)Qwen3.5-4B87.60%70.21초2,461.67190건(38.0%)
Llama-3.1-8B-Instruct49.80%21.42초904.4871건(14.2%)
Phi-4-reasoning92.40%180.80초4,046.59482건(96.4%)
GAIA (165)Qwen3.5-4B12.12%67.49초2,353.9075건(45.5%)
Llama-3.1-8B-Instruct5.45%10.71초452.2310건(6.1%)
Phi-4-reasoning11.52%182.94초4,091.12164건(99.4%)

MATH-500에서 Phi-4-reasoning은 Qwen3.5-4B 대비 정확도가 4.8%p 높지만(92.40% vs 87.60%), 최종응답 시간은 2.6배, 출력 토큰은 1.6배, 토큰 한도 도달률은 190건에서 482건으로 뛰었습니다. 반대로 GAIA에서는 Phi-4-reasoning의 정확도가 오히려 Qwen3.5-4B보다 낮았습니다(11.52% vs 12.12%). 추론을 더 시켰다고 더 정확해지지 않은 것입니다.

추론 배분 비율(과다·과소·적정)도 벤치마크마다 지배적인 실패 유형이 달랐습니다. 아래 비율은 논문 Table 2의 절대 건수(과다·과소 추론 건수)를 표본 수로 나눠 검산한 값입니다.

데이터셋모델과다추론 비율과소추론 비율적정추론 비율
MATH-500Qwen3.5-4B68.00%8.00%24.00%
Llama-3.1-8B-Instruct19.80%22.00%58.20%
Phi-4-reasoning89.40%4.80%5.80%
GAIAQwen3.5-4B38.18%36.97%24.85%
Llama-3.1-8B-Instruct10.30%71.52%18.18%
Phi-4-reasoning35.15%62.42%2.42%

MATH-500에서는 과다추론이, GAIA에서는 과소추론이 지배적인 실패 유형으로 뒤바뀝니다. 특히 Llama-3.1-8B-Instruct는 GAIA에서 71.52%가 과소추론으로 분류돼(118건/165건), 증거를 충분히 모으기 전에 답을 냈다는 뜻입니다. 도구 호출 빈도도 갈렸습니다 — MATH-500은 표본당 평균 0.39회, GAIA는 0.93회로, 외부 정보가 필요한 과제일수록 도구를 더 썼지만 그렇다고 GAIA 정확도가 12%를 넘지 못했습니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 툴 라우터를 Qwen3.5-4B로 고정하고 최종 응답 모델만 바꾸는 통제된 비교 구조이고, 추론 분류(GPT-4.1)와 정답 판정을 독립 수행해 두 지표가 서로를 오염시키지 않으며, 코드·프롬프트·평가 산출물 공개를 명시해 재현 경로가 열려 있습니다.

감안할 점도 뚜렷합니다. 저자 스스로 밝힌 대로 하나의 툴 라우팅 모델과 세 응답 모델에 국한된 예비 연구라 다른 아키텍처로 일반화할 수 없고, 금전적 비용·GPU 사용률·처리량은 측정하지 않았습니다. 토큰 예산을 바꿔가며 비교하는 어블레이션과 반복 시행이 없어, 표의 평균값이 실행 간 변동을 얼마나 반영하는지는 알 수 없습니다. 상반된 시각으로는 선행 연구(Tran and Kiela, 2026)가 동일 사고 토큰 예산에서 단일 에이전트가 다중 에이전트를 능가한다고 보고한 바 있어, "추론·협업을 늘리면 좋다"는 통념에 대한 이 논문의 반박이 고립된 결과는 아닙니다.

리뷰어 판단

첫째, MATH-500과 GAIA를 나란히 보면 "생각을 더 시키는" 처방의 효과가 과제 유형에 크게 좌우된다고 판단합니다. 정형화된 수학 문제에서는 추론 확장이 정확도를 실제로 올리지만 비용이 급격히 늘고, 다단계 실세계 과제에서는 추론을 3배 가까이 늘려도 정확도가 오히려 소폭 떨어졌습니다. 사고 예산 확장은 과제 유형을 가리지 않고 쓸 처방이 아닙니다.

둘째, 토큰 한도 도달과 정확도의 관계가 벤치마크마다 다르다는 점이 표에서 드러납니다. MATH-500은 한도 도달 시 정확도(Qwen 73.68%)가 미도달 시(96.13%)보다 뚜렷이 낮아 "예산 소진 = 실패 신호"가 성립하지만, GAIA의 Qwen3.5-4B는 한도 도달 시 정확도(13.33%)가 미도달 시(11.11%)보다 오히려 높습니다(각 75건·90건으로 표본 크기가 비교 가능). 복합 과제에서는 토큰 소진이 실패의 원인이 아니라 과제 난이도의 결과일 뿐이라는 뜻으로 읽힙니다.

셋째, Llama-3.1-8B-Instruct의 GAIA 과소추론 비율(71.52%)이 가장 실무적으로 유용한 신호라고 봅니다. 약한 모델을 복합 에이전트 과제에 쓸 때 필요한 조치는 사고 시간 연장이 아니라, 증거 부족 상태의 조기 종료를 잡아내는 별도 검증 단계일 가능성이 높습니다.

실무 적용

  • 과제 유형별 사고 예산 분리 — 정형화된 단일 정답형 과제에는 추론 확장이 유효하지만, 다단계 실세계 과제에는 추론 길이보다 증거 수집·도구 호출 설계를 먼저 점검합니다.
  • 토큰 한도 도달률을 경보 지표로 — 특정 모델의 한도 도달률이 90%를 넘어가면(Phi-4-reasoning의 96.4%처럼) 프롬프트나 최대 길이를 조정하라는 신호로 다룹니다.
  • 과소추론 비율을 별도 계측 — 정확도만 보지 말고 incomplete·조기종료 비율을 추적해, 비용 절감을 위해 사고를 줄였을 때 생기는 부작용을 조기에 잡아냅니다.
  • 모델 교체 전 정확도-지연 곡선 실측 — 소폭의 정확도 상승을 위해 지연시간이 2배 이상 늘어나는 모델 스와핑은 자체 트래픽의 SLA·비용 목표와 대조한 뒤 결정합니다.
  • 복합 과제에는 검증 역할 우선 검토 — 실세계 다단계 과제에서 추론량 증가의 한계가 뚜렷하므로, 사고 예산 확장보다 별도 감사·검증 단계 추가를 먼저 검토합니다.

결론

이 예비 연구는 "더 생각하게 하라"는 처방이 과제 유형을 가리지 않고 통하지는 않는다는 것을 수치로 보여줍니다. 정형화된 수학 문제에서는 추론 확장이 정확도를 높이지만, 실세계 다단계 과제에서는 같은 처방이 비용만 늘리고 정확도는 그대로거나 떨어집니다. 반복 시행·비용 어블레이션이 없는 한계는 있지만, 세 모델·두 벤치마크에서 일관되게 관찰된 패턴이라는 점에서 사고 예산을 과제 특성에 맞춰 나누는 실무적 재검토를 권할 근거는 충분합니다. 정확도 대비 비용을 어떻게 측정할지는 정확도 너머의 성능 점검 설계에서 더 다룹니다.

참고 링크