원문 정보
Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata 외 23인, "Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair", arXiv:2608.15579 [cs.SE], 2026-08-16 제출, DOI 10.1145/3832783.3834531, 라이선스 CC BY 4.0. 소속: 후지쯔 리서치(일본·미국·유럽·중국). 제41회 IEEE/ACM 자동화 소프트웨어공학 학회(ASE 2026) Industry Showcase 트랙 채택, 2026년 10월 뮌헨 발표 예정.
동료심사를 거친 산업 경험 보고서(experience report)입니다 — 다만 Industry Showcase 트랙은 연구 트랙보다 심사 강도가 낮고, 학술적 신규성보다 산업 현장 적용 경험의 타당성 검증에 초점을 둡니다. 저자 26인 전원이 후지쯔 소속이며, 이 논문은 후지쯔가 사내에서 만든 코딩 에이전트를 후지쯔 연구진이 직접 평가한 결과입니다 — 자사 제품을 자사가 평가했다는 이해상충이 명백합니다. 다만 논문은 이 경계를 스스로 표로 정리해 두었습니다: 어떤 주장이 제거 실험(ablation)으로 뒷받침되고 어떤 주장이 운영 관찰에 그치는지 구분해 밝힙니다. 원문 전문은 세션 이그레스 장애로 GitHub Actions가 2026-08-18T21:42:47Z에 수집한 스냅숏(1차 출처 HTML 전문 사본)으로 대조했습니다.
연구 개요
연구 질문은 "파인튜닝 없는 로컬 오픈웨이트 모델이 감사 가능한 수리 하니스와 크로스에이전트 선택을 결합하면 SWE-bench 스타일 이슈 해결에서 어디까지 갈 수 있는가"입니다. 대상은 Python SWE-bench Verified(500건)와 Java Multi-SWE-bench(128건)입니다. 방법론은 세 층입니다. 첫째, mini-swe-agent 기반 8단계 페이즈 그래프(재현→테스트 합성→위치추적→수정→검증→…→최종 보고)로 장기 실행을 구조화합니다. 둘째, 라인 트레이싱·호출자 탐색·가드 편집이라는 결정적(deterministic) 도구만 노출해 편집 실패를 줄입니다. 셋째, 같은 모델(Qwen3.5-27B)을 8회 독립 실행(K=8)한 뒤, 각 실행이 스스로 만든 버그 재현·회귀 테스트를 서로 다른 실행의 패치에 교차 적용해 채점하는 "크로스에이전트 선택자"로 최종 패치를 고릅니다. 히든 벤치마크 테스트나 학습된 검증자를 쓰지 않는다는 제약이 핵심입니다 — 실전 병합 시점에는 히든 피드백이 없다는 상황을 그대로 반영합니다.
핵심 결과
아래 표는 원문 HTML 전문의 Table 3·5·7·8과 대조했습니다. Table 5의 저장소별 재현 건수는 합계가 374/500으로 헤드라인과 정확히 일치함을 직접 검산했습니다.
| 지표 | Python (SWE-bench Verified, n=500) | Java (Multi-SWE-bench, n=128) |
|---|---|---|
| 해결 건수 (95% Wilson CI) | 374/500 = 74.80% [70.82%, 78.41%] | 41/128 = 32.03% [24.57%, 40.54%] |
| 리더보드 순위(전체) | 12/135위 | 4/42위 |
| 오픈웨이트 내 순위 | 1위(등재 오픈웨이트 중) | 1위(엄격 오픈웨이트 기준) |
| 내부 도커 재채점 | 376/500 = 75.2% | — |
Python 헤드라인은 공식 클라우드 평가기 기준입니다. 가장 큰 비중인 django/django(231건, 46.2%)는 76.6%로 평균을 웃돌았고, 가장 낮은 pylint-dev/pylint(10건)는 30.0%에 그쳤습니다 — 표본이 작은 저장소는 순위 근거보다 실패 사례로 읽어야 한다고 논문 스스로 경고합니다.
K=8 실행에서 선택자가 기여한 몫은 기준(누적 실행 vs 단일 실행)이 서로 달라 별도 표로 분리합니다.
| 구성 | 해결 건수/500 | 비고 |
|---|---|---|
| 단일 실행 평균(K=1, 8회 평균) | 338.6 | 67.7%, 표준편차 3.12건 |
| 실행 순서 기준(K=8, 첫 완주 채택) | 362 | 72.4%, 선택 없음 |
| 자기 테스트만 채점(진단용) | 346 | 69.2%, 추정치 |
| 크로스에이전트 선택자(제출 결과) | 376 | 75.2%, 내부 재채점 기준 |
| 오라클 상한(8회 중 1회라도 성공) | 408 | 81.6% |
선택자는 순서 기준 대비 +14건, 단일 실행 평균 대비 +35~37건을 더 해결했고, 오라클 상한의 92.2%(376/408)에 도달했습니다. 남은 실패 성격은 뚜렷합니다 — 미해결 126건 중 91.3%(115건)는 패치가 하니스에 깨끗이 적용되지만 히든 테스트를 통과하지 못한 "의미 오류"였고, 형식이 잘못돼 적용조차 안 된 사례는 0건입니다. 495개 실행 중 494개(99.8%)가 문법적으로 유효한 패치를 냈습니다.
신뢰도 평가
믿을 근거: 같은 모델·같은 하니스를 Python·Java 두 언어에 그대로 옮겨 재현했고, 페이즈별 메시지 비중이 언어 간 ±5%p 이내로 일치해 하니스 효과가 특정 언어에 종속되지 않음을 보였습니다. 12개 저장소 재현율 합계가 헤드라인과 정확히 일치하는 등 원문 표 내부의 산술 일관성도 확인됩니다. 선택자 가중치(w_B=0.3, w_R=0.7)의 민감도 분석도 실려 있어(인접 7개 조합에서 최대 35/495건, 5/500건 변화) 사후 최적화가 아니라는 근거를 스스로 제시합니다.
감안할 점: 저자 26인 전원이 논문이 평가하는 시스템을 만든 후지쯔 소속입니다. 산업 임팩트 주장(운영 접점 5→1, 사이클당 75분→5분)은 저자들 스스로 "통제된 개발자 파일럿이 아닌 자릿수 추정치"라고 명시합니다. 페이즈 그래프·핸드오버·툴 샌드박스 같은 핵심 메커니즘은 개별 제거 실험 없이 "운영상 관찰"로만 뒷받침되며, 논문의 증거 지도(Table 1)가 이를 스스로 인정합니다. 오픈웨이트 1위라는 주장도 절대적 최고를 뜻하지 않습니다 — 폐쇄형 프론티어 조합 두 건(Sonar/live-SWE + Claude-Opus-4.5)에는 22건 차로 유의하게 뒤처지고, 동급 오픈웨이트 경쟁작 Lingxi v1.5+Kimi-K2와의 차이(+18건)는 통계적으로 유의하지 않습니다(p=0.054). 자금 출처는 별도 명시가 없으나 저자 전원이 후지쯔 소속 연구원이므로 자사 연구비로 판단됩니다.
리뷰어 판단
첫째, 이 논문에서 가장 실무적으로 값진 수치는 74.8%라는 헤드라인이 아니라 실패 분해라고 판단합니다. 494/495 패치가 형식적으로 유효한데도 91.3%의 실패가 의미 오류였다는 사실은, 코딩 에이전트 도입 판단의 병목이 "패치를 만들 수 있는가"에서 "만든 패치가 맞는가"로 이미 옮겨갔다는 신호로 읽을 수 있습니다. 형식 검증에 투자를 더하는 것은 이제 수익이 낮은 구간에 들어섰다고 봅니다.
둘째, 크로스에이전트 선택자가 오라클 상한의 92.2%까지만 도달했다는 수치(선택자 후회 34건, 6.8%p)를 저자들은 담담히 보고하지만, 실무적으로는 그 간극 자체가 시사점이 큽니다. 8회 실행 중 최소 한 번은 성공하는 문항이 408건인데 실제로 골라내는 것은 376건뿐이라는 뜻으로, "후보를 늘리는 것"과 "잘 고르는 것" 사이의 간극이 여전히 크다는 의미입니다. 선택 로직 고도화가 후보 수 증설보다 비용 대비 효율이 높을 가능성이 있습니다.
실무 적용
- 형식 대신 의미 검증에 투자 — 패치 적용 성공률이 이미 99%대라면, 다음 개선 지점은 린터·포매터가 아니라 히든 테스트를 대신할 자체 회귀 테스트 생성 품질입니다.
- 독립 생성 테스트로 후보 교차 채점 — 여러 실행이 각자 만든 테스트를 서로의 패치에 교차 적용하면, 히든 피드백 없이도 병합 전 선택 신호를 확보할 수 있습니다.
- 재작업 루프를 별도 추적 — CODE_FIX↔VERIFY_PATCH 같은 반복 구간을 계측해, 특정 페이즈에서 반복이 몰리면 조기 종료 기준을 둡니다.
- 후보 수(K)는 난이도 진단 후 축소 — 8회 중 234건은 전원 성공하는 "쉬운" 문항이므로, 난이도 사전 분류로 후보 수를 가변화하면 컴퓨팅 비용을 줄일 여지가 있습니다.
- 리더보드 순위는 부분집합을 함께 명시 — "1위" 문구를 재인용할 때는 비교 대상(오픈웨이트/전체, 언어)을 반드시 함께 밝혀 과장을 막습니다.
결론
Kozuchi Agent는 새 모델이 아니라 감사 가능한 하니스와 저비용 선택 메커니즘으로 오픈웨이트 27B 모델을 상위권에 올린 사례입니다. 핵심 성과는 74.8%라는 숫자보다, 남은 실패의 91.3%가 형식이 아닌 의미 문제로 좁혀졌다는 진단에 있습니다. 다만 저자 전원이 이해당사자이고 핵심 메커니즘 다수가 제거 실험 없이 보고된 만큼, 수치는 후지쯔의 운영 환경에서 나온 방향성 신호로 받아들이고 도입 전 자체 하니스 위에서 선택자·페이즈 그래프를 따로 검증하는 편이 안전합니다. 후보 수 증설과 선택 정확도 사이의 비용 트레이드오프를 운영 관점에서 다룬 글은 성능 점검 경제학에서 이어집니다.