AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs

나무는 모았는데 지팡이는 없다: AgentWorld가 묻는 협업의 조건

나무를 베는 AI와 지팡이를 만드는 AI는 언제 재료를 주고받아야 할까. AgentWorld의 공동 작업과 성공률 52%를 살펴보고, 성공에 기여한 행동을 추적하는 CCE가 보여 주는 것과 놓치는 것을 분석한다.

Jiphyeonjeon Team2026-10-0519 min read상세 읽기쉬운 읽기
multi-agentbenchmarkcollaborationlong-horizonllm-as-a-judgecausal-attributionsimulation

Paper: Raphael Shu; Yusen Zhang; Young Min Cho; Jin Mo Yang; Yuan Yuan; Wenliang Zheng; Sharath Chandra Guntuku; Lyle Ungar; Zhou Yu; Rui Zhang (2026). "AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs". arXiv:2609.31590v1. OpenAgents, Columbia University, University of Pennsylvania, Seoul National University, Penn State University. 앞의 세 저자는 공동 기여자로 표시된다. PDF · 서지 정보 · 프로젝트 · 저장소. 2026-09-25 공개된 23쪽 v1을 기준으로 한다.

벌목꾼은 나무를 충분히 모았고, 목공은 막대기를 만들 준비가 됐으며, 마법사는 지팡이에 쓸 재료를 기다린다. 그런데 나무가 벌목꾼의 가방에만 남아 있다면 팀은 목표를 끝내지 못한다. 이 장면은 논문의 제작 과제를 바탕으로 든 설명용 예다. 각자 일을 하는 것과 다음 사람이 일할 수 있게 만드는 것은 다르다.

AgentWorld는 이 차이를 게임 속 공동 작업으로 평가한다. 사람이 설계한 100개 과제와 그 과제를 바꾼 100개 변형에서, 서로 다른 능력과 자원을 가진 에이전트들이 재료를 옮기고 진척을 공유하며 목표를 완수해야 한다. 논문의 기여는 더 강한 협업 알고리즘보다, 협업이 필요한 환경과 그 과정을 들여다볼 평가 방법에 있다.

주요 네 모델 중 원본 과제 성공률은 최고 52%다. 성공에 연결된 행동을 역추적하는 CCE도 제안하지만, 그 값 0.320을 ‘전체 행동의 32%만 유용했다’고 읽으면 중요한 조건을 놓친다.

핵심 요약

항목 설명
평가 대상 비대칭 역할·능력·자원을 가진 3–20개 에이전트의 공동 과제 수행.
환경 Kaetram 기반 MMORPG, 13개 고수준 도구, 관측→도구 한 번→완료 대기의 순차 round-robin.
시간 범위 과제당 최대 25–55라운드, 평균 예산 38. 모든 실행이 실제 50라운드를 넘는 것은 아니다.
데이터 사람이 만든 main 100개와 Claude Opus 4.5 기반 변형 100개. 변형은 독립적인 새 과제 100종과 구분한다.
주요 결과 Main SR: Gemini 52%, Claude 45%, GPT-5 Mini 36%, DeepSeek 20%. 증강에서 네 모델 모두 하락.
CCE 성공을 직접 만든 행동과 그 선행 기여 행동 수/전체 행동 수. 실패는 0으로 놓고 과제별 평균한다.
평가 신뢰성 사람–judge 69/84 일치, κ=0.64. 제한된 라벨 일치도이지 인과 관계의 정답률 인증은 아니다.
핵심 유보 CCE의 macro 평균·성공 조건부 수치 및 일부 절제 분모에 불일치가 있다. Oracle도 수학적 상한은 아니다.

이하 main은 원본 과제, augmented는 증강 과제를 뜻한다.

목차

  1. 같은 답을 내는 팀과 함께 일하는 팀
  2. 복잡한 세계를 단순한 도구로 조작한다
  3. 과제와 검증 함수가 성공의 의미를 정한다
  4. CCE는 성공에서 행동을 거슬러 올라간다
  5. 평균 CCE를 전체 행동의 효율로 읽으면 안 된다
  6. 판정 일치도와 인과적 타당성은 다른 질문이다
  7. 모델 성적과 증강 과제의 난도를 분리한다
  8. 통신과 역할 절제에서 무엇을 알 수 있는가
  9. 오류 유형과 반복 실험의 분모를 확인한다

1. 같은 답을 내는 팀과 함께 일하는 팀

여러 모델이 문제를 독립적으로 푼 뒤 답을 고르는 실험에서는 팀의 정답률이 올라가도 실제 협력이 있었는지 분리하기 어렵다. 반면 한 에이전트가 캐낸 광석이 다른 에이전트의 제련을 거쳐 세 번째의 무기로 이어진다면, 작업의 의존 관계를 실행 기록에서 볼 수 있다.

Self-Organizing Agent Teams는 풀이와 검토의 조직을 학습한다. Stellar Colosseum은 긴 증명을 절별 의존성으로 나눈다. AgentWorld는 새로운 협업 알고리즘보다 외부 세계에서의 역할 분담·자원 전달·상태 공유를 평가할 과제와 지표를 제공한다. 세 연구의 정답률이나 성공률은 같은 척도가 아니다.

실세계 직무 협업의 모든 요소를 복제한 것은 아니다. 게임 규칙과 도구를 추상화한 뒤, 그 안에서 모델이 서로의 진척을 파악하고 행동 순서를 맞출 수 있는지 묻는다. ‘협업을 더 잘 드러내는 설계’와 ‘점수에 협업 능력만 순수하게 반영된다’는 주장은 구분해야 한다.

2. 복잡한 세계를 단순한 도구로 조작한다

AgentWorld 세계와 blackbox 에이전트 및 고수준 도구

Figure 2. 세계·에이전트 정보 경계·대표 도구. 그림은 총 13개 중 10개를 예시한다. 출처: Shu et al. (2026), v1, p.2, Fig.2 — 연구·학습 목적 인용.

환경은 1,056×768 타일, 9개 biome, 380개 이상 아이템, 144종 mob, 70명 이상 NPC, 1,531개 채집 지점을 갖는다는 저자 설명이다. 플랫폼의 최대 동시 에이전트 수 1,000과 벤치마크의 실제 팀 크기 3–20은 다르다. 1,000개 LLM 에이전트가 같은 평가 과제를 수행한 결과가 아니다.

attack_entity는 이동·전투·전리품 수집을 한 호출로 처리하고, harvest_resource도 채집 지점 이동과 획득을 묶는다. 모델은 미세 조작 대신 누구에게 무슨 재료가 필요한지 판단한다. 그렇다고 경로·도구 인자·규칙 이해와 협업의 영향이 완전히 분리됐다고 볼 수는 없다.

실시간 게임 위의 순차 평가

각 round에서 에이전트들이 차례로 새 관측을 받고 도구 한 번을 호출한다. 그 행동이 끝난 후 다음 에이전트가 행동한다. Round는 팀 전체의 한 차례이고 action은 개별 도구 호출이다. 같은 round 안에서도 뒤 에이전트는 앞 에이전트가 바꾼 세계를 만날 수 있다.

Blackbox는 다른 에이전트의 내부 상태·관측·행동 기록에 직접 접근하지 못한다는 뜻이다. 명시적 chat과 자기 주변 관측을 통해 조정한다. 전역 상태 공유가 없다는 것과 환경의 모든 정보를 모른다는 것은 다르다. 역할별 문서에는 제작법·자원 위치·몬스터 속성 같은 유용한 지식이 제공된다.

이 설정에서는 chat도 행동 슬롯을 사용한다. 같은 횟수의 round에서 지나친 통신이 실제 작업을 대체할 수 있지만, 무료 통신 채널에서도 똑같은 trade-off가 나타난다고 일반화할 수는 없다.

3. 과제와 검증 함수가 성공의 의미를 정한다

다섯 annotator가 100개 main 과제를 설계하고, 두 LLM을 이용한 pilot에서 실패를 시스템·과제·에이전트 오류로 나누어 수정했다. Round budget도 pilot 성공 실행에 맞춰 조정했다. 이 절차는 실행 가능성을 높이지만 평가 분포가 pilot 모델·설계자의 판단과 무관하게 만들어졌다는 뜻은 아니다.

과제는 8개 범주다. Figure 4의 집계는 전투 28, 제작 22, 채집 14, 거래 13, 탐험 10, 생존 6, 기타 7로 합계 100이며, 기타에는 희소한 협업·건설 범주가 묶인다. 3인 과제가 45개로 가장 큰 집단이지만 절반을 넘지는 않는다. 최대 round는 25–55, 평균 예산은 38이다. ‘50+’라는 초록·비교표의 요약을 전 과제의 최소 실행 길이로 읽지 않는다. 부록에는 20인 팀이 6라운드에 성공한 사례도 있다.

성공률과 부분 성공률은 서로 다른 질문이다

  • 성공률(SR): 각 과제의 Python 검증 함수(verifier)가 최종 상태, 필요하면 실행 기록(trajectory)을 검사한다. 모든 성공 조건이 충족돼야 성공이다.
  • 부분 성공률(PSR): 검증 함수가 보고하는 개별 체크포인트의 달성 비율을 과제별로 계산해 평균한다. 성공 과제는 100%다.

Gemini의 PSR 71.5%와 SR 52% 사이 19.5%p는 서로 다른 지표의 차이다. ‘19.5%의 과제가 마지막 단계에서 실패했다’는 분류가 아니다. 이를 말하려면 과제별 checkpoint와 실패 위치가 필요하다.

검증 함수 자체의 의미도 읽어야 한다. Task 01의 설명은 마법사에게 지팡이를 준비하는 것이지만, Appendix B의 예시 verifier는 어느 인벤토리에든 staff가 있는지 검사한다. 따라서 그 예시 코드만으로 마법사에게 전달·장착까지 확인했다고 말할 수 없다. 이것은 인쇄된 검증 조건의 범위이며 전체 구현의 버그를 확인한 주장은 아니다.

증강 검토의 분모

Claude Opus 4.5가 목표·출발 위치·초기 아이템을 바꾼 변형 100개를 만든다. Appendix D가 보고하는 사람 검토는 그중 10%, 즉 10개다. 표본 모두에서 협업 필요·의미적 목표·역할 비대칭 유지, 90%에서 적절한 난도를 확인했다. 표본 10/10을 전체 100개 전수 검증으로 바꾸지 않는다. 원본과 변형은 관계가 있으므로 독립적인 200개 새 과제와도 구분한다.

4. CCE는 성공에서 행동을 거슬러 올라간다

성공 행동을 시작점으로 역추적한 CCE 예시

Figure 5. 3명×9라운드의 27개 행동 중 12개를 기여로 표시해 44.4%를 얻는다. 출처: Shu et al. (2026), v1, p.6, Fig.5 — 연구·학습 목적 인용.

CCE(Causal Collaboration Effectiveness)는 팀에 1–5점 협업 점수를 직접 매기지 않는다. 먼저 지팡이 제작처럼 성공을 직접 만든 행동을 찾는다. 그다음 ‘이 제작에 쓰인 막대기는 누가 만들었나’, ‘그 나무는 누가 전달했나’를 거꾸로 따라간다. 전체 행동 집합을 T, 성공을 직접 만든 행동 집합을 S라 하면, 성공 행동과 그 선행 기여 행동을 합친 집합 C로 다음 값을 계산한다.

C=S\cup\operatorname{ancestors}(S),\qquad \mathrm{CCE}=\frac{|C|}{|T|}.

벌목→나무 전달→막대기 제작→지팡이 제작처럼, 자원을 만들거나 이동·정보 전달로 후속 행동을 도운 행위를 포함한다. Chat도 별도 action이고 모든 행동의 가중치는 같다. 한 API 호출이 내부적으로 수행한 게임 동작 수·토큰·시간·비용을 재는 지표가 아니다.

GPT-4.1, temperature 0이 성공 행동을 고르고, 뒤 round에서 앞으로 거슬러 가며 contributing 여부를 판정한다. 따라서 LLM은 단순히 최종 숫자만 계산하지 않을 뿐, 역추적 시작점과 귀속 집합을 만드는 판단에는 관여한다. DAG를 만든 뒤 분수를 계산하는 부분만 결정적이라고 해서 전체가 자동으로 객관적 인과 측정이 되지는 않는다.

에이전트별 기여율(Per-Agent Contribution)은 \mathrm{PAC}_i=|C\cap T_i|/|T_i|다. 각자의 행동 중 얼마가 성공에 연결됐는지 보여 준다. 누가 기여 행동을 얼마나 담당했는지 보려면 이 비율뿐 아니라 행동 수도 함께 봐야 한다. Main 표는 CCE 중심이며, CCE 자체에는 에이전트 사이 의존 관계의 개수나 역할 균형이 직접 들어가지 않는다. 한 명에게 유효 작업이 몰린 실행과 잘 분업한 실행이 같은 총 기여 비율을 가질 수도 있다.

시간 순서와 종료 규칙도 지표의 일부다

부록은 edge를 같은 round 또는 이후 round로 허용하지만, round 번호의 비감소만으로 DAG가 보장되는 것은 아니다. 같은 round의 실제 행동 순서를 써야 한다. 또한 예시 judge prompt는 이미 찾은 later rounds의 기여 행동을 제시한다. 같은 round의 전달→제작 사슬을 어떻게 닫아 추적하는지는 원문 설명만으로 확정하기 어렵다. 실제 구현이 이를 빠뜨렸다고 단정하지는 않는다.

Figure 5는 성공 제작 뒤의 행동도 분모에 넣는다. 성공 직후 멈추는 실행과 계속 기록하는 실행은 같은 유효 작업을 해도 CCE가 다를 수 있다. 실험을 재현할 때 종료·로그 범위·동일 round 처리까지 고정해야 하는 이유다.

5. 평균 CCE를 전체 행동의 효율로 읽으면 안 된다

Table 2는 실패 과제의 CCE를 0으로 놓고 과제별 비율을 평균한다. 과제 q의 성공 여부를 s_q\in{0,1}, 성공 시 효율을 e_q라 두면

\overline{\mathrm{CCE}}=\frac1Q\sum_qs_qe_q =\mathrm{SR}\times\mathbb E[e_q\mid s_q=1].

따라서 CCE와 SR이 함께 움직이는 일부는 지표 설계에서 이미 생긴다. 실패 실행이 유용한 중간 작업을 많이 했더라도 보고 CCE는 0이다. 이때 ‘실패한 모든 행동은 쓸모없다’는 의미가 아니다. Appendix F의 ‘no success criteria met인 완전 실패’라는 문구는 본문·Table 2의 ‘실패 과제는 0’보다 좁으므로 부분 실패의 처리 규칙도 재현 시 확인해야 한다.

과제별 평균과 전체 행동의 비율은 다르다

과제별 비율을 같은 비중으로 평균하는 macro 평균 \frac1Q\sum_q |C_q|/|T_q|와 행동을 모두 합친 pooled 비율 \sum_q|C_q|/\sum_q|T_q|는 다르다. 설명용으로 10개 중 8개와 100개 중 20개가 기여한 두 성공 과제를 생각하면, 평균 CCE는 0.5지만 전체 행동 중 비율은 28/110≈0.255다. 짧은 과제와 긴 과제를 한 표씩 세느냐, 행동 하나하나를 세느냐의 차이다.

그러므로 Gemini의 평균 CCE 0.320을 전체 행동의 3분의 1 미만만 기여한 것으로, DeepSeek의 0.125를 전체 행동의 약 88%가 낭비된 것으로 직접 해석하는 원문의 서술은 강하다. 실패의 0점과 macro 평균을 분리하지 않은 해석이다.

성공 조건부 수치의 원문 불일치

동일 main 과제·실패 0·동일 가중치라면 Gemini는 0.320/0.52≈0.615가 된다. 그러나 §4.3은 성공 과제 CCE를 0.609라고 쓴다. 100과제에서 성공 52개라는 조건을 고정하면 CCE의 세 자리 반올림만으로 이 차이를 설명하기 어렵다. 이 글은 두 값을 임의로 통합하지 않으며 원시 집계·판본 대응이 필요하다고 남긴다.

Claude는 0.294/0.45≈0.653으로 본문의 0.653과 맞는다. 이는 성공했을 때의 효율과 성공 빈도가 서로 다른 축임을 보여 준다. ‘Gemini가 모든 의미에서 가장 효율적’이라는 순위로 축약하지 않는다.

6. 판정 일치도와 인과적 타당성은 다른 질문이다

CCE의 causal은 관측된 trajectory에서 ‘이 행동이 저 행동을 가능하게 했는가’를 LLM으로 판정한다는 뜻이다. 행동을 제거하고 환경을 재실행하는 intervention이나 counterfactual 실험은 아니다. 실제로 필요한 선행 행동과 다소 도움이 된 행동도 포괄적으로 함께 넣는다.

일치도 검증의 범위

비교 보고된 표본과 결과
사람 1명 대 GPT-4.1 두 agent 모델·11과제에서 84개 행동 기여 판단, 69개 일치=82.1%, κ=0.64
GPT-4.1 대 Claude Sonnet 4 7,298개 판단, raw agreement 84%, κ=0.66
세 judge의 모델별 CCE GPT-4.1·Sonnet 4·Llama-4 Maverick에서 주요 네 agent 모델의 순위 유지

사람의 전체 정답 집합이나 모든 graph edge를 독립 인증한 결과가 아니다. 표본 수와 모집단이 다른 두 일치도를 숫자가 비슷하다는 이유로 같은 수준의 검증으로 볼 수 없다. κ의 구간 추정·라벨별 confusion matrix·다수 사람 간 합의도는 보고하지 않는다.

Table 6에서 Claude agent의 CCE는 judge에 따라 0.294→0.241로 바뀐다. 최대 차이는 0.053으로, 원문의 ‘약 0.05’와 부합하지만 값 자체가 고정된 것은 아니다. 네 모델의 순위 보존은 유용한 경험적 점검이며 미래 모델·새 과제·holistic judge보다 항상 우월하다는 보장은 아니다.

포괄적 판정은 수학적 상한이 아니다

저자는 marginally helpful 행동도 넣어 CCE를 유용한 행동 비율의 upper bound로 읽자고 한다. 그러나 false negative나 잘못 선택한 성공 행동이 없어야 엄밀한 상한이 된다. 포괄적 정책은 높은 쪽으로 귀속하려는 평가 방침이지 보장된 경계가 아니다.

‘False positive는 한 행동만 조금 더한다’는 부록의 설명에도 주의가 필요하다. 잘못 포함한 행동을 frontier에 넣고 그 조상까지 다시 찾으면 하나의 오류가 여러 행동의 포함으로 이어질 수 있다. 반대로 시간 창이나 자원 기반 pruning은 먼 과거의 유효한 의존을 놓칠 수 있다. 이는 제안된 역추적의 구조적 위험이며 실제 오류 빈도를 측정한 결과는 아니다.

7. 모델 성적과 증강 과제의 난도를 분리한다

주요 모델 Main SR Main PSR Main CCE Augmented SR Augmented PSR Augmented CCE
DeepSeek R1-70B 20.0% 43.5% 0.125 10.0% 28.9% 0.063
Claude Haiku 4.5 45.0% 62.7% 0.294 26.0% 49.1% 0.179
GPT-5 Mini 36.0% 62.6% 0.206 21.0% 41.6% 0.145
Gemini 3 Flash 52.0% 71.5% 0.320 24.0% 61.3% 0.113

Table 2, p.8. Main·augmented는 각각 100과제다.

SR 하락은 각각 10·19·15·28%p다. 특히 Gemini는 main 1위지만 주요 네 모델의 augmented SR은 Claude 26%가 Gemini 24%보다 높다. 따라서 ‘최고 모델 52%’는 main 결과다.

변형은 목표량 증가·먼 시작점·적은 자원 등 난도를 올리는 변경을 포함한다. 점수 하락은 이런 설정 변화에 취약함을 보여 주지만, 같은 난도에서의 단순 표현 불변성 검사나 모델 오염의 증거는 아니다. 원본과 변형의 역할·자원 제약을 함께 봐야 한다.

추가 두 모델은 별도로 읽는다

같은 Table 2에는 Muse-Glimmer-30B와 Gemma 4 26B A4B도 있다. Muse의 main/augmented SR은 38.0/36.0%, PSR 45.3/52.5%, CCE 0.128/0.126이며 결과는 final로 표시된다. Gemma는 SR 34.7/30.6%, PSR 43.7/43.8%, CCE 0.110/0.087이지만 provisional이며 scored tasks에 대한 평균이다.

표 주석은 추가 모델에 augmented v1 split을 명시한다. 주요 네 모델과의 세부 판본 대응·Gemma 유효 분모를 확인하지 않고 여섯 모델을 하나의 완전히 통제된 순위로 합치지 않는다. ‘모든 모델에서 증강하면 모든 지표가 하락’도 아니다. 예컨대 Muse의 PSR은 올라간다.

주요 네 모델의 동일 prompt·도구 인터페이스는 비교를 돕지만, 동일 토큰·추론량·금액·context 관리까지 통제했다는 뜻은 아니다. 같은 round 수라도 팀 크기와 action 종류에 따라 비용이 달라진다.

8. 통신과 역할 절제에서 무엇을 알 수 있는가

비교 기준마다 주어진 정보와 자원이 다르다

설정 SR 평균 round 평균 chat
무작위 합법 행동 5.7% 34.1 8.3
사람의 공유 계획·통신 없음 17.6% 30.7 0.0
통신 없음 22.9% 32.0 0.0
역할·아이템을 한 에이전트에 통합 28.6% 28.0 0.0
기본 blackbox 팀 52.0% 26.4 11.0
Oracle communication 60.0% 25.2 7.9

Table 3, p.9, Gemini 3 Flash. 각 비교 조건의 정확한 평가 과제 수와 행동 예산 대응은 추가 확인이 필요하다.

5.7·17.6·22.9·28.6%는 단일 100개 이진 과제의 정수 성공률로는 나오지 않는다. 별도 subset이나 반복 평균일 수 있지만 표는 이를 명확히 설명하지 않는다. Main의 100개 분모를 모든 baseline에 자동 적용하지 않는다.

Single-agent는 원래 한 역할 그대로가 아니라 모든 역할·아이템을 합친 변경된 설정이다. 그 28.6%만으로 원본 과제의 단독 수행 불가능성을 증명하거나 반박하지 않는다. 한 명과 여러 명에게 같은 round budget을 주면 총 행동 기회도 같지 않을 수 있다.

Oracle은 한 에이전트가 모든 메시지를 보고 조정하는 설정이다. 52→60%는 그 구성의 관측 개선이며 가능한 모든 통신 전략의 수학적 상한이 아니다. 남은 40% 실패도 저수준 능력·규칙 이해·계획·도구 실행의 원인을 완전히 분해하지 않는다.

공유 계획을 주고 통신을 없앤 17.6%가 계획 없이 통신만 없앤 22.9%보다 낮다는 점은 고정 계획을 실행 중 수정하기 어렵다는 설명과 맞는다. 그러나 이것은 한 계획 생성·실행 설정의 비교이지 계획 자체가 해롭다는 일반 명제가 아니다.

구성요소를 빼면 정보와 수행 기회도 달라진다

35과제 설계 요소 절제 표

Table 4. 문서 제거와 round 축소는 입력 정보와 수행 기회도 바꾼다. 출처: Shu et al. (2026), v1, p.10, Table 4 — 연구·학습 목적 인용.

Full 54.3%, 역할 비대칭 정보 제거 45.7%, round budget 50→10 축소 37.1%, spawn 무작위화 51.4%, 문서 제거 29.4%다. 본문은 역할의 정보 제거라고 설명하므로 실제 능력을 동일하게 만든 실험과 혼동하지 않는다. Round 축소의 하락은 ‘짧은 과제에서 협업을 더 못한다’가 아니라 완료할 시간이 줄어든 효과를 포함한다.

분모도 문제가 있다. 35과제에서 54.3·45.7·37.1·51.4%는 각각 19·16·13·18개 성공과 맞지만, 29.4%는 어떤 정수 성공 건수/35를 소수 첫째 자리로 반올림해도 나오지 않는다. 반복 평균·누락 과제·표 오기 중 무엇인지 원문만으로 확정할 수 없다. 문서 제거의 24.9%p 차이는 표시값의 차이로만 보존하며 임의로 분모를 바꾸지 않는다.

9. 오류 유형과 반복 실험의 분모를 확인한다

많이 말하는 것과 잘 조정하는 것은 다르다

Main 평균 chat은 Gemini 11.0, Claude 26.6, GPT-5 Mini 44.1, DeepSeek 7.5다. GPT-5 Mini는 가장 많이 말하지만 SR 36%이며, DeepSeek는 적게 말하고 20%다. 저자는 GPT-5 Mini 실패 실행에서 chat이 행동의 26%이며, DeepSeek 첫 chat은 평균 round 5로 다른 모델의 1–2보다 늦다고 보고한다.

모델 능력·행동 정책·실패 시간도 함께 다르므로 이 관측만으로 최적 메시지 수를 추정하거나 chat 양의 인과 효과를 결정할 수는 없다.

37.7%는 전체 메시지가 아니라 분류된 오류의 비율

Table 5는 Gemini의 100과제 trace에서 분석한 오류 61개를 분류한다.

유형 건수 오류 중 비율
오래된 정보·중복 23 37.7%
역할·대상 오인 10 16.4%
사실 오류 9 14.8%
성급한 완료 선언 7 11.5%
실질 정보 없는 말 7 11.5%
논리 불일치 5 8.2%

전체 chat의 37.7%가 중복이라는 뜻도, 전체 실패 과제의 37.7%가 그 원인이라는 뜻도 아니다. 61개를 고른 절차와 중복 라벨 기준 없이는 메시지 수준 오류율로 바꿀 수 없다. 또한 범주별 생존 SR은 §3.4에 67–100%, §4.2에 50–100%로 다르게 적혀 있다. 원시 category 표 없이 하나로 정정하지 않는다.

세 번 같은 성공률이 모든 실행의 동일성을 뜻하지 않는다

Gemini의 동일 35과제, temperature 0.7, seeds 42·819·314에서 SR은 모두 54.3%다. 그러나 평균 round는 18.77·15.25·18.91, 평균 chat은 4.69·4.50·4.34다. n−1 분모의 표본 표준편차는 각각 약 2.07라운드·0.18 chat으로 보고와 맞는다.

이는 한 모델·한 부분집합의 반복이다. 성공한 과제의 교집합을 공개하지 않은 상태에서 모든 문항의 결과가 같았다고 할 수 없다. 모델 차이의 통계적 유의성이나 API snapshot 변화에 대한 안정성도 입증하지 않는다. 이 유보는 원문도 직접 명시한다.

References

Shu, R., Zhang, Y., Cho, Y. M., Yang, J. M., Yuan, Y., Zheng, W., Guntuku, S. C., Ungar, L., Yu, Z., & Zhang, R. (2026). AgentWorld: Benchmarking long-horizon collaboration of multi-agent LLMs [Preprint]. arXiv. https://arxiv.org/abs/2609.31590v1