Agent Plasticity: Measuring Self-Improvement Through Experience
고정된 언어 모델이 경험을 영속 도구와 기억으로 바꾸는 과정을 보드게임과 NetHack에서 추적하고, held-out 성능 향상과 학습 비용을 함께 측정합니다.
Paper: Harman Singh; Anton Bakhtin; Rulin Shao; Gabriel Synnaeve; Ilia Kulikov; Rob Fergus; Sanjeev Arora; Kurt Keutzer; Jason Weston; Anuj Mahajan; Anirudh Goyal (2026). "Agent Plasticity: Measuring Self-Improvement Through Experience". arXiv preprint, arXiv:2610.08902v1, 2026년 10월 6일, 43쪽. PDF · arXiv HTML
서론
정적 벤치마크는 한 시점에 에이전트가 무엇을 할 수 있는지를 측정한다. Singh et al.은 여기에 다른 질문을 더한다. 경험을 통해 만든 도구·전략·메모리를 다음 인스턴스가 물려받을 때, held-out 과제의 성능이 얼마나 달라지고 그 변화를 얻는 데 얼마의 학습 비용이 드는가? 논문은 가중치를 고정한 채 경험을 영속 artifact로 축적하는 에이전트의 전체 학습 궤적을 측정한다.
여기서 agent plasticity는 고정 모델 자체의 성질이라기보다 특정 모델, artifact inventory, reflection 절차, 과제와 가격 체계가 결합된 학습 protocol에서 경험을 성능 향상으로 바꾸는 효율이다. 점수의 최종 높이와 비용당 향상량은 별개의 값이다. 또한 보드게임의 held-out 평가와 NetHack의 매 checkpoint 새 게임 평가는 서로 다른 설계로 읽어야 한다.
요약
| 항목 | 논문에서 측정하는 내용 |
|---|---|
| 바뀌는 것 | 모델 weight가 아니라 다음 instance에 전달되는 Python 도구, 기술·전략, 텍스트 기억의 inventory다. |
| 격리 | acting episode는 새 context와 임시 작업공간에서 시작한다. 보드게임의 reflection은 training 상호작용을 받지만 held-out trajectory와 점수는 받지 않는다. |
| 비용 | training과 reflection의 provider API 비용을 누적한다. 거절된 reflection 시도도 포함하고 held-out 평가·배포·CPU 시간을 제외한다. |
| 대표 결과 | 보드게임 세 family를 합친 곡선에서 GPT-5.6 Sol의 P_sat은 298, Claude Opus 5는 233, Claude Fable 5는 57, Claude Opus 4.8은 14다. Fable 5의 fitted endpoint는 더 높고 Sol의 비용당 획득 효율은 더 높다. |
| 별도 환경 | NetHack에서는 각 checkpoint마다 새 10게임을 먼저 평가한 뒤 reflection에 넘긴다. 이 게임들은 고정된 영구 held-out set이 아니다. |
목차
- 경험을 영속 개선으로 측정하기
- 고정 weight와 artifact protocol
- 환경·분할·feedback 설계
- 비용과 plasticity 지표
- 보드게임의 결과
- NetHack의 별도 측정
- 재사용·실패 진단과 저자 한계
1. 경험을 영속 개선으로 측정하기
두 에이전트가 현재 점수가 비슷해도 이후 경험에서 서로 다른 경로를 밟을 수 있다. 하나는 실패를 바탕으로 재사용 가능한 도구를 만들고, 다른 하나는 inventory를 유지하거나 성능을 낮출 수 있다. 따라서 endpoint 점수만으로는 시작 능력과 경험으로 얻은 향상을 분리하기 어렵다. 학습 기회 수만 세어도 모델별 호출 비용이 다르면 획득 효율을 비교하기 어렵다.
논문은 세 질문을 함께 다룬다. 첫째, training interaction에서 얻은 변경이 향후 held-out 상호작용에도 이어지는가? 둘째, 개선에 필요한 학습 비용은 얼마인가? 셋째, 개선 과정의 실패는 artifact가 없어서인지, 있었지만 쓰지 않아서인지, 써도 실패가 남아서인지 구분할 수 있는가? 이 framework는 모델 weight를 업데이트하는 optimizer가 아니라, 고정 weight 에이전트의 영속적 비모수 적응을 반복 측정한다.
2. 고정 weight와 artifact protocol
checkpoint t의 에이전트는 고정된 언어 모델 M과 영속 inventory I_t로 구성된다. Inventory에는 실행 가능한 Python 도구, 자연어 기술·전략, 텍스트 메모리가 들어간다. 각 acting episode는 새 context와 임시 파일에서 시작하므로 이전 대화 기록이나 episode-local 파일은 다음 게임에 전달되지 않는다. Training 게임의 trajectory, 결과, 실행 trace, 오류, 게임별 feedback은 같은 모델이 수행하는 reflection 단계에 제공된다.
I_{t+1}=U_M\!\left(I_t,\mathcal{E}^{\mathrm{train}}_t\right),여기서 U_M은 모델 weight를 바꾸는 연산이 아니라 training evidence를 읽고 inventory를 제안·수정하는 절차다. 제출된 변경은 구조 검사와 실행 가능성 검사를 통과해야 영속화된다. 이 gate는 artifact의 형식·적재·실행 가능성을 확인하는 유효성 gate이며, held-out 점수가 나아지는지를 검사하는 성능 gate는 아니다. 거절된 변경과 재시도에도 reflection 호출 비용이 발생한다.
CP0의 영속 inventory는 비어 있지만 actor가 쓸 수 있는 모든 도구가 없는 것은 아니다. 각 episode의 임시 작업공간에서 로컬 도구를 새로 만들어 사용할 수 있다. 그러므로 CP0은 영속 artifact가 없는 baseline이지, 동일 예산으로 reflection을 생략한 반사실 조건은 아니다.
그림 1. Singh et al. (2026), Figure 2, arXiv v1 PDF p.2. Training evidence는 reflection에 전달되고, held-out 게임과 점수는 reflection에 공개되지 않는다. 각 새 episode는 모델 weight와 갱신된 영속 inventory를 사용한다.
각 lineage에서 actor와 reflection은 같은 모델을 사용한다. 모델 weight는 모든 checkpoint에서 고정되며, 변화하는 것은 inventory다. 이 설계는 대화 기록이 누적되는 효과와 persistent artifact를 통한 변화를 분리해 관찰한다.
3. 환경·분할·feedback 설계
보드게임에서는 training 게임만 다음 inventory를 갱신하는 reflection에 전달한다. Held-out ID는 training과 같은 상대 난이도 범위의 게임이고, held-out OOD는 더 강한 상대를 둔다. OOD는 임의의 새 과제나 완전히 다른 게임을 뜻하지 않는다. Chess 점수는 승리 W, 무승부 D, 게임 수 N에 대해 다음과 같다.
S_{\mathrm{chess}}=100\frac{W+0.5D}{N}.| 조건 | checkpoint 범위 | CP당 Train / held-out ID / held-out OOD 게임 | 상대 및 점수 조건 |
|---|---|---|---|
| Chess Hard | 0–20 | 16 / 12 / 12 | Stockfish 16, 수당 20k nodes; train skill 1–8, ID 3–8, OOD 12. 양 색을 평가한다. |
| Chess Easy | 0–20 | 16 / 16 / 12 | 같은 chess 점수와 엔진; train·ID skill 2–5, OOD 8–10. 양 색을 평가한다. |
| Go 5×5 | 0–20 | 20 / 20 / 12 | Chinese area 점수, komi 9.5, positional superko, no suicide; GNU Go train·ID level 5–9, OOD level 10. |
| Hex 6×6 | 0–20 | 40 / 40 / 32 | 연결 승패 점수; native alpha–beta engine은 train·ID에서 10k–1M, OOD에서 10M nodes다. |
| NetHack Challenge v0 | 0–40 | 매 checkpoint 새 10게임 | 별도 harness 및 raw score protocol. 새 게임을 먼저 점수화한 다음 결과와 trace를 reflection에 넘긴다. |
Chess의 training 게임에는 skill-20 Stockfish의 move-quality annotation이 반영되어 reflection feedback으로 쓰인다. Go의 KataGo 비교와 Hex의 더 깊은 엔진 판정은 실패를 분석하기 위한 offline annotation이며, actor나 reflection에 제공되는 teacher feedback은 아니다. Held-out 게임은 세 보드게임에서 reflection에 전달되지 않는다.
Chess actor는 게임당 최대 64회, Go·Hex actor는 최대 32회의 model call을 받으며, reflection은 최대 50회 호출된다. Go·Hex에서 Bash/Python call이 제한 시간을 넘으면 상태 확인과 한 수 제출만 가능한 마지막 recovery call이 주어진다. 게임 수와 checkpoint 수가 같다고 호출 예산까지 같은 것은 아니다.
NetHack은 보드게임과 구별되는 별도 protocol이다. 각 checkpoint의 각 lineage는 lawful dwarf female Valkyrie로 새 seed의 게임 10개를 플레이하며, 게임당 최대 50,000 primitive actions와 active play 2시간 제한을 둔다. 그 10게임은 해당 checkpoint의 inventory를 점수화한 뒤 reflection에 제공된다. CP가 바뀌면 새 게임과 난이도도 바뀌므로 같은 held-out set을 checkpoint마다 반복 평가하는 설계가 아니다.
4. 비용과 plasticity 지표
모델 m, 환경 e, checkpoint T까지의 누적 learning cost는 training interaction 비용과 reflection 비용의 합이다.
C_{m,e,T}=\sum_{u=0}^{T-1}\left(c^{\mathrm{train}}_{m,e,u}+c^{\mathrm{reflect}}_{m,e,u}\right),\qquad C_{m,e,0}=0.저자들은 token 사용량을 provider 가격으로 환산한 달러를 compute 비용의 대리 지표로 쓴다. 여기에 training에서 경험을 얻는 호출과 artifact를 수정하는 reflection 호출이 포함되고, malformed output이나 불법 import 등으로 거절된 reflection도 포함된다. Held-out 평가와 배포 호출은 분모에서 빠진다. 물리적 compute, 엔진·sandbox CPU 시간, wall-clock 시간과 사람의 작업 시간도 이 값에 포함되지 않는다.
관측 checkpoint T의 score S에 대한 기본 plasticity는 CP0 대비 score gain을 누적 learning cost로 나눈다.
P^{\mathrm{score}}_{m,e,s,T}=\frac{S_{m,e,s,T}-S_{m,e,s,0}}{C_{m,e,T}}.단위는 score point/USD이며 논문 표에서는 ×1,000해 score point per $1,000으로 표시한다. 이 값은 음수일 수 있고, 비용이 0인 CP0에서는 정의되지 않는다. 점수의 시작점과 평가 구간에 따라 달라지는 관측 구간의 gain/cost 비율이다.
포화 fit과 headline 값
headline인 P_sat은 순간 기울기가 아니라 각 model–environment 성능 곡선에 맞춘 Hill형 포화 곡선에서 얻는다.
\hat{S}(C)=S_0+A\frac{C^h}{C^h+C_{50}^h}.S_0, A, C_{50}, h 네 매개변수는 함께 fit된다. S_0는 fit의 초기 절편이며 관측된 CP0 점수와 같다고 두지 않는다. A는 fitted 총 증가량이고 C_{50}은 그 증가량 절반에 해당하는 비용이다. C^*는 fitted increase의 90%에 처음 도달한 관측 checkpoint의 비용이다. 따라서 보고량은
P^{\mathrm{sat}}_{m,e}=\frac{\hat{S}(C^*)-S_0}{C^*}이며, fitted gain을 해당 관측 비용으로 나눈 값이다. 연속 곡선의 미분값이 아니다. 교차하는 관측 checkpoint가 없으면 90% 지점을 최대 3C_{\max}까지 외삽한다. 그 한계를 넘어 saturation을 확인할 수 없으면 마지막 checkpoint의 fitted gain/cost를 plasticity-to-date로 보고한다. Fitted rise의 90%가 10 percentage points보다 작으면 P_sat=0을 할당한다. 이는 기준에 미달했다는 뜻이며 학습이 전혀 없었다는 증명은 아니다.
Figure 1은 Chess Hard/Easy, Go, Hex의 held-out ID score–cost 곡선을 결합해 먼저 곡선을 만들고 fit하는 집계 결과다. 개별 환경별 비율을 계산해 평균 낸 값이 아니다. 모델별 표준값은 다음과 같다.
그림 2. Singh et al. (2026), Figure 1, arXiv v1 PDF p.1. 왼쪽은 누적 learning cost에 따른 held-out ID score, 오른쪽은 포화까지의 score gain을 비용으로 나눈 P_sat이다. GPT-5.5는 관측 종료 시점에도 개선 중이어서 포화값이 확정되지 않는다.
| 모델 | P_sat (score points / $1,000) |
함께 읽을 점 |
|---|---|---|
| GPT-5.6 Sol | 298 | 제시된 모델 중 비용당 획득 효율이 가장 높다. |
| Claude Opus 5 | 233 | 두 번째로 높은 보고값이다. |
| Claude Fable 5 | 57 | combined-game curve의 fitted endpoint가 가장 높다. |
| Claude Opus 4.8 | 14 | 공식 프로젝트 설명에 따르면 마지막 관측 비용 이후로 포화 지점을 외삽한 경우다. |
| GPT-5.6 Luna | 0 | fitted rise 기준에 따라 0을 할당했다. |
| GPT-5.5 | 미확정 | run 종료 시점에도 상승 중이라 saturation을 정하지 못했다. |
Fable 5의 fitted endpoint가 가장 높고 Sol의 P_sat이 가장 높다는 두 결과는 서로 다른 질문에 답한다. 하나는 도달한 성능 수준이고, 다른 하나는 정한 포화 절차까지의 비용당 획득량이다.
5. 보드게임의 결과
Hard chess에서 Claude Fable 5의 held-out ID 점수는 CP0의 37.5%에서 CP16–20 평균 73.3%로, Claude Opus 5는 25.0%에서 66.4%로 올랐다. GPT-5.6 Sol은 거의 0%에서 CP16–20 평균 약 36.9%까지 상승했다. 시작 점수와 향상 폭은 같은 순위가 아니다.
다른 환경에서도 개선은 모델별로 달랐다. 5×5 Go에서 Fable 5의 held-out ID는 CP0→20에 20%→80%, OOD는 0%→50%였다. 6×6 Hex에서 GPT-5.6 Sol의 held-out ID는 40%→77.5%, OOD는 28.1%→78.1%였다. 반면 Opus 4.8은 Go에서 하락하고 Hex에서 크게 개선했으며, Opus 5는 Go의 마지막 checkpoint에서 tool-making error와 함께 점수가 떨어졌다. OOD 상대가 더 강하더라도 OOD 점수가 매 모델·환경에서 반드시 ID보다 낮게 나타나는 것은 아니다.
이 수치들은 같은 영속 artifact protocol 안에서도 개선 궤적이 과제에 따라 달라짐을 보여 준다. 보드게임 결과와 NetHack 점수는 척도와 평가 설계가 다르므로 하나의 공통 성능축으로 합산하지 않는다.
6. NetHack의 별도 측정
NetHack은 Claude Code와 Codex의 native harness를 출발점으로 사용한다. 각 모델 lineage는 CP0–40에서 매 checkpoint마다 새로운 10게임을 먼저 치르고, 결과와 trace를 reflection에 제공한다. 논문은 모델마다 lineage 하나를 보고한다. 따라서 CP0–40의 곡선은 학습된 inventory의 변화뿐 아니라 새 게임의 난이도 차이도 포함한다.
각 게임의 점수는 그 게임에서 얻은 최고 원점수이며, checkpoint 요약에는 이 점수들의 평균·중앙값·최댓값을 사용한다. Figure 5는 이 10개 점수의 **중앙값(median score)**과 평균 최고 dungeon level을 표시한다. Mean score 곡선은 별도의 Figure 10에 보고된다. NetHack의 plasticity 계산에서는 고정 anchor가 각각 0과 100이 되도록 점수 단위를 변환한다. 213.6→0, 6,526.98→100은 단위를 정의하는 기준점이지 가능한 raw score의 하한·상한이 아니다.
그림 3. Singh et al. (2026), Figure 5, arXiv v1 PDF p.6. CP0–40에서 게임별 최고 원점수의 중앙값, 평균 최고 dungeon level과 normalized P_sat을 보여 준다. Mean score는 Figure 10에 따로 제시되며, 각 checkpoint는 새로운 10게임으로 평가된다.
Claude Opus 5.5의 fitted rise는 A=68.95 normalized points이며 90% 기준은 62.055다. 처음 기준을 넘는 관측 checkpoint는 CP11이고, 그 지점의 fitted gain은 66.25, 그때까지의 누적 learning cost는 <span class="blog-math-inline"><code>1,072.73이다. 표시된 gain과 비용으로 직접 계산하면 약 61.76 points per </code></span>1,000이며, 논문 보고값은 61.75다. 나머지 다섯 모델은 이 분석에서 reliable rise를 보이지 않았다. 이 normalized score와 게임·harness가 보드게임과 다르므로 61.75를 보드게임의 P_sat과 직접 순위 비교하지 않는다.
CP10에서의 artifact와 행동량
Table 3은 Opus 5.5의 상승이 library 파일 수나 tool-call 양만으로 설명되지 않는다는 점을 보여 주기 위해 같은 CP10의 10게임에서 inventory와 게임 행동량을 병렬로 보고한다.
| 모델 | tool code 파일 / 줄 | tests | instruction 줄 | tool calls/game (share) | actions/game | dug down | mean score |
|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 6 / 2,713 | 125 | 419 | 622 (97%) | 3,585 | 5 | 9,015 |
| GPT-5.6 Sol | 1 / 2,089 | 58 | 176 | 218 (59%) | 1,211 | 0 | 417 |
| Claude Opus 4.8 | 5 / 1,341 | 58 | 413 | 10 (2%) | 716 | 2 | 933 |
| Claude Sonnet 5 | 4 / 1,683 | 81 | 467 | 914 (96%) | 955 | 1 | 402 |
| GPT-5.6 Luna | 0 / 0 | 0 | 146 | 0 (0%) | 880 | 0 | 239 |
| Claude Opus 5 | 13 / 8,237 | 505 | 452 | 293 (96%) | 1,704 | 1 | 1,919 |
tests는 검증 통과 건수가 아니라 test function 수다. instruction 줄은 최상위 CLAUDE.md 또는 AGENTS.md의 줄 수다. tool calls는 library를 실행한 shell command 수와 전체 shell command 중 비율이며 이동·행동 단위의 재사용률이 아니다. dug down은 10게임 가운데 바닥을 판 적이 있는 게임 수다. 이 수치의 병렬 제시는 artifact 수량이 성능의 원인임을 식별하지 않는다. 저자들은 lineage 간 harness 조건도 같지 않다고 설명하며, CP10 Opus 5.5의 crash guard 사례를 다른 모델과 matched-harness 인과 비교로 해석하지 않는다.
7. 재사용·실패 진단과 저자 한계
논문은 artifact가 게임 결정에서 쓰였는지와 확인된 실패가 어떤 조건에서 남았는지를 서로 다른 분모로 집계한다. Relevant decision은 저장 artifact 중 적어도 하나가 해당 수를 선택하거나 실행하는 데 관련될 수 있는 결정이다. 그 분모에서 한 결정에 artifact 하나라도 실제로 사용되면 재사용으로 세며, 같은 수의 다른 후보 artifact를 별도 미사용으로 중복 계산하지 않는다.
확인된 실패는 그 결정과 관련된 covering artifact를 기준으로 세 범주로 나뉜다. F_absent는 실패를 다룰 artifact가 없음, F_missed는 artifact가 있으나 사용되지 않음, F_used는 사용됐지만 실패가 남음이다. 이 failure composition은 실패 사례에 조건부이므로 전체 게임의 실패율이나 관련 결정의 비율이 아니다. failure count / relevant decision도 한 결정에 복수 failure가 가능하므로 확률이 아니라 정규화된 count다. Artifact-conditioned success rate는 relevant artifact를 사용한 결정 중 실패가 확인되지 않은 비율이라 앞의 두 분모와 구분된다.
그림 4. Singh et al. (2026), Figure 4, arXiv v1 PDF p.4. 왼쪽은 relevant decision에서의 재사용 범주, 오른쪽은 확인된 실패만을 artifact 존재·사용 여부로 분해한다. Panel 간 share를 같은 분모로 해석하지 않는다.
Hard·Easy chess를 합친 relevant decision 중 artifact 미사용 비율은 GPT-5.6 Luna 약 98%, Gemini 3.1 Pro 약 87%, Claude Opus 4.6 약 51%, GPT-5.5 약 28%다. Claude Fable 5, Claude Opus 5, Claude Opus 4.8, GPT-5.6 Sol은 약 2–6%다. 논문은 Chess Hard, Go, Hex의 19개 model–game cell에서 held-out ID 재사용과 점수 gain의 연관을 보고한다. 이는 관찰된 연관이며 artifact 사용의 인과 효과는 아니다.
재사용이 잦아도 실패가 모두 사라지지는 않는다. 강한 improver를 포함해 해당 그룹에서 남은 실패의 83–99%는 relevant artifact가 사용된 상태에서 발생했다. 이는 retrieval뿐 아니라 artifact의 내용, 일반화, 적용도 실패와 함께 관찰된다는 뜻이다. 사용 자체가 성능 개선을 보장하지 않는다.
저자들이 명시한 한계는 다음과 같다. 첫째, frozen weight와 fresh context가 persistent adaptation을 분리하지만 training feedback의 기여와 artifact 개발에 들어간 reflection compute를 분리하지 않는다. 둘째, 비용은 deployment를 포함하지 않으며 plasticity 추정은 provider 가격, 시작 점수의 headroom, 학습 horizon, 포화 fit에 의존한다. 셋째, 재사용 진단은 관찰적이다. 넷째, finite evaluation set에는 checkpoint 수준의 noise가 있다. 다섯째, NetHack은 매 checkpoint 새 게임이므로 learning과 난이도 변화가 섞인다. 여섯째, 별도로 학습한 lineage만으로는 과제 간 artifact·개선전략 transfer가 확립되지 않는다. 또한 긴 context에서 지시를 따르는 능력이 artifact 생성과 적용에 기여한 정도도 이 실험에서 분리하지 않는다.
이 논문의 결과는 endpoint capability, 경험당 획득 효율, inventory의 재사용과 실패를 따로 기록해야 함을 보여 준다. P_score는 지정된 checkpoint까지의 관측 gain/cost이고 P_sat은 정해진 곡선 fit과 포화 규칙에 따른 요약값이다. 보드게임의 held-out ID/OOD 설계와 NetHack의 checkpoint별 fresh games는 별도의 평가 결과로 남겨 둬야 한다.
References
Singh, H., Bakhtin, A., Shao, R., Synnaeve, G., Kulikov, I., Fergus, R., Arora, S., Keutzer, K., Weston, J., Mahajan, A., & Goyal, A. (2026). Agent plasticity: Measuring self-improvement through experience [Preprint]. arXiv. https://arxiv.org/abs/2610.08902v1



