Harness-Zero: Harness Distillation via Agent-as-Harness
외부 하네스가 대신 수행하던 검사와 작업 절차를 모델 자신의 행동으로 옮길 수 있을까. 실행 전 검토와 증류 과정을 설명하고, 도메인별 학습 결과와 행동 회복률의 의미를 살펴본다.
Paper: Haoran Ye, Yuxing Lu, Haonan Dong, Zhaochen Su, & Guojie Song (2026). Harness-Zero: Harness Distillation via Agent-as-Harness. arXiv:2609.24974v1 · 원문 PDF · HTML · 공식 저장소
스프레드시트의 빈칸을 채우되, 이미 적혀 있는 예시 셀은 바꾸면 안 되는 작업을 생각해 보자. 에이전트가 파일을 저장하고 끝내려 할 때 외부 검사기가 원본과 결과를 비교해 잘못된 수정을 막아 줄 수 있다. 그렇다면 이런 검사 절차를 매번 밖에서 대신 수행하는 대신, 모델이 스스로 확인하고 고치는 행동으로 배울 수 있을까?
Harness-Zero는 좋은 하네스가 유도하는 행동을 학습 데이터로 바꾸어 모델에 옮기려는 연구다. 여기서 하네스는 도구 호출, 상태 관리, 검사와 실행 순서를 조직하는 모델 바깥의 시스템을 뜻한다. 단순히 좋은 답을 복사하는 것이 아니라, 지금 주어진 실행 환경에서 직접 수행할 수 있는 작업 절차를 배우게 한다는 점이 핵심이다.
두 조건은 처음부터 구분해야 한다. 배포 때 없애는 것은 최적화된 전용 하네스와 검토자이며, 기본 실행 하네스는 남는다. 또 논문의 세 도메인 결과는 하나의 통합 모델이 아니라 도메인별로 따로 학습한 모델의 결과를 평균한 값이다.
1. 좋은 도구를 쓰는 것과 그 행동을 배우는 것은 다르다
외부 하네스는 모델의 실수를 여러 방식으로 줄인다. 작업 전에 파일을 읽게 하고, 위험한 변경을 막고, 저장한 결과를 다시 열어 확인하게 할 수 있다. 자주 실패하는 유형을 기억으로 남기거나 도메인 전용 도구를 제공하기도 한다.
하지만 그 환경에서 성공한 기록을 그대로 학습시키면 문제가 생긴다. 기록 속에 전용 도구를 호출하는 행동이 있는데 배포 환경에는 그 도구가 없다면, 모델은 쓸 수 없는 이름을 따라 하게 된다. 외부 검사기가 자동으로 수행한 확인 절차는 모델 자신의 행동으로 충분히 드러나지 않을 수도 있다.
Harness-Zero가 해결하려는 것은 이 간격이다. 전용 하네스의 의도를 유지하되, 학생 모델이 나중에 사용할 최소 실행 환경의 행동으로 다시 표현한다. 예를 들어 전용 검사 도구 호출 대신, 파일을 읽고 비교하는 Python 코드를 작성해 bash로 실행하는 식이다.
2. 실행 전에 검토하고, 수정된 행동은 학생 환경에서 실행한다
Figure 1. 전용 하네스의 안내를 읽는 검토자가 학생의 제안을 통과시키거나 실행 가능한 행동으로 바꾼다. 그 기록으로 학습한 뒤에는 전용 하네스와 검토자를 제거하고 기본 실행 하네스만 사용한다. 논문 v1, 4쪽 Figure 1에서 인용.
방법은 세 단계다. 먼저 학습 과제에서 반복되는 실패를 바탕으로 전용 하네스를 개선한다. 다음으로 그 도구와 검사 규칙, 스킬과 기억을 검토자가 읽을 참조 자료로 바꾼다. 마지막으로 검토를 거친 실행 기록을 모아 학생 모델을 미세조정한다.
수집 중에는 학생이 먼저 다음 행동을 제안한다. 검토자는 그 행동이 실행되기 전에 두 가지 중 하나를 선택한다.
- PASS: 제안을 그대로 통과시킨다.
- REPLACE: 학생의 현재 상태에서 실행할 수 있는 완전한 응답으로 바꾼다.
처음의 스프레드시트 예에서 학생이 성급하게 완료를 선언한다면, 검토자는 그것을 원본과 결과 파일을 다시 읽어 비교하는 행동으로 바꿀 수 있다. 중요한 점은 검토자가 보이지 않는 곳에서 파일을 직접 고치는 것이 아니라는 것이다. 검사 행동이 학생의 실행 환경에서 수행되고, 결과도 학생이 보는 기록에 남는다. 논문 §3
기본 구성의 검토자는 학생이 본 이력과 현재 제안, 참조 하네스를 읽지만 숨은 정답이나 환경 내부를 따로 들여다보지는 않는다. 추가 정보가 필요하면 학생이 할 수 있는 읽기나 검사 행동을 제안해야 한다. 그래야 나중에 검토자가 없어도 학생이 비슷한 절차를 수행할 수 있다.
3. 무엇을 학습하고, 무엇을 남기는가
학습하는 기록에는 그대로 통과한 학생 응답과 검토자가 바꾼 응답이 함께 들어간다. 검토자의 비공개 토론은 분리하고, 내부 경로 같은 비공개 표지가 남은 궤적은 제외한다. 대체 응답의 추론에서 검토자 관점의 표현이 정규식으로 탐지되면 해당 추론 토큰을 학습 손실에서 가리는 규칙도 둔다. 모든 교사 추론을 지우거나 모든 의미적 정보 누출을 차단한다는 뜻은 아니다.
학생은 Qwen3.5-9B이고, 학습용 기록을 만들 때의 검토자는 GPT-5.6 Sol이다. 수집한 데이터로 LoRA 지도 미세조정을 두 에폭 수행한다. 배포 때는 학습된 학생과 기본 실행 하네스만 남으며, 전용 하네스나 검토자 모델을 호출하지 않는다.
그 기본 환경에는 bash 실행과 파일시스템 등이 있다. 따라서 이름의 ‘Zero’를 도구나 하네스가 전혀 없다는 뜻으로 읽으면 안 된다. 바깥에서 강제하던 절차의 일부를 모델의 행동으로 옮겨, 배포 때 필요한 외부 지원을 줄이는 방법이다.
학습도 도메인별로 따로 한다. 스프레드시트, 앱 도구 사용, 화학 문제를 한 모델에 함께 학습한 결과는 아니다. 같은 기본 하네스를 사용한다는 것과 하나의 통합 체크포인트를 사용한다는 것은 다른 주장이다. 논문 부록 E.3
4. 평균은 올랐지만 모든 도메인에서 전용 하네스를 넘지는 않았다
| 조건 | 스프레드시트 | AppWorld | USPTO | 세 지표 평균 |
|---|---|---|---|---|
| 기본 모델·최소 하네스 | 31.0% | 26.8% | 12.0% | 23.3% |
| 기본 모델·전용 하네스 | 39.0% | 48.2% | 38.0% | 41.7% |
| 도메인별 증류 모델·최소 하네스 | 44.0% | 58.9% | 30.0% | 44.3% |
스프레드시트와 USPTO는 과제 성공률, AppWorld는 시나리오 목표 완료율이다. 마지막 열은 세 벤치마크 점수를 같은 비중으로 평균한 값이며, 모든 문항을 한데 모은 성공률이 아니다. 증류 행의 각 열은 해당 도메인에서 따로 학습한 모델의 결과다. 논문 Table 2
평균은 기본 모델의 23.3%에서 44.3%로 높아진다. 다만 이 개선이 모든 도메인에서 같은 모양은 아니다. 스프레드시트와 앱 작업에서는 전용 하네스를 붙인 기본 모델도 넘어선다. USPTO에서는 기본 모델보다 좋아지지만, 전용 하네스의 38.0%에는 못 미친다.
저자들은 상태를 확인하고, 필요한 곳만 바꾸고, 결과를 검증하는 절차가 깊은 도메인 지식보다 옮기기 쉬울 수 있다고 해석한다. 화학 하네스에는 반응 지식, 후보 생성, 분자 표현 검증이 함께 들어 있기 때문이다. 이는 결과를 설명하는 해석이며, 어느 요소가 성능 차이를 얼마나 만들었는지 모두 분리한 실험은 아니다.
5. 성공한 교사의 기록이 항상 좋은 학습 자료는 아니다
USPTO에서는 학습 기록의 출처를 바꾼 비교도 한다. 강한 교사가 직접 수행한 기록, 전용 하네스를 붙인 교사의 기록, 정답을 알고 검토한 기록, Harness-Zero의 검토 기록을 같은 학생 모델에 학습시킨다.
눈에 띄는 것은 수집 때의 성공률과 학습 뒤의 성능이 다르다는 점이다. 정답을 알고 검토하는 조건은 수집 성공률이 98.6%인데, 그 기록으로 학습한 학생의 시험 성공률은 15.0%다. Harness-Zero는 수집 성공률이 59.4%로 낮지만 학습 뒤에는 30.0%를 얻는다. 전용 하네스를 붙인 교사의 기록은 62.0%를 성공해도, 이를 학습한 학생은 최소 하네스에서 3.0%에 그친다.
논문은 마지막 조건에서 학생이 배포 환경에 없는 도구를 호출하는 문제가 나타났다고 설명한다. 성공 기록을 따라 하는 것만으로는 그 기록이 전제한 도구와 환경까지 얻을 수 없는 셈이다. 논문 §4.4
이 비교에도 범위가 있다. USPTO에서는 실패한 시행도 학습 데이터에 포함하며, 여러 조건은 행동 공간과 안내 방식 등에서도 차이가 난다. 따라서 강한 교사나 정답 정보가 일반적으로 쓸모없다는 결론은 아니다. 이 실험에서는 수집 성공률만으로 학생에게 얼마나 잘 전이될지 판단할 수 없었다고 읽는 편이 정확하다.
6. 행동 회복률 82.3%는 무엇을 뜻하는가
논문은 전용 하네스가 유도한 28개 행동 패턴도 살펴본다. 수정 전에 상태를 읽는지, 저장한 파일을 다시 여는지, 필요한 페이지를 끝까지 가져오는지 같은 행동이다.
평가할 때는 기본 모델이 전용 하네스 아래에서는 그 행동을 보였지만 최소 하네스에서는 보이지 않았던 과제를 골라 둔다. 그 과제에서 증류 모델이 같은 행동을 보이는 비율을 패턴별로 계산한 뒤 평균하면 82.3%다.
따라서 이 숫자는 전체 과제의 성공률도, 전용 하네스 기능의 82.3%를 완전히 복제했다는 뜻도 아니다. 기준 모델의 0% 역시 이렇게 과제를 고른 결과다. 선택된 행동이 학습 뒤 나타난다는 증거는 되지만, 그 행동이 성능 개선의 원인이라는 것까지 입증하지는 않는다. 실제로 행동 회복이 높다고 전용 하네스 대비 과제 점수도 더 높은 것은 아니다. 논문 §4.5
검토자도 충분히 유능해야 한다. 별도의 학습 없는 실험에서는 같은 모델이 학생과 검토자를 맡는데, 더 약한 모델에서는 검토를 붙여도 코드 하네스를 이기지 못한다. 모든 행동을 실행 전에 검토하는 동안에는 호출과 대기 비용도 늘어난다. 증류는 이 검토자를 배포 단계에서 빼는 방식이지, 학습 데이터 수집 비용까지 없애는 방식은 아니다.
7. 도구 이름이 아니라 실행 가능한 절차를 옮긴다
Harness-Zero의 기여는 하네스를 단순한 배포용 부속품이 아니라 학습 신호의 출처로 본다는 데 있다. 좋은 외부 규칙이 있다면 그 규칙을 학생이 실제로 수행할 수 있는 행동으로 바꾸고, 실행 결과까지 포함한 기록을 학습시킬 수 있다.
다만 현재 결과는 세 도메인별 학습과 특정 기본 하네스에 한정된다. 여러 도메인을 한 모델에 합쳤을 때의 전이, 반복 실행의 변동, 전체 학습 비용 대비 배포 이득은 추가 확인이 필요하다. 맥락 관리처럼 응답 한 번으로 옮기기 어려운 외부 기능도 남는다.
이 글은 원문과 공개 자료를 대조한 리뷰이며, 학습이나 벤치마크를 독립적으로 재실행하지 않았다. 검토 프로토콜, 비교 조건과 평균의 계산 방식, 공개 범위는 상세 읽기에서 이어진다.
References
Ye, H., Lu, Y., Dong, H., Su, Z., & Song, G. (2026). Harness-Zero: Harness Distillation via Agent-as-Harness. arXiv:2609.24974v1.
