A Survey of Agentic Reasoning for Large Language Models

답을 만드는 AI에서 일을 끝내는 AI로 — 에이전틱 추론 서베이 쉽게 읽기

에이전틱 추론을 기초 능력·자기 진화·협업으로 나누어 읽는다. 무엇을 실행 중에 바꾸고 무엇을 학습하는지, 어떤 평가가 필요한지 살펴보고, v2의 분류 경계와 PDF·HTML 서지 차이를 검토한다.

Jiphyeonjeon Team2026-09-259 min read쉬운 읽기상세 읽기
surveyagentic-reasoningmulti-agentagent-memorytool-usebenchmarkspaper-review

Paper: Tianxin Wei; Ting-Wei Li; Zhining Liu; 외 26인 (2026). A Survey of Agentic Reasoning for Large Language Models: Towards Recursively Self-Improving and Collective Agents. arXiv:2601.12538v2 · PDF. 2026년 9월 20일 공개된 135쪽의 v2를 기준으로 한다. PDF·HTML 본문에는 Agentic Reasoning for Large Language Models — Foundations · Evolution · Collaboration이라는 표제가 쓰인다.

코드 오류를 고쳐 달라고 했을 때, AI가 그럴듯한 수정안을 설명하는 것과 실제 파일을 열고 테스트를 통과시키는 것은 다르다. 후자는 무엇을 확인할지 정하고, 도구를 실행하고, 결과를 보고 다음 행동을 바꿔야 한다.

이 서베이는 그 차이를 에이전틱 추론이라는 이름으로 정리한다. 핵심은 길게 생각하는 능력만이 아니다. 생각이 행동을 고르고, 행동의 결과가 다음 생각을 바꾸는 순환이다.

세부 분류와 수식, 서지 검토는 딥리뷰에 있다. 이 글은 새로운 시스템의 성능을 검증한 보고서가 아니라, 여러 연구를 읽는 지도를 설명한다.

1. 모르고 있는 것을 확인하는 일이 추론의 일부가 된다

웹에서 제품 정보를 조사하는 상황을 생각해 보자. 이미 입력된 자료만으로 답하면, 그 자료가 오래되었는지 모델은 알기 어렵다. 반면 검색 도구를 사용할 수 있다면 현재 페이지를 확인하고, 필요한 정보가 빠졌을 때 다른 자료를 찾을 수 있다. 이 예시는 개념을 설명하기 위한 것이다.

여기에는 두 종류의 상태가 있다. 바깥 세상의 실제 상태와, 에이전트가 지금까지 보고 기억한 상태다. 둘은 같지 않다. 메모에 ‘재고 있음’이라고 적혀 있어도 실제 재고는 바뀌었을 수 있다.

에이전틱 추론은 이 차이를 전제로 한다. 지금 가진 정보로 무엇을 판단할 수 있는지, 무엇을 더 확인해야 하는지, 확인 결과에 따라 계획을 어떻게 바꿀지를 결정한다. 도구는 모델의 결론을 장식하는 것이 아니라 다음 판단에 필요한 관찰을 가져오는 수단이다. 논문 §2

2. 세 관점은 등급이 아니라 질문이다

서베이는 연구를 세 관점으로 묶는다.

기초 능력, 자기 진화, 협업을 연결한 에이전틱 추론 개관

그림 1. 기초 능력은 계획·도구·검색, 자기 진화는 피드백·기억·갱신, 집단 추론은 역할·협업에 초점을 둔다. 세 관점은 한 시스템 안에서도 함께 나타날 수 있다. 원논문 v2, 2쪽 Figure 1에서 인용.

첫째, 지금 일을 어떻게 풀 것인가? 계획을 세우고 도구를 부르고 근거를 찾는 기초 능력이다. 예를 들어 테스트 실행 전에 필요한 파일을 찾고, 실행 결과에 따라 수정 범위를 바꾼다.

둘째, 이번 경험에서 무엇을 남길 것인가? 실패 원인을 기억하거나 도구를 추가해 다음 과제에 활용하는 자기 진화다. 같은 오류를 다시 만나도 처음부터 시행착오를 반복하지 않으려는 접근이다.

셋째, 여러 에이전트가 무엇을 나눌 것인가? 조사·작성·검증처럼 역할을 나누고 정보를 전달하는 집단 추론이다. 누가 무엇을 알고, 어떤 결과를 누구에게 넘기는지가 중요하다.

셋째가 첫째보다 반드시 더 좋은 것은 아니다. 한 에이전트가 잘할 일을 여러 에이전트에게 나누면 통신과 조정만 늘어날 수 있다. 이 세 가지는 성숙도 사다리가 아니라 설계를 살펴보는 질문이다.

3. 사용 방법을 바꾸는 것과 모델을 학습시키는 것은 다르다

같은 모델로도 프롬프트를 바꾸고, 검색을 더 하고, 후보 계획을 비교하면 결과가 달라질 수 있다. 이때 모델 가중치를 그대로 두는 접근을 논문은 기본적으로 in-context라고 부른다. 지금 가진 모델을 어떻게 사용할지 조정하는 것이다.

반면 좋은 행동 사례로 지도 미세조정(SFT)을 하거나, 결과에 보상을 주어 강화학습(RL)을 하면 학습 가능한 정책의 파라미터가 달라진다. 논문이 기본 틀에서 설명하는 post-training이다.

이 차이는 비용이 드는 위치에도 영향을 준다. 첫 방식은 실행할 때 검색·검증·추가 호출을 많이 할 수 있다. 두 번째는 경험을 행동 정책에 반영하는 대신 학습 데이터와 보상을 설계해야 한다. 어느 쪽도 그 자체로 항상 더 싸거나 정확하지는 않다.

용어를 읽을 때 한 가지 예외를 기억해야 한다. 협업 절에서는 post-training에 프롬프트와 에이전트 연결 구조를 탐색하는 방법까지 포함한다. 따라서 그 이름만 보고 ‘모델 가중치를 학습했구나’라고 판단하지 말고, 실제로 무엇을 바꿨는지 확인하는 편이 정확하다. 논문 §2.2 · §5.2

4. 경험을 남기는 자리도 여러 가지다

실패한 시도 뒤에 다음과 같은 일을 할 수 있다.

하는 일 바뀌는 것
‘다음에는 버전을 먼저 확인하라’고 메모한다. 다음 판단에 사용할 문맥과 기억
반복되는 계산을 함수로 만들어 저장한다. 재사용할 도구 라이브러리
조사자와 검증자가 결과를 주고받는 순서를 고친다. 워크플로와 통신 구조
성공·실패 사례로 SFT나 RL을 수행한다. 학습 가능한 정책의 파라미터

네 가지 모두 넓은 의미에서 시스템을 바꾼다. 하지만 메모를 저장하는 일을 모델이 재학습했다고 부를 수는 없다.

기억의 내용, 구조, 관리 정책을 나눈 도식

그림 6. 대화·경험을 문맥에 활용하는 것, 기억을 그래프로 연결하는 것, 어떤 기억을 저장·검색·갱신할지 정책을 학습하는 것은 다른 설계 선택이다. 원논문 v2, 24쪽 Figure 6에서 인용.

Reflexion 계열은 경험을 언어로 정리해 후속 시도에 활용한다. LATM은 도구를 만드는 역할과 사용하는 역할을 구분해, 만들어 둔 도구를 재사용한다. 둘 다 ‘경험을 다음 수행에 남긴다’는 관점에서는 연결되지만, 남는 산출물은 다르다.

여기서 한 단계 더 물어야 한다. 바뀐 것이 정말 좋아졌는가? 잘못된 진단을 메모로 남기거나 오류가 있는 함수를 재사용하면 문제가 누적될 수도 있다. 갱신은 관찰할 수 있는 변경이고, 개선은 따로 검증해야 하는 결과다. 논문 §4

5. 팀을 만들 때는 메시지의 경로를 설계한다

여러 에이전트에게 ‘전문가처럼 토론하라’고 지시하는 것만으로 역할 분담이 완성되지는 않는다. 누가 자료를 찾고, 누가 증거를 추리고, 누가 결과를 통합하며, 의견이 충돌하면 무엇을 기준으로 결정할지가 필요하다.

서베이의 웹 조사 사례 INFOGENT는 이 차이를 보여 준다. Navigator는 페이지를 찾고, Extractor는 증거를 뽑고, Aggregator는 결과를 합치며 추가 탐색을 요청한다. 각 역할의 산출물이 다른 역할의 입력이 된다.

구조를 고정할 수도 있고, 현재 과제에 따라 다음 에이전트를 고르는 라우터를 둘 수도 있다. 둘 중 어느 방식이 적절한지는 업무에 따라 다르다. 중요한 것은 팀원 수보다 누가 어떤 정보를 받아 어떤 결정을 하는가다.

여러 에이전트가 같은 잘못된 자료를 읽고 동의했다면 독립적인 검증이 늘어난 것은 아니다. 같은 총 예산에서 한 에이전트보다 나은지, 통신과 재시도로 비용이 얼마나 늘었는지도 확인해야 한다. 이는 서베이의 분류를 적용할 때 이 리뷰가 권하는 비교 기준이다. 논문 §5 · §6.5.3

6. 평가 점수는 무엇을 했는지와 함께 읽는다

서베이는 능력 중심 평가와 응용 중심 평가를 나눈다. 이 구분은 실용적이다. 도구를 잘 고르는지 진단하는 시험과, 여러 도구를 써서 전체 업무를 끝내는 시험은 서로 대신할 수 없다.

  • 도구: 맞는 API를 올바른 인자로 호출했는가?
  • 검색: 질문을 뒷받침하는 근거를 실제로 찾았는가?
  • 기억·계획: 지난 기록을 회수하고 여러 단계의 제약을 유지했는가?
  • 협업: 공동 의사결정이 더 나은 결과로 이어졌는가?
  • 전체 업무: 시간·비용·권한 제약 안에서 과제를 끝냈는가?

예를 들어 코드가 오류 없이 실행된 것과 사용자가 원한 기능을 구현한 것은 다르다. 기억을 많이 회수한 것과 현재 질문에 맞는 기억을 가져온 것도 다르다. 무엇을 재는지 먼저 정해야 높은 점수를 해석할 수 있다.

서베이의 대표 시스템 표는 관련 연구를 찾는 데 유용하지만, 같은 모델·데이터·예산으로 다시 시험한 순위표는 아니다. 이 목록만으로 특정 방법의 일반적인 우위를 결정할 수는 없다. 논문 §7

7. 이 지도를 사용할 때 주의할 점

첫째, 요약 그림보다 본문의 구체적인 정의를 확인한다. 기억 절은 도입에서 네 흐름이라고 적지만 실제 하위 절과 그림은 셋이다. 벤치마크 그림은 검색 항목을 빠뜨리고 기억·다중 에이전트의 절 번호도 본문과 다르게 표시한다. 그림을 탐색 안내로 사용할 때 주의가 필요하다.

둘째, 전용 절이 없다는 것을 아예 다루지 않는다는 뜻으로 바꾸지 않는다. 수학·소프트웨어 개발 전용 벤치마크 절은 없지만, 코드 구현과 실행을 포함하는 평가는 다른 응용에서 다룬다. 금융·법률·교육도 도메인별 역할 설명에 등장한다.

셋째, 참고문헌의 매체와 번호를 확인한다. PDF와 HTML 모두 참고문헌은 797개이며, References 이전 영역에서는 각각 769개 항목의 인용·링크가 확인된다. HTML은 References 뒤 번호 나열 블록까지 포함해야 모든 항목에 링크가 있다. 최초 게시본의 ‘HTML에는 모든 항목의 본문 쪽 링크가 있었다’는 설명은 뒤쪽 블록까지 포함한 집계여서 바로잡았다. 이는 인용 연결에 관한 관찰이지, 연구자의 의도나 개별 연구의 가치를 판단하는 근거가 아니다. 표시 번호도 다르므로 개별 연구를 인용할 때는 제목과 원문을 확인해야 한다. 감사 범위와 방법

마지막으로, 변경과 개선을 구분한다. 도구를 더 붙이고 기억을 늘리고 팀을 구성하면 시스템은 복잡해진다. 하지만 더 잘한다는 증거는 별도의 과제와 평가에서 나와야 한다. 이 글도 개별 시스템을 실행하거나 성능을 재현하지는 않았다.

이 서베이에서 가져갈 것은 ‘에이전트는 이 순서로 진화한다’는 공식이 아니다. 무엇을 관찰하고, 무엇을 바꾸고, 그 결과를 누가 검증하는가라는 질문이다. 그 질문에 답할 수 있을 때, 기능을 늘리는 일과 실제로 일을 더 잘 끝내는 일을 구분하기 쉬워진다.

References

  1. Wei, T.; Li, T.-W.; Liu, Z.; et al. (2026). A Survey of Agentic Reasoning for Large Language Models: Towards Recursively Self-Improving and Collective Agents. arXiv:2601.12538v2.
  2. Yao, S.; Zhao, J.; Yu, D.; et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
  3. Shinn, N.; Cassano, F.; Gopinath, A.; Narasimhan, K.; Yao, S. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366.
  4. Cai, T.; Wang, X.; Ma, T.; Chen, X.; Zhou, D. (2023). Large Language Models as Tool Makers. arXiv:2305.17126.