Paper Reviews
Deep multi-agent reviews of individual academic papers from Jiphyeonjeon.
- Attention-based PCA — 가우시안 토큰을 재구성하도록 학습한 단순 attention이 어떤 조건에서 첫 주성분을 찾는지 쉽게 설명합니다. 유한 프롬프트, 공유 spike, 증명상의 주의점도 함께 다룹니다.
- Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science — Stellar Colosseum은 준비도 판정, 증명 분해, 부분 풀이와 전역 검토를 나눠 긴 연구 작업을 관리한다. TCS-Bench 71%는 두 실행을 선택한 결과이며, Codeforces의 5문제 증가는 실행 probe만의 효과가 아니다.
- Verifiable Social Reasoning for LLM Assistants — Fuse는 숨은 동기를 가진 사회 시뮬레이션을 사용자가 다시 이야기하게 해 상담 모델을 시험한다. 최고 MSR 83.7은 정답률이 아니며, 합성 동기를 실제 사람의 마음이나 조언 안전성으로 확대할 수 없다.
- Cogentic: Multi-Agent Orchestration for Automated Proof Discovery — Cogentic은 여러 증명 후보를 병렬로 만들고 반박을 교차 검토하며, 다시 확인한 보조정리를 다음 탐색에 넘기는 연구용 하네스다. 다섯 수학적 성과의 조건과 자연어 비평·전문가 확인·형식 검증의 차이를 살펴본다.
- Context Language Models — CLM은 대화 기록을 늘어나는 로그가 아니라 에이전트가 고치는 다음 입력으로 다룬다. 긴 작업에서 문맥 관리·스킬 학습·강화학습과 suffix cache 절감이 어떻게 다른지, 정확도·계산량의 분모와 안전성 한계를 함께 살펴본다.
- Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion — R4T는 강화학습으로 여러 검색 방향을 발견하고, 그 결과를 작은 확산 검색기의 학습 자료로 옮긴다. 검색 묶음의 다양성·참조 커버리지와 교사 대비 학생의 품질 손실, 그리고 ‘single-pass’와 실제 샘플링 비용의 차이를 함께 살펴본다.
- Hierarchical BM25: Lexical Search at Billion-Document Scale — Hierarchical BM25는 10억 문서 전체를 훑는 대신 주제별 클러스터를 먼저 골라 검색량을 줄인다. 방문한 문서의 BM25 점수는 정확히 계산하지만, 전역 정답 순위와 10억 문서에서의 품질은 보장하지 않는다.
- GraphCert: Bootstrap Agentic Graph Reasoning with Certified Evidence Rubrics — GraphCert는 작은 모델이 그래프 질의와 답을 만들게 한 뒤, 실행 결과를 다시 확인하고 남은 의미 오류를 심사해 Solver를 학습한다. 다섯 도메인의 F1은 모두 최고였지만, 인증은 무오류 증명이 아니며 비교와 보상 절제도 함께 살펴야 한다.
- Concept-Grounded Attention: A Controlled Evaluation of Graph-Injected Attention, Temporal Versioning, and Epistemic Status — Concept-Grounded Attention은 개념 그래프를 트랜스포머 계산에 넣지만, 대조 실험에서 주의 편향은 원래 모델에도 있었고 추가 학습 이득 대부분은 엇갈린 개념으로도 나타났다. 날짜와 확인 상태를 입력에 명시한 결과는 더 분명했지만, 평가 범위는 제한적이다.
- H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases — 문서 하나의 벡터와 토큰 전부 사이에서 문맥별 구절을 만들고, 중요도에 따라 남겨 검색한다. 분할·선택·가중 상호작용의 원리부터 후보집합·벡터 예산·언어에 따른 성능과 비용의 적용 범위까지 읽는다.
- Self-Organizing Agent Teams Learn to Reason Together — 고정된 세 모델이 과거 협업 기록에서 역할·대화 단계·검토 절차를 학습한다. 정답을 만들어 내는 능력과 골라내는 능력을 구분하고, 라우팅 오라클·계산 예산 대조·demonstrability 상관의 의미를 분석한다.
- Dynamic Latent Routing — 몇 토큰마다 코드 하나를 골라 모델의 중간 표현을 바꾸면 추론에 도움이 될까? DLR의 라우팅과 공동 학습을 설명하고, 24개 QA 설정의 개선과 산술 코드 개입이 무엇을 보여 주는지 살펴본다.
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure — JEV가 판정과 라벨 확률을 이용해 추가 검토가 필요한 응답을 가려내는 방법을 설명한다. 작업별 정확도, 호스팅 요금, 동결된 이중 순서 정책의 결과와 적용 조건을 살펴본다.
- Harness-Zero: Harness Distillation via Agent-as-Harness — 외부 하네스가 대신 수행하던 검사와 작업 절차를 모델 자신의 행동으로 옮길 수 있을까. 실행 전 검토와 증류 과정을 설명하고, 도메인별 학습 결과와 행동 회복률의 의미를 살펴본다.
- Language Models Can Control Their Own Attention — 모델이 필요한 맥락을 직접 선언하면 추론 엔진은 어디까지 덜 읽을 수 있을까. Declarative Attention의 세 모드, 주의 토큰 절감과 정확도의 교환, 실측과 구분해야 할 시간 추정을 살펴본다.
- A Survey of Agentic Reasoning for Large Language Models — 에이전틱 추론을 기초 능력·자기 진화·협업으로 나누어 읽는다. 무엇을 실행 중에 바꾸고 무엇을 학습하는지, 어떤 평가가 필요한지 살펴보고, v2의 분류 경계와 PDF·HTML 서지 차이를 검토한다.
- WFM: Wiki Foundation Model for Complex Agentic Reasoning — WFM은 엔티티 관계와 원문 문단을 한 그래프에서 학습한다. 관계 인지 주의와 반복 검색의 설계를 살펴보고, 논문이 명시한 계획값·실측 구분의 불확실성과 성능표의 집계 문제를 함께 검토한다.
- RLCD: Reinforcement Learning from Contrastive Distillation for LM Alignment — RLCD는 대비되는 프롬프트로 선호쌍을 만들고 사후 채점 없이 정렬을 학습한다. 7B 시뮬레이션의 개선과 30B의 혼합 결과를 살펴보고, 출력 길이와 기준선 설정이 해석에 주는 제약을 짚는다.
- EvoOntology: A Self-Evolving Ontology Layer for Data Agents — 데이터 에이전트가 필요한 의미 정보만 찾아 쓰고 실행 기록으로 온톨로지를 고치는 과정을 수식 없이 설명한다. 세 벤치마크의 성능과 DDR 네 백본에서 측정한 토큰 사용량을 함께 읽는다.
- Better & Faster Large Language Models via Multi-token Prediction — 다중 토큰 예측은 같은 문맥에서 여러 미래 토큰을 함께 학습하고 추가 예측기를 생성 가속에도 쓰는 방법이다. 코드 실험에서 성능과 속도 개선을 보였지만 모델 크기와 학습량에 따라 이득이 달라졌다.
- Recurrent Looped Transformer — RLT는 직전 토큰에서 만든 내부 상태를 다음 토큰 계산으로 넘기는 Transformer다. 긴 순서 정보를 다루는 작은 알고리즘 과제에서 일부 강점이 있었지만, 효과는 과제와 층 배분에 따라 크게 달랐고 순차 계산 비용도 늘었다.
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — 이 서베이는 AI가 AI 개발에 쓰인다는 사실보다, 다음 개선 결정을 누가 맡고 무엇이 다음 세대로 남는지를 묻는다. 기준점 B0와 L1–L5의 다섯 수준은 성능 순위가 아니라 개선 권한의 지도이며, 진짜 재귀적 향상은 아직 검증 과제로 남아 있다.
- TTPO: Test-Time Policy Optimization — TTPO는 정답 없는 시험 문제에서 여러 풀이의 다수 답을 임시 기준으로 삼되, 동의한 풀이와 불일치한 풀이를 다르게 학습한다. 수학 추론 점수를 높였지만, 틀린 다수가 소수 정답을 벌할 위험까지 없애지는 못한다.
- InCoder-32B-Thinking: Industrial Code World Model for Thinking — InCoder-32B-Thinking은 실제 실행 오류와 수정 기록으로 추론 데이터를 만들고 실행 결과를 예측하는 모델로 그 과정을 늘린다. 코드 추론 성능은 높아졌지만, 예측 모델이 실제 툴체인을 대신해 정답을 보증하는 것은 아니다.
- CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents — CodeNib은 저장소의 문자열·의미·코드 구조를 커밋별로 따로 정리해 코딩 에이전트가 다시 찾는 일을 줄이려는 시스템이다. 검색, 위치 찾기, 갱신, 토큰 사용을 한 점수로 합치지 않고 각각의 품질 조건에서 측정한다.
- RAG vs. GraphRAG: A Systematic Evaluation and Key Insights — RAG와 여러 GraphRAG를 질의응답·요약에서 비교한 연구다. 우열은 질문 유형과 근거 표현에 따라 달라지며 입력 토큰량을 맞추면 일부 차이가 줄어 구조와 맥락 길이의 효과를 함께 봐야 한다.
- Procedural Graphs: Self-Evolving Execution Structures for LLM Agents — Procedural Graphs는 절차 그래프로 행동을 안내하고 별도 개선 단계에서 경험을 반영한 그래프 수정안을 검증한다. 여러 모델·벤치마크 조합에서 우세했지만, 안내가 행동을 강제하거나 이후 성능 향상을 보장하지는 않는다.
- Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory — AMD는 교사의 성공 경험을 전체 계획·하위 과제·함수 호출 메모리로 나눠, 작은 에이전트가 가중치 갱신 없이 활용하게 한다. 세 도구 사용 벤치마크에서 성능이 개선됐으며, 평가 과제의 교사 경험이 메모리에 포함됐는지에 따라 결과를 구분해야 한다.
- Causal Foundation Models — 다양한 인과적 데이터 생성 과정을 미리 학습해 새 관측 데이터에서 처치 효과를 추정하는 CFM을 설명하고 세 모델을 비교한 연구다. 과제별 학습 부담을 줄일 수 있지만 효과를 식별하는 가정과 사전학습 분포의 적합성은 여전히 필요하다.
- Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality — WikiProfile은 같은 사실의 문맥 속 복원, 정·역방향 질문 응답, 객관식 선택을 비교하는 행동 평가다. 일부 강한 모델도 문맥에서 복원한 사실에 안정적으로 답하지 못하며, thinking을 켜면 그중 일부가 개선된다.
- CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering — CLAUSE는 그래프 확장·경로 탐색·근거 선별을 함께 학습해 정확도와 자원 사용을 조절한다. 다만 평균 비용 제약과 질의별 보장은 구별해야 한다.
- Intent Propagation Contrastive Collaborative Filtering — IPCCF는 사용자–아이템 관계와 2-hop 구조를 교차 전파하고 의도 표현을 대조학습으로 정렬한다. 추천 성능의 개선이 의도 해석의 검증을 뜻하지는 않는다.
- Flow Reasoning Models: Turning Flows Into Efficient Recurrent Reasoners — FRM은 flow 모델의 예측을 다시 입력해 구조적 답을 반복 수정한다. Fixed-Point Forcing은 깊은 반복의 노출 편향을 줄이지만, 퍼즐 밖 일반화는 아직 검증 범위 밖이다.
- Where Reasoning Matters: Rethinking Latent Reasoning in Semantic ID-based Generative Recommendation — IBA는 시맨틱 ID의 위치별 정보이득과 관측된 정제 이득을 이용해 잠재 추론 스텝을 배분한다. 이는 정확도 자체가 아니라 손실 감소를 활용한 대리 목표다.
- A Decoder-Only Foundation Model for Time-Series Forecasting — TimesFM은 여러 시계열을 사전학습해 새 데이터셋을 zero-shot 예측하려는 decoder-only 모델이다. 집계 방식과 데이터셋별 편차를 함께 읽어야 성능 범위를 알 수 있다.
- Accelerating Scientific Research with Gemini in the Real-World — Co-Scientist는 가설·실험·원고 작성을 연결하지만, 네 평가는 자율성·비용·검증 조건이 다르다. 이 글은 신뢰성 모듈 묶음의 환각 결과와 아직 직접 재지 않은 연구 가속을 분리해 읽는다.
- WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution — WikiSkill은 실행 기록과 스킬 사이에 지속 위키를 둔다. 다섯 작업·다섯 모델의 평균 개선은 분명하지만, 작은 검증 분할과 한 모델에서만 수행한 절제가 결론의 범위를 정한다.
- ColPali: Efficient Document Retrieval with Vision Language Models — ColPali는 OCR과 청킹 대신 페이지 이미지를 다중 벡터로 색인한다. ViDoRe의 nDCG@5 차이는 크지만 빠른 색인·30ms 질의·큰 저장 공간을 함께 계산해야 실제 도입 판단이 가능하다.
- Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents — MRAgent는 대화 기억을 한 번 검색해 넣는 대신, 중간 증거에 따라 그래프를 여러 번 순회한다. 두 장기 기억 벤치마크의 향상은 유망하지만, 그래프 구조와 능동 정책의 기여는 완전히 분리되지 않았다.
- Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings — PPE는 자연어 질문에서 데이터 선택, 파운데이션 임베딩 융합, 모델 탐색까지 잇는다. 여러 지리 과제의 높은 점수는 유망하지만, 서로 다른 기준선·공간 분할·불확실성을 한 성능 주장으로 묶어선 안 된다.
- From Agent Loops to Structured Graphs: A Scheduler-Theoretic Framework for LLM Agent Execution — SGH는 LLM agent loop를 스케줄러로 읽고 정적 DAG, 계획 버전, 상태기계, 단계적 회복을 제안한다. 다만 구현·실험 없는 설계 논문이므로 성능 결과로 읽어서는 안 된다.
- LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation — LoongReflect는 긴 탐색 에이전트의 reflect·backtrack을 기억 제어 행동으로 보고 전역 관점을 가진 교사 증류와 결과 보상 학습을 결합한다. 보고된 QA 성능은 이 설정과 모델 범위에서만 해석해야 한다.
- Partial Cross Mapping Eliminates Indirect Causal Influences — PCM은 비선형 시계열에서 cross mapping이 잡아내는 인과 신호를 제3 변수의 정보로 조건화해, 간접 경로와 직접 결합을 구분하려 한다. 이는 개입 효과를 일반적으로 증명하는 방법은 아니다.
- Dynamical Causality Under Invisible Confounders — CIC는 두 시계열을 지연 임베딩 공간에서 공통·사적 성분으로 나눠 숨은 교란과 동역학적 연결을 구분하려 한다. 이는 관측 자료만으로 일반적 개입 인과를 증명한다는 뜻은 아니다.
- IC2: interventional dynamical causality under latent confounders — 관측 시계열만으로 개입 수준의 인과를 추정한다는 IC2의 주장이 정확히 무엇이며, 지연 임베딩 공간에서 교차사상 이웃으로 구성한 개입 데이터가 어디까지 개입의 대리물로 성립하는지를 검토합니다.
- SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge — SkillSmith는 과제 설명과 prefix-tuning K/V 캐시를 함께 읽어 새 prefix를 만든다. 조합 과제의 미세조정에서는 강하지만, 제로샷에서는 텍스트 전용 ICL보다 낮았다는 결과까지 함께 읽어야 한다.
- LinearRAG: Linear Graph Retrieval Augmented Generation on Large-scale Corpora — LinearRAG는 엔티티·문장·문단만 잇는 Tri-Graph로 관계 추출을 없애고, 의미 브리징과 PageRank로 문단을 찾는다. 성능과 색인 효율은 서로 다른 측정 범위에서 읽어야 한다.
- Transferable human mobility network reconstruction with neuroGravity — neuroGravity는 중력 모형의 형태를 남기고 GNN으로 보정해 희소 관측 도시의 OD 흐름을 복원한다. 미국 도시 간 zero-shot 전이는 강하지만 소득 분리와 전이 성능의 관계는 다섯 도시 관측자료의 연관으로 읽어야 한다.
- Theory-informed and interpretable graph learning for urban commuting flows — PIG-GNN은 origin·destination 역할을 분리하고 거리 감쇠와 Zipf 분포를 soft constraint로 둔다. England 통근 흐름의 정확도·분포 일치도는 높였지만, 관측자료의 scaling law와 정책 인과효과를 같은 것으로 읽을 수는 없다.
- Knowledge Graph Prompting for Multi-Document Question Answering — KGP는 문서 passage·page·table을 graph로 연결하고, LLM이 다음 근거의 설명을 생성해 이웃 node를 고른다. passage QA와 PDFTriage 구조 검색은 별도 평가 트랙이며, 12문서·30-passage 실험 범위를 대규모 전역 색인 성능으로 확대하면 안 된다.
- From RAG to Memory: Non-Parametric Continual Learning for Large Language Models — HippoRAG 2는 원문 passage와 개념 그래프를 한 검색 공간에 넣고 질문마다 관련 관계를 다시 골라 PPR로 근거를 찾는다. 단순 사실 검색을 지키면서 여러 문서의 연결을 찾으려는 비모수 기억 설계다.
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization — Microsoft GraphRAG는 문서 집합을 엔티티 그래프와 계층형 커뮤니티 보고서로 미리 요약한 뒤, 질의마다 부분 답변을 합쳐 전체 주제를 설명한다. 특정 사실 검색보다 corpus 전체의 흐름을 묻는 질문을 겨냥한다.
- CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG — CausalRAG2는 계층형 지식 그래프의 멀어진 모듈을 LLM 기반 causal gate로 잇고, 질의 뒤에는 관련 경로만 다시 고르는 RAG다. 여기서 인과는 관측 데이터에서 발견한 원인이 아니라 텍스트의 논리·사건 의존성을 가리킨다.
- LeanRAG: Knowledge-Graph-Based Generation with Semantic Aggregation and Hierarchical Retrieval — LeanRAG는 비슷한 엔티티를 상위 개념으로 집약하고 집약 개념 사이 관계까지 만들어 질문의 세부 근거에서 공통 상위 구조로 올라간다. 긴 답에 중복 문맥이 쌓이는 문제를 줄이려는 계층형 GraphRAG 설계다.
- LightRAG: Simple and Fast Retrieval-Augmented Generation — LightRAG는 문서를 엔티티·관계 그래프로 색인한 뒤, 질문의 구체 단서는 엔티티에서, 넓은 주제는 관계에서 찾는다. 커뮤니티 보고서를 크게 읽는 global GraphRAG와 달리 작은 그래프 프로파일과 원문을 조합하는 설계다.
- HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models — HippoRAG는 문서에서 뽑은 개방형 지식 그래프에 Personalized PageRank를 적용해 다중 홉 근거를 찾는다. 2WikiMultiHopQA의 큰 검색 이득은 entity 중심 과제·추출 품질·색인 비용이라는 조건과 함께 읽어야 한다.
- CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generation — CausalRAG는 질문 근처의 텍스트 그래프를 넓힌 뒤 LLM이 인과 경로를 골라 요약하는 RAG다. OpenAlex 자동평가의 높은 점수는 유망하지만 정식 인과 식별·사람 평가·비용 비교의 근거와는 구분해야 한다.
- IC2S2 2026 프로그램은 무엇을 검증하나: LLM 전환 그다음의 측정·타당성 국면 — IC2S2 2026 공식 프로그램은 LLM을 사회과학 도구로 쓰는 발표를 유지하면서도, 설문 시뮬레이션·주석·생성 에이전트의 타당성 측정과 보정에 주요 세션을 배정했다. 이 글은 발표 제목과 편성에서 읽은 동향이며 전수 논문 분석은 아니다.
- IC2S2 2025는 무엇을 검증했나: LLM이 '측정 도구'로 무대에 오른 해 — IC2S2 2025 공식 프로그램은 LLM을 사회과학의 측정·추론 도구로 다루되, 인간 주석과의 결합·실리콘 표본의 타당성·보정 문제를 중심에 놓았다. 이 글은 프로그램 기반 동향 해석이며 개별 발표의 확정된 결론을 뜻하지 않는다.
- Hypergraph Neural Networks — HGNN은 여러 노드를 한 하이퍼엣지로 묶고 노드→하이퍼엣지→노드로 특징을 전파한다. 다중 모달 3D 인식의 큰 향상은 유망하지만 하이퍼그래프 효과와 이어 붙이기와 평균하기의 차이를 분리한 실험은 아니다.
- Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration — Graph-of-Agents는 질문에 맞는 LLM 일부를 고르고, 응답의 관련도에 따라 메시지를 주고받게 한 뒤 답을 통합한다. MMLU-Pro의 근소한 점수 차이와 비용 절감은 유망하지만, 모든 과제에서 소수 에이전트가 더 낫다는 결론은 아니다.
- RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM — RAGU는 엔티티·관계 추출과 중복 통합을 나누고, 7B Meno-Lite로 그래프를 만든다. 의료 GraphRAG-Bench에서 합성형 질문의 이점은 보이지만, 추출기 성능 우위가 최종 QA 우위로 그대로 이어지지는 않는다.
- LightGCN: Simplifying and Powering Graph Convolution Network for Recommendation — LightGCN은 사용자–아이템 그래프에서 비선형 변환과 feature transformation을 빼고 이웃 집계와 층 결합만 남긴 추천 모델이다. NGCF 대비 평균 16% 상대 향상은 같은 평가 설정의 결과이며 상호작용 희소성과 오프라인 순위 지표의 조건을 함께 봐야 한다.
- Deep GraphRAG: A Balanced Approach to Hierarchical Retrieval and Adaptive Integration — Deep GraphRAG는 커뮤니티 계층을 global에서 local로 내려오며 탐색하고, 작은 지식 통합 모델을 보상 재가중으로 학습한다. NQ·HotpotQA의 EM과 DRIFT 대비 지연 감소는 강점이지만, 1.5B 근접 성능은 증류된 통합 단계에 한정된다.
- CoEvoT: Co-Evolving Chain-of-Thought Prompting for Graph–LLM Reasoning — CoEvoT는 LLM의 중간 사고를 이용해 그래프 토큰을 단계마다 갱신하고, 새 토큰으로 다음 추론을 이끄는 Graph–LLM 방식이다. 교차 데이터셋 성능은 강하지만, 링크 예측의 작은 마진과 긴 추론 시간은 함께 고려해야 한다.
- Light Graph Convolutional Collaborative Filtering With Multi-Aspect Information — LGC-ACF는 장르·감독·브랜드 같은 속성마다 사용자–속성 그래프를 만들고 LightGCN을 적용한다. 상호작용만 쓰는 기준선보다 높은 결과는 유망하지만 같은 부가정보를 쓰는 모델과의 비교가 빠져 있다.
- Is Attention Interpretable? — Serrano와 Smith는 학습된 텍스트 분류기의 attention 가중치를 지우고 출력을 다시 계산했다. 큰 가중치는 영향도를 어느 정도 예고했지만, 예측을 떠받치는 성분의 신뢰할 만한 순위는 아니었다.
- Quantum Machine Learning Models for Graphs — Sauvage와 동료들은 노드 순열을 보존하는 양자 그래프 모델의 구성 요소를 정리했다. 같은 측정 결과에서 관측값을 더 읽어 그래프 구별에 필요한 회로 깊이를 낮추고, 작은 그래프에서 학습한 파라미터가 큰 그래프의 출력 집중을 줄이는 사례를 보였다.
- A Structural Probe for Finding Syntax in Word Representations — Structural Probe는 고정된 단어 표현에 선형 사영을 학습해 의존구문 트리의 거리와 깊이를 복원한다. BERTLarge의 높은 UUAS는 표현에 구문 정보를 읽어낼 수 있음을 보이지만 모델이 트리를 명시적으로 계산한다는 증거는 아니다.
- Locating and Editing Factual Associations in GPT — ROME은 subject token을 손상·복원하는 causal tracing으로 중간층 MLP를 지목하고, 그 가중치에 rank-one 업데이트를 넣어 단일 사실을 편집한다. CounterFact의 높은 편집 점수는 정의된 반사실·단일 편집 조건의 결과다.
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning — SEED는 긴 에이전트 작업이 끝난 뒤 궤적을 자연어 hindsight skill로 정리하고, 그 skill이 지지한 기존 행동 token을 더 강하게 학습한다. ALFWorld·Search-based QA·WebShop의 GRPO 비교 개선은 이 논문의 정해진 모델·예산·환경 조건에서 읽어야 한다.
- ICLR 2026 XAI는 무엇을 믿을 수 있나: 설명 생성에서 검증과 개입으로 — ICLR 2026 본회의의 Delta-XAI와 희소 오토인코더 연구를 통해 예측 변화 설명과 해석 가능성의 실제 효용을 구분해 읽는다. 두 그림과 실험 결과는 각 논문의 근거이며 학회 전체의 연구 비중을 뜻하지 않는다.
- ICLR 2026 Agent 연구는 무엇을 검증하나: 장기 실행 시스템의 학습과 평가 — ICLR 2026 본회의에서 고른 AgentFlow와 AgentFold 등을 통해 장기 도구 사용의 학습, 문맥 관리, 실행 평가를 살핀다. 정책·상태·실행 도구를 구분하고 각 그림이 보여 주는 범위와 남는 검증 과제를 짚는다.
- ICLR 2026 GNN 연구 트렌드: 메시지 패싱 이후 확장된 연구 의제 — ICLR 2026 본회의에서 고른 그래프 학습 논문은 이웃의 라벨, 멀리 있는 정보, 모델 표현력, 그래프 입력 방식을 서로 다른 문제로 다룬다. 반례와 실험 도표를 통해 성능 주장이 성립하는 조건을 읽는다.
- A Systematic Comparison of Contextualized Word Embeddings for Lexical Semantic Change — Periti와 Tahmasebi는 8개 언어 LSC 벤치마크에서 contextualized embedding과 변화 지표를 같은 조건으로 비교했다. XL-LEXEME+APD의 높은 GCD 점수는 변화량 순위의 근거이며, 사용례 판단과 의미 군집까지 맞춘다는 뜻은 아니다.
- Survey of Computational Approaches to Lexical Semantic Change Detection — Tahmasebi 등은 통시적 의미 변화를 의미 변화와 어휘 대체로, 계산 방법을 단어 수준과 의미 구별 방식으로 나눈다. 이 서베이는 성능 순위보다 정답 데이터와 평가 설계를 먼저 살펴야 한다고 진단한다.
- Analysing Lexical Semantic Change with Contextualised Word Representations — Giulianelli 등은 BERT의 문맥별 표현을 용법 유형으로 묶고, 그 분포 변화를 세 지표로 측정한다. APD가 가장 높았다는 결과는 변화량 순위의 근거이며, 군집이 곧 사전적 의미라는 뜻은 아니다.
- Lexical Semantic Change through Large Language Models: a Survey — Periti와 Montanelli의 survey는 문맥화 의미 변화 탐지를 임베딩·집계·평가 단계와 형태·의미·앙상블 접근으로 정리한다. Table 6의 형태 기반 우세는 논문별 최선값을 모은 비교라 통제 실험의 승리로 읽으면 안 된다.
- Statistically Significant Detection of Linguistic Change — Kulkarni 등은 빈도·품사·분포 표현의 시계열에 순열 기반 변화점 검정을 붙였다. p-value는 정해진 시계열 평균이 변했을 근거이며 변화가 언어 의미 때문인지까지 판정하지는 않는다.
- Dynamic Word Embeddings — Bamler와 Mandt의 Dynamic Word Embeddings는 시기별 skip-gram을 확산 prior로 연결해 filtering과 smoothing을 수행한다. held-out 예측 우도 개선은 시간 평활화의 근거지만, 실제 의미 변화의 정답 정확도를 직접 보인 것은 아니다.
- How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings — Ethayarajh는 BERT·ELMo·GPT-2 표현의 기하를 비교해, 상위층일수록 같은 단어의 표현이 문맥에 더 따라 갈라진다고 보였다. 이 결론은 측정한 모델·층·문장 표본의 기하학적 결과다.
- Training Temporal Word Embeddings with a Compass — TWEC는 전체 코퍼스에서 얻은 고정 단어 벡터를 ‘나침반’으로 삼아, 시간 슬라이스별 문맥 벡터를 같은 좌표계에서 학습한다. 사후 정렬을 줄이는 이 설계가 언제 유용한지와 실험의 범위를 정리한다.
- Dynamic Contextualized Word Embeddings — DCWE는 BERT의 문장 문맥 앞에 시간과 사회 집단별 단어 오프셋을 둔다. 단어가 문장 안에서 무엇을 뜻하는지와 누가 언제 쓰는지를 함께 다루려는 설계와 검증 범위를 정리한다.
- Diachronic Word Embeddings Reveal Statistical Laws of Semantic Change — Hamilton 등이 시대별 단어 임베딩으로 검토한 의미 변화의 두 통계적 경향, 즉 빈도와 다의성의 관계를 방법·근거·해석 범위와 함께 쉽게 설명한다. 두 관계는 관측 자료에서 얻은 통계적 결과다.
- Structural Deep Network Embedding — SDNE는 인접행렬을 깊은 오토인코더로 복원하면서 연결된 노드를 가깝게 만드는 초기 그래프 임베딩 방법이다. 두 근접성을 함께 쓰는 이유와 결과를 읽을 때의 조건을 정리한다.
- Can Classic GNNs Be Strong Baselines for Graph-level Tasks? Simple Architectures Meet Excellence — GNN+는 GCN·GIN·GatedGCN에 여섯 가지 널리 쓰인 학습·구조 요소를 결합해 14개 그래프 벤치마크에서 강한 성능을 보였다. 결론은 Transformer가 불필요하다는 뜻보다, 비교 전에 GNN 기준선을 같은 수준으로 현대화해야 한다는 데 있다.
- Position: LLM-Based Social Simulations Require a Boundary — 이 포지션 페이퍼는 LLM 에이전트가 평균 반응은 맞춰도 인간 행동의 분산을 충분히 재현하지 못할 수 있다고 주장한다. 저자들은 시뮬레이션 결과를 인간 행동·인과의 증명으로 읽기보다, 검증 수준에 맞춘 집합적 가설 생성에 쓰자고 제안한다.
- Population-Aligned Persona Generation for LLM-based Social Simulation — PAPG는 LLM 사회시뮬레이션의 페르소나 집합을 인간 설문 응답 분포에 맞추려는 방법이다. 재표집과 최적수송으로 분포 오차를 낮췄지만 그 결과는 특정 설문과 LLM 응답 공간에서의 정렬이며 실제 인간 행동이나 인과를 증명하지는 않는다.
- Dynamic Word Embeddings for Evolving Semantic Discovery — DW2V는 연도별 단어 벡터를 따로 학습한 뒤 맞추는 대신, 모든 시점의 PPMI 행렬을 함께 분해하고 인접 시점을 부드럽게 연결한다. 희소한 자료에서 강하지만, 높은 검색 점수는 의미 변화의 정답을 직접 입증하지 않는다.
- Dynamic Embeddings for Language Evolution — Dynamic Bernoulli Embeddings는 단어 벡터를 시간별로 움직이게 하고 Gaussian random walk로 인접 시점을 연결한다. held-out 예측은 여섯 조건에서 좋아졌지만, 벡터 궤적은 의미 변화의 확정 판정이 아니라 사전분포와 자료가 함께 만든 추정치다.
- Heterogeneous Graph Attention Network — HAN은 meta-path 안의 이웃과 meta-path 사이의 중요도를 두 단계 attention으로 결합한다. 성능표와 attention 가중치는 사람이 정한 meta-path와 평가 조건 안에서 읽어야 한다.
- Heterogeneous Graph Neural Network — HetGNN은 restart random walk로 타입별 이웃을 뽑고, 콘텐츠 인코더와 타입 간 attention을 결합한다. 결과는 시간 분할과 고정된 이웃 표본 크기 조건에서 해석해야 한다.
- DeepWalk: Online Learning of Social Representations — DeepWalk은 짧은 random walk를 단어열처럼 다루어 노드 임베딩을 학습한다. 희소 라벨 분류의 F1 개선은 당시 데이터·분할·선형 분류기 조건의 결과다.
- Graph Attention Networks — GAT은 이웃 특징에 masked self-attention을 적용해 노드별 가중합을 만든다. 벤치마크의 정확도 향상은 주어진 라벨 분할과 attention 가중치의 예측적 유용성을 보여 줄 뿐 설명의 진실성을 보장하지 않는다.
- How Powerful are Graph Neural Networks? — GIN은 sum과 MLP로 이웃 다중집합을 보존해 1-WL과 같은 구별력에 도달하는 충분조건을 보인다. 이론적 표현력은 테스트 정확도나 일반화를 보장하지 않는다.
- Inductive Representation Learning on Large Graphs — GraphSAGE는 노드별 벡터표를 외우는 대신 특징과 이웃에서 표현을 계산하는 함수를 배운다. 새 노드·새 그래프에 적용되는 조건, 표집의 이득과 한계를 살핀다.
- Semi-Supervised Classification with Graph Convolutional Networks — GCN은 인접한 문서의 feature를 섞어 일부 라벨만으로 노드를 분류한다. 라벨 접근과 edge 접근을 구분해 transductive 결과를 읽는 법을 설명한다.
- GNNExplainer: Generating Explanations for Graph Neural Networks — GNNExplainer는 이미 학습된 GNN의 예측을 최대한 유지하는 작은 부분그래프와 feature mask를 찾는다. 그 mask가 인과적 원인이라는 뜻은 아니다.
- Explaining Temporal Graph Neural Networks via Feature-induced Information Flow — Temporal GNN의 사건 관련도를 모델 내부의 특징 정보 흐름으로 추적한다. Infection·Attacker·ICEWS18의 서로 다른 예측 과제와 평가 지표를 구분해 읽는다.
- SkillOpt: Executive Strategy for Self-Evolving Agent Skills — SkillOpt는 모델 가중치를 고정하고 외부 스킬 문서를 검증 점수로 갱신한다. 두 단계의 채택 관문과 기각 기록이 작동하려면 자동 평가 가능한 과제가 필요하다.