IC2S2 2025는 무엇을 검증했나: LLM이 '측정 도구'로 무대에 오른 해
Norrköping에서 열린 IC2S2 2025(제11회)의 공식 프로그램(구두 284·포스터 323·기조 9·튜토리얼 10)을 근거로, 전산사회과학이 LLM을 사회과학 측정 도구로 쓰되 그 통계적 타당성을 심문하는 '측정론적 전환'을 살펴봅니다.
Corpus: 제11회 IC2S2(2025-07-21–24, Norrköping, Sweden, Swedish Excellence Center for CSS + Linköping University Institute for Analytical Sociology)의 공식 프로그램을 근거로 삼았다. IC2S2는 비아카이브(non-archival) 학회라 정식 proceedings·논문 도판이 없다 — 여기서 "IC2S2 논문"은 프로그램에 오른 발표다. 프로그램 페이지가 conferia.js 클라이언트 렌더링이라, 실제 데이터 소스인 공식 일정 CSV(ic2s2_2025_schedule_v5.csv, 721행)를 내려받아 전수 파싱했다 — 기조 9 · 튜토리얼 10 · 병렬 구두발표 284건(49개 세션) · 라이트닝 15 · 포스터 323 = 발표 총 622건. 아래 발표 제목·저자는 전부 이 공식 CSV에서 나온 것이고(창작 없음), 기조·튜토리얼은 별도 페이지로 교차 확인했다. 이 글은 프로그램의 질적·양적 종합이며 발표 내용 자체의 평가가 아니다.
Abstract: IC2S2 2025의 무게중심은 "LLM이 인간을 시뮬레이션할 수 있나"라는 열광이 아니라, LLM을 사회과학 측정 도구로 쓸 때의 통계적 타당성이었다. 기조 무대가 이를 압축한다 — Lisa Argyle "Arti-'fickle' Intelligence: LLM을 사회과학 추론 도구로", Brandon Stewart "Design-Based Supervised Learning: 불완전한 LLM 주석을 하류 분석에 타당하게 쓰는 일반 틀". 튜토리얼도 "LLM Power to the People", "Bridging Human and LLM Annotations for Statistically Valid CSS"가 같은 의제를 되풀이했고, 채택 발표에서 Can Unconfident LLM Annotations Be Used for Confident Conclusions?, The Mixed Subjects Design, Validating Generative Agent-based Models 같은 제목이 한 계보를 이뤘다. 생성 에이전트·실리콘 표본은 무비판 채택이 아니라 타당화·감사 모드로 다뤄졌고, 오정보·양극화는 플랫폼 알고리즘 효과·현장 실험으로, 텍스트는 멀티모달(이미지·위성·영상)로 확장됐다. 다만 이 글은 프로그램의 종합이지 전수 계량 논문 분석이 아니며, 개별 비중 수치는 방향성 지표로 읽어야 한다.
Executive Summary
| 항목 | 설명 |
|---|---|
| 분석 질문 | IC2S2 2025 프로그램은 LLM·에이전트·데이터 분석을 어떤 문제로 다뤘는가? |
| 근거 범위 | 공식 일정 CSV(721행) 전수 파싱 — 구두 284(49세션)·포스터 323·라이트닝 15·기조 9·튜토리얼 10. 제목·저자는 CSV 그대로, 주제 비율은 키워드 매칭(방향성 지표). |
| 핵심 판정 | 지배 축은 "생성 에이전트 열광"이 아니라 "측정론적 전환" — LLM을 측정 도구로 쓸 때의 통계적 타당성(Stewart 기조 DBSL, Gligorić 주석, Broska Mixed Subjects). |
| 대표 흐름 | LLM 주석·측정 타당성, 생성 에이전트의 검증·감사, 오정보의 플랫폼 효과·현장실험, 인과·실험 등뼈, 텍스트→멀티모달, post-API의 특권 데이터·센싱·행정자료. |
| 주의할 점 | 비아카이브라 발표=논문 아님(도판 없음). 주제 비율은 키워드 매칭이라 상한이 부풀 수 있어 "약 4분의 1" 수준으로 읽을 것. |
TL;DR
- IC2S2 2025(제11회, Norrköping)는 공식 일정 CSV 전수 파싱 기준 구두 284·포스터 323·라이트닝 15·기조 9·튜토리얼 10, 총 622건 발표로 구성된 전산사회과학 학회다.
- IC2S2 2025의 지배 축은 생성 에이전트 열광이 아니라 '측정론적 전환'으로, 기조 9명 중 2명(Argyle·Stewart)이 LLM을 추론·측정 도구로 쓸 때의 통계적 타당성을 무대에 세웠고 채택 발표는 불완전한 LLM 주석의 보정·실리콘 표본의 관측치화·생성 에이전트의 타당화로 그 의제를 채웠다.
- IC2S2 2025의 이 종합은 그러나 프로그램 기반이라 발표가 출판 논문이 아니고(비아카이브), 주제별 비율은 키워드 매칭이라 상한이 부풀 수 있어 방향성 지표(예: LLM 언급 약 4분의 1)로만 읽어야 한다.
목차
- 조사 범위와 방법
- 프로그램 한눈에 — 규모와 구조
- 기조가 말하는 것: LLM이 '추론 도구'로 무대에 오르다
- 가장 뚜렷한 축 — 측정론적 전환
- 생성 에이전트·실리콘 표본은 '검증 모드'
- 오정보·양극화 — 플랫폼 효과와 현장 실험으로
- 인과·실험이라는 등뼈, 텍스트→멀티모달 확장
- 네트워크·방법·재현성, 그리고 post-API 적응
- 주의해서 읽을 점
- 결론
1. 조사 범위와 방법
IC2S2는 정식 proceedings가 없다(CFP도 "Call for Abstracts"). 그래서 "채택 논문 + arXiv 도판" 방식을 쓸 수 없고, 발표는 논문이 아니며 도판도 없다. 이 글은 프로그램 자체를 코퍼스로 삼는다. 프로그램 페이지가 클라이언트 렌더링이라, 페이지가 쓰는 공식 일정 CSV(721행)를 내려받아 전수 파싱했다 — 그래서 규모·발표 제목·저자·세션 배치는 인상비평이 아니라 실제 전수 데이터다. 근거 등급은 세 층이다: (a) 확정 — 기조·튜토리얼(각 페이지)과 CSV의 발표 제목·저자·세션; (b) 프로그램 집계 — 규모 수치(CSV 계수); (c) 방향성 지표 — 주제별 키워드 매칭 비율(광의어 때문에 상한이 부풀 수 있음).
2. 프로그램 한눈에 — 규모와 구조
제11회 IC2S2, 4일. 7/21(월) 튜토리얼 데이(오전 5·오후 5). 7/22–24(화·수·목) 본회의 — 병렬 세션 블록 6개(Parallel sessions 1–6, 총 49개 구두 세션), 라이트닝 토크 2회(수·목 오전), 포스터 3세션. 하루 두 번(오전·오후 초) 기조 페어를 배치했다. 규모(공식 CSV): 구두 284 · 포스터 323 · 라이트닝 15 · 기조 9 · 튜토리얼 10.
스폰서 구성은 2026과 대비된다: Norrköpings Kommun · Vitterhetsakademien · Metrika · YouTube · Google · Meta · Pareto · EPJ Data Science. 산업·플랫폼 스폰서(YouTube·Google·Meta)가 있었다 — 2026 Burlington이 대학·주정부 스폰서만 두었던 것과 반대다. 데이터 접근·산업 얽힘이라는 CSS의 상시 긴장이 스폰서 명단에도 드러난다.
3. 기조가 말하는 것: LLM이 '추론 도구'로 무대에 오르다
기조는 9인, 전원 제목이 공개돼 있다:
- Lisa Argyle(BYU) — "Arti-'fickle' Intelligence: Using LLMs as a Tool for Inference in the Political and Social Sciences" — LLM을 사회과학 추론 도구로.
- Brandon Stewart(Princeton) — "Design-Based Supervised Learning: A General Framework for Using LLM Annotations and Other Predicted Variables in Downstream Analyses" — 불완전한 LLM 주석을 하류 분석에 타당하게 쓰는 틀.
- Amir Goldberg(Stanford) — "The Sociology of Interpretation: A Computational Approach" — 의미·문화의 계산적 연구.
- Laura Nelson(UBC) — "Why Qualitative Research Needs Computational Social Science" — 질적 연구와 계산의 접합.
- Dean Eckles(MIT) — "Effect sizes and decisions" — 통계 방법·실험 설계.
- Duncan Watts(UPenn) — "Integrating explanation and prediction in computational social science" — 설명과 예측의 통합.
- Arnout van de Rijt(EUI) — "Luck and success in millions of life courses" — 계층·인과.
- Kathleen M. Carley(CMU) — "Computational analysis of social and organizational systems" — 사회연결망·social-cybersecurity.
- Sarah Williams(MIT) — "Urban policy and big data for public good" — 데이터 윤리·공익.
라인업의 무게중심은 뚜렷하다. 9명 중 2명(Argyle·Stewart)이 "LLM을 추론·측정 도구로 쓰는 방법"을 주제로 삼았고, 3명(Eckles·van de Rijt·Watts)이 인과·측정·설명-예측의 타당성을 되물었다. 나머지는 계산문화(Goldberg)·질적×계산(Nelson)·네트워크(Carley)·데이터 윤리(Williams)다. 이것이 이 학회의 한 줄 신호다 — 무대 중앙은 "LLM으로 무엇이든 하자"가 아니라 **"LLM을 도구로 쓸 때 무엇이 타당한가"**였다.
4. 가장 뚜렷한 축 — 측정론적 전환
프로그램의 실질 무게중심은 LLM을 사회과학 측정 도구로 쓸 때의 통계적 타당성이다. Stewart 기조(불완전한 LLM 주석의 편향 보정)와 같은 그룹의 오후 튜토리얼 "Bridging Human and LLM Annotations for Statistically Valid CSS"(Gligorić·Lee·Zrnic)가 한 축을 세우고, 채택 발표가 이를 채운다(제목·저자는 공식 CSV 그대로):
- "Can Unconfident LLM Annotations Be Used for Confident Conclusions?" — Kristina Gligorić, Tijana Zrnic, Cinoo Lee, Emmanuel Candès, Dan Jurafsky (세션 "LLMs, Annotation, Synthetic Data").
- "The Mixed Subjects Design: Treating Large Language Models as Potentially Informative Observations" — David Broska, Austin van Loon, Michael Howes (세션 "Social Prediction"). 실리콘 표본을 "관측치로 취급"하는 설계 — silicon sampling 타당성 논쟁의 한가운데.
- "Just Put a Human in the Loop? Investigating LLM-Assisted Annotation for Subjective Tasks" — Hope Schroeder, Deb Roy, Jad Kabbara (MIT). human-in-the-loop 회의론.
- "Propaganda is already influencing large language models: evidence from training data, audits, and real-world usage" — Hannah Waight, Eddie Yang, Margaret Roberts, Brandon Stewart, Joshua Tucker (세션 "LLMs & Bias").
- "Linear Representations of Political Perspective Emerge in Large Language Models" — Junsol Kim, James Evans, Aaron Schein (세션 "LLMs & Society").
이 계보가 곧 이 해의 요약이다 — 정확도 자랑이 아니라 불완전한 LLM 출력을 통계적으로 타당하게 쓰는 조건·보정이 주제다. 이는 "LLM 측정은 값싸지만 방법론적 타당성은 미성숙"이라는 CSS의 진단을 학회 무대에서 되풀이한 것이고, DSL/PPI 같은 측정오차 보정이 CSS 데이터 실무의 척추가 되는 흐름과 맞물린다.

원논문 Figure 1: CONFIDENCE-DRIVEN INFERENCE 개요 — 텍스트 코퍼스와 관심량 θ가 주어지면 (1) LLM 주석과 LLM 신뢰도를 바탕으로 소수의 인간 주석을 전략적으로 수집하고, (2) 이를 결합해 편향 없는 추정치 θ̂^conf와 유효한 신뢰구간을 산출하여 타당한 다운스트림 결론을 가능하게 한다.*

원논문 Figure 1: 조건별·군중 결정 임계값(3/5·4/5·5/5)별·LLM 제안 출처별로 본 군중 주석자 라벨과 LLM 제안 라벨 간 평균 중첩 비율(막대그래프). 제안을 보여준 조건(Suggested Text·Suggested Text+AI·Prehighlighted)에서 중첩이 Baseline보다 크게 상승한다.

원논문 Figure 3: Llama-2-7b-chat의 예측력 상위 K=32개 어텐션 헤드 활성값으로 예측한 (a) 미국 의원(ρ=0.870)과 (b) 미국 뉴스 매체(ρ=0.798)의 이념 위치 — x축은 예측된 정치 성향, y축은 검증된 이념 점수(DW-NOMINATE / Ad Fontes)이며 음수는 진보, 양수는 보수.

원논문 Figure 1: 인간·실리콘·혼합 피험자 설계의 실험 비교 — 각 설계의 데이터 구조(X, Y, f(X)), 추정량(θ̂^H·θ̂^S·θ̂^M), 그리고 타당성·정밀성·저비용 충족 여부를 체크표로 대비한 개념도.
5. 생성 에이전트·실리콘 표본은 '검증 모드'
생성 에이전트·실리콘 표본 발표는 다수 있었으나(제목 매칭 약 10건), 대표작이 무비판 채택이 아니라 타당화·감사를 표제로 걸었다:
- "Validating Generative Agent-based Models" — Indira Sen, Georg Ahnert, Markus Strohmaier, Jana Lasser (세션 "ABMs I"). GABM 타당화 자체가 발표 주제.
- "Evaluating Commonsense Knowledge in Human and Large Language Model-Simulated Populations" — Josh Nguyen, Duncan Watts, Mark Whiting (세션 "Social Prediction"). LLM-시뮬 인구의 대표성 평가.
- "Collective Moral Reasoning in Multi-Agent LLMs"(Anita Keshmirian 외) · "Gender Dynamics in a Social Network of Large Language Model Agents"(Faezeh Fadaei, Taha Yasseri) — 모두 세션 "ABMs I".
- "Persona-driven Simulation of Voting Behavior in the European Parliament with LLMs"(포스터) — Maximilian Kreutner, Marlene Lutz, Markus Strohmaier.
즉 이 시기 대표작들은 실리콘 표본을 무비판 채택하기보다 타당화·감사를 표제로 걸었다(위 나열 중 일부는 응용 발표이므로 필드 전체를 하나로 묶어 읽지는 말 것). (이 프레이밍은 이듬해 2026 프로그램에서 "Surveys & Social Science"가 두 세션으로 커지며 이어진다.)

Figure 1: 인간과 대규모 언어모델(LLM)의 상식을 측정하는 평가 설정 — 각 진술에 대해 (a) 본인 동의 여부와 (b) 남들이 동의할지를 묻고, (A) 인간 설문 응답자, (B) 설문 응답자로서의 LLM, (C) 응답자 집단을 시뮬레이션하는 LLM('실리콘 표본')의 세 관점으로 비교한다.
6. 오정보·양극화 — 플랫폼 효과와 현장 실험으로
오정보·양극화는 코어이되(구두 세션 Misinformation 1·Polarization 2로 규모 자체는 크지 않음) 프레이밍이 알고리즘 감사 + 노출 개입/현장 실험으로 성숙했다:
- "Social media algorithms can curb misinformation, but do they?" — Chhandak Bagchi, Filippo Menczer 외.
- "Limiting Exposure to Elites and Political Content on Social Media Can Reduce Polarization and Susceptibility to Misinformation" — Kokil Jaidka, Subhayan Mukerjee, Yphtach Lelkes.
- "Distracting, Reinforcing, or Debunking: Auditing Google's Reverse Image Search in Fact-Checking Visual Misinformation" — Cong Lin 외(공저 Yingdan Lu).
양극화는 전지구 비교 측정(Measuring ideological polarization across the world…, Ramaciotti Morales)과 '지각된 양극화' 모델(How opinion variation among in-groups can skew perceptions…, Steiglechner·Smaldino·Merico)로 이론화가 진전됐다.
7. 인과·실험이라는 등뼈, 텍스트→멀티모달 확장
인과·실험이 프로그램의 등뼈다. 기조 3인이 여기 정렬(Eckles·van de Rijt·Watts)하고, 채택 발표가 뒷받침한다 — "Scrubbing Language of Leakage: A Sensitivity Analysis Framework for Text-Based Causal Inference"(Adel Daoud, Richard Johansson, Connor Jerzak), "Social influence and behavioral contagion: A Reddit bot field experiment"(Hiroki Oda, Kinga Makovi, Taha Yasseri, Milena Tsvetkova), 그리고 위성이미지 인과 튜토리얼(Planetary Causal Inference).
텍스트는 멀티모달로 확장됐다 — "Image as Data"가 정식 세션으로 서고, "An Image is Worth K Topics: A Visual Structural Topic Model with Image Embeddings"(Matias Piqueras 외), "Generative Multimodal Models for Social Science: An Application with Satellite and Streetscape Imagery"(Tina Law, Elizabeth Roberto), "Evaluating Multimodal Language Models for Annotating Team Behaviors in Videos"(Evey Huang, Matthew Groh, Brian Uzzi) 같은 발표가 이미지·위성·영상을 사회 데이터로 끌어왔다.
8. 네트워크·방법·재현성, 그리고 post-API 적응
네트워크는 여전히 backbone이되 방법이 고차·부호 네트워크로 심화됐다 — "Explosive cooperation in social dilemmas on higher-order networks"(Andrea Civilini, Federico Battiston 외), 부호 네트워크 구조·커뮤니티 검출·공간 임베딩 네트워크의 비모수 지역화(Regionalization via nonparametric community detection…, Weis·Laber·Kirkley·Klein).
방법·윤리·재현성이 독립 트랙으로 가시화됐다 — 재현성 튜토리얼(A Workflow for Open Reproducible CSS, van Lissa), "Social Good & Ethics"·"Theory & Methodology" 세션, 그리고 생성AI 주석 편향 감사 연구가 나란히 편성됐다. LLM을 쓰자는 낙관과 그 편향을 감사하자는 회의가 한 프로그램에 공존했다.
post-API 시대 적응은 데이터원 선택에 드러난다 — API 제약을 특권적 협약 데이터(Facebook URL/Social Science One: Analyzing News Engagement on Facebook…, Fraxanet 외; Meta 데이터: Social Capital Around the World, Johnston·Bailey 외), 위성·GPS 이동 데이터, 행정등록 자료로 대체하는 흐름이다. "긁던 소셜미디어"에서 "특권 데이터·센싱·행정자료"로 옮겨가는 흐름이 프로그램 곳곳에 배어 있다.
9. 주의해서 읽을 점
- 발표는 논문이 아니다. 비아카이브라 여기 제목들은 프로그램에 오른 발표이지 출판된 논문·확정 결과가 아니다. 도판이 없는 이유도 이것이다.
- 규모 수치는 공식 CSV 계수(구두 284·포스터 323·라이트닝 15·세션 49)로 확정이지만, 주제별 비율은 키워드 매칭이라 상한이 부풀 수 있다 — LLM 언급 약 4분의 1, "network"도 약 4분의 1 수준으로 읽는 게 안전하다("network"는 신경망·소셜네트워크를 함께 잡는다).
- 병렬 세션의 개별 주제명 일부와 포스터 세션의 요일 배정은 클라이언트 렌더 그리드가 fetch마다 다르게 요약해, 세션 블록 6개·포스터 3세션이라는 집계만 신뢰한다.
- 개별 발표 제목·저자는 공식 CSV에서 전수 확인했으나, 세션 배치의 정확 시각·요일은 재확인 전이다.
10. 결론
IC2S2 2025의 한 줄 요약은 **"LLM이 사회과학의 측정 도구로 무대에 오른 해"**다. 기조 두 자리(Argyle·Stewart)가 "LLM을 추론 도구로 쓰는 방법과 그 타당성"을 무대에 세웠고, 채택 발표는 불완전한 주석의 보정·실리콘 표본의 관측치화·생성 에이전트의 타당화로 그 의제를 채웠다. 생성 에이전트·실리콘 표본은 열광이 아니라 검증 모드로 다뤄졌고, 오정보·양극화는 플랫폼 알고리즘 효과·현장 실험으로, 텍스트는 멀티모달로 확장됐다. 인과·실험은 등뼈로 남았고, post-API 적응은 특권 데이터·센싱·행정자료로 옮겨가는 흐름으로 나타났다. 이 측정론적 전환은 이듬해 2026 프로그램에서 "Understanding LLMs"가 자체 트랙이 되고 "Surveys & Social Science"가 두 세션으로 커지며 이어진다. 이 글은 프로그램의 종합이지 전수 계량 분석이 아니며, 여기 담긴 비율은 방향성 지표로 읽어야 한다.
References
- Broska, D., Howes, M., & van Loon, A. (2025). The mixed subjects design: Treating large language models as potentially informative observations. Sociological Methods & Research. Advance online publication. https://doi.org/10.1177/00491241251326865
- Gligorić, K., Zrnic, T., Lee, C., Candès, E. J., & Jurafsky, D. (2024). Can unconfident LLM annotations be used for confident conclusions? (arXiv:2408.15204). arXiv. https://arxiv.org/abs/2408.15204
- Kim, J., Evans, J., & Schein, A. (2025). Linear representations of political perspective emerge in large language models (arXiv:2503.02080). arXiv. https://arxiv.org/abs/2503.02080
- Nguyen, J., Watts, D., & Whiting, M. (2025). A large-scale evaluation of commonsense knowledge in humans and LLMs (arXiv:2505.10309). arXiv. https://arxiv.org/abs/2505.10309
- Schroeder, H., Roy, D., & Kabbara, J. (2025). Just put a human in the loop? Investigating LLM-assisted annotation for subjective tasks (arXiv:2507.15821). arXiv. https://arxiv.org/abs/2507.15821
- Waight, H., Yang, E., Yuan, Y., Messing, S., Roberts, M. E., Stewart, B. M., & Tucker, J. A. (2026). State media control influences large language models. Nature, 655, 685–693. https://doi.org/10.1038/s41586-026-10506-7
근거: ic2s2-2025.org(키노트·튜토리얼·스폰서·토픽) 직접 fetch + 공식 일정 CSV(ic2s2_2025_schedule_v5.csv, 721행) 전수 파싱, 2026-07-29 작성. 에이전트팀 조사(deep-research + 축별 적대적 검증, 공식 CSV·페이지 재대조)에서 30개 발표 제목이 전부 CSV에 verbatim 확인됐고, 창작된 기조·발표는 없었다. 검증에서 주제 비율(LLM 약 33%·network 약 44.7% 초안)이 재계산상 약 25%로 낮아져 "약 4분의 1"로 완화했다.