Dynamic Embeddings for Language Evolution

희소한 시대의 단어 뜻을 이웃 시점에서 빌려오는 법

Dynamic Bernoulli Embeddings는 단어 벡터를 시간별로 움직이게 하고 Gaussian random walk로 인접 시점을 연결한다. held-out 예측은 여섯 조건에서 좋아졌지만, 벡터 궤적은 의미 변화의 확정 판정이 아니라 사전분포와 자료가 함께 만든 추정치다.

Jiphyeonjeon Team2026-09-235 min read쉬운 읽기상세 읽기
DynamicEmbeddingsWordEmbeddingsLanguageEvolutionBernoulliEmbeddingsPaperReview

Paper: Maja Rudolph; David Blei (2018). "Dynamic Embeddings for Language Evolution." Proceedings of the 2018 World Wide Web Conference, 1003–1011; arXiv:1703.08052. PDF · DOI

1. 한 단어에 벡터 하나만 두면 시간이 사라진다

출판본 제목은 「Dynamic Embeddings for Language Evolution」이다. 아래 방법·수치·그림은 제목이 「Dynamic Bernoulli Embeddings for Language Evolution」인 2017년 arXiv v1을 기준으로 설명한다.

한 코퍼스에서 정적 임베딩을 학습하면 같은 단어의 시대별 용법을 벡터 하나로 압축한다. 논문은 intelligence를 상원 연설과 ACM 초록에서 각각 분석하며, 두 코퍼스를 하나로 합친 모델은 아니다. Rudolph와 Blei는 이 문제를 시간 슬라이스별 벡터로 푼다. 그러나 연도별로 독립 학습하면 두 문제가 생긴다. 어떤 해는 자료가 너무 적고, 각 해의 벡터 공간은 따로 회전해 사후 정렬이 필요하다.

논문은 dynamic Bernoulli embedding으로 이 문제를 푼다. 단어의 임베딩 벡터 ρ만 시간에 따라 움직이게 하고, 문맥 벡터 α는 모든 시점이 공유하게 둔다. 그래서 서로 다른 시점의 ρ는 처음부터 같은 문맥 좌표계에서 학습된다. 이것이 별도 정렬을 피하는 구조적 이유다.

intelligence의 시대별 이웃 변화

그림 1. arXiv:1703.08052v1 PDF p. 2의 Figure 1 원도판을 인용했다. intelligence의 이웃이 코퍼스와 시점에 따라 달라지는 예다. 이웃 목록은 모델의 정성적 분석 결과이며, 단어 의미의 정답 주석이나 변화 원인 검증은 아니다.

2. 핵심 가정은 ‘어제의 벡터와 오늘의 벡터는 대체로 가깝다’이다

시간 (t)의 단어 벡터는 바로 앞 시점 벡터 주변의 Gaussian 분포에서 온다고 둔다: ρᵗ ~ N(ρᵗ⁻¹, λ⁻¹I)(Eq. 5). 이를 random walk prior라고 한다. λ가 클수록 큰 이동은 더 강하게 벌점을 받는다. 관측 단어와 문맥의 Bernoulli 조건부 확률, 이 prior를 합친 pseudo MAP 목적함수를 최대화한다(Eq. 6). 비용이 큰 ‘관측되지 않은 모든 단어’ 항은 unigram의 0.75제곱 분포에서 뽑는 negative sampling으로 근사한다(Eq. 7).

시간 동적 임베딩의 그래피컬 모델

그림 2. arXiv:1703.08052v1 PDF p. 3의 Figure 2 원도판을 인용했다. 위의 ρ 벡터는 시간 사슬을 따라 움직이고, 아래의 α 문맥 벡터는 전 시점이 공유한다. 공유 좌표계는 정렬에는 유리하지만 문맥 자체의 시간 변화는 직접 모델링하지 않는다.

쉽게 말하면, 1910년에 드문 단어가 나왔을 때 1908년과 1912년의 사용례가 추정을 도와준다. 이는 희소 자료의 잡음을 줄이지만, 실제로 1910년에 그 단어가 어떻게 쓰였는지 독립적으로 많이 보았다는 뜻은 아니다. 특히 관측이 없는 시점의 벡터는 prior가 만든 보간에 가깝다.

3. 예측력은 여섯 조건에서 좋아졌다

저자들은 Arxiv ML(2007–2015), ACM 초록(1951–2014), 미국 상원 연설(1858–2009)을 사용한다(Table 1). 각 코퍼스에서 문맥 창 2와 8을 두고 전체 기간을 하나로 학습한 정적 모델(s-emb), 시점별 독립 모델(t-emb), 동적 모델(d-emb)을 비교한다. 평가는 held-out 위치의 관측 단어 항인 log-likelihood ℒ_pos다. 이는 보류한 위치의 관측 단어를 그 문맥에 조건화한 양의 항이다. 전체 코퍼스의 정규화된 가능도나 미래 시점을 예측하는 지표는 아니며, 의미 변화의 인간 정답을 맞히는 측정은 아니다.

Table 2에서 d-emb는 여섯 조건 모두 가장 높은 ℒ_pos를 보고한다. 예를 들어 Arxiv ML·문맥 2에서 d-emb는 −2.535±0.001, 정적 모델은 −2.706±0.002, 독립 시점 모델은 −2.646±0.002다. 반대로 ACM·문맥 8에서는 d-emb −2.228±0.001과 정적 모델 −2.231±0.001의 간격이 매우 작다. 시간 연결의 이득은 데이터 양과 문맥 설정에 따라 크기가 다르며, ±가 반복 표준편차인지 표준오차인지는 논문이 정의하지 않는다.

iraq의 궤적과 시점별 이웃

그림 3. arXiv:1703.08052v1 PDF p. 6의 Figure 3 원도판을 인용했다. iraq의 PCA 투영과 이웃을 보인다. 투영과 이웃은 주변 단어 전체의 변화에도 영향을 받으며, 그림만으로 특정 정치 사건이 의미 변화를 일으켰다고 결론 낼 수는 없다.

4. 정성 사례는 무엇을 보여 주나

Table 3은 computer가 계산 직업 관련 이웃에서 software·hardware 쪽으로 이동하는 모습을, values가 화폐 가치에서 도덕적 가치 쪽으로 이동하는 모습을 제시한다. iraq는 상원 코퍼스에서 드리프트 1위 3.09이며(Table 4), 이웃이 국가명·전쟁·테러 관련어로 옮는다고 논문은 설명한다(Fig. 3). 이런 사례는 숫자 하나로는 놓치기 쉬운 변화 후보를 읽게 해 준다.

다만 Appendix C에 따르면 iraq는 76개 슬라이스 중 64개에 관측이 없고, 그 시점의 임베딩은 앞뒤 벡터의 평균으로 채워진다. 대표 그림의 초반 궤적 일부는 자료가 직접 지지한 추정이라기보다 시간 prior가 역방향으로 전달한 보간일 수 있다. 이 점은 실패를 뜻하지 않는다. 모델의 작동 방식이다. 다만 탐색 결과를 사료 분석의 결론으로 승격할 때 반드시 표시해야 할 조건이다.

5. 이 모델을 쓸 때의 해석 규칙

동적 임베딩은 한 모델 안에서 희소한 시대 자료와 시간 정렬 문제를 처리한다. 하지만 좋은 held-out likelihood는 공기 통계를 잘 평활했다는 증거일 뿐, 추정된 이동이 실제 의미 변화와 정확히 일치한다는 증거는 아니다. 변화 후보마다 원문 용례, 시점별 빈도, 독립 언어학 주석을 확인해야 한다. 또한 모델 안의 관계는 단어 사용의 연관이며, 사회 사건이나 사람의 신념 변화에 대한 인과 증명은 아니다.

심층 보기

References

Rudolph, M., & Blei, D. (2018). Dynamic embeddings for language evolution. Proceedings of the 2018 World Wide Web Conference, 1003–1011. https://doi.org/10.1145/3178876.3185999

Rudolph, M., & Blei, D. (2017). Dynamic Bernoulli embeddings for language evolution (arXiv:1703.08052v1). arXiv. https://arxiv.org/abs/1703.08052v1