Dynamic Word Embeddings for Evolving Semantic Discovery

단어 뜻의 변화는 정렬 뒤가 아니라 학습 중에 잇는다

DW2V는 연도별 단어 벡터를 따로 학습한 뒤 맞추는 대신, 모든 시점의 PPMI 행렬을 함께 분해하고 인접 시점을 부드럽게 연결한다. 희소한 자료에서 강하지만, 높은 검색 점수는 의미 변화의 정답을 직접 입증하지 않는다.

Jiphyeonjeon Team2026-09-225 min read쉬운 읽기상세 읽기
DynamicWordEmbeddingsWord2VecSemanticChangeMatrixFactorizationPaperReview

Paper: Zijun Yao; Yifan Sun; Weicong Ding; Nikhil Rao; Hui Xiong (2018). "Dynamic Word Embeddings for Evolving Semantic Discovery." Proceedings of the Eleventh ACM International Conference on Web Search and Data Mining (WSDM 2018), 673–681; arXiv:1703.00607. PDF · DOI

1. 시대별 word2vec을 나란히 놓기 어려운 이유

단어 임베딩은 비슷한 문맥에서 쓰인 단어를 가까운 벡터에 둔다. 하지만 1990년과 2010년의 임베딩을 각각 학습하면, 두 공간은 같은 모양이어도 임의로 회전할 수 있다. 그래서 한 시점의 apple과 다른 시점의 apple 사이 거리를 바로 비교할 수 없다. 이를 정렬 문제라고 한다. 기존 방식은 시점마다 벡터를 학습하고 Procrustes 같은 사후 정렬로 좌표를 맞췄다.

DW2V는 처음부터 모든 시점을 한 목적함수에 넣는다. 정렬을 나중에 고치지 않는다. 같은 단어의 이웃이 시간에 따라 변할 수 있도록 허용하되, 바로 다음 시점으로 갑자기 멀리 뛰면 벌점을 준다. 따라서 희소한 한 해의 통계는 가까운 해의 정보를 빌리고, 시간축 전체가 하나의 좌표계 안에서 학습된다.

브랜드·인물 단어의 시간 궤적

그림 1. arXiv:1703.00607v2 PDF p. 4의 Figure 1 원도판을 인용했다. apple, amazon, obama, trump 등의 시점별 궤적을 예시로 보인다. 시각화는 모델이 만든 좌표의 투영이므로, 역사적 의미 변화의 독립 정답 판정은 아니다.

2. 방법: PPMI를 맞추고, 시간 차이에는 벌점을 준다

논문은 해마다 만든 PPMI(단어와 문맥이 우연보다 얼마나 자주 함께 나왔는지를 나타내는 행렬)를 저차원 벡터로 분해한다. 목적함수에는 세 항이 있다(§2, Eq. 5). 첫째, 각 해의 PPMI를 잘 재구성하는 항. 둘째, 벡터 크기가 과도해지지 않게 하는 정칙화. 셋째, 같은 단어의 인접 연도 벡터 차이를 작게 만드는 시간 평활화다. 마지막 항의 세기가 크면 궤적은 더 매끄럽지만 급변도 눌릴 수 있다.

최적화는 모든 연도의 벡터를 한꺼번에 거대한 행렬로 뒤집는 방식이 아니다. 비대칭 완화로 문제를 나눈 뒤, 한 블록을 고정하고 다른 블록을 릿지 회귀의 닫힌 해로 갱신하는 block coordinate descent를 쓴다(§3, Eqs. 8–11). 그래서 ‘공동 학습’이면서도 긴 시간열을 다룰 수 있다. 공동 목적함수로 시점 사이의 상대적 정렬을 맞춰 별도 사후 정렬을 피한 것이 핵심이다. 특별한 새 단어 의미 규칙을 제안한 것은 아니다. 모든 시점에 같은 직교 회전을 적용하는 자유도는 남지만, 시점 간 비교에는 영향을 주지 않는다.

벡터 크기(norm)와 빈도의 변화 예시

그림 2. arXiv:1703.00607v2 PDF p. 6의 Figure 2 원도판을 인용했다. 대통령 관련 질의에서 단어 벡터의 norm과 상대 빈도가 시간에 따라 변하는 예를 보인다. 빈도 변화와 벡터 변화는 관련되지만 서로 같은 측정값은 아니다.

3. 무엇을 평가했나

저자들은 1990–2016년 New York Times 코퍼스를 쓴다(§4). 평가는 세 갈래다. 뉴스 섹션 라벨로 단어 군집을 맞히는 군집화(Tables 4–5), 시간에 따른 등가어를 찾는 질의(Tables 6–7), 그리고 특정 연도의 공기 데이터를 희소하게 만든 강건성 실험(Table 8)이다. 세 종류의 정답은 모두 이 연구가 구성하거나 같은 코퍼스에서 가져온 기준이다. 따라서 외부 언어학자가 주석한 의미 변화 벤치마크와는 다르다.

가장 선명한 보고는 희소성 실험이다. 1991–2015년의 3년 간격 연도에서 공기 데이터를 0.1%만 남긴 Testset 1 실험에서 DW2V의 MRR은 0.4427, 정렬 기반 AW2V는 0.0362였다(Table 8). MRR은 정답 등가어의 순위 역수를 평균한 값이다. 약 12배 차이는 시간 평활화가 데이터가 적은 시점에 도움이 된다는 직접 근거다. 반면 이것은 결손 상황에서 같은 연구의 등가어 질의를 더 잘 푼 결과이지, 모든 역사 코퍼스에서 실제 의미 변화를 12배 정확히 찾는다는 뜻은 아니다.

사건 관련 단어의 norm과 빈도 변화

그림 3. arXiv:1703.00607v2 PDF p. 6의 Figure 3 원도판을 인용했다. 사건 관련 단어의 벡터 norm과 상대 빈도를 비교한다. 시각화는 변화 후보를 찾는 탐색 도구이며, 변화 원인이나 변화 시점을 인과적으로 판정하지 않는다.

4. 성과를 읽는 올바른 단위

Tables 4–7에서 DW2V는 보고한 군집화·등가어 조건에서 1위다. 다만 Testset 1에서는 시간을 무시한 정적 word2vec이 2위라는 점도 함께 남는다. 시간 정보를 넣는 일이 모든 질의에 같은 이득을 주는 것은 아니다. 그리드 탐색 선택 기준, 반복 시드에 따른 변동, 통계 검정도 충분히 제시되지 않아 근소한 차이의 안정성을 이 표만으로 확정할 수 없다.

5. 평활화가 주는 것과 가리는 것

관측이 거의 없는 시점의 벡터는 실제 그 해의 용례만으로 정해지지 않는다. 인접 연도의 벡터와 평활화 계수가 강하게 개입한다. 노이즈를 줄이는 장점이 있지만 전쟁·기술 등장처럼 급격한 변화를 여러 해에 걸쳐 번지게 할 수 있다. 또 뉴스에서 자주 등장한 사건·인물의 변화는 코퍼스 구성 변화일 수도 있다.

그래서 DW2V는 역사적 언어 변화를 발견할 후보를 제시하는 도구로 쓰기에 좋다. 후보 단어의 실제 문장, 시기별 표본 수, 독립 주석을 추가로 확인할 때 비로소 ‘의미가 바뀌었다’는 해석이 강해진다. 벡터 궤적만으로 사람들의 개념 변화나 사회 사건의 원인을 증명할 수는 없다.

심층 보기

References

Yao, Z., Sun, Y., Ding, W., Rao, N., & Xiong, H. (2018). Dynamic word embeddings for evolving semantic discovery. Proceedings of the Eleventh ACM International Conference on Web Search and Data Mining (WSDM 2018), 673–681. https://doi.org/10.1145/3159652.3159703