Heterogeneous Graph Attention Network

HAN은 meta-path 안의 이웃과 meta-path 사이의 중요도를 두 단계 attention으로 결합한다. 성능표와 attention 가중치는 사람이 정한 meta-path와 평가 조건 안에서 읽어야 한다.

Jiphyeonjeon Team2026-09-225 min read쉬운 읽기상세 읽기
HANHeterogeneousGraphGraphAttentionGraphNeuralNetworksPaperReview

Paper: Xiao Wang; Houye Ji; Chuan Shi; Bai Wang; Peng Cui; Philip S. Yu; Yanfang Ye (2019). "Heterogeneous Graph Attention Network". The World Wide Web Conference (WWW '19), 2022–2032. arXiv:1903.07293 PDF.

한눈에 보기

인용 그래프에는 논문, 저자, 학회처럼 서로 다른 종류의 노드와 관계가 함께 있다. 이런 이종 그래프에서는 같은 이웃이라도 무엇을 통해 연결되었는지가 중요하다. HAN(Heterogeneous Graph Attention Network)은 이 문제를 두 번의 선택으로 나눈다. 먼저 특정 meta-path로 연결된 이웃 가운데 어떤 노드의 정보를 더 반영할지 고르고, 다음으로 여러 meta-path 가운데 어느 관계 의미를 더 비중 있게 합칠지 고른다.

여기서 meta-path는 개별 경로가 아니라 타입 수준의 관계 문법이다. 영화–배우–영화(MAM)는 ‘같은 배우가 나온 영화’, 영화–감독–영화(MDM)는 ‘같은 감독의 영화’라는 서로 다른 관점을 만든다. HAN은 그 관점들을 한 모델 안에 넣고, 관점 안과 관점 사이에 각각 attention을 둔다.

1. 무엇이 어려운가

동종 그래프용 GCN이나 GAT를 그대로 쓰면 타입이 다른 노드의 특징 공간과 관계의 의미를 충분히 구분하기 어렵다. 반대로 meta-path 기반 임베딩은 여러 경로를 만들 수 있지만, 어떤 경로 조합이 과제에 맞는지는 보통 사람이 정하거나 탐색해야 했다. HAN은 “이웃의 중요도”와 “관계 의미의 중요도”를 모두 학습 대상으로 삼는다.

다만 입력을 먼저 봐야 한다. 논문의 Algorithm 1은 meta-path 집합을 모델의 입력으로 둔다. HAN이 새로운 의미 관계를 자동으로 발견하는 것이 아니라, 사람이 제공한 후보 MAM·MDM·APCPA 등의 상대적 가중치를 학습하는 구조다.

HAN의 이종 그래프와 meta-path

그림 1. Wang et al. (2019), Figure 1, arXiv:1903.07293 PDF p. 2의 원도판. IMDB의 노드 타입과 MAM·MDM meta-path를 보인다. 경로의 중간 노드가 최종 이웃 표현에 그대로 남는다는 뜻은 아니다.

2. 모델은 어떻게 계산하는가

모델은 두 단계로 계산한다. 먼저 저자·논문·영화처럼 타입에 따라 크기와 뜻이 다른 노드 특징을 각각 변환해 공통 공간에 놓는다. 하나의 meta-path를 정하면, 그 경로로 연결된 이웃마다 대상 노드와의 특징 조합을 보고 점수를 매긴다. 대상 노드의 이웃 안에서 점수를 정규화하고, 높은 점수를 받은 이웃의 특징을 더 많이 반영한다. 여러 attention head를 사용해 이 과정을 반복한 표현이 해당 meta-path에 대한 노드 표현이다. 이 이웃 가중치는 대상 노드와 이웃에 따라 달라진다.

다음에는 meta-path마다 만들어진 표현을 합친다. 모델은 각 경로의 점수를 모든 노드에 걸쳐 평균하고, 경로 점수들을 정규화한다. 이 결과인 경로별 비중 β는 그래프 전체에서 공유되는 하나의 스칼라다. 한 영화에는 배우 관계를, 다른 영화에는 감독 관계를 각각 독립적으로 더 높여 주는 노드별 경로 비중이 아니다. 경로 안의 이웃 가중치와 경로 사이의 전역 비중을 구별해야 HAN의 동작을 정확히 읽을 수 있다.

HAN의 두 단계 집계

그림 2. Wang et al. (2019), Figure 3, PDF p. 5의 원도판. 위쪽은 meta-path 안의 node-level attention, 아래쪽은 meta-path 간 semantic-level 가중합이다. 두 가중치가 원인이나 사람의 설명을 증명하는 값은 아니다.

3. 작은 예로 읽기

어떤 영화의 장르를 예측한다고 하자. MAM 아래에서는 같은 배우가 등장한 영화들이 이웃이고, MDM 아래에서는 같은 감독의 영화들이 이웃이다. node-level attention은 MAM 이웃 중 어느 영화가 현재 영화와 더 관련 있는지 조정한다. semantic-level attention은 ‘이 데이터와 이 분류 과제에서는 배우 연결과 감독 연결 중 어느 쪽이 더 유용한가’를 한 비율로 합친다. HAN의 attention은 예측에 쓰인 학습 가중치다. “이 배우가 이 장르의 원인이다”라는 인과 설명이나 개별 사용자의 설명으로 번역하면 안 된다.

4. 저자가 보고한 결과

세 데이터셋(DBLP·ACM·IMDB)에서 노드 분류와 군집화를 평가했다. 분류 절에서 저자는 학습된 표현에 5-최근접 이웃 분류기를 적용하고 10회 반복 평균을 보고한다. ACM의 Table 3에서 “Training 20%” 행의 Macro-F1은 HAN 89.40%, GCN 86.81%이고, “Training 80%” 행은 90.63% 대 88.29%다. 이 비율은 표에 표시된 분류 평가 조건이다. HAN 자체도 라벨이 붙은 노드의 교차 엔트로피로 학습하지만, 논문은 이 행들을 HAN의 학습 라벨 수만 독립적으로 바꾼 개입 실험으로 충분히 규정하지 않는다. 따라서 수치 차이를 라벨 예산만의 효과로 읽기 어렵다.

군집화에서는 ACM의 NMI가 HAN 61.56, GAT 57.29였으며, DBLP에서 HAN은 79.12였다(Table 4). 군집은 학습된 표현을 KMeans로 묶어 평가한다. 분류 정확도와 군집 NMI는 서로 다른 과제의 척도이므로 한 숫자로 합쳐 우열을 판단할 수 없다. 두 결과는 지정된 그래프와 meta-path 후보 안에서 HAN 표현이 유용했다는 증거다.

비교 조건도 함께 읽어야 한다. metapath2vec·HERec·GCN·GAT에는 시험한 meta-path 가운데 최고 성능을 보고했고, ESim에는 HAN이 학습한 경로 가중치를 사용했다. HAN은 주어진 meta-path 집합을 함께 사용했다. 따라서 표의 차이는 attention 설계만의 순수한 효과로 단정할 수 없다. 논문도 DBLP에서는 APCPA 한 경로가 특히 중요해 HAN의 이득이 ACM·IMDB보다 작다고 설명한다.

5. 적용 조건과 한계

HAN은 관계 타입이 분명하고, 도메인 지식으로 유의미한 meta-path 후보를 만들 수 있으며, 하나의 과제에서 전역 경로 중요도로 충분할 때 잘 맞는다. 반대로 노드마다 중요한 관계가 크게 다르거나 긴 경로의 중간 타입 정보를 보존해야 하면 이 설계만으로는 부족할 수 있다. 또한 논문의 inductive 적용 가능성은 구조적 주장이고, 이 논문의 실험은 세 그래프의 semi-supervised 분류·군집화에 집중한다.

성능 개선은 사람에게 설명 가능한 meta-path를 골랐다는 증거도, attention이 충실한 설명이라는 증거도 아니다. 그런 목적으로 쓸 때에는 경로 후보의 민감도, 노드별 가중치의 안정성, 사람이 검증할 수 있는 외부 기준을 별도로 평가해야 한다.

더 긴 수식·표 분석은 심화 보기에서 확인할 수 있다.

References

Wang, X., Ji, H., Shi, C., Wang, B., Cui, P., Yu, P. S., & Ye, Y. (2019). Heterogeneous graph attention network. Proceedings of The World Wide Web Conference, 2022–2032. https://doi.org/10.1145/3308558.3313562