Residual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders
마지막 아이템은 왜 자꾸 다시 추천될까요? Residual Dominance 쉽게 읽기
SASRec의 마지막 위치 readout과 residual 경로가 최근 아이템 의존을 어떻게 표현하는지 살펴봅니다. 아홉 데이터셋의 norm 분해, 순위 진단, 고정 가중치 residual scaling, 조건부 회복과 validation 제약을 구분합니다.
Paper: Keito Kozaki; Keigo Sakurai; Ren Togo; Takahiro Ogawa; Miki Haseyama (2026). "Residual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders". Hokkaido University. arXiv:2608.14021v1 PDF · arXiv 서지 정보 · 출판 DOI. 2026년 8월 14일 공개된 10쪽 v1 PDF를 기준으로 합니다.
최근 행동은 다음 행동을 알려 주는 단서일 수 있습니다. 이 논문은 학습된 추천 모델에서 마지막 아이템이 예측에 두드러지는 구조를 분석합니다.
한눈에 보기
| 질문 | 논문이 보여 주는 내용 |
|---|---|
| 왜 마지막 아이템이 두드러지나요? | Attention 출력에 같은 위치의 입력을 더하는 residual이 여러 위치의 자기 상태를 보존하고, SASRec은 마지막 위치만 읽어 예측합니다. |
| residual을 약하게 하면 좋아지나요? | Contextual mixing은 커지지만, 마지막 아이템 재등장률과 전체 HR@10·NDCG@10은 내려갑니다. |
| 앞선 위치의 신호는 쓸모가 있나요? | 최종 정답을 이미 맞힌 앞선 위치가 있는 일부 final miss는 낮은 residual 강도에서 회복됩니다. 이 조건부 결과는 전체 정확도 상승과 같지 않습니다. |
1. 마지막 위치만 읽는 SASRec
SASRec은 사용자의 아이템 이력을 순서대로 처리해 다음 아이템을 예측하는 모델입니다. Causal self-attention은 각 위치가 자기보다 뒤의 위치를 보지 않도록 mask를 씁니다. 여기서 causal은 미래 입력을 가린다는 뜻이지, 원인과 결과를 식별하는 인과 추론이라는 뜻은 아닙니다.
Attention은 참조한 위치들의 값을 가중합해 출력 벡터를 만듭니다. Residual connection은 그 출력에 같은 위치의 입력 벡터를 더하는 경로입니다. 여러 단계가 끝나면 SASRec의 readout은 마지막 위치 L의 표현으로 전체 아이템을 점수화합니다. 따라서 여러 위치가 자기 상태를 보존하는 구조와 마지막 위치 하나를 예측에 읽는 방식이 함께 작동합니다.
논문은 residual이 위치별 자기 성분을 보존하는 경향을 residual dominance라고 부릅니다.
2. 무엇을 맞히고 무엇을 세나요?
논문은 Beauty, Sports, Video, Diginetica, Toys, Steam, BeerAdvocate, ML-1M, Zvuk의 아홉 데이터셋을 사용합니다. 사용자와 아이템 각각에 상호작용이 최소 5개 남도록 5-core 필터링을 하고, 연속해서 반복된 아이템을 제거합니다. 시간순 분할인 Global Time Split으로 학습과 validation은 전체의 90%, test는 나머지 10%에 둡니다.
표준 추천 평가는 전체 아이템 목록에서 정답 순위를 매기는 full-catalog ranking입니다. HR@10은 실제 다음 아이템이 상위 10개에 들었는지 세고, NDCG@10은 정답이 더 높은 순위에 올수록 더 크게 계산합니다. 추천 목록에서 과거에 본 아이템을 빼는 filter-seen은 적용하되, 반복 소비가 특징인 Diginetica와 Zvuk에서는 적용하지 않습니다.
HRLI@K는 실제 다음 정답이 아니라 입력의 마지막 아이템이 추천 상위 K개 안에 다시 등장하는 비율입니다. 논문은 HRLI@1, 즉 그 아이템이 1위인지 주로 봅니다. 끝에서 두 번째 입력 아이템의 재등장은 HRL2I로 측정합니다. HRLI·HRL2I는 검사 대상 아이템을 목록에서 지우지 않도록 모든 데이터에서 filter-seen 없이 계산합니다. 따라서 HRLI를 실제 다음 아이템 적중률로 읽으면 안 됩니다.
Mixing ratio는 attention block 표현의 위치별 norm 기여 중 다른 위치에서 온 몫을 나타내는 지표입니다. 논문은 attention 출력만 볼 때와 residual, layer normalization까지 적용한 뒤를 비교합니다. 본문과 보충문서의 mixing ratio 식은 다르게 정의되어 있습니다. Layer normalization의 bias β는 mixing ratio 계산에서 제외됩니다. 두 식과 아홉 데이터의 상세 표는 상세 읽기에 정리되어 있습니다.
3. 순서를 섞으면 마지막 위치의 역할이 드러납니다
저자들은 입력 순서를 두 방식으로 섞습니다. Partial shuffle은 마지막 아이템은 마지막 자리에 그대로 두고 앞의 아이템만 섞습니다. 과거 아이템을 없애지 않습니다. Full shuffle은 마지막 아이템까지 포함해 모든 위치를 섞습니다.
희소 데이터에서는 마지막 아이템을 고정한 partial shuffle보다 full shuffle에서 성능이 더 크게 떨어졌습니다. ML-1M처럼 밀도가 높은 데이터에서는 partial shuffle도 성능에 영향을 주지만, full shuffle의 하락이 더 컸습니다. Steam과 Diginetica에서는 두 shuffle의 차이가 작았습니다. 따라서 결과는 데이터의 순차성에 따라 달랐습니다.
별도 HRLI 지표에서 SASRec 계열 모델은 마지막 입력 아이템을 바로 앞 아이템보다 더 자주 top-1에 올렸습니다. HRLI는 입력 아이템의 순위 재등장을, shuffle은 입력 순서 변화에 대한 성능을 측정합니다.
4. Residual이 attention 표현을 바꿉니다
Attention은 앞선 위치의 정보를 모으지만, residual은 같은 위치의 입력도 더합니다. 논문은 각 위치에서 나온 벡터를 나눈 다음 norm을 비교합니다. Norm은 벡터의 크기를 나타내므로 attention weight 하나만 보는 것보다 value 변환과 residual 합산을 함께 설명할 수 있습니다.
아홉 데이터 모두에서 attention 출력만 본 mixing ratio는 0.721–0.959였습니다. Residual을 더한 뒤에는 0.119–0.395로 낮아졌고, layer normalization 뒤에는 0.119–0.386이었습니다. 즉 이 표에서 가장 큰 변화는 residual을 더할 때 관찰됩니다.
Figure 3. Kozaki et al. (2026), arXiv v1 PDF p.6. Toys와 ML-1M에서 attention-only 출력과 residual·layer normalization 이후를 비교합니다. 후자에서는 같은 위치의 성분이 더 두드러집니다.
이는 과거 정보가 사라졌다는 뜻이 아닙니다. Norm은 위치별 벡터 기여의 크기이며, 깊은 층의 같은 위치 상태에도 앞선 층에서 처리한 문맥이 담겨 있습니다.
5. 학습한 뒤 residual 강도만 바꿉니다
저자들은 모델을 다시 학습하지 않고, 각 attention 단계의 residual 입력에 α를 곱합니다. 이 조작은 모든 sequence 위치의 attention residual branch에 적용되며 학습 가중치는 고정됩니다(고정 revision의 공개 models.py). Feed-forward network(FFN)의 residual은 조절하지 않습니다.
α를 낮추면 residual 경로에서 같은 위치 입력을 직접 보존하는 정도가 작아집니다. 하지만 α=0도 마지막 아이템 자체를 입력에서 지우는 것은 아닙니다. 그 아이템은 attention을 계산하는 query·key·value 경로에 남습니다.
Figure 4. Kozaki et al. (2026), arXiv v1 PDF p.7. 모든 위치와 attention 층의 residual에 α를 적용합니다. α가 작아질수록 mixing ratio는 올라가고 HRLI@1, HR@10, NDCG@10은 내려갑니다.
이 실험에서 표현의 contextual mixing이 커지는 것과 추천 정확도가 높아지는 것은 같은 결과가 아니었습니다. 논문은 residual scaling을 추론 시의 민감도 진단으로 제시하며, 새 추천 방식이나 엄밀한 인과 식별로 제안하지 않습니다.
6. 앞선 위치의 정답은 조건부로 회복됩니다
Table 4는 모든 위치 표현이 같은 최종 test target을 맞히는지 비교합니다. L에서 놓쳤지만 L−1, L−2, L−3 가운데 한 위치가 그 정답을 상위 10개에 둔 경우를 셉니다. 표의 각 비율 분모는 final miss만 모은 집합이 아니라 전체 test sequence입니다. 위치별 다음 학습 target을 서로 비교하는 표가 아닙니다.
마지막 위치는 틀리고 앞선 한 위치가 맞힌 비율 중 최댓값은 표준 HR@10의 약 24–46%입니다. 둘 다 전체 test sequence 기준이며, 오답의 그만큼을 고쳤다는 뜻은 아닙니다.
회복 곡선은 α=1일 때 마지막 위치는 놓쳤고 앞선 위치 중 적어도 하나가 이미 같은 최종 정답을 맞힌 사례로 subset을 고정합니다. 그다음 α를 바꾸어 마지막 위치가 맞히는 비율을 계산합니다. 저자들은 α≈0.1–0.3에서 이 조건부 회복이 가장 큰 결과를 보고합니다.
Figure 5. Kozaki et al. (2026), arXiv v1 PDF p.8. α=1에서 마지막 위치는 miss하고 L−1, L−2, L−3 중 하나 이상은 최종 test target을 hit한 고정 subset을 사용합니다. α=1의 회복률은 정의상 0입니다.
회복률은 고정 subset 안의 비율이지만 전체 HR@10과 NDCG@10은 모든 test 사례를 셉니다. 기존 hit가 miss로 바뀔 수도 있어, 논문은 α를 낮추면 두 전체 지표가 감소한다고 보고합니다.
7. Validation 선택과 논문의 범위
논문은 validation에서 하나의 전역 α를 고르는 규칙도 다룹니다. Recovery_val(α)를 최대화하면서 HR@10_val(α) ≥ (1−ε)HR@10_val(1)을 만족해야 합니다. ε는 기준 HR에 대한 상대 감소 허용치입니다. HR이 몇 퍼센트포인트 떨어져도 된다는 뜻이 아닙니다. 이 규칙은 정확도를 최대화하는 대신, 허용한 HR 감소 안에서 앞선 위치가 맞힌 subset의 회복을 크게 합니다.
Figure 6. Kozaki et al. (2026), arXiv v1 PDF p.8. Toys에서 ε에 따른 validation-selected α와 oracle-selected α, 그리고 test HR 변화와 조건부 회복을 보여 줍니다.
저자들은 residual dominance가 마지막 아이템 의존의 유일한 원인이라고 말하지 않습니다. Causal masking, 위치 정보, 마지막 위치 readout, 학습 목적과 데이터 특성도 영향을 줄 수 있습니다. 분석은 마지막 위치 표현으로 예측하는 causal self-attention 모델에 한정됩니다. HRLI와 실제 온라인 효용의 관계도 향후 과제로 남깁니다.
저자들은 고정 revision의 공개 코드 저장소와 같은 revision의 보충문서 PDF를 제공합니다.
참고문헌
Kozaki, K., Sakurai, K., Togo, R., Ogawa, T., & Haseyama, M. (2026). Residual dominance as a structural account of last-item reliance in causal self-attention recommenders. In Proceedings of the 20th ACM Conference on Recommender Systems (pp. 457–466). Association for Computing Machinery. https://doi.org/10.1145/3773078.3831798



