A Decoder-Only Foundation Model for Time-Series Forecasting
TimesFM이 입력 시계열을 패치로 나눠 decoder-only Transformer로 예측하는 원리와 Monash·Darts·ETT 결과를 분석하고, 원시 코퍼스의 Wiki pageviews 편중, 집계 방식, inference-time context selection, 본문 도판과 부록 표의 기준선 차이가 zero-shot 성능 주장의 범위를 어떻게 제한하는지 살펴본다.
Paper: Das, A., Kong, W., Sen, R., & Zhou, Y. (2024). A decoder-only foundation model for time-series forecasting. In Proceedings of the 41st International Conference on Machine Learning (PMLR 235, pp. 10148–10167). https://proceedings.mlr.press/v235/das24c.html · arXiv:2310.10688v4 https://arxiv.org/abs/2310.10688v4
Abstract: Das et al.은 서로 다른 대규모 시계열을 함께 사전학습한 뒤, 처음 보는 데이터셋에서 가중치 미세조정 없이 예측하는 decoder-only foundation model TimesFM을 제안한다. 200M 모델은 길이 32의 입력 패치를 받아 길이 128의 출력 패치를 생성해 장기 예측의 자기회귀 단계를 줄인다. 저자 보고에서는 Monash·Darts·ETT에서 데이터셋별 지도학습 모델과 경쟁하는 집계 성능을 보이지만, Monash 순위는 집계 방식에 따라 달라지고 Darts에서는 두 집계 모두 3위다. 이 글은 구조와 사전학습 표집, 평가 설계를 먼저 재구성한 뒤 naive 기준선에 뒤지는 사례, 추론 시 문맥 길이 선택, 본문 도판과 부록 표의 비교군 차이가 zero-shot 성능 주장의 범위를 어떻게 제한하는지 살핀다. 범위는 ICML 2024 논문과 당시의 200M 모델이며, 후속 TimesFM 배포판의 사용 가이드는 아니다.
Executive Summary
| 항목 | 설명 |
|---|---|
| 연구 질문 | 서로 다른 도메인·시간 입도·예측 지평의 시계열을 함께 사전학습한 하나의 모델이, 처음 보는 데이터셋에서도 별도 학습 없이 데이터셋별 지도학습 모델과 경쟁할 수 있는가. |
| 핵심 기여 | 시계열을 겹치지 않는 패치로 토큰화해 decoder-only Transformer에 넣고, 입력 패치보다 긴 출력 패치를 한 번에 생성하는 TimesFM을 제안했다. |
| 방법적 결과 | 200M 모델은 길이 32의 입력 패치에서 길이 128의 출력 패치를 생성한다. 사전학습 loader는 real data 80%, synthetic data 20%를 표집하고, real data는 네 시간 입도 그룹에 같은 가중을 준다. |
| 실험 결과 | Monash에서는 기하평균 기준 TimesFM 0.6846이 1위지만 산술평균에서는 0.8005로 2위다. Darts에서는 두 집계 모두 3위다. Monash·Darts 26개 데이터셋 중 5개에서는 naive 기준선보다 오차가 크고, ETT의 PatchTST(ZS) 평균 0.349는 TimesFM 0.364보다 낮다. |
| 핵심 한계 | 순위가 집계 방식과 비교군 구성에 민감하며, 일부 Monash 데이터셋에서는 추론 시 문맥 길이를 선택했다. 사전학습 그룹 내부 표집, 평가 데이터와의 겉보기 중첩, 본문 도판과 부록 표의 방법 대응도 문서만으로 완전히 재구성되지 않는다. |
목차
- 데이터셋마다 학습하던 예측을 하나의 모델로
- 시계열을 패치로 처리하는 decoder-only 모델
- 사전학습 코퍼스와 표집 방식
- 평가 설계
- 결과와 절제
- 결과가 뒷받침하는 범위
- 결론
1. 데이터셋마다 학습하던 예측을 하나의 모델로
1.1 연구 질문
시계열 예측은 대체로 데이터셋마다 모델을 따로 학습한다. 이 논문은 대규모 시계열로 사전학습한 하나의 모델이 이전에 보지 못한 데이터셋에서도 유용한 시간 패턴을 학습할 수 있는지 묻는다.
1.2 TimesFM이 말하는 zero-shot forecasting의 범위
목표는 한 번 학습한 모델 하나로 도메인·지평·시간 입도가 다른 여러 데이터셋을 예측하는 것이다. 여기서 zero-shot은 평가 데이터셋마다 모델 가중치를 다시 학습하지 않는다는 뜻이다. 모델 규모는 200M 파라미터, 사전학습 데이터는 O(100B) 시점으로 당시 대형 언어 모델보다 작다.
2. 시계열을 패치로 처리하는 decoder-only 모델
2.1 입력 시계열에서 출력 패치까지

그림 1. TimesFM의 학습 구조. 출처: Das et al. (2024), Figure 1, arXiv:2310.10688v4, CC BY 4.0. 블로그용으로 축소·재배치.
입력 시계열을 겹치지 않는 패치로 자르고 각 패치를 잔차 블록으로 벡터화해 트랜스포머에 넣는다. 언어 모델의 토큰 자리에 패치가 들어가는 셈이다.
2.2 길이 32 입력과 길이 128 출력
핵심 설계는 입력 패치와 출력 패치의 길이를 다르게 둔 것이다. 200M 모델에서 입력 패치는 32, 출력 패치는 128이다. 한 번의 디코딩으로 128 시점을 내므로, 긴 지평을 예측할 때 자기회귀 스텝 수가 줄어든다.
2.3 17M·70M·200M 모델 구성
하이퍼파라미터는 Table 6에 있다.
| 크기 | 층 | 모델 차원 | 출력 패치 | 입력 패치 | 헤드 | 드롭아웃 |
|---|---|---|---|---|---|---|
| 200M | 20 | 1280 | 128 | 32 | 16 | 0.2 |
| 70M | 10 | 1024 | 128 | 32 | 16 | 0.2 |
| 17M | 10 | 512 | 128 | 32 | 16 | 0.2 |
3. 사전학습 코퍼스와 표집 방식
3.1 381.4B 시점으로 구성된 원시 코퍼스
Table 1의 값을 합산하면 다음과 같다.
| 구분 | 시점 수 | 비중 |
|---|---|---|
| Wiki Pageviews 4종 | 374,458,301,591 | 98.2% |
| 합성 데이터 | 6,144,000,000 | 1.6% |
| Google Trends 4종 | 536,372,243 | 0.1% |
| 나머지 전부(Electricity·Traffic·Weather·Favorita·LibCity·M4) | 222,968,225 | 0.1% |
| 합계 | 381,361,642,059 | 100% |
Wiki hourly와 Wiki daily 둘만 92.9%다. 합성 데이터는 3M 계열 × 2,048 시점으로 Table 1의 6,144,000,000과 일치한다.
3.2 Wiki pageviews 98.2%와 실제 학습 노출의 차이
원시 코퍼스에서 Wiki pageviews가 차지하는 비중과 실제 학습 노출 비중은 동일하지 않다. loader는 real data 80%, synthetic data 20%를 표집하고, real data 안에서는 hourly+sub-hourly·daily·weekly·monthly 네 그룹에 같은 가중을 준다. 따라서 코퍼스 크기가 그대로 배치 노출 비율이 되지는 않는다.
3.3 real·synthetic 혼합과 그룹 내부 표집의 미공개 범위
논문이 명시하는 것은 그룹 사이의 균등 가중까지다. 그룹 안에서 데이터셋을 어떻게 표집하는지는 설명하지 않는다. hourly 그룹만 떼어 보면 원시 코퍼스 크기 기준 Wiki hourly가 239.1B이고, 나머지 시간 단위 데이터 전체는 약 453.4M이다. 이 기준에서는 hourly 그룹의 99.8%가 Wiki지만, 실제 노출 비중은 내부 sampler가 공개되지 않아 계산할 수 없다.
합성 데이터는 원시 코퍼스의 1.6%지만 배치의 20%를 받으므로 크기 비례 표집과 비교하면 12배 넘게 상향 가중된다. 논문은 합성 데이터를 주요 구성요소로 설명하지만, 20%라는 가중을 택한 근거는 제시하지 않는다.
§5는 Wiki 계열을 약 300B 시점이라고 설명하지만 Table 1의 네 항목 합은 374.5B로 약 25% 차이가 난다. 반면 초록의 O(100B) timepoints는 자릿수 표기이므로 전체 합계 381.4B와 모순으로 보기는 어렵다.
4. 평가 설계
4.1 Monash·Darts·ETT 평가 구성
평가는 세 그룹이다. Monash 아카이브는 결측치가 있는 데이터셋을 제외한 18개, Darts는 8개 시계열, ETT는 ETTm1·ETTm2·ETTh1·ETTh2를 지평 96과 192에서 평가한 8개 과제로 구성된다.
4.2 naive-scaled MAE와 두 집계
데이터셋마다 스케일이 크게 다르므로 마지막 값을 반복하는 naive 기준선의 MAE로 각 모델의 MAE를 나눈 scaled MAE를 쓴다. 본문 Figure 2a는 기하평균, 부록 Figure 4a는 산술평균을 보고한다. 논문은 정규화 지표에는 기하평균이 더 견고하다는 Fleming과 Wallace(1986)를 선택 근거로 든다.
4.3 기준선 조달과 inference-time context selection
기준선의 출처는 그룹마다 다르다. Monash 기준선은 원 논문의 보충자료에서, Darts 기준선은 llmtime 저자가 제공한 사전 계산 출력에서 가져왔다. llmtime도 Monash·Darts에서는 GPT-3 출력이지만, ETT에서는 GPT-3 접근 종료로 GPT-3.5-Turbo를 사용했다. 같은 이름의 기준선이 모든 그룹에서 같은 모델을 뜻하지는 않는다.
일부 Monash 데이터셋에서는 훈련 구간으로 만든 검증 지표를 이용해 추론 문맥 길이를 32·64·최대 길이 중에서 골랐다. 가중치를 미세조정하지 않았다는 의미의 zero-shot은 유지되지만, 완전히 무조정인 out-of-box 평가는 아니다. 부록에는 여섯 tuple이 열거되지만 tourism monthly가 문맥 32와 64로 두 번 등장해 다섯 개 데이터셋만 식별되는 목록상 불일치도 있다.
5. 결과와 절제

그림 2. Monash·Darts·ETT 세 그룹의 평균 성능. 낮을수록 좋다. 출처: Das et al. (2024), Figure 2, arXiv:2310.10688v4, CC BY 4.0. 블로그용으로 축소·재배치.
5.1 집계 방식에 따라 달라지는 순위
Table 3·4의 산술평균과 본문 Figure 2의 기하평균을 나란히 놓으면 다음과 같다.
| 산술평균(부록 Figure 4) | 기하평균(본문 Figure 2) | |
|---|---|---|
| Monash | N-BEATS 0.7844 1위 / TimesFM 0.8005 2위 | TimesFM 0.6846 1위 / N-BEATS 0.7005 |
| Darts | ARIMA 0.6045 1위 / llmtime 0.6641 / TimesFM 0.6829 3위 | llmtime 0.4882 1위 / ARIMA 0.5219 / TimesFM 0.5767 3위 |
Monash에서는 1위가 집계 방식에 따라 달라지고, 본문에 실린 기하평균에서 TimesFM이 앞선다. Darts에서는 두 집계 모두 3위로 llmtime과 ARIMA보다 뒤에 있다.
논문은 기하평균 선택 근거를 밝히고 산술평균도 부록에 싣는다. Figure 4 캡션은 TimesFM이 Monash의 N-BEATS, Darts의 ARIMA와 유의한 차이가 없다고 설명하며, Darts의 표본 수가 작아 신뢰구간이 넓다는 점도 적는다. 다른 집계를 숨긴 것은 아니지만, 초록과 본문 도판의 대표 결과가 TimesFM에 유리한 기하평균에 기반한다는 점은 함께 봐야 한다.
5.2 데이터셋별 편차와 naive 기준선
Table 3·4의 26개 Monash·Darts 데이터셋을 비교하면 TimesFM이 naive보다 오차가 큰 경우는 다섯 개다.
| 그룹 | 데이터셋 | TimesFM | NAIVE | 차이 |
|---|---|---|---|---|
| Monash | cif 2016 | 773,980.44 | 386,526.37 | +100.2% |
| Monash | bitcoin | 1.3e18 | 7.77e17 | +67.3% |
| Monash | saugeenday | 24.63 | 21.50 | +14.6% |
| Monash | tourism yearly | 109,977.29 | 99,456.05 | +10.6% |
| Darts | GasRateCO2 | 2.50 | 2.29 | +9.2% |
cif 2016에서는 TimesFM의 오차가 naive의 약 두 배다. 집계 수준에서 경쟁력이 있더라도 모든 데이터셋에서 단순 기준선을 안정적으로 이긴다는 뜻은 아니다. 논문은 naive 값을 표에 싣지만 이 다섯 사례를 본문에서 별도로 논하지 않는다.
덧붙여 cif 2016은 앞서 본 문맥 길이 추론 시 조정을 받은 여섯 데이터셋 중 하나다(문맥 32로 설정). 조정을 거치고도 naive의 두 배다.
Darts 표에 인쇄된 개별 값을 naive로 정규화해 평균하면 PatchTST는 0.7414지만 평균 행에는 0.7462로 적혀 있다. 내부 원정밀도 값이 없어 계산 오류로 단정할 수는 없고 순위도 바뀌지 않지만, 표시된 값만으로는 평균을 재현할 수 없다. Table 5의 Informer 평균은 계산 0.985와 인쇄 0.99의 반올림 경계에 있다.
개별 데이터셋의 편차도 크다. Darts AirPassengers에서 TimesFM 62.51 대 ARIMA 24.03으로 2.6배 차이가 나고, Monash tourism yearly에서 109,977 대 N-BEATS 70,952로 1.55배다. 반대로 fred md에서는 947.12로 차순위 TBATS 1,989.97의 절반 이하이고, pedestrian counts에서도 1위다. 초록의 "comes close to"는 집계 수준의 진술이고, 개별 데이터셋의 이 편차는 드러나지 않는다.
5.3 본문 도판과 부록 표의 비교군
논문은 Table 4가 Figure 2a의 실제 MAE 값을 제시한다고 설명한다. 그러나 본문 도판과 부록 표의 비교군은 다음처럼 일치하지 않는다.
| 그룹 | 본문 Figure | 부록 Table |
|---|---|---|
| Monash | 15개 막대, 4번째가 PatchTST ≈0.72 |
16개 열, PatchTST(ZS) 1.0557 — 대응 막대 없음 |
| ETT | 7개 막대, 3번째가 N-BEATS ≈0.41 |
7개 열, N-BEATS 없음 · PatchTST(ZS) 0.35 — 대응 막대 없음 |
| Darts | 8개 막대 | 8개 열 — 일대일 대응 |
PatchTST(ZS)는 외부 기준선이 아니라 논문이 같은 data loader와 FLOPs로 학습한 200M PatchTST 절제다. 디코더 전용 설계와 PatchTST 구조를 비교하기 위한 조건이며, 논문도 Monash에서는 좋지 않고 ETT에서는 TimesFM·지도학습 PatchTST와 유사하다고 기술한다.
Table 5의 표시값을 평균하면 PatchTST(ZS) 0.349, TimesFM 0.364, PatchTST 0.373이다. ETT에서 동조건 절제가 TimesFM보다 0.015 낮으므로 유사하다는 서술은 가능하지만, TimesFM이 가장 앞선다고 단정할 수는 없다.
Figure 2c에는 PatchTST(ZS)가 없고, Figure 2a의 PatchTST 약 0.72는 Table 4의 PatchTST(ZS) 1.0557과 대응하지 않는다. 부록 A.6은 Monash 기준선을 2021년 아카이브 논문의 보충표에서 가져왔다고 적는데 PatchTST는 2022년 방법이다. 따라서 Table 4가 Figure 2a의 수치라는 설명만으로는 각 막대의 출처와 조건을 완전히 재구성하기 어렵다.
5.4 출력 패치·모델 크기·합성 데이터 유무 절제

그림 3. 출력 패치 길이·모델 크기·합성 데이터 포함 여부에 대한 절제. 출처: Das et al. (2024), Figure 3, arXiv:2310.10688v4, CC BY 4.0. 블로그용으로 축소·재배치.
§6.2는 출력 패치 길이와 모델 크기를 바꾸고, 합성 데이터 포함 모델과 미포함 모델을 비교한다. 저자 보고 기준으로 출력 패치 확대, 모델 규모 증가, 합성 데이터 포함은 대체로 주 결과와 같은 개선 방향을 보인다.
6. 결과가 뒷받침하는 범위
6.1 논문이 밝힌 한계
- TimesFM은 point forecasting만 다루며 probabilistic forecasting은 후속 과제로 남긴다.
- 사전학습에서 외생 공변량을 쓰지 않고, fine-tuning과 공변량 활용도 충분히 탐색하지 않았다.
- hyperparameter 탐색이 제한적이고 모델의 예측 근거를 해석하는 방법도 제시하지 않는다.
- Informer 계열에서는 사전학습과 겹치는 데이터셋을 제외하고 ETT 네 종만 평가한다.
- Darts는 시계열이 8개뿐이라 신뢰구간이 넓고 순서를 확정하기 어렵다.
- Darts 데이터셋이 공개 블로그에 자주 쓰여 llmtime의 데이터 오염 가능성을 배제할 수 없다고 적는다.
6.2 zero-shot 평가와 데이터 중첩의 경계
여기서부터는 공개된 설정에서 도출한 해설자의 해석이다. Table 4의 weather·traffic hourly·traffic weekly·australian electricity demand는 Table 1의 Weather·Traffic Hourly·Electricity Hourly와 이름이 겹친다. 그러나 출처 판본과 split hash가 없어 동일 데이터인지는 논문만으로 판정할 수 없다. 이는 누수를 입증하는 근거가 아니라, held-out 선언을 독립적으로 검증할 식별 정보가 부족하다는 뜻이다.
문맥 길이 선택도 같은 경계를 만든다. 모델 가중치를 다시 학습하지 않았으므로 zero-shot이라는 표현은 유지되지만, 평가 데이터셋마다 문맥 길이를 검증 지표로 고른 이상 완전한 무조정 적용과는 다르다. 이 조건은 본문이 아니라 부록에 있다.
6.3 계산량·표집·서지의 재현성
논문은 200M 모델을 global batch 4,096과 1.5M iteration으로 학습했고, 최종 실행에는 TPUv5e 16 tensor core에서 2일이 걸렸다고 보고한다. 실험과 trial에는 그보다 더 많은 계산이 들었다고 밝히지만 전체 탐색 비용은 정량화하지 않는다.
그룹 내부 sampler가 공개되지 않은 탓에 실제 Wiki 노출 비중과 그 도메인 특성이 일반화에 미친 영향은 평가할 수 없다(§3.3).
v4의 §5는 M4 데이터셋을 [MSA22]로 인용하지만 해당 참고문헌은 M5 accuracy competition 논문이다. 같은 키가 §1에서는 M5를 가리킨다. 이는 TimesFM v4 안의 M4/M5 서지 불일치로 남는다.
6.4 현재 근거로 남는 기여
TimesFM은 데이터셋마다 별도 모델을 학습하던 시계열 예측을 대규모 사전학습과 zero-shot 적용의 문제로 바꿨다. naive-scaled MAE와 기하평균 선택의 근거를 밝히고 산술평균도 부록에 제공했기 때문에 집계 방식의 영향을 논문 자료만으로 비교할 수 있다.
PatchTST(ZS)는 같은 data loader와 FLOPs를 사용한 구조 절제다. ETT에서 TimesFM보다 근소하게 낮은 평균을 보이는 결과까지 표에 남겨, decoder-only 설계의 효과와 한계를 함께 검토할 수 있게 했다. Informer 계열의 사전학습 중첩을 인지하고 ETT로 평가 범위를 좁힌 점도 재현성 경계를 명시한 사례다.
7. 결론
TimesFM의 핵심 기여는 시계열 예측의 기본 단위를 데이터셋별 전용 모델에서 대규모 사전학습 모델로 옮긴 데 있다. 시계열을 패치로 바꾸고 길이 32의 입력에서 길이 128의 출력을 한 번에 생성하는 decoder-only 설계는 200M 모델 하나로 여러 도메인과 예측 지평을 다루는 구체적인 방법을 제시한다.
실험이 가장 분명하게 뒷받침하는 결론은 TimesFM이 여러 벤치마크에서 경쟁력 있는 zero-shot 기준선이라는 점이다. 이를 모든 데이터셋에서 지도학습 모델을 대체한다는 주장으로 넓히기는 어렵다. Monash 순위는 집계 방식에 따라 바뀌고 Darts에서는 두 집계 모두 3위이며, Monash·Darts 26개 데이터셋 중 5개에서는 naive 기준선보다 오차가 크다. Figure 2c의 비교군에서는 TimesFM과 지도학습 PatchTST가 선두권이지만, 부록의 동조건 PatchTST(ZS) 평균은 TimesFM보다 낮다.
따라서 이 논문의 가치는 보편적 우위를 확정한 데 있기보다, 하나의 사전학습 모델이 서로 다른 시계열로 전이될 수 있다는 연구 방향을 실험 가능한 형태로 만든 데 있다. 그룹 내부 표집 방식, inference-time context selection, 평가 데이터 중첩, 본문과 부록의 비교 방법 대응을 더 명확히 통제한 후속 평가가 TimesFM의 일반화 범위를 결정할 것이다.
References
Das, A., Kong, W., Sen, R., & Zhou, Y. (2024). A decoder-only foundation model for time-series forecasting. In Proceedings of the 41st International Conference on Machine Learning (PMLR 235, pp. 10148–10167). https://proceedings.mlr.press/v235/das24c.html
Fleming, P. J., & Wallace, J. J. (1986). How not to lie with statistics: The correct way to summarize benchmark results. Communications of the ACM, 29(3), 218–221.
Godahewa, R., Bergmeir, C., Webb, G. I., Hyndman, R. J., & Montero-Manso, P. (2021). Monash time series forecasting archive (arXiv:2105.06643). arXiv. https://arxiv.org/abs/2105.06643
Gruver, N., Finzi, M., Qiu, S., & Wilson, A. G. (2023). Large language models are zero-shot time series forecasters (arXiv:2310.07820). arXiv. https://arxiv.org/abs/2310.07820
Google Research. (n.d.). TimesFM [Source code]. GitHub. https://github.com/google-research/timesfm
Herzen, J., Lässig, F., Piazzetta, S. G., Neuer, T., Tafti, L., Raille, G., Van Pottelbergh, T., Pasieka, M., Skrodzki, A., Huguenin, N., et al. (2022). Darts: User-friendly modern machine learning for time series. The Journal of Machine Learning Research, 23(1), 5442–5447.
Makridakis, S., Spiliotis, E., & Assimakopoulos, V. (2022). M5 accuracy competition: Results, findings, and conclusions. International Journal of Forecasting, 38(4), 1346–1364.
Nie, Y., Nguyen, N. H., Sinthong, P., & Kalagnanam, J. (2022). A time series is worth 64 words: Long-term forecasting with transformers. International Conference on Learning Representations.
Oreshkin, B. N., Carpov, D., Chapados, N., & Bengio, Y. (2019). N-BEATS: Neural basis expansion analysis for interpretable time series forecasting. International Conference on Learning Representations.
Salinas, D., Flunkert, V., Gasthaus, J., & Januschowski, T. (2020). DeepAR: Probabilistic forecasting with autoregressive recurrent networks. International Journal of Forecasting, 36(3), 1181–1191.
Wang, J., Jiang, J., Jiang, W., Han, C., & Zhao, W. X. (2023). Towards efficient and comprehensive urban spatial-temporal prediction: A unified library and performance benchmark (arXiv:2304.14343). arXiv. https://arxiv.org/abs/2304.14343
Zhou, H., Zhang, S., Peng, J., Zhang, S., Li, J., Xiong, H., & Zhang, W. (2021). Informer: Beyond efficient transformer for long sequence time-series forecasting. In Proceedings of the AAAI Conference on Artificial Intelligence.