전체 글619 [시계열분석 20] 무엇을 이겼다고 말할 수 있나 — 최종 벤치마크 CH 20 시계열분석 · Part 7 무엇을 이겼다고 말할 수 있나무엇을 이겼다고 말할 수 있나 — 최종 벤치마크열세 줄짜리 표 하나로 이 회차를 닫는다. 1위는 모수 5개짜리 추세+계절더미 회귀 0.7532, 신경망 중 가장 나은 GRU 는 0.8076(모수 929), 가장 큰 Transformer 는 0.8600(모수 17697)이다. 차이가 우연인지 Diebold–Mariano 검정으로 재면 회귀 vs GRU 는 p = 0.00457 로 유의하지만, GRU vs RNN 은 p = 0.534 로 구별되지 않는다 — 하위권 모형들은 서로 다른 모형이 아니라 같은 잡음이다. 계절나이브(2.0704)에서 회귀(0.7532)까지의 간격 1.3172 중 회귀는 100.0% 를 모수 5개로 메웠고 Transfo.. 2026. 9. 6. [시계열분석 19] 여덟 모형을 같은 자리에 세운다 — DLinear가 던진 질문 CH 19 시계열분석 · Part 7 무엇을 이겼다고 말할 수 있나여덟 모형을 같은 자리에 세운다 — DLinear가 던진 질문11장부터 18장까지 하나씩 만든 모형을 전부 같은 자리에 세운다. 같은 자료·같은 분할·같은 정규화·같은 손실(L1)·같은 에폭(60)·같은 조기종료, 그리고 씨앗 세 개의 평균. 결과는 이렇다 — GRU 0.8134, RNN 0.8134, LSTM 0.8389, Transformer 0.8479, MLP 0.8731, TCN 0.8745, DLinear 0.8866, 선형 한 층 0.8888. 모수는 17개에서 17697개까지 1041배 차이가 나는데 MAE 차이는 0.0754 뿐이고, 모수(로그)와 MAE 의 상관계수는 −0.4804 다. 씨앗만 바꿔도 MAE 가 0.002.. 2026. 9. 6. [시계열분석 18] 스케일링과 데이터 누수 — 시계열에서만 생기는 사고 CH 18 시계열분석 · Part 6 예측을 제대로 하기스케일링과 데이터 누수 — 시계열에서만 생기는 사고이 장은 실무에서 가장 값비싼 실수를 다룬다. 데이터 누수(data leakage)는 예측 시점에 알 수 없는 정보가 학습에 들어가는 것이고, 시계열에서 그 정보는 언제나 미래다. 같은 모형에 정규화 방식만 바꿔 넣으면 테스트 MAE 가 없음 1.9592 / 전역(누수) 1.5432 / 학습구간만 1.3506 / 인스턴스 0.8769 로 갈린다. 그런데 이 장의 핵심은 그 표가 아니다. 초고는 "전역 스케일링이 성능을 부풀린다"고 썼는데 측정은 정확히 반대였다 — 추세 0.50 에서 전역 1.9902, 학습구간만 1.6540 으로 전역이 0.3362 나쁘다. 새어 든 정보가 '도움'이 아니라 '왜곡'.. 2026. 9. 6. [시계열분석 17] 확률적 예측 — 점 하나가 아니라 분포를 내놀기 CH 17 시계열분석 · Part 6 예측을 제대로 하기확률적 예측 — 점 하나가 아니라 분포를 내놓기11~16장은 내내 숫자 하나를 맞혔다. 그런데 재고를 몇 개 쌓을지, 사람을 몇 명 배치할지 정하는 사람이 정말 묻는 것은 "얼마일까"가 아니라 "얼마나 나쁠 수 있나"다. 이 장은 출력 칸을 1개에서 7개로 늘리고 핀볼 손실 하나만 바꿔서 τ = 0.05 … 0.95 의 분위수를 한꺼번에 학습한다(모수 775, 검증 핀볼손실 0.06116). 결과는 정직하게 말해야 한다 — 90% 예측구간의 커버리지 0.8800(목표 0.90), 평균 폭 3.4185. 같은 자리에서 추세+계절더미 회귀에 정규가정을 얹은 구간은 커버리지 0.9250, 폭 3.3260 이다. 더 넓은데 덜 덮었다 — 교정과 예리함 두 .. 2026. 9. 6. [시계열분석 16] 다단계 예측의 세 가지 전략 — 재귀·직접·MIMO CH 16 시계열분석 · Part 6 예측을 제대로 하기다단계 예측의 세 가지 전략 — 재귀·직접·MIMO11~15장은 전부 한 걸음 앞만 맞혔다. 이 장은 열여섯 걸음 앞까지 간다. 그러면 새 문제가 하나 생긴다 — 입력 자리에 무엇을 넣을 것인가. 답이 셋이다. 재귀는 1단계 모형 하나를 만들어 자기 예측을 되먹이고, 직접은 h 마다 모형을 따로 두고, MIMO는 모형 하나가 16개를 한 번에 뱉는다. 결과는 잔인할 만큼 분명하다. h = 1 에서 0.8968 / 0.9024 / 0.9114 로 셋이 거의 같지만, h = 16 에서는 4.3601 / 0.8205 / 0.7890 이다. 재귀만 4.86배로 무너진다. 평균 MAE(h = 1…16)는 재귀 2.2868, 직접 0.8711, MIMO 0.8.. 2026. 9. 6. [시계열분석 15] 어텐션 — 시계열에 “언제”를 어떻게 알려주나 CH 15 시계열분석 · Part 5 시간을 신경망에 넣기어텐션 — 시계열에 "언제"를 어떻게 알려주나어텐션은 Attn(Q,K,V) = softmax(QKᵀ/√d)V 한 줄이 전부다. 그런데 이 한 줄에는 시간이 들어 있지 않다. 입력을 섞어 넣고 출력을 되돌리면 원래와 최대 차이가 5.960e-08 — 부동소수점 찌꺼기를 빼면 완전히 같다. 그래서 위치 인코딩과 인과 마스크를 손으로 붙여 준다. 마스크가 없으면 t=0 이 t=4 를 0.204 만큼 본다. 그렇게 만든 Transformer(모수 17697)의 테스트 MAE 는 0.8332, 모수 5 개짜리 추세+계절더미 회귀의 0.7532 에 0.0800 진다.01 개념02 수식03 코드04 실험05 시각화용어 및 기호 정의어텐션 Attn(Q,K,V)a.. 2026. 9. 6. 이전 1 2 3 4 ··· 104 다음