전체 글700 [강화학습 10] DQN ① 경험재생과 타깃망 CH 10 강화학습 · Part 2 표를 버리고DQN ① 경험재생과 타깃망9장에서 본 불안정에는 병이 두 개 있다. 하나는 연속한 표본이 심하게 상관되어 있다는 것이고, 다른 하나는 목표값이 예측과 함께 움직여 과녁이 도망간다는 것이다. DQN 은 이 둘에 각각 경험재생과 타깃망을 붙였다. 이 장에서는 상관 ρ=0.9 인 32개 표본이 실제로는 몇 개 몫을 하는지 계산하고, 목표가 같이 움직일 때 파라미터가 발산하는 조건을 정확히 구하고, 두 장치를 끄고 켜는 절제 실험을 5×5 격자에서 직접 돌린다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의DQNDeep Q-Network. 행동가치 Q(s,a) 를 신경망으로 근사하고, 경험재생과 타깃망으로 학습을 안정화한 알고리즘.. 2026. 9. 13. [강화학습 09] 함수근사와 치명적 삼위일체 CH 09 강화학습 · Part 2 표를 버리고함수근사와 치명적 삼위일체1부에서 얻은 수렴 보장은 전부 표가 있다는 전제 위에 있었다. 상태마다 칸 하나씩, 칸끼리는 서로 간섭하지 않는다는 전제다. 그런데 바둑의 상태 수는 10172 이고 아타리 화면은 1067970 이다. 표를 버리고 파라미터로 값을 근사하는 순간, 한 상태를 고치면 다른 상태도 같이 움직인다. 이 장은 그 대가를 정확히 계산한다 — 함수근사 · 부트스트랩 · off-policy 셋이 모이면 가중치가 지수적으로 발산하며, 그 확대율은 스텝당 1.0023925 처럼 숫자로 적힌다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의함수근사 v̂(s,w)function approximation. 상태 s 와 파.. 2026. 9. 13. [강화학습 08] SARSA와 Q러닝 — 절벽 앞에서 갈리는 길 CH 08 강화학습 · Part 1 표로 푸는 강화학습SARSA와 Q러닝 — 절벽 앞에서 갈리는 길7장의 TD 는 값을 재는 법이었다. 이제 고르는 법으로 간다. 갱신식에서 딱 한 글자 — 다음 상태의 값을 Q(S′,A′) 로 쓰느냐 maxa Q(S′,a) 로 쓰느냐 — 만 바뀌는데, 그 결과 두 알고리즘은 절벽 앞에서 서로 다른 길을 고른다. 3×6 절벽에서 최단경로는 −7, 우회로는 −9 지만, ε=0.1 로 걷는 순간 최단경로의 기대수익은 −22.90 으로 떨어지고 우회로는 −13.35 에 머문다. 이 숫자 하나가 온폴리시와 오프폴리시를 가른다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의행동가치 Q(s,a)action-value. 상태 s 에서 행동 a 를 하고.. 2026. 9. 13. [강화학습 07] TD 학습 — 추정으로 추정을 고친다 CH 07 강화학습 · Part 1 표로 푸는 강화학습TD 학습 — 추정으로 추정을 고친다6장의 몬테카를로는 에피소드가 끝나야 한 글자를 배웠다. 끝나지 않는 과제라면 영영 못 배운다. 해법은 뻔뻔하다 — 아직 모르는 미래를 내 추정으로 메꾸고 지금 갱신한다. 이 장은 그 뻔뻔함이 왜 정당한지, 그리고 어디까지 정당한지를 따라간다. 같은 한 에피소드에서 MC는 V(A) 를 1.2158 로 올리는데 TD는 0.9810 으로 내리는 지점, 그리고 여덟 판의 데이터에서 두 방법이 V(A)=0 과 V(A)=0.75 로 완전히 갈라서는 지점을 손으로 확인한다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의시간차 학습 TDtemporal-difference learning. 시간적.. 2026. 9. 13. [강화학습 06] 몬테카를로 — 모델 없이, 끝까지 가 보고 CH 06 강화학습 · Part 1 표로 푸는 강화학습몬테카를로 — 모델 없이, 끝까지 가 보고5장의 동적계획법은 전이확률 P 와 보상함수 R 을 이미 안다고 가정했다. 현실에서 그 표를 가진 사람은 없다. 그러면 남는 방법은 하나뿐이다 — 직접 해 보고 평균낸다. 이 장은 그 가장 정직한 추정법을 끝까지 따라간다. 첫방문과 모든방문이 같은 세 에피소드에서 1.3053 과 1.4290 으로 갈리는 지점, 그리고 중요도비가 스무 번 곱해지며 1.2 × 104 로 폭발하는 지점을 손으로 확인한다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의몬테카를로 MCMonte Carlo. 기댓값을 표본평균으로 대신하는 방법 전반. 여기서는 "에피소드를 끝까지 굴려 얻은 수익의 평균"을.. 2026. 9. 13. [강화학습 05] 동적계획법 — 정책반복과 가치반복 CH 05 강화학습 · Part 1 표로 푸는 강화학습동적계획법 — 정책반복과 가치반복4장에서는 주어진 정책의 가치를 구했다. 이 장에서는 그 가치를 딛고 더 나은 정책을 만든다. 방법은 두 박자다 — 평가하고 개선한다. 환경의 전이확률 P 와 보상 R 를 전부 안다는 가정 아래, 이 두 박자가 유한 번 만에 정확한 최적정책에 도달한다는 것을 증명하고, 4칸짜리 복도 MDP 에서 끝까지 손으로 돌려 본다. 핵심 도구는 벨만 연산자가 γ-축약사상이라는 사실 하나다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의동적계획법 DPdynamic programming. 환경 모델 P, R 를 완전히 알 때 MDP 를 푸는 방법의 총칭. 6장부터 다룰 모든 기법은 이것을 표본으로 흉.. 2026. 9. 13. 이전 1 2 3 4 ··· 117 다음