전체 글753 새 악재는 없었지만··· 금리·유가 부담에 코스피 0.85% 하락 6627선, 코스닥은 나홀로 상승 (9/15) 한국 증시 마감 브리핑2026.09.15 (화)마감 리포트 · 시장 전체 · 2026.09.15새 악재는 없었지만··· 금리·유가 부담에 코스피 0.85% 하락 6627선, 코스닥은 나홀로 상승 (9/15)전날 3%대 급락 이후 하루 만에 낙폭을 다소 줄였지만, 코스피는 여전히 6,600선 초반에서 방향을 잡지 못했다. 새로운 악재가 나오지 않았음에도 국채금리·유가 부담과 저가 매수세 약화가 겹치며 하락을 이어간 반면, 코스닥은 로봇·이차전지·제약주가 지수를 끌어올리며 나홀로 상승했다.코스피-0.85%6,627.26 (-57.11p)코스닥+0.70%812.41 (+5.62p)외국인 순매도(코스피)-1조5,735억기관도 9,044억 순매도오늘 한국 증시 동향코스피는 이날 57.11포인트(-0.85%) 내린.. 2026. 9. 15. [강화학습 30] 무엇을 이겼다고 말할 수 있나 (완결) CH 30 강화학습 · Part 5 보상을 사람에게서 배우다무엇을 이겼다고 말할 수 있나 (완결)강화학습 논문의 학습곡선은 유난히 잘 뒤집힌다. 코드를 한 줄도 바꾸지 않고 시드 하나만 갈아도 두 알고리즘의 순위가 바뀐다. 지도학습에서는 잡음이던 것이 여기서는 정책이 데이터를 만들기 때문에 누적 증폭된다. 이 장은 "이겼다"는 문장이 성립하기 위한 최소 조건을 통계로 적는다. d = 0.5σ 의 차이를 양측 α=0.05·검정력 0.8 로 잡으려면 양쪽에 시드 64개가 필요하고, 논문이 흔히 쓰는 3~5개로는 2σ 이상의 차이만 보인다. 그리고 30장 전체를 한 장의 지도로 닫는다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의시드 seed난수 생성기의 초기값. 초기 가중.. 2026. 9. 15. [강화학습 29] RLHF ② DPO·GRPO, 그리고 보상 해킹 CH 29 강화학습 · Part 5 보상을 사람에게서 배우다RLHF ② DPO·GRPO, 그리고 보상 해킹28장의 파이프라인은 부품이 많다. SFT 모델, 보상모델, 가치망, 정책, 기준정책 — 네댓 개의 신경망이 동시에 메모리에 올라간다. 이 장은 그 부품을 하나씩 지운다. 보상모델을 지우면 DPO, 가치망을 지우면 GRPO 다. DPO 의 핵심은 28장의 최적해 π* ∝ πref·exp(r/β) 를 r 에 대해 뒤집는 한 줄이고, 그때 골칫거리 분할함수 Z(x) 가 브래들리–테리의 차이 안에서 통째로 소거된다. 그리고 어느 방식을 쓰든, 참보상 대신 대리보상을 세게 최적화하는 한 굿하트 법칙이 따라온다. 그것도 숫자로 본다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 .. 2026. 9. 15. [강화학습 28] RLHF ① 선호에서 보상모델로 CH 28 강화학습 · Part 5 보상을 사람에게서 배우다RLHF ① 선호에서 보상모델로27장은 시연에서 보상을 거꾸로 알아내려 했다. 이 장은 재료를 바꾼다. 사람에게 "이 답변 몇 점?"이라 묻지 않고 "둘 중 어느 쪽이 낫나"만 묻는다. 절대점수는 평가자마다·날마다 흔들리지만 쌍 비교는 흔들리지 않는다. 이 장은 그 비교 더미에서 보상함수를 꺼내는 브래들리–테리 모형을 손으로 풀고, SFT → RM → PPO 3단 파이프라인을 조립하고, KL 페널티가 붙은 목적 𝔼[r] − β·KL 의 최적해가 πref(y)·exp(r(y)/β) 에 비례함을 유도한다. 이 마지막 식이 29장 DPO 의 출발점이다.01 직관02 수식 읽는 법03 손으로 풀기04 코드05 시각화약어 및 기호 정의RLHFReinfo.. 2026. 9. 15. [강화학습 27] 모방학습과 역강화학습 CH 27 강화학습 · Part 5 보상을 사람에게서 배우다모방학습과 역강화학습26장까지 우리는 보상함수가 주어져 있다고 가정했다. 절벽은 −100, 목표는 +1, 한 걸음은 −1. 이제 그 가정을 버린다. "좋은 운전"의 보상함수를 적어 보라고 하면 누구도 적을 수 없고, 속도·안전·승차감의 교환비를 숫자로 박아 넣는 순간 이미 틀린 목표를 최적화하게 된다. 대신 우리가 할 수 있는 일은 보여 주는 것이다. 시연에서 정책을 얻는 세 가지 길 — 행동을 그대로 흉내기(BC), 보상을 거꾸로 추정하기(IRL), 점유분포를 맞추기(GAIL) — 을 끝까지 따라간다. BC 가 왜 O(εT2) 로 무너지는지 숫자로 보고, 보상함수가 원리적으로 하나로 정해지지 않는다는 사실을 퍼텐셜 정형화로 증명한다.01 직관0.. 2026. 9. 15. [강화학습 26] 오프라인 RL — 환경 없이 로그만 있을 때 CH 26 강화학습 · Part 4 엔트로피 · 모델 · 데이터오프라인 RL — 환경 없이 로그만 있을 때자율주행차에게 "이번엔 중앙선을 넘어 보자"고 할 수는 없다. 환자에게 시험용 투약을 할 수도 없다. 그래서 이미 쌓인 로그만으로 더 나은 정책을 만들어야 한다. 데이터가 고정되어 있으니 지도학습처럼 들리지만, 결정적으로 다른 점이 하나 있다 — 평가할 때는 내 정책이 데이터를 만든다. 데이터에 없는 행동의 Q 를 물어보면 근거 없는 숫자가 돌아오고, 그 숫자가 벨만 백업을 타고 증폭되며 퍼진다. γ=0.99 에서 한 번의 과대평가 Δ=0.5 가 50 까지 자라는 것을 손으로 계산하고, 그 재앙을 막는 세 가지 답 — CQL · IQL · 의사결정 트랜스포머 — 을 숫자로 분해한다.01 직관02 수식.. 2026. 9. 15. 이전 1 2 3 4 ··· 126 다음