Reinforcement-Learning(강화학습)
8 posts
[AI] 환각은 버그가 아니라 압축의 대가다 — LLM 지식 저장의 중첩(Superposition)
[AI] 모델은 의도적으로 더 멍청해지고 있다 — 추론과 사실 지식의 트레이드오프
[Claude Code] 도구 스키마 과적합: 최신 모델이 서드파티 도구에 약한 이유
[LLM] 00. Introduction: LLM 밑바닥부터 이해하기
[LLM] 01. AI 수학 기초 — 내적, Softmax, KL Divergence
[LLM] 02. 신경망은 어떻게 학습하는가 — 역전파와 Adam
[LLM] 10. RLHF와 DPO — 사람의 선호를 학습시키는 법
[LLM] 11. 추론 모델의 시대 — Chain-of-Thought와 GRPO
Home