/
https://42jerrykim.github.io/ _index.md
LLM 파라미터의 3분의 2를 차지하는 Feed Forward Network가 지식을 저장하는 원리를, 직교 벡터와 Johnson-Lindenstrauss 보조정리, Superposition 개념으로 설명합니다. 환각과 기계적 해석가능성 연구도 함께 다룹니다. 사전학습된 GPT를 특정 과제에 맞추는 Classification Fine-tuning과, 전체 가중치 대신 저차원 행렬만 학습하는 LoRA·QLoRA를 다룹니다. 왜 파인튜닝마다 다른 전략이 필요한지 데이터 규모 관점에서 설명합니다. 베이스 모델이 지시를 따르지 못하는 이유부터, 프롬프트 포맷 설계, 패딩과 -100 마스킹으로 손실 계산에서 정답이 아닌 부분을 제외하는 방법, 3단계 파인튜닝 피라미드까지 지시 미세튜닝의 실전을 코드와 함께 자세히 다룹니다. Reward Model로 응답 순위를 학습하고 강화학습으로 정책을 조정하는 RLHF 파이프라인과, Reward Model 없이 선호 데이터를 직접 손실함수로 바꾸는 DPO를 비교합니다. InstructGPT·DPO 원 논문을 인용합니다. 중간 추론 과정을 생성하면 왜 정답률이 올라가는지 Chain-of-Thought로 설명하고, 정답 채점의 어려움과 이를 해결하는 GRPO 강화학습 방식까지 최근 추론 모델이 학습되는 원리를 논문과 함께 자세히 정리합니다. 이미 계산한 Key·Value를 재사용하는 KV Cache부터, 메모리 사용량을 줄이는 GQA와 MLA, Sliding Window Attention까지 LLM 추론을 빠르게 만드는 서빙 효율화 기법을 다룹니다. 시리즈 A의 마지막 챕터입니다. 모델을 자원이 제한된 기기에서 빠르게 돌리는 경량화 시리즈의 도입 챕터입니다. Prefill/Decode의 서로 다른 병목, Pruning·Quantization·Distillation 3대 기법의 관계, 7개 챕터 커리큘럼을 정리합니다. 신경망이 과잉 설계되는 이유부터, Fine-grained와 Coarse-grained Pruning의 정확도-가속 트레이드오프, Magnitude 기반 선택, N:M Sparsity, 희소 행렬 저장 방식까지 Pruning의 핵심을 정리합니다. Linear Quantization의 Scale·Zero-point 계산부터 Symmetric·Asymmetric 방식, Static·Dynamic Quantization, PTQ와 QAT의 트레이드오프까지 모델을 저비트로 표현하는 Quantization의 핵심을 정리합니다. 작은 모델이 처음부터 학습되기 어려운 이유부터, Temperature로 만드는 Soft Label, Forward·Reverse KL Divergence의 차이, 중간 레이어를 비교하는 Feature-based KD까지 지식 증류의 핵심을 Hinton 원 논문과 함께 정리합니다.