/
https://42jerrykim.github.io/ _index.md
Attention과 신경망 학습을 이해하는 데 필요한 최소한의 수학을 정리합니다. 벡터 내적과 코사인 유사도, 선형함수와 활성화함수, Softmax·Sigmoid, KL Divergence와 Cross Entropy를 코드와 함께 다룹니다.
순전파·손실 계산·역전파로 이어지는 신경망 학습 과정을 Chain Rule과 경사하강법 관점에서 정리합니다. Local Minimum 문제를 보완하는 Adam Optimizer, Batch Size·Epoch·Step 개념을 코드와 함께 다룹니다.
인코더-디코더 RNN의 장기 의존성 문제부터 RNN Attention, 그리고 순차 구조 자체를 끊어낸 Transformer까지 언어모델 아키텍처의 진화 과정을 정리합니다. BERT·GPT·T5 구조의 차이도 함께 다룹니다.
텍스트를 토큰 ID로 바꾸는 토크나이징, 토큰을 벡터로 바꾸는 임베딩, 그리고 절대·상대 위치 인코딩과 RoPE까지 GPT 입력 표현을 다룹니다. PyTorch Dataset/DataLoader 구현 예제를 포함합니다.
Query, Key, Value로 나누는 이유부터 Scaled Dot-Product Attention, Causal Masking, Multi-head Attention까지 Self-Attention의 계산 과정을 수식과 PyTorch 코드로 분해합니다.
Multi-head Attention을 감싸는 GPT 블록의 나머지 구성요소인 LayerNorm, Feed Forward Network, Residual Connection, Dropout을 조립하고, Temperature·Top-K 샘플링으로 다음 토큰을 생성하는 과정을 다룹니다.
LLM 파라미터의 3분의 2를 차지하는 Feed Forward Network가 지식을 저장하는 원리를, 직교 벡터와 Johnson-Lindenstrauss 보조정리, Superposition 개념으로 설명합니다. 환각과 기계적 해석가능성 연구도 함께 다룹니다.
사전학습된 GPT를 특정 과제에 맞추는 Classification Fine-tuning과, 전체 가중치 대신 저차원 행렬만 학습하는 LoRA·QLoRA를 다룹니다. 왜 파인튜닝마다 다른 전략이 필요한지 데이터 규모 관점에서 설명합니다.
베이스 모델이 지시를 따르지 못하는 이유부터, 프롬프트 포맷 설계, 패딩과 -100 마스킹으로 손실 계산에서 정답이 아닌 부분을 제외하는 방법, 3단계 파인튜닝 피라미드까지 지시 미세튜닝의 실전을 코드와 함께 자세히 다룹니다.
Reward Model로 응답 순위를 학습하고 강화학습으로 정책을 조정하는 RLHF 파이프라인과, Reward Model 없이 선호 데이터를 직접 손실함수로 바꾸는 DPO를 비교합니다. InstructGPT·DPO 원 논문을 인용합니다.