Featured image of post [On-Device AI] 00. Introduction: On-Device AI 경량화

[On-Device AI] 00. Introduction: On-Device AI 경량화

모델을 자원이 제한된 기기에서 빠르게 돌리는 경량화 시리즈의 도입 챕터입니다. Prefill/Decode의 서로 다른 병목, Pruning·Quantization·Distillation 3대 기법의 관계, 7개 챕터 커리큘럼을 정리합니다.

Featured image of post [On-Device AI] 02. Quantization — 비트 수를 줄이는 법

[On-Device AI] 02. Quantization — 비트 수를 줄이는 법

Linear Quantization의 Scale·Zero-point 계산부터 Symmetric·Asymmetric 방식, Static·Dynamic Quantization, PTQ와 QAT의 트레이드오프까지 모델을 저비트로 표현하는 Quantization의 핵심을 정리합니다.

Featured image of post [On-Device AI] 03. Knowledge Distillation — Teacher와 Student

[On-Device AI] 03. Knowledge Distillation — Teacher와 Student

작은 모델이 처음부터 학습되기 어려운 이유부터, Temperature로 만드는 Soft Label, Forward·Reverse KL Divergence의 차이, 중간 레이어를 비교하는 Feature-based KD까지 지식 증류의 핵심을 Hinton 원 논문과 함께 정리합니다.

Featured image of post [On-Device AI] 04. LLM을 위한 Pruning — OBS와 SparseGPT

[On-Device AI] 04. LLM을 위한 Pruning — OBS와 SparseGPT

단순 절댓값 기준 Pruning이 LLM에서 왜 부족한지부터, 테일러 급수 기반 OBD·OBS, 이를 레이어 단위로 확장한 SparseGPT, Activation 크기까지 고려하는 Wanda까지 LLM 전용 Pruning 기법을 원 논문과 함께 정리합니다.

Featured image of post [On-Device AI] 05. LLM Quantization — SmoothQuant와 AWQ

[On-Device AI] 05. LLM Quantization — SmoothQuant와 AWQ

LLM Activation의 Outlier가 왜 다루기 어려운지부터, 어려움을 Weight로 옮기는 SmoothQuant, 중요 채널만 보호하는 AWQ, OBS 계열의 GPTQ, QLoRA의 NF4·Double Quantization까지 LLM 전용 Quantization 기법을 정리합니다.

Featured image of post [RAG] 00. Introduction: RAG와 정보검색

[RAG] 00. Introduction: RAG와 정보검색

검색과 LLM을 결합하는 시리즈의 도입 챕터입니다. LLM만으로는 부족한 세 가지 이유부터, 고전 IR에서 GraphRAG·MCP까지 이어지는 8개 챕터 커리큘럼과 학습 목표, 챕터별 우선순위 로드맵을 자세히 정리합니다.

Featured image of post [RAG] 01. Classical IR — 역색인, TF-IDF, BM25

[RAG] 01. Classical IR — 역색인, TF-IDF, BM25

역색인 자료구조부터 단어 빈도의 한계를 보정하는 TF-IDF, 오랫동안 사실상 표준이었던 BM25, 그리고 MRR·Precision·Recall 같은 검색 평가 지표까지 신경망 이전 정보검색의 핵심을 자세히 정리합니다.

Featured image of post [RAG] 02. Dense Retrieval — BERT로 의미를 검색하기

[RAG] 02. Dense Retrieval — BERT로 의미를 검색하기

희소 벡터 대신 신경망 임베딩으로 검색하는 Dense Retrieval을 다룹니다. Bi-encoder와 Cross-encoder의 정확도-속도 트레이드오프, DPR의 대조 학습, Re-ranking 2단계 구조를 원 논문과 함께 정리합니다.