On-Device-AI(온디바이스AI)
10 posts
[AI] zg(zvec-grep): 온디바이스 하이브리드 검색으로 에이전트 도구 호출 줄이기
[AI] 양자화 트리거 백도어: FP16에선 무해하던 모델이 INT8에서 오작동하는 이유
[LLM] 12. LLM 서빙 효율화 — KV Cache, GQA, MLA
[On-Device AI] 00. Introduction: On-Device AI 경량화
[On-Device AI] 01. Pruning — 가지치기로 모델 슬림화하기
[On-Device AI] 02. Quantization — 비트 수를 줄이는 법
[On-Device AI] 03. Knowledge Distillation — Teacher와 Student
[On-Device AI] 04. LLM을 위한 Pruning — OBS와 SparseGPT
[On-Device AI] 05. LLM Quantization — SmoothQuant와 AWQ
[On-Device AI] 06. 추론 가속 — Speculative Decoding, FlashAttention
Home