/
https://42jerrykim.github.io/ _index.md
RDTSC/RDTSCP로 사이클 단위를 직접 읽는 법과 clock_gettime의 CLOCK_MONOTONIC 계열을 대조하고, invariant TSC·코어 동기화·vDSO 동작 원리, 그리고 정밀 타이밍에서 흔히 걸리는 함정을 다룹니다. DPDK·RDMA·io_uring·AF_XDP가 각각 커널을 얼마나 우회하는지, syscall·복사·인터럽트 비용을 줄이는 스펙트럼을 정리하고 이 트랙의 범위와 Tr.09·Tr.10 심화 트랙으로의 위임 경계를 다룹니다. 컨테이너·VM 격리 메커니즘의 오버헤드 원인을 정리하고, Kubernetes CPU limit(CFS quota) 스로틀링 문제를 isolcpus·Intel RDT(CAT·MBA) 조합으로 옮겨가는 실무 전환 기준을 다룹니다. 퍼블릭 클라우드의 Noisy Neighbor 현상과 CPU Steal Time의 발생 원리를 mpstat %steal 지표로 분석하고, 인스턴스 타입 선택·전용 호스트·Sole-Tenant 노드·모니터링으로 꼬리 지연을 방어하는 실무 전략을 정리합니다. AMD Zen CPU 전용 프로파일러 uProf를 다룹니다. IBS의 스키드 없는 정밀 샘플링 원리, 전력·열 분석, uProf 5.3의 DuckDB 백엔드·vIBS 등 최신 기능, perf·VTune과의 역할 분담 기준까지 심화 수준으로 정리합니다. bpftrace·BCC로 kprobe·uprobe·USDT를 계측해 커널·유저 공간을 동적으로 관찰하는 방법과, eBPF 기반 CUDA GPU 상시 프로파일링 사례(Polar Signals)로 본 오버헤드 특성·프로덕션 적용 판단 기준을 다룹니다. Flame Graph의 해석 원리(폭=샘플 비중, 스택 병합)와 on-CPU·off-CPU·differential 변형, Brendan Gregg 도구 체인을 다루고, perf 수집부터 병목 프레임 확정까지 실전 워크플로우를 정리합니다. Google Benchmark로 신뢰할 수 있는 마이크로벤치마크를 작성하는 실전 가이드. DoNotOptimize·ClobberMemory의 정확한 의미, Args/Ranges 파라미터화, 반복·통계 옵션, 커스텀 카운터, JSON 출력과 CI 회귀 게이트 연동까지 다룹니다. Intel VTune Profiler의 4대 분석 유형(hotspots, microarchitecture exploration, memory access, threading)의 수집 원리와 해석법, 2026.1의 통합 XPU Offload Analysis(CPU/GPU/NPU)까지 심화 정리합니다. perf stat -d 파생 지표 해석, 이벤트 선택과 정밀 샘플링, perf sched·mem·c2c로 스케줄링 지연과 false sharing 추적, off-CPU 분석과 Linux 6.15 perf --latency의 wall-clock 지연 프로파일링까지 perf 고급 워크플로우를 정리합니다.