/
https://42jerrykim.github.io/ _index.md
DVFS와 P-state/C-state, Intel Turbo Boost·AMD Precision Boost 2의 동작 원리를 다루고 Linux governor 선택이 지연시간 일관성과 p99 tail latency에 미치는 영향을 정리합니다. 현대 CPU가 fetch·decode·execute·writeback 단계를 겹쳐 실행하는 파이프라인 구조와 슈퍼스칼라·IPC 개념, 구조적·데이터·제어 해저드를 정리합니다. 분기 예측·Out-of-Order 실행 등 후속 챕터가 딛고 설 기초 모델을 세웁니다. PMU 하드웨어 카운터와 TopDown Microarchitecture Analysis(TMA) 트리를 이 트랙의 각 마이크로아키텍처 챕터에 연결하고, 하이브리드 코어의 perf --cputype 분리와 TMA의 신규 메트릭 HBM_Bound를 심화 수준으로 다룹니다. TopDown 분석의 기초 직관을 다룹니다. Pipeline Slot 단위로 Frontend Bound·Bad Speculation·Backend Bound·Retiring 네 병목 범주를 구분하고, perf stat -M TopdownL1로 실측해 후속 심화 챕터로 이어지는 분류 습관을 정리합니다. Out-of-Order 엔진의 핵심 구조인 reorder buffer·reservation station과 레지스터 리네이밍의 내부 동작을 다루고, ROB 크기가 메모리 수준 병렬성과 실제 지연시간에 미치는 영향을 벤치마크로 확인합니다. RISC-V ISA의 모듈형 설계(베이스+확장)와 RVA23 프로파일, RVV 벡터 확장의 vector-length-agnostic 모델을 다루고, 임베디드부터 서버·AI 가속 코어까지 확장 조합이 성능에 미치는 실무 판단 기준을 정리합니다. 동시 멀티스레딩(SMT/Hyper-Threading)이 물리 코어 자원을 두 논리 스레드로 나누는 구조와 캐시·실행 포트·분기 예측기 경합이 만드는 성능 간섭, 저지연 워크로드에서 SMT를 끄거나 격리하는 판단 기준을 정리합니다. TLB(Translation Lookaside Buffer) 구조와 페이지 워크 비용, huge page(hugetlbfs·THP)가 TLB 압력을 줄이는 원리를 다루고, perf 카운터와 /proc/vmstat으로 TLB 미스와 THP 동작을 진단·완화하는 실무 판단 기준을 정리합니다. DSB(Decoded Stream Buffer)와 μOp 캐시가 디코더 병목을 우회하는 구조, 32바이트 코드 윈도우와 way 제약이 적중률에 미치는 영향, perf 카운터로 프런트엔드 경로를 측정하는 방법을 정리합니다. ILP(명령 수준 병렬성)의 정의와 슈퍼스칼라 실행 구조, 데이터 의존성(RAW/WAR/WAW)이 파이프라인 처리량을 제약하는 방식을 다룹니다. 의존 체인을 끊어 병렬성을 확보하는 코드 패턴과 ILP의 실질적 한계를 함께 정리합니다.