Armin Ronacher가 CLI 에이전트 Pi에서 발견한 현상 — Claude Opus 4.8·Sonnet 5가 구형 모델보다 서드파티 도구 스키마에서 더 자주 실패하는 이유와, Claude Code 특화 학습의 대가, Anthropic의 공식 해법인 Strict Tool Use를 정리했다.
hot path를 최적화해도 체감 지연은 그대로일 수 있다. 지연을 결정하는 건 critical path이기 때문이다. 계측을 새로 심을 수 없는 임베디드 멀티 데몬 시스템에서 Mystery Machine·lprof부터 Canopy·Google CPT까지 로그만으로 인과관계를 재구성해온 연구를 정리한다.
장애 원인을 찾을 때 로그 전체를 LLM에 그대로 넣으면 컨텍스트 초과와 환각이 뒤따른다. Drain 파싱, LogBERT 이상탐지, RAG 검색으로 후보를 좁힌 뒤 LLM이 최종 판단만 내리는 3단계 파이프라인과 Microsoft·Meta의 프로덕션 실측 수치를 정리한다.
2026-08-14부터 Claude Code 기본값이 된 Auto Mode의 근거 실험(수동 승인 13.6%·분류기 89% 차단율)과 Apollo Research·Trajectory Labs 레드팀 결과, Simon Willison의 prompt injection 우려를 정리했다.
테스트와 리뷰를 통과한 버그가 프로덕션에서 터지는 건 그 상태 조합을 아무도 실행해본 적이 없어서다. AWS 7개 팀과 MongoDB가 TLA+ 모델체킹으로 잡아낸 경쟁 상태 사례와 PlusCal 코드로, 형식 검증과 property-based testing을 언제 쓸지 정리한다.
긴 컨텍스트·대형 vocabulary LLM 학습에서 cross-entropy가 만드는 거대한 logits 텐서 메모리 병목을, Fused Linear Cross-Entropy(FLCE)가 청크 단위 계산으로 없애는 원리를 Liger Kernel 구현과 실측 벤치마크(최대 84% 절감)로 설명한다.