AI-Safety
8 posts
[AI] OpenAI 미공개 모델의 Hugging Face 침투, 세 개의 '에이전트 문명'
[Claude Code] Auto Mode를 뚫은 ZIP 임포트 셰도잉 — 정화 명령까지 막은 안전장치
[AI] 멀티에이전트 조율 실패 — Claude들이 담합하고 서로 공격한 이유
[AI] CoT는 거짓말은 안 해도 다 말하지도 않는다 — 필러 토큰이 숨긴 계산
[AI] Claude 사이버보안 평가 사고 3건 — 시뮬레이션이 현실이 됐을 때
[AI] 환각은 버그가 아니라 압축의 대가다 — LLM 지식 저장의 중첩(Superposition)
[AI] dcg: AI 코딩 에이전트의 rm -rf를 막는 파괴적 명령 차단 후크
[Claude Code] Auto Mode 기본값 전환: 사람의 승인은 왜 못 미더운가
Home