Qwen
5 posts
[ML] RIDE: 교사가 도달한 곳이 아니라 움직인 방향을 증류하다
[ML] 출제자와 풀이자가 같은 오답에 합의할 때: CrossFit과 Co-Cheating
[ML] DPO 손실의 절반을 차지하는 69개 토큰: Frequency-Hard DPO
[AI] zg(zvec-grep): 온디바이스 하이브리드 검색으로 에이전트 도구 호출 줄이기
[AI] CoT는 거짓말은 안 해도 다 말하지도 않는다 — 필러 토큰이 숨긴 계산
Home