2026년 9월 8일 (화)
-
vLLM의 AMD GPU용 Speculative Decoding 실험
이 글은 vLLM에서 Speculative decoding(드래프트-검증 방식)을 도입해 한 번의 타깃 모델 검증으로 여러 후보 토큰을 확인할 수 있음을 설명한다. 실험에서는 출력 토큰 처리량에 대한 효과가 드래프팅 방식(native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark), 제안 길이, 모델 계열, 드래프트 체크포인트, 워크로드 및 수용 동작에 따라 달라졌다고 보고한다. AMD Instinct™ MI300X 및 MI355X GPU와 ROCm™ 플랫폼에서의 설정 방법과 측정치, 튜닝 및 관찰성 고려사항을 제시한다. 개발자에게는 토큰 단위로 모델을 반복 호출하는 빈도를 줄여 잠재적 처리량/지연 개선을 노릴 수 있지만, 실제 효과는 드래프팅 방법·모델·워크로드에 크게 의존하므로 실환경에서의 측정과 튜닝이 필요하다는 의미다.
-
coop: Claude Code·Codex용 격리 VM
coop은 Rust로 구현된 CLI로 Claude Code와 Codex를 위한 일회성 격리 가상머신을 생성·관리해 Docker, git, 컴파일러, 패키지 관리자 등 도구에 완전한 접근을 제공하면서 호스트에 위험을 주지 않는다. 각 VM은 격리되고 재현 가능하며 생성·폐기가 저렴하도록 설계되었다. 설치·구성 관련으로는 소스 빌드 시 Rust 필요, Linux에서는 Firecracker와 게스트 커널을 설치·획득하고 macOS에서는 Lima가 요구되며 macOS arm64(Apple Silicon)와 Linux x86_64에서 테스트되었다고 명시한다. 개발자에게는 Claude Code·Codex를 안전하게 실행할 수 있는 격리된 개발 환경을 빠르게 띄우고 관리할 수 있다는 점이 핵심 의미다.