2026년 9월 27일 (일)
-
Claude Code로 체스 게임 음성 기반 분석
Claude Code skills가 한 체스 게임을 사람이 읽을 수 있는 포스트모템으로 변환한다. 작성자는 lichess 링크와 경기 중 녹음한 mp3를 주면 whisper.cpp로 로컬 전사하고 PGN의 시계시간과 매칭해 각 수에서 사용자가 무슨 생각을 했는지 연결한다. Claude가 Stockfish에 인간이 묻는 방식으로 반복 질의해 '왜 내 수가 안 되는가'를 설명하고, Stockfish 스윕·주석된 PGN·내레이션 비디오 등을 생성한다. 전체 처리에 약 1시간 걸리며 심사숙고한 게임에 적합하고, skills/chess-analysis/SKILL.md에서 시작하라고 안내하며 결과는 엔진으로 확인하므로 의심스러우면 엔진 재검증을 권장한다.
-
LLM 워터마크가 에이전트 행동에 미치는 영향
Anthropic이 Claude 출력에 Google DeepMind의 SynthID-Text 기반 워터마크를 적용하겠다고 발표했으며, 이는 EU AI Act(Article 50(2))의 기계 판독형 표시 요구와 연관된다. 생성 시점 워터마크는 토큰 샘플링 과정을 바꿔 모델의 거부(refusal) 행동과 프롬프트 인젝션에 대한 강인성뿐 아니라 에이전트가 호출하는 도구와 인수 결정에도 영향을 줄 수 있어 저자들은 이를 'sampling drift'라 명명한다. 실험에서는 거부 행동과 도구 호출에서 워터마크로 인한 변화가 관찰되었고, 효과는 모델·키에 따라 달라집니다; 집계 점수로는 상쇄되어 보일 수 있어 쌍별 불일치와 순성능을 함께 제시해야 한다고 보고한다. 논문은 이 현상이 AI 안전·보안에 주는 의미와 개발자가 취해야 할 조치를 논의한다.
-
Jev 스타일 단일 함수 LLM 래퍼(비전 포함)
작성자는 Jev 방식(LLM의 토큰 확률 읽기)을 단일 함수 래퍼로 구현하고 비전 모델까지 확장했다. 한 토큰 생성만 허용해 logprobs를 얻는 요청 형식을 사용하고, 이미지용 attachments 필드를 추가해 웹캠 프레임을 base64 JPEG로 보내며 질문을 반복해 결과를 표로 출력한다. 예제로 Gemma 4 12B를 RTX 3090에서 쓰면 약 1 FPS, gpt-6-luna에서는 약 0.2 FPS를 얻었고, standalone Python 예제와 llama.cpp·OpenAI API 차이를 처리하는 방법을 제공한다.