2026년 8월 13일 (목)
-
Claude Code 2.1.229 업데이트 내역
Claude Code 2.1.229은 원격 제어 세션 재개를 위한 claude remote-control --continue 문서화, 자체 호스팅 러너 세션에 서버 제공 Claude Code 훅 추가(관리형 환경과 일치), 긴 사고 중단 시 Vertex와 Bedrock 업스트림에서 유휴 타임아웃 연결을 방지하는 게이트웨이 스트리밍의 SSE keepalive 핑 추가 등 기능을 추가했다. 플러그인 마켓플레이스에 로컬 명령을 소스화하는 기능과 ListAgents의 원격 제어 세션 상태 표기(offline, cloud) 등이 포함되며, 스트리밍 중 응답 일부 소실 및 중복 출력, 여러 플랫폼·경로 관련 크래시, 파일 감시자 누수, SDK 및 --input-format stream-json의 공백 메시지 400 오류, 32MB 요청 제한과 관련한 재시도 동작 등 다수의 버그가 수정됐다. MCP OAuth 리디렉트 URI에서 localhost 대신 127.0.0.1 사용, CLAUDE_CODE_ATTRIBUTION_HEADER 비활성화 시 자동 모드 문제 수정, /model 관련 Sonnet/Opus 1M 거부 문제 등 구체적 수정사항도 포함되어 있다. 본문 마지막
-
Material Discovery Bench로 3D 칩용 소재 탐색
Material Discovery Bench는 반도체 업계의 3D 패키징을 가능하게 할 열전도성 절연체 소재를 찾는 장기·개방형 연구 벤치마크로, 모델들이 새로운 소재를 다중 목표 제약(κ > 20 W/(m·K), ε₀ < 10, Young’s modulus ≥ 20 GPa, shear modulus ≥ 6 GPa, 동적 안정성)을 동시에 만족해야 성공으로 인정한다. Claude Fable, Claude Opus, GPT-5.6 sol, Kimi K3 같은 최첨단 모델들이 후보 물질을 찾아냈고, 각 후보에 대해 실험자가 시도할 수 있는 합리적 합성 레시피도 제안하도록 요청했다. 그러나 모든 모델의 합성 레시피 평가는 전반적으로 부진했고, Opus-5와 Kimi-K3는 특히 치명적 결함이 많은 반면 GPT-5.6 Sol이 유일하게 실현 가능한 레시피를 제출해 상대적으로 성과가 좋았다. 레시피 채점은 박사·포스닥·교수 등 전문가들이 설계한 루브릭으로 검토·보정된 LLM 그레이더로 수행되었다.
-
LLM이 잘하는 수학 분야는 무엇인가?
저자는 OpenAI가 비소픽 군의 비정형 구성과 다색 Ramsey 수의 초지수 성장 증명 등 열 가지 주요 문제를 해결했다고 발표한 직후 이 글을 썼다고 밝히며, LLM 역량이 빠르게 변하고 있음을 전제한다. LLM이 모든 수학 분야에서 인간을 능가하는 것은 아니며, 특히 LLM의 유명한 성과들이 반례 발견인 경우가 많다는 점을 지적한다. 반례 발견을 LLM이 잘하는 이유를 주장하려면 먼저 '반례 발견'의 정의를 명확히 하고, 그 특정 유형의 문제에서 LLM이 유리한 이유를 제시해야 한다고 논한다.
-
프라이빗 LLM API의 추론 흔적 유출 연구
연구진은 Anthropic, OpenAI, Google이 암호화된 chain-of-thought 블록을 클라이언트에 반환하며 이를 세션·사용자·모델 간 재생(replay)할 수 있음을 보여주었다. 동일 모델 계열 내에서 같은 암호화 키를 쓰는 사례를 이용해 강력한 모델의 추론 흔적을 약한 모델에 주입하면 약한 모델을 탈옥시켜 원래 암호화된 추론을 평문으로 복원할 수 있었고, 해당 취약점은 리포트 후 공급자들이 인지하여 현재는 재현되지 않는 것으로 보인다고 밝혔다. 논문은 추론 흔적 예시와 함께 생각(트레이스)을 악용한 프롬프트 인젝션 변종 등 상세한 복원 사례를 부록에 수록했다.