마이크로소프트 논문, CASD 프롬프트 최적화에서 평균 16.6점 향상 보고
CASD는 기성 코딩 에이전트가 에이전트 로그 전체를 분석하고 그 결과를 하나의 프롬프트에 규칙으로 쓰게 하며, 환경 접근이나 검증 데이터는 쓰지 않는다. DAIR.AI는 한 번의 실행이 보고된 벤치마크에서 GEPA와 SkillOpt를 앞섰고, 최적화된 프롬프트당 비용은 약 1.60달러라고 밝혔다.
CASD는 기성 코딩 에이전트가 에이전트 로그 전체를 분석하고 그 결과를 하나의 프롬프트에 규칙으로 쓰게 하며, 환경 접근이나 검증 데이터는 쓰지 않는다. DAIR.AI는 한 번의 실행이 보고된 벤치마크에서 GEPA와 SkillOpt를 앞섰고, 최적화된 프롬프트당 비용은 약 1.60달러라고 밝혔다.
관리자는 Unity Gateway에서 모델, 도구, 정책, 예산을 관리하고, 개발자는 Claude Code, Codex, OpenCode 등 코딩 에이전트를 계속 사용할 수 있다. 구성을 한 번 업데이트하면 지원되는 에이전트 전체에 적용된다.
Claude Code에서 max effort로 실행했을 때 Artificial Analysis가 측정한 Opus 5.5 점수는 66점으로, Opus 5의 60점과 Claude Fable 5.1의 62점을 웃돈다. 작업당 비용은 13.04달러로, 토큰 가격이 낮아졌음에도 Opus 5의 10.79달러보다 높다.
Token Meter는 Splunk가 만든 무료 오픈소스 메뉴 막대 도구로, 실행이 진행되는 동안 코딩 에이전트 비용을 보여 준다.
단기 환경은 스키마와 데이터를 함께 담아 테스트가 프로덕션에 영향을 주지 않는다. 워크플로는 Databricks CLI와 AGENTS.md를 사용해 변경을 상위 브랜치와 비교하고, 승인된 업데이트는 CI/CD를 거친다.
Databricks는 DevHub가 개발자에게 바로 사용할 수 있는 템플릿, 문서, 단계별 안내, 그리고 Cursor, Claude Code, Codex 또는 다른 코딩 에이전트에 복사할 수 있는 에이전트 프롬프트를 제공한다고 밝혔습니다.
elvis(@omarsar0)는 StepFun의 새로운 Step 5 Preview를 코딩 에이전트로 조기 테스트했다고 말한다. 그는 이 모델과 GLM 5.3이 모두 실제 저장소 작업 2건을 수정 라운드 없이 해결했고, Step 5 Preview는 작업을 확인한 뒤 중단했으며, 약 368K토큰 롱컨텍스트 테스트에서 숨겨진 단서 5개를 찾아냈다고 보고한다.