Did Codex Reset
GitHub

#ai-agents

모든 AI 뉴스 보기
TGRSS 피드총 37건

Databricks, 한 시간 만에 연간 약 120만 달러의 AI 낭비를 줄였다고 밝혀

Databricks는 Unity Gateway 추적과 Genie One을 통해 MCP 서버 버그 7건을 확인했다고 밝혔다. 이 버그들은 연간 약 49만 9,000달러의 토큰 낭비, 연간 약 1만 2,000시간의 에이전트 대기 시간, 24시간 동안의 도구 오류 1,409건으로 이어졌다. Genie One이 수정 항목의 우선순위를 매겼고, 코딩 에이전트가 한 시간 안에 수정을 마치는 데 도움을 줬다.

Microsoft Autopilot 프리뷰, OpenClaw 기반으로 첫 고객에 배포

Omar Shahine은 지속 작동하는 개인 에이전트인 Microsoft Autopilot의 프리뷰가 Microsoft의 첫 고객에게 제공되고 있으며 OpenClaw 기반으로 구축된다고 말했다. Peter Steinberger는 대규모 배포에 맞춰 코드베이스를 준비하는 Microsoft와의 작업이 3월부터 진행돼 왔다고 말했다.

Taste-Bench 최고 모델, 더 나은 방향을 59.7% 선택

Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.