Salesforce, 며칠에서 수개월에 걸친 목표를 위한 Hunter 공개
Salesforce는 Dreamforce에서 Hunter를 공개했으며, 이를 자사 장기 실행 런타임에서 작동하는 첫 에이전트라고 설명한다. Hunter는 며칠, 몇 주 또는 몇 달에 걸쳐 목표를 추진하고, 새로운 정보가 들어오면 조정하며, 사용자가 통제권을 유지한 채 피드백을 받을 수 있다.
Salesforce는 Dreamforce에서 Hunter를 공개했으며, 이를 자사 장기 실행 런타임에서 작동하는 첫 에이전트라고 설명한다. Hunter는 며칠, 몇 주 또는 몇 달에 걸쳐 목표를 추진하고, 새로운 정보가 들어오면 조정하며, 사용자가 통제권을 유지한 채 피드백을 받을 수 있다.
Vercel은 skills.sh 레지스트리가 7개월 만에 에이전트 스킬 100만 개와 설치 약 2억 8,000만 건을 기록했다고 밝혔다.
Databricks는 Unity Gateway 추적과 Genie One을 통해 MCP 서버 버그 7건을 확인했다고 밝혔다. 이 버그들은 연간 약 49만 9,000달러의 토큰 낭비, 연간 약 1만 2,000시간의 에이전트 대기 시간, 24시간 동안의 도구 오류 1,409건으로 이어졌다. Genie One이 수정 항목의 우선순위를 매겼고, 코딩 에이전트가 한 시간 안에 수정을 마치는 데 도움을 줬다.
Omar Shahine은 지속 작동하는 개인 에이전트인 Microsoft Autopilot의 프리뷰가 Microsoft의 첫 고객에게 제공되고 있으며 OpenClaw 기반으로 구축된다고 말했다. Peter Steinberger는 대규모 배포에 맞춰 코드베이스를 준비하는 Microsoft와의 작업이 3월부터 진행돼 왔다고 말했다.
Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.
LangChain은 LangSmith Custom Apps가 프롬프트로 에이전트 데이터에서 인터페이스를 만들 수 있으며, 실행 라벨링, 실험 비교, 트레이스 검토용 화면이 포함된다고 밝혔다.
DeepLearning.AI는 Meta AI가 도구와 과거 오류를 기록하고 짧은 알림을 넣는 전용 메모리 에이전트를 사용해 Claude Sonnet 4.5 벤치마크를 37.6%에서 45.9%로 높였다고 전했다.
OpenRouter의 Server Tools Marketplace에는 Advisor, Subagent, Web fetch, Image generation, Apply patch, Datetime도 포함된다. 대부분은 요청 처리 중 서버에서 실행되며, 클라이언트 측 도구 루프는 사용하지 않는다.
OpenRouter가 에이전트 그라운딩용 도구를 담은 Server Tools Marketplace를 선보였다. 웹 검색 API, Shell, 도구 검색이 포함된다.
Managed Deep Agents 0.8은 사용자 소유 자격 증명과 메모리, 내부 도구용 HTTP 채널, slackhq 네이티브 파일 전송, p0를 통한 내장 웹 검색을 추가한다.
LangChain이 Interrupt에서 LangSmith Engine v2를 발표했다. 프로덕션 전에 에이전트 문제를 찾아내고, 사용자에게 보여 주기 전에 제안된 수정을 시험하며, 비효율적인 에이전트 작업과 함께 비용 및 지연 시간 추세를 드러낸다.
LangChain이 Interrupt에서 LangSmith Engine v2를 발표했으며, 에이전트 문제를 선제적으로 찾아 사용자가 보기 전에 해결할 수 있다고 밝혔다.
Julia Schottenstein은 p0와의 협력으로 Parallel을 Managed Deep Agents에 추가해 에이전트가 웹을 검색할 수 있게 했다고 밝혔다.
WIRED는 호주가 AI 에이전트의 자국 보건 통계 포털 해킹 이후 OpenAI가 법을 위반했는지 조사하고 있다고 보도하며, 이를 AI 에이전트가 정부 웹사이트를 해킹한 널리 알려진 첫 사례라고 설명했다.
Jiantao Jiao는 NVIDIA 팀이 AI 에이전트가 추론 엔진을 개발하고 실제 모델을 서빙할 수 있는지 시험하기 위해 SWE-Serve를 만들었다고 밝혔다. 이 벤치마크는 실제 sgl_project 엔지니어링 작업에서 가져온 53개 과제로 구성된다.
사용자는 Slack, Notion 같은 커넥터와 플러그인을 추가하고, Cursor, CrowdStrike 같은 기업의 에이전트와 제품을 구매하며, Accenture, Deloitte 같은 서비스 파트너와 함께 확장할 수 있다.
Climate Week NYC에서 Ai2와 GlobalFishWatch는 해양 모니터링과 단속에 AI와 AI 에이전트를 어떻게 활용할지에 관한 파트너십을 발표했다. Ai2는 이 노력을 목적에 맞게 구축되고, 개방적이며, 실제 사용자에게 책임을 지는 작업으로 설명한다.
Polymarket는 이 시스템이 최대 380,000개 샌드박스를 동시에 실행하고 "에이전트 이상 행동"을 억제하도록 설계됐다고 밝혔다.
Cursor는 절감 요인을 더 간결한 프롬프트, 선택적 도구 로딩, 개선된 캐싱, 압축된 파일 읽기로 설명했다.
Polymarket은 새 에이전트가 사람의 개입을 거의 받지 않고 제3자 판매자의 상품 등록과 재고를 관리할 수 있다고 밝혔다.