SkillLift 논문, 에이전트 스킬 진화에 토큰 비용 40–70% 감소 보고
DAIR.AI가 전체 롤아웃으로 모든 수정본을 채점하는 대신 학습된 루브릭을 훈련해 에이전트 스킬 프롬프트 후보의 순위를 매기는 SkillLift 논문을 조명했다. SkillsBench와 WildClawBench에서 SkillOpt와 CoEvoSkills를 능가하고, 목표 성능에 40 to 70% 더 적은 토큰으로 도달했다고 보고한다.
DAIR.AI가 전체 롤아웃으로 모든 수정본을 채점하는 대신 학습된 루브릭을 훈련해 에이전트 스킬 프롬프트 후보의 순위를 매기는 SkillLift 논문을 조명했다. SkillsBench와 WildClawBench에서 SkillOpt와 CoEvoSkills를 능가하고, 목표 성능에 40 to 70% 더 적은 토큰으로 도달했다고 보고한다.
Google Gemini가 사용자들을 화요일, 9월 22일 오전 11시 PT에 Discord에서 Gemini로 쇼핑하는 라이브 데모에 초대했으며, 정보에 기반한 구매, 옵션 비교, 카메라 기반 브라우징을 다룹니다.
Runway는 새로운 확장된 Workflows가 이제 이용 가능하며 Compositing, Alpha, HDR, Depth Map 및 RGB Depth를 추가했다고 밝혔습니다.
WIRED는 애플이 완전히 새로운 M6 칩으로 맥 미니를 리프레시했다고 보도했으며, 이번 업데이트가 그 어느 때보다 AI에 더 초점을 맞추고 있다고 설명했다.
TypeSafe AI는 Jev가 이제 이용 가능하다고 밝히며 https://console.typesafe.ai 링크를 게시했습니다. 해당 게시물은 Jev가 무엇인지 또는 어떠한 접근 조건도 명시하지 않았습니다.
Command Code는 지난주 $1 Go 플랜에서 약 40,000개의 가짜 계정을 만들고 약 $450,000의 추론을 밀어넣으려 한 사기 조직을 적발했다고 밝혔다. 해당 계정들을 차단하고 신고했으며 프록시를 차단했고, 사용자들에게 비공식 리버스 엔지니어링 프록시를 사용하지 말라고 경고했으며, Pi용 Command Code 프로바이더가 오늘 시작된다고 말했다.
Amazon Science는 Amazon Bio Discovery가 항체 약물 설계를 가속화하기 위해 MochiBind, CA-MAP, 에이전트 가이드 설계 시스템을 개발했으며, 새로운 암 표적에 대해 실험실에서 검증된 히트 46건을 보고했다고 밝혔다.
Peter Steinberger는 유포 중인 “메타가 OpenClaw를 사용한다”는 이야기에 반박하기 위해 Nat Friedman을 인용하며, 자체 에이전트를 구축했고 OpenClaw에서 영감을 받았다고 말했다. Friedman은 Muse를 처음부터 구축했지만 OpenClaw에서 크게 영감을 받았다고 말했다.
Lambda는 EGInterpolator를 풍부한 컨포머 데이터에서 분자 구조를 학습한 후 부족한 MD 궤적에서 운동을 학습하는 Stanford와의 ICLR 2026 공동 연구로 설명했다. DRUGS 벤치마크에서 이 방법이 참조 시뮬레이션과의 격차를 결합각에서 73%, 결합 길이에서 78%, 비틀림 운동에서 24% 줄였다고 밝혔다.
Cline은 Grok 4.7이 Cline에서 제공되며 9/27까지 40% 할인이 적용된다고 밝혔다. 또한 해당 모델은 DeepSWE에서 GPT 5.6 Sol 및 Fable 5.1에 근접한 점수를 기록하며, TPS가 높고 비용은 약 8배 저렴하다고 전했다.
Forbes는 사이버보안 연구자들이 버그 바운티 프로그램의 일환으로 Anthropic의 Claude를 사용해 OpenAI의 내부 시스템을 침해했다고 보도했다.
GitHub는 엔지니어 1명과 에이전트 팀이 GitHub Copilot 에이전트 런타임을 Rust로 이식해 코드 품질을 유지하면서 800,000줄의 프로덕션 코드를 출시했다고 밝혔다.
elvis (@omarsar0)가 데이터 에이전트를 위한 자기진화 온톨로지 계층으로 MCP 서버로 제공되는 EvoOntology에 관한 논문을 공유했다. 게시물에 따르면 DDR-Bench 정확도가 6개 백본에서 평균 17.8포인트 상승하며 GPT-5.5의 26.7포인트를 포함하고, BIRD 실행 정확도는 7.4포인트 상승한다.
LangChain은 nathan drezner를 인용하고 Typesafe AI의 Jev 미들웨어 공식 문서를 링크했으며, 이 미들웨어는 사용자가 경로를 정의한 후 LangChain 관리형 딥 에이전트의 모델 선택을 처리할 수 있다.
OpenAI는 AI와 수학의 발전을 책임감 있게 공유하는 데 도움을 주기 위해 수학자들로 구성된 독립 자문 그룹과 협력하고 있다고 밝혔다. 이 그룹은 새로운 수학적 결과를 평가하고 전달하며, 학술 및 전문 기준을 유지하고, 수학 연구와 학습을 위한 도구를 구축하는 데 조언할 것이다.
Alexandr Wang은 Muse가 모든 Shopify 스토어에서 Shop Pay를 통한 에이전틱 체크아웃을 가능하게 하기 위해 Shopify와 제휴하고 있으며, Muse 사용자에게 다양한 스토어에 대한 접근을 제공하는 것이 목표라고 말했다.
Nathan Drezner는 TypeSafe AI의 Jev 미들웨어를 LangChain 관리형 딥 에이전트와 함께 모델 라우팅에 사용할 수 있다고 말합니다. 사용자는 경로를 정의하고 Jev가 모델 선택을 처리합니다.
DAIR.AI는 Microsoft Research와 동료들의 논문 AutoTailor를 조명했습니다. 이 논문은 웹 궤적을 매개변수화된 브라우저 자동화 API로 변환하고 이를 33개로 필터링합니다. 106개의 WebArena Postmill 작업에서 해당 API와 ReAct 폴백은 ReAct 단독의 87.5% 대비 90.6%의 정확도에 도달했습니다.
OpenCode는 Grok 4.7이 다음 주 동안 30% 할인된다고 밝혔다.
ChatGPT는 사용자가 Experian 신용 보고서와 VantageScore 3.0을 안전하게 연결하여 이제 신용 점수를 추적할 수 있다고 밝혔다. 이 기능은 미국 Plus 및 Pro 사용자를 대상으로 웹과 최신 iOS 및 Android 앱의 Finances에서 제공된다.