Did Codex Reset
GitHub

AI 뉴스

TGRSS 피드총 435건

SkillLift 논문, 에이전트 스킬 진화에 토큰 비용 40–70% 감소 보고

DAIR.AI가 전체 롤아웃으로 모든 수정본을 채점하는 대신 학습된 루브릭을 훈련해 에이전트 스킬 프롬프트 후보의 순위를 매기는 SkillLift 논문을 조명했다. SkillsBench와 WildClawBench에서 SkillOpt와 CoEvoSkills를 능가하고, 목표 성능에 40 to 70% 더 적은 토큰으로 도달했다고 보고한다.

Command Code, 약 40K개의 가짜 $1 Go 계정 차단하고 비공식 프록시 경고

Command Code는 지난주 $1 Go 플랜에서 약 40,000개의 가짜 계정을 만들고 약 $450,000의 추론을 밀어넣으려 한 사기 조직을 적발했다고 밝혔다. 해당 계정들을 차단하고 신고했으며 프록시를 차단했고, 사용자들에게 비공식 리버스 엔지니어링 프록시를 사용하지 말라고 경고했으며, Pi용 Command Code 프로바이더가 오늘 시작된다고 말했다.

Peter Steinberger: 메타, OpenClaw에서 영감을 받아 자체 에이전트 구축

Peter Steinberger는 유포 중인 “메타가 OpenClaw를 사용한다”는 이야기에 반박하기 위해 Nat Friedman을 인용하며, 자체 에이전트를 구축했고 OpenClaw에서 영감을 받았다고 말했다. Friedman은 Muse를 처음부터 구축했지만 OpenClaw에서 크게 영감을 받았다고 말했다.

Lambda, EGInterpolator가 DRUGS에서 분자 동역학 격차를 줄인다고 보고

Lambda는 EGInterpolator를 풍부한 컨포머 데이터에서 분자 구조를 학습한 후 부족한 MD 궤적에서 운동을 학습하는 Stanford와의 ICLR 2026 공동 연구로 설명했다. DRUGS 벤치마크에서 이 방법이 참조 시뮬레이션과의 격차를 결합각에서 73%, 결합 길이에서 78%, 비틀림 운동에서 24% 줄였다고 밝혔다.

EvoOntology 논문, 자기진화 온톨로지 계층이 DDR-Bench와 BIRD에서 데이터 에이전트 점수를 끌어올린다고 보고

elvis (@omarsar0)가 데이터 에이전트를 위한 자기진화 온톨로지 계층으로 MCP 서버로 제공되는 EvoOntology에 관한 논문을 공유했다. 게시물에 따르면 DDR-Bench 정확도가 6개 백본에서 평균 17.8포인트 상승하며 GPT-5.5의 26.7포인트를 포함하고, BIRD 실행 정확도는 7.4포인트 상승한다.

OpenAI, 수학자들로 구성된 독립 자문 그룹과 협력

OpenAI는 AI와 수학의 발전을 책임감 있게 공유하는 데 도움을 주기 위해 수학자들로 구성된 독립 자문 그룹과 협력하고 있다고 밝혔다. 이 그룹은 새로운 수학적 결과를 평가하고 전달하며, 학술 및 전문 기준을 유지하고, 수학 연구와 학습을 위한 도구를 구축하는 데 조언할 것이다.

AutoTailor, 자동 생성된 웹 API를 1,283개 후보에서 33개로 필터링

DAIR.AI는 Microsoft Research와 동료들의 논문 AutoTailor를 조명했습니다. 이 논문은 웹 궤적을 매개변수화된 브라우저 자동화 API로 변환하고 이를 33개로 필터링합니다. 106개의 WebArena Postmill 작업에서 해당 API와 ReAct 폴백은 ReAct 단독의 87.5% 대비 90.6%의 정확도에 도달했습니다.