Wiki Foundation Model, 연결된 마크다운 위키에서 에이전트 메모리 검색
WFM은 LLM 위키를 그래프로 바꾸고, 질의에 조건화된 메시지 전달로 검색한다. 각 페이지의 텍스트와 페이지 사이 링크가 함께 결과를 만든다. 연구팀은 GPU 간 학습 프로토콜이 10.5배 더 빠르게 학습한다고 밝혔으며, 에이전트 메모리와 다중 홉 추론을 다루는 벤치마크 5개에서 강한 결과를 보고했다.
WFM은 LLM 위키를 그래프로 바꾸고, 질의에 조건화된 메시지 전달로 검색한다. 각 페이지의 텍스트와 페이지 사이 링크가 함께 결과를 만든다. 연구팀은 GPU 간 학습 프로토콜이 10.5배 더 빠르게 학습한다고 밝혔으며, 에이전트 메모리와 다중 홉 추론을 다루는 벤치마크 5개에서 강한 결과를 보고했다.
Perplexity는 힌트 유도 자기 증류로 Computer 모델이 자체 오류로부터 학습하도록 사후 학습했다. 21.2% 감소는 이전 체크포인트 대비라고 밝혔다.
EvolveTrade 논문은 트레이딩 에이전트의 시스템 프롬프트를 정책으로 보고, 별도 Policy Agent가 각 구간 이후 의사결정 기록과 실현 수익률을 바탕으로 프롬프트를 다시 작성하게 한다. 기반 모델은 고정된 채 유지된다. 여러 시장 국면과 두 가지 기반 모델에서, 논문은 대부분 설정에서 고정 프롬프트 기준선보다 높은 샤프 비율과 누적 수익률을 보고한다.
DAIR.AI가 전체 롤아웃으로 모든 수정본을 채점하는 대신 학습된 루브릭을 훈련해 에이전트 스킬 프롬프트 후보의 순위를 매기는 SkillLift 논문을 조명했다. SkillsBench와 WildClawBench에서 SkillOpt와 CoEvoSkills를 능가하고, 목표 성능에 40 to 70% 더 적은 토큰으로 도달했다고 보고한다.
elvis (@omarsar0)가 데이터 에이전트를 위한 자기진화 온톨로지 계층으로 MCP 서버로 제공되는 EvoOntology에 관한 논문을 공유했다. 게시물에 따르면 DDR-Bench 정확도가 6개 백본에서 평균 17.8포인트 상승하며 GPT-5.5의 26.7포인트를 포함하고, BIRD 실행 정확도는 7.4포인트 상승한다.