Wiki Foundation Model 從互相連結的 Markdown wiki 檢索智能體記憶
WFM 把 LLM wiki 轉成圖,並以受查詢條件化的訊息傳遞進行檢索,讓頁面文字與頁面之間的連結共同影響結果。團隊表示,一套 GPU 對 GPU 訓練協議的訓練速度快 10.5 倍,並在五項涵蓋智能體記憶與多跳推理的基準測試中取得強勁結果。
WFM 把 LLM wiki 轉成圖,並以受查詢條件化的訊息傳遞進行檢索,讓頁面文字與頁面之間的連結共同影響結果。團隊表示,一套 GPU 對 GPU 訓練協議的訓練速度快 10.5 倍,並在五項涵蓋智能體記憶與多跳推理的基準測試中取得強勁結果。
Perplexity 以提示引導的自我蒸餾對 Computer 模型進行後訓練,讓模型從自身錯誤中學習。該公司表示,21.2% 的降幅是相對於較早的檢查點。
EvolveTrade 論文把交易代理的系統提示視為其策略,並由另一個 Policy Agent 在每個區間後,根據決策軌跡和已實現回報重寫該提示,骨幹模型則保持凍結。論文報告,在多種市場狀態和兩個骨幹模型下,該方法在大多數設定中的夏普比率和累計回報高於固定提示基線。
DAIR.AI 重點介紹一篇 SkillLift 論文,該論文訓練一個已學習的評分準則,為智能體技能提示候選排名,而非以完整 rollout 為每次修訂評分。報告稱其在 SkillsBench 及 WildClawBench 上擊敗 SkillOpt 和 CoEvoSkills,以少 40 to 70% 的 token 達到目標表現。
elvis(@omarsar0)分享一篇關於 EvoOntology 的論文,此為面向數據代理、以 MCP 伺服器形式提供的自我演化本體層。帖文指 DDR-Bench 準確率在六個骨幹模型上平均上升 17.8 分,當中 GPT-5.5 上升 26.7 分,而 BIRD 執行準確率上升 7.4 分。