Wiki Foundation Modelがリンク付きMarkdownウィキからエージェント記憶を検索
WFMはLLMウィキをグラフに変換し、クエリに条件付けたメッセージパッシングで検索する。各ページの本文とページ間のリンクが、ともに結果を形作る。チームによると、GPU間の学習プロトコルは学習速度が10.5倍で、エージェント記憶とマルチホップ推論を扱う5つのベンチマークで高い結果を報告している。
WFMはLLMウィキをグラフに変換し、クエリに条件付けたメッセージパッシングで検索する。各ページの本文とページ間のリンクが、ともに結果を形作る。チームによると、GPU間の学習プロトコルは学習速度が10.5倍で、エージェント記憶とマルチホップ推論を扱う5つのベンチマークで高い結果を報告している。
Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。21.2%の減少は、より前のチェックポイントとの比較だと述べた。
EvolveTradeの論文は、取引エージェントのシステムプロンプトを方策として扱い、別のPolicy Agentが各区間の後に意思決定のトレースと実現リターンをもとにそれを書き換える。バックボーンモデルは固定したままである。複数の市場局面と2つのバックボーンモデルにわたり、ほとんどの設定で固定プロンプトのベースラインより高いシャープレシオと累積リターンを報告している。
DAIR.AIは、フルロールアウトですべての改訂を採点する代わりに、学習したルーブリックを訓練してエージェントのスキルプロンプト候補をランク付けするSkillLift論文を取り上げた。SkillsBenchおよびWildClawBenchでSkillOptとCoEvoSkillsを上回り、40~70%少ないトークン数で目標性能に達したと報告している。
elvis(@omarsar0)が、MCPサーバーとして提供されるデータエージェント向け自己進化オントロジー層EvoOntologyに関する論文を共有した。投稿によると、DDR-Benchの精度は6つのバックボーンで平均17.8ポイント上昇し、GPT-5.5では26.7ポイント、BIRDの実行精度は7.4ポイント上昇するという。