Did Codex Reset
GitHub

#research

すべてのAIニュースを見る

Wiki Foundation Modelがリンク付きMarkdownウィキからエージェント記憶を検索

WFMはLLMウィキをグラフに変換し、クエリに条件付けたメッセージパッシングで検索する。各ページの本文とページ間のリンクが、ともに結果を形作る。チームによると、GPU間の学習プロトコルは学習速度が10.5倍で、エージェント記憶とマルチホップ推論を扱う5つのベンチマークで高い結果を報告している。

EvolveTradeは各区間の後に取引エージェントのシステムプロンプトを書き換える

EvolveTradeの論文は、取引エージェントのシステムプロンプトを方策として扱い、別のPolicy Agentが各区間の後に意思決定のトレースと実現リターンをもとにそれを書き換える。バックボーンモデルは固定したままである。複数の市場局面と2つのバックボーンモデルにわたり、ほとんどの設定で固定プロンプトのベースラインより高いシャープレシオと累積リターンを報告している。

SkillLift論文、エージェントスキル進化のトークンコスト40~70%削減を報告

DAIR.AIは、フルロールアウトですべての改訂を採点する代わりに、学習したルーブリックを訓練してエージェントのスキルプロンプト候補をランク付けするSkillLift論文を取り上げた。SkillsBenchおよびWildClawBenchでSkillOptとCoEvoSkillsを上回り、40~70%少ないトークン数で目標性能に達したと報告している。

EvoOntology論文、自己進化するオントロジー層がDDR-BenchとBIRDでデータエージェントのスコアを向上と報告

elvis(@omarsar0)が、MCPサーバーとして提供されるデータエージェント向け自己進化オントロジー層EvoOntologyに関する論文を共有した。投稿によると、DDR-Benchの精度は6つのバックボーンで平均17.8ポイント上昇し、GPT-5.5では26.7ポイント、BIRDの実行精度は7.4ポイント上昇するという。