SkillLift論文、エージェントスキル進化のトークンコスト40~70%削減を報告
DAIR.AIは、フルロールアウトですべての改訂を採点する代わりに、学習したルーブリックを訓練してエージェントのスキルプロンプト候補をランク付けするSkillLift論文を取り上げた。SkillsBenchおよびWildClawBenchでSkillOptとCoEvoSkillsを上回り、40~70%少ないトークン数で目標性能に達したと報告している。
DAIR.AIは、フルロールアウトですべての改訂を採点する代わりに、学習したルーブリックを訓練してエージェントのスキルプロンプト候補をランク付けするSkillLift論文を取り上げた。SkillsBenchおよびWildClawBenchでSkillOptとCoEvoSkillsを上回り、40~70%少ないトークン数で目標性能に達したと報告している。
Google Geminiはユーザーを、太平洋時間9月22日火曜日午前11時にGeminiを使ったショッピングのライブDiscordデモへ招待し、情報に基づく購入、オプションの比較、カメラベースのブラウジングをカバーする。
Runwayは、Compositing、Alpha、HDR、Depth Map、RGB Depthを追加した新しい拡張Workflowsが現在利用可能だと発表した。
WIREDは、Appleが全く新しいM6チップでMac Miniを刷新したと報じ、今回のアップデートはこれまで以上にAIに重点を置いていると述べている。
TypeSafe AIはJevが現在利用可能であると述べ、https://console.typesafe.ai にリンクしました。投稿ではJevが何であるかやアクセス条件は指定されていませんでした。
Command Codeは先週、同社の$1 Goプランで約40,000件の偽アカウントを作成し、約$450,000の推論を押し通そうとした詐欺グループを摘発したと述べた。同社はアカウントを禁止・報告し、プロキシを遮断し、非公式のリバースエンジニアリングされたプロキシを使用しないようユーザーに警告し、Pi向けのCommand Codeプロバイダーが本日開始すると述べた。
Amazon Scienceによると、Amazon Bio Discoveryは抗体医薬品設計を加速するためMochiBind、CA-MAP、およびエージェント誘導型設計システムを開発し、新規がん標的に対して46件の実験室検証済みヒットを報告した。
Peter Steinbergerは流布している「MetaがOpenClawを使用している」という話に反論するためNat Friedmanを引用し、彼らは独自のエージェントを構築し、OpenClawに着想を得たと述べた。Friedmanは、Museはゼロから構築されたが、OpenClawに強く着想を得ていると述べた。
Lambdaは、EGInterpolatorをStanfordとのICLR 2026の研究として説明し、豊富なコンフォーマーデータから分子構造を学習してから、乏しいMD軌跡から運動を学習するとした。DRUGSベンチマークでは、この手法が参照シミュレーションとのギャップを結合角で73%、結合長で78%、ねじれ運動で24%縮小したと述べた。
Clineは、Grok 4.7がClineで利用可能になり、9/27まで40%オフだと述べた。同社はまた、このモデルはDeepSWEでGPT 5.6 SolおよびFable 5.1に近いスコアを記録し、高いTPSでコストは約8倍安いと述べた。
Forbesは、サイバーセキュリティ研究者がバグバウンティプログラムの一環としてAnthropicのClaudeを使用してOpenAIの内部システムに侵入したと報じた。
GitHubは、1人のエンジニアとエージェントのチームがGitHub CopilotエージェントランタイムをRustに移植し、コード品質を維持しながら80万行の本番コードを出荷したと述べた。
elvis(@omarsar0)が、MCPサーバーとして提供されるデータエージェント向け自己進化オントロジー層EvoOntologyに関する論文を共有した。投稿によると、DDR-Benchの精度は6つのバックボーンで平均17.8ポイント上昇し、GPT-5.5では26.7ポイント、BIRDの実行精度は7.4ポイント上昇するという。
LangChainはnathan dreznerを引用し、Typesafe AIのJevミドルウェアの公式ドキュメントをリンクした。このミドルウェアは、ユーザーがルートを定義した後、LangChainのマネージドディープエージェントのモデル選択を処理できる。
OpenAIは、AIと数学の進歩を責任を持って共有するために、数学者による独立諮問グループと協力していると述べた。このグループは、新しい数学的成果の評価と伝達、学術的および専門的基準の維持、数学研究と学習のためのツール構築について助言する。
Alexandr Wangは、MuseがShopifyと提携してすべてのShopifyストアでShop Payによるエージェント型チェックアウトを可能にすると述べ、Museユーザーに幅広いストアへのアクセスを提供することを目指していると語った。
Nathan Drezner氏は、TypeSafe AIのJevミドルウェアをLangChain管理のディープエージェントでモデルルーティングに使用できると述べています。ユーザーがルートを定義すると、Jevがモデル選択を処理します。
DAIR.AIは、Microsoft Researchとその同僚による論文AutoTailorを取り上げた。この論文はWeb軌跡をパラメータ化されたブラウザ自動化APIに変換し、それらを33件に絞り込む。106件のWebArena Postmillタスクにおいて、これらのAPIとReActフォールバックの組み合わせは90.6%の正確性に達し、ReAct単独の87.5%を上回った。
OpenCodeは、Grok 4.7が今後1週間30%オフだと述べた。
ChatGPTは、ユーザーがExperianのクレジットレポートとVantageScore 3.0を安全に接続することでクレジットスコアを追跡できるようになったと述べました。この機能は、米国のPlusおよびProユーザー向けのFinancesで、ウェブおよび最新のiOSとAndroidアプリで利用可能です。