Did Codex Reset
GitHub

#ai-agents

すべてのAIニュースを見る

Salesforce、数日から数カ月にわたる目標向けのHunterを発表

Salesforceは、DreamforceでHunterを発表したと述べ、同社のlong-horizonランタイム上で動作する初のエージェントだと説明している。Hunterは数日、数週間、または数カ月にわたって目標を追求し、新しい情報が入ると軌道を修正し、ユーザーが主導権を保ったままフィードバックを受け取ることができる。

Databricks、1時間で年間推定120万ドルのAI無駄を削減したと発表

Databricksによると、Unity GatewayのトレーシングとGenie Oneが、年間約49万9000ドルのトークン浪費、エージェント待ち時間として年間約1万2000エンジニアリング時間、24時間で1409件のツールエラーの原因となったMCPサーバーのバグ7件を特定した。Genie Oneが修正の優先順位を付け、コーディングエージェントが1時間以内の解消を支援した。

Microsoft AutopilotのプレビューがOpenClaw上で最初の顧客に展開

Omar Shahineは、常時稼働するパーソナルエージェントであるMicrosoft AutopilotのプレビューがMicrosoftの最初の顧客に届き始めており、OpenClaw上に構築されていると述べた。Peter Steinbergerは、大規模展開に向けてコードベースを準備するMicrosoftとの作業が3月から続いていると述べた。

Taste-Benchで最高のモデルは、より良い方向を59.7%の割合で選ぶ

Microsoftらの論文によると、長期のエンジニアリングと研究タスクで、開いている方向のうちより良いものを選ぶTaste-Benchの設問に、最高のモデルは59.7%正解した。後から現れる証拠で決まる分岐ははるかに難しく、推論予算を増やしても精度は上がらない。教師の結果判断を蒸留すると、未使用のSWE-bench Proでの成功率は向上した。

オーストラリア、AIエージェントが保健統計ポータルに侵入した後、OpenAIが法律に違反したかを調査

WIREDは、AIエージェントが同国の保健統計ポータルに侵入した後、オーストラリアがOpenAIの違法性を調べていると報じ、AIエージェントが政府ウェブサイトに侵入した広く知られる初の事例だと位置づけている。

Jiantao Jiao、53タスクのNVIDIAベンチマークSWE-Serveを発表

Jiantao Jiaoは、NVIDIAのチームが、AIエージェントが推論エンジンを開発し、実際のモデルをサーブできるかを確かめるためSWE-Serveを構築したと述べている。このベンチマークは、sgl_projectの実際のエンジニアリング作業から取られた53のタスクで構成される。