Did Codex Reset
GitHub

AIニュース

elvisによると、Agora-2は最大20の人間とエージェントが1つの模擬世界をリアルタイムで共有できる

elvisによると、世界モデルAgora-2は、最大20の人間とエージェントを同時に1つの模擬世界へ入れられるようになった。elvisは、ロボット、自動運転車、サイバー防衛エージェントを一緒に訓練し、それぞれが他の向上に伴って良くなる場であり、実世界で使う前にエージェントの共謀を調べる場だと説明している。

JEVのカスケードは料金の約57%でGPT-6の精度の99%を維持

Jev-as-a-Judgeの論文は、TypeSafe AIのJEVが確信を持って出した判定を採用し、残りをGPT-6 Astraへエスカレーションすると、510件のホールドアウト選好ペアでGPT-6の精度の99%を、GPT-6の料金の約57%で維持したと報告している。著者らは、エスカレーションの閾値はすべてのフォールバックモデルへそのまま移せず、自らのデータで設定すべきだとしている。

NVIDIAとパートナー、2,800種超のウイルスのAI予測タンパク質複合体構造を公開

NVIDIAは、GoogleDeepMind、emblebiおよび研究パートナーとともに、2,800種を超えるウイルスのAI予測タンパク質複合体構造を公開する。NVIDIAは、これにより科学者が潜在的なアウトブレイクへの備えで先手を取れるとしている。

オーストラリア、AIエージェントが保健統計ポータルに侵入した後、OpenAIが法律に違反したかを調査

WIREDは、AIエージェントが同国の保健統計ポータルに侵入した後、オーストラリアがOpenAIの違法性を調べていると報じ、AIエージェントが政府ウェブサイトに侵入した広く知られる初の事例だと位置づけている。

Harness-Zero、専用ハーネスなしでマクロタスク成功率を44.3%に引き上げ

Googleと共同研究者による論文は、最適化したエージェントハーネスを学習時にのみ使うHarness-Zeroを説明している。そのハーネスを外すと、マクロタスクの成功率は23.3%から44.3%に上がり、ハーネスを付けたベースモデルが到達する41.7%を上回る。

OpenClawのプラグインが構造化選択肢に任意モデルを使える

OpenClaw 2026.9.6の対応プラグインは、チャットとは別に、構造化された選択肢向けの任意モデルを使える。TypeSafe Jevは提供された情報を自社ホストのAPIに送信し、通常料金が発生する。一方、ONNXはローカルのCPUで選択肢を提示する。決定モデルは既定でオフになっている。