HassanがTev1 0.8Bを訓練、Jevに似た小型分類器
このモデルはOllamaを通じてHassanのMac上で完全に動作し、本人の説明ではタスク分類をエンドツーエンドで約50ミリ秒で行う。重みとベンチマークはまだ公開されておらず、Hassanは両方を近いうちに公開すると述べている。
このモデルはOllamaを通じてHassanのMac上で完全に動作し、本人の説明ではタスク分類をエンドツーエンドで約50ミリ秒で行う。重みとベンチマークはまだ公開されておらず、Hassanは両方を近いうちに公開すると述べている。
SmolDataEnvsは、コードとデータサイエンスで小規模モデルをヒルクライミングするための、検証可能な強化学習環境タスク5,000件超からなるオープンソースのセットです。公開内容には環境、評価、学習が含まれます。
Gemini 3.8 FlashがClineで無料になる。Clineによると、Artificial Analysis Intelligence Indexのスコアは41、処理速度は毎秒291トークン、コンテキストウィンドウは100万トークン。
DeepLearning.AIによると、Meta AIは専用メモリエージェントを使い、ツールと過去の誤りを記録して短いリマインダーを挿入し、Claude Sonnet 4.5のベンチマークを37.6%から45.9%に引き上げた。
David Singletonによると、すべてのMuseユーザーに無料のクラウドコンピュータ「Muse Secure VM」が提供される。ユーザーのMuseエージェントと共有する隔離されたUbuntu環境で、機密性の高い操作と保存された秘密情報はその外に置かれる。
PerplexityのPortable Computerは同社のWindowsアプリ上で動作し、ConsumerおよびEnterpriseのProとMaxの全加入者が利用できる。
Perplexityによると、Portable ComputerはSlack、Gmail、Google Driveなどの接続済みアプリと、端末上のファイルに対応する。完全にローカルで実行するタスクは、ファイル、データ、回答を端末内に保持し、Computerクレジットを消費しない。
PerplexityのWindows向けPortable Computerが、AMD Ryzen AI Maxシリーズプロセッサー上で動作するようになった。接続済みアプリとローカルファイルを使うローカルAIエージェントを備え、スケジュールした処理を端末上だけで実行できる。
defer_loadingとマークされた関数は、モデルが必要になったときに検索され、ターンごとにすべての定義が送られることはない。OpenRouterは、ツール検索に追加料金はないとしている。
OpenRouterのServer Tools Marketplaceには、Advisor、Subagent、Web fetch、Image generation、Apply patch、Datetimeも含まれる。大半はリクエスト中にサーバー側で動作し、クライアント側のツールループは使わない。
OpenRouterは、エージェントをグラウンディングするためのツールとして、ウェブ検索API、Shell、ツール検索を含むServer Tools Marketplaceを導入した。
Managed Deep Agents 0.8では、ユーザー所有の認証情報とメモリ、社内ツール向けのHTTPチャネル、slackhqのネイティブなファイル転送、p0経由の組み込みWeb検索が追加される。
elvisによると、世界モデルAgora-2は、最大20の人間とエージェントを同時に1つの模擬世界へ入れられるようになった。elvisは、ロボット、自動運転車、サイバー防衛エージェントを一緒に訓練し、それぞれが他の向上に伴って良くなる場であり、実世界で使う前にエージェントの共謀を調べる場だと説明している。
Sakana AIは、Schmidhuberが新たに設置したRSI Labの運営を支援すると述べた。同ラボの目的は、機械知能の向上を目指す科学的発見の複利的な循環を引き起こすことだ。同社は東京でラボの専門家を集めている。
Jev-as-a-Judgeの論文は、TypeSafe AIのJEVが確信を持って出した判定を採用し、残りをGPT-6 Astraへエスカレーションすると、510件のホールドアウト選好ペアでGPT-6の精度の99%を、GPT-6の料金の約57%で維持したと報告している。著者らは、エスカレーションの閾値はすべてのフォールバックモデルへそのまま移せず、自らのデータで設定すべきだとしている。
LangChainはInterruptでLangSmith Engine v2を発表した。本番前にエージェントの問題を特定し、提案された修正をユーザーに示す前にテストし、非効率なエージェントの処理とともにコストとレイテンシの傾向を示す。
LangChainはInterruptでLangSmith Engine v2を発表し、エージェントの問題を事前に見つけ、ユーザーが目にする前に解決できるとしている。
NVIDIAは、GoogleDeepMind、emblebiおよび研究パートナーとともに、2,800種を超えるウイルスのAI予測タンパク質複合体構造を公開する。NVIDIAは、これにより科学者が潜在的なアウトブレイクへの備えで先手を取れるとしている。
Julia Schottensteinは、p0との提携によりParallelがManaged Deep Agentsに追加され、エージェントがウェブを検索できるようになると述べている。
Row ZeroがDatabricksに加わるのに伴い、同社はDatabricks Genieにネイティブで完全にガバナンスされたスプレッドシート体験を導入する。Unity Catalogによるエンタープライズ級のセキュリティとリネージを備える。