LangSmithがJevとSemIfを含む意思決定モデルに対応
LangSmithは、JevとSemIfを含む対応済みの意思決定モデルについて、各ステップを可視化する。
LangSmithは、JevとSemIfを含む対応済みの意思決定モデルについて、各ステップを可視化する。
多言語対応のControlled Voice Arenaリーダーボードは、テキスト読み上げモデルを新たに9言語で比較する。言語を選べるリーダーボード、公開投票アリーナ、ベンチマーク手法が公開されている。
Artificial Analysisのランキングで、9言語すべてを首位とするオープンウェイトの音声合成モデルはない。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS、Breeze TTS 2が、それぞれ異なる言語でオープンウェイト分野の首位に立ち、各ボードに含まれるオープンウェイトモデルは2〜6件にとどまる。
Controlled Voice Arenaは、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語のテキスト読み上げモデルを順位付けするようになった。CartesiaのSonicファミリーが9つのボードのうち8つで首位に立ち、Inworld AIのRealtime TTS-2は標準中国語で1位となった。
0.87.1では、Piのライブラリが最新モデルを使えるよう更新され、リリースはpi.devで公開されている。
Expediaは、Museに参加すると述べている。まもなく、行き先を伝えられた個人向けAIエージェントがExpediaと連携し、ホテルからその間の手配まで整理できるようになる。
Artificial Analysisは、StepAudio 3 ASRの文字起こし速度係数を実時間の88倍と報告している。3つのより速いシステムより遅く、ElevenLabs Scribe v2およびGemini 3.5 Transcribeに近く、Fun-Realtime-ASR-previewより速い。
Artificial Analysisによると、StepFunのStepAudio 3 ASRはStepFun API経由で非ストリーミングの文字起こしに利用でき、AA-WER IndexのWERは1.7%でAlibabaのFun-Realtime-ASR-previewと同率、StepAudio 2.5 ASRの4.7%から低下した。文字起こし速度は実時間の88倍、料金は1時間あたり0.40ドル。
Pydanticによると、エージェントはTypeSafe AIのJev分類器を使い、型付きの質問に答える。各エージェントの既存の出力モデルを返し、フィールドごとに1つの信頼度スコアが付く。
Expediaによると、Muse上のパーソナルAIエージェントは、まもなく目的地を受け取り、Expediaと連携してホテルや旅行の他の手配をできるようになる。
OpenCodeでGPT 6 Sol、Luna、Opus 5.5が利用できるようになった。料金、上限、利用条件は示されていない。
OpenAIの2モデルはArenaで試すことができ、実世界のエージェント型タスクへの投票がリーダーボードに反映される。Arena.aiによると、petergostevは同一のプロンプトと最大推論設定でGPT-6 SolとGPT-5.6 Solも比較している。
Piによると、3つのモデルはradius.earendil.comのRadiusで利用できる。
GPT-6 SolはPerplexityとComputerで利用でき、Computerのeffortセレクターでは既定のLightオプションとなっている。
Claudeは、Claude Opus 5.5が本日利用可能だと述べている。この発言は2026年9月22日18:55 UTCに投稿されたもので、プラットフォーム、価格、利用枠、利用資格の条件は示されていない。
Arena.aiでは、両モデルをBattle ModeとAgent Modeで試せる。
OpenAIのGPT-6 SolとGPT-6 Lunaは、Arena.aiのAgent Arenaで試せるようになり、スコアは今後公開される。Code ArenaではWebDev、Text、Vision、Search、Documentでも利用できる。OpenAIは、両モデルがGPT-6 Astraを基盤にしており、API価格はGPT-5.6のプロモーション価格より50%低いと述べている。
GitHub Copilotは、OpenAIDevsのGPT-6ファミリーから2つの追加モデルを一般提供する。対話型およびエージェント型のコーディング向けのGPT-6 Solと、GitHubが小規模なタスク向けの軽量かつ最安の選択肢と呼ぶGPT-6 Lunaである。
DAIR.AIは、適応型MCTS方策で研究エージェントが予算をどこに使うかを選ぶPrimeScientistを紹介している。同じ予算の下で12件のAI研究タスクを比較し、AutoResearchより報酬が10.3%高く、研究試行回数が50.6%少なかったと報告している。
Sam Altman氏は、GPT-6 SolとLunaが知能、アライメント、作業成果、コーディング、コンピュータ利用の点で5.6ファミリーの前モデルから大きく向上し、トークンあたりの価格は半分、タスクあたりではさらに安いと述べている。タスクあたりの価格では、市場に競争力のあるものは見当たらないと考えているという。