LangSmith 现已支持包括 Jev 和 SemIf 在内的决策模型
LangSmith 为受支持的决策模型提供每一步的可见性,包括 Jev 和 SemIf。
LangSmith 为受支持的决策模型提供每一步的可见性,包括 Jev 和 SemIf。
多语言 Controlled Voice Arena 排行榜比较 9 种新语言的文本转语音模型。现已提供可按语言筛选的排行榜、公开投票竞技场和评测方法。
在 Artificial Analysis 的排名中,没有任何单一开放权重文本转语音模型在全部九种语言上领先。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS 和 Breeze TTS 2 分别在不同语言的开放权重榜上居首,且每个榜单只收录 2 到 6 个开放权重模型。
Controlled Voice Arena 现已对日语、普通话、印地语、西班牙语、德语、法语、葡萄牙语、越南语和阿拉伯语的文本转语音模型进行排名。Cartesia 的 Sonic 系列在九个榜单中的八个领先,Inworld AI 的 Realtime TTS-2 在普通话榜单排名第一。
0.87.1 版本更新了 Pi 的库,使其可使用最新模型,发布信息刊登在 pi.dev。
Expedia 表示将加入 Muse。不久后,得知目的地的个人 AI 智能体将能与 Expedia 协作,整理酒店及途中各项安排。
Artificial Analysis 报告,StepAudio 3 ASR 的转写速度为实时的 88 倍,落后于三个更快的系统,接近 ElevenLabs Scribe v2 与 Gemini 3.5 Transcribe,并领先于 Fun-Realtime-ASR-preview。
Artificial Analysis 称,StepFun 的 StepAudio 3 ASR 已可通过 StepFun API 进行非流式转写,在 AA-WER Index 上的词错误率为 1.7%,与阿里巴巴的 Fun-Realtime-ASR-preview 并列,低于 StepAudio 2.5 ASR 的 4.7%。其转写速度为实时的 88 倍,价格为每小时 0.40 美元。
Pydantic 表示,这些智能体使用 TypeSafe AI 的 Jev 分类器回答类型化问题,并按每个智能体已有的输出模型返回结果,每个字段附带一个置信度分数。
Expedia 表示,Muse 上的个人 AI 智能体很快就能接收目的地,并与 Expedia 合作安排酒店及行程的其他部分。
OpenCode 现已提供 GPT 6 Sol、Luna 和 Opus 5.5。未说明价格、限额或使用资格条件。
OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。
Pi 表示,这三款模型已在 Radius(radius.earendil.com)上线。
GPT-6 Sol 可在 Perplexity 和 Computer 中使用,并作为 Computer 的 effort 选择器中的默认 Light 选项。
Claude 称 Claude Opus 5.5 今日可用。该声明发布于 2026 年 9 月 22 日 18:55 UTC,未给出平台、价格、配额或使用资格。
在 Arena.ai 上,两款模型均可在 Battle Mode 和 Agent Mode 中试用。
OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 现可在 Arena.ai 的 Agent Arena 中测试,分数尚未公布;也可在 Code Arena 的 WebDev、Text、Vision、Search 与 Document 类别中测试。OpenAI 称,这两款模型建立在 GPT-6 Astra 的进展之上,API 价格比 GPT-5.6 的促销价低 50%。
GitHub Copilot 现已全面提供 OpenAIDevs GPT-6 系列的另外两款模型:面向交互式与智能体编程的 GPT-6 Sol,以及 GitHub 所称的轻量、成本最低、适用于较小任务的 GPT-6 Luna。
DAIR.AI 介绍了 PrimeScientist。它用自适应 MCTS 策略决定研究智能体把预算花在何处。在相同预算下的 12 项 AI 研究任务中,报告显示其奖励比 AutoResearch 高 10.3%,研究尝试少 50.6%。
Sam Altman 称,GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程和计算机使用方面,相比 5.6 系列前代有大幅提升,每 token 价格减半,按任务计费则更低。他表示,按每任务定价来看,他认为市场上没有任何产品具有竞争力。