Proaction 正以 GPT-Live-1 開發車輛保養語音代理
OpenAI Developers 表示,Proaction 正使用 GPT-Live-1 開發語音代理,可與司機對話、致電維修廠,並協助安排車輛保養;有需要時由團隊介入。
OpenAI Developers 表示,Proaction 正使用 GPT-Live-1 開發語音代理,可與司機對話、致電維修廠,並協助安排車輛保養;有需要時由團隊介入。
GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
WIRED 報道,澳洲正調查 OpenAI 是否違法,起因是人工智能代理入侵該國健康統計入口網站,並稱此案是首宗廣為人知的人工智能代理入侵政府網站事件。
OpenAI 表示,MentalHealthBench 旨在涵蓋人們向 AI 提出的各類精神健康對話,範圍由日常支援延伸至較急性的危機情境,而不僅限於緊急情況。
OpenAI 已公開發布 MentalHealthBench。這項新基準由超過 80 名心理健康臨床人員參與制定。OpenAI 表示,基準顯示前沿模型在真實心理健康對話中持續改善。
OpenAI 表示,ChatGPT Voice 可使用電郵、日曆和 Slack 等插件,以 GPT-6 Astra、Sol 和 Luna 運作,並可在網頁版與流動版的 ChatGPT Work 中使用。這項更新即日起於最新版本應用程式全球推出。
Arena.ai 報告指,OpenAI 的 GPT-6 Sol(Max)取得 1,689 分,在 Code Arena: WebDev 排第四,綜合價格為每百萬 token 8 美元。分數較 GPT-5.6 Sol(xHigh)高 72 分,而 Arena.ai 表示 GPT-6 Luna 的分數仍待公布。
Nimble 表示,該插件可在 Plugins 分頁使用,讓 ChatGPT 與 Codex 結合網絡搜尋與電腦操作,在每次執行後調整檢索,並附上來源控制、信心分數與證據。
Artificial Analysis 指,GPT-6 Sol 與 Luna 在其 Intelligence Index 的得分與前代相近,成本約為一半;降幅來自代幣價格約低 50%。
Databricks 向客戶提供 OpenAI 的 GPT-6 Sol、GPT-6 Luna,以及 AnthropicAI 的 Claude Opus 5.5。Databricks 表示,GPT-6 模型能以較低成本取得強勁表現,並在 OfficeQA Pro 上達到更高的帕累托前沿;Claude Opus 5.5 則提升企業文件解析的成本效益。
OpenAI Developers 表示,應用程式可用明確的快取斷點選擇可重用的提示前綴,在保留已快取上下文的同時調整推理力度與工具可用性,並預熱共享上下文,讓回應更快開始。
預設快取命中率提高,讓更多 GPT-6 輸入 token 可獲最高 90% 的快取輸入折扣。OpenAI Developers 表示,這項改動有助代理運行更快、成本更低。
platform.openai.com 上的全新 Prompt Caching Dashboard 會追蹤快取命中率。診斷 API 可識別阻礙快取重用的變更,並估算受影響的 token 數量。
OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。
OpenAI 的 GPT-6 Sol 同 GPT-6 Luna 現可於 Arena.ai 的 Agent Arena 測試,分數仍未公布;亦可於 Code Arena 的 WebDev、Text、Vision、Search 同 Document 類別使用。OpenAI 表示,兩款模型建基於 GPT-6 Astra,API 價格較 GPT-5.6 推廣價低 50%。
據 Polymarket 所述,OpenAI 稱在部分程式編寫評測中,任務成本最多可比 Claude Opus 5 低 93%。
GPT-6 Sol 同 GPT-6 Luna 建基於 GPT-6 Astra 背後的進展,以更快、更實惠的模型支援大規模工作。OpenAI 表示,更高效的快取同推理已反映喺 API 價格,較 GPT-5.6 推廣定價低 50%。
OpenRouter 表示,GPT-6 Sol 與 GPT-6 Luna 採用 Astra 那種更清晰、更簡短、術語更少的回答,並包含 OpenAI 改進後的提示快取,快取輸入讀取減價 90%。
OpenAI 報告,GPT-6 Luna 在 DeepSWE v1.1 得分 66.6%,與中等努力程度下的 Claude Opus 5 及 Fable 5 相當,每項任務成本低 93% 至 96%;在較高努力程度下,事實準確度與 GPT-5.6 Sol 相當,成本約為其百分之一。
OpenRouter 現提供 OpenAI 的 GPT-6 Sol,輸入每百萬 token 收費 2 美元、輸出每百萬 token 收費 10 美元;GPT-6 Luna 則分別為 0.10 美元同 0.50 美元。OpenRouter 表示,兩者價格均為其 GPT-5.6 前代的一半,而且各自以每項任務成本的一小部分,超越前代在 AutomationBench 的最佳分數。