Arena.ai 表示 GPT-6 Sol 與 GPT-6 Luna 的分數即將公布
OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。
OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。
OpenAI 表示,兩款模型相對各自的 GPT-5.6 對應版本均有改進。
LangChain 表示已測試 Jev 對比 GPT-5.6 Luna、GPT-5.6 Terra 及 Claude Sonnet 4.6 作為代理評估評判,報告每次呼叫均與人類審核者一致,方差最多低 913x,每次呼叫 0.44s,完整運行成本為 $0.34,而使用 Claude Sonnet 4.6 則為 $28.17。