微軟論文報告 CASD 提示詞優化平均提升 16.6 分
CASD 讓現成的編程智能體分析完整的智能體日誌,並把發現寫成單一提示詞中的規則,無需環境存取或驗證數據。DAIR.AI 表示,在所報告的基準測試中,一次處理的表現優於 GEPA 與 SkillOpt,每個優化後的提示詞成本約 1.60 美元。
CASD 讓現成的編程智能體分析完整的智能體日誌,並把發現寫成單一提示詞中的規則,無需環境存取或驗證數據。DAIR.AI 表示,在所報告的基準測試中,一次處理的表現優於 GEPA 與 SkillOpt,每個優化後的提示詞成本約 1.60 美元。
管理員可在 Unity Gateway 管理模型、工具、政策與預算,開發者則可繼續使用 Claude Code、Codex、OpenCode 及其他程式編寫代理。一次設定更新會套用至所有受支援的代理。
在 Claude Code 以 max effort 運行時,Artificial Analysis 測得 Opus 5.5 為 66 分,高於 Opus 5 的 60 分及 Claude Fable 5.1 的 62 分。其每項任務成本為 13.04 美元,儘管 token 價格較低,仍高於 Opus 5 的 10.79 美元。
Token Meter 是 Splunk 推出的免費開源選單列工具,可在一次運行進行期間顯示編碼代理成本。
這些短期環境會同時擷取結構與資料,測試因此不會影響正式環境。工作流程使用 Databricks CLI 與 AGENTS.md,先把變更與父分支比較,獲批准的更新再經 CI/CD 推進。
Databricks 表示,DevHub 為開發者提供即用模板、文件、逐步指引,以及可複製到 Cursor、Claude Code、Codex 或其他編程代理的代理提示詞。
elvis (@omarsar0) says he early-tested StepFun’s new Step 5 Preview as a coding agent. He reports that it and GLM 5.3 both solved two real repository tasks with no fix rounds, that Step 5 Preview stopped after checking its work, and that it found five hidden clues in a ~368K-token long-context test.