Microsoftの論文、CASDのプロンプト最適化で平均16.6ポイント向上を報告
CASDは、既製のコーディングエージェントにエージェントログ一式を分析させ、知見を1つのプロンプト内のルールとして記述させる。環境へのアクセスも検証データも不要だ。DAIR.AIによると、1回の実行は報告されたベンチマークでGEPAとSkillOptを上回り、最適化済みプロンプト1件あたりの費用は約1.60ドルだった。
CASDは、既製のコーディングエージェントにエージェントログ一式を分析させ、知見を1つのプロンプト内のルールとして記述させる。環境へのアクセスも検証データも不要だ。DAIR.AIによると、1回の実行は報告されたベンチマークでGEPAとSkillOptを上回り、最適化済みプロンプト1件あたりの費用は約1.60ドルだった。
管理者はUnity Gatewayでモデル、ツール、ポリシー、予算を管理でき、開発者はClaude Code、Codex、OpenCodeなどのコーディングエージェントを使い続けられる。設定を一度更新すると、対応するエージェント全体に適用される。
Claude Codeの最大努力設定で、Artificial AnalysisはOpus 5.5を66と測定した。Opus 5の60、Claude Fable 5.1の62を上回る。タスクあたりの費用は13.04ドルで、トークン単価は下がったものの、Opus 5の10.79ドルより高い。
Token MeterはSplunkが提供する無料のオープンソースのメニューバーツールで、実行中のコーディングエージェントのコストを表示する。
短期間のみ存在する環境はスキーマとデータの両方を取り込むため、テストは本番環境に影響しない。ワークフローではDatabricks CLIとAGENTS.mdを使い、承認された更新がCI/CDを通る前に、変更を親ブランチと比較する。
Databricksによると、DevHubは開発者にすぐに使えるテンプレート、ドキュメント、ステップバイステップのガイダンス、およびCursor、Claude Code、Codex、または他のコーディングエージェントにコピーできるエージェントプロンプトを提供する。
elvis(@omarsar0)は、StepFunの新しいStep 5 Previewをコーディングエージェントとして早期テストしたと述べている。彼は、それとGLM 5.3の両方が2つの実際のリポジトリタスクを修正ラウンドなしで解決し、Step 5 Previewは作業を確認した後に停止し、約368Kトークンの長文脈テストで5つの隠された手がかりを見つけたと報告している。