論文用一次 Jev 是/否評分標記對齊失敗
一篇論文報告,TypeSafe AI 的 Jev 無需額外訓練,就能以 0.886 的中位 AUROC 把對齊失敗與良好回應區分開。在 19 項基準上,一次 Jev 評估成本為 0.30 美元,而這些基準所用的 LLM 評判成本為 18.96 美元。
一篇論文報告,TypeSafe AI 的 Jev 無需額外訓練,就能以 0.886 的中位 AUROC 把對齊失敗與良好回應區分開。在 19 項基準上,一次 Jev 評估成本為 0.30 美元,而這些基準所用的 LLM 評判成本為 18.96 美元。