Did Codex Reset
GitHub

LangChain, Jev가 에이전트 평가 심사관으로서 GPT-5.6 및 Claude Sonnet 4.6 대비 인간 심사자와 일치했다고 보고

LangChain

LangChain은 Jev를 에이전트 평가 심사관으로서 GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6와 비교 테스트했다고 밝혔다.

LangChain에 따르면 Jev는 모든 호출에서 인간 심사자와 일치했으며, 분산이 최대 913배 낮고, LLM의 2.16-2.83초 대비 호출당 0.44초였다. 전체 실행 비용은 Jev가 $0.34, Claude Sonnet 4.6가 $28.17이라고 보고했다.