LangChain reports Jev matched a human reviewer vs GPT-5.6 and Claude Sonnet 4.6 as agent-eval judges
LangChain said it tested Jev against GPT-5.6 Luna, GPT-5.6 Terra, and Claude Sonnet 4.6 as agent-eval judges, reporting a human-reviewer match on every call, up to 913x lower variance, 0.44s per call, and a $0.34 full-run cost versus $28.17 with Claude Sonnet 4.6.