Did Codex Reset
GitHub

#evaluation

모든 AI 뉴스 보기
TGRSS 피드총 5건

LangChain, Jev가 에이전트 평가 심사관으로서 GPT-5.6 및 Claude Sonnet 4.6 대비 인간 심사자와 일치했다고 보고

LangChain은 Jev를 에이전트 평가 심사관으로서 GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6와 비교 테스트했다고 밝혔으며, 모든 호출에서 인간 심사자와 일치하고, 분산이 최대 913배 낮으며, 호출당 0.44초, 전체 실행 비용이 Claude Sonnet 4.6의 $28.17 대비 $0.34라고 보고했다.

Jev-as-a-judge가 이제 LangSmith에서 사용 가능

LangChain은 Jev-as-a-judge가 이제 LangSmith에서 사용 가능하다고 밝혔습니다. 회사는 모든 프로덕션 트레이스를 채점하고, 비용 상승 없이 트레이스당 더 많은 기준을 확인하며, 자동 대응을 트리거할 만큼 빠르게 안전 또는 보안 문제를 포착할 수 있다고 주장합니다.

Elvis, Jev로 AI 논문 ~2.3K편을 83초 만에 $0.14에 재태깅했다고 보고

Elvis (@omarsar0)는 Jev를 사용해 AI 연구 논문 약 2.3K편을 총비용 $0.14로 약 83초 만에 정리했다고 밝혔다. 그는 Jev가 기존 DeepSeek V4 Flash 태그의 75%에 동의했고 고신뢰도 주제 변경을 약 579건 찾았으며, 불일치 항목 30건에 대한 수동 확인이 전부 수용된 뒤 변경 사항이 프로덕션에 적용됐다고 말했다.