Did Codex Reset
GitHub

#benchmark

모든 AI 뉴스 보기
TGRSS 피드총 11건

AssemblyAI Universal 3.5 Pro, 15개 모델 테스트에서 단어 오류율 1.93%

Tarush Agarwal은 동일한 음성과 파이프라인으로 15개 모델을 비교한 음성-텍스트 벤치마크를 보고했다. Pipecat FLEURS의 낭독 클립 1,000개에서 AssemblyAI Universal 3.5 Pro는 단어 오류율 1.93%, 첫 텍스트까지 걸린 시간의 중앙값 489ms로, 해당 테스트에서 두 지표 모두 가장 좋은 결과를 냈다.

Qwen, 하이브리드 컴퓨터 사용 에이전트를 위한 RecreationBench 도입

ModelScope는 Qwen이 Ubuntu, macOS, Windows, Android 및 Web에서 하이브리드 컴퓨터 사용 에이전트를 위한 250개 작업 벤치마크인 RecreationBench를 도입했다고 밝혔다. 에이전트는 실행 중인 앱을 탐색하고 코드로 재현한 뒤 프로그램 테스트와 VLM 기반 시각 평가를 통과해야 한다.