Did Codex Reset
GitHub

AssemblyAI, Universal 3.6 Pro Realtime 출시 발표

AssemblyAI

AssemblyAI는 Universal 3.6 Pro Realtime가 출시됐다고 밝혔다. 회사에 따르면 두 건의 독립 벤치마크는 모든 스트리밍 음성 모델을 같은 오디오와 같은 테스트 하네스에서 실행했고, Universal 3.6 Pro Realtime가 두 벤치마크 모두에서 앞섰다.

trydaily의 Pipecat 공개 음성-텍스트 벤치마크에서 AssemblyAI는 이 모델이 파레토 프론티어에 있다고 밝혔다. covaldev 실시간 리더보드에서는 실제 음성 에이전트 오디오 기준으로 어떤 스트리밍 모델보다 단어 오류율이 낮다고 회사는 밝혔다.

AssemblyAI에 따르면 “No”, “Nah”, “Nuh-uh” 같은 짧은 응답은 조용한 통화뿐 아니라 시끄러운 방과 전화 회선에서도 98.5%의 비율로 정확히 인식된다. TV, 동료, 근처 책상에서 나오는 배경 목소리는 전사에 들어가지 않는다고 한다. 회사는 또 이 모델이 하나의 엔드포인트에서 자동 감지로 32개 언어를 다루며, 문장 도중에 언어를 바꾸는 발신자도 포함한다고 밝혔다. 개체 인식 엔드포인팅을 사용해 발신자가 말을 마치면 턴을 끝내고, 전화번호를 말하는 동안에는 턴을 열어 둔다. AssemblyAI는 실제 음성 에이전트와 전화 대화 수만 시간으로 학습했다고 밝혔다.