Jiantao Jiao, 53개 과제의 NVIDIA 벤치마크 SWE-Serve 발표
Jiantao Jiao는 NVIDIA 팀이 AI 에이전트가 추론 엔진을 개발하고 실제 모델을 서빙할 수 있는지 시험하기 위해 SWE-Serve를 만들었다고 밝혔다. 이 벤치마크는 실제 sgl_project 엔지니어링 작업에서 가져온 53개 과제로 구성된다.
Jiantao Jiao는 NVIDIA 팀이 AI 에이전트가 추론 엔진을 개발하고 실제 모델을 서빙할 수 있는지 시험하기 위해 SWE-Serve를 만들었다고 밝혔다. 이 벤치마크는 실제 sgl_project 엔지니어링 작업에서 가져온 53개 과제로 구성된다.
WebCraftBench는 에이전트가 실제 앱을 사용한 뒤 심미성, 사용성, 원래 요청의 충족 여부를 평가한다. Tencent Hy는 검증된 197개 쌍에서 인간 선호와 85.3% 일치했다고 밝혔다.
OpenAI는 MentalHealthBench가 응급 상황만이 아니라, 사람들이 AI에 가져오는 정신건강 대화의 전 범위, 즉 일상적 지원부터 더 급성인 위기 상황까지 다루도록 설계됐다고 밝혔다.
OpenAI가 정신건강 임상의 80명 이상이 참여해 만든 새 벤치마크 MentalHealthBench를 공개했다. OpenAI는 이 벤치마크가 프론티어 모델이 현실적인 정신건강 대화에서 계속 개선되고 있음을 보여 준다고 밝혔다.
Artificial Analysis의 Pronunciation Robustness 벤치마크에서 Gemini 3.8 Flash TTS는 89.5%를 기록하며 Gemini 3.1 Flash TTS, SpaceXAI TTS, Gemini 3.8 Flash-Lite TTS를 앞섰다. 개별 발음 항목의 1위는 여러 모델에 나뉘어 있다.
Polymarket는 GPT-6 Astra가 DrivingBench가 테스트한 AI 가운데 코스를 완주한 유일한 AI였다고 밝혔다.
NVIDIA AI는 voicearena_ai의 초기 Diarization-Bench에서 Nemotron 3 Diarization의 오류율이 14.72%로, 2위보다 약 24% 낮다고 밝혔다.
Tarush Agarwal은 동일한 음성과 파이프라인으로 15개 모델을 비교한 음성-텍스트 벤치마크를 보고했다. Pipecat FLEURS의 낭독 클립 1,000개에서 AssemblyAI Universal 3.5 Pro는 단어 오류율 1.93%, 첫 텍스트까지 걸린 시간의 중앙값 489ms로, 해당 테스트에서 두 지표 모두 가장 좋은 결과를 냈다.
Lovable는 자사 0-to-1 제작 벤치마크에서 GPT-6 Sol이 모든 노력 수준에서 GPT-5.6 Sol보다 6~12% 높은 점수를 기록했으며, 의도 정렬과 디자인 기본기에서 더 큰 향상을 보였다고 밝혔다.
ModelScope는 Qwen이 Ubuntu, macOS, Windows, Android 및 Web에서 하이브리드 컴퓨터 사용 에이전트를 위한 250개 작업 벤치마크인 RecreationBench를 도입했다고 밝혔다. 에이전트는 실행 중인 앱을 탐색하고 코드로 재현한 뒤 프로그램 테스트와 VLM 기반 시각 평가를 통과해야 한다.
짧은 데모에서 TypeSafe AI의 Jev는 정확 일치 80.5%, 약 200밀리초, 100만 단위당 122달러를 기록했고, Luna는 정확 일치 84.9%, 약 2초, 100만 단위당 482달러를 기록했다.