Did Codex Reset
GitHub

#benchmarks

모든 AI 뉴스 보기
TGRSS 피드총 15건

마이크로소프트 논문, CASD 프롬프트 최적화에서 평균 16.6점 향상 보고

CASD는 기성 코딩 에이전트가 에이전트 로그 전체를 분석하고 그 결과를 하나의 프롬프트에 규칙으로 쓰게 하며, 환경 접근이나 검증 데이터는 쓰지 않는다. DAIR.AI는 한 번의 실행이 보고된 벤치마크에서 GEPA와 SkillOpt를 앞섰고, 최적화된 프롬프트당 비용은 약 1.60달러라고 밝혔다.

Taste-Bench 최고 모델, 더 나은 방향을 59.7% 선택

Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.

Artificial Analysis, Intelligence Index 비용 프론티어에 새 지점 11개 보고

MiMo-V2.6-Pro, Claude Opus 5.5, GPT-6 Luna, GPT-6 Sol이 서로 다른 reasoning effort에서 Artificial Analysis의 Intelligence Index 대 작업당 비용 파레토 프론티어에 새 지점 11개를 차지했다. Claude Opus 5.5(max with fallback)는 작업당 5.98달러에 58점을 기록해 이 지수에서 가장 높은 결과다.

Gemini 3.8 Flash TTS, Artificial Analysis 발음 강건성 벤치마크 1위

Artificial Analysis는 Google이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시했다고 밝혔다. 두 모델은 사전 설정 음성과 음성 복제를 지원하는 Google DeepMind 텍스트 음성 변환 모델이다. 테스트에서 Gemini 3.8 Flash TTS는 발음 강건성 89.5%, Provider Voice Arena Elo 1,263을 기록했다.

스탠퍼드와 Together AI 논문에서 세 모델의 자기조직화 팀이 평균 66.7%를 기록

DAIR.AI는 스탠퍼드와 Together AI 논문에서 o3-mini, Claude Sonnet 4, DeepSeek-V3가 자기조직화 팀으로 수학·물리 벤치마크 다섯 개에서 평균 66.7%를 기록했다고 전했다. 이는 가장 강한 구성원 단독의 48.8%와 완벽한 라우터의 59.0%보다 높다.

EvoOntology 논문, 자기진화 온톨로지 계층이 DDR-Bench와 BIRD에서 데이터 에이전트 점수를 끌어올린다고 보고

elvis (@omarsar0)가 데이터 에이전트를 위한 자기진화 온톨로지 계층으로 MCP 서버로 제공되는 EvoOntology에 관한 논문을 공유했다. 게시물에 따르면 DDR-Bench 정확도가 6개 백본에서 평균 17.8포인트 상승하며 GPT-5.5의 26.7포인트를 포함하고, BIRD 실행 정확도는 7.4포인트 상승한다.