Hassan, 초소형 Jev 유사 분류기 Tev1 0.8B를 학습
이 모델은 Ollama를 통해 그의 Mac에서 완전히 실행되며, 그의 설명에 따르면 작업을 종단 간 약 50ms에 분류한다. 가중치와 벤치마크는 아직 공개되지 않았고, Hassan은 둘 다 곧 공개할 예정이라고 밝혔다.
이 모델은 Ollama를 통해 그의 Mac에서 완전히 실행되며, 그의 설명에 따르면 작업을 종단 간 약 50ms에 분류한다. 가중치와 벤치마크는 아직 공개되지 않았고, Hassan은 둘 다 곧 공개할 예정이라고 밝혔다.
SmolDataEnvs는 코드와 데이터 과학 분야에서 소형 모델을 점진적으로 개선하기 위한, 검증 가능한 강화학습 환경 과제 5,000개 이상을 모은 오픈소스 자료다. 이번 공개에는 환경, 평가, 학습 자료가 포함된다.
Cline에서 Gemini 3.8 Flash를 무료로 이용할 수 있다. Cline은 이 모델이 Artificial Analysis Intelligence Index에서 41점을 기록하고, 초당 291토큰으로 실행되며, 컨텍스트 창이 100만 토큰이라고 밝혔다.
DeepLearning.AI는 Meta AI가 도구와 과거 오류를 기록하고 짧은 알림을 넣는 전용 메모리 에이전트를 사용해 Claude Sonnet 4.5 벤치마크를 37.6%에서 45.9%로 높였다고 전했다.
David Singleton은 모든 Muse 사용자가 이제 무료 클라우드 컴퓨터인 Muse Secure VM을 받는다고 밝혔다. 이는 사용자의 Muse 에이전트와 공유하는 격리된 Ubuntu 환경이며, 민감한 작업과 저장된 비밀은 그 밖에 둔다.
Perplexity의 Portable Computer는 Windows 앱에서 실행되며, 모든 Consumer 및 Enterprise Pro와 Max 구독자에게 제공된다.
Perplexity는 Portable Computer가 Slack, Gmail, Google Drive를 포함한 연결된 앱과 기기에 있는 파일에서 작동한다고 밝혔다. 전적으로 로컬에서 실행되는 작업은 파일, 데이터, 답변을 기기에 유지하며 Computer 크레딧을 사용하지 않는다.
Perplexity의 Windows용 Portable Computer가 이제 AMD Ryzen AI Max 시리즈 프로세서에서 실행된다. 연결된 앱과 로컬 파일을 사용하는 로컬 AI 에이전트가 예약된 작업을 기기에서만 수행할 수 있다.
defer_loading으로 표시된 함수는 모델이 필요할 때 검색되며, 매 턴마다 모든 정의를 보내지는 않습니다. OpenRouter는 도구 검색에 추가 요금이 없다고 밝혔습니다.
OpenRouter의 Server Tools Marketplace에는 Advisor, Subagent, Web fetch, Image generation, Apply patch, Datetime도 포함된다. 대부분은 요청 처리 중 서버에서 실행되며, 클라이언트 측 도구 루프는 사용하지 않는다.
OpenRouter가 에이전트 그라운딩용 도구를 담은 Server Tools Marketplace를 선보였다. 웹 검색 API, Shell, 도구 검색이 포함된다.
Managed Deep Agents 0.8은 사용자 소유 자격 증명과 메모리, 내부 도구용 HTTP 채널, slackhq 네이티브 파일 전송, p0를 통한 내장 웹 검색을 추가한다.
elvis는 월드 모델 Agora-2가 이제 최대 20명의 인간과 에이전트를 하나의 시뮬레이션 세계에 동시에 넣을 수 있다고 밝혔다. elvis는 이를 로봇, 자율주행차, 사이버 방어 에이전트를 함께 훈련하고, 실제 환경에 적용하기 전에 에이전트 담합을 연구할 수 있는 공간으로 설명했다.
Sakana AI는 슈미트후버가 새로 구성된 RSI Lab의 방향을 잡는 데 도움을 줄 것이라고 밝혔다. 연구소의 목표는 기계 지능을 개선하기 위한 과학적 발견의 누적 순환이다. 회사는 도쿄에서 연구소 전문가를 모으고 있다.
Jev-as-a-Judge 논문은 TypeSafe AI의 확신 있는 JEV 판정을 받아들이고 나머지는 GPT-6 Astra로 올리면, 510개 홀드아웃 선호 쌍에서 GPT-6 정확도의 99%를 GPT-6 비용의 약 57%로 유지했다고 보고한다. 저자들은 상향 임계값이 모든 폴백 모델로 전이되지 않았으며 자체 데이터에서 설정해야 한다고 말한다.
LangChain이 Interrupt에서 LangSmith Engine v2를 발표했다. 프로덕션 전에 에이전트 문제를 찾아내고, 사용자에게 보여 주기 전에 제안된 수정을 시험하며, 비효율적인 에이전트 작업과 함께 비용 및 지연 시간 추세를 드러낸다.
LangChain이 Interrupt에서 LangSmith Engine v2를 발표했으며, 에이전트 문제를 선제적으로 찾아 사용자가 보기 전에 해결할 수 있다고 밝혔다.
NVIDIA가 GoogleDeepMind, emblebi, 연구 파트너와 함께 2,800종 이상 바이러스의 AI 예측 단백질 복합체 구조를 공개한다. NVIDIA는 이를 통해 과학자들이 잠재적 유행에 대비하는 데 앞서 나갈 수 있다고 밝혔다.
Julia Schottenstein은 p0와의 협력으로 Parallel을 Managed Deep Agents에 추가해 에이전트가 웹을 검색할 수 있게 했다고 밝혔다.
Row Zero가 Databricks에 합류하면서, 회사는 Unity Catalog를 통한 엔터프라이즈급 보안과 계보를 갖춘 네이티브의 완전 거버넌스 스프레드시트 경험을 Databricks Genie에 도입한다.