Adithya S K 發布 SmolDataEnvs,收錄逾 5,000 項可驗證的強化學習任務 AAdithya S K9小時41分鐘前 Adithya S K 已發布 SmolDataEnvs,收錄逾 5,000 項可驗證的強化學習環境任務,用於在程式與數據科學領域對小型模型進行爬山式優化。環境、評估與訓練材料均為開源。 #smoldataenvs#強化學習#開源#小型模型#數據科學
Qwen 團隊推出原生多模態模型 Qwen3.8-Omni-FlashQwen3.8-Omni-Flash 專為跨文字、音頻及影片的長程智能體任務而訓練,採用 Qwen3.8-Next 的稀疏混合專家設計,上下文視窗達 100 萬個 token。兩個開源框架 Qwen-MM-Plugins 與 Qwen-Live-Harness,分別加入多模態及實時智能體支援。
Salesforce AI Research 審核最乾淨的公開終端代理 RL 資料集,僅 35.8% 通過Salesforce AI Research 在發現雙向獎勵錯誤後,將該資料集的乾淨比例定為 35.8%,另外兩個分別為 10.1% 和 3.3%。作者表示,用於過濾有缺陷環境的 RIVER,在使用少於 TMax 30% 環境的情況下,把 Terminal-Bench-Lite 上的 RL 增益提高 106%,把 Terminal-Bench v2.1 上的增益提高 30%。
NVIDIA 的 Skill2Env 把公開 Agent Skills 編譯成 7,971 項終端機任務Codex 規劃器與建立器把每項技能轉成經過測試的終端機工作流程,評分標準取自該技能本身的質素準則。只看結果的強化學習把 Qwen3.8-27B 在 Terminal-Bench 2.1 的表現由 49.4% 提升至 54.1%;加入評分標準後則達 50.1%,但在軌跡比較中勝出更多。
inclusionAI 開源兩款 6B 的 Ming-Image-0.1-Design 模型inclusionAI 已以 MIT 授權開源 Ming-Image-0.1-Design 系列:兩款互補的 6B 模型 Design 與 Layer,用於視覺設計工作流程。ModelScope 表示,Design 在 Artificial Analysis UI/UX Design 排行榜的開源權重模型中排名第一;Layer 則在全部 12 項受測 Crello 設定中領先,速度為受測 20B 開源權重基線的 4.3 倍。