SkillLift 论文报告演化智能体技能的 token 成本降低 40–70%
DAIR.AI 介绍了一篇 SkillLift 论文,该方法训练一个学习得到的评分标准来对智能体技能提示候选进行排序,而不是用完整 rollout 对每次修订打分。论文报告称在 SkillsBench 和 WildClawBench 上优于 SkillOpt 和 CoEvoSkills,并以少 40% 到 70% 的 token 达到目标性能。
DAIR.AI 介绍了一篇 SkillLift 论文,该方法训练一个学习得到的评分标准来对智能体技能提示候选进行排序,而不是用完整 rollout 对每次修订打分。论文报告称在 SkillsBench 和 WildClawBench 上优于 SkillOpt 和 CoEvoSkills,并以少 40% 到 70% 的 token 达到目标性能。
Google Gemini 邀请用户于太平洋时间 9 月 22 日星期二上午 11 点在 Discord 上观看使用 Gemini 购物的直播演示,涵盖知情购买、比较选项和基于相机的浏览。
Runway 表示新的扩展工作流现已推出,新增合成、Alpha、HDR、深度图和 RGB 深度。
WIRED 报道称,苹果已用全新 M6 芯片更新 Mac Mini,并称此次更新比以往更聚焦于 AI。
TypeSafe AI 表示 Jev 现已可用,并附上链接 https://console.typesafe.ai。该帖文未说明 Jev 是什么,也未提及任何访问条款。
Command Code 表示上周查获一个欺诈团伙,该团伙在其 1 美元 Go 套餐上创建了约 40,000 个虚假账户,并试图通过这些账户推送约 45 万美元的推理用量。该公司已封禁并举报这些账户、切断其代理,警告用户不要使用非官方逆向工程代理,并表示面向 Pi 的 Command Code 提供方今日上线。
Amazon Science 表示,Amazon Bio Discovery 开发了 MochiBind、CA-MAP 以及一套智能体引导的设计系统,以加速抗体药物设计,并报告针对一种新型癌症靶点获得 46 个经实验室验证的命中。
Peter Steinberger 引用 Nat Friedman 的话,反驳正在流传的“Meta 使用 OpenClaw”说法,称他们自建了智能体,并受到 OpenClaw 启发。Friedman 表示 Muse 是从零构建的,但深受 OpenClaw 启发。
Lambda 将 EGInterpolator 描述为与斯坦福大学合作的 ICLR 2026 工作,该方法先从丰富的构象数据中学习分子结构,再从稀缺的 MD 轨迹中学习运动。在 DRUGS 基准上,该公司表示该方法将与参考模拟的差距缩小了:键角 73%、键长 78%、扭转运动 24%。
Cline 表示 Grok 4.7 已在 Cline 上线,截至 9/27 享 40% 优惠。该公司还称该模型在 DeepSWE 上的得分接近 GPT 5.6 Sol 和 Fable 5.1,TPS 高且成本约便宜 8 倍。
福布斯报道称,网络安全研究人员在漏洞赏金计划中利用 Anthropic 的 Claude 入侵了 OpenAI 的内部系统。
GitHub 表示,一名工程师与一组智能体将 GitHub Copilot 智能体运行时移植到 Rust,交付了 80 万行生产代码,同时保持了代码质量。
elvis (@omarsar0) 分享了一篇关于 EvoOntology 的论文,这是一种以 MCP 服务器形式提供的、面向数据智能体的自演化本体层。帖文称,在六个骨干模型上,DDR-Bench 准确率平均提升 17.8 个百分点,其中 GPT-5.5 提升 26.7 个百分点,BIRD 执行准确率提升 7.4 个百分点。
LangChain 引用了 nathan drezner,并链接了 Typesafe AI 的 Jev 中间件官方文档。该中间件可在用户定义路由后,为 LangChain 托管深度智能体处理模型选择。
OpenAI 表示,其正与一个独立的数学家顾问小组合作,以帮助其负责任地分享人工智能与数学领域的进展。该小组将就评估和传达新的数学成果、维护学术与职业标准,以及构建用于数学研究和学习的工具提供建议。
Alexandr Wang 表示,Muse 正与 Shopify 合作,在所有 Shopify 商店通过 Shop Pay 实现智能体结账,旨在让 Muse 用户能够访问广泛的商店。
Nathan Drezner 表示,TypeSafe AI 的 Jev 中间件可与 LangChain 托管深度智能体配合使用,用于模型路由。用户定义路由,Jev 负责模型选择。
DAIR.AI 重点介绍了 AutoTailor,这篇来自 Microsoft Research 及其合作者的论文将 Web 轨迹转化为参数化浏览器自动化 API,并将其筛选至 33 个。在 106 项 WebArena Postmill 任务上,这些 API 配合 ReAct 回退达到了 90.6% 的正确率,而单独使用 ReAct 为 87.5%。
OpenCode 表示 Grok 4.7 接下来一周优惠 30%。
ChatGPT 表示,用户现在可通过安全连接 Experian 信用报告和 VantageScore 3.0 来追踪信用评分。该功能在财务中面向美国 Plus 和 Pro 用户开放,支持网页端以及最新版 iOS 和 Android 应用。