内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-09-23 AI 领域呈现旗舰对决与生态扩张并行的格局,值得关注的信息:Anthropic 发布 Claude Opus 5.5,官方称接近 Fable 5.1 水平、成本较 Opus 5 降低约 40%,并以 58 分位列 Artificial Analysis 智能指数第一;OpenAI 数小时内推出 GPT-6 Sol 与 GPT-6 Luna,API 定价较 GPT-5.6 腰斩,Luna 低至 0.10/0.50 美元每百万 token;阿里云在云栖大会推出 Qwen Book AI 智能体电脑,主张 OS as Harness 的端云一体架构;字节豆包团队同步缩减 Chat 与后训练资源,对话产品线资源向商业化与办公倾斜;此外 Win11 出现首个 AI 自主决策恶意软件 ClosedQuorum,WordPress 模板路径遍历漏洞 CVSS 9.2 持续发酵。
热点事件
OpenAI 推出 GPT-6 Sol 与 Luna,API 价格腰斩
2026 年 9 月 23 日,OpenAI 正式推出 GPT-6 系列两款新模型 GPT-6 Sol 与 GPT-6 Luna,沿用旗舰 GPT-6 Astra 的训练方法,将编码、计算机使用、专业工作与对齐等能力下放到更低成本档位。API 定价较 GPT-5.6 促销价下调 50%:Sol 每百万 token 输入 2 美元、输出 10 美元;Luna 进一步压至输入 0.10 美元、输出 0.50 美元,batch 模式下输出可低至 5 美元和 0.25 美元。性能方面,Sol 在 AutomationBench 跨应用业务流程测试中优于 Claude Opus 5,单任务成本仅为其 9%;DeepSWE v1.1 软件工程测试中 Sol 取得 68.8%,Luna 取得 66.6%,事实错误率约为前代一半。同日披露的客户案例显示,Harvey 借助 GPT-6 Astra 处理法律上下文,将庭审记录与判例研究整合为结构化文档。需注意,部分基准以 Opus 5 与 Fable 5.1 作参照,对比结果存疑。
重点: 旗舰能力下放叠加价格腰斩,重塑高性价比模型竞争格局
来源:展开 8 条收起 8 条
- 推出 GPT‑6 Sol 与 Luna(OpenAI News)
- OpenAI 推出 GPT-6 Sol 和 Luna:API 价格大降 50%,单任务成本最低不到竞品一成(AI新闻资讯)
- OpenAI 发布 GPT-6 Sol 与 Luna,主打更低成本与更少错误(TechCrunch)
- OpenAI 发布 GPT-6 Sol 和 Luna,API 价格降低 50%(极客公园)
- OpenAI发布GPT-6 Sol与Luna,API价格下调50%(爱范儿)
- Harvey借助GPT‑6 Astra将法律上下文转化为更强文书(OpenAI News)
- OpenAI 发布 GPT-6 Sol 强调高性价比(AI Valley)
- OpenAI 推出 GPT-6 Sol 与 Luna,价格腰斩(AI Breakfast)
Anthropic 发布 Claude Opus 5.5,智能指数登顶
Anthropic 于 9 月 22 日至 23 日发布 Claude 5.5 系列首款模型 Claude Opus 5.5,官方宣称多数任务表现接近 Fable 5.1。默认设置下典型工作负载成本较 Opus 5 降低约 40%、输出速度提升超 30%;API 定价由 5/25 美元每百万 token 下调至 4/20 美元,缓存读取价从 0.50 美元降至 0.20 美元,降幅约 60%。官方 9 项测试中 7 项领先 Fable 5.1、Opus 5、GPT-6 Astra 与 GPT-5.6 Sol,Terminal-Bench 4.0 达 66.4%,Artificial Analysis 智能指数以 58 分位列第一。早期应用层面,Opus 5.5 一天内完成 68 万行代码迁移,将 20 万行代码审计从 Opus 5 的 20 多小时压缩至不到 3 小时,并将 HAProxy 改写用时从 Fable 5.1 的 12 小时缩短至 9.5 小时、成本降低 51%。Anthropic 同时指出其突破限制边界频率较 Opus 5 降低约 85%,但承认现有评估无法覆盖所有真实部署风险。
重点: 降价提速并登顶智能指数,与 OpenAI 形成同日对决
来源:展开 6 条收起 6 条
- Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 与新一轮价格战(Simon Willison's Weblog)
- 【AI 资讯】Claude Opus 5.5 成为 AINews 新默认模型,全行业降价 40-50%(Latent Space)
- Anthropic上线Claude Opus 5.5 ,任务成本大降 40%(AI新闻资讯)
- Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(量子位)
- Anthropic发布Claude Opus5.5:任务成本降40%、输出提速30%,9项测试7项领先GPT-6Astra(AI新闻资讯)
- Claude 5.5 发布,性能直逼 Fable,还要卷价格(爱范儿)
字节豆包团队裁员减员,对话产品线资源向商业化与办公倾斜
多家媒体报道,字节跳动旗下豆包团队正同步缩减 Chat 与后训练资源,组织架构进入密集调整阶段。由豆包负责人赵祺主导的通用 Session 团队规模约 50 人,原为豆包内部最大团队之一,主要负责对话产品能力,此次预计缩减约一半;部分员工转岗至豆包商业化和飞书团队,其余被裁撤。同期,隶属 Seed 大模型部门、由朱文佳负责的产品后训练对话团队(Product Posttrain-Chat)也在收缩,因业务需求下降,员工转向 Horizon RL、产品后训练-办公等部门;豆包对话模型合版负责人在一个月内已两度变更。整体来看,字节跳动在豆包达成 2 亿日活后,正将对话产品与模型研发资源进一步向商业化及办公等高需求场景集中。
重点: 豆包 2 亿日活后资源重新配置,对话主线收缩
来源:展开 2 条收起 2 条
- 豆包对话团队或裁员一半(Readhub - 每日早报)
- 消息称豆包调整Chat团队与后训练资源,对话模型业务进入结构优化阶段(AI新闻资讯)
阿里云发布 Qwen Book,AI 智能体电脑正式亮相
在 2026 云栖大会上,阿里云正式发布 AI 智能体电脑 Qwen Book,主打自主理解用户意图、持续学习与长期任务执行。产品搭载 Skill 键盘阵列、全局 AI 按键、语音手写笔等交互入口,并提供支持 7×24 小时运行重度任务的操作空间,针对传统 AI 办公中跨应用、跨 Agent 协同效率不足的问题进行优化。Qwen Book 基于 "OS as Harness" 理念,以千问端云模型为核心,深度融合操作系统、应用、云服务与硬件能力,统一管理交互入口、运行时环境、个人持续上下文以及软硬件操控能力,构建可理解、可记忆、可持续运行和可治理的 Agent 计算环境。阿里云研发副总裁张献涛表示,希望 Qwen Book 从硬件工具演变为 Token 驱动、持续成长的智能体载体,推动个人智能向 RSI 演进。生态方面,Qwen Book 已与高通、英特尔、罗技、绿联等伙伴完成适配,并打通支付宝、千问输入法等阿里系应用,同时开放系统接口和能力接入。
重点: 端云一体智能体电脑落地,硬件与 OS 深度协同
来源:展开 1 条收起 1 条
- 阿里云发布Qwen Book:AI智能体电脑正式亮相(AI新闻资讯)
阿里云栖大会阐述 AI 经济学,模型、芯片、云三线并进
2026 年 9 月 22 日杭州云栖大会上,阿里巴巴集团 CEO 吴泳铭提出 "思考力商品化" 核心理念,认为机器供给的思考量将达千倍以上,并以工业革命中的动力商品化为类比,指出 AI 模型、AI 芯片、AI 云是机器智能时代三大基石,分别对应思考的生产、产品与流通环节。阿里据此在芯片(平头哥真武 V900 等)、模型(Qwen 团队探索 RSI 及 5-10T 参数目标)与云(阿里云目标 2032 年全球数据中心超 20GW)三条战线持续投入,形成完整的"思考力"生产链条。同时,阿里围绕 Agent 落地进行全栈优化,发布 AgentCore、新一代 CPFS、Agent Studio 等产品,解决算力效率、长任务可靠性与成本问题,文章认为阿里正将自己定位为机器智能时代的经济基础设施。
重点: 三线并进战略升级,定位机器智能时代基础设施
来源:展开 1 条收起 1 条
- 拆解下阿里的 AI 经济学,与它的下注(极客公园)
变更与实践
DeepSeek 公开 Agent 训练系统 DSec 论文,梁文锋署名
DeepSeek 发布论文公开 Agent 训练基础设施 DSec(DeepSeek Elastic Compute) 的技术细节,创始人梁文锋署名。该系统每秒可生成超 5000 个沙盒,日均产出 300 万个,峰值并发 38 万个,依托约 160 节点、3 万核 CPU 与 250TB 内存的单集群运行。论文详细拆解了四类沙盒后端(FnCall、Container、MicroVM、Full VM)、六层调度链路,以及三层 EROFS 只读镜像叠加与按需加载方案,后者将 8192 容器部署时间由 60 分钟压缩至 35 分钟。资源管理上,通过 virtio-pmem+DAX 共享内存使 MicroVM 峰值内存占用降 40.2%,CPU 分级调度将延迟敏感任务膨胀率由 45.2% 压至 17.3%。
来源:展开 2 条收起 2 条
- DeepSeek新论文公开Agent训练!梁文锋署名(量子位)
- DeepSeek 公开 Agent 训练系统 DSec 技术细节,梁文锋署名(Readhub - 每日早报)
Anthropic 重构 Claude Code Projects,上线多线程并行协作与共享记忆
Anthropic 对 Claude Code Projects 实施重构,系统从文件夹形态升级为以会话为核心的协作中心,由协调员自动拆解用户任务,并将子任务并行分配至多个独立云端线程,每条线程在隔离环境中拉取 Git 分支独立编码、完成测试后自动提交 PR。执行过程中,Claude 在各线程间构建共享记忆,沉淀技术规范、架构决策与团队偏好,缓解多 Agent 上下文传递的信息损耗;项目库统一管理用户文件与产出。功能以 beta 形式向部分 Pro 与 Max 订阅用户开放,团队版、企业版及本地执行能力将在后续推出。同周 Anthropic 推送 Claude Code v2.1.280,将 Opus 5.5 设为默认模型,支持百万 Token 上下文并采用更低定价,旧版 effort 等级不再适用。
来源:展开 4 条收起 4 条
高通骁龙峰会发布两款旗舰芯片,Extreme 版支持本地运行 300 亿参数大模型
高通在年度骁龙峰会上推出 骁龙 8 Elite Gen6 与 骁龙 8 Elite Extreme Gen6 两款旗舰手机处理器,均以端侧 AI 能力为核心升级方向。新芯片搭载全新传感中枢,可本地运行最高 2 亿参数小模型,实现个性化语音助手与本地记忆功能;Extreme 版进一步支持本地运行 300 亿参数 MoE 混合专家模型,仅动态激活部分参数以兼顾性能与功耗。相比苹果此前公布的 200 亿参数 MoE 模型,体量显著更大。两款芯片同时升级影像与音频处理,Gen6 引入新 AI 加速器,Extreme 支持8K60fps 录制与 4K240fps 慢动作。会上,摩托罗拉签约首发 Extreme 芯片,宣布推出旗舰机型 Motorola Signature27,预计年内上市。
来源:展开 3 条收起 3 条
- 高通发布骁龙 8 Elite Gen 6 与 Extreme 芯片,支持本地运行 300 亿参数大模型(AI新闻资讯)
- 高通发布两款新手机芯片,重点聚焦 AI(TechCrunch)
- 高通发布两款旗舰骁龙芯片,Extreme 版支持本地运行 300 亿参数大模型(Readhub - 每日早报)
腾讯 SRE 搭建错误码治理 Agent,排查从 3-8 小时压缩至分钟级
腾讯 SRE 团队针对每日数百条错误码告警,利用智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台与代码托管平台四类能力挂载到同一 Agent,自主编排排查流程,在分钟级产出根因分析与修复建议。选型上选择单 Agent 以保留渐进式探索的完整上下文,将排查流程与工具规则沉淀到 Skill;设计上以五步排查流程组织多源证据,建立 0-4 分的置信度模型;工程上以 11 个节点的工作流配合快慢双路径解析与 17 项输出保证 JSON 结构化输出稳定。团队基于 50 条 case 进行 5 轮 Prompt 调优,将 action_type 与人工标注一致率从 66% 提升至 88%,硬冲突率从 20% 降至 0%,并形成三层评测闭环支撑 Skill 持续迭代。
来源:展开 1 条收起 1 条
- 错误码排查从 3~8 小时到分钟级,Agent怎么做到的?(腾讯技术工程)
OpenAI 为 GPT-6 推出改进版提示缓存功能
OpenAI 为 GPT-6 系列模型推出改进版提示缓存系统,默认提供更高的缓存命中率,并在 30 分钟窗口内对可复用的共享前缀给予最高 90% 的输入 token 折扣。新增 Prompt Caching Dashboard 用于监控缓存命中率随时间变化及输入构成对比,配合缓存未命中诊断工具可定位模型、工具、设置或输入变更导致的复用失败,并显示受影响 token 估计值。开发者可通过显式缓存断点选择要复用的前缀、在不破坏缓存的前提下调整推理力度,以及通过稳定的工具定义、追加新指令和预热缓存等方式优化命中率。GitHub Copilot、Manus、Strawberry Browser、Wordsmith 等客户案例显示,缓存命中率从约 83-85% 提升至 90% 以上,推理成本显著下降。
来源:展开 1 条收起 1 条
- GPT‑6 推出更优的提示缓存功能(OpenAI News)
安全与风险
WordPress 模板路径遍历漏洞 CVE-2026-87902 曝光,CVSS 9.2 引发争议
WordPress 被披露存在编号为 CVE-2026-8792(亦称 Click2Shell)的严重安全漏洞,CVSS 评分高达 9.2 分,攻击者无需登录即可在服务器上运行任意 PHP 代码。漏洞源于 WordPress 查找页面模板时的路径遍历缺陷,受影响版本可被构造特殊请求将模板路径跳出主题目录,从而加载并执行服务器上的任意 .php 文件;另一路径则利用主题预览链接中主题标识符在服务端与浏览器 JavaScript 引擎间的处理差异,强制安装并激活主题再结合插件缺陷执行代码。受影响范围覆盖 WordPress 4.7 至 7.1.1 的多个分支,涉及 Twenty Twelve、Twenty Fourteen 及 Neve、Hestia、Sydney 等主题。WordPress 已在 v7.1.1 修复该漏洞并为 v7.0、v6.9 等分支提供移植补丁。
影响: 使用相关主题与分支版本的 WordPress 站点管理员
建议: 立即升级至 7.1.1 或对应分支最新版本,暂无法升级者启用 DISALLOWFILEMODS 阻止后台安装主题插件
来源:展开 4 条收起 4 条
- WordPress 爆出 9.2 分严重安全漏洞|CVE-2026-87902(小众软件)
- WordPress Click2Shell漏洞曝光 恶意链接可以诱导管理员触发PHP代码执行(蓝点网)
- 🚨 WordPress 2016 年以来模板路径遍历漏洞:条件性 RCE 与 9.2 分争议(News Hacker | 极客洞察)
- 🚨 黑客称借 PeopleSoft 漏洞进入 AWS GovCloud,获全体 FBI 员工数据(News Hacker | 极客洞察)
朝鲜黑客伪装招聘方投放恶意代码,全球超 3 万台设备感染
美国联邦调查局、澳大利亚信号局、日本警察厅和德国安全机构联合发布警告,朝鲜黑客组织正伪装成招聘软件工程师、前端工程师和加密货币从业者的招聘方,通过虚假技术面试和编程测试传播恶意软件。黑客冒充 AI、区块链、NFT 等技术公司招聘人员,要求应聘者下载伪装成代码作业或视频会议修复工具的恶意文件,相关活动已波及 100 多个国家和地区,累计感染超过 3 万台设备。恶意代码隐藏在仓库或 VSCode 项目中,可窃取浏览器凭证、键盘输入、加密钱包数据等,黑客从 7000 多个加密钱包盗取资金,估计价值超 1000 万美元。
影响: 求职者、企业招聘团队及加密钱包持有者
建议: 核实招聘方身份,谨慎下载来路不明的代码与工具文件
来源:展开 1 条收起 1 条
黑客组织 ShinyHunters 声称入侵 FBI,窃取特工及申请人数据
黑客组织 ShinyHunters 声称入侵美国 FBI 系统,窃取了近全部 FBI 特工及求职申请人的敏感数据,并在暗网泄露网站公布声明。404 Media 率先报道,核实了部分被盗姓名、家庭住址和电话号码。黑客称行动非出于经济动机,要求 FBI 删除一份其称为虚假指控的报告。攻击路径为先入侵用于存储求职者信息的 Oracle PeopleSoft 服务器,再横向移动至托管特工和申请人数据的亚马逊政府云,窃取数 TB 数据。FBI 特工招聘网站和特工申请人门户一度显示维护中。分析指出,被盗数据可能构成重大反情报威胁,外国情报机构可借此胁迫或勒索 FBI 特工及其家属。
影响: FBI 特工、求职者及家属,可能延伸到反情报体系
建议: 加强身份核验与通信凭据管理,警惕针对涉密人员的社工与勒索
来源:展开 1 条收起 1 条
- 黑客组织 ShinyHunters 声称入侵 FBI,窃取特工及申请人数据(TechCrunch)
Win11 惊现 AI 驱动恶意软件 ClosedQuorum,入侵后自主决策
思科安全团队 Cisco Talos 于 9 月 22 日披露了一款名为 ClosedQuorum 的 AI 驱动恶意软件,主要针对 Windows 11。该恶意软件基于 Go 语言构建,在成功入侵后无需人工指令即可自主运行,会调用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等 AI 模型,借助投票系统决定下一步行动,主要用于窃取浏览器登录凭证、提取加密货币信息、持久化执行及横向扩散。Talos 将其描述为首个公开记录的、把战术指挥与控制决策委托给 AI 模型的 Windows 植入程序,即便指挥服务器离线也能推进,绕过传统依赖流量特征识别 C2 信标的防护方式。
影响: Windows 11 用户与企业终端环境
建议: 及时更新系统补丁、启用多因素认证并谨慎处理可疑文件
来源:展开 1 条收起 1 条
OpenAI 向乌克兰扩展网络防御访问权限以保护民用基础设施
OpenAI 宣布将向乌克兰政府提供其 Daybreak 网络安全项目 访问权限,以支持民用基础设施的网络防御。OpenAI 将与乌克兰数字转型部合作,向乌方团队提供识别软件漏洞、开发和测试修复方案的工具。乌克兰国家网络事件响应小组 CERT-UA 在 2025 年处理了近 6000 起网络事件,涉及医院系统、能源和电信领域。此前 OpenAI 已向法国、德国、波兰等欧洲国家及欧盟网络局 ENISA 提供类似访问,ENISA 用其模型发现了欧盟机构软件中的漏洞,波兰 CERT Polska 借助相关模型发现了第三方路由器软件中的六个漏洞。
影响: 乌克兰民用基础设施及医院、能源、电信等关键系统
建议: 持续投入国家级网络事件响应能力建设,推动跨区域威胁情报共享
来源:展开 1 条收起 1 条
- OpenAI向乌克兰扩展网络防御访问权限以保护民用基础设施(OpenAI News)
开源与工具
NVIDIA 开源 Nemotron 3 Diarization,实时多说话人语音分离模型
NVIDIA 发布开源权重模型 Nemotron 3 Diarization,参数量 1 亿,专为实时多说话人语音分离设计。该模型支持最多 8 名说话人,可在离线和流式场景下运行,依赖 Sortformer 的到达顺序排序机制确保跨片段说话人标签稳定。模型在 VoiceArena Diarization-Bench 榜单上以 14.72% 的 DER 排名第一,相对第二名降低约 24%;在八个测试集上较前代 Streaming Sortformer 平均相对 DER 下降约 41%,吞吐量在 30.4 秒配置下达到 15113 倍实时率。NVIDIA 提供了基于 NeMo 的流式和离线调用示例,并介绍与 Parakeet TDT 等 ASR 模型结合生成带说话人归属的转写流程。模型遵循 OpenMDW License v1.1,依赖 NVIDIA Ampere、Hopper 或 Blackwell 系列 GPU 运行。
适用场景: 实时会议转写、客服多角色对话、广播与播客内容归档
来源:展开 1 条收起 1 条
- \\了解谁在何时说话:使用 NVIDIA Nemotron 3 Diarization 构建实时多说话人 AI\\(Hugging Face - Blog)
Simon Willison 发布 llm 0.36
2026 年 9 月 22 日,Simon Willison 发布开源命令行 LLM 工具 llm 0.36 版本。核心更新包括新增对 OpenAI GPT-6 Sol 与 GPT-6 Luna 两个模型的支持;模型插件可通过声明 supports_conversation = False 标记仅支持单轮对话,调用多轮历史时将抛出 llm.ConversationNotSupported 异常,llm-typesafe 成为首个采用该机制的插件;llm logs 的 Markdown 输出将推理轨迹包裹在特定标签中,便于解析。此外,该版本合并了五位新贡献者提交的错误修复,进一步完善工具稳定性与生态扩展能力。
适用场景: 命令行快速调用多模型、统一日志解析与单轮对话场景开发
来源:展开 2 条收起 2 条
- llm 0.36(Simon Willison's Weblog)
- 打造高性能、低CPU消耗系统—36种编码实战技巧(下篇)(京东技术)
Graphify:统一代码库上下文以简化自主软件工程
InfoQ 报道开源工具 Graphify 致力于解决大语言模型在代码库场景下的跨文件感知难题。该项目于 2026 年 4 月发布,采用 MIT 与 Apache-2.0 双许可证,凭借高频迭代在上线前十天便获得数千 GitHub star。Graphify 通过 tree-sitter 解析 AST、结合文档语义,使用社区检测算法将代码库、文档与非结构化数据转换为可查询的多模态知识图谱,并可通过 MCP 服务器接入 AI 编程助手,显著降低 token 消耗。近期迭代新增 Terraform 块属性保留、Rust 拆分 impl 泛型解析、Kotlin 外部接收者追踪、C++ 作用域静态调用路由、Markdown 代码跨引用及 PHP 内嵌脚本索引等功能。其官方基准测试显示 LOCOMO recall@10 为 0.497、QA 准确率 45.3%、LongMemEval-S 子集 76%,并将 ERPNext 关键事实覆盖率从 70.8% 提升至 82.0%。
适用场景: 中大型代码库的代理编程上下文增强与跨文件检索
来源:展开 1 条收起 1 条
- Graphify:统一代码库上下文以简化自主软件工程(InfoQ)
strands-agents/harness-sdk:面向生产级 AI 智能体的开源 SDK
GitHub 仓库 strands-agents/harness-sdk 是面向生产级 AI 智能体的开源 SDK 项目,支持 Python 与 TypeScript,覆盖任意模型与任意云环境,提供端到端的智能体构建与控制能力。项目公开仓库已获得约 7.6k Star 与 1.2k Fork,提交历史达 2,752 次,并开放 518 个 Issue 与 286 个 Pull Request 进行协作。仓库目录包含 harness-py、harness-ts、strands-py、strands-ts、strands-cli、strands-mcp 等子包,分别对应 Python 与 TypeScript 实现、命令行工具以及 MCP 集成。最新提交合并了 PR #4519,新增 Agent.shutdown() 方法以支持基于作用域的资源清理,同期还合并了强制 Python 格式检查、对齐 @strands-agents/sdk 版本范围等更新,标志 SDK 走向统一发布形态。
适用场景: 生产级多模型、多云智能体编排与生命周期管理
来源:展开 1 条收起 1 条
- strands-agents/harness-sdk:面向生产级 AI 智能体的开源 SDK(Trending repositories on GitHub today · GitHub)
vLLM 引入硬件无关模型层
vLLM 推出 硬件无关层 以支持跨多种硬件运行模型并保持高性能。在 NVIDIA H100 GPU 上效率可达原生实现的 96.6%,同时保持 PyTorch 可编译与可扩展,方便社区适配新 GPU 与老旧或小众加速器。这一改动降低了模型对特定 GPU 架构的依赖,为多硬件环境下的统一推理部署提供了基础。
适用场景: 跨 GPU 与小众加速器统一部署 LLM 推理服务
来源:展开 1 条收起 1 条
- vLLM 引入硬件无关模型层(TLTD)
数据与洞察
人类动作预训练呈幂律下降,Figure Helix 2.5 陌生家庭成功率从 9% 升至 56%
Figure 发布 Helix 2.5 并公布两组实验:一是在 30 个陌生家庭中对比是否经过 Index 人类数据预训练,完整任务成功率从 9% 升至 56%;二是用四档嵌套 Index 数据显示机器人动作预测损失随预训练规模呈幂律下降。Dyna 此前已用 1000 至 100 万小时人类视频预训练,在 14 项真机任务上获得 20% 到 53% 的平均归一化表现,验证规模效应可延伸到闭环。Figure 同时披露 Index Creator 网络已积累超 1600 万条视频,累计向创作者支付 1500 万美元,并以 35 亿美元算力合作部署最高 10 万颗 GPU。亮源新创发布的 Light-O1 则将人类动作预训练从 37.5 亿扩展到 1200 亿 tokens,跨本体预测误差随规模呈幂律下降。
意义: 人类行为数据成为机器人预训练的规模化资产,Scaling 规律延伸到闭环真机任务
数据: Helix 2.5 在 30 个陌生家庭完整任务成功率从 9% 升至 56%;Dyna 用 1000 至 100 万小时人类视频在 14 项真机任务获得 20%–53% 平均归一化表现;Index Creator 积累超 1600 万条视频,累计支付 1500 万美元,算力合作最高部署 10 万颗 GPU;亮源新创 Light-O1 将人类动作预训练扩展到 1200 亿 tokens(原 37.5 亿)。
来源:展开 1 条收起 1 条
TWIST 入选 ACM CCS 2026,面向云上大模型的隐私保护推理方案
字节跳动安全研究团队与香港城市大学联合提出的隐私保护推理方案 TWIST 被 ACM CCS 2026 接收。该工作针对云上大模型 MaaS 部署中租户提示词、生成结果及中间状态可能被云端窥探的隐私风险,提出联合模型-Token 变换机制:通过私有密钥将模型权重与输入 Token 同时映射到变换空间,使服务端在标准推理引擎上直接处理混淆态数据。在 Qwen2.5、Qwen3、DeepSeek-V3.1、Llama3 等模型及多类攻击下的实验显示,Token 恢复率最高仅约 25%(671B 模型压低至 4.80%),PII 恢复率降至 0%-2.63%,下游任务准确率差距压缩在 0.12%-2.22%,在线推理延迟增幅保持在个位数百分比,无需修改推理引擎或依赖可信硬件。
意义: 在保持效用与低延迟前提下实现云端 MaaS 隐私保护推理
数据: 在 Qwen2.5、Qwen3、DeepSeek-V3.1、Llama3 等模型与多类攻击下,Token 恢复率最高约 25%,671B 模型压低至 4.80%;PII 恢复率降至 0%–2.63%;下游任务准确率差距压缩在 0.12%–2.22%;在线推理延迟增幅为个位数百分比,无需修改推理引擎或依赖可信硬件。
来源:展开 1 条收起 1 条
- TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案(字节跳动技术团队)
vivo ART 入选 ECCV 2026,首个 2K 妆容迁移框架与 MF2K 数据集
vivo 蓝图实验室提出妆容迁移框架 ART,入选 ECCV 2026。该框架通过两阶段训练解决复杂妆容迁移中细节丢失与身份漂移问题:Stage I 用大模型生成的伪目标初始化迁移模型并训练卸妆模型;Stage II 将迁移结果保留为可微的妆容载体,通过在参考图素颜版上重建真实参考图,让真实图像的监督信号反向修正迁移结果。文章还发布了首个 2K 妆容数据集 MF2K,含 8,573 张 2048×2048 人像,覆盖素颜、淡妆、浓妆和艺术妆四类。在 MT、LADN、MT-Wild、MF2K 四个测试集评测中,ART 在妆容相似度(MF2K 上 MSimG 9.22)与背景稳定性上同时领先,21 人用户研究中三个维度均排名第一,是首个支持 2048×2048 输出的妆容迁移框架。
意义: 推动高保真妆容迁移走向真实图像监督与 2K 实用输出
数据: ART 是首个支持 2048×2048 输出的妆容迁移框架;MF2K 数据集含 8,573 张 2K 人像,覆盖素颜、淡妆、浓妆与艺术妆四类;在 MT、LADN、MT-Wild、MF2K 四个测试集上,于 MF2K 取得 MSimG 9.22,并在 21 人用户研究的三个维度均排名第一;最优起始噪声强度为 0.6。
来源:展开 1 条收起 1 条
- ART:妆容迁移框架,重新定义高保真妆容迁移 | ECCV 2026(vivo互联网技术)
麦肯锡警告智能体账单或比聊天 AI 贵 30 倍
麦肯锡最新提醒指出,智能体 AI 运行成本可能比聊天 AI 高出数倍,同一任务不同智能体花费差距最高可达 30 倍。《2026 年 AI 现状》调查显示,约三分之一企业已将超 10% 的技术与通信预算投入 AI,60% 受访者计划明年继续追加投入,五分之一企业表示 AI 开支已开始挤压运营成本。麦肯锡全球研究院院长唐吉·卡特林称 AI 支出规模正变得相当可观。软件开发因自动编程天然吞噬 token 而最易承压;亚马逊曾因员工为冲 token 排行榜刷量而撤榜,Coinbase 和 Salesforce 也在收紧 AI 使用。同时麦肯锡另一份报告称智能体 AI 可削减转型办公室任务人工时间 35% 到 70%。
意义: 企业 AI 投入高速扩张,智能体成本与价值平衡成为未来 12 个月关键问题
数据: 同一任务不同智能体花费差距最高达 30 倍;约三分之一企业已把超 10% 的技术与通信预算投入 AI,60% 受访者计划明年继续追加投入,五分之一企业表示 AI 开支已开始挤压运营成本;麦肯锡另一份报告显示智能体 AI 可削减转型办公室任务人工时间 35%–70%。
来源:展开 1 条收起 1 条
IDC 联合浪潮发布 AI 计算力报告,中国智能体部署渗透率达 81%
IDC 与浪潮信息联合发布《2026 年中国人工智能计算力发展评估报告》,揭示 AI 行业正经历从「堆算力」到「Token 效率」的范式转变。报告指出,2026 年中国智能体部署渗透率达 81%,全球领先;预计到 2030 年全球活跃智能体复合增长率 129.8%,但 Token 消耗复合增速高达 4822.6%,是前者的 37 倍,导致全球 AI 算力缺口将达 3809 亿美元,2027 年需求满足率跌至 71%。报告提出 AI 基础设施将分裂为「能力型智算」与「容量型智算」两条路线,竞争核心转向全系统协同的 Token 持续生产能力。城市排名方面,北京、杭州、深圳占据 2026 年中国 AI 算力城市榜前三。
意义: 从堆算力转向 Token 效率,AI 基础设施走向两极分化
数据: 2026 年中国智能体部署渗透率达 81%,全球领先;预计到 2030 年全球活跃智能体复合增长率 129.8%,Token 消耗复合增速 4822.6%(约为前者的 37 倍);全球 AI 算力缺口将达 3809 亿美元,2027 年需求满足率跌至 71%;中国 AI 算力城市榜前三为北京、杭州、深圳。
来源:展开 1 条收起 1 条
其他值得看
美国 680 亿美元数据中心项目遭公众反对潮阻滞
来源:展开 2 条收起 2 条
- AI 基建遭反噬:Q2 美国 680 亿美元数据中心项目因公众反对受阻(AI新闻资讯)
- 每个人都能找到反对数据中心建设的理由(TechCrunch)
阿里发布《AI Native 研发范式实践手册》
来源:展开 1 条收起 1 条
- 《AI Native 研发范式实践手册》重磅发布(阿里技术)
Anthropic 发布 AI 驱动代码现代化六步法博文
来源:展开 1 条收起 1 条
- 如何为 AI 驱动的代码现代化项目做准备(Claude Blog)
Snorkel AI 估值翻三倍至 35 亿美元,AI 训练数据需求激增
来源:展开 1 条收起 1 条
- Snorkel AI 估值翻三倍至 35 亿美元,AI 训练数据需求激增(TechCrunch)
OpenAI 与 Grab 在东南亚推出 AI 技能培训项目
来源:展开 1 条收起 1 条
- Grab与OpenAI将实用AI技能带入东南亚(OpenAI News)
OpenAI Academy 两周年:累计 400 万人参与
来源:展开 1 条收起 1 条
- OpenAI Academy 两周年:扩大社区 AI 培训覆盖(OpenAI News)
DeepMind 研究员 Bonnie Li 转会 OpenAI
来源:展开 1 条收起 1 条
Ema 融资 7700 万美元,多 AI 代理加速蚕食企业软件市场
来源:展开 1 条收起 1 条
- Ema融资7700万美元,AI开始蚕食企业软件与服务市场(TechCrunch)
希腊总理旧金山谈 AI,承认政策落后于技术
来源:展开 1 条收起 1 条
- "我们已经在打昨天的仗了":希腊总理坦诚谈AI(TechCrunch)
谷歌与盖茨基金会合作,将 AI 资源带到全球南方 2 亿农民身边
来源:展开 1 条收起 1 条
- 谷歌与盖茨基金会合作,将 AI 资源带到全球南方 2 亿农民身边(The Keyword)