10-03日报 | OpenAI 安全团队再动荡、苹果收紧 macOS 全盘访问、阿里押注 AI 三大基础设施

来源:40 个引用生成:2026/10/04 06:10

内容

声明:完全使用AI生成,可能存在错误,需谨慎甄别。

摘要

2026-10-03 AI 领域呈现头部公司人事与权限治理同步收紧、产业基础设施加速投入的格局,值得关注的信息:OpenAI 安全系统团队 David Robinson 离职并公开批评公司安全文化,引发外界对前沿模型安全治理的担忧;苹果 宣布将收紧 macOS「完全磁盘访问」权限,应对 AI 智能体 滥用系统级授权带来的隐私风险;阿里巴巴 CEO 吴泳铭 在云栖大会明确长期投入 AI 模型、AI 芯片、AI 云 三大基础设施;DeepSeek 发布 V4.1-Flash,主打 KV 缓存极限压缩,API 价格大幅下调;Anthropic 启动 Claude Frontier Academy,承诺投入 1 亿美元 培养企业级部署人才;英伟达 股价创新高,市值逼近 6 万亿美元 关口。

热点事件

OpenAI安全团队再动荡:透明度负责人Robinson离职并公开批评

多家媒体报道,OpenAI 安全系统团队中负责安全透明度事务的 David Robinson 已从公司离职,此前他还参与了《Preparedness Framework 2.0》等关键政策文档的撰写。Robinson 在《大西洋月刊》发文,称在 OpenAI 工作三年半后认为公司文化已崩坏,批评其迭代部署试错模式无法匹配模型变强后的风险规模,呼吁引入类似航空航天业的冗余与安全科学体系;OpenAI 方面回应称将持续改进训练、测试与第三方评估等安全措施。此次离职是 OpenAI 安全团队近期系列动荡的一部分:此前安全主管等高管已相继离任,公司还以泄露敏感基础设施信息为由开除了 Jasmine Wang、Tomek Korbak、Mikita Balesni 三名安全与对齐研究人员。

重点: OpenAI 安全团队关键政策起草人离职并公开批评公司安全治理,反映前沿模型安全团队持续失血。

来源:展开 5 条收起 5 条

苹果收紧macOS完全磁盘访问权限以应对AI智能体隐私风险

苹果 宣布将收紧 macOS「完全磁盘访问」(Full Disk Access)权限控制,原因是该权限允许应用访问用户全部文件、邮件、信息及浏览历史,而持续运行、自主调取工具的 AI 智能体 一旦获得整盘访问,可能在用户不知情下读取或传输数据,波及通讯对方隐私。苹果已在开发者博客确认将引入新 API 用于权限细化,要求用户通过明确操作才能授予此级别访问,但具体限制方式(如按文件夹细分、定期重新授权或自动撤销长期未用权限)及实施时间均未公布。背景上,近期 Meta Muse Mac 应用被指未经授权读取私人消息、ChatGPT Mac 应用被曝存在数据访问漏洞,凸显了代理式 AI 应用滥用系统级权限的风险。

重点: 苹果为 AI 智能体引入权限细化机制,回应代理式 AI 滥用系统级授权的隐私风险。

来源:展开 4 条收起 4 条

派拉蒙获准完成华纳兄弟探索收购 合并后将更名Skydance

美国联邦法官 9 月 30 日 批准派拉蒙与 12 个州就收购华纳兄弟探索达成的和解协议,为这笔约 1100 亿美元 的交易扫清反垄断障碍,预计 10 月 6 日 完成。合并完成后公司将更名为 Skydance,由派拉蒙 CEO David Ellison 继续担任董事长兼 CEO,并任命美泰董事长兼 CEO Ynon Kreiz 于 10 月 5 日加入,担任联席 CEO 负责日常运营和业务整合。Ellison 强调派拉蒙和华纳兄弟品牌仍将保留,整合后的平台将汇集 Paramount+、HBO Max 以及 CBS、CNN、MTV 等电视网络。和解条款还包括增加美国电影制作、支持受影响员工及建立新闻编辑监督等承诺。此前 Netflix 曾有意竞购华纳兄弟流媒体及影业业务,最终由派拉蒙完成更广泛的合并。

重点: 1100亿美元媒体合并落地催生 Skydance,整合 Paramount+、HBO Max 等核心流媒体资产。

来源:展开 2 条收起 2 条

变更与实践

Anthropic推出Claude Frontier Academy投入1亿美元培养AI工程师

Anthropic 推出 Claude Frontier Academy,承诺投入 1 亿美元,目标在 *2027 年底前培养 1 万名前沿部署工程师(FDE),缓解企业 AI 落地的人才瓶颈。项目首期 FDE Residency 借鉴医学培养模式:学员先参加数日线下培训,经模拟企业部署考核成为 Claude Resident Engineer,再进入 12 周驻留期 领导实际 Claude 部署案例,结业合格者获 Frontier Deployed Engineer 徽章,首批认证预计 2027 年初产生。首批学员来自埃森哲、贝恩、凯捷、德勤、麦肯锡、摩根士丹利、诺和诺德及澳大利亚联邦银行,分布旧金山、纽约、伦敦三地。该项目叠加 Anthropic 覆盖 4.6 万家* 企业的 Partner Network 与逾 4000 人已完成的 Basecamp 培训,进一步扩充 Claude 认证体系。

来源:展开 2 条收起 2 条

OpenAI发布GPT-6系列模型指南覆盖成本与长时任务管理

OpenAI 于 2026 年 10 月 2 日 发布《GPT-6 系列模型指南》,面向开发者介绍如何高效使用 GPT-6 模型家族并控制时间与成本。GPT-6 系列包含三款模型:GPT-6 Astra(最强智能,输入 10 美元/百万 tokens、输出 50 美元、缓存输入 1 美元)、GPT-6.1 Sol(接近 Astra 智能、五分之一价格)、GPT-6 Luna(高效日常任务)。指南涵盖三大方面:生产环境部署建议使用提示缓存(可节省高达 95% 成本)和压缩来管理成本与上下文;提示与指令优化方面强调给出清晰任务说明、明确输出要求并提供决策自主边界;长时任务管理方面介绍转向控制(steering)、异步工具调用、多智能体工作流(GPT-6.1 Sol 支持,仍为 beta)以及计算机使用功能,并展示了 Harvey、Cognition、Hex、Invideo 等团队基于 GPT-6 Astra 的实际应用案例。

来源:展开 1 条收起 1 条

吴泳铭:阿里将长期投入AI模型、AI芯片、AI云三大基础设施

2026 云栖大会 上,阿里巴巴集团 CEO 吴泳铭 提出 AI 正推动人类进入机器智能时代,智能将成为可大规模生产供给的商品,并作出两大核心判断:未来机器思考总量可达人类 千倍以上,当前 AI 应用仍处于极早期,真正的代表性产品尚未出现。阿里明确将长期投入 AI 模型、AI 芯片、AI 云 三大基础设施:千问团队计划训练 5T 至 10T 规模的全新模型;发布新一代 AI 芯片 真武 V900;提出到 2032 年阿里云运营的全球数据中心规模目标超过 20GW。吴泳铭强调机器智能并非人类智能的替代品,规模化的高水平智力供给将打开数万亿倍增长空间,使人类从繁重脑力劳动中解放,更多投入好奇心、创造力与对美好事物的感知。

来源:展开 1 条收起 1 条

DeepSeek发布V4.1-Flash模型主打KV缓存极限压缩

DeepSeek 发布 V4.1-Flash 模型,核心聚焦 KV 缓存压缩 极限优化,相关论文已在 arXiv 公开,旨在降低推理显存占用、改善吞吐表现。该版本采用重构的编码器-解码器 MoE 架构,将全输入缓存压缩至每 token 890 字节,相比前代缩小约 437 倍。模型含 5520 亿 骨干参数及 1960 亿 记忆模块参数,激活 8–160 亿,输出速度达 225.6 tokens/秒,在 Artificial Analysis 智能指数上以 39 分 超越 V4-Pro-0813。API 价格方面,输入降至 0.30 美元/百万 tokens、缓存命中 0.006 美元、输出 1.20 美元。值得注意的是,发布前 Anthropic 曾指控 DeepSeek 等中国厂商蒸馏 Claude,DeepSeek 在发布中未提及任何外部模型。

来源:展开 2 条收起 2 条

Google发布Gemini 3.8 Live语音模型

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音转语音模型,基于 Gemini 3 Pro,支持图像视频输入、97 种语言与并行工具调用。Live Extended Thinking 在 Speech to Speech Index 上以 82.6% 排名第一,Tau Voice 基准以 68.6% 居首;3.8 Live 在 Speech Agent Arena 排行榜中排名第二。输入音频每小时 0.84 美元,是榜单中最便宜的模型,为开发者构建多语言实时语音交互与并行工具调用类 Agent 提供高性价比选择。

来源:展开 1 条收起 1 条

安全与风险

Sanders提案《Ban Flock Act》禁止联邦政府使用车牌识别系统

美国参议员 Bernie Sanders 提出《Ban Flock Act》,禁止联邦机构使用自动车牌识别系统(ALPR)或接入地方警局及私人公司运营的读取数据,仅在收费和国会另行批准的情况下例外。法案对不配合的州和地方政府处以财政惩罚,包括失去五个联邦部门的拨款;公民可起诉联邦政府,州检察长可执法。尽管标题针对 Flock,法案文本实际适用于所有 ALPR 系统。Flock 是美国最大 ALPR 供应商,部署超 12 万摄像头,月均处理 200 亿条 车辆读取记录。社区抗议、暂停使用和取消合同压力下,Flock 将默认数据保留期从 30 天 缩短至 7 天,并新增搜索审计工具。议员 Ocasio-Cortez 和 Merkley 担任共同提案人。

影响: 覆盖所有 ALPR 供应商,影响联邦机构数据获取权限及州/地方政府的联邦拨款。

建议: 联邦机构合规审查现有 ALPR 接入;州/地方政府评估配合成本与替代方案;ALPR 厂商缩短保留期并完善审计。

来源:展开 1 条收起 1 条

AI智能体削弱开源漏洞披露禁运机制

InfoQ 报道,剑桥大学计算机科学教授、OCaml 编译器核心维护者 Anil Madhavapeddy 发表文章指出,AI 智能体 可仅凭公开线索将软件漏洞转化为可用攻击代码,削弱了传统漏洞披露禁运机制的有效性。他在修复某路径遍历漏洞时发现,打开修复 PR 仅数分钟后,其在线 Web 服务器日志中就出现了针对该漏洞模式的探测请求。一项研究显示,GPT-4 智能体 在获得 CVE 描述后可利用 15 个漏洞基准中的 87%,而无描述时仅 7%。Chainguard 开发者关系负责人 Adrian Mouat 表示,开源维护者陷入困境——仅打开修复 PR 就可能让攻击者抢先开发并使用漏洞利用代码。Madhavapeddy 建议三类缓解措施:私有漏洞讨论、更快的持续发布流程以及快速协议层缓解。开源 rclone 项目维护者 Nick Craig-Wood 表示,过去一个月处理的漏洞数已超过项目前 10 年的总和。QEMU 已因此缩短漏洞禁运期以应对日益快速和自动化的漏洞发现。

影响: 所有开源软件维护者及其下游用户的漏洞窗口期被显著压缩,rclone 等项目近一个月漏洞量已超过去十年。

建议: 采用私有漏洞讨论、加快补丁发布节奏、在协议层增加快速缓解机制;维护者避免公开 PR 提前泄露修复模式。

来源:展开 1 条收起 1 条

Linux维护者拆解Mythos报告的79个CVE:多为误报、旧修复或边缘场景

Linux 内核长期维护者 Greg Kroah-Hartman 在演讲中拆解了 Anthropic 自动化代码安全审计系统 Mythos 所宣称的 79 个 CVE:其中 24 个 缺乏足够细节、14 个 根本不是 bug、3 个 数据完全编造、15 个 已在最新版本修复,剩余项目多依赖恶意文件系统镜像、可注入数据包或不受信设备等较窄攻击前提,最终仅约 10 个 构成真正的修复,且分类数字合计仅 76。讨论指出 Mythos 可能仅通过匹配历史补丁模式在其他位置发现类似缺陷,并非全新发现;评论区分了 Linux、FreeBSD 与 OpenBSD 上的不同成果,强调人工 triage 成本极高,LLM 误报还会自证合理并增加维护者沟通负担。整体认为 Mythos 在 Linux 代码库中缺少足以支撑宣传的致命发现,但若针对特定代码库训练并配合第二模型做分类验证,仍可能具备审计价值。

影响: 影响 LLM 自动化漏洞审计工具的可信度评估,以及维护者对 AI 报告的 triage 流程。

建议: 针对特定代码库微调并配合二级模型做分类验证后再发布结论;维护者要求审计方提供完整复现路径与触发条件。

来源:展开 1 条收起 1 条

开源与工具

Ai2开源AstaBrief 8B:快速生成带引用科研报告

Allen Institute for AI(Ai2) 开源了 AstaBrief 8B 模型,用于其科学工作平台 Asta 的报告生成。该模型基于 Qwen3-8B,通过监督微调(SFT)和直接偏好优化(DPO)训练,SFT 阶段使用了来自 ScholarQA 流水线的 4.7 万条 真实科研查询训练样本,DPO 阶段则通过多模型生成、要求两位评审模型(GPT-4.1 和 DeepSeek-R1)达成一致来构建约 6000 对 偏好数据。AstaBrief 一次性生成完整带引用的报告,在 SQABench-CS2 与 DeepScholarBench 上与 Claude 驱动的 Thinking mode 接近持平,同时将报告生成平均时间从 178.5 秒 降至 51.1 秒(约快 3.5 倍)。在 Asta 用户中,23% 试用 Fast mode 后未切回,84.2% 给出正面反馈。开源权重使敏感科研数据可本地部署。

适用场景: 科研人员需要快速产出带引用、可本地部署的文献综述或研究简报时可直接调用,适合对数据隐私敏感的科研团队。

来源:展开 1 条收起 1 条

Istio 1.31新增Agentgateway航点并将发布制品迁出Google Cloud

Istio 1.31 于 8 月 31 日发布,新增 Agentgateway 作为 ambient mesh 中的 Layer 7 waypoint 代理,依托 istio-agentgateway-waypoint GatewayClass,并修复了 ListenerSet 处理及 agentgateway 后端的 mTLS 连接问题。版本支持 Kubernetes 1.32 至 1.36,同时引入 waypoint 间的金丝雀流量切换机制以及 zoneAwareLbSetting、ALLOWANYDYNAMIC_DNS 等流量管理改进和 FIPS 合规、trustDomains 鉴权策略。Agentgateway 由 Solo.io 捐赠给 Linux 基金会,专为代理流量设计,支持 Model Context Protocol 等协议。9 月 21 日发布的 1.31.1 修复了仅作为金丝雀引用的 waypoint 未被编程路由策略的 bug。另外由于默认 GCP 多云资金模型调整,Istio 计划将基础设施从 Google Cloud 迁移至 AWS,不再向 gcr.io/istio-release 等 Google 托管仓库发布制品,下一次故障演练定于 10 月 13 日,最终将于 12 月退役。

适用场景: 适合在 ambient mesh 模式下部署 AI Agent 流量代理、需要 MCP 等协议支持的 Kubernetes 服务网格用户,并影响 Istio 制品镜像源使用者。

来源:展开 1 条收起 1 条

Aleph Alpha发布主权开权重模型Kolibri

德国 AI 公司 Aleph Alpha 发布主权开权重模型 Kolibri,采用 78B A3B 的 MoE 架构,强调欧洲可控的数据治理与知识产权安全,面向受监管行业场景。性能方面,社区 benchmark 显示其大致可与 Qwen3.6 35B A3B 比肩,但高质量编程仍不够实用。讨论焦点集中在三个层面:一是版权合规与前沿竞争力的张力,正反方就未经授权训练数据的合法性、首次销售原则 的适用性,以及完全干净训练集是否可行展开争论;二是部署门槛,78B A3B 在合适量化下或可在 96GB RAM 运行,但与新近 Qwen 编码模型仍有差距,消费级硬件吸引力有限;三是开放权重生态愿景,社区提议构建类似 Linux 发行版的 LLM distro,依赖高质量公共训练集,形成可长期维护的基础模型生态。

适用场景: 面向受监管行业与欧洲主权 AI 场景,强调数据治理与知识产权合规;适合需要在本地化、可审计权重下运行的政企用户。

来源:展开 1 条收起 1 条

美团LongCat团队开源LongCat-Video视频生成模型

美团 LongCat 团队 在 GitHub 开源了 LongCat-Video 视频生成项目,核心模型 LongCat-Video 拥有 136 亿参数,统一支持文生视频、图生视频和视频续写任务,采用粗到精生成策略与块稀疏注意力,可在数分钟内生成 720p 30fps 视频,并通过多奖励 GRPO 强化学习提升质量。2025 年 10 月 25 日首发基础模型及技术报告,12 月 16 日发布音频驱动角色动画版本 LongCat-Video-Avatar,支持单流与多流音频输入。2026 年 5 月 21 日推出升级版 LongCat-Video-Avatar-1.5,将音频编码器从 Wav2Vec2 替换为 Whisper-Large 以提升唇形同步精度,并通过步蒸馏将推理压缩至 8 步,同时兼容风格化领域。项目以 MIT 许可证 开源,截至最新更新已积累约 8.6k 星标和 1.5k 次 Fork。

适用场景: 适合需要文生视频、图生视频、音频驱动角色动画的研究与产品团队,尤其是关注开源可商用、720p 视频生成的开发者。

来源:展开 1 条收起 1 条

Cloudflare发布Streamline支持自定义视频处理管道

Cloudflare 发布新产品 Streamline,允许开发者将 Cloudflare Stream 与 Cloudflare Workers 组合,搭建自定义视频处理管道。该产品作为 Stream 与 Workers 之间的桥梁,可接入转码、AI 内容审核、媒体丰富等多种 Worker,支持录播与直播视频上传、存储、编码及内容分发的全流程定制,为开发者提供灵活可扩展的视频流水线构建能力,适配多样化视频处理需求。

适用场景: 适合需要在 Cloudflare 边缘上灵活组合转码与 AI 内容审核的视频平台、流媒体服务及 UGC 内容审核团队。

来源:展开 1 条收起 1 条

数据与洞察

WhatWorkedBench:AI研究代理实验推断能力不及传统统计方法

卡耐基梅隆大学与清华大学团队在预印本论文 WhatWorkedBench 中提出一种评测自主 AI 研究代理的新思路:要求代理从 30 个数据源、8 类工作流 共 1248 个配置 中,仅实测有限几种后预测全部未做组合的得分。实验显示,代理能选中最优配置(成对岭回归 15/22),却难以准确推断未测配置(还原分仅 0.632),甚至不及六十年前的高斯过程(0.698)。三个关键发现:一是实验推断能力弱于传统统计方法;二是阅读代码后推断未提升;三是代理能复述代码约束却无法在预测中遵守,批量修复后还原分从 0.338 升至 0.507。研究指出,AI 研究代理的瓶颈在于从数据和规则到判断的最后一公里,建议为代理接入统计工具并结合代码静态分析。

数据: 代理最优配置选中率 15/22,未测配置还原分 0.632,落后于高斯过程的 0.698;批量修复后还原分从 0.338 升至 0.507。

意义: 当前 AI 研究代理虽能找到局部最优,却无法替代传统统计方法做稳健外推,需要工具增强才能成为合格的科研助手。

来源:展开 1 条收起 1 条

英伟达股价创历史新高市值逼近6万亿美元

英伟达 股价自 5 月以来首次创历史新高,周五上涨 2.9%,较 7 月底低点反弹近 25%,年内涨幅约 27%。目前公司市值约 5.7 万亿美元,距成为首家市值达 6 万亿美元 的上市公司不到 3000 亿美元,有望连续第四年实现两位数年度涨幅。

数据: 单日涨幅 2.9%,较 7 月底反弹近 25%,年内涨幅约 27%,市值约 5.7 万亿美元,距 6 万亿差约 3000 亿。

意义: 反映市场对 AI 算力需求的持续信心,英伟达有望成为首家突破 6 万亿市值的上市公司,延续 AI 资本开支景气。

来源:展开 1 条收起 1 条

Zitron分析:剔除资本支出后AI对美国GDP实际贡献微乎其微

Ed Zitron 发表付费通讯文章,批评当前关于 AI 经济贡献的分析普遍基于有缺陷的数据或假设。他援引 Goldman Sachs 预测,指出 2026 年 美国 AI 投资预计将占 GDP 的 1.9%,但这一增长几乎完全来自数据中心建设和 GPU 销售,而非 AI 服务本身的收入或生产力提升。文章指出,ICT 行业 占名义 GDP 的比重近两年保持平稳,说明 AI 软件销售和 GPU 租赁对经济的实际拉动有限。Zitron 进一步质疑 BLS 软件生产者价格指数,该指数目前低于 1997 年水平,但现实中 SaaS 自 2022 年以来持续涨价,每年涨幅比消费通胀高出 9 个百分点 以上,表明 BEA 可能因此高估了软件业对 GDP 的贡献。总体而言,他主张在剔除资本支出后,AI 对 GDP 的实际影响微乎其微。

数据: 2026 年美国 AI 投资预计占 GDP 1.9%,ICT 占名义 GDP 比重近两年持平;BLS 软件价格指数低于 1997 年,但 SaaS 年涨幅比消费通胀高 9 个百分点以上。

意义: 当前 AI 经济贡献叙事可能高估软件拉动,真实增长主要来自资本支出与硬件建设,AI 服务本身的实际生产率收益仍待验证。

来源:展开 1 条收起 1 条

其他值得看

TypeSafe AI创始人谈Jev决策模型与AI行业判断

来源:展开 1 条收起 1 条

DoorDash构建GenAI平台覆盖全公司5000名用户

来源:展开 1 条收起 1 条

Meta推出Muse Gadgets开源硬件项目

来源:展开 1 条收起 1 条

Chatham借助OpenAI Codex与GPT-5.6改造资本市场业务

来源:展开 1 条收起 1 条

亚马逊拟SPV回租80亿美元英伟达GPU

来源:展开 2 条收起 2 条

英伟达推出DGX SPARK 64GB可本地运行千亿参数AI模型

来源:展开 1 条收起 1 条

Sean Parker重塑Stability AI押注AI音乐生成

来源:展开 1 条收起 1 条

Meta AI智能体Muse即将登陆智能眼镜

来源:展开 1 条收起 1 条

Circuit Breaker Labs用AI智能体红队测试高风险应用

来源:展开 1 条收起 1 条

Supabase收购Turso引发开源SQLite前途与性能争议

来源:展开 1 条收起 1 条
Infinitum - 10-03日报 | OpenAI 安全团队再动荡、苹果收紧 macOS 全盘访问、阿里押注 AI 三大基础设施