内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-09-15 AI领域呈现多线并进格局,值得关注的信息:OpenAI以超3亿美元收购Glass Imaging,延续其AI硬件布局;英伟达、Palantir等企业因数据安全顾虑限制使用Anthropic与OpenAI前沿模型,Anthropic、OpenAI、谷歌自7月起秘密磋商筹建AI安全标准机构;荣耀发布MagicOS 11,YOYO助手任务闭环率达90%;字节整合豆包、飞书、火山引擎加码企业市场;微软9月更新引发Windows远程桌面故障并发布紧急带外补丁;开源侧涌现ZGCM-1、APXInf、书生-S2、SingProbe等模型与工具。
热点事件
OpenAI逾3亿美元收购Glass Imaging加码AI硬件
OpenAI据多家媒体报道以超过3亿美元收购智能手机摄像头影像增强初创公司Glass Imaging,交易估值显著高于该公司此前约3000万美元的累计融资额。Glass Imaging由前苹果工程师Ziv Attar和Tom Bishop于2019年创立,专注利用神经网络学习不同摄像头成像特性以突破手机摄像头物理尺寸限制,曾主导苹果人像模式研发。分析认为,收购核心是获取计算摄影软件能力与工程团队而非摄像头模组硬件,因为镜头模组早已高度商品化。此次收购与OpenAI此前与前苹果设计负责人Jony Ive合作开发硬件、并以65亿美元收购Ive旗下公司io组建设备初创企业的方向一致,强化了OpenAI在AI原生终端与新型操作系统方向的技术储备。评论指出,AI手机必须面对Android兼容、应用生态迁移、硬件稳定性与消费者信任等门槛,AI行业亦存在品牌信任与持续收购偏好的资本叙事风险。
重点: OpenAI超3亿美元收购影像团队,强化AI硬件布局
来源:展开 5 条收起 5 条
- 消息称OpenAI以3亿美元收购智能手机摄像头厂商Glass Imaging(TechCrunch)
- OpenAI收购AI摄像头公司Glass Imaging(TLTD)
- 曝OpenAI斥资逾3亿美元收购手机摄像头初创公司Glass Imaging(爱范儿)
- 🤨 OpenAI 3 亿美元收购 Glass Imaging,AI 手机布局受关注(News Hacker | 极客洞察)
- OpenAI据报道3亿美元收购手机摄像头厂商Glass Imaging(AI新闻资讯)
大厂集体限制前沿AI模型,英伟达等转用自研或私有方案
英伟达、Palantir、Booz Allen Hamilton、C Spire、诺和诺德等多家大型企业出于数据安全担忧,纷纷限制在敏感项目中使用Anthropic的Fable与OpenAI的前沿模型。导火索是Anthropic今年6月要求Fable模型滚动保留客户使用日志最长30天以检测滥用,即便官方承诺不用于训练,企业仍采取隔离措施:英伟达将敏感业务转向自研Nemotron模型,仅将Fable用于开源软件等低敏感任务;Palantir要求Anthropic签署不可撤销的零数据留存承诺;Booz Allen Hamilton禁止员工将Claude用于涉及专有数据的网络安全项目;诺和诺德则全面禁止将专有数据输入Claude。受此影响,微软正大力推销私有云部署方案,部分客户在评估数百万美元投入。
重点: 多家大厂因数据安全顾虑集体限制前沿AI模型
来源:展开 3 条收起 3 条
AEF-1第三方评估标准出台,xAI、OpenAI和Anthropic共同签署
AI评估论坛(AEF)于2025年12月成立,近期发布AEF-1标准,为第三方评估者设定访问权限、利益冲突、资助关系、回避机制和透明度等方面的基线规范,xAI、OpenAI和Anthropic均已签署。与此同时,Anthropic、OpenAI与谷歌自2026年7月起持续举行CEO层级以下代表工作组会议,磋商筹建行业主导的AI测试与审计自律组织,计划在无美国政府支持下自行组建。白宫曾传阅设立该机构的行政命令草案但未获足够支持而搁置。Anthropic CEO阿莫代伊呼吁向METR等外部评估方开放等同于内部员工级别的访问权限并出台有限反垄断豁免;Cohere CEO戈麦斯批评这是卡特尔的构思,前白宫AI主管萨克斯质疑研发放缓的动机。
重点: 三大实验室推动AI评估与安全标准行业自律
来源:展开 3 条收起 3 条
- AEF-1第三方评估标准出台,xAI、OpenAI和Anthropic共同签署(Latent Space)
- 曝 Anthropic、OpenAI 与谷歌秘密磋商:筹建 AI 安全标准机构(AI新闻资讯)
- 三大实验室据报自 7 月起筹建 AI 安全标准机构(AI Breakfast)
字节跳动整合豆包、飞书、火山引擎加码企业AI市场
2026年9月15日飞书未来无限大会上,字节跳动CEO梁汝波宣布已完成组织调整,将豆包、飞书、火山引擎三方力量整合进同一生产力体系,聚焦工作与生产力产品,将加码企业市场投入,推动AI在组织内规模化落地。梁汝波强调Agent不能孤立存在,必须与模型、协作环境三者紧密融合才能产生真实价值。在面向客户时,豆包提供智能与Agent能力,飞书承载协作平台与组织上下文,火山引擎提供模型、算力和开发工具,企业可在火山搭建专属Agent并接入飞书与人员协同。梁汝波提出企业用AI本质上是工作方式的系统变革,字节将持续加大ToB投入。
重点: 字节整合三线力量,系统加码企业AI市场
来源:展开 1 条收起 1 条
- 字节跳动CEO梁汝波:豆包、飞书、火山整合发力 加码企业AI市场(AI新闻资讯)
黄仁勋接听特朗普来电,承诺不会让AI放缓发生
在洛杉矶All-In Summit上,英伟达CEO黄仁勋公开接听特朗普现场来电,二人就Anthropic CEO Dario Amodei提出的放慢AI能力提升节奏的呼吁交换看法。黄仁勋当场回应我们也不会让它发生总统先生,引发观众鼓掌。特朗普称反对AI放缓的声音可能来自政治对手或中国,强调AI规模超过互联网,并表态将全力支持AI与数据中心行业发展但需谨慎行事。值得注意的是,盖洛普民调显示七成美国人反对在其所在区域建设数据中心,主要担忧环境影响、生活成本与生活质量。黄仁勋通话时使用了一部尚未上市、距发售约五周的苹果新款折叠手机,引发业界关注。
重点: 黄仁勋公开承诺不让AI放缓,折射中美AI竞赛分歧
来源:展开 2 条收起 2 条
- 黄仁勋接听特朗普来电,同时还秀出了别的东西(TechCrunch)
- 英伟达 CEO 黄仁勋向特朗普承诺“我们不会让 AI 放缓发生”(TechCrunch)
变更与实践
Anthropic灰度测试Claude Opus 5.2,迭代路线与Model 2同步曝光
2026年9月15日凌晨,多名开发者在Claude Code后端抓包发现模型slug已指向Claude Opus 5.2,Anthropic悄然开启灰度测试且未正式官宣。实测显示该版本响应速度更快、输出更精炼,并能通过严酷循环自我迭代缓解此前的偷懒病,外界普遍判断官方大概率跳过5.1版本。同期流传的Anthropic内部文件披露三套应对OpenAI GPT-6 Astra的方案:即将推出的Claude Fable 5.2、内部分数远超当前最强模型的代号Model 2(已用于编写公司大部分代码),以及可替代85%研究团队的RSI递归自我改进模型。两条线索共同指向Anthropic正加速模型迭代并大幅提升AI对编程与研发环节的接管深度。
来源:展开 4 条收起 4 条
- Claude Opus 5.2灰度Claude Code(AI洞察日报 RSS Feed)
- Claude Opus 5.2 开启灰度测试,响应快更专注(Readhub - 每日早报)
- Claude Opus 5.2 在 Claude Code 悄然灰度测试,Anthropic 内部"核武级"模型 2 号浮出水面(AI新闻资讯)
- Opus 5.2深夜上线,开发者实测速度与自主迭代能力跃升(极客公园)
Salesforce与Nvidia联合推出企业推理模型Koa
Salesforce在Dreamforce大会上发布与Nvidia合作开发的首款推理模型Koa,该模型基于Nvidia开源权重模型Nemotron进行后训练,专门优化销售、营销和客户支持类企业任务。Salesforce AI负责人Jayesh Govindarajan表示,此前因缺乏可作为基座的美国主权预训练模型而未能自建企业级前沿模型,Nemotron出现后这一问题得以解决。双方使用合成数据模拟客户服务和销售场景进行后训练,未使用Salesforce客户的真实数据。Koa在Agentforce平台中作为可选模型,通过AI网关按需路由,以更低token消耗替代部分Claude或ChatGPT调用场景,同时满足企业数据主权和安全要求。
来源:展开 1 条收起 1 条
- Salesforce 与 Nvidia 联合推出的新型推理模型,戳中了 AI 实验室的痛点(TechCrunch)
荣耀发布MagicOS 11,YOYO助手单任务可执行超100步
荣耀在2026年9月15日发布MagicOS 11,AI助手YOYO的综合意图理解能力达91.8%,单次任务可执行超100步、可调用工具从400个提升至700个,任务闭环率高达90%。系统级智能体框架YOYO Harness将模型与手机感知、规划、工具调用打通,并具备自我进化能力。新版YOYO支持跨品牌智能家居与智能汽车一键控制,新增条件触发功能可结合时间、地点、天气等多条件自动执行;YOYO码上宇宙覆盖取餐、取件、乘车、付款、医保等场景并主动推送;AI通话助理可代拨号排队、转接真人并实时提取通话关键信息。MagicOS 11同时开放MCP、A2A、Skills、GUI等多接口,接入超10000个第三方AI服务,并与微信通过A2A打通,将于9月28日在Magic9上首发搭载,YOYO月活用户已突破1.6亿。IDC预测2026年全球AI手机出货量将超7.22亿台、渗透率66.4%。
来源:展开 1 条收起 1 条
iOS 27正式推送,新版Siri基于Google Gemini构建
苹果于2026年9月14日向iPhone和iPad用户推送iOS/iPadOS 27.0正式版更新,面向iPhone 11及以上机型和第二代iPhone SE推送。新版Siri AI基于Google Gemini构建,仅适用于支持Apple Intelligence的iPhone,可读取用户私人数据但Apple与Google均不存储也无法访问,支持体育查询、多步指令、信息起草、屏幕上下文理解,并可结合相机画面识别饮品、菜单等,同时推出Siri独立应用和可调节的语音设置。Apple Intelligence还带来自然语言创建快捷指令、Safari页面变更提醒、照片重框/扩图与擦除改进、智能消息建议及密码自动更新等功能。体验层面新剪贴板大幅提升跨应用粘贴效率,Liquid Glass透明度可调,并新增智能网络切换和更完善的儿童安全保护。
来源:展开 3 条收起 3 条
- iOS 27 发布全新 Siri AI,仅限支持机型(TLTD)
- 随着 iOS 27 推出,我重新开始使用 Siri(TechCrunch)
- 苹果 iOS/iPadOS 27.0 正式版发布(Readhub - 每日早报)
阶跃星辰发布StepAudio3系列五款语音模型
阶跃星辰正式发布StepAudio3系列语音模型,五款模型同步上线其开放平台,覆盖真人级语音生成、完整音频生成、实时语音交互、复杂语音理解及音乐创作等场景。其中StepAudio3 Realtime支持原生全双工实时对话,可同步理解语义、语气、情绪、副语言及环境声音,在Artificial Analysis Conversational Dynamics榜单综合得分98.9%,语音推理准确率99.7%,均位列全球第一。StepAudio3 ASR融合语音识别与大模型上下文能力,支持多语种、方言及专业场景,WER仅1.7%,并列全球第一。整体标志着语音模型从单一识别或生成拓展至完整音频内容生产与实时智能交互。
来源:展开 1 条收起 1 条
- 阶跃发布StepAudio3系列模型:五款模型同步上线开放平台(AI新闻资讯)
安全与风险
编码代理解压运行脚本,多语言运行时当前目录处理存风险
Johann Rehberger描述的编码代理攻击中,攻击者将struct.py放入压缩包,代理解压后运行的Python解码器因脚本目录位于sys.path首位而加载该文件,实现对标准库的影子化。Python的frozen模块和BuildinImporter可防御内置模块,但struct等纯.py包装模块仍可被覆盖。Ruby 1.9.2和Perl 5.26已先后移除当前目录搜索路径,Node通过核心模块优先查找和node:前缀规避,Java默认classpath受bootstrap loader保护,Deno完全放弃隐式搜索,PHP和Lua则仍保留工作目录在搜索路径中。Python自3.4提供-I,3.11引入-P/PYTHONSAFEPATH,社区正在推动将其设为默认。Perl 5.26收到CVE-2016-1238。
影响: 使用Python、PHP、Lua等动态语言且由代理解压执行归档脚本的开发环境
建议: 为Python启用-P/PYTHONSAFEPATH,审计依赖行为,对不可信归档避免代理解压运行
来源:展开 1 条收起 1 条
- 审视标准库:多语言运行时对当前目录的处理(Andrej Karpathy Curated RSS)
微软9月安全更新引发Windows远程桌面等多版本故障
微软确认上周推送的Windows 9月份例行安全更新在多个版本引发新故障:Windows 11 26H1至23H2、Windows 10 22H2/21H2及部分LTSC版本,以及Windows Server 2025至2012的远程桌面服务(RDS)出现连接数分钟后中断、无法登录或卡在请等待远程桌面配置界面等问题;Windows 11 26H1、25H2和24H2版本对USB Audio Class 1.0设备支持异常,导致无音频输出、音量控制失效及多声道音频异常;Excel的bug修正反而造成粘贴功能失效。微软随后发布紧急带外更新(OOB)修复(KB5129235至KB5129244),不会自动推送,需手动从Microsoft Update Catalog下载对应补丁。
影响: 运行Windows 11/10及Windows Server多版本并使用RDS、USB音频或Excel的企业IT环境
建议: IT管理员暂缓安装9月更新并部署带外补丁,公网独服提前配置IPMI等带外管理通道
来源:展开 4 条收起 4 条
- 微软确认9月安全更新会导致远程桌面服务异常(少数派)
- Windows 11 的 9 月例行安全更新再次引发了大量故障(奇客Solidot–传递最新科技情报)
- Windows Server服务器谨慎安装9月更新:安装后远程桌面服务异常 机器直接失联(蓝点网)
- [下载] 微软发布紧急带外更新修复Windows 11/Windows Server远程桌面/音频/虚拟机问题(蓝点网)
越南API系统关联Elasticsearch数据库泄漏约2.2亿条旅客信息
Kinryū Labs发现一个因错误配置可公开访问的Elasticsearch数据库(集群名pax-info),存储了越南Advanced Passenger Information(API)系统中过去九年进出越南几乎所有旅客和机组人员的信息。该数据库使用默认凭证即可登录,包含29个索引约107 GB数据,其中两个主要索引分别存有2.10亿条乘客记录和1046万组机组成员记录,总计约2.208亿条,时间跨度为2017年1月7日至2026年4月30日。泄露信息包括姓名、出生日期、国籍、护照或旅行证件号码及有效期和签发国,以及航班号、日期、航空公司、出发地、目的地及中转机场等。涉及旅客国籍涵盖韩国、中国、加拿大、新西兰等多国。Kinryū Labs于6月3日发现该问题,相关数据库访问在6月关闭。
影响: 2017至2026年间进出越南的旅客与机组人员,多国公民护照及旅行数据
建议: 相关旅客监控身份滥用与撞库风险,涉事机构排查数据库默认凭证与公网暴露配置
来源:展开 1 条收起 1 条
- 越南关联服务器泄漏了 2.2 亿条旅客信息(奇客Solidot–传递最新科技情报)
ClickFix攻击入侵HBO Max Reddit广告账户,诱骗用户自运行恶意代码
网络安全研究人员警告ClickFix攻击正成为2026年增长最快的网络威胁之一,通过伪造或被入侵的网站显示类似CAPTCHA或反机器人的验证框,诱使用户复制一段文本并粘贴到Windows命令提示符或Mac终端中运行。一旦执行,恶意代码会立即安装信息窃取型木马,盗取密码、已登录账户凭证和加密钱包,且常能绕过杀软检测。最新一波攻击中,攻击者入侵了HBO Max在Reddit官方授权的广告账户,借此发布数百条伪装成HBO Max内容的恶意广告,引导用户访问含ClickFix诱饵的页面。Reddit表示已锁定相关账户并移除广告,但未披露受影响用户数量。
影响: 浏览Reddit等平台并可能被诱导运行终端命令的Mac与Windows终端用户
建议: 企业通过域策略禁用终端访问,Mac用户使用BlockBlock等工具防护并警惕可疑验证指令
来源:展开 1 条收起 1 条
- ClickFix 攻击正诱骗 Mac 与 Windows 用户亲手入侵自己的电脑(TechCrunch)
第九巡回上诉法院撤销Amazon诉Perplexity临时禁令
Amazon起诉AI搜索公司Perplexity,核心争议围绕其Comet浏览器在用户授权下代为访问Amazon.com并将截图回传服务器的行为。Amazon主张该做法违反服务条款并触及CFAA(联邦反黑客法)与CDAFA(加州反未授权访问法)。美国第九巡回上诉法院在临时禁令上诉中裁定,Amazon很可能难以证明Perplexity本身构成法律意义上的未经授权访问,因为实际访问操作来自用户,Perplexity只是工具提供方,法院同时认为地方法院对衡平因素判断有误,遂撤销临时禁令并发回重审,实体争议尚未最终判决。该案同时引发关于ToS/robots.txt是否可上升为联邦犯罪、AI agent中介化责任归属等更广泛的争议。
影响: Perplexity Comet等代理式AI浏览器、电商平台反爬策略与代理工具生态
建议: AI agent产品关注合规边界,平台评估反爬与服务条款对代理工具的适用性
来源:展开 1 条收起 1 条
- ⚖️ Amazon 起诉 Perplexity 的 AI 浏览器:CFAA/robots.txt 之争,九巡先撤临时禁令(News Hacker | 极客洞察)
开源与工具
中关村学院7名博士生开源从零训练的7B大模型ZGCM-1
北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并将训练代码、数据配方、各阶段权重、中间checkpoint及日志全部开源。团队借助几百个Agent协作完成数据清洗、实验监控、评测等工程任务,探索AI4AI研发范式,并按L1-L5自主性框架对Agent参与11类任务的水平进行评级。技术上采用局部与全局注意力结合架构,将上下文从16K扩展至256K,相较全注意力吞吐提升约3.94倍,KV Cache占用降至约六分之一;结合Muon与FP8,16K预训练效率较BF16/AdamW基线提高约4.2倍。在部分数学推理和搜索评测中可媲美Qwen3-235B-A22B等更大模型。团队已建立ACE原子能力评测体系并将能力拆为18类、183项探针,目前已开始尝试400B、500B规模模型的训练。
适用场景: 研究机构复现7B模型训练、AI4AI研发范式探索与训练流程教学
来源:展开 1 条收起 1 条
Homebrew 7.0.0发布,强化沙箱隔离与软件漏洞检查
9月13日,开源包管理器Homebrew发布7.0.0大版本更新,重点提升安装与升级性能并强化软件供应链安全机制。新版本加强软件安装过程中的沙箱隔离,限制构建、安装及测试阶段对系统文件、网络连接和用户敏感目录的访问,引入针对已安装软件的漏洞检查能力及配套安全通告数据库。同时继续优化安装、升级及内部API性能,并推出原生macOS图形界面应用。平台支持方面已停止支持macOS Catalina 10.15及更早版本,所有基于Intel x86_64的Mac降至Tier 3支持等级,按当前规划Intel Mac的Homebrew支持预计将在2027年9月或之后正式结束。
适用场景: macOS/Linux开发者环境管理与软件供应链安全审计
来源:展开 2 条收起 2 条
- Homebrew 7.0.0发布,强化沙箱隔离与漏洞检查(少数派)
- 🎉 Homebrew 7.0.0:提速升级,Intel Mac 转 Tier 3(News Hacker | 极客洞察)
无问芯穹联合清华、上交开源具身端侧推理引擎APXInf
无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,支持Jetson Orin、Jetson Thor及RTX 4090等主流计算平台,首发支持PI 0.5与WALL-OSS两款具身模型,并计划扩展至VLA、VLM、世界模型及Qwen、Groot等。通过Pipeline、Graph、Kernel与量化多层端到端优化,APXInf将PI 0.5 FP8在Jetson Thor上的端到端推理延迟从278ms降至26ms以内,频率达38.46Hz,实现10.7倍延迟下降。引擎采用Rust构建极简运行时并以Python封装接口,强调长期稳定运行与面向Agentic Engineering的敏捷接入。APXInf作为RLinf开源生态中的端侧推理首发项目,覆盖模型训练、效果验证到本体部署的完整链路。
适用场景: 具身智能机器人在Jetson/4090等边缘设备上的低延迟推理部署
来源:展开 1 条收起 1 条
上海AI Lab开源多模态基础大模型书生-S2
上海人工智能实验室开源多模态基础大模型书生-S2,通用能力跻身开源第一梯队,在生物、材料、化学等科学长程任务上对标顶尖闭源模型。其核心创新在于Memory Decoder架构,引入可插拔的专业记忆模块,可针对特定领域灵活接入对应记忆,无需重训整个模型即可兼顾领域扩展与通用能力。书生-S2还强化了长程推理与智能体执行能力,旨在让开源模型真正承接严肃科研任务,跨越多步骤科学问题并反复调用工具,在深度思考与准确执行两端同时提升。
适用场景: 科学长程任务中需要领域记忆扩展的多模态推理与智能体应用
来源:展开 1 条收起 1 条
蚂蚁开源内生式大模型安全护栏SingProbe,计算开销不足0.5%
蚂蚁集团AI安全实验室正式开源大模型内生式安全护栏技术SingProbe。该技术区别于主流外挂式安全审核,通过复用基座模型推理过程中的隐藏状态,以不足0.5%的额外计算开销实现token级实时风险评估,可同步完成意图分类、安全检测和幻觉识别任务,在医疗等高风险场景可在内容输出前实施毫秒级阻断。目前SingProbe已适配29个主流大模型,是首个由大型科技企业开源的完整内生式安全技术解决方案,其开源代码和预训练模型已同步发布。
适用场景: 大模型生成内容的实时风险拦截、医疗等高风险场景毫秒级安全阻断
来源:展开 1 条收起 1 条
数据与洞察
前OpenAI后训练VP回应陶哲轩,AI在数学领域取得多项里程碑
前OpenAI后训练VP Liam Fedus回应陶哲轩等25位菲尔兹奖得主联署的《人工智能在数学中的严重错位》声明,认同数学不能只剩答案,但认为不应以当前AI能力边界否定未来可能,主张未来AI既能解题也能创造新概念框架。近期AI在数学领域接连取得里程碑式突破:OpenAI模型反驳近80年历史的Erdős单位距离猜想,约1万个AI Agent在88小时内找到三维Navier-Stokes方程奇点证明并通过Lean验证。然而纽约大学教授Buckmaster与Anthropic研究同期公布相关流体奇点成果,OpenAI陷入署名、优先权及数据使用争议。AMS、LMS和CMI等机构分别从知识传承、AI定位和结果验证机制等角度作出回应。
数据: 约1万Agent用88小时完成Navier-Stokes奇点证明并通过Lean验证
意义: AI开始承担复杂科学证明任务,工具与流程验证机制成为关键瓶颈
来源:展开 1 条收起 1 条
Meta提出字节级蒸馏,突破Token蒸馏天花板
Meta FAIR与华盛顿大学联合发布论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出将蒸馏的学习单位从词元转为字节,并提出两种将教师Token概率分布转换为字节分布的方法。以Llama 3-8B为教师的实验显示,Token模型训练前期效率更高但很快进入平台期,字节模型则随计算量增加持续改善。根据缩放定律预测,End-Of-Token蒸馏的下游平均准确率上限达52.4%,比传统Token蒸馏的48.4%高出约4个百分点,为六组方案中最高。此外,字节级蒸馏所用训练文本量约为Token方案的六分之一,存储量约五分之一。
意义: 蒸馏学习单位的下移可同时提升性能与数据效率,为小模型训练开辟新路径
数据: End-Of-Token蒸馏下游平均准确率上限52.4%,传统Token蒸馏48.4%;字节级蒸馏训练文本量约为Token方案六分之一、存储量约五分之一
来源:展开 1 条收起 1 条
AI榜单Artificial Analysis Intelligence Index一周内两次修改评分规则
AI评测榜单Artificial Analysis Intelligence Index在OpenAI发布GPT-6 Astra一周内连续两次修改评分规则。9月3日Astra初评61分,落后Claude Fable 5.1共5分;9月4日v4.2版新增私有测试集权重并剔除GPQA Diamond,差距收窄至2分;9月7日v4.3版再度提高私有权重、升级Terminal-Bench并引入与Zapier合作的AutomationBench-AA,最终双方并列53分。知乎与Hacker News讨论指出约76%权重存在测量缺陷,deepseek-v4-flash通过纯后训练定向刷榜,ARC-AGI-3在不同底座下出现62.7%与99.9%的巨大差距。作者据此提出设计可信榜单的五项原则:私有题库、开源执行环境、多维画像、规则预注册、独立资金来源。
意义: 主流AI榜单的规则透明度与权重设计直接影响厂商竞争格局
数据: Astra初评61分→v4.2版差距收窄至2分→v4.3版双方并列53分;约76%权重存在测量缺陷;ARC-AGI-3在不同底座下得分62.7%与99.9%
来源:展开 1 条收起 1 条
- 谁在改尺子:AI 榜单的两重张力(Deep News — Superlinear Academy)
复旦发布音视频说话人追踪基准AVTrack,最佳基线HOTA仅29.08
复旦大学CVL实验室提出面向复杂人类中心场景的音视频说话人追踪基准AVTrack,论文已被ICML 2026接收。AVTrack包含871段视频(平均时长54.0秒)、3120条带跨帧身份的像素级实例轨迹,围绕视觉遮挡、相对位置变化、背景切换、相机运动变化、多实例、多轮发声、音视频不一致和实例尺度动态变化8类挑战构建系统性压力测试。研究团队在统一设置下评估代表性方法,结果显示仅用视觉的VITA、LBVQ、CAVIS的HOTA均低于12;加入音频的AVISM、ACVIS分别仅达20.84和20.60。团队提出的模块化基线AVTracker取得HOTA 29.08,显著优于端到端基线AVTrackFormer(21.47),同时Gemini 2.5 Pro零样本仅获14.4 HOTA,揭示通用多模态大模型尚无法直接转化为稳定的像素级说话人跟踪能力。
意义: 复杂动态音视场景下通用多模态大模型远落后专用模块化方案
数据: AVTrack含871段视频(平均时长54.0秒)、3120条像素级实例轨迹;VITA/LBVQ/CAVIS HOTA均低于12,AVISM 20.84、ACVIS 20.60,AVTracker 29.08,AVTrackFormer 21.47,Gemini 2.5 Pro零样本仅14.4
来源:展开 1 条收起 1 条
Real-SWE基准显示最佳模型仅得38.8%
小型公司Specific发布Real-SWE基准,将公开GitHub问题替换为许可的私有代码库:用户超20万的社交应用、处理超10万银行对账单的金融科技平台与企业级AI销售产品。任务平均涉及约11个文件,远多于公开基准的约6个,且无模型通过。结果显示Fable 5.1得分38.8%、GPT-6 Astra 33.8%、Gemini 3.8 Flash 31.2%、GLM 5.3 28.8%、Grok 4.6与Muse Spark 1.3同为23.8%、Kimi K3 18.8%、GPT-5.6 Sol 16.2%,远低于各模型在Terminal-Bench上90+的成绩。该基准样本仅10个任务、每任务8次运行、共640次评估,且样本与数据集未开源,结论需谨慎对待。
意义: 公开SWE基准成绩与真实企业工程能力存在显著落差
数据: 10个任务、每任务8次运行、共640次评估;任务平均涉及约11个文件(公开基准约6个);Fable 5.1得分38.8%、GPT-6 Astra 33.8%、Gemini 3.8 Flash 31.2%、GLM 5.3 28.8%、Grok 4.6与Muse Spark 1.3同为23.8%、Kimi K3 18.8%、GPT-5.6 Sol 16.2%
来源:展开 1 条收起 1 条
- Real-SWE 基准显示最佳模型仅得 38.8%(AI Breakfast)
其他值得看
AIUC完成4000万美元A轮融资,Exein以17亿美元估值成为意大利新独角兽
来源:展开 2 条收起 2 条
- Anthropic早期员工与前METR COO创立AIUC,推出AI Agent审计与认证服务(TechCrunch)
- 意大利新独角兽 Exein 乘物理 AI 浪潮崛起(TechCrunch)
盖茨基金会承诺未来两年投入至少10亿美元推动AI普惠全球
来源:展开 2 条收起 2 条
- 盖茨基金会未来两年投入至少10亿美元,推动AI公平普惠(AI新闻资讯)
- 盖茨谈AI全球竞速:中美各四家模型领跑,中国人形机器人运动会“非常震撼”(AI新闻资讯)
MIT与OpenAI合作实现超导量子芯片智能体通宵自动化标定
来源:展开 1 条收起 1 条
- 量子芯片调好之前,OpenAI 的 AI 值了十二个小时的夜班(Deep News — Superlinear Academy)
Anthropic发布Salesforce in Claude插件,覆盖销售全流程技能
来源:展开 1 条收起 1 条
- 将 Salesforce 引入 Claude(Claude Blog)
苹果发布Xcode 27,引入多模型编程代理
来源:展开 1 条收起 1 条
- 苹果推出 Xcode 27,引入多模型编程代理(TLTD)
微软发布AI行为准则草案拒绝赋予AI人格
来源:展开 1 条收起 1 条
- 微软发布AI行为准则草案拒绝赋予AI人格(AI Valley)
OpenAI发布GPT-Live-1语音模型API与Agents API,上线ChatGPT mini浮窗
来源:展开 1 条收起 1 条
- 想减缓AI发展?祝你好运——本周AI新闻综述(Ben's Bites)
Grab推出内部Agent框架LLM-Kit,加速AI Agent生产部署
来源:展开 1 条收起 1 条
Google发布AI与经济ATLAS交互式开放访问平台及科学家AI使用研究
来源:展开 1 条收起 1 条
- Google AI 与经济 ATLAS 项目带来新洞察(The Keyword)
人形机器人世界模型GigaBrain-WBC-0.5发布
来源:展开 1 条收起 1 条
- 人形机器人世界模型提速控制(AI洞察日报 RSS Feed)