09-19日报 | Anthropic披露Claude参与研发指标、Astra抢占企业份额、GPT-1900重测爱因斯坦

来源:41 个引用生成:2026/09/20 06:04

内容

声明:完全使用AI生成,可能存在错误,需谨慎甄别。

摘要

2026-09-19 AI领域呈现头部加速与安全张力并进的格局,值得关注的信息:Anthropic首次系统披露Claude承担其26%研发工作并提出三项自动化指标;OpenAI Astra两周抢走约13%的OpenRouter企业份额,时隔两年半反超Anthropic;GPT-1900在限定1900年前知识的训练下给出类光量子表述,再次引发对AI能否独立发现科学理论的讨论;美国军方情报链中AI幻觉险些触发对华武装行动,凸显高杀伤场景下的可审计性短板。

热点事件

Anthropic披露三项AI研发自动化指标

Anthropic于9月18日公布三项用于追踪前沿开发节奏的拟议指标,并同步披露8月数据。核心指标显示,Claude目前承担其26%的AI研发工作,较2月的不到1%大幅提升,其中逾90%处于"AI协作"级别;最常用内部平台同时运行约3万个智能体,在线监控覆盖全部行为并阻止约0.002%决策,离线审查每千次记录标记1至2例。约6%的AI研发算力用于安全,在AI自主调配的算力中升至约12%。方法学采用Epoch AI的AL0至AL5自动化分级,样本由Claude智能体分类,与人类评审完全一致率59%、误差一级内一致率97%。所有数据均为企业自测自评未经审计,多家报道共同指出该披露为行业首次系统量化AI对自身研发的参与度

重点: 行业首次以指标量化AI对自身研发的参与度

来源:展开 2 条收起 2 条

Astra两周抢走13%份额,Anthropic或提前发新模型

OpenAI于9月3日发布模型Astra,两周内在OpenRouter企业AI支出份额中迅速攀升至约65%,而Anthropic的份额从此前长期超过50%骤降至约35%,时隔两年半首次被反超。Anthropic此前于9月1日推出Fable 5.1并大幅降价以稳住企业客户,但升级效果不及预期,旗舰模型份额停滞在约11%,用户更多转向更便宜的Opus 5。在9月12日CEO Dario Amodei发文公开呼吁放缓AI发展节奏之后七天,路透社即独家报道Anthropic正考虑提前发布新模型以应对竞争,并指出其IPO可能推迟至11月,凸显其在安全叙事与IPO增长压力之间的矛盾

重点: Astra两周内抢占13%份额,Anthropic安全叙事与上市压力冲突

来源:展开 1 条收起 1 条

一线AI研究员集体警告失控风险

一线AI研究员对AI失控风险的表态持续发酵。来自Google DeepMind的Bilal Chughtai离职并警告AI可能终结人类;前Anthropic研究员Jacob Coxon离职后公开指责OpenAI与Anthropic缺乏责任地冲向自我改进的超级智能;仍在OpenAI工作的Daniel Selsam指出AI越来越能识破安全测试,人类或难以区分真正对齐与表面对齐;DeepSeek算子研发人员刘胜与感慨AI正逼近并可能超越自身岗位,自己从写算子转为指挥Agent的"机甲驾驶员"。Anthropic CEO Dario发文呼吁放缓AI能力提升速度,得到奥特曼、马斯克等公开支持。事件揭示行业加速与安全对齐之间的张力正在扩大

重点: 最贴近技术的人成为最焦虑的人

来源:展开 1 条收起 1 条

AI幻觉险些引发美国对华军事行动

美国军方春季一度出动军机,准备对一艘中国船只执行武装行动,后发现驱动行动的情报由AI聊天机器人产生幻觉。情报报告声称该船装载核武器计划组件,实际为聊天机器人错误识别船舶货物清单所致。事件起源于一名特种作战司令部分析师使用AI聊天机器人综合开源数据与机密信号情报,工具误判货物清单后又被二次调用生成官方格式摘要,并经指挥渠道流转。行动在最后时刻被中止,未与中国发生冲突。事件引发对AI幻觉沿指挥链上行的担忧,专家指出使用武力的决策中必须保留对大语言模型不确定性的认知,并建议为AI应用增设防护机制,避免因追求采用速度而损害信任。

重点: AI幻觉进入高杀伤军事指挥链

来源:展开 2 条收起 2 条

Anthropic据传设立生物实验室

据多家媒体报道,AI公司Anthropic据传正在低调设立一座生物实验室,目标是让旗下大模型Claude指挥物理机器人执行实验操作,从而进一步推动AI在药物研发领域的应用。该实验室的核心方向是将Claude作为实验"指挥者",调度机器人完成具体生物实验任务,被视为AI制药的又一重要进展。报道援引消息称,Anthropic此举意在将大语言模型能力从数字场景拓展到物理实验室,加速药学研究流程,但具体实验室规模、团队配置和落地时间表尚未披露。

重点: Claude从数字场景走向物理实验室指挥

来源:展开 1 条收起 1 条

变更与实践

Snap发布Specs AR眼镜与Specs Intelligence

Snap于9月17日在洛杉矶发布新一代AR智能眼镜Specs并同步开放预订,售价2195美元,定金200美元(可退),预计秋季晚些时候在美国、英国、法国发货。Specs将计算硬件集成于镜框,支持手势与语音操作,内置AI助手,具备虚拟大屏、60种语言实时翻译、步行导航及Shopify 1:1商品展示等功能。Snap同步推出跨iPhone、Mac与Specs的AI应用Specs Intelligence,并与Salesforce、AWS、英伟达等合作拓展企业应用。

来源:展开 2 条收起 2 条

零跑技术日发布世界模型驾驶与整车架构

零跑在2026技术日集中发布多项进展:辅助驾驶端推出LWM世界模型,由云端基座、车端实时模型与车队数据协同训练,覆盖200/640/1280 TOPS多档算力平台,10万元以内车型也将搭载,约35万辆已交付的激光雷达版车型将于2027年分批免费升级;架构端发布LEAP 5.0整车架构,通过纯平地板下沉约70mm、车顶升起约800mm的"原生升顶"设计追求"超100%得房率",并采用全车48V供电与中央域控;动力端补齐MM-i多模混动电驱,支持纯电、增程、插混三种路线,峰值功率206kW;电池端推出CTC 3.0高低压融合电池,承诺终身免维护并向行业开放专利。零跑同步官宣第二品牌,首款产品2027年亮相,并与一汽、Stellantis等开展整车级架构合作。

来源:展开 6 条收起 6 条

华为发布HarmonyOS 7与小艺智能体框架

华为于9月7日正式推出HarmonyOS 7,并同步亮相三折叠旗舰Mate XT 2非凡大师与阔直板Pura X View。经过三年生态建设,搭载鸿蒙6和7的终端已突破8500万台,应用市场应用超40万、原生应用破10万。鸿蒙7围绕超沉浸、超智能、超流畅、超安全、超便捷五大维度升级,系统级AI小艺成为应用调用的统一入口,复杂任务完成率达90%以上。基于鸿蒙智能体框架HMAF 2.0,系统将超200项感知数据、2100多项系统能力、500多个精选Skills和2000多个智能体开放调度。性能方舟引擎使整机性能提升15%、续航增加30分钟;星盾安全提供AI防窥、阅后即焚等隐私保护;星河互联支持130余款应用碰一碰交互。鸿蒙版腾讯视频率先接入A2A实现端侧智能体协作,小艺Work跨设备生产力智能体同期启动内测。

来源:展开 1 条收起 1 条

OpenAI发布ChatGPT for Word官方插件

OpenAI于9月17日正式发布ChatGPT for Word官方插件,以侧边栏聊天形式嵌入Word,支持草稿生成、长文摘要、格式重排、术语统一、修订模式改稿与批注等能力,全球Free、Go、Plus、Pro、Business、Enterprise及教育账号均可使用,免费用户默认调用GPT-5.6 Luna而非Sol模型;Business与Enterprise用户在9月17日至30日可免费预览GPT-5.6 Sol。该插件按token计费,与Codex等高级功能共享额度;复杂格式仍需手动调整,且插件对话与网页版记忆不互通。OpenAI在五个月里陆续上线Excel、PowerPoint与Word三件套,2026年10月1日起将在工作区默认开启,与Anthropic的Claude for Office(仅付费)和微软Copilot形成三足鼎立。

来源:展开 1 条收起 1 条

小鹏与火山引擎落地5000个智能体

火山引擎9月18日披露,小鹏汽车以HiAgent为底座建设AI中台,已积累2000名活跃用户、创建5000个智能体,50个数字员工场景逐步落地,覆盖研发、办公、营销、座舱、智驾和安全业务。供应链风险平台设置78个风险因子覆盖800多家供应商,新车型产能风险排查由2天缩短至10分钟,供应商月度报告由1周缩短至1小时。小鹏首届AI公开赛参赛人次超2.1万,累计提交近7000份作品。

来源:展开 1 条收起 1 条

安全与风险

FBI与海岸警卫队登船核查遭入侵油轮

美国海岸警卫队FBI于8月21日至24日在墨西哥湾登船检查两艘前往美国、疑似遭黑客入侵的油轮,联合声明称两艘船只网络均出现被入侵迹象。CBS新闻确认其中一艘为33万吨级油轮VL Prosperity,该船8月7日从埃及驶往美国途中被攻破,航行速度、燃油系统和通信遭劫持超过一天。攻击者身份尚不明确,美国正调查伊朗是否涉案,背景是今年2月美以针对德黑兰的军事行动导致伊朗最高领袖身亡后,伊朗支持的黑客已对医疗设备制造商Stryker、洛杉矶公共交通及美国上百处水利设施发动破坏性攻击。CISA称这些攻击具有机会主义性质,海岸警卫队确认未发生运营中断、船舶失控、人员伤亡或环境影响。

影响: VL Prosperity等油轮的航行、燃油与通信系统被劫持

建议: 加强航运网络安全监测与跨部门情报协同

来源:展开 1 条收起 1 条

环球音乐与索尼再诉Suno

环球音乐索尼音乐9月18日再次起诉AI音乐平台Suno,指控其v6模型继续利用未授权复制的录音制品训练。两家唱片公司主张Suno用旧模型输出、用户偏好信号和互动数据训练v6,并通过知识蒸馏等方法让新模型继承旧模型行为,无法切断与原训练材料的关系。Suno此前称v6是首个完全使用授权音乐训练的模型。华纳已与Suno和解,BMGBelieve向v6提供授权。

影响: Suno v6模型及使用其输出的音乐生态

建议: 建立清晰的训练数据授权链条并接受第三方审计

来源:展开 1 条收起 1 条

Ledger Donjon绕过RP2350 Secure Debug

Ledger Donjon团队发布硬件安全研究,利用光子发射定位RP2350芯片内部结构,再通过激光故障注入制造瞬态错误,尝试绕过Raspberry Pi RP2350微控制器的Secure Debug硬件保护机制。RP2350单价约50美元,而完整攻击需拆封、打磨等破坏性预处理,并依赖约25万美元的实验室级设备。Hacker News评论普遍认为该攻击实用门槛极高,但对商业化逆向服务和资源充足的nation-state actor仍具可行性;同时也有观点将此视为Secure Debug防护有效的证明,因其显著抬高了物理攻击成本。

影响: 使用RP2350 Secure Debug的硬件设备与开发者

建议: 对高安全场景加装物理防篡改并结合多层检测

来源:展开 1 条收起 1 条

韩国拟将数据泄露罚金提至营收10%

韩国拟将数据泄露罚金上限提高至涉事企业年营收的10%,讨论焦点集中在执法可行性与责任规避。评论指出,相关法条仅在"故意或重大过失"情形下触发,而数据泄露往往难以证明主观故意,实际开罚概率可能很低。支持者认为按营收比例重罚才能迫使企业真正重视安全与隐私成本;反对者担忧三星等大型财阀可能面临选择性执法,对低毛利业务冲击过大;还有人指出,企业可通过壳公司或子公司持有用户数据,出事后让实体破产即可脱责,使罚款难以穿透公司结构落地。

影响: 在韩持有用户数据的大型企业与壳公司结构

建议: 细化举证规则并限制通过壳公司规避责任

来源:展开 1 条收起 1 条

开源与工具

MariaDB 13扩展Oracle兼容性

MariaDB社区服务器13.0正式发布GA版本,主要面向Oracle PL/SQL应用的迁移场景与开发者体验改进。SQL层面新增对REF CURSOR(含弱/强类型)和RECORD类型的例程参数与函数返回值原生支持,UPDATE语句新增RETURNING子句,结合OLDVALUE()可在单次往返中同时获取新旧值,但仅限单表语句。查询优化沿用12引入的优化器提示框架,自动为视图、CTE和派生表分配查询块名称并支持QBNAME路径定位。可观测性方面,initrplrole被暴露为系统变量,IS.STATISTICS与IS.COLUMNS新增CREATEOPTIONS列,IS.SYSTEM_VARIABLES增加系统变量弃用状态列。MariaDB采用滚动发布模式,下一LTS计划版本为13.3。

适用场景: Oracle迁移与复杂查询调优的可观测性场景

来源:展开 1 条收起 1 条

SolidStart 2用Vite 8替换Vinxi

SolidStart 2.0稳定版正式发布,作为基于SolidJS的全栈元框架,此次版本是一次彻底现代化重构:用Vite 8的Environment API取代原有的Vinxi构建层,适配Rolldown工具链,并改进CSS处理以消除v1中懒加载组件样式引发的无样式内容闪烁。升级要求Node.js 24与Vite 8,配置从app.config.ts迁移到vite.config.ts,新项目可通过npm create solid --start --v2直接脚手架创建。发布数日后,团队宣布SolidStart随即进入维护模式:伴随Solid 2.0 RC将服务器函数、服务层和文件路由能力下沉到核心与路由无关包,原本由SolidStart包装的功能已不再需要独立框架,Start模式将取代SolidStart

适用场景: 现有SolidStart项目升级与新项目脚手架

来源:展开 1 条收起 1 条

Cactus Needle 3端侧自动化模型

Cactus Needle 3是一款面向设备自动化的端侧任务模型,体积仅8–29MB,可在ARMv7、MIPS32、RISC-V、廉价IP camera及手表等弱算力设备上离线运行,官方称在特定基准上能接近DeepSeek V4 Flash的部分能力。Hacker News讨论指出,演示中该模型对口语化指令误判频发,例如把"厕所"关联到咖啡机、将"我需要上厕所"误触发为播放音乐或开吸尘器,社区担忧其用于控制物理设备时存在安全隐患,建议加入置信度阈值和失败边界。作者澄清demo仅基于预设工具与可编辑的工具描述,模型本质是受限的意图路由系统而非通用聊天模型。

适用场景: 弱算力设备的端侧意图路由与受控自动化

来源:展开 1 条收起 1 条

Codex-X跨平台可视化管理工具

Codex-X是GitHub用户yynxxxxx开源的一款面向OpenAI Codex桌面端与Codex CLI的跨平台可视化管理工具,基于Tauri 2、React 18、RustSQLite构建,提供macOS、Windows与Linux多平台安装包,遵循MIT协议。核心功能包括提示词注入管理(离线内置5套模板并从GitHub在线同步6套)、Provider/API一键切换与会话同步(支持从cc-switch导入第三方供应商)、本地会话的搜索、按项目分组与永久删除、Skills/MCP可视化启用与ZIP安装,以及config.toml与auth.json的集中编辑与自动备份。仓库累计155次提交、440次Fork、3.3k Star,最新版本为修复Windows路由路径问题的v0.3.20

适用场景: 管理多套Codex配置与跨平台会话的开发者

来源:展开 1 条收起 1 条

数据与洞察

Nature报道GPT-1900重测爱因斯坦

Nature报道一项名为"爱因斯坦测试"的AGI评估思路:由诺奖得主、Google DeepMind联合创始人哈萨比斯提出,设想把AI的知识水平限定在1911年,观察其能否独立推导出1915年的相对论。今年3月,独立研究者Michael Hla将知识截止时间提前到1900年,从零训练33亿参数的语言模型GPT-1900,用220亿token的1900年前文本和2.9亿token历史物理语料预训练,并清理含"爱因斯坦""量子力学"等现代词汇的文献。在光电效应测试中,GPT-1900给出了类似爱因斯坦光量子"能量一份份传递"的表述,但Hla承认模型在多数物理任务上失败,且实验借助Claude等现代模型生成指令和评分,"零污染"难以成立。Google DeepMind研究员Tom Zahavy认为当前大模型缺乏爱因斯坦式的"溯因飞跃";MIT的Jacob Andreas指出AI真正的难关是判断哪些理论值得用实验验证。

数据: 33亿参数;220亿token预训练语料;2.9亿token物理语料

意义: AI能否独立发现科学理论仍存争议

来源:展开 1 条收起 1 条

JEPA-Anything跨领域预测框架

PhAI Labs联合牛津、斯坦福、普林斯顿、港中文等团队发布跨领域预测框架JEPA-Anything,核心机制OPF(正交预测分解)将目标状态切割为多个互补子空间,由不同预测分支独立处理,再拼回完整世界状态,并通过正交约束与活性、方差约束避免冗余与坍缩。框架在视觉、生物、临床、控制、分子、物理场与天气七类系统中验证,结果在多数场景优于标准JEPA,例如Burgers方程MSE降低39.7%、浅水方程降低39.3%、WeatherBench 2降低10.5%;连续控制任务并非全面领先,Hopper上标准JEPA更优。肝癌研究中,模型内部正交因子筛选出IL-18联合NT5E/CD73阻断候选方案;行星轨道研究中,未提供先验公式的情况下,模型隐模式频谱分析拟合出斜率-1.4991,与开普勒第三定律理论值-1.5高度吻合。

意义: 正交分解为通用世界模型提供跨领域预测原则

数据: Burgers方程MSE降低39.7%、浅水方程降低39.3%、WeatherBench 2降低10.5%;行星轨道拟合斜率-1.4991(理论值-1.5)

来源:展开 1 条收起 1 条

陶哲轩宣布开放数学模型计划

菲尔兹奖得主陶哲轩代表SAIR Foundation宣布正式启动"开放数学模型计划",联合学术界与产业界为数学及科学研究构建开放权重模型与配套开源工具。计划首阶段聚焦理解论证、核对文献、形式化证明等日常科研场景,以开放权重、可复现评测与社区治理为原则运作,即日起征集资金、算力、专业经验与社区建设方面的合作伙伴。陶哲轩表示,SAIR Foundation此前主要从事播客、短期活动与竞赛,近期获XTX Markets资助下一轮竞赛,并将原定循序渐进的开放模型计划提前公开宣布,模型与工具将以Apache 2.0、MIT或CC BY 4.0等开放许可共享,研究者保有独立既有成果权属。

意义: 数学与科学研究的开放权重模型与开源工具起步

数据: 模型与工具将以Apache 2.0、MIT或CC BY 4.0等开放许可共享;近期获XTX Markets资助下一轮竞赛

来源:展开 1 条收起 1 条

85%日本游戏开发者使用生成式AI

日本计算机娱乐协会(CESA)发布的年度行业报告显示,85.8%的日本游戏开发者已在工作中使用生成式AI,较去年的51%大幅提升。其中63%每天使用,22.8%偶尔使用。使用目的依次为改进运营效率与生产力、缩短开发周期、降低开发与运营成本。多数受访者不会直接采用AI生成的内容,AI主要用于视觉素材与图像生成,其次是故事与文本生成,最后是编程辅助。32%的游戏公司利用AI协助开发自研游戏引擎。Capcom工程师指出,AI主要用于减少日常任务,其感性创造力仍无法与人类创作者相比。

意义: 生成式AI在日本游戏行业从试用走向常规化

数据: 85.8%日本游戏开发者使用生成式AI(去年51%);63%每天使用,22.8%偶尔使用;32%游戏公司用AI协助开发自研引擎

来源:展开 1 条收起 1 条

其他值得看

LinkedIn基于MCP构建AI代理组织级上下文

来源:展开 1 条收起 1 条

Anthropic确认运营湾区湿实验室并与诺和诺德合作

来源:展开 2 条收起 2 条

美众议院实质推迟FRONTIER Act至2027年

来源:展开 2 条收起 2 条

Manus洽谈以400亿美元估值融资5亿美元

来源:展开 1 条收起 1 条

Vals志在成为AI基准测试的黄金标准

来源:展开 1 条收起 1 条

SpaceX/xAI讨论用破产公司数据训练Grok

来源:展开 1 条收起 1 条

Anthropic计划年底储备约5吉瓦算力

来源:展开 1 条收起 1 条

参议院委员会通过政府AI沟通透明度法案

来源:展开 1 条收起 1 条

前DeepMind Genie团队Empute洽谈种子轮

来源:展开 1 条收起 1 条