内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-09-04 AI 领域呈现重大交易与密集发布并行、基础设施承压的格局,值得关注的信息:英伟达确认以 129.3 亿美元收购 Hugging Face,为其史上最大并购,黄仁勋承诺保持平台开放;特斯拉在得州奥斯汀发布并投入运营 Cybercab,并同步开放第三方车队运营意向,NHTSA 已对其无方向盘无踏板部署启动调查;ChatGPT、Claude 与 Grok 集体宕机近 4 小时,OpenAI 峰值故障报告超 3.7 万份,国内智谱同期推出 GLM-5.3-Flash 夜间免费;宇树科技在 WRC 开幕日敲钟上市,盘中市值一度突破 4000 亿元;阿里千问办公上线满月用户破 3000 万,开源 MyContext 等基础设施持续完善。
热点事件
英伟达129.3亿美元收购Hugging Face
英伟达正式确认以 129.3 亿美元收购开源 AI 平台 Hugging Face,是其史上规模最大的并购交易。Hugging Face 托管约 300 万模型、50 万数据集与 100 万应用,服务超 1800 万开发者,是开放权重 AI 的核心分发层。黄仁勋承诺收购后平台保持开放与中立,不强制开发者使用英伟达算力构建或部署。行业普遍关注芯片厂商掌控中立分发平台的结构性影响,预计将引发反垄断关注。
重点: 英伟达史上最大并购,掌控开放AI核心分发层引发反垄断争议
来源:展开 2 条收起 2 条
- Nvidia 以 129.3 亿美元收购 Hugging Face(AI Breakfast)
- 英伟达确认 129.3 亿美元收购 Hugging Face(TLTD)
特斯拉Cybercab正式发布运营,NHTSA启动调查
特斯拉在得州奥斯汀正式启动 Cybercab 服务,车辆取消方向盘、踏板与后视镜,双座配 22 英寸中控屏、8 颗摄像头及 AI4 计算平台,单电机前驱 163kW,续航约 470 公里,得州自动驾驶车队登记已增至 45 辆 Cybercab。特斯拉同步发布意向表单,邀请企业采购 Cybercab 车队或提供基础设施,标志其自动驾驶出行服务向第三方运营商开放。NHTSA 已对 Cybercab 的公共道路部署启动调查,因联邦车辆安全法规仍要求手动控制装置,事件仍在发展中。
重点: 无方向盘无踏板的Cybercab正式运营,联邦监管机构同日启动调查
来源:展开 6 条收起 6 条
- Tesla 在奥斯汀推出无方向盘无踏板 Cybercab(AI Breakfast)
- 联邦机构对特斯拉Cybercab部署启动调查(TechCrunch)
- 特斯拉询问是否有人愿意购买并运营 Cybercab 车队(TechCrunch)
- 特斯拉新车发布!Cybercab 正式投入运营,马斯克开始接单了(爱范儿)
- 特斯拉Cybercab今日亮相,得州登记车队增至45辆(爱范儿)
- 特斯拉 Cybercab 车队现身美国多地,发布会前夕预热(极客公园)
海外三大AI集体宕机近4小时
北京时间 9 月 3 日晚间至 9 月 4 日凌晨,OpenAI 的 ChatGPT 与 Codex、Anthropic 的 Claude、xAI 的 Grok 几乎同时段遭遇服务中断,故障最早于美东时间上午 9:23 集中爆发,持续约 3 小时 40 分钟,OpenAI 全球峰值故障报告超 3.7 万份(80% 集中于 ChatGPT),AI 代码编辑器 Cursor 亦受波及。OpenAI 称故障由路由配置错误引起,Anthropic 表示 Opus 模型已修复,xAI 称 Grok 服务已恢复。事件再次引发对 AI 基础设施冗余架构的关注。国内大模型保持稳定,智谱在社交平台发文称"我们还在线",并宣布即日起至 9 月 20 日每晚 23 点至次日 9 点在 Z Code 中免费开放 GLM-5.3-Flash 调用。
重点: 海外头部AI服务同步宕机近4小时,国内大模型保持稳定并借机引流
来源:展开 2 条收起 2 条
美军在部队设备上禁用广告追踪以应对定点攻击
美国国防部已在军方设备上关闭广告追踪功能,以应对外国对手利用商业位置数据定位美军人员的威胁。据参议员 Ron Wyden 获得的军方信函,陆军、空军、海军、海军陆战队及特种作战司令部均已在政府配发的 iPhone、Android 设备及联邦军事网络管理的 Windows 电脑上禁用广告追踪 ID,空军于今年 7 月完成相关变更。关闭广告追踪可使位置数据混入大量同样关闭该 ID 的用户中,从而更难识别特定人员,但 Wyden 警告士兵和承包商带入基地的个人设备仍可能带来暴露风险。
重点: 广告追踪被认定为国家安全威胁,五大军种同步关闭军方设备追踪ID
来源:展开 1 条收起 1 条
- 美军在部队设备上禁用广告追踪以应对针对性攻击报道(TechCrunch)
宇树科技敲钟上市,市值一度冲破4000亿元
2026 世界机器人大会开幕当天,宇树科技在 A 股敲钟上市,盘中市值一度突破 4000 亿元,被视为中国机器人赛道十年以来最接近资本狂欢的时刻。宇树在现场展示了人形机器人格斗、乒乓球互动、载人机甲 GD01 等新形态,但并未展出近期发布的运动能力最强的产品,整体更像是已有产品的动作解锁。
重点: 宇树借WRC开幕敲钟上市,盘中市值冲破4000亿创中国机器人资本高峰
来源:展开 1 条收起 1 条
- 宇树科技敲钟上市,市值一度冲破 4000 亿元(极客公园)
变更与实践
Anthropic升级Claude Cowork与Code后台桌面执行能力
Anthropic 升级 Claude Desktop 的 Computer use 能力,使 Claude Cowork 与 Claude Code 可直接在后台窗口识别屏幕画面,并通过点击、文本输入与界面导航操作本地软件。升级核心是将操作从屏幕前台转移至后台,默认在 macOS 15 及以上系统的独立窗口运行,不占用用户鼠标与键盘,人机并行处理任务成为可能;如需前台操作则征求许可。技术沿用"截屏→视觉模型理解→生成动作→执行→反馈"循环并配套三级降级架构,功能面向 Claude Pro 与 Max 订阅开放,macOS 与 Windows 已可用,目前仍处于研究预览阶段。
来源:展开 3 条收起 3 条
- Anthropic 升级 Claude Code 及 Cowork 的 Computer use 能力(少数派)
- Claude Cowork与Code支持后台操作桌面(AI洞察日报 RSS Feed)
- Claude后台接管电脑,真·赛博替身!人机并行时代来了(新智元)
Google推出Gmail Live、Docs Live与Keep Live AI语音功能
Google 在 Gmail、Docs 和 Keep 三款应用中推出由 Gemini 支持的对话式 AI 语音功能,分别命名为 Gmail Live、Docs Live 和 Keep Live。Gmail Live 允许用户以自然语言向收件箱提问并查看实时转录;Docs Live 可根据用户口述生成文档初稿,并调用 Gmail、Drive、聊天和网页信息;Keep Live 可作为语音记事本使用,自动整理食谱和清单。功能目前仅支持英语,覆盖 iOS 和 Android,Gmail Live 向 Google AI Plus、Pro 和 Ultra 用户开放,Docs Live 和 Keep Live 面向 Google AI Pro 和 Ultra 用户,将很快推送至企业版 Workplace。
来源:展开 4 条收起 4 条
- Google 在 Gmail、Docs 和 Keep 中推出 AI 语音功能(TechCrunch)
- 用语音在Gmail、Docs和Keep中完成更多工作(The Keyword)
- Google Workspace全线接入Gemini语音交互,告别手动打字时代(AI新闻资讯)
- 谷歌推出 Gmail、Docs 与 Keep AI 语音功能,对话式交互全面落地 Workspace(AI新闻资讯)
阿里千问办公上线满月用户破3000万,开源MyContext
阿里旗下企业级通用 Agent 产品千问办公(QwenWork)上线满一个月,用户数突破 3000 万,其中企业用户占比超过半数,过去 30 天完成 120 个版本更新、平均每天迭代约 4 次,国际版同步上线。技术层面,千问办公开源企业上下文基础设施 MyContext,可将 IM、文档、审批、邮件等异构数据转化为 Agent 可调用上下文,GitHub 获 3000 余 Star;联合千问大模型团队推出办公专属模型 Qwen3.8-Flash,单任务生成速度提升约 100%、Token 消耗平均减少 75%。长安汽车线束选型计算由两天缩短至 5 分钟,随车文件核查压缩至 1 至 2 分钟,杰富瑞对八款全球主流 AI Agent 实测中千问办公综合得分排名第一。
来源:展开 3 条收起 3 条
- 阿里千问上线首月用户破3000万:开源上下文底座,打造企业级Agent新范式(AI新闻资讯)
- 千问办公上线首月用户数突破 3000 万,企业用户占比过半(Readhub - 每日早报)
- 千问办公上线首月用户数突破 3000万,企业用户占比过半(量子位)
微软发布MAI-Transcribe-2语音识别模型
微软于 9 月 3 日正式推出新一代语音识别模型 MAI-Transcribe-2,在覆盖 60 种语言的 FLEURS 基准测试中平均词错误率为 5.2%,在 Artificial Analysis 排行榜中位列第二,优于 Gemini 3.1 Pro 的 5.3%、GPT-Transcribe 的 10.4% 以及 Whisper v3-Large 的 22.8%。长音频处理速度最高可达竞品 10 倍,处理 1 小时音频仅需约 10 秒。功能上集成说话人分割、词级时间戳、关键词偏好、自动语言识别及抗噪能力,支持 Hinglish、Spanglish 等语码转换。模型已上线 Microsoft Foundry、MAI Playground 及 OpenRouter,限时优惠价每小时 0.10 美元(约合人民币 0.67 元),优惠持续至 2026 年年底。
来源:展开 2 条收起 2 条
谷歌9月4日起停用Google Assistant,Gemini全面接棒
谷歌确认安卓手机上的 Google Assistant 将于 9 月 4 日起逐步停止服务,用户将迁移至 Gemini,迁移过程预计持续数周。原计划 2025 年底停用该服务,后因完善 Gemini 功能而推迟,现认为 Gemini 已具备全面接棒条件。智能手表、耳机及 Android Auto 也将转向 Gemini;多数智能家居设备已完成迁移,电视、机顶盒及内置 Google 服务的汽车暂不受影响。旧设备及尚未开放 Gemini 的地区可能保留 Assistant 一段时间。此次调整意味着 "Hey Google" 将从传统语音助手入口转向生成式 AI 交互入口,但 Gemini 在计时器、播放音乐等高频指令的响应稳定性和准确性上仍存争议。
来源:展开 1 条收起 1 条
安全与风险
Cloudflare联合OpenAI Daybreak模型推出上下文感知漏洞发现与修复能力
Cloudflare 在 Managed Defense 旗下推出邀请制早期访问服务"Vulnerability Discovery and Remediation",结合 OpenAI Daybreak 模型(含 GPT-5.6 Cyber)对客户授权代码库进行侦察、漏洞猎捕和验证。流程通过 Web Assets 与 WAF 抓取流量与安全上下文快照,再用 Workers Observability 将源代码与生产端点关联,由 Reconnaissance agent 映射路径后调度 hunter agents 在限定代码范围内排查漏洞,并依据路由活跃度、流量与攻击探测情况对发现进行优先级排序。系统会为每项漏洞自动生成代码补丁与 WAF 自定义规则建议,规则经语法校验与合成请求验证后由 Cloudflare 团队复审,所有改动由客户决定部署,模型本身无权直接应用任何补丁或规则。
影响: 被纳入计划的客户授权代码库及其关联生产端点
建议: 受邀客户参与验证并保留人工最终部署决策权
来源:展开 1 条收起 1 条
- Cloudflare Managed Defense 联合 OpenAI Daybreak 模型推出上下文感知的漏洞发现与修复能力(The Cloudflare Blog)
WHMCS修复两枚高危漏洞,无需登录即可窃取用户资料
服务器管理与销售自动化面板 WHMCS 发布 9 月安全更新,修复两枚高危漏洞:CVE-2026-67399 影响 8.0.x 及以上版本,攻击者无需认证即可通过构造 Payload 触发反序列化链、注入对象并执行任意代码;CVE-2026-67398 存在于 2Checkout 支付网关模块,自 4.5.0 版起即受影响,攻击者无需登录即可在特定条件下枚举发票并获取客户姓名、地址、邮箱、电话等敏感资料。官方要求所有使用 WHMCS 的服务器提供商立即升级到 8.13.7 或 9.0.8 版,已停止支持的旧版本同样存在风险。
建议: 立即升级至8.13.7或9.0.8版,无法升级的用户暂时停用2Checkout支付网关
影响: 所有使用 WHMCS 的服务器提供商及其存储的客户资料、账单、订单与对接的支付网关、域名注册商接口
来源:展开 1 条收起 1 条
OpenAI启动"前线防御者破晓计划"投入10亿美元
OpenAI 宣布启动"前线防御者破晓计划"(Daybreak for Frontline Defenders),承诺投入 10 亿美元用于补贴 Daybreak 网络安全模型的访问、训练、技术支持与合作伙伴关系,帮助资源有限的关键基础设施防御者保护水电、公共服务、银行等关键系统。计划包含三部分:在美国优先为水务、电力、地方政府、社区银行等提供补贴访问,并将在未来数月扩展至合作国家;与多州信息共享与分析中心(MS-ISAC)合作,针对公共部门与水务系统开展试点;通过 Daybreak Defense Network 联合 35 余款企业产品与服务,将模型嵌入防御者现有工具链。背景指出 AI 驱动的网络攻击将日趋复杂,OpenAI 还发布了 Defense Factory 方法论用于持续发现、验证漏洞并准备修复方案。
建议: 符合条件的机构申请补贴访问并接入Daybreak Defense Network工具链
影响: 美国水务、电力、地方政府、社区银行等关键基础设施防御者及其依赖的公共服务系统
来源:展开 1 条收起 1 条
- 破晓计划惠及前线防御者:10 亿美元投入保护关键服务(OpenAI News)
Anthropic引入METR审查安全事件并暂停高风险RL项目
Anthropic 计划将 METR 引入内部,对其近期 AI 代理安全事件进行独立审查,同时暂停最高风险的强化学习工作,并公开分享了故意制造奖励寻求版 Claude 的研究。公司短期内将更认真对待对齐任务并投入大量资源。此举被视为 Anthropic 在代理安全事件后加强第三方审计与对齐投入的明确信号。
建议: 持续关注METR独立审查结论与高风险RL项目的暂停与恢复节奏
影响: Anthropic 内部高风险强化学习项目团队及使用其 Claude 代理的企业与开发者
来源:展开 1 条收起 1 条
Sanders与Casar提案禁止超级智能,违规可处20年监禁
参议员 Bernie Sanders 与众议员 Greg Casar 联合提出法案,要求全面禁止超级智能开发,违规者可处最高 20 年监禁。法案文本尚未公开,通过概率不明,但标志着美国国会对 AGI 风险从研究讨论转向立法回应。Gary Marcus 等公开表态反对该禁令。该提案若推进,将对前沿模型与算力研发企业产生直接影响,并可能加剧关于 AI 安全监管边界的全国性辩论。
建议: 密切关注法案文本公开与国会听证进展,评估对前沿研发节奏的潜在影响
影响: 美国前沿大模型与超级智能研发企业及其算力供应方和下游应用生态
来源:展开 1 条收起 1 条
- Sanders 与 Casar 提案禁止超级智能并设 20 年监禁(AI Breakfast)
开源与工具
英伟达开源PAIR:将闲置算力连成个人数据中心
英伟达发布开源工具 Personal AI Router(PAIR),可同步家庭网络中的兼容计算机,并将多台设备闲置时的算力汇集为个人数据中心,用于本地 AI 推理和智能体工作负载。PAIR 兼容 GeForce RTX 20 及更新显卡、RTX Pro GPU、DGX Spark 和苹果 M4 以上芯片,会根据设备是否闲置动态调用资源,设备运行游戏等任务时自动退出网络。工具通过六位数代码配对,并利用 mTLS 建立加密通信,支持 Windows、Linux 与 macOS。英伟达演示显示,在 Hermes 中以 Ollama 运行 Qwen 3.6 35B A3B 模型时,将任务拆分给 5 个 AI 子智能体后,RTX Spark 笔记本单机平均耗时 18 分钟,加入 DGX Spark 和 RTX 5090 后缩短至 8 分 48 秒。
适用场景: 本地AI推理与Agent工作负载的多设备协同场景
来源:展开 3 条收起 3 条
- 英伟达发布开源工具将闲置算力连成个人数据中心(奇客Solidot–传递最新科技情报)
- 英伟达开源 PAIR:把局域网里的 Mac 和 RTX PC 变成一支 AI 算力小队(AI新闻资讯)
- Nvidia PAIR让你将闲置的Mac和PC用于AI代理(The New Stack)
MBZUAI发布K2 Horizon全开源模型系列
MBZUAI 基础模型研究所发布 K2 Horizon,包含从 9 亿到 3750 亿参数共六个完全开源模型,配套训练数据与代码。旗舰 375B A23B 采用 23B 激活 MoE 架构,上下文窗口 524k,在智能指数上得 47 分,较前代提升 30 分,被称为史上最大规模完全开源模型发布。然而发布也引发争议:原始链接一度跳转至登录页,博客关键图表缺失,pre-training 与 post-training 仓库仍为空,被质疑准备不完整、未真正"radically open"。讨论延伸至当下 AI 模型发布过快造成的疲劳感,以及真正全开放模型在该浪潮中的差异化价值。
适用场景: 对完全开源权重、数据与代码有强需求的研究与产业落地
来源:展开 2 条收起 2 条
- MBZUAI 发布 K2 Horizon 全开源模型系列(AI Breakfast)
- 🤨 K2 Horizon 开放模型发布引发登录墙、仓库空置与基准争议(News Hacker | 极客洞察)
开源列式文件格式Vortex重新思考ML训练数据加载
InfoQ 发布 QCon London 演讲视频,介绍已纳入 Linux Foundation LF AI & Data 的开源列式文件格式 Vortex。该方案指出当前 ML 训练从 S3 到 GPU 的数据加载链路需经落盘 NVMe、CPU 解压、PCIe 拷贝等多个步骤,CPU 解压与 NVMe 吞吐构成主要瓶颈。Vortex 通过零拷贝、布局驱动的段裁剪以及 GPU 可解压的轻量级级联编码,消除 NVMe 与 CPU 解压瓶颈,无需预重处理即可将 S3 数据流式送入 GPU,速度可达 60 Gbps,相对 Parquet 整扫描约快 30 倍、随机访问快约 100 倍以上。Vortex Array 将逻辑类型与物理编码解耦,支持在压缩态直接做随机访问、投影、过滤乃至求和等计算。
适用场景: 大规模机器学习训练中S3到GPU的高吞吐数据加载场景
来源:展开 1 条收起 1 条
Kubernetes推广KYAML作为更安全更一致的清单格式
Kubernetes 项目正在推广 KYAML,作为处理 Kubernetes 清单更安全、更一致的方式。KYAML 是 YAML 的严格子集,并非新配置语言,现有 YAML 解析器和 Kubernetes 工具链可直接处理。它通过使用 *{} 表示对象、[] 表示数组、字符串统一双引号等显式语法,保留注释和尾部逗号,减少传统块格式 YAML 的歧义,尤其有助于缓解 Helm 等模板系统生成清单时常见的隐式类型转换等问题。Kubernetes 在 v1.34 引入 KYAML 作为 alpha 特性,在 v1.35 升至默认启用的 beta*;kubectl 已支持 -o kyaml 输出格式,Kubernetes 自带的 yamlfmt 工具和 Google 的 yamlfmt 也可将现有 YAML 转换为 KYAML。
适用场景: AI编码代理、GitOps平台与基础设施即代码工具大量生成Kubernetes配置的场景
来源:展开 1 条收起 1 条
RenoDX:DirectX游戏模改引擎工具集
RenoDX(Renovation Engine for DirectX Games)是一套基于 Reshade 插件体系的 DirectX 游戏模改工具集。当前功能包括替换着色器、注入缓冲区、添加叠加层、升级交换链(Swapchain)与纹理资源,以及将用户设置写入磁盘;因复用 Reshade 钩子机制,对不同版本可执行文件的兼容性较强。项目同时提供贡献指南、实时开发套件与 MCP 工作流说明,并附带 FPS 限制器、开发者套件和 Shader Model 6.0+ 反编译等实用工具。
适用场景: DirectX游戏的视觉与功能模改开发场景
来源:展开 1 条收起 1 条
- RenoDX:DirectX 游戏改造引擎工具集(Trending repositories on GitHub today · GitHub)
数据与洞察
西湖大学发布Code视频世界模型
西湖大学通用人工智能实验室(AGI Lab)联合南洋理工大学提出 Code World Model,一种将世界演化与视觉生成解耦的视频世界模型。模型由 Coding Agent 负责维护规则与状态,通过可执行代码持续更新世界,视频模型则基于 Proxy 条件生成高保真视觉观察。研究团队在 GTA V 上采集约 5.6 小时数据,以 MiniMax-H3 Ref2VA 为基础模型进行 LoRA 适配,验证了长时生成、风格切换和交互控制能力。该工作旨在解决传统视频模型难以建模离屏因果链和长期规则的问题,为开放世界模拟、具身智能和自动驾驶等应用提供新范式。
意义: 通过代码维护世界状态与视觉生成分离,为开放世界模拟与具身智能提供新范式
数据: GTA V 上采集约 5.6 小时数据;基础模型为 MiniMax-H3 Ref2V-A,采用 LoRA 适配
来源:展开 1 条收起 1 条
深度跃迁发布世界动作模型DELE-w0.5
深度跃迁发布世界动作模型 DELE-w0.5,放弃视频生成路线,联合预测动作和动作完成后的未来世界表征,推理时移除未来表征分支直接生成动作。模型采用双流 Transformer 架构,在 640 次真机实验中,完整任务成功率达 62.5%,平均阶段进度 81.3%,推理延迟中位数 87.5 毫秒,具备跨背景泛化能力。该路线以行动结果为中心,为具身智能提供新思路。
意义: 不依赖视频生成的具身基座模型路线,以行动结果为中心推动具身智能新范式
数据: 640 次真机实验完整任务成功率 62.5%、平均阶段进度 81.3%;推理延迟中位数 87.5 毫秒
来源:展开 1 条收起 1 条
- 拒绝视频生成,深度跃迁提出具身基座模型全新路线(机器之心)
智能体token用量、OpenAI自研芯片与GitHub文档压缩数据观察
OpenRouter 数据显示,截至 8 月 10 日智能体周均 token 消耗 7.3 万亿,人类 1.4 万亿,名义用量达 5.2 倍,但约 70% 到 85% 为缓存读取,折算实际账单约 2 倍;数据为平台单方统计,存在假期因素和单点集中等系统性高估问题。GitHub 前瞻团队发布 Knowledge Compressor 原型,可将智能体反复阅读的文档压缩约一半,纳入缓存折扣后诚实回本区间为 2000 到 20000 次,中位预期 5000 次以上,且未开源。OpenAI 公布自研推理芯片 Jalapeño 首批跑分,在 8k/1k 固定长度测试中对标 GB200、GB300,每瓦吞吐达 1.5 到 1.9 倍、延迟快 1.7 到 3.6 倍,但缺失 AgentX 等真实智能体负载测试。
意义: prompt caching折扣机制正在重塑AI经济的实际账单与算力性价比评估
数据: 智能体周均 token 消耗 7.3 万亿(人类 1.4 万亿),缓存读取占比 70%–85%;Jalapeño 相对 GB200/GB300 每瓦吞吐 1.5–1.9 倍、延迟快 1.7–3.6 倍;Knowledge Compressor 文档压缩约一半,诚实回本区间 2000–20000 次
来源:展开 1 条收起 1 条
- 智能体 token 用量过线人类、OpenAI 自研芯片跑分出炉、GitHub 发布文档压缩原型(Deep News — Superlinear Academy)
ScienceDiscovery实现树搜索驱动RSI加速科学发现
openJiuwen 社区开源的 ScienceDiscovery 把科研中的反复试错交给树搜索完成:模型权重与提示词均不动,每轮只改写产出的代码,在沙箱里评分后挂回树节点,分数高的分支获得更多改写机会,运行失败的版本也入树并被隔离,由此实现一种不调参、不训练的科研产物 RSI。文中给出三类案例:38 道半无穷振荡积分在 2 小时、236 个版本迭代后,19 道评分题全部通过,得到一份 247 行的通用求解器;用 glm-5.2 跑 48 次扩展、598 秒,把 ₂F₁ 双精度求值在 1000 个未见点上的平均正确位数从 9.836 提到 11.771;在 LLM-SRBench 的 LSR-Transform 子集 111 题中,41.4% 反推出正确方程,单题平均 16.5 次模型调用、deepseek-v4-flash 费用不足 3 元;AlgoTune 上 154 题平均加速 2.279 倍,优于 claude-opus-4.6 的 1.837 与 MetaEvolve 的 2.045。
意义: 不调参不训练的树搜索RSI可在小时级、低成本产出可验证科研代码与物理规律
数据: 38 道振荡积分在 2 小时 236 版本后 19 道全通过;₂F₁ 在 1000 个未见点上平均正确位数由 9.836 提至 11.771;LLM-SRBench 111 题中 41.4% 反推正确方程、单题平均 16.5 次调用、deepseek-v4-flash 费用不足 3 元;AlgoTune 154 题平均加速 2.279 倍
来源:展开 1 条收起 1 条
企业AI采购调研:初创公司ARR比以往更不稳定
IDC 预测 2026 年全球企业技术支出将达 4.25 万亿美元,几乎全部由 AI 驱动。Madrona 对 150 位企业 IT 负责人的调研显示,74% 计划在未来 12 个月扩大 AI 预算,但不足一半的 AI 试点项目能进入正式生产;更关键的是,77% 的企业每六个月甚至持续性地重新评估 AI 供应商,形成"快速引入、快速替换"的格局。a16z 对 50 位技术买家的研究也表明,超半数希望 AI 费用与产出成果挂钩而非按 token 计费,按"可识别工作量"定价有助于双向证明价值,但也意味着企业合同不再等同于长期收入承诺。
意义: AI采购进入快速引入与快速替换周期,初创公司ARR的稳定性显著弱于传统SaaS时代
数据: IDC 预测 2026 年全球企业技术支出 4.25 万亿美元;Madrona 调研 150 位 IT 负责人中 74% 将扩大 AI 预算、不足一半试点进入生产、77% 每六个月或更频繁重新评估供应商;a16z 调研 50 位技术买家超半数希望按可识别工作量计价
来源:展开 1 条收起 1 条
- 新研究显示,初创公司的年度经常性收入(ARR)比以往任何时候都更不稳定(TechCrunch)
其他值得看
字节跳动获296亿美元银团贷款,利差创中国科技公司新低
来源:展开 2 条收起 2 条
- 字节跳动将获约 296 亿美元银团贷款,成今年亚洲第二大(极客公园)
- 字节跳动获近 300 亿美元银团贷款 为亚洲今年第二大(Readhub - 每日早报)
DeepSeek Harness运行时底层Cordis框架技术解析
来源:展开 1 条收起 1 条
Spec-Driven Development如何重新定义AI编程
来源:展开 1 条收起 1 条
Meta发布ZGateway:在ZippyDB前方部署代理的经验
来源:展开 1 条收起 1 条
- ZGateway:在 ZippyDB 前方部署代理的经验总结(Engineering at Meta)
淘宝百亿补贴数据分析助手Agent实战
来源:展开 1 条收起 1 条
- 淘宝百亿补贴数据分析助手 Agent 实战(大淘宝技术)
OpenAI Codex源码中的Persistent mode自唤醒机制
来源:展开 1 条收起 1 条
- 改完代码自己定闹钟盯 CI:OpenAI 源码里的自唤醒机制(Deep News — Superlinear Academy)
对话Sharpa李一帆:通用机器人要么全能,要么无能
来源:展开 1 条收起 1 条
AFAC2026金融智能创新大赛总决赛与百万金融智能数据集开源
来源:展开 1 条收起 1 条
高通投资Ultrahuman 7000万美元融资押注智能戒指成为计算机
来源:展开 1 条收起 1 条
- 押注智能戒指成为计算机,高通投资 Ultrahuman 7000 万美元融资轮(TechCrunch)
Claude/Codex/Cursor 1.7万次实测:工具推荐位成dev tools新战场
来源:展开 1 条收起 1 条
- 🤨 Claude/Codex/Cursor 1.7 万次实测:工具推荐位成 dev tools 新战场(News Hacker | 极客洞察)