内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-07-24 AI 领域呈现数学突破与产业并购并进格局,值得关注的信息:菲尔兹奖得主 Jacob Tsimerman 宣布加入 OpenAI 安全部门,Claude Fable 5 被披露数小时内证伪悬置 87 年的雅可比猜想;Stripe 正洽谈约 100 亿美元 收购模型聚合平台 OpenRouter;OpenAI 向全美开放 ChatGPT Health;黑森林实验室 发布可原生生成 20 秒音视频的 FLUX.3。产品侧 Meta Muse Spark 1.1 以低价 API 发起价格战,安全侧 GitHub Agent 提示词注入与 Kimi K3 网络能力评测同步升温。
热点事件
菲尔兹奖得主 Tsimerman 宣布加入 OpenAI 安全部门
2026 年 7 月 23 日,新晋菲尔兹奖得主、加拿大数学家 Jacob Tsimerman 在 ICM 新闻发布会现场宣布将很快入职 OpenAI 安全部门,并停止招收博士生。直接诱因是 AI 在数学证明上的突破:他今年 5 月参与验证了 OpenAI 模型推翻悬置 80 年的埃尔德什单位距离猜想。Tsimerman 判断 AI 将在两年内于数学证明上全面超越人类,并视其为对社会的严重威胁。他也是本届四位得主中唯一明确加入产业 AI 实验室者,标志着顶尖纯数学人才加速流向前沿模型安全研究。
重点: 顶级数学家转向 AI 安全,标志证明能力跃迁
来源:展开 4 条收起 4 条
Stripe 洽谈约 100 亿美元收购 OpenRouter
多方消息称,支付巨头 Stripe 正洽谈以约 100 亿美元 收购 AI 模型聚合平台 OpenRouter,交易或近期宣布,但仍存在破裂或被竞购风险。OpenRouter 此前估值约 13 亿美元,若成交估值 溢价近八倍。该平台以统一 API 聚合 OpenAI、Anthropic、谷歌、Meta 等主流大模型,是应用开发关键基础设施。若收购达成,Stripe 将从支付层延伸至 模型分发与计费层,有望创下 AI 模型聚合赛道最大并购纪录。
重点: 支付巨头切入模型分发,AI 基建并购升级
来源:展开 2 条收起 2 条
OpenAI 向全美用户开放 ChatGPT Health
7 月 23 日,OpenAI 在美国正式上线 ChatGPT Health,面向所有 18 岁以上登录用户,覆盖网页与 iOS 的 Free、Go、Plus、Pro 套餐。功能可安全连接 Apple Health、One Medical、Function Health 及多家医院电子病历,在常规对话中结合用药、化验、睡眠与活动数据做个性化健康问答。免费用户用 GPT-5.5 Instant,付费可用更强 GPT-5.6 Sol;OpenAI 强调连接数据不用于训练或广告,用户可随时断开并在 30 天内删除。多项研究曾提示 AI 医疗建议可靠性存疑,发布前夕已有相关诉讼个案。
重点: 消费级 AI 正式切入医疗数据与健康场景
来源:展开 2 条收起 2 条
- 在 ChatGPT 中推出 Health 功能(OpenAI News)
- OpenAI向全美用户开放ChatGPT Health(TLTD)
黑森林实验室发布 FLUX.3:原生 20 秒音视频同步生成
Black Forest Labs 发布多模态基础模型 FLUX.3,基于 Self-Flow 统一架构联合学习图像、视频与音频,可单次原生生成最长 20 秒 音画同步内容,支持文生视频、图生视频、关键帧转视频及多镜头串联。人工评测中,对 Grok Imagine Video 胜率 69%,对 Luma Ray3.2 胜率 93%、对 Runway Gen-4.5 胜率 77%。FLUX.3 Video 已开放 Early Access,图像版与开源版 Flux3Dev 将陆续推出;实验室还联合 Mimic Robotics 推出机器人动作模型 Flux-mimic,已在奥迪工厂测试。
重点: 统一多模态流模型把音视频生成 generational 推进
来源:展开 3 条收起 3 条
Claude Fable 5 数小时证伪 87 年雅可比猜想
Anthropic 研究员 Levent Alpöge 披露,Claude Fable 5 在数小时内证伪了悬而未决 87 年 的雅可比猜想。模型构造出三维多项式反例:其行列式为常数,却将不同输入映射到相同输出,从而打破可逆性并推翻该长期数学猜想。这一结果与 OpenAI 模型此前在埃尔德什单位距离猜想上的突破形成呼应,进一步强化“前沿模型正在改写开放数学问题求解节奏”的判断,也加剧了学界对 AI 证明可靠性、验证流程与职业影响的讨论。
重点: 前沿模型再次攻克长期开放数学猜想
来源:展开 1 条收起 1 条
- Anthropic Claude Fable 5数小时证伪87年雅可比猜想(AI Breakfast)
变更与实践
Meta 发布 Muse Spark 1.1 并上线低价付费 API
Meta 推出闭源视觉语言模型 Muse Spark 1.1,主打代理任务,在 MCP Atlas 工具调用榜排名第一、JobBench 第二。模型强调多代理编排、上下文管理与计算机操作,可自主在脚本自动化与直接操作 UI 间择优,并支持批量并行动作。同步上线的 Meta Model API 是美国首个付费模型访问入口,输出价仅 4.25 美元/百万 token,远低于 Claude Opus 4.8、GPT-5.6 Sol 等 25–50 美元档,扎克伯格公开抨击对手利润率过高。
来源:展开 1 条收起 1 条
- Meta发布Muse Spark 1.1与付费API,以低价发起价格战(The Batch | DeepLearning.AI | AI News & Insights)
腾讯 WorkBuddy:把 Agent 做成可用产品的工程拆解
腾讯 WorkBuddy 策略产品经理从产品视角系统拆解 Agent 工程化路径,沿“模型—上下文—Harness—Loop”展开:厘清 Function Call、MCP、Skill、Plugin 边界,阐述 Context Engineering 的写入、选择、检索、压缩、隔离五类动作,并提出 Harness Engineering 的驾驭/约束/整合结构,对比 OpenAI、Anthropic、LangChain 实践。核心结论是:模型决定能力上限,上下文与 Harness 决定上限能否稳定落地,人仍需负责方向、标准与责任。
来源:展开 1 条收起 1 条
- 腾讯WorkBuddy实践:如何把Agent做成可用产品(腾讯技术工程)
ChatGPT 桌面端上线 GPT-Live 全双工语音模式
OpenAI 升级 ChatGPT 桌面应用并与 Codex 整合,正式上线由 GPT-Live 全双工语音模型驱动的 ChatGPT Voice。模式支持同时聆听与说话,覆盖聊天、办公和编程,用户可通过语音发起、检查或调整任务,并从单一对话启动多个工作流;智能体后台执行期间用户可继续交谈,实现“边说边办”的多任务协同,标志语音交互从简单问答向多任务智能体编排演进。
来源:展开 3 条收起 3 条
- ChatGPT桌面应用上线语音模式:口述需求AI多线程干活,冲杯咖啡的功夫会议纪要就备好了(AI新闻资讯)
- OpenAI ChatGPT 桌面应用上线语音模式:用户口述需求,AI 推进多项任务(Readhub - 每日早报)
- ChatGPT 桌面端装上了"真人口吻":GPT-Live 语音上线,你说话它就在后台干活(AI新闻资讯)
Runway 推出生成式媒体模型路由器 Media Router
Runway 推出面向生成式媒体的 Media Router,集成于 Runway Dev 开发者平台。系统可按质量、延迟与 Token 成本偏好,在图像、视频与音频模型间自动调度第三方及自研最优模型,并支持按区域与定价精准路由。Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock 与 Quora 等已通过 API 接入。此举标志 Runway 从 AI 视频应用向全栈生成媒体编排中枢转型。
来源:展开 2 条收起 2 条
- Runway 推出 AI 模型路由器,应对生成式媒体领域日趋拥挤(TechCrunch)
- Runway推出生成式媒体AI模型路由平台系统,全面开启开发者架构服务(AI新闻资讯)
DeepSeek 完成首次外部融资,梁文锋详述开源与低成本策略
DeepSeek 完成首次外部股权融资,募资约 510 亿元,估值约 3250 亿至 3509 亿元,梁文锋为本轮最大单一出资方。在约 4 小时投资人交流中,他强调以 AGI 为主线、坚持开源���只赚合理利润,不追求成为下一个字节或腾讯;API 定价以约 10 个月收回服务器成本为合理标准。当前最大瓶颈是算力,看好国产芯片替代,并认为大模型下一步需突破持续学习并走向具身智能。
来源:展开 1 条收起 1 条
- 梁文锋 4 小时投资会讲话流出:DeepSeek 只赚取合理利润,克制、开源与低成本是实现 AGI 的核心策略(Readhub - 每日早报)
安全与风险
GitLost:间接提示词注入可令 GitHub AI 代理泄露私有仓
Noma Security 披露名为 GitLost 的间接提示词注入漏洞,可利用 GitHub 新发布的 Agentic Workflows AI 代理泄露私有仓库数据。攻击者无需凭证,只需在目标组织公共仓提交 Issue,并等待代理因 issues.assigned 自动触发;通过隐蔽指令与关键词绕过护栏,诱导具备跨仓读取权限的代理读取受限私有文件并在公共评论中公开。研究指出,智能体系统中信任边界部分由模型行为决定,提示词注入已成为代理式 AI 的系统性漏洞类。
影响: 启用 Agentic Workflows 且代理权限过宽的 GitHub 组织
建议: 视用户内容为不可信输入,收紧代理权限并隔离公开输出
来源:展开 1 条收起 1 条
UK AISI 与 CAISI 联合评测:Kimi K3 网络攻击能力仍落后
英国 AISI 与 CAISI 联合发布对月之暗面 Kimi K3 的网络攻击能力测评。在 ExploitBench 上 Kimi K3 仅获 32.2%,落后美国领先模型 76.2% 约四成,未能完成任意代码执行级任务;在模拟企业网络攻击的 TLO 评测中平均仅推进至第 17 步(满分 32),美国领先模型可达 28.5 步。同时其安全护栏几乎无法阻挡漏洞利用开发。评测设 100M token 预算等设定引发对开源模型是否吃亏的争议,结果也被部分人用来讨论蒸馏指控中“通用强、安防弱”的特征。
影响: 依赖开源模型做攻防研究与安全评测的团队
建议: 区分通用能力与攻击 elicitation,审慎解读跨国对比口径
来源:展开 2 条收起 2 条
- Kimi K3 攻防考卷翻车:漏洞利用只到美国前沿模型四成,蒸馏疑云被安全机构摆上台(AI新闻资讯)
- 🤨 UK AISI 评测 Kimi K3 网络攻击能力:接近前沿,100M token 上限引争议(News Hacker | 极客洞察)
严格 AI 护栏正阻碍合法进攻性安全研究
TechCrunch 报道,OpenAI 的 Trusted Access for Cyber、Anthropic 的 Cyber Verification Program 等严格模型使用限制,正在阻碍合法防御与进攻性网络安全研究。多位资深研究员表示护栏过严且行为不一致,迫使他们转向本地开源模型,甚至依赖中国 GLM 等模型。专家担忧这会削弱美国在 AI 安全领域竞争力,使防御者在大规模 AI 攻击浪潮中处于劣势。
影响: 依赖前沿闭源模型做漏洞挖掘的安全团队
建议: 建立可信研究者通道,平衡滥用防控与防御研究需求
来源:展开 1 条收起 1 条
- AI护栏如何阻碍进攻性网络安全研究人员的工作(TechCrunch)
开源与工具
UniWorld-View 登顶 WorldScore 并开源,适配昇腾
兔展智能联合北大、鹏城实验室研发的世界模型 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已适配国产昇腾算力,代码与权重全部开源。给定单图或单目视频,模型可按指定相机位姿推、拉、摇、移甚至 360° 环绕生成新视角视频;单图 3D 与视频 4D 生成共享同一套代码。技术上提出遮挡感知点云渲染与几何流+外观流双分支架构,训练数据来自元空智能。
适用场景: 新视角合成、4D 重建与国产算力上的世界模型研究
来源:展开 1 条收起 1 条
阿里开源 0.8B 文档解析模型 OvisOCR2,登顶 OmniDocBench
阿里 开源 0.8B 参数文档解析模型 OvisOCR2,在 OmniDocBench v1.6 以 96.58 分 登顶,成为首个全面超越传统流水线方法的端到端文档解析模型。基于 Qwen3.5-0.8B 后训练,单模型一次生成即可按阅读顺序输出文本、公式、表格与视觉区域的 Markdown,突破版面分析+内容识别的误差累积。已基于 Apache 2.0 在 Hugging Face 与魔搭开源,兼容 vLLM。
适用场景: 低资源高精度文档解析、RAG 与办公自动化入库
来源:展开 1 条收起 1 条
数据与洞察
具身数据赛道一年融资 44.7 亿:近百玩家涌入仍待利润验证
量子位基于对 97 家 国内具身数据玩家的不完全统计发布行业图谱。过去一年(2025.7–2026.7),15 家独立具身数据服务商共完成 34 起融资、合计约 44.7 亿元,仅为上半年具身智能全行业 438 亿元融资的零头。技术路线分真机遥操、无本体采集、仿真合成、互联网视频蒸馏四类,43% 玩家跨路线布局;现有年产能 160 万至 180 万小时,短期目标扩 15–20 倍。光轮智能以 31 亿元融资、20 亿美元估值成全球首个具身数据独角兽,但半数以上公司成立不足一年,商业模式仍待利润验证。
数据: 97 家玩家、44.7 亿元融资、年产能 160–180 万小时
意义: 具身智能上游数据供给爆发,但变现与质量闭环仍早期
来源:展开 1 条收起 1 条
斯坦福研究:检索失败是 LLM 回答新闻事实的主因
斯坦福与 Together AI 团队在 2026 年 2 月每日测试六款配备网络搜索的 LLM,基于 BBC 新闻用六种语言出题。英文原题下前四款准确率超 90%,但多数模型在印地语等非英语语种明显下降。错误原因中 检索失败占 38.8%,检索到主题相关但细节不符的文档占 32.7%;面对含错误前提的问题,Grok 4 以 70% 准确率领先,GPT-5 仅 19%。研究表明提升检索质量可能比继续扩参带来更大收益。
数据: 检索失败 38.8%、细节不符 32.7%、非英语显著掉点
意义: 事实问答瓶颈更在检索与多语言信息源,而非单纯模型规模
来源:展开 1 条收起 1 条
- 斯坦福研究:网络检索失败是LLM回答新闻事实的主要短板(The Batch | DeepLearning.AI | AI News & Insights)
其他值得看
Token 降本 50%:Harness 工作流成本优化实践
十项改造把中型需求全流程 token 砍半。
来源:展开 1 条收起 1 条
- Token降本50%:Harness工作流的成本优化实践(腾讯云开发者)
阿里后端 AI 知识库四层体系建设长文
把隐性工程约束显式化给 Agent 消费。
来源:展开 1 条收起 1 条
快手用 AI 治理 Feature Flag:已下线 1500 个开关
双引擎自进化,线上零故障准确率超 98%。
来源:展开 1 条收起 1 条
金山办公发布独立 AI Agent「灵犀专业版」
从单文件编辑转向整项工作直接交活。
来源:展开 1 条收起 1 条
Cursor Swarm 重写 SQLite:Harness 三维扩展实验
规范确定场景下的理想工程演示。
来源:展开 1 条收起 1 条
- Cursor 重写 SQLite:一次把 Harness Engineering 三个维度同时往前推的理想实验(Deep News — Superlinear Academy)
Ethan Mollick 发布 2026 夏季 AI 工具选择指南
从聊天机器人转向智能体系统的选型框架。
来源:展开 1 条收起 1 条
- 2026年夏季版:一份有态度的AI工具选择指南(One Useful Thing)
Google 签署欧盟 AI 生成内容透明度行为准则
延续 SynthID 与 GPAI 准则的合规布局。
来源:展开 1 条收起 1 条
- Google签署欧盟AI法案AI生成内容透明度行为准则(The Keyword)
Cursor 上线智能模型路由器,提交成本降约 60%
Teams/Enterprise 可按任务自动匹配模型。
来源:展开 1 条收起 1 条
欧盟依据 DMA 对谷歌开出 8.9 亿欧元罚单
搜索偏袒与应用商店外购限制被罚。
来源:展开 3 条收起 3 条
- Google 因搜索和应用商店服务违反 DMA 被欧盟罚款 8.9 亿欧元(奇客Solidot–传递最新科技情报)
- 😒 欧盟因搜索与 Android/app 竞争违规重罚 Google 8.9 亿欧元(News Hacker | 极客洞察)
- 欧盟委员会公告:谷歌因违反欧盟相关法规,合计被罚 8.9 亿欧元(Readhub - 每日早报)
Patreon 裁员约 20%,CEO 声明被批 AI 公关腔
创作者平台成本重组与组织扁平化并行。
来源:展开 2 条收起 2 条
- Patreon 裁员 20%(TechCrunch)
- 🙄 Patreon 裁员 20% :被批作秀、AI 话术与盈利压力(News Hacker | 极客洞察)