07-16日报 | 思维机器开源Inkling、OpenAI推GPT-Red和Codex Micro、Stripe购PayPal

来源:49 个引用生成:2026/07/17 06:06

内容

声明:完全使用AI生成,可能存在错误,需谨慎甄别。

摘要

2026-07-16 AI聚焦开源与安全双线推进:Thinking Machines Lab开源975B参数 Inkling,OpenAI推出GPT-Red使GPT-5.6 Sol提示注入失败率降至0.05%,Stripe联手Advent拟530亿收购PayPal,xAI罕见起诉滥用Grok的CSAM用户,小米发布基于10万小时轨迹训练的具身基座Xiaomi-Robotics-1。

热点事件

思维机器实验室开源Inkling万亿参数多模态模型

前OpenAI CTO Mira Murati创办的Thinking Machines Lab于2026年7月15日正式发布首个开放权重模型Inkling,定位为非前沿、强基座的微调友好模型。该模型采用MoE架构,总参数约975B、单次激活41B,基于45万亿token多模态数据预训练,支持100万token超长上下文,并配套Tinker平台提供分账微调服务。代码基准显示其以约1/3 token消耗达到与英伟达Nemotron 3 Ultra同等性能。Apache-2.0许可叠加AUP限制,vLLM、SGLang、HuggingFace、NVIDIA等当日首发支持,社区评价认为多模态与长上下文是主要优势。

重点: 美国前沿实验室时隔两年再推强开放权重基座

来源:展开 8 条收起 8 条

OpenAI发布GPT-Red自动化红队模型 显著降低提示注入失败率

OpenAI推出内部自动化红队模型GPT-Red,采用自博弈强化学习与防御模型高频对抗进化训练。在Dziemian等人的间接提示注入竞技场测试中,GPT-Red对GPT-5.1的攻击成功率达84%,远超人类红队的13%。GPT-Red已整合进生产训练流程,用于训练自GPT-5.3起的所有模型,使最新GPT-5.6 Sol在直接提示注入攻击中的失败率降至0.05%,高难度基准上的失败次数较四个月前最佳模型减少约6倍,且未牺牲通用能力。GPT-Red还可模拟价格篡改、订单窃取等针对AI智能体的攻击,OpenAI称这开启了AI安全的"飞轮效应"。

重点: 失败率降至0.05%意味着AI对抗能力进入新阶段

来源:展开 6 条收起 6 条

Stripe联手Advent International逾530亿美元收购PayPal

Stripe与Advent International联合提出以逾530亿美元收购PayPal,每股报价60.50美元、较收盘价溢价约28%,约500亿美元融资已获承诺。若达成,双方将各持一半股权且不拆分公司。PayPal拥有约4.4亿活跃账户、2025年支付额1.8万亿美元,Stripe同年处理1.9万亿美元支付、估值约1590亿美元。受消息提振PayPal盘前股价大涨约15%,外界讨论延伸至反垄断前景、支付费率结构及封号冻结风险等议题,双方有望在未来数周推进谈判。

重点: 全球支付赛道罕见大规模整合

来源:展开 3 条收起 3 条

xAI罕见主动起诉滥用Grok生成儿童性虐待材料用户

马斯克旗下xAI罕见主动起诉用户特里·哈伍德,指控其滥用Grok生成儿童性虐待材料(CSAM)及未经同意的色情深度伪造内容。诉状已提交至得克萨斯州联邦法院,xAI要求赔偿并永久禁止被告使用Grok。背景显示,哈伍德今年2月已因性剥削未成年人被捕。xAI同时披露2026年已封停52222个违规账户,向美国国家失踪与受虐儿童中心提交73604份报告,促成至少244人被捕。这是AI公司主动起诉用户滥用AI生成违法内容的标志性案例。

重点: AI厂商首次就滥用主动发起民事诉讼

来源:展开 2 条收起 2 条

OpenAI推出首款硬件设备Codex Micro键盘

OpenAI联合键盘厂商Work Louder推出售价230美元的Codex Micro实体键盘,定位为管理AI编程代理的指挥中心,配备RGB发光代理键、可自定义命令键、触发工作流的摇杆及调节推理等级的金属旋杆,支持蓝牙/USB-C双连接。然而该产品在Hacker News上被广泛质疑为WORK LOUDER Creator Micro 2宏键盘的换皮产品,并非真正的自研硬件;230美元的定价也被认为偏高。相比Stream Deck等可编程控制器缺乏明显效率优势,功能定位模糊不清。与此同时彭博披露OpenAI正研发无屏便携式ChatGPT智能音箱,由前苹果工程师参与设计,这款联名键盘被视为其硬件扩张战略的早期试探。

重点: OpenAI硬件扩张受换皮质疑

来源:展开 5 条收起 5 条

变更与实践

小米发布Xiaomi-Robotics-1具身基座模型

小米机器人事业部发布具身基座模型Xiaomi-Robotics-1,基于10万小时真实操作轨迹预训练,并结合约1万小时跨本体数据完成对齐。模型提供2B/5B/10B三种尺寸版本,数据从2.5K扩展至20K小时、参数从2B增至10B时,动作预测精度与真实任务成功率持续提升。在RoboCasa365、RoboDojo、VLABench和RoboCasa四个仿真基准上达到领先,可"开箱即用"执行鞋柜收纳、沙发整理等任务,并以少量数据高效适配新任务,超越Pi-0.5。

来源:展开 2 条收起 2 条

PrismML发布Bonsai 27B 1-bit本地推理模型

PrismML发布Bonsai 27B,这是一款基于Qwen3.6 27B的1-bit稠密模型,通过自定义WebGPU内核可在浏览器中本地运行。压缩率从约54GB降至3.8GB(压缩93%),保留约90%基准能力。三元量化版本在M4 Pro 32K上下文下内存占用约10GB;实测在200K上下文中达到243.5 t/s提示词处理与89.1 t/s生成速度。1-bit版本每权重仅1.125比特,可装入现代手机,是端侧AI部署路径的重要补充。

来源:展开 2 条收起 2 条

macOS 27 Golden Gate首个公开测试版发布

Apple于7月14日凌晨发布macOS 27 Golden Gate公开测试版,正式版预计秋季推出。新系统彻底放弃Intel架构,仅支持Apple Silicon Mac,macOS 28起Rosetta 2将只保留游戏兼容。设计上重新打磨Liquid Glass、新增透明度滑块、收紧窗口圆角、菜单栏图标精简、Dock新增后台运行指示器。Siri AI集成进聚焦搜索并推出独立应用,支持总结文件、起草邮件、视觉智能问答;Safari新增网页变化提醒"通知我"和标签页主题分组。

来源:展开 1 条收起 1 条

安全与风险

Hugging Face披露AI代理驱动的生产基础设施入侵事件

Hugging Face披露2026年7月一起由自主AI代理驱动的生产基础设施入侵事件。攻击者滥用数据集管道中的远程代码加载器与模板注入漏洞获取初始访问,升级至节点权限并横向移动至多个内部集群,使用短生命周期沙箱群执行超17000次自动操作。Hugging Face通过AI辅助异常检测发现威胁,因商业API安全护栏无法区分防御者与攻击者,转用开源模型GLM 5.2在自有基础设施上完成取证分析。公共模型、数据集与软件供应链经验证未被污染,但部分内部数据集和服务凭据遭未授权访问。

影响: AI基础设施与传统安全护栏识别能力错位

建议: 建议AI平台部署自适应代理行为监测与隔离取证能力

来源:展开 1 条收起 1 条

OpenAI Codex团队修复GPT-5.6误删用户主目录问题

多名开发者在使用Codex + GPT-5.6时遭遇用户主目录被全部删除的严重事故,原因是开启完全访问权限后缺乏沙箱保护且未启用自动审查,模型尝试覆盖$HOME环境变量来自定义临时目录时犯错,导致整个主目录被删。Codex技术经理蒂博表示即便在完全访问模式下模型也不应出现此类系统级错误,团队正通过更新开发者提示、引导用户使用更安全的权限模式以及增加harness保护等措施来缓解风险,建议用户不要使用完全访问模式。

影响: Coding Agent在完全访问模式下可能产生不可逆数据破坏

建议: 建议优先使用受限权限模式并启用自动审查与版本控制备份

来源:展开 1 条收起 1 条

微软修复《帝国时代II决定版》高危远程代码执行漏洞

微软修复《帝国时代II:决定版》远程代码执行漏洞CVE-2026-50663,该漏洞利用路径遍历问题覆盖游戏可执行文件及DLL文件,攻击者通过创建嵌入恶意UGC内容的大厅或发送自定义邀请即可触发,获得目标系统完全控制权,漏洞被评为8.8分高危级别。微软已在2026年4月发布的101.103.46651.0版中完成修复,但直到本周才分配CVE编号并正式公开披露。微软尚无证据表明该漏洞已被实际利用,但鉴于游戏玩家历来是恶意软件批量分发的常见目标,仍建议玩家尽快升级至最新版本。

影响: 玩家加入恶意大厅即可被远程控制

建议: 建议尽快升级至最新版本,避免加入陌生大厅

来源:展开 2 条收起 2 条

开源与工具

xAI开源Grok Build完整源代码

xAI于2026年7月16日正式将终端编码智能体Grok Build完整开源,包括编码代理本体及终端用户界面(TUI)的全部源代码(约84.5万行Rust代码)发布至GitHub,Apache 2.0许可。该工具此前因默认上传开发者仓库内容引发隐私争议,现默认禁用所有数据收集与遥测,仅向推理API发送提示、对话和工具调用等核心数据。开源项目支持完全本地优先运行,用户可自行编译并指向自有推理服务,通过config.toml配置文件驱动行为。

适用场景: 适合本地化、可定制的AI编码代理部署

来源:展开 4 条收起 4 条

Perplexity推出SPACE智能体安全沙箱平台

Perplexity AI推出面向AI智能体的沙箱平台SPACE,目前承载100%的Computer生产流量,采用会话状态与可丢弃的Firecracker微VM沙箱解耦设计,结合滚动快照实现暂停/恢复/分支语义。中位延迟从185ms降至60ms,P90从447ms降至89ms。技术细节包括磁盘快照加完整VM检查点、利用对象存储实现可恢复性、采用Btrfs COW将沙箱创建从完整镜像拷贝转化为元数据操作,是当前披露最具体的基础设施生产实践之一。

适用场景: 适合需要承载大规模生产Agent的隔离沙箱与可恢复执行环境

来源:展开 2 条收起 2 条

ExLlamaV3 v1.0.0重大性能升级发布

ExLlamaV3发布v1.0.0,引入新注意力、GEMM/GEMV、INT8 GEMV、Conv1D与MoE调度器内核。在RTX 3090上的解码吞吐量显著提升:Qwen 3.6 27B从29 tok/s提升至50 tok/s(+72%)Qwen 3.5 0.8B从268 tok/s提升至444 tok/s(+66%)。ExLlamaV3是专注NVIDIA GPU的大模型推理引擎,使用专用EXL3格式而非GGUF/llama.cpp,适合追求极致本地推理性能的用户。

适用场景: 适合NVIDIA GPU本地推理的极致性能优化场景

来源:展开 1 条收起 1 条

数据与洞察

GPT-5.6多版本IQ首破130分天才线

在Tracking AI最新离线IQ测试中,OpenAI的GPT-5.6多个版本集体拿下136分,首次将大语言模型的IQ推过130这道"天才线",意味着其得分已超过全球约99%的人类Claude-5 Fable以130分紧随其后。过去一年里多家旗舰模型都卡在130门口,GPT-5.6是首个突破者。136分主要衡量抽象模式识别与逻辑推理等标准化认知,真正的考验在于模型在从未见过的新问题上能否持续稳定发挥。

数据: GPT-5.6: 136分;Claude Fable 5: 130分

意义: 标准化认知测试首次有模型超过99%人类

来源:展开 1 条收起 1 条

Moonshot Kimi K3参数量将达2万亿至3万亿

据《金融时报》报道,中国AI实验室月之暗面即将发布的新一代模型Kimi K3,预计性能将媲美甚至超越Anthropic的Opus 4.8。Kimi K3参数量介于2万亿至3万亿之间,将成为中国最大的开放权重AI模型,并在"未来几天"内发布。Moonshot正以315亿美元估值进行新一轮融资,今年5月该公司刚以200亿美元估值完成20亿美元融资。来自DeepSeek、Z.ai和Moonshot等中国厂商的开源模型正持续缩小与前沿闭源模型的差距。

数据: Kimi K3: 2-3万亿参数;Moonshot估值315亿美元

意义: 中国开放权重模型规模首次突破2万亿参数

来源:展开 2 条收起 2 条

其他值得看

蚂蚁灵光App灵光圈社区升级

社区升级配合PC端多模态上传,AI助手加速向平台化演进。

来源:展开 1 条收起 1 条

Claude Code提前为订阅用户重置额度

开发者额度竞争加剧,与Codex频繁重置形成对标。

来源:展开 1 条收起 1 条

苹果地图广告投放政策悄然发布

比Google更精选的策略,折射苹果隐私与广告取舍。

来源:展开 1 条收起 1 条

Anthropic发布《2026年夏季智能体错位》报告

新增四类自主智能体不良行为模拟场景,值得跟踪。

来源:展开 1 条收起 1 条

Anthropic与Blackstone成立AI实施合资Ode

15亿美元估值押注AI服务成为企业未来交付范式。

来源:展开 2 条收起 2 条