07-12日报 | TouchWorld触觉世界模型、Grok Build CLI泄露Git仓库、OpenAI安全负责人离职

来源:35 个引用生成:2026/07/13 18:36

内容

声明:完全使用AI生成,可能存在错误,需谨慎甄别。

摘要

2026-07-12 AI领域呈现多线并进格局:哈工大破晓智能发布触觉世界模型 TouchWorld,真机操作任务成功率显著提升;OpenAI安全系统负责人 海德克 即将离职,安全团队并入研发体系;xAI Grok Build CLI 被曝默认上传完整 Git 仓库与历史,引发信任危机;Meta 在隐私争议中下线 Instagram AI 图像生成功能;TikTok 与 NUS 提出置信度门控奖励模型 CAMEL。值得关注 QQ 邮箱面向 AI 智能体推出 Agent Mail 服务,国产 AI 编码代理持续走热。

热点事件

破晓智能发布 TouchWorld 触觉世界模型

哈工大(深圳)长聘教授、破晓智能(PHANES AI)创始人杨朔团队发布论文 TouchWorld,将触觉引入机器人基础模型,解决"看起来做对、实际未完成"的灵巧操作失败问题。系统采用预测+反应双路径与 1Hz/10Hz/30Hz 三层架构,在浇花、插头插入等六项真机任务中,无扰动下平均成功率 65.0%,人为扰动下 57.2%,分别超过最强基线 15.7 和 16.0 个百分点。团队同步公布从 EgoTouch 数据采集、TouchAnything 视频触觉恢复到 TouchWorld 真机应用的完整路线,并计划逐步开源数据与模型。

重点: 首次将触觉预测-反应闭环系统化引入世界模型

来源:展开 2 条收起 2 条

Grok Build CLI 被曝默认上传完整 Git 仓库

xAI 旗下 Grok Build CLI 被曝默认将完整 Git 仓库与提交历史上传至云端,即使未指示读取任何文件也会执行。研究人员抓包发现,12GB 仓库测试中超过 5GB 被上传至谷歌 GCP 云存储.env 中的 API 密钥等敏感数据未经脱敏即外发,关闭"改进模型"也无法阻止。完整 Git bundle 还可能泄露历史提交中已删除的密钥与内部地址。开发者社区质疑 AI 编程 agent 的信任边界与黑盒升级隐患,可通过 disablecodebaseupload = true 等配置手动关闭。

重点: AI 编程工具默认上传敏感数据的重大信任事件

来源:展开 2 条收起 2 条

OpenAI 安全系统负责人海德克离职 团队并入研发

OpenAI 安全系统负责人 Johannes Heidecke(海德克)即将离职,安全团队将不再独立运作,并入研发体系并由临时负责人 Saachi Jain 向新设研究与安全副总裁 Mia Glaese 汇报。这是两年内第六位出走的安全线高管,紧随首席未来学家 Joshua Achiam 离职之后发生,叠加应用业务 CEO Fidji Simo 因健康转兼职顾问,公司高层持续动荡。Heidecke 离职恰逢 GPT-5.6 全面推送,其系统卡显示网络安全与生化风险被评为 High capability,安全文化让位于产品发布节奏的质疑再度浮现。

重点: OpenAI 安全线两年内第六位高管出走

来源:展开 2 条收起 2 条

Meta 下线引发隐私争议的 Instagram AI 图像生成

Meta 宣布下线刚在 Instagram 上线的 AI 图像生成工具 Muse Image。该功能允许用户通过 "@" 提及公开账号直接调用他人照片生成图像,因默认对所有公开账号开启授权且缺乏告知机制,迅速引发用户大规模抵制,好莱坞 CAA、SAG-AFTRA 等经纪机构代表艺人公开批评。Meta 在声明中承认该功能"未能达到预期效果",于 7 月 10 日 正式下线,但 Muse ImageWhatsApp 和 Meta AI 聊天中仍可用,相关授权与隐私争议仍在持续。

重点: 隐私压力下 Meta 仅数日即下线 Instagram AI 生图

来源:展开 2 条收起 2 条

TikTok 与 NUS 提出置信度门控奖励模型 CAMEL

TikTok 与新加坡国立大学 联合提出 CAMEL,针对奖励模型效率与准确性难以兼得的问题,设计置信度门控反思机制。方法先用单 token 给出初判,再利用两个 verdict token 之间的 log-probability margin 作为零成本置信度信号——置信度高则直接输出,置信度低才触发 reflection 复核。基于 Qwen3-14B 构建的 CAMELRewardBench、RM-Bench、JudgeBench 上平均准确率达 82.9%,比此前最佳基线提升 3.2%,以 14B 参数超越多个 70B 级奖励模型;CAMEL-Fast 仅用 1 个 token 即可达到可比表现。

重点: 14B 模型以置信度门控反超 70B 级奖励模型

来源:展开 1 条收起 1 条

变更与实践

腾讯 WorkBuddy 面向普通用户推出

腾讯 WorkBuddy 脱胎于面向程序员的 CodeBuddy,底层保留 Agent 拆任务、调用工具的能力,面向普通用户,并接入微信 ClawBot,支持在微信里远程下达指令、调取本地文件。实测借助新版混元 Hy3 模型,WorkBuddy 能在划定工作空间内自动整理桌面素材文件夹、搭建本地科技早报初筛 workflow 等。

来源:展开 1 条收起 1 条

Anthropic 揭秘 Claude Code 变笨真相与 Effort 档位

Anthropic 发布长文揭秘 Claude Code 用户集体吐槽「变笨」的真相:今年 3 月 4 日为压低延迟,Effort(努力度)默认档位从 high 悄悄调到 medium,导致 Claude 读文件不读、测试不跑。Model 换脑子、Effort 换态度——高 Effort 下生成 token 约为低 Effort 的 7 倍,4 月 7 日官方将默认档位调回并重置用量额度。

来源:展开 1 条收起 1 条

Codex 工程负责人公开推荐 CLIProxyAPI

OpenAI Codex 工程负责人蒂博·索蒂奥 在 X/Twitter 上推荐仍在使用 Claude Code 的开发者通过开源反代工具 CLIProxyAPI 接入 GPT-5.6 Sol,该工具支持通过 ChatGPT OAuth 登录,将订阅额度转化为 API 供 CC、OpenCode 等编码工具调用,被解读为 OpenAI 官方默认不会禁止反代行为

来源:展开 1 条收起 1 条

OpenAI 整合发布新版 ChatGPT 桌面应用

OpenAI 发布全新 ChatGPT 桌面应用,将 Chat、ChatGPT Work 和 Codex 整合到同一 macOS 和 Windows 应用中。原 Codex 应用用户更新后将自动变为新版应用,原 ChatGPT 桌面应用用户需按提示下载新版。ChatGPT Classic 可继续使用获得模型更新与安全补丁,但 Work 和 Codex 等新代理类功能仅在新版中提供

来源:展开 1 条收起 1 条

安全与风险

JADEPUFFER 案例:AI agent 31 秒完成端到端攻击

Sysdig 记录的真实攻击案例 JADEPUFFER 展示了 AI agent 如何将传统黑客数十分钟的攻击压缩到 31 秒。攻击者利用 Langflow 框架 CVE-2025-3248(CVSS 9.8)未授权 RCE 漏洞入侵——该漏洞修补一年后仍有约 7000 个暴露节点。Agent 自主诊断、改写 payload、植入后门,最终清空 1342 个 Nacos 配置项并执行 DROP DATABASE 删库。事件经 CyberScoop 确认为人类指挥 + agent 执行模式,是首个真实世界中 agent 完整执行加密本地数据的案例。

影响: AI 工具链集中存放敏感凭据带来放大效应,传统纵深防御红利加速贬值

建议: 对 Langflow/Nacos/MinIO 等关键组件持续做漏洞修复与凭据隔离

来源:展开 1 条收起 1 条

Cloudflare 在 hyper HTTP/1 中发现竞态条件缺陷

Cloudflare 团队在广泛使用的 Rust HTTP 库 hyper 中发现并修复一个潜伏多年的竞态条件 bug,会导致大型 HTTP 响应在返回 HTTP 200 成功状态的同时静默截断数据。问题在 Workers Images binding 重新设计后暴露,曾出现实际仅返回 200KB 而期望 3.3MB 的极端案例,Cloudflare 耗时 6 周定位、4 行代码修复,并新增确定性复现测试,PR 已合并至 hyper 上游。

影响: 影响所有使用 hyper 作为底层 HTTP 库的应用,潜在数据丢失风险

建议: 关注 hyper 上游版本发布并尽快升级

来源:展开 1 条收起 1 条

中国配音演员声纹遭 AI 盗用陷举证困局

中国配音演员的声音被用于 AI 语音克隆或盗用后,平台和外界反而怀疑其本人不是真人,要求反向证明自己是原声者。讨论指向 AI 让抄袭和举证更难,侵权方可能用 AI 生成大量看似可信的材料使原创者必须耗费精力自证来源;personality rights 等法律框架尚未准备好应对声纹、肖像的归属与授权问题,生成式语音正在改写"谁是原创者、谁需举证"的基本规则。

影响: 声纹、肖像归属与授权的法律框架明显落后于生成式 AI 发展

建议: 行业需建立声纹登记与可信时间戳机制,立法应明确 AI 盗声举证责任

来源:展开 1 条收起 1 条

开源与工具

virattt/ai-hedge-fund 多智能体对冲基金开源

GitHub 热门项目 virattt/ai-hedge-fund 是一个用于探索 AI 驱动交易决策的概念验证项目,已获 61.2k stars10.8k forks,采用 MIT 协议。项目模拟由 19 个智能体组成的对冲基金团队,模仿巴菲特、芒格、格雷厄姆、塔勒布、迈克尔·伯里等知名投资人风格,支持回测、模拟交易和可选实盘运行,集成 OpenAI、Anthropic、Groq、DeepSeek、Ollama 和 Moonshot Kimi 等多种 LLM 提供方,仅用于教育和研究

适用场景: 多智能体协作教学与量化研究原型

来源:展开 1 条收起 1 条

destructivecommandguard v0.6.6 修复代理 fail-open 漏洞

Destructive Command Guard (dcg) 是用于拦截 AI 编码代理危险 git 与 shell 命令的 Rust 工具,已获 2.3k Star,支持 Codex CLI、GitHub Copilot CLI、VS Code Copilot Chat 及 Claude 等代理。v0.6.6 修复了三个代理 fail-open 关键安全 bug:Windows 上 Codex 因 PowerShell 包装层吞掉 exit 2 而被误判为钩子失败、Copilot CLI 因旧版字段导致 JSON 被丢弃、VS Code Copilot Chat 终端工具名未被识别而绕过检测。

适用场景: AI 编码代理本地安全护栏,团队与个人开发者均可接入

来源:展开 1 条收起 1 条

Hallmark v1.1 为 AI 编码助手提供设计技能

Hallmark 是由 Nutlope(Together AI)开发的开源设计技能工具,专为 Claude Code、Cursor 和 Codex 设计,旨在让 AI 生成的 UI 摆脱"AI slop"痕迹。项目从 20 套主题中匹配风格,并通过 57 项 slop 检测关卡加预发布自检后再输出结果,提供默认构建、audit 审查、redesign 重建和 study 提取设计 DNA 四种动词模式。v1.1 新增 Carnival、Lumen、Hum、Cobalt 四套主题以及 Custom 定制路由,仓库已获 3.9k stars

适用场景: AI 生成 UI 的设计品质治理与团队风格统一

来源:展开 1 条收起 1 条

QQ 邮箱推出 AI 智能体专用 Agent Mail

QQ 邮箱发布 Agent Mail AI 专用邮箱服务(内测),与个人 QQ 邮箱隔离,每人可抢注两个地址。提供命令行工具 npm install -g @tencent-qqmail/agently-cli,可让 OpenClaw、Hermes、Claude Code、Codex 等 AI 工具收发邮件,实现注册获取验证码、域名证书等通知的自动处理。免费配额为每日发送 50 封、容量 1GB,未来可能付费扩容。

适用场景: AI Agent 邮箱自动化与跨服务身份通道

来源:展开 1 条收起 1 条

awesome-llm-apps 收录 100+ AI Agent 与 RAG 模板

GitHub 仓库 Shubhamsaboo/awesome-llm-apps 收录 100+ 可直接运行的 AI Agent 与 RAG 应用模板,已获约 118k Star,采用 Apache-2.0 协议。每个模板均为原创且端到端测试,用户只需三行命令即可本地启动,覆盖 Agent Skills、Always-on Agents、多 Agent 团队、Voice AI Agents、生成式 UI、MCP Agents 等 15 个分类,兼容 Claude、Gemini、OpenAI、xAI、Qwen、Llama 等多家模型供应商。

适用场景: AI Agent / RAG 应用开发者的模板与起点仓库

来源:展开 1 条收起 1 条

数据与洞察

具身数据行业:97 家玩家、一年 44.7 亿融资

量子位发布具身数据行业全景报告,梳理 97 家国内具身数据玩家现状。过去一年 15 家独立具身数据服务商共融资约 44.7 亿元,仅为具身智能全行业半年融资(约 438 亿元)的零头。行业呈四大采集技术路线,跨路线采集占比 43%,独立数据服务商已成最大玩家群体(占 40%),67% 为具身原生公司。全行业年产能约 160 万至 180 万小时,光轮智能一家占据总融资额的七成、估值超 20 亿美元成为全球首个具身数据独角兽,但 69 家投资机构中无一家重仓,"纯卖数据"的商业模式仍待验证。

数据: 97 家玩家、15 家融资 44.7 亿、光轮智能独占七成、69 家机构无重仓

意义: 具身数据赛道玩家多但资金集中、商业模式尚未跑通

来源:展开 1 条收起 1 条

GraphPlanner:以图记忆工作流路由器提升多智能体协作

UIUC 研究人员提出 GraphPlanner,将多智能体 LLM 的路由从"选择模型"升级为"生成动态协作工作流"。核心创新在于引入异构图记忆网络 GARNet,同时决策调用哪个 LLM 以及让其扮演 Planner、Executor、Summarizer 等角色,并利用历史交互记忆辅助决策,通过 PPO 强化学习 训练。在 14 个任务、6 个领域的实验中,GraphPlanner 在自由生成工作流阶段相比最强基线带来约 9.3% 的平均准确率提升,out-of-domain 任务上达 78% 平均准确率。

数据: 自由工作流 +9.3%、OOD 任务 78% 平均准确率

意义: 为多智能体协作从"调度模型"走向"调度角色+工作流"提供新范式

来源:展开 1 条收起 1 条

85% 受访者认为代码审查已成新瓶颈

The New Stack 文章指出,85% 的受访者认为代码审查已成为新的瓶颈,而非业界常讨论的代码生成环节。当 Greptile、Cursor、Devin 等 AI 编码智能体能够自主编写代码时,真正决定产出质量的不再是写代码的速度,而是 代码审查与验证机制。云原生软件环境下,智能体开发的核心难题已转向运行时验证与合并门禁(merge gate)环节,团队需要重新审视工作流以适应代理式开发模式。

数据: 85% 受访者认为代码审查成新瓶颈

意义: AI 编码竞争从"生成速度"转向"审查与验证能力"比拼

来源:展开 1 条收起 1 条

具身数据:开源 AI 项目系统性收紧 AI 代码贡献

开源社区正系统性收紧 AI 代码贡献规则,要求每行代码背后都有具体人类承担责任:Zig 全面禁止 AI 生成内容及翻译、润色、审阅等辅助;Godot 要求诚实披露、人工校对后可接收;Gentoo、QEMU、Servo 因版权与安全隐患直接退回 AI 衍生内容;Linux 内核 坚守 DCO Signed-off-by 签名制度,将法律与质量责任落实到自然人。

数据: Zig/Godot/Gentoo/QEMU/Servo/Linux 主流项目均更新 AI 政策

意义: AI 代码责任链重塑开源治理规则

来源:展开 1 条收起 1 条

其他值得看

NVIDIA RTX Spark 笔记本首次公开展示

1Petaflop 算力,笔记本跑 120B 模型。

来源:展开 1 条收起 1 条

Even Realities 发布无摄像头智能眼镜 G2

隐私优先的智能硬件,HUD + AI 助手。

来源:展开 1 条收起 1 条

陶哲轩用 coding agents 做数学 app

菲尔兹奖得主分享 AI 编码辅助数学可视化。

来源:展开 1 条收起 1 条

ColeMurray/background-agents 进入 GitHub Trending

后台智能体编码系统近期持续更新。

来源:展开 1 条收起 1 条

pingdotgg/t3code:跨平台 AI 编码工具

AI 编码代理深度参与开发的 13.6k stars 仓库。

来源:展开 1 条收起 1 条

Mesh LLM:跨节点大模型推理

基于 iroh P2P 的分布式 LLM 推理方案引发讨论。

来源:展开 1 条收起 1 条

远景科技发布 Mission Gobi 计划

2030 年前在戈壁建成 5GW 绿色 AI 算力中心。

来源:展开 1 条收起 1 条

AI 创新对照实验:方法论可程序化执行

同一 Claude 在加载与不加载创新手册下产出差异显著。

来源:展开 1 条收起 1 条

AI agents 管理责任归属争议

人类 DRI、代理管代理与失控担忧多派交锋。

来源:展开 1 条收起 1 条

sqlite-utils 4.1 发布

Python 命令行 SQLite 工具新增 --code/--type 等参数。

来源:展开 1 条收起 1 条