内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-07-26 AI 领域呈现多模态生成与具身基建同步推进的格局,值得关注的信息:黑森林实验室发布 FLUX.3,可单次原生生成最长 20 秒音画同步内容;新智具身联合复旦发布 N0 系列触觉报告,开源超 3 万小时视触数据;Cloudflare 推出 AI 爬虫分级管控与按请求付费网关;微软发布纯视觉浏览器智能体 Fara1.5。开源侧 The Stack v3、MonkeyOCRv2 与手机 Agent Open Minis 同步上新,FFmpeg PixelSmash 远程代码执行风险亦需警惕。
热点事件
黑森林实验室发布 FLUX.3:单次原生生成 20 秒音视频
黑森林实验室(Black Forest Labs)发布多模态基础模型 FLUX.3,基于 Self-Flow 统一架构联合学习图像、视频与音频,可单次原生生成最长 20 秒音画同步内容,支持文生视频、图生视频、关键帧转视频及多镜头串联。FLUX.3 Video 已开放 Early Access,图像版与开源版 Flux3Dev 将陆续推出。人工评测中,对 Grok Imagine Video 胜率 69%,对 Seedance 2.0 与 Gemini Omni Flash 均为 52%,对 Luma Ray3.2、Runway Gen-4.5 分别达 93% 与 77%。实验室还联合 Mimic Robotics 推出机器人动作模型 Flux-mimic,已在奥迪工厂测试,把多模态能力延伸到实体产线。
重点: 音视频原生一体化与工业机器人联动
来源:展开 3 条收起 3 条
新智具身联合复旦发布 N0 系列:3 万小时触觉数据开源
2026 年 7 月 26 日,新智具身(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,将触觉从辅助模态升级为具身智能核心基建。N0-Foundation 构建超 3 万小时视觉-触觉交互数据集与 NeoForce 统一表征,解决跨设备融合;N0-VTLA 预测未来 50 步触觉演变,使插插头等任务成功率显著超越纯视觉方案;N0-TWAM 在世界模型中联合预测视频、触觉与动作,仿真平均成功率约 84.5%,真机约 46.3%。项目数据与模型均已开源。
重点: 当日发布并开源,补齐具身“手感”
来源:展开 2 条收起 2 条
Cloudflare 分级管控 AI 爬虫,配套按请求付费网关
Cloudflare 面向出版商推出 AI 流量控制框架,将爬虫按用途划分为搜索、AI 训练与 AI 智能体三类,默认拦截训练与智能体、仅放行搜索,控制将于 9 月 15 日生效,并发布 BotBase 公开数据库做爬虫身份验证。同步上线的付费网关允许出版商按请求向 AI 智能体收取网页、API 与模型上下文协议访问费用。数据显示自动化请求已占其 HTTP 流量的 57.5%。Googlebot、Applebot 等兼具搜索与训练的多用途爬虫可能被连带封禁,社区也质疑 Cloudflare 既服务 AI 基建又限制爬虫的利益冲突。
重点: 内容侧对训练与 Agent 抓取显著收紧
来源:展开 2 条收起 2 条
- Cloudflare分级管控AI爬虫,并推出按请求付费网关(The Batch | DeepLearning.AI | AI News & Insights)
- 😒 Cloudflare AI 爬虫新规:Googlebot 或被封,用户催 pay-per-crawl(News Hacker | 极客洞察)
微软发布 Fara1.5-27B:纯视觉浏览器操作智能体
微软研究院 AI 前沿团队发布 Fara1.5-27B,一款面向浏览器的纯视觉多模态计算机操作智能体,基于 Qwen3.5-27B 监督微调,训练数据来自 FaraGen1.5 合成任务,并配合 MagenticLite 框架运行。同步提供更小的 Fara1.5-4B 与 Fara1.5-9B 检查点。已知局限包括 缺乏 DOM 感知、仅支持英文、易受视觉提示注入。该路线强调“看屏幕操作”而非依赖页面结构,为浏览器自动化 Agent 提供了可复用的工程基线。
重点: 纯视觉浏览器 Agent 新开源检查点
来源:展开 1 条收起 1 条
- 微软发布Fara1.5-27B纯视觉浏览器操作智能体(AI 开发者日报)
变更与实践
阿里发布 Qwen-Audio-3.0-TTS:支持 16 语与最长 3 分钟生成
阿里巴巴 Qwen 团队推出 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本,支持 16 种语言,具备 `[whisper]、[angry]` 等内联控制标签、自然语言风格引导、嘈杂参考音频鲁棒性,以及最长 3 分钟一次性生成能力。团队称其在 Artificial Analysis TTS 排行榜位居前列,适合多语种语音产品与可控风格合成场景快速接入。
来源:展开 1 条收起 1 条
- 阿里发布Qwen-Audio-3.0-TTS支持16种语言(AI 开发者日报)
智能音箱接入大模型后:仍需重做注意力、身份与授权
分析文章指出,语音交互在大模型加持下仍需跨过三道关卡:注意力管理(高分心场景要压缩回复)、身份边界(共享空间厘清指令归属与隐私)、动作授权(付款等操作差异化确认并保留撤销)。文中以 OpenAI 语音硬件传闻、GPT-Live 与 CarPlay 语音优先模式为背景,强调 流畅对话并不足以构成真正的语音 Agent,关键在于场景化交接机制。
来源:展开 1 条收起 1 条
- 给智能音箱加上大模型以后,为什么还得重做交互?(Deep News — Superlinear Academy)
Netflix:约 300 个 title 嵌入 GenAI,强调工业判断优先
Netflix 在 2026 年 Q2 股东信披露约 300 个 title 使用 GenAI 工作流,主要集中在预演、场景参考、镜头规划与 VFX 等后期卡点,而非端到端一键成片。Partner Help 要求进入成片与涉及演员肖像的素材须书面审批。文章认为 决定 AI 真正用处的是影视工业多年积累的制作判断,全虚拟角色路线未必更省总成本。
来源:展开 1 条收起 1 条
- Netflix 的 300 个 AI title,补上了 AI 短剧最缺的一课(Deep News — Superlinear Academy)
安全与风险
FFmpeg PixelSmash:特制视频可触发远程代码执行
JFrog 安全研究团队披露 FFmpeg 关键漏洞 PixelSmash(CVE-2026-8461,CVSS 8.8),位于 MagicYUV 解码器,已潜伏约 16 年。攻击者仅需投递特制小型媒体文件(AVI/MKV/MOV)即可触发远程代码执行或拒绝服务,影响桌面播放器、缩略图生成、云转码、Jellyfin、Emby、Nextcloud 及部分 NAS。团队已在 Jellyfin 与 Nextcloud 上演示完整 RCE;发现过程得益于 AI 赋能安全模型,官方已发布修复补丁。
影响: 播放器、媒体服务器与云转码链路
建议: 尽快升级 FFmpeg 或禁用 MagicYUV
来源:展开 1 条收起 1 条
开源与工具
The Stack v3 发布:约 5 万亿 token 开放代码语料
Hugging Face 研究人员发布 The Stack v3,号称迄今最大开放代码数据集:约 114TB 原始数据、2.24 亿仓库、440 亿文件、770 种编程语言、约 5 万亿 token。相较 v2,过滤后语料从约 5500 亿跃升至 5 万亿,C++、TypeScript、Rust、Python 等规模显著增长;排除限制性许可,并提供可直接训练版本。
适用场景: 代码大模型预训练与开源复现
来源:展开 1 条收起 1 条
- The Stack v3发布:史上最大开放代码数据集(AI 开发者日报)
MonkeyOCRv2:以重建保留文档证据,开源 1.13 亿图数据
MonkeyOCRv2 提出“重建即文档视觉记忆”,用像素级重建约束编码器保留笔画、字形与版面。受控实验中替换视觉编码器带来 13.2 分差距;字符打乱测试低分辨率识别由 55.4% 升至 72.1%。0.7B 参数的 Parsing 版在 17 语种 MDPBench 以 83.3 分位列开源第一,并开源含 1.13 亿张文档图像的 MonkeyDoc v2。
适用场景: 多语种文档解析与 OCR 基座训练
来源:展开 1 条收起 1 条
Open Minis 开源:跨 iOS/Android 的手机端 AI Agent
开发者 Ethan 宣布将 Open Minis 完整 iOS 与 Android 代码开源。应用支持原生 Linux shell、浏览器自动化、可扩展技能、持久内存与深度系统集成,可操作日历、通讯录、定位、照片等权限;iOS 额外支持 HealthKit/HomeKit/NFC,安卓支持无障碍与 Shizuku。使用需自备 AI API,无内置模型,适合本地优先的个人工作流二次开发。
适用场景: 手机端个人 Agent 二次开发与集成
来源:展开 1 条收起 1 条
数据与洞察
地方 AI 生态重塑助手竞赛:份额集中但事务能力分化
基于 Sensor Tower《2026 年 AI 状态报告》的分析指出,全球 AI 助手仍高度集中——ChatGPT 约 46%、Gemini 约 28%、Claude 约 10%——但榜单难衡量“把回答变成预订、购买、支付”的能力。韩国 Naver AI Tab 两个月累计用户破 400 万后于 7 月 15 日达 1000 万;中国通义在春节补贴下日活从 700 万跃至 5800 万。文章提出“模型—助手—生态”框架,强调本地语言、地图、支付与商户关系正在把助手升级为事务型界面。
数据: ChatGPT 46%/Gemini 28%;通义日活至 5800 万
意义: 本地生态把助手从问答推向可执行操作
来源:展开 1 条收起 1 条
- 地方AI生态如何重塑全球AI助手竞赛(Turing Post)
其他值得看
图书管理员推广“远离 AI”工作坊
教用户关闭强制植入的系统 AI 功能。
来源:展开 1 条收起 1 条
- 图书管理员为厌倦大科技公司的人们举办爆火的"远离AI"工作坊(TechCrunch)
奥地利部署基于 Mistral 的 GovGPT
开源权重政府 AI 平台,服务约 18 万雇员。
来源:展开 1 条收起 1 条
- 奥地利部署Mistral开源政府AI平台GovGPT(AI 开发者日报)
DeepSeek 梁文锋:开源优先的 AGI 路径
投资者会议强调优化 AGI 成功概率。
来源:展开 1 条收起 1 条
- DeepSeek创始人4小时投资者会议:开源优先AGI战略(AI 开发者日报)
AI 构建者应了解的 11 种协议
MCP、A2A 等到传统标准的系统速查。
来源:展开 1 条收起 1 条
- 每个AI构建者都应该了解的AI协议(Turing Post)
北航等提出 InfraNet 红外主导检测
夜间与复杂场景 RGB-IR 检测新框架。
来源:展开 1 条收起 1 条
Verizon 与 Google 签超 10 亿美元暗光纤
为 AI 数据中心网络连接加码基建。
来源:展开 1 条收起 1 条
三星与博通签 2000 亿美元五年备忘录
覆盖 2nm 制程与 HBM4 高带宽内存。
来源:展开 1 条收起 1 条
社区为 Scratch 接入 AI 编程助手
语音文字引导少儿完成动画与小游戏。
来源:展开 1 条收起 1 条
- 社区爱好者给 Scratch 引入了 AI 编程助手(奇客Solidot–传递最新科技情报)