07-26日报 | FLUX.3 原生音视频、N0 触觉具身、Cloudflare AI 爬虫分级、微软 Fara1.5

来源:24 个引用生成:2026/07/27 06:11

内容

声明:完全使用AI生成,可能存在错误,需谨慎甄别。

摘要

2026-07-26 AI 领域呈现多模态生成与具身基建同步推进的格局,值得关注的信息:黑森林实验室发布 FLUX.3,可单次原生生成最长 20 秒音画同步内容;新智具身联合复旦发布 N0 系列触觉报告,开源超 3 万小时视触数据;Cloudflare 推出 AI 爬虫分级管控与按请求付费网关;微软发布纯视觉浏览器智能体 Fara1.5。开源侧 The Stack v3MonkeyOCRv2 与手机 Agent Open Minis 同步上新,FFmpeg PixelSmash 远程代码执行风险亦需警惕。

热点事件

黑森林实验室发布 FLUX.3:单次原生生成 20 秒音视频

黑森林实验室(Black Forest Labs)发布多模态基础模型 FLUX.3,基于 Self-Flow 统一架构联合学习图像、视频与音频,可单次原生生成最长 20 秒音画同步内容,支持文生视频、图生视频、关键帧转视频及多镜头串联。FLUX.3 Video 已开放 Early Access,图像版与开源版 Flux3Dev 将陆续推出。人工评测中,对 Grok Imagine Video 胜率 69%,对 Seedance 2.0 与 Gemini Omni Flash 均为 52%,对 Luma Ray3.2、Runway Gen-4.5 分别达 93%77%。实验室还联合 Mimic Robotics 推出机器人动作模型 Flux-mimic,已在奥迪工厂测试,把多模态能力延伸到实体产线。

重点: 音视频原生一体化与工业机器人联动

来源:展开 3 条收起 3 条

新智具身联合复旦发布 N0 系列:3 万小时触觉数据开源

2026 年 7 月 26 日,新智具身(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,将触觉从辅助模态升级为具身智能核心基建。N0-Foundation 构建超 3 万小时视觉-触觉交互数据集与 NeoForce 统一表征,解决跨设备融合;N0-VTLA 预测未来 50 步触觉演变,使插插头等任务成功率显著超越纯视觉方案;N0-TWAM 在世界模型中联合预测视频、触觉与动作,仿真平均成功率约 84.5%,真机约 46.3%。项目数据与模型均已开源。

重点: 当日发布并开源,补齐具身“手感”

来源:展开 2 条收起 2 条

Cloudflare 分级管控 AI 爬虫,配套按请求付费网关

Cloudflare 面向出版商推出 AI 流量控制框架,将爬虫按用途划分为搜索、AI 训练与 AI 智能体三类,默认拦截训练与智能体、仅放行搜索,控制将于 9 月 15 日生效,并发布 BotBase 公开数据库做爬虫身份验证。同步上线的付费网关允许出版商按请求向 AI 智能体收取网页、API 与模型上下文协议访问费用。数据显示自动化请求已占其 HTTP 流量的 57.5%Googlebot、Applebot 等兼具搜索与训练的多用途爬虫可能被连带封禁,社区也质疑 Cloudflare 既服务 AI 基建又限制爬虫的利益冲突。

重点: 内容侧对训练与 Agent 抓取显著收紧

来源:展开 2 条收起 2 条

微软发布 Fara1.5-27B:纯视觉浏览器操作智能体

微软研究院 AI 前沿团队发布 Fara1.5-27B,一款面向浏览器的纯视觉多模态计算机操作智能体,基于 Qwen3.5-27B 监督微调,训练数据来自 FaraGen1.5 合成任务,并配合 MagenticLite 框架运行。同步提供更小的 Fara1.5-4BFara1.5-9B 检查点。已知局限包括 缺乏 DOM 感知、仅支持英文、易受视觉提示注入。该路线强调“看屏幕操作”而非依赖页面结构,为浏览器自动化 Agent 提供了可复用的工程基线。

重点: 纯视觉浏览器 Agent 新开源检查点

来源:展开 1 条收起 1 条

变更与实践

阿里发布 Qwen-Audio-3.0-TTS:支持 16 语与最长 3 分钟生成

阿里巴巴 Qwen 团队推出 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本,支持 16 种语言,具备 `[whisper][angry]` 等内联控制标签、自然语言风格引导、嘈杂参考音频鲁棒性,以及最长 3 分钟一次性生成能力。团队称其在 Artificial Analysis TTS 排行榜位居前列,适合多语种语音产品与可控风格合成场景快速接入。

来源:展开 1 条收起 1 条

智能音箱接入大模型后:仍需重做注意力、身份与授权

分析文章指出,语音交互在大模型加持下仍需跨过三道关卡:注意力管理(高分心场景要压缩回复)、身份边界(共享空间厘清指令归属与隐私)、动作授权(付款等操作差异化确认并保留撤销)。文中以 OpenAI 语音硬件传闻、GPT-Live 与 CarPlay 语音优先模式为背景,强调 流畅对话并不足以构成真正的语音 Agent,关键在于场景化交接机制。

来源:展开 1 条收起 1 条

Netflix:约 300 个 title 嵌入 GenAI,强调工业判断优先

Netflix 在 2026 年 Q2 股东信披露约 300 个 title 使用 GenAI 工作流,主要集中在预演、场景参考、镜头规划与 VFX 等后期卡点,而非端到端一键成片。Partner Help 要求进入成片与涉及演员肖像的素材须书面审批。文章认为 决定 AI 真正用处的是影视工业多年积累的制作判断,全虚拟角色路线未必更省总成本。

来源:展开 1 条收起 1 条

安全与风险

FFmpeg PixelSmash:特制视频可触发远程代码执行

JFrog 安全研究团队披露 FFmpeg 关键漏洞 PixelSmash(CVE-2026-8461,CVSS 8.8),位于 MagicYUV 解码器,已潜伏约 16 年。攻击者仅需投递特制小型媒体文件(AVI/MKV/MOV)即可触发远程代码执行或拒绝服务,影响桌面播放器、缩略图生成、云转码、Jellyfin、Emby、Nextcloud 及部分 NAS。团队已在 Jellyfin 与 Nextcloud 上演示完整 RCE;发现过程得益于 AI 赋能安全模型,官方已发布修复补丁。

影响: 播放器、媒体服务器与云转码链路

建议: 尽快升级 FFmpeg 或禁用 MagicYUV

来源:展开 1 条收起 1 条

开源与工具

The Stack v3 发布:约 5 万亿 token 开放代码语料

Hugging Face 研究人员发布 The Stack v3,号称迄今最大开放代码数据集:约 114TB 原始数据、2.24 亿仓库、440 亿文件、770 种编程语言、约 5 万亿 token。相较 v2,过滤后语料从约 5500 亿跃升至 5 万亿,C++、TypeScript、Rust、Python 等规模显著增长;排除限制性许可,并提供可直接训练版本。

适用场景: 代码大模型预训练与开源复现

来源:展开 1 条收起 1 条

MonkeyOCRv2:以重建保留文档证据,开源 1.13 亿图数据

MonkeyOCRv2 提出“重建即文档视觉记忆”,用像素级重建约束编码器保留笔画、字形与版面。受控实验中替换视觉编码器带来 13.2 分差距;字符打乱测试低分辨率识别由 55.4% 升至 72.1%。0.7B 参数的 Parsing 版在 17 语种 MDPBench 以 83.3 分位列开源第一,并开源含 1.13 亿张文档图像的 MonkeyDoc v2。

适用场景: 多语种文档解析与 OCR 基座训练

来源:展开 1 条收起 1 条

Open Minis 开源:跨 iOS/Android 的手机端 AI Agent

开发者 Ethan 宣布将 Open Minis 完整 iOS 与 Android 代码开源。应用支持原生 Linux shell、浏览器自动化、可扩展技能、持久内存与深度系统集成,可操作日历、通讯录、定位、照片等权限;iOS 额外支持 HealthKit/HomeKit/NFC,安卓支持无障碍与 Shizuku。使用需自备 AI API,无内置模型,适合本地优先的个人工作流二次开发。

适用场景: 手机端个人 Agent 二次开发与集成

来源:展开 1 条收起 1 条

数据与洞察

地方 AI 生态重塑助手竞赛:份额集中但事务能力分化

基于 Sensor Tower《2026 年 AI 状态报告》的分析指出,全球 AI 助手仍高度集中——ChatGPT 约 46%、Gemini 约 28%、Claude 约 10%——但榜单难衡量“把回答变成预订、购买、支付”的能力。韩国 Naver AI Tab 两个月累计用户破 400 万后于 7 月 15 日达 1000 万;中国通义在春节补贴下日活从 700 万跃至 5800 万。文章提出“模型—助手—生态”框架,强调本地语言、地图、支付与商户关系正在把助手升级为事务型界面。

数据: ChatGPT 46%/Gemini 28%;通义日活至 5800 万

意义: 本地生态把助手从问答推向可执行操作

来源:展开 1 条收起 1 条

其他值得看

图书管理员推广“远离 AI”工作坊

教用户关闭强制植入的系统 AI 功能。

来源:展开 1 条收起 1 条

奥地利部署基于 Mistral 的 GovGPT

开源权重政府 AI 平台,服务约 18 万雇员。

来源:展开 1 条收起 1 条

DeepSeek 梁文锋:开源优先的 AGI 路径

投资者会议强调优化 AGI 成功概率。

来源:展开 1 条收起 1 条

AI 构建者应了解的 11 种协议

MCP、A2A 等到传统标准的系统速查。

来源:展开 1 条收起 1 条

北航等提出 InfraNet 红外主导检测

夜间与复杂场景 RGB-IR 检测新框架。

来源:展开 1 条收起 1 条

Verizon 与 Google 签超 10 亿美元暗光纤

为 AI 数据中心网络连接加码基建。

来源:展开 1 条收起 1 条

三星与博通签 2000 亿美元五年备忘录

覆盖 2nm 制程与 HBM4 高带宽内存。

来源:展开 1 条收起 1 条

社区为 Scratch 接入 AI 编程助手

语音文字引导少儿完成动画与小游戏。

来源:展开 1 条收起 1 条