内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-09-12 AI领域呈现多线并进格局,值得关注的信息:OpenAI在Navier-Stokes方程上声称找到失效特例并遭克雷数学研究所公开回应;英伟达洽谈最高100亿美元参投Anthropic近2万亿美元IPO;Automattic确认创始人Mullenweg在被强制休假后重返CEO;阿里与浙大联合发布Astar模型,在阿里Lazada广告推荐系统中实现GMV提升4.86%;GitHub推出多模型路由项目HydraFusion,TerminalBench 2.1评测成本降低67%。
热点事件
克雷回应OpenAI千禧年问题与抢先发布争议
数学家Tristan Buckmaster与合作者Levent Alpöge公开了多孔介质方程、Boussinesq方程及三维不可压缩Euler方程光滑强迫下有限时间爆破的成果。Buckmaster披露,他在9月3日致信OpenAI知名数学家后,对方次日由Sebastien Bubeck等人与他两次通话,告知其内部模型已生成强迫Navier-Stokes爆破的约100页证明;Buckmaster怀疑OpenAI是在获知其团队进展后才启动相关工作,并追问是否使用了他在Codex中的会话数据,未获明确答复。OpenAI还提出两种发布方案并两次要求将Levent移出署名,Buckmaster拒绝并决定公开经过。同日,OpenAI声称动用约1万个AI智能体进行88小时计算,于9月5日找到Navier-Stokes方程失效的反例。克雷数学研究所发表公开声明,将依据评奖流程核实成果,要求先在同行评审期刊发表并经过至少两年数学界普遍认可;由于完整证明尚未给出,正式确认该问题解决至少需等到2029年。
重点: 千禧年难题遇抢先发布与署名争议,影响AI数学研究信任。
来源:展开 2 条收起 2 条
- Tristan Buckmaster 关于被 OpenAI 在 Navier-Stokes 问题上抢先发布的声明(Andrej Karpathy Curated RSS)
- 克雷数学研究所就 Navier-Stokes 问题发表公开声明(奇客Solidot–传递最新科技情报)
英伟达洽谈百亿美元参投Anthropic IPO
据多家媒体报道,英伟达正洽谈在AI初创公司Anthropic的IPO中投资高达100亿美元,有望成为锚定投资者。Anthropic此次IPO拟筹资最多1000亿美元,估值或达约2万亿美元,被视为可能冲刺史上规模最大的上市交易之一。该投资若落实,将进一步加深英伟达与Anthropic在AI领域的战略合作,也是英伟达近期密集布局AI生态的延续:此前已宣布向联发科投资超35亿美元、洽谈投资Perplexity、拟向数据中心电力开发商Cloverleaf投资数亿美元等;公司CFO透露已向人工智能实验室累计投入超过500亿美元。同步消息显示,高盛、美银等华尔街银行正竞相争取为Anthropic员工提供IPO后财富管理服务。
重点: 百亿级锚定投资或重塑算力供应链与AI初创估值逻辑。
来源:展开 3 条收起 3 条
- 英伟达洽谈在 Anthropic IPO 中投资高达 100 亿美元(Readhub - 每日早报)
- 英伟达拟最高百亿美元参投Anthropic IPO(AI洞察日报 RSS Feed)
- 英伟达考虑向 Anthropic IPO 投资最多 100 亿美元,估值或达 2 万亿美元(极客公园)
Automattic确认Mullenweg重返CEO职位
Automattic确认,WordPress创始人Matt Mullenweg在董事会投票将其强制休假后已重返CEO职位。公司发言人通过邮件表示,Mullenweg现为Automattic董事长兼CEO,并获得董事会的全面支持。此前董事会以未知原因投票让Mullenweg带薪休假,由CFO Mark Davies出任临时CEO;Mullenweg拒绝离场,将其他管理员踢出公司Slack并告知员工他已重新掌控公司,还在Slack发布"我是海盗了"等言论,并提到这可能已是他第五次遭遇"政变"。董事会成员Toni Schneider据报已辞职,公司未回应关于董事会构成变化的问询。
重点: 创始人反击董事会强制休假,暴露公司治理与控制权冲突。
来源:展开 1 条收起 1 条
- Automattic确认Mullenweg在被董事会试图罢免后已重返CEO职位(TechCrunch)
变更与实践
阿里与浙大联合发布Astar模型并落地广告推荐
阿里与浙大联合推出专门用于指导AI系统进化的LLM——Astar,核心思路是从AI系统自身的历史版本记录(Git提交、loss曲线、业务指标)中提炼真实的演化经验。团队设计了"两两扩增"生成密集样本、两级过滤剔除噪音日志、三级标签分层约束搜索空间、训练奖励模型实现秒级离线打分等方案。Astar在0.6B和8B参数规模下,单次生成有效优化方向的成功率分别为54.35%和67.86%,显著超越GPT-5.5(30.71%)和人类资深专家(32.29%),将算法工程师产生新idea的效率提升10~100倍。落地阿里Lazada核心广告推荐系统后,Astar全自动主导20轮迭代,离线Hitrate@200提升23.6%,线上A/B测试带动GMV提升4.86%、广告收入提升1.82%。
来源:展开 1 条收起 1 条
DeepSeek灰度测试AI语音对话功能
DeepSeek正在App端小范围灰度测试AI语音对话功能,获得内测资格的用户可在App右上角看到喇叭入口,实现实时语音对话。设置页面同步新增「朗读音色」选项,提供贝壳、白浪、海星、暗潮四款不同风格的语音供选择。本次测试为小范围开放,被视为DeepSeek在交互形态上从纯文本向多模态语音扩展的一次重要尝试,为后续功能全面上线做准备。
来源:展开 2 条收起 2 条
- DeepSeek 灰度测试 AI 语音对话,内置四种风格音色(极客公园)
- DeepSeek 灰度测试 AI 语音对话,支持四种音色(Readhub - 每日早报)
Vercel v0推出一键集成并自动载入Agent Skill
Vercel旗下AI网页生成工具v0推出"一键集成"功能:在连接云服务商(如Resend、MongoDB Atlas、Clerk、Algolia)的同一动作中,平台除处理环境变量与凭据外,还会自动载入供应商发布的agent skill规则文件,将官方引导知识同步注入生成上下文,使模型直接按推荐规范产出代码。生态层面,Stripe推出stripe agent setup CLI,Resend上线resend-skills仓库,Anthropic于2025年12月将Agent Skills开放为标准,Agent Plugins 1.0于2026年8月统一plugin.json封装规范;截至9月7日已有56支团队在officialskills.sh发布660条官方技能。文章同时指出Snyk扫描显示技能存在安全缺陷,Zenity披露skills.sh渠道出现凭据窃取攻击,平台治理透明度仍待解答。
来源:展开 1 条收起 1 条
- v0 一键集成:连接服务时,供应商的推荐用法自动进入 AI(Deep News — Superlinear Academy)
GitHub Copilot发布多模型路由项目HydraFusion
GitHub推出Copilot研究预览项目HydraFusion,通过运行时多模型编排实现前沿级编码智能。HydraFusion将工作流执行视为优化挑战,根据任务复杂度动态组合多厂商模型,采用Single、Cascade、Critique三种执行模式;架构遵循完整成本核算、有限执行、隔离评审、故障保护和路由校验五大原则。在TerminalBench 2.1评测中,HydraFusion验证任务质量提升4.9个百分点,估计成本降低67%;在内部多轮基准CheckpointBench上,任务得分与Claude Opus 5基线基本持平,成本降低65%。该项目面向所有Copilot等级用户开放,可通过CLI的/experimental配置启用,并按底层模型标准token费率计费。
来源:展开 1 条收起 1 条
Cloudflare测试缓存转码以降低存储需求
Cloudflare正在测试一项名为Cache Transcoding的原型功能,利用Zstandard压缩算法对缓存中的可压缩文本(如HTML、JSON、CSS、JavaScript)在落盘前进行压缩,读取时再解压。该方案仅对大于等于4 KiB、未压缩、成功返回且大小已知的纯文本响应生效,会排除范围请求、预压缩或二进制内容及未知大小响应。Cloudflare估算此方式可使合格内容体积缩小约2.8倍,相当于为现有服务器额外增加PB级有效缓存容量,并减少数据中心间的传输量;该功能依托Zstandard与Cloudflare自研的Rust代理框架Pingora实现,编码开销仅在内容进入缓存时产生一次,后续每次复用都能持续获得存储与带宽收益。图片、视频和字体等已压缩媒体约占请求量21.4%却占63.3%字节量,因此不在处理范围内;可压缩文本占请求量67.3%、字节量22.3%,其中约71%以未压缩形式到达。
来源:展开 1 条收起 1 条
- Cloudflare 测试缓存转码以降低存储需求(InfoQ)
安全与风险
Flock员工因记者拍摄报警引发监控隐私争议
围绕Flock Safety安装工人被记者拍摄其公共摄像头施工过程时报警一事引发讨论。核心争议在于,一家从事无差别公共监控的公司,其现场工作人员反而以被拍摄为由报警,凸显公共空间"被拍"与"被尾随"之间界限的模糊。评论延伸至多个层面:责任归属上,分歧在于Y Combinator早期投资、地方政府采购决策与Flock扩张路径各自应承担多少责任;反制路径上,有人分享在county commissioners meeting公开施压的成功经验,并提及佛罗里达Pasco County正在拆除公共摄像头;价值判断上,支持者认为Flock协助破获重案、保护弱势群体,反对者则担忧系统易被滥用,从打击重罪滑向大规模无证追踪。
影响: 公共空间下的记者与普通公民成为被反向记录对象,监控边界模糊。
建议: 通过地方议会等渠道推动公共摄像头采购与使用边界审查。
来源:展开 1 条收起 1 条
- 😒 Flock 员工因记者拍摄公共摄像头安装报警,引爆监控隐私争议(News Hacker | 极客洞察)
系统提示泄露仓库再次上榜引发滥用担忧
systempromptsleaks仓库持续收录多家模型的系统提示文本,总星数已达64974,单日新增216。该仓库通过集中公开方式让开发者可以查看多家厂商模型的底层提示与行为约束,短期内有助于安全研究,但同时也降低了绕过模型安全护栏的门槛,使恶意调用者更容易针对特定提示词工程进行定制攻击。仓库热度的持续攀升反映出社区对透明度的高诉求,也意味着系统提示一旦泄露即被永久存档,难以通过后续更新撤回。
影响: 模型厂商与终端用户均受波及,攻击者可低成本利用泄露提示。
建议: 厂商需将敏感逻辑外移并加强提示混淆,用户应优先选用有审计的服务。
来源:展开 1 条收起 1 条
- 系统提示泄露仓库再次上榜(AI洞察日报 RSS Feed)
开源与工具
Pyromind开源PyroDash协同推理框架
Pyromind开源PyroDash,提出成本感知、token级的小-大模型协同推理范式:通过专属控制token τ_off让4B小模型在生成过程中自行判断何时交接,单向、至多一次地将任务连同已有轨迹交给冻结的大模型续写。在五项数学推理基准上,成本优先配置下估算总成本由纯大模型的49.36美元降至1.78美元,准确率仅下降约3个百分点;准确率优先配置下平均准确率达64.04%,反超纯大模型57.68%约6.36个百分点,同时成本低两成。训练采用EasyHard-24k数据集与三阶段管线(控制token嵌入学习、行为冷启动SFT、成本感知GRPO),将真实账单按prefill与decoding分开计价写入奖励函数,被作者称为collaborative scaling范式。
适用场景: 适合成本敏感、需在小模型上调用大模型能力的数学推理场景。
来源:展开 1 条收起 1 条
IFM发布K2 Horizon开放LLM舰队
IFM发布K2 Horizon,包含0.9B/3.7B/7B/32B密集模型与36B-A4B、375B-A23B稀疏MoE,在约20T tokens上预训练。36B稀疏模型采用MoVA(Mixture-of-Value Attention),并以Apache 2.0开源训练代码、中间检查点、数据/配方与最终权重,覆盖密集与稀疏架构,被视为接近真正开源的旗舰级开放模型舰队。
适用场景: 适合需要从密集小模型到稀疏大模型全谱系自托管与二次训练的研究团队。
来源:展开 1 条收起 1 条
- IFM发布K2 Horizon开放LLM舰队并开源训练全流程(AINews)
jiji262开源douyin-downloader抖音批量下载工具
jiji262开源的douyin-downloader是一款面向抖音的批量下载工具,支持单视频、图集、合集、音乐及作者主页批量下载,并提供去水印、最高画质选择、进度条、重试退避、SQLite去重、增量恢复、下载完整性校验与浏览器兜底等能力。最近一次提交内置msToken配置快照,解决GitHub不可达时生成随机token导致翻页403、主页只能抓取前几页的问题;8月29日更新针对门禁放映厅版权影视链接返回filterreason=lvideonotsupport的情况,在下载器工厂中登记UNSUPPORTEDURLTYPEDETAIL,CLI与sidecar在建下载器前明确提示"不支持"而非模糊报错。配套桌面应用Douzy基于同一后端扩展至抖音、TikTok与YouTube三平台,目前处于封闭测试阶段。仓库累计获得11.2k星标、1.7k次Fork,使用MIT协议发布。
适用场景: 适合需要批量下载抖音多类型内容并去重、去水印的内容创作者与研究者。
来源:展开 1 条收起 1 条
- jiji262/douyin-downloader:抖音批量下载工具,支持去水印与多类型内容抓取(Trending repositories on GitHub today · GitHub)
vphone-cli在Apple Silicon上虚拟化运行iOS 27
开源项目vphone-cli在Apple Silicon上实现了完整的iOS 27虚拟机方案,基于Apple自身的Virtualization.framework而非传统模拟技术,可自动完成固件下载、引导链补丁、DFU恢复及首次启动,运行后可获得root权限的SSH访问与VNC图形界面。该项目整合了Apple为Private Cloud Compute提供的Virtual Research Environment中"iPhone研究环境虚拟机"组件,延续了wh1te4ever的非模拟虚拟化思路。与Xcode模拟器相比,vphone-cli支持内核调试、相机、蓝牙、Metal、App Store安装等功能,更接近真实硬件行为,对安全研究和自动化测试意义重大;但Apple并未官方支持此类固件使用方式,未来PCC VRE是否继续提供相关组件尚不明朗。
适用场景: 适合需要接近真实硬件行为的iOS安全研究、内核调试与自动化测试。
来源:展开 1 条收起 1 条
数据与洞察
GPT-6 Astra在Vending-Bench 2经营测试中登顶
OpenAI的GPT-6 Astra在Andon Labs发布的Vending-Bench 2自动售货机模拟经营测试中首次登顶。该测试为模型一台自动售货机500美元启动资金,自主寻找供应商、谈判采购、补货调价,经营模拟一年后比账户余额。双方各跑6轮,Astra平均最终余额15515美元,约为Claude Fable 5.1(5422美元)的3倍,且Astra最差成绩也超过Fable最好成绩。差距源于采购谈判与长期执行:Astra一次谈判中面对226美元报价坚持108美元,最终砍价约52%,并维持可乐均价1.15美元;Fable则把前期高价当参照,至年末可乐均价涨至2.21美元。预付款环节Fable出现45次失败预付款损失约14331美元,Astra则保持零同类损失,重复付款前99%会先读取供应商回复。
数据: Astra平均最终余额15515美元,约为Fable 5.1的3倍,砍价幅度约52%。
意义: 提示AI Agent在长期自主谈判与稳健执行上仍有显著模型间差距。
来源:展开 1 条收起 1 条
agentic LLM的KV-cache实测发现LRU比预期更难击败
作者用393个真实Claude Code会话模拟后发现,LRU表现比论文预期更难击败:主要性能损失并非来自会话超过5分钟TTL被误判,而是短时间反复调用工具使工作集膨胀到约88k tokens,直接撞上cache容量上限;超5分钟间隔的请求仅占17.5%的重计算,10秒内短间隔请求反而占33.1%。评论区进一步指出Belady理论最优策略在特定测试harness下也会输给LRU,因为长链插入可能驱逐正在构建的前缀,而新插入block在LRU中获得最新时间戳反而更稳定。讨论还延伸到发布负结果的价值,以及文章AI文风与非母语英语写作之间的权衡。
数据: 短间隔10秒内请求占33.1%,超5分钟仅占17.5%;工作集约88k tokens。
意义: 提示agentic负载下传统LRU仍是稳健基线,复杂替换策略收益有限。
来源:展开 1 条收起 1 条
- 🤔 agentic LLM 的 KV-cache 实测:LRU 比论文预期更难击败(News Hacker | 极客洞察)
LogiMed-RoB评测暴露医学证据推理端到端短板
LogiMed-RoB覆盖860项RCT和14820个查询,顶级模型原子一致性达98.88%,但端到端风险偏倚推理跌至45.13%。这意味着模型在单独判断证据片段时几乎不犯错,但在整合多步证据得出最终偏倚结论时仍会出现严重失误,提示临床验证不能只看最终标签命中。
数据: 原子一致性98.88%,端到端风险偏倚推理仅45.13%,覆盖860项RCT。
意义: 表明医学AI需引入端到端证据链评估,而非仅依赖原子级指标。
来源:展开 1 条收起 1 条
- 医学证据逻辑评测暴露模型端到端短板(AI洞察日报 RSS Feed)
Mr.LHDR长程研究代理基准拉高评测难度
Mr.LHDR基于多模态证据和中间结论构建,每题平均需要12.1个必要结论且依赖深度达10.4,最强系统OA仅得43.1%。该基准强调证据整合与长链推理,当前最强系统在多模态证据融合与跨步结论组织上仍存在明显短板。
数据: 每题平均12.1个必要结论、依赖深度10.4,最强系统仅43.1%。
意义: 提示证据整合是当前大模型长程研究能力的主要瓶颈。
来源:展开 1 条收起 1 条
- 长程研究代理基准拉高难度(AI洞察日报 RSS Feed)
训练用电弹性指标PFI成形
新论文基于131次H200训练并补充H200与H100验证提出PFI指标,在30%限电下每个作业约追回1.5k tokens/s,为数据中心调度提供量化尺标。该指标将模型训练吞吐对功耗限制的敏感程度统一刻画,使不同硬件、不同任务的限电策略具备可比性。
数据: 131次H200训练,30%限电下每个作业约追回1.5k tokens/s。
意义: 为数据中心在限电场景下评估训练作业弹性提供统一量化标准。
来源:展开 1 条收起 1 条
- 训练用电弹性指标PFI成形(AI洞察日报 RSS Feed)
其他值得看
米羊科技发布关系型生产力Agent白艾莉
来源:展开 1 条收起 1 条
OpenAI公开Jalapeno推理芯片架构
来源:展开 1 条收起 1 条
- OpenAI公开Jalapeno推理芯片架构(AI洞察日报 RSS Feed)
亮源新创连续发布三项Physical AI技术
来源:展开 1 条收起 1 条
聚变能源初创公司在国防领域找到新合作伙伴
来源:展开 1 条收起 1 条
- 聚变能源初创公司在国防领域找到新合作伙伴(TechCrunch)
生数科技发布自进化世界模型Motus2
来源:展开 1 条收起 1 条
- 生数科技发布自进化世界模型Motus2(AI洞察日报 RSS Feed)
华尔街银行争夺Anthropic员工IPO财富管理业务
来源:展开 1 条收起 1 条
- 高盛、美银等争夺管理 Anthropic 员工 IPO 巨额财富(Readhub - 每日早报)