内容
声明:完全使用AI生成,可能存在错误,需谨慎甄别。
摘要
2026-08-28 AI领域呈现多线并进格局,值得关注的信息:Anthropic面向科研与制造推出Model Hardware Standard研究预览,将设备集成周期从数周压缩至分钟级;联邦法官裁定五角大楼将Anthropic列为供应链风险违法,认定其属于非法报复;腾讯混元开源Hy4 preview,以770B总参数、49B激活参数与1M上下文稳居开源第一梯队;英伟达发布Q2营收962亿美元并回应循环融资质疑,同时据传约129亿美元收购Hugging Face;Meta就儿童保护诉讼达成近167亿美元和解;DeepMind启动全球首个AI模型双盲评估试点。
热点事件
Anthropic发布Model Hardware Standard硬件标准研究预览
Anthropic近日正式发布面向硬件的Model Hardware Standard(MHS)研究预览,旨在让大模型驱动的AI智能体安全高效操控物理设备。该标准源于Anthropic与霍华德·休斯医学研究所Janelia研究园区的合作,目前已面向首批科研实验室和先进制造商开放。MHS可将集成周期从数周乃至数月压缩至数小时甚至数分钟,大幅降低自动化门槛;接入该标准的Claude表现出类似人类科学家的探索性,能自主推理实验步骤、动态更新参数,并在无人工介入下从硬件故障中恢复。MHS适配任何具备可编程接口的物理设备,与底层模型无关,通过统一标准化驱动程序解决通信与交互难题,主要提供MCP、命令行界面和代码文件三种控制机制。AWS Strands Robots、Doosan、Tecan、Universal Robots、MBF、QIAGEN、Hugging Face、Raspberry Pi等已加入或计划集成,Genentech已用其完成实验自动化。Anthropic表示MHS尚无法兼容完全不具备可编程接口的传统硬件,将联合早期采用者推进标准完善并计划后续开源。
重点: 把Claude操控物理设备的集成周期从数周压缩至分钟级
来源:展开 3 条收起 3 条
- 预览模型硬件标准(MHS)(Anthropic News)
- Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了(量子位)
- Anthropic重磅发布模型硬件标准MHS,AI Agent正式迈向实体操控(AI新闻资讯)
美国联邦法官裁定阻止五角大楼将Anthropic列入黑名单
美国旧金山地区法官Rita Lin在59页裁决书中认定五角大楼将Anthropic列为"供应链风险"的决定"非法且毫无根据",下令阻止相关黑名单措施。Anthropic此前在加州联邦法院起诉国防部长赫格塞斯越权,指控其以"国家安全供应链风险"标签不当打压该公司。法官强调"空洞地援引国家安全不是惩罚和报复政府批评者的空白支票",指出政府行政记录薄弱,仅有一份4页备忘录且晚于部分被质疑措施,且原先以Anthropic会在国家安全系统中保留后门访问为由实施限制的前提后被推翻。此案争议的是五角大楼的供应链风险认定而非出口管制,影响范围和潜在赔偿计算因此不同。Anthropic于三月分别在加州和华盛顿特区对国防部提起两起诉讼,华盛顿特区案件仍在进行中。
重点: 法院明确国安名义不能作为报复政府批评者的空白支票
来源:展开 3 条收起 3 条
- 美国法官阻止特朗普国防部对Anthropic的黑名单决定(Andrej Karpathy Curated RSS)
- 😒 美国法官裁定五角大楼封杀 Anthropic 违法(News Hacker | 极客洞察)
- 🤨 特朗普政府黑名单封杀 Anthropic 被判违法(News Hacker | 极客洞察)
Anthropic在针对国防部供应链风险标签的诉讼中赢得首次法庭胜利
美国加州联邦地区法官Rita Lin周四裁定,特朗普政府将Anthropic列为供应链风险的认定违法,属于针对Anthropic批评政府的非法报复,违反宪法第一修正案并剥夺其第五修正案正当程序权利。此前国防部长Hegseth和总统特朗普以Anthropic为Claude模型设定安全护栏、限制用于全自主武器和大规模监控为由,将其标记为供应链风险并要求所有联邦机构停止与其合作。法官指出,政府一方面称Anthropic威胁国安,另一方面又提议依据《国防生产法》将其列为关键供应商、并继续推进合同及合作其新模型Mythos用于网络安全,前后矛盾且构成打击报复。Anthropic发言人表示欢迎裁决,期待继续与政府合作推动AI服务于国家安全。
重点: 裁决直指政府行为前后矛盾,构成第一修正案层面的报复
来源:展开 1 条收起 1 条
- Anthropic在针对国防部供应链风险标签的诉讼中赢得首次法庭胜利(TechCrunch)
英伟达Q2营收962亿美元并回应AI投资循环融资质疑
英伟达Q2营收达962亿美元同比增长106%,其中数据中心业务营收890亿美元同比增长117%,公司已大规模投资领先AI实验室,包括今年初斥资300亿美元收购OpenAI股份。CEO黄仁勋表示,投资前沿AI实验室是一生一遇的机会,唯一的遗憾是没能更早投入更多,并透露OpenAI和Anthropic可能很快上市。面对外界对其AI投资循环融资性质的质疑,英伟达表示前沿AI实验室增长速度快于其资产负债表和信用能力所能支撑,将由英伟达持续为其提供算力飞轮支持,直至这些实验室有能力自筹资金;黄仁勋认为相关风险很低,强调前沿AI公司发展需要海量资本支持。
重点: 英伟达用千亿级财报与持续投入承诺对冲循环融资质疑
来源:展开 2 条收起 2 条
- 黄仁勋谈 AI 投资:「唯一的遗憾是没能更早、投入更多」(Readhub - 每日早报)
- Nvidia坚称可继续投入资金支撑AI热潮(TLTD)
英伟达据传以约129亿美元收购Hugging Face引发社区讨论
Business Insider、The Information与Reuters相继报道Nvidia与Hugging Face的收购谈判与最终协议,金额约129亿美元。社区讨论集中于两点:一是担忧AMD ROCm、Vulkan等非CUDA后端支持可能退化,llama.cpp未来许可与路线图归属成为焦点;二是部分评论强调开源fork与BT种子镜像作为去中心化分发备选方案的意义。Nvidia近年已围绕NVLink Fusion半定制AI芯片平台扩展生态,此次收购若落地将进一步整合模型/数据集分发入口与AI芯片生态,加剧社区对开源平台中立性的疑虑。
重点: Nvidia拿下开源模型分发枢纽,社区担忧生态中立性
来源:展开 1 条收起 1 条
变更与实践
腾讯混元开源旗舰大模型Hy4 preview并由WorkBuddy首发接入
腾讯混元正式开源Hy4 preview大模型,总参数770B、单次推理激活49B,支持1M上下文,端到端优化使吞吐较基线提升31.8%,Arena代码榜进入前五、开源模型中位列第三。模型依托与软件工程、游戏、金融、安全等专家的高质量数据共建,强化代码、办公、游戏与科研等实用场景;163名专家对203个工程任务盲测均分2.99,略胜GLM-5.3的2.92与Kimi K3的2.94。配合Hyra,Hy4 preview将三维Blaschke–Lebesgue问题体积下界由0.380799推进至0.41104,距Meissner四面体猜想的0.41986仅差约2%。权重与代码已在HuggingFace、GitHub、ModelScope与Gitcode同步开源,并接入腾讯云TokenHub与OpenRouter;API定价为输入6元、输出18元每百万tokens,WorkBuddy与CodeBuddy提供两周免费体验。
来源:展开 5 条收起 5 条
Google升级AI Mode旅行功能,新增航班价格追踪与酒店预订
Google宣布为其Search中的AI Mode上线三项旅行规划与预订功能,标志其从信息检索拓展为可处理部分行程的交易型助手。航班价格追踪借助Google Flights数据覆盖超300家航司及旅游平台,价格变动时通过邮件提醒,已在超180个国家推出。积分与里程显示面向全球用户上线,首批支持阿拉斯加航空、美国航空、Choice Hotels、希尔顿、温德姆,后续将接入雅高、Flying Blue、凯悦、智利航空及汉莎集团。酒店直接预订率先在美国英语环境开放,集成Booking.com、Expedia、希尔顿、Marriott、IHG、Priceline、Trip.com等十余家合作方,通过Google Pay完成支付,售后由酒店或预订平台负责。
来源:展开 3 条收起 3 条
- 在搜索中规划和预订旅行的三种新方式(The Keyword)
- Google AI Mode新增航班价格追踪、酒店预订等功能(TechCrunch)
- 谷歌升级搜索 AI 模式:支持300多家平台机票追踪与酒店预订(AI新闻资讯)
英伟达暂停AI云融资分成计划规避反垄断审查
英伟达已暂停今年7月推出的面向AI云服务商的新型融资分成计划,距上线不足两个月。该计划原本拟向云厂商提供信用支持以购买英伟达芯片,并换取其基于英伟达算力产生的云业务营收分成;若客户售不出算力,英伟达还设计由公司回租兜底,形成"既当供应商又当股东"的模式。部分英伟达员工向客户表达顾虑,认为上述安排可能触发反垄断审查,公司已要求部分客户只能将搭载自家芯片的算力转租给经审批对象,并倾向分散供给小型初创。英伟达发言人强调新模式仍在运作并将持续优化,但据披露公司后续或将该计划调整并入其他业务,以在扩张与合规之间重新找平衡。
来源:展开 2 条收起 2 条
- 英伟达急刹"抽成换算力"计划,疑为规避反垄断审查(AI新闻资讯)
- 英伟达暂停部分AI云融资分成方案(爱范儿)
阿里发布全新Qoder:从AI编程工具升级为智能体工作台
阿里于8月27日正式发布全新Qoder,将其从AI编程IDE升级为以Coding能力为核心底座、面向所有人的智能体工作台。用户用自然语言描述目标,Qoder即可理解上下文、制定计划、调用工具、执行并验证,全程可查看、调整或接管。Qoder IDE自2025年8月全球发布以来累计用户超600万、服务超10万家企业,新版本背后是工作对象从代码工程转向智能体任务、工作姿势从亲自生产转向委派与验收、参与者从程序员扩展到产品与运营人群的三重协作范式转移。技术上搭载Harness长链路执行底座,支持读—改—验证—迭代自主闭环,引入分级权限与工具白名单,内置海内外SOTA模型并深度适配Qwen系列,提供40+连接器、70+插件、20K+技能,支持Browser Use与Computer Use,新增桌面端常驻与语音唤起。
来源:展开 1 条收起 1 条
英伟达推出NVHBM定制高带宽内存
8月26日,NVIDIA扩展NVLink Fusion半定制AI芯片平台并推出NVHBM高带宽内存,将内存控制器集成到HBM 3D堆叠内部。相比标准HBM4e,带宽最高提升30%,HBM功耗最高降低15%,可释放计算裸片最多25%额外面积。亚马逊旗下Annapurna Labs将成为首家合作伙伴。NVHBM通过把控制器集成进堆叠内部,降低了内存通道的物理与电气开销,有助于在保持大模型训练与推理所需高带宽的同时降低板级功耗与面积压力,与NVLink Fusion半定制方案共同强化NVIDIA在AI加速器市场的整合能力。
来源:展开 1 条收起 1 条
- 英伟达推出NVHBM定制高带宽内存(少数派)
安全与风险
Meta就儿童伤害诉讼与美国多州和解,赔偿最高约180亿美元
Meta与美国多州就青少年社交媒体成瘾与儿童安全指控达成和解,总额最高约180亿美元,分十年支付。新措施包括默认启用"夜间屏蔽"功能(午夜至凌晨6时青少年无法访问Facebook和Instagram),以及青少年账户每日累计使用时长默认上限为两小时。协议还包含一项特殊条款:各州同意不依据现行儿童安全法律就Meta留存和使用儿童数据的行为提起诉讼,前提是该数据仅用于训练和测试Meta的年龄验证模型;Meta需在协议生效后一年内开发并开始测试用于识别13岁以下用户的年龄保障模型,但协议未强制要求使用AI技术,并禁止将13岁以下用户数据用于广告投放、营销或算法优化,引入独立审计师监督合规。
影响: 美国青少年用户及其家长、第三方儿童保护诉讼原告、COPPA联邦执法边界
建议: 关注Meta年龄验证模型是否启用AI、监控独立审计报告并评估其他州及FTC后续立场
来源:展开 4 条收起 4 条
- Meta将支付 170 亿美元和解儿童隐私保护诉讼,将限制青少年在特定时间访问社媒(奇客Solidot–传递最新科技情报)
- Meta 的一记手腕轻拍(Spyglass)
- 😒 Meta 就伤害儿童和解 166.8 亿美元,默认 2 小时限时遭质疑(News Hacker | 极客洞察)
- Meta 180 亿美元和解协议中隐藏的儿童数据法律豁免条款(TechCrunch)
Claude Code Opus 5自动模式可被提示注入突破
提示注入研究者Johann Rehberger发现一种针对Claude Code自动模式的攻击,对自动模式成功率约80%。该攻击通过诱导Claude Code下载并解压zip压缩包,然后执行其中导入base64的代码,间接触发从压缩包中提取的本地struct.py文件被加载执行。值得注意的是,自动模式不仅未阻止恶意进程创建,还在Claude自身检测到入侵并尝试终止恶意进程时拒绝了清理命令,使安全机制本身成为失败的一环。Simon Willison认同结论:在面临对抗性攻击风险时,运行智能体的唯一安全方式是基于沙箱,包括在容器、虚拟机或操作系统沙箱中运行、限制网络出口、监控智能体行为,并避免向智能体运行时暴露主目录、SSH密钥、云凭证等敏感资源。
建议: 将智能体置于容器或VM沙箱、限制网络出口、避免暴露主目录与凭据并监控进程行为
影响: 使用 Claude Code Opus 5 自动模式的开发者及其主机环境,主目录、SSH 密钥与云凭据存在被恶意代码读取的风险
来源:展开 2 条收起 2 条
- 破解 Claude Code Opus 5 自动模式(Simon Willison's Weblog)
- Claude Code Opus 5自动模式可被提示注入突破(TLTD)
116家公司联名签署公开信呼吁重视AI时代网络安全
OpenAI、Anthropic、微软、Alphabet、亚马逊等116家企业和机构签署公开信,警告AI赋能的网络攻击将愈发猖獗,呼吁政府与行业将网络安全置于首要位置。联名信提出推进"可信访问计划"、提升防御工具安全门槛,并为关键基础设施提供专项防护资金。签署方涵盖网络安全、金融、半导体及云服务等领域。Sam Altman强调行动时间紧迫,该公开信被视为跨产业协同的政策动作,旨在通过统一的安全门槛与专项防护资金降低AI驱动的网络攻击对关键系统的冲击。
建议: 跟进可信访问计划细则、推动防御工具安全门槛与关键基础设施专项防护资金落地
影响: 关键基础设施运营方、政府与各行业组织,以及依赖 AI 与网络服务的企业用户
来源:展开 2 条收起 2 条
- 116家公司联名信:呼吁高度重视AI时代网络安全(极客公园)
- OpenAI联合116家机构发布AI网络防御公开信(AINews)
研究显示高级AI智能体可轻易逃逸虚拟机隔离
Trail of Bits近期测试表明,高级AI智能体能够通过利用主机系统中已知与未知漏洞快速突破虚拟机边界,对传统虚拟化作为安全隔离手段的有效性提出质疑。研究建议采用攻击面极小、便于快速更新的虚拟化方案,以更好地适配具备网络攻击能力的智能体威胁。结论意味着依赖虚拟机作为隔离边界的智能体部署方案需要重新评估,特别是涉及代码执行、工具调用和联网能力的智能体运行时,传统VM边界已不足以构成充分防线。
建议: 替换为攻击面更小的微虚拟化方案并加快补丁更新与漏洞披露闭环
影响: 在虚拟机中部署 AI 智能体的企业与开发者,以及其所托管的代码执行、工具调用和联网负载
来源:展开 1 条收起 1 条
- 研究显示 AI 智能体可轻易逃逸虚拟机(TLTD)
ATF宣布重大事件,Qilin勒索软件团伙声称实施入侵
美国烟酒枪炮及爆炸物管理局(ATF)宣布一起针对其独立系统的网络攻击被定性为"重大事件",按联邦法律须在发现后一周内向国会通报。ATF表示该系统独立于其主网络,包含ATF调查目标等信息。TechCrunch看到Qilin勒索软件团伙在其泄露网站声称对此事负责,但未提供泄露数据样本等证据。Qilin以"勒索软件即服务"模式运营,曾攻击媒体巨头Lee Enterprises和英国病理实验室巨头Synnovis。ATF加入近年来多个因数据泄露而宣布重大事件的联邦机构行列,包括2023年美国法警局系统遭勒索攻击以及今年早些时候FBI一系统暴露监控目标电话号码的事件。
建议: 隔离受影响系统、加速取证与对外披露、并评估Qilin历史TTP以阻断二次勒索
影响: 美国 ATF 独立系统所含调查目标信息、ATF 内部网络,以及其他近期被勒索软件盯上的联邦机构
来源:展开 1 条收起 1 条
- ATF 宣布"重大事件",勒索软件团伙声称实施入侵(TechCrunch)
开源与工具
Hugging Face与Pollen Robotics联合开售399美元开源机器人Microduck
Hugging Face与Pollen Robotics联合推出售价399美元的Microduck,整机高约25厘米,配备15个执行器及相机、LiDAR、NFC、Wi-Fi等传感器,定位家庭训练场景,计划在圣诞前发货。产品具备摇摆、用嘴捡起800克以内物品、自立起身、蹲伏及滑旱冰等动作,行为可在仿真中训练后直接部署,配套SDK、仿真环境与完整强化学习训练栈已在GitHub开源。Thom Wolf在Twitter透露初期约每5秒售出一台,并很快达成100万美元销售额,多位研究者已购买并尝试激光指针跟随等社区训练实验。
适用场景: 开发者与爱好者进行具身智能训练的家庭级开源机器人入门项目
来源:展开 3 条收起 3 条
- Hugging Face推出售价399美元的Microduck开源机器人(TLTD)
- Hugging Face开售399美元开源鸭机器人Microduck(AI洞察日报 RSS Feed)
- Pollen Robotics与Hugging Face联合发布399美元开源双足机器人Microduck(AINews)
高德发布万帧级流式3D重建模型ABot-Recon并开源推理评测代码
阿里巴巴旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅以连续12帧局部画面为上下文窗口,通过"局部位姿预测+残差优化"路径,实现万帧级实时3D场景重建,计算复杂度保持恒定。在Oxford Spires基准上平均轨迹误差较LingBot-Map降低40.6%,相对旋转误差RPE-R低至0.12°;KITTI-02测试中推理达24.45FPS,峰值显存约6.71GB,仅需单目RGB视频输入,GTX 1080Ti即可运行。模型已在GitHub开源推理及评测代码,并在魔搭社区上线体验专区,可应用于测绘私域建图、具身智能、自动驾驶及3D内容生产等场景。
适用场景: 测绘私域建图、具身智能、自动驾驶与3D内容生产等长序列实时三维重建
来源:展开 1 条收起 1 条
Qwen3.8-Flash-Next开源发布,提供vLLM与SGLang推理食谱
Qwen团队开源Qwen3.8-Flash-Next,采用Gated DeltaNet + Qwen Sparse Attention (QSA) 混合注意力,配以Gated Residual与层2的bigram/trigram n-gram嵌入,总参125B、激活6B、原生262K上下文可扩至1M。官方已提供vLLM与SGLang食谱,Unsloth发布GGUF量化,llama.cpp支持PR进行中;社区实测在双RTX PRO 6000上MTP1模式下可达123–126 tok/s,并对SSD/CPU卸载KV与n-gram表的细粒度控制提出需求。
适用场景: 需要长上下文与高速推理的本地与私有化部署场景
来源:展开 1 条收起 1 条
GitNexus:面向AI编码代理的代码库知识图谱与MCP上下文工具
GitNexus是Akon Labs开源的代码库知识图谱工具,通过CLI与MCP(Model Context Protocol)将任意代码库索引为包含依赖、调用链、集群与执行流的知识图谱,并为Cursor、Claude Code、Antigravity、Codex等AI编码代理提供架构级上下文。官方声明GitNexus无任何加密货币或代币,警告市场上出现的同名代币与项目无关。项目提供本地CLI、Web UI、Render一键部署(默认约35美元/月)三种使用方式,并支持17个MCP工具、2个MCP提示词与多套Agent Skills,核心创新在于索引时预计算结构(聚类、追踪、置信度评分),使代理单次调用即可获得完整影响范围,区别于传统Graph RAG的多轮查询。
适用场景: 为AI编码代理补充架构级依赖与调用链上下文,提升重构与影响面分析效率
来源:展开 1 条收起 1 条
- GitNexus:面向 AI 编码代理的代码库知识图谱与 MCP 上下文工具(Trending repositories on GitHub today · GitHub)
微信开源WeMM-Embedding多模态向量模型
微信团队开源多模态向量模型WeMM-Embedding,提供2B、4B和9B三种规模,统一处理文本、图片、视频及视觉文档,采用Apache-2.0许可证。9B版本在MMEB-v2取得80.6分、MMEB-v3取得59.5分,为对比表中最高成绩。该模型已部署在视频号、公众号、朋友圈和电商场景,提供搜索和推荐支持;开源后开发者可在统一接口下完成跨模态检索与召回,Apache-2.0许可允许商用。
适用场景: 需要统一处理图文与视频的多模态检索、推荐与RAG系统
来源:展开 1 条收起 1 条
数据与洞察
云知声2026年中期财报:Agent业务半年进账近5亿
云知声发布2026年中期财报,上半年营收5.62亿元同比增长38.7%,增速较去年同期20.2%接近翻倍。智能体业务营收4.78亿元同比增长35.7%,占总收入85.1%;新增Token业务收入近3000万元同比增长约760%,Q2环比增长超500%,毛利率超60%;复购收入占比超60%,合同额同比增长65%,在手订单超15亿元;研发投入2.84亿元,占三费总和78.5%。医疗场景中单份病历审核压缩至10秒内,质控覆盖率升至100%,人工效率提升超80%;整体毛利1.86亿元同比增长42%,亏损同比收窄20.2%。
意义: 验证重交付+平台复用架构下Agent商业化的可持续性,Token收入暴涨暗示模型调用量进入收入化阶段
数据: 上半年营收5.62亿元同比增长38.7%,智能体业务4.78亿元同比增长35.7%占总收入85.1%;Token业务收入近3000万元同比增长约760%、Q2环比增长超500%毛利率超60%;复购收入占比超60%,合同额同比增长65%,在手订单超15亿元,研发投入2.84亿元占三费总和78.5%;整体毛利1.86亿元同比增长42%,亏损同比收窄20.2%;医疗场景单份病历审核压缩至10秒内,质控覆盖率升至100%,人工效率提升超80%
来源:展开 1 条收起 1 条
DeepMind推出全球首个AI模型双盲评估试点
Google DeepMind宣布前沿模型双盲评估试点,在安全环境中对测试提示与模型权重均不公开,旨在使外部评估在不暴露双方资产的前提下具备可行性。DeepMind将该评估定位为对评估流程程序化设计的探索,采用密码学环境防止基准测试污染,确保评估结果公正可信。此举意在解决传统基准评测中训练数据污染、提示泄露以及权重暴露等问题,为前沿模型的能力与安全评估建立新的方法学基础。
意义: 为前沿AI模型评测提供可复现、防污染的程序化范式
数据: 覆盖全球首个AI模型双盲评估试点,由116家组织联署,涉及测试提示与模型权重均不公开的安全评估流程,未披露具体基准分数
来源:展开 2 条收起 2 条
- DeepMind推出全球首个AI双盲评估(TLTD)
- Google DeepMind启动前沿AI双盲评估试点(AINews)
MiniMax-H3视频生成在H200上实现最高6.24倍推理加速
lmsys.org对MiniMax-H3视频生成在8×H200 GPU上进行详细基准测试:SGLang Diffusion实现1.95倍无损加速,结合步复用和稀疏注意力最高可达6.24倍加速。fal与MiniMax合作推出H3 Max视频生成模型,宣称可在5秒内生成15秒高质量视频,相对其他高质量模型号称提速50倍;fal平台首周五折优惠。多家账号转发技术说明并给予好评,体现视频生成领域推理优化与可控性的产品化竞争已与基础模型质量同等重要。
意义: 推理优化已成为视频生成模型产品化竞争的关键维度
数据: lmsys.org在8×H200 GPU上对MiniMax-H3视频生成基准测试,SGLang Diffusion实现1.95倍无损加速,结合步复用与稀疏注意力最高6.24倍加速;fal与MiniMax合作的H3 Max宣称可在5秒内生成15秒高质量视频,相对其他高质量模型提速50倍,fal平台首周五折
来源:展开 3 条收起 3 条
- MiniMax-H3在H200 GPU上实现最高6.24倍推理加速(TLTD)
- fal联合MiniMax发布视频生成模型H3 Max(AINews)
- fal推出H3 Max视频生成模型(TLTD)
JIT-Agent提出按需生成智能体底座框架
JIT-Agent研究团队发布新论文,提出按需生成Harness的智能体底座框架,可根据任务自适应调整执行环境。实验显示DeepSeek-V4-Flash反超GPT-5.6,GLM最高提升20.2分,为智能体系统的灵活部署提供了新方向。论文的核心结论是底座的可变性本身可以成为性能变量,挑战了"统一Harness最优"的隐含假设。
意义: 验证智能体底座按任务动态生成可显著释放模型潜在能力
数据: 实验显示DeepSeek-V4-Flash在JIT-Agent框架下反超GPT-5.6,GLM最高提升20.2分
来源:展开 1 条收起 1 条
- JIT-Agent提出按需生成智能体底座(AI洞察日报 RSS Feed)
Sonar Vortex语义代码导航使编码Agent成本下降5%–36%
Sonar提出的Sonar Vortex将代码库建模为结构化图谱,通过SonarQube CLI或MCP Server让Agent直接查询类、方法、字段间的调用与实现关系,绕过文本匹配的局限。在一项使用真实开源合并commit作为基准、控制变量的对比研究中,Agent加入语义代码导航后,在六项涉及Java、Python、TypeScript、C#的任务中均实现成本下降,降幅从5%到36%不等,其中Java接口修改节省36%。该方法还揭示了测试通过不等于变更完整的隐患,对工程团队在Agent重构验证上提出了新的衡量问题。
意义: 语义代码导航比传统文本搜索更高效,Agent重构验证需要超越测试通过率的新指标
数据: 基于真实开源合并commit的对照研究中,六项Java、Python、TypeScript、C#任务成本均下降,降幅5%到36%不等,Java接口修改节省36%
来源:展开 1 条收起 1 条
- 为什么代码搜索让编码 Agent 如此昂贵(Turing Post)
其他值得看
AI工程范式的跃迁:一文讲透Context Engineering
来源:展开 1 条收起 1 条
腾讯汤道生:和AI一起长跑的这两年
来源:展开 1 条收起 1 条
- 腾讯汤道生:和AI一起长跑的这两年(腾讯研究院)
Meta印度及东南亚业务副总裁转投OpenAI
来源:展开 1 条收起 1 条
- Meta高管转投OpenAI之际,这家社交媒体巨头在印度面临日益严格的审查(TechCrunch)
《时代》周刊全球AI 100放榜,邓泰华入选创新者榜单
来源:展开 1 条收起 1 条
IBM在Hot Chips 2026推出双指令集处理器
来源:展开 1 条收起 1 条
- IBM 推出双指令集处理器(奇客Solidot–传递最新科技情报)
Uber构建GitFarm为大规模monorepo提供Git即服务
来源:展开 1 条收起 1 条
扎克伯格撰文暗批Anthropic但Meta同时是其最大客户之一
来源:展开 1 条收起 1 条
DeepSeek寻求以740亿美元估值融资74亿美元
来源:展开 1 条收起 1 条
OpenAI权力格局剧变:Brockman接管日常运营大权
来源:展开 1 条收起 1 条
软银洽购人形机器人公司1X Technologies多数股权
来源:展开 1 条收起 1 条
- 软银洽购1X多数股权(爱范儿)