神雕侠侣古天乐版

Windows是AI PC路上的绊脚石_我的网站

妖女迷行

A |     

微软近期做了一件看起来相当反常的事。它开始重新优化 Windows 在 8GB 及以上设备上的内存表现。

B |

图自 Windows Blog

图自 Windows Blog放在几年前,这基本算是做梦。毕竟按照当年「安迪给的,比尔拿走」定律来看,一直是硬件规格有多高, Windows 就吃掉多少——8GB 早就被当成入门配置扫进了历史的角落,微软主推的 Windows 11 AI+ PC,也从一开始就把内存门槛定在了 16GB。    7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。可现实上演了一出回马枪。

C |          入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。

D | 而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。AI 的爆发让数据中心疯狂囤积内存,颗粒价格一路上涨,成本压力顺着供应链传到每一台 PC 上。而那个被无数 Windows 用户抱怨的问题,再次摆到了台面上:臃肿的 Windows,是不是 AI PC 路上的绊脚石?

吞掉右 Ctrl 的 Copilot 键

吞掉右 Ctrl 的 Copilot 键傲慢|你一直在给 Windows 擦屁股Windows 长久以来存在的最大误判,就是默认处理器会越来越快,内存不够用户自然会加,再不济就换台新电脑。

E | 在这套逻辑下,Windows 对自身的内存开销比较宽容。后台服务和框架越积越多,内存占用也跟着上涨,反正更强的硬件总能把这些问题暂时盖过去。         不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。

F |          图:WAIC 2026 现场,宇树科技展台(来源:新蓝网)          穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。

G | 但得到的答案却分别指向不同的东西。但 AI 出现以后,多出来的硬件资源不再只属于传统应用。过去新增的内存能让浏览器多开几十个标签页,现在越来越多本地 AI 功能还要加载模型、维护索引,并持续处理来自屏幕和摄像头的数据。

H | 有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。同一个词,在不同的展台上被不同的数字定义。Windows 那些曾经无关痛痒的基础开销,也开始直接挤压 AI 的运行空间。微软直到此时才重新审视 8GB 设备,更像是硬件增长已经无法继续替系统掩盖浪费。暴食|没有节制的加法就是负担硬件长期承担善后,也养出了 Windows 不断做加法的习惯。微软此次优化的对象横跨内存分配器、WinUI 3、Chromium 和 WebView2,从底层资源分配一直延伸到界面框架和网页运行环境。         当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。         一张拼图,三个榜单          2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。可问题早已超出某个单独组件,更像是整套系统长期缺少统一资源约束后的结果。         技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。

I |

图自 DotNetBrowser

图自 DotNetBrowser单独拎出来看,每一层都有自己的正当理由。

J | 媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强?          然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。WinUI 3 是为了现代化的界面体验,Chromium 是为了网页兼容和开发一致性,旧框架是为了让历史应用和企业软件继续跑下去。麻烦在于每一层都「存在即合理」,又缺少统一的收缩机制去约束,于是各层在各自的目标下不断扩张,最后叠加成整个系统的负担。

K | 传统 PC 还能靠硬件升级稀释冗余,但 AI PC 要把大量内存留给模型权重、上下文和常驻 Agent。

L | 微软如今重新优化 8GB 设备,也说明 Windows 的基础开销仍有不小的压缩空间,只是过去没有足够大的压力推动微软处理。懒惰|兼容,Windows 最重的包袱如果说暴食来自不断增加功能,懒惰则体现在旧东西几乎不怎么「打理」。Windows 主打兼容性优先,这也导致旧接口和运行环境退出得很慢,新旧体系时常并存。

M | 为了兼容几十年前的软件或企业系统,甚至是特殊外设的驱动,Windows 都保留了好几套不同年代的接口与运行环境。这套兼容性确实是它最重要的生态地基,让大量行业系统几十年都能跑在同一个平台上。         落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。

N | 但兼容能力后来逐渐变成了一项没有明确边界的义务。最经典的例子就是控制面板至今没有被新设置完全取代,很多功能只能让两套入口长期并存。         那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。看懂它们,比看懂任何一场发布会都更接近行业的真实进度。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。部分界面的入口看似越来越现代,但一旦深挖几层,照样能翻出十几年前的逻辑和窗口体系。         VBench:回答"像不像"          VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。

图自 Tom's Guide

图自 Tom's GuideWindows 的懒惰不在于它什么都没做,恰恰相反,它做了太多加法,却始终不愿承担做减法的代价。它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。         它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。         在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。         根据其 HuggingFace 官方榜单的认证视图,主要名次如下:          图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图)          但 VBench 仍主要评价视频结果。传统桌面环境还能容忍这种结构,可 AI PC 还要处理 CPU、GPU 与 NPU 之间更频繁的任务调度,同时为本地模型和后台 AI 功能分配资源。旧规则保留得越多,统一管理的难度就越高。贪婪|甩不掉的微软全家桶Windows 的臃肿也不能全部归咎于历史兼容。画面可以逼真,模型却未必理解画面背后的规律。

o |          WorldModelBench:回答"懂不懂"          如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。         2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。今天的 Windows 早已不是一套操作系统,更像是微软账户带着 Edge 和 OneDrive,再拉上 Microsoft 365 与 Xbox 一起挤进来的全家桶入口。         该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。

p | 其中物理遵循占总分一半。

q | 这些组件既承担具体功能,也关乎着微软在系统生态的分发入口。因此是否能够彻底移除,自然不只是一个技术问题。不仅如此,OEM 厂商还要在这层基础上继续「装修」,从更新工具到电源管理,到驱动面板和各类预装软件,能加进系统的通通给你满上,主打一个「加加加加到厌倦」。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。

r |

联想桌面助手

联想桌面助手于是就形成了一个解不开的死结:历史兼容让旧东西搬不走,商业扩张又让新模块不断住进来,系统只能持续膨胀。微软若想让 AI Agent 成为统一的任务入口,来负责调动应用和系统能力,就得先处理 Windows 内部大量彼此独立的服务与权限体系。依赖|技术捷径是最大的拖累让 Windows 变沉的,还有微软越来越依赖的网页技术。Windows 不少更新的功能都一定程度上使用了 WebView2。

s |          结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。而 WebView2 使用基于 Chromium 的 Microsoft Edge 渲染引擎,让开发团队能够复用 HTML、CSS 和 JavaScript,以此降低界面开发成本,也方便快速更新。

t |          模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。         图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图)          RoboTwin 2.0:回答"动不动得了"          世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。         RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。工程效率是提高了,资源纪律却没有同步跟上。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。

图自 Windows Latest

图自 Windows LatestWebView2 的运行时本身可以由多个应用共享,但不同应用仍可能各自建立浏览器进程、渲染进程、页面状态和用户数据环境。

u |          早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。应用数量增加后,这些彼此隔离的活动进程仍会叠加内存与后台开销。微软持续优化 Chromium 和 WebView2 的内存与启动成本,已经说明问题不能只归咎于某个应用写得差,更需要思考如何统一和规范分散的资源使用方式。嫉妒|什么都想要,什么都不行微软当然也希望 Windows 能像 macOS 一样,把处理器、系统、开发工具和应用生态,都打包进同一套协同体验里,更希望 AI+ PC 能拿出接近 MacBook 的软硬件配合。机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。         图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图)          三张榜单,三种能力,各自有发布机构和评分体系。Windows 却很难照搬苹果的路线。

v | 没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。

w | 但这个链条还缺少一个最关键的环节。         Physics-IQ:回答"准不准"          人类做很多动作时,会下意识在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。

图自 Tom's Guide

图自 Tom's Guide苹果能够控制硬件型号数量,同时统一产品的处理器架构和开发工具,甚至敢给旧架构设定明确的退出时间。         机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这里犯错。这类预测如果不准,后面的规划和执行都无从谈起。微软可以通过 Prism 承接传统 x86 和 x64 应用,但驱动与内核组件仍然需要原生 Arm64 支持。         测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。换而言之,应用能够依靠转译过渡,特殊硬件却依然取决于厂商是否愿意重新开发驱动。

x | 微软既想获得新平台的协同效率,又不愿放弃开放生态、历史兼容和市场规模,最终只能同时承担两套模式的成本。         2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。         它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。

y | 模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。长期犹豫也在削弱 Windows 曾经近乎垄断的优势。2021 年前后,Windows 在 StatCounter 全球桌面网页使用统计中的份额仍接近八成;到 2026 年 7 月,这个数字已经降至 71.18%。

z |

2021 年(上)、近 12 个月(下)

2021 年(上)、近 12 个月(下)以 StatCounter 的统计来看,Windows 仍有领先的地位,但友商的平台优势也在变强。苹果通过推动整条 Mac 产品线统一转向 M 系列芯片,完成了新一代硬件架构的迁移;而 Linux 则在开发工具和 AI 计算上继续扩张,并逐渐渗透到更多跨架构环境中。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。

| Windows 每次在新架构和旧生态之间反复权衡,都会拉长自身迁移周期,也给其他平台留下吸引用户和开发者的时间。迁怒|优化做不好,就让内存买单面对系统膨胀,微软过去最常见的处理方式,是提高硬件门槛。         Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。

| 这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。

| 8GB 不够就推动 16GB,游戏和多任务吃紧就建议 32GB,ARM 兼容不完善就依靠更强的处理器和更高效的转译弥补。

|          然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。         2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。今年 4 月,微软还在 Windows Learning Center 的游戏 PC 指南中,把 16GB 称为实际起点,并把 32GB 称为更省心的升级选择。这篇文章随后在 5 月初被删除;到了 8 月,另一篇把 32GB 称为重度玩家理想配置的旧指南,也被确认已经下线。微软没有解释原因,调整时间却很微妙。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。

图自 Windows Latest

图自 Windows Latest提高配置看起来顺理成章,但成本却要由 OEM 厂商和消费者承担。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。         这张表有三种读法。         看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。              看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。AI 浪潮推高内存需求后,依赖硬件升级解决软件问题的方式开始不起效了。              图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图)          再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。因为消费者花同样的钱,或许只能买到内存更小的电脑,微软也无法继续假设所有性能问题都能靠堆配置解决。在这样的背景下,系统层面的优化已不再是技术选择,更来自现实压力。微软愿意处理 Windows 的资源问题,当然值得肯定。

|               图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图)          把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。但现在仍然无法确定,它准备真正移走多少历史负担,又有多少只是重新整理,好给 AI+ PC 腾出有限的运行空间。         生成得逼真,和预测得准确,被证明是两回事。         把视频生成做成"预测下一个词"          Magi-1 赢在哪里?论文给出的答案是架构选择。         当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。         而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。回头看,Windows 的七宗罪最终争夺的都是同一批资源:内存、功耗、后台权限、开发资源,以及操作系统对整台电脑的控制权。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。传统 PC 可以依靠更大的内存和更快的处理器,把很多系统层面的浪费「稀释」掉。

| 但 AI PC 的逻辑完全不同。

|          图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)          这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。

| 它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。

| 对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。

|          如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。模型需要驻留内存,持续维护上下文状态,还要在 CPU、GPU 和 NPU 之间频繁调度数据流。LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。

| 系统资源已经从随用随取的弹性池,转向被精确分配的常驻空间。

| 在这种结构下,系统自身哪怕多出一点基础开销,都会直接挤压 AI 的可用空间。

图自 How-To Geek

图自 How-To Geek但问题的关键在于,Windows 并没有一条可以「推倒重来」的路径。它必须在不破坏旧生态的前提下推进现代化改造——既要维持数十年积累的应用与驱动体系,又要承接本地模型、AI Agent 和跨处理器调度带来的新资源需求。         图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital)          一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。         尺子一旦出现,叙事便有了边界          在WAIC 的论坛上,"世界模型"被反复提起。在双重约束下,Windows 的资源控制和平台迁移都不可避免地变得缓慢而保守。7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。         竞争的坐标系确实在平移。

| 相比之下,其他操作系统同样有自己的历史包袱和生态限制,但很少有一个平台像 Windows 这样,同时承载如此复杂的历史兼容体系,开放硬件生态,商业分发入口,以及跨代架构迁移压力。当这些因素叠加在一起时,问题就不再是「优化得够不够好」,而是系统本身是否还能以足够快的速度,适应 AI PC 这种全新的计算范式。作者|柯铭源编辑|肖钦鹏、杜晨

。过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些东西没法靠话术修饰。

| 坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。         榜单会迭代,名次会更替。

| 但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。         尺子一旦有了,量出什么,就是什么。

|

Current article:http://www.linlangdouwaqiexusan.bond/list_m4j/e2k.docx

Published on:16:03:39


用手机访问
下载APP
appicon 下载
扫一扫,手机浏览
code
休闲娱乐
综合热点资讯
单机游戏下载
精彩专栏
游民星空联运游戏