把千亿模型装进笔记本,Windows 终于要反击 Mac 了

AI PC 这个概念喊了两年,终于有人把「本地跑大模型」从演示台搬进了背包。
联想在柏林 IFA 2026 期间的 Lenovo Innovation World 2026 上发布了一系列 AI 终端,手表、手机、平板、笔记本电脑、显示器等等。
其中最重要的产品,毫无疑问是联想联合英伟达推出的 Lenovo Yoga Pro 9n(国内型号:YOGA Pro 15 Spark),这是一台可以本地运行千亿参数大模型的量产笔记本。这款笔记本重 1.65 千克,最薄 16.7 毫米,最高配备 128GB 统一内存。
而按照英伟达对 RTX Spark 的规格说明,这套配置已经可以在本地运行 1200 亿参数、最高支持 100 万 token 上下文的大语言模型。以往我们讨论 AI PC 时,要不就是放在桌面上的专业主机,像是 DGX Spark 和 Mac Studio 等产品,要不就是能让我们为了一只龙虾抢疯的 Mac Mini。
一台笔记本要成为合格的 AI PC,似乎要不就是在硬件上堆到尽可能的极致,要有大内存,要有顶级显卡,然后尽可能保持电脑的尺寸和散热。或者在软件上,曾经是能无痛安装 OpenClaw 也可以,以及能最大限度的支持各种 AI Agent 的使用,就像 AI 手机一样,AI 能操作的 APP 越多,这个设备就越 AI,电脑同样如此。
但是当 AI PC 也开始走完一个完整的周期:概念走红、参数比拼、用户追问价值。我们也开始想知道,这些算力,到底能在我的电脑上做成什么?应付实时翻译、会议降噪这类功能级任务或许绰绰有余,但完整的大模型推理,稍微复杂一点的 AI 工作流,仍然要回到云端处理。
本地大模型,更多时候站在演示台上,而不是我们的桌面上。
联想这次推出的 Yoga Pro 9n 换了一条路线,它选择深度接入了英伟达的端侧 AI 架构体系,搭载 NVIDIA RTX Spark 超级芯片,通过 NVLink-C2C 互联,将 20 核 NVIDIA Grace CPU 与 6144 个 CUDA 核心的 Blackwell RTX GPU 合为一体,提供 1 PFLOPS(FP4 精度)的 AI 性能。
一台 Windows 笔记本电脑,也有了成为 Agent 主机的潜力。统一内存成了 AI PC 的新趋势 传统 PC 中,CPU 内存与 GPU 显存相互独立,大模型参数在两者之间反复搬运,显存的容量往往直接决定能跑多大的模型。过去做高性能电脑,独显几乎是标配,但独显峰值算力再强,消费级产品的显存通常也就十几二十 GB,模型稍微大一点,就装不下了。
英伟达 RTX Spark 的统一内存架构则是让 CPU、GPU 共享同一个物理内存池,最高 128GB 对两者同时可用,模型权重、输入数据和中间结果只需保存一份;千亿参数级的大模型也得以在一台笔记本上本地运行。英伟达给出的参考值,是 1200 亿参数、100 万 token 上下文的大语言模型。
英伟达给出的参考值,是 1200 亿参数、100 万 token 上下文的大语言模型。开发者可以沿用熟悉的 CUDA 技术栈,数据不必上传云端,项目文档、代码与素材都留在本地。平台还能在后台协调多个 AI 智能体,跨应用自动完成复杂的创作任务。
值得一提的是,联想 X Power 散热架构把 80W TDP 压进了最薄 16.7 毫米的机身,配 15.3 英寸 2.5K 165Hz PureSight Pro OLED 屏;基于 RTX 平台,Yoga 家族也获得了进阶的游戏能力。开发 AI 应用、剪高分辨率视频、渲染 3D 场景,都可以在这一台机器上完成。
Luca Rossi,联想集团执行副总裁兼智能设备业务集团(IDG)总裁 Luca Rossi,联想集团执行副总裁兼智能设备业务集团(IDG)总裁 同平台的 Lenovo Yoga 9n 2-in-1,则把这份算力装进了一台 360 度翻转创作本:最高 64GB 统一内存,支持「屏幕 + 触控板」双表面手写。
2 in 1 是联想的二合一型笔记本电脑 2 in 1 是联想的二合一型笔记本电脑 联想不是唯一押注统一内存的玩家。就在前不久,苹果刚刚更新的 Mac mini 和 Mac Studio,几乎也是把本地 AI 计算的性能上限再抬高一截。
Mac mini 提供 M6 和 M5 Pro 两种芯片,统一内存最高 64GB,并且支持通过 Thunderbolt 把多台机器组成集群。Mac Studio 则提供 M5 Max 与 M5 Ultra,其中 M5 Ultra 版本最高支持 512GB 统一内存、每秒 1.2TB 带宽,按苹果的说法,足以承载数百亿乃至数千亿参数的模型。
今年 6 月 WWDC26 的一场特别活动上,苹果还现场演示过这种集群的玩法:4 台 Mac Studio 通过 Thunderbolt 5 互联,用 LM Studio 基于 MLX Distributed 跑起了万亿参数规模的开放权重模型 Kimi K2.6。官方数据显示,4 机集群的推理性能最高可以达到单机的 3 倍。
苹果笔记本这边,128GB 统一内存的 MacBook Pro(M5 Max)也可以在本地运行 120B 参数的开源模型 gpt-oss-120b,有实测显示最高约 79 token/s,但前提是 4-bit 量化,且长上下文会明显挤占内存。
把两家 PC 更新的方向放在一起,很明显能看到端侧 AI 的瓶颈已经从单纯的算力,转到了「模型装不装得下、数据搬不搬得动」的比拼。苹果用统一内存加 Thunderbolt 集群铺开了从笔记本到桌面的整条线。
联想和英伟达这次的意义,则是把同样的能力第一次带进 Windows + CUDA 生态,并用 FP4 精度和统一内存,把本地上下文的上限推高到了 100 万 token 这个数量级。Windows,也开始争夺 Agent 主机 但在这场比拼里,还有一个容易被忽略的变化:Windows 入场了。
当我们把这件事放到更大的生态竞争里看,Lenovo Yoga Pro 9n 的意义就不只是停留在「又一台很强的 AI PC」。过去一段时间里,真正能稳定承载本地大模型、长上下文和多智能体工作流的设备,讨论度往往集中在 Mac 和 Linux 操作系统。
Mac 靠统一内存和 MLX,一只「龙虾」就能让 Mac mini 卖断货;Linux 则是英伟达、工作站和开发者工具链的大本营。像 DGX Spark 这样的个人 AI 超算,本身就是建立在 Linux 软件栈之上,大量 CUDA 开发和模型部署工具也首先围绕 Linux 成熟起来。
而 Windows 虽然一直是最广泛的个人电脑平台,却很少被视为本地大模型和 Agent 的主场。现在,随着联想把 RTX Spark 这套能力装进量产笔记本,再把可扩展的小型超算节点带进商用场景,Windows 也开始拥有了承载千亿参数模型和本地 Agent 的现实基础。
英伟达 RTX Spark 芯片介绍网页,多款 Windows 电脑搭载了该超级芯片 英伟达 RTX Spark 芯片介绍网页,多款 Windows 电脑搭载了该超级芯片 对于已经围绕 CUDA 开发 AI 应用的人来说,RTX Spark 背后有着 CUDA 多年积累的开发工具、软件库和开发者群体;既有的知识和开发经验可以继续沿用,这也让 Windows 在争夺个人 Agent 主机时,多了一份软件上的吸引力。
当 Mac 正在变成开发者和创作者的本地 AI 工作站时,Windows 也显然不想错过这块市场。笔记本之外,一切都在为 Agent 服务 把算力和内存做大做匀之后,下一个问题是:这些能力为谁准备?联想的答案是 AI Agent。
当 AI 从「有问必答的助手」变成「能自己规划、持续干活的协作者」,它对设备的要求也变了:任务一跑就是几小时,上下文要长期留存,数据和权限都得留在本地。联想的商用新品 ThinkCentre X Ultra(国内型号:ThinkCentre X Tiny)就是冲着这个需求来的。
1.6 升的机身里,塞进了 AMD 锐龙 AI Max+ PRO 495 系列处理器和最高 128GB 统一内存。
和 DGX Spark 仅支持 Linux 系统不同,这款超算盒子,联想提供了面向 Windows 和 Linux 的预配置 AI 工具与工作流 和 DGX Spark 仅支持 Linux 系统不同,这款超算盒子,联想提供了面向 Windows 和 Linux 的预配置 AI 工具与工作流 更有意思的是它的扩展方式,最多四台设备可以集群互联成一个统一计算平台,运行更大的模型、更长的上下文和多智能体工作流。
一个部门可以先从一台用起,业务增长、模型变大时再逐台叠加。从「一人一台电脑」到「AI 一台我一台」,办公桌正在变成最小的 AI 算力节点。
除了「千亿参数进笔记本」和这台对标英伟达 DGX Spark 个人超算之外,联想这次的阵容铺得很满,我们简单盘点了一下包括下面这些信息: 两款概念机:Project Aeroblade 用与 Frore Systems 合作的 AirJet 固态主动散热取代风扇,在不足 10 毫米、不到 1000 克的机身里做到无风扇全性能;Project Swan 把卷轴屏带进商用本,合上是 14 英寸,展开是 17 英寸。
平板:Lenovo Yoga Tab Plus Gen 2 / Yoga Tab Gen 2(国内型号:拯救者 Y900 13 / Y900 11),主打笔优先交互,4K 144Hz 屏配 8192 级压感手写笔;Lenovo Smart Canvas Concept 演示了创作在一体机与平板之间跨设备接力。
主流与家用:与潘通合作的七色 IdeaPad Vibe 系列;无中置主机设计的 IdeaCentre AIO i 一体机。
商用:ThinkBook 14 Gen 9(骁龙 X2 Plus,80 TOPS,至高 26 小时视频续航)、12.9 毫米 990 克的 ThinkBook 14x Gen 2、ThinkCentre M75 系列,以及四款 ThinkVision 显示器,其中包括全球首款获微软认证的雷电 VoIP 显示器 P34WD-4v。
摩托罗拉:首款内置 Motorola Qira 的智能手表 moto watch ultra;搭载摩托罗拉史上最高 2 亿像素主摄的 edge 70 plus;镶了 35 颗施华洛世奇水晶的 razr 特别版。
个人 AI:Lenovo \& Motorola Qira 支持门槛只需要 16GB 内存 PC,随 Android 17 覆盖更多手机平板,并借 Workato 打通邮件与日历;国内的天禧个人智能体升级到 4.3,支持全双工自然语音对话。从买电脑,到买算力 过去两年,Windows 和 Mac 走出了两条截然不同的 AI PC 路线。
Windows 最早最积极地喊着 AI PC,早早就把 AI 变成操作系统的一部分:NPU、Copilot+ PC、实时翻译、Recall,以及越来越多的系统级 AI API。但真正说到本地跑大模型、搭 AI 工作流,Mac 则凭借统一内存和 MLX,意外成为了开发者最喜欢的本地大模型工作站之一。
前者解决的是「怎么让 PC 多一些 AI 功能」,后者解决的是「怎么让大模型真正跑在 PC 上」。而 RTX Spark 这样的设备出现之后,Windows 和 macOS 的两条路线开始汇合。Windows PC 也开始拥有百 GB 级统一内存、千亿参数模型和 CUDA,本地 AI 不再只是系统里的一个功能,而可以成为整台电脑长期运行的工作负载。
模型厂商会更有动力为端侧做蒸馏和量化,开发者也可以基于 CUDA 或 MLX 生态做本地优先的应用,而隐私、延迟和订阅成本这三座大山,或许也开始有了绕开的可能。顺着这条路往下想,手机、平板、手表未必没有机会跑本地大模型。
其实这次联想把 Qira 的支持门槛已经下探到 16GB 内存的 PC,宣布随 Android 17 覆盖更多摩托罗拉手机和平板,甚至让它登上了 moto watch ultra 这块手表。不过眼下在手腕的端侧模型,还只是一个「调取跨设备记忆」的助手,但内存容量和带宽的爬坡曲线一旦延伸到移动端,端侧模型从笔记本向更小设备扩散,就只是时间问题。
下一场 AI PC 的竞争,开始拥有一条更容易理解的衡量标准: 一台电脑有多 AI,不再只看它有多少 AI 功能,还要看有多少原本必须交给云端的工作,现在可以留在你的电脑里完成。过去这个位置更多属于 Mac 和 Linux,现在 Windows 设备也开始带着统一内存、CUDA 和千亿模型能力加入争夺。
到那时,无论 Windows 还是 macOS,我们买的都将会是一台真正属于自己的 Agent 主机。