
2026-9-15 10:46
【天极网DIY硬件频道】在柏林IFA 2026的开幕演讲上,AMD正式发布了代号Gorgon Halo的锐龙AI Max PRO 400系列处理器。9 月 10 日,AMD在北京举办媒体沙龙,联合联想、超聚变、铭凡等合作伙伴首秀了9款基于旗舰型号锐龙AI Max+ PRO 495打造的新品。AMD官方在沙龙上表示,近期预计将有超过20款基于495 平台的新品上市,其中绝大多数是迷你主机形态,惠普则将带来基于Gorgon Halo的新一代ZBook Ultra移动工作站。按AMD的说法,这是首款能在本地运行3000亿参数模型的x86客户端处理器。
这一代真正的变量又落到了整个PC行业的焦点:内存。锐龙AI Max PRO 400系列把支持统一内存容量从上一代的128GB抬到 192GB,规格为256bit LPDDR5X-8533,带宽约273GB/s,其中最高160GB可以划拨给集成的 Radeon 8065S核显作为显存。规格方面,旗舰AI Max+ PRO 495基于Zen 5架构,16 核 32 线程,最高加速频率 5.2GHz;Radeon 8065S 采用RDNA 3.5架构、40 个图形计算单元;NPU基于XDNA 2架构、最高55 TOPS算力,可配置功耗45至120 W。AMD 同时称,本地可运行的模型参数规模从前代的200B扩展到300B,官方资料给出的数字约3210亿。
要理解160GB显存意味着什么,得先说清本地跑大模型卡在哪。推理阶段GPU的主要工作是反复读取模型权重,这一阶段的瓶颈主要在内存而不是算力上。主流笔记本的独显通常只能搭配8-24GB显存,而一个 700 亿参数模型即使按FP16精度也要约140GB,即便压到4bit量化仍需38到40GB;如果独显需要借用内存空间,读取数据还得过PCIe总线,Gen 4 x16的实际带宽只有约 32GB/s。而统一内存省掉的正是这一段:CPU、GPU、NPU 面对的是同一块物理内存、同一套地址空间,不再需要来回访问。
不过300B参数是AMD官方给出的上限,如果按4bit折算,权重约占150GB,剩下的约10GB还要留给随上下文长度增长的KV缓存,无疑代表一种理论极限情况。大模型能跑起来和跑得顺是两件事,最终实际表现依然与量化精度、上下文长度、并发数强相关。
产品落地的速度更值得留意。沙龙首秀的9款新品覆盖迷你主机、紧凑型AI工作站与桌面AI设备,联想ThinkCentre X Ultra、铭凡MS-S1 MAX-P495、极摩客EVO X5 Pro、七彩虹灵创Mini Pro、阿迈奇F9A等均在列,六联智能的两款则预计今年第四季度量产。以铭凡MS-S1 MAX-P495为例,它内置320W电源,支持120W持续、160W峰值释放,提供双10GbE网口和两个USB4接口,并支持多机集群;官方实测数据是Q4量化下运行284B模型约15 Token/s,Q8精度下运行122B模型约27 Token/s。铭凡同期发布的N5 MAX-P495,则把同一颗芯片和最高200TB本地存储装进一台五盘位设备。
小结
把192GB统一内存做进一台紧凑型小主机,这件事的价值不仅在跑分,更在于边界。AMD把这一代平台的能力上限推到300B级别之后,大模型推理、并发的智能体工作流、实时渲染与仿真这类原本要依赖专业工作站甚至机房的负载,第一次在桌面上有了完整的本地选项——一台能放上工位的机器,已经可以从昂贵的工作站独立显卡手里接下相当一部分负载,而不必每次都排队等云端。更值得琢磨的是它顺带解决的第二件事:数据留在本地。过去几年把数据交给云端,本质上是拿便利换掉了一部分控制权;当本地设备能装下此前只有云端才装得下的模型,这道选择题第一次变得不那么难答,一些敏感数据可以真正不出门。当然,清醒还是要有的:300B是上限不是日常,量化之后能跑的规模、实际的推理速度、以及自己到底需不需要在本地跑300B,才是买单前该问清楚的三个问题。
微博认证登陆
QQ账号登陆
微信账号登陆
取消
©2026 天极网旗下网站