
【ZOL中关村在线原创技术解析】聊天式AI和智能体AI看似都在使用大模型能力帮助用户解决特定任务,但对于底层硬件系统来说,实际上考验的是完全不同的能力。
聊天AI是给出答案的一次性响应,这比的是谁的GPU更强、谁的token吐得更快。而智能体AI却是一整套已完成、并且经过验证的工作成果,从读取几百份文件开始、到做OCR识别、提取关键信息、再到生成报告,最后还要自我核查,确保结果可用。因此,前者比拼的是“单点爆发力”,后者比拼的是“全流程贯通能力”,而这恰恰是GPU算力无法单独决定胜负的领域。这也是为什么当前芯片厂商都在讲的智能体AI时代CPU与GPU配比重回1:1的底层原因。

年初CES,AMD发布了锐龙AI Halo迷你主机,并在近期的AMD Advancing AI大会上公布了升级款机型。随后,AMD发布了一份基于锐龙AI Halo平台的本地智能体基准测试(HEPA)报告,这份报告很好地解答了智能体AI时代CPU的重要性。

根据测试结果来看,在真实的企业级智能体工作负载下,搭载AMD锐龙AI Max+ 395处理器的锐龙AI Halo,在多项关键指标上其实已经超越了GPU能力强劲的NVIDIA DGX Spark(GB10),这背后揭示的,其实是本地AI硬件评价标准的一次根本性转变。
·智能体工作流大部分不是跑在GPU之上
与聊天AI先思考再给出答案不同,智能体要完成一项任务,通常需要经过解析、OCR、切分、嵌入、检索、数据链整理、生成、验证等多个阶段。AMD的测试将这一流程拆解为8个具体环节,测试结果发现:其中的7个阶段均会运行在CPU上,只有生成这一个阶段,也就是模型输出token的过程会运行在GPU 上。具体可以参看下表:

换句话说,GPU只在整个任务的临门一脚环节发力,而解析文档、识别扫描件、切分内容、生成向量、检索证据这些真正耗费系统资源的准备工作负载,几乎全部压在CPU身上。这意味着,一台设备的智能体的实际表现,很大程度上取决于CPU的编排与并行处理能力,而不只是GPU的峰值算力,这与聊天AI时代的AI应用逻辑完全不同。

·从token速度到全流程效率
聊天时代最常被提及的两个指标是首token响应时间(TTFT)和每秒token数,它们衡量的是单个模型流式输出单次回答的速度。但对智能体而言,这两个指标只能反映流水线中“生成”这一小段的表现,无法说明任务整体完成得有多快。

因此,智能体时代真正有意义的指标变成了端到端完成时间,即从接收任务到交付经过验证的成果所需的总时长,以及每个已完成工作流的成本。这也是AMD设计HEPA基准测试的出发点,也就是不再单独衡量推理速度,而是衡量把所有活干完所需要的时间和所付出的代价。
·HEPA基准测试:贴近真实企业场景的极限压力测试
HEPA,全称Hermes Executive Presentation Agent,是AMD自定义设计的基准测试,用来模拟一个高度真实的企业知识工作场景,包括:智能体需要处理302份本地文件(相当于一个大型团队共享网盘),文件中混杂着有效信息、冗余材料、过时甚至相互冲突的内容,还包含需要真正OCR识别的扫描件和源自图像的素材。
智能体必须完整读取这批数据、对扫描件执行OCR、将内容切分为801个片段并生成嵌入向量、检索出有证据支撑的内容包、生成一份可提交董事会的高管演示文稿(配套备忘录、图表及带引用来源的附录),并最终通过一套确定性的质量验证流程。整个过程更像是老板扔给你一个几百GB的共享盘,要求“下午三点前给出一份能上会的PPT”,而不是简单地“回答某一个问题”。
这项测试在两台配置对等的设备上进行:一台是搭载AMD锐龙AI Max+ 395(16核32线程)的锐龙AI Halo开发者设备,另一台是搭载GB10(20核Arm 架构)的NVIDIA DGX Spark。两者均配备128GB统一内存,运行相同的语料库、相同的编排模型(Qwen3.6-35B-A3B混合专家模型)、相同的嵌入模型与真实TesseractOCR,并且都完成了5/5次有效运行与25/25项确定性质量检查,确保结果具备可比性。
在完全相同的测试条件下,AMD锐龙AI Halo在端到端完成时间、CPU编排效率和每工作流成本三项关键指标上,均优于NVIDIA DGX Spark,具体参考下方表格:

CPU编排阶段,锐龙AI Halo领先34%。从测试结果看到,AMD完成CPU侧准备工作仅用时152.1 秒,而DGX Spark耗时229.9秒。根据AMD官方信息,其中差距最大的环节是嵌入与路由,AMD用时71.5秒,DGX Spark用时139.6秒,差距接近一倍。
端到端工作流方面,锐龙AI Halo快15%。AMD完成整个经过验证的工作流用时311.6秒,DGX Spark用时367.1秒,AMD提前55.5秒交付结果。在智能体场景中,这才是真正有意义的核心KPI,即交出一份可用的成果,而不是比拼谁的token吐得更快。

每工作流成本方面,锐龙AI Halo低27%。按三年硬件摊销计算(不含能源成本),AMD每个已完成工作流的成本约为0.0132美元,DGX Spark约为0.0182美元。值得注意的是,即便DGX Spark在单纯的GPU推理阶段更具优势,它依然在整体任务上落后,因为前面我们也说了,推理只是智能体AI流水线中的一环,CPU密集型的编排工作同样会决定最终的成败。
·AMD为什么能赢?答案就藏在CPU里
那么为什么GPU能力更强的DGX Spark反倒在智能体工作流中的效率不及锐龙AI Halo呢?其实答案就是CPU。

AMD锐龙AI Max+ 395拥有16 个Zen 5核心以及32个有效工作线程,并集成了AVX-512/VNNI向量加速指令集,同时具备面向文档处理与检索技术栈高度优化的原生x86工具链。相比之下,DGX Spark的Grace Blackwell 平台虽然拥有20个Arm核心,但它不支持超线程,而且向量加速依赖的是SVE2而非效率更高的AVX-512。
而且解析、OCR、嵌入、路由这些阶段本质上都是高度数据并行的任务,会随着核心数、线程数的增加而近似线性地提速,也会随着数据集规模扩大而放大差距。更多的线程、更强的向量处理能力,意味着可以同时处理更多源文件的解析、嵌入与路由,这正是AMD在“嵌入与路由”这一决定性环节领先近一倍的根本原因。同时如果数据体量越大,这种架构优势就体现得越加明显。
·系统制胜,而非单一芯片的竞赛
AMD锐龙AI Halo的设计思路可以概括为一个智能体、两个引擎、一个统一内存池。智能体负责规划、调用工具、验证结果;CPU承担解析、OCR、切分嵌入、检索路由、数据整理等编排循环;GPU则专注于token生成;而128GB超大统一内存,让编排模型与生成模型始终保持常驻状态,模型与数据之间无需反复加载、来回搬运。

这种大容量统一内存的存在,本身就是让在本地完整运行一整套模型组合成为可能的关键前提,如果没有它,模型甚至无法被完整加载进设备。而随着本地智能体逐步演化为完整的模型“全家桶”(编排模型、常驻小模型、嵌入模型、重排序模型、OCR模型、语音模型、图像模型协同运行),这种系统级的均衡设计所带来的优势,只会持续累积、不断放大。
·从“谁的GPU更强”到“谁的系统更快更省”
聊天AI时代,人们习惯问的问题是,“谁的GPU更强?”但到了智能体AI时代,真正值得追问的问题变成了,“谁的系统能够以更快的速度、更低的成本完成整个工作流?”

AMD的HEPA测试给出了非常明确的答案,一个系统完全可能赢得单纯的token生成速度竞赛,却依然会在真实的智能体AI工作流任务完成度上落败,因为智能体工作流本身就是一场涉及编排、检索、验证的系统性工程,而非一次孤立的矩阵运算。
对于希望在本地部署智能体应用的企业与开发者而言,AMD的这项测试其实更具参考价值,因为它在评估本地AI硬件时,不是只看GPU算力峰值,而是综合考察CPU的并行处理能力、内存架构设计,以及整个系统在真实工作负载下的端到端表现。同时锐龙AI Halo所代表的,正是这样一种以平衡系统为核心设计理念的本地智能体计算平台。
如果说过去的聊天式AI讲的是关于GPU的故事,那么智能体AI所讲的,则是一个关于系统的故事。
本文属于原创文章,如若转载,请注明来源:智能体AI时代为什么CPU同等重要?AMD锐龙AI Halo本地智能体推理实测解析https://nb.zol.com.cn/1227/12274601.html

































































