By ITCuli

Normalizing NVIDIA Vera Benchmarks to AMD EPYC Turin A Framework

Normalizing NVIDIA Vera Benchmarks to AMD EPYC Turin A Framework

VI: NVIDIA Vera và AMD EPYC Turin: nên đọc benchmark như thế nào?

Bài viết gốc của ServeTheHome phân tích một điểm rất thực tế: các benchmark đầu tiên của CPU NVIDIA Vera không sai theo nghĩa kỹ thuật, nhưng cách đặt khung so sánh với AMD EPYC Turin có thể làm người đọc đánh giá lệch nếu chỉ nhìn biểu đồ. Vera là CPU máy chủ tương thích Arm, dùng nhân tùy biến Olympus, được NVIDIA đưa vào câu chuyện hạ tầng cho AI agent. Đối thủ được đem ra so là AMD EPYC Turin, đặc biệt các SKU nhiều nhân như EPYC 9755. Vấn đề chính nằm ở mẫu số, workload mục tiêu và cách gọi “single-thread” khác “single-core”.

AMD EPYC Turin and NVIDIA Vera

Con số gây chú ý nhất là băng thông bộ nhớ trên mỗi nhân: NVIDIA nêu Vera đạt 12,7GB/s mỗi nhân, trong khi EPYC Turin được đặt ở mức 3,1GB/s. Nghe như chênh lệch rất lớn, nhưng ServeTheHome chỉ ra rằng phép chia này dùng 88 nhân ở phía Vera và 128 nhân ở phía EPYC 9755. Nếu chọn EPYC 9655 96 nhân, tức gần hơn với 88 nhân của Vera, tỷ lệ sẽ bớt kịch tính. Ngoài ra Vera là thiết kế 2026 với hệ thống bộ nhớ mới hơn, còn Turin là thế hệ 2024. Khoảng cách băng thông vì vậy có phần đến từ chuyển thế hệ bộ nhớ, số kênh và tốc độ RAM, tương tự các bước nhảy AMD từng có từ Milan DDR4 sang Genoa DDR5.

Điểm thứ hai là độ trễ giữa các nhân. Whitepaper của NVIDIA cho thấy bản đồ latency của EPYC có nhiều vùng đỏ ngoài CCX và CCD, còn Vera có nhiều vùng xanh hơn nhờ thiết kế ít phân mảnh hơn. Điều này đúng về hướng kỹ thuật: chiplet tạo thêm hop, hop tạo thêm độ trễ. Nhưng với workload AI agent chạy trong VM, container hoặc sandbox, mỗi phiên thường dùng khoảng 1 đến 4 nhân. Nếu scheduler đặt đúng, phần việc này nằm gọn trong một CCX của EPYC, tức phần “xanh” của chính bản đồ AMD. Với sandbox một nhân, độ trễ core-to-core gần như không phải nút thắt chính.

NVIDIA Vera whitepaper core to core latency compared to AMD EPYC 9755

Vera vẫn có lợi thế thật trong môi trường kém tối ưu: nếu scheduler phân mảnh một workload 4 nhân ra nhiều vùng xa nhau, kiến trúc nguyên khối hoặc ít hop sẽ dễ ổn định hơn. Nhưng khi so 128 nhân, câu chuyện đảo chiều. Vera chỉ có 88 nhân mỗi socket trong khung so sánh này; muốn đạt 128 nhân phải đi qua socket thứ hai. Lúc đó 40 nhân bổ sung không chỉ vượt qua ranh giới chiplet, mà còn qua liên kết socket-to-socket, thường có độ trễ và jitter cao hơn. Vì vậy lợi thế “latency xanh” của Vera mạnh nhất trong phạm vi 88 nhân, không nên tự động kéo dài cho mọi cấu hình nhiều socket hoặc nhiều node.

Điểm thứ ba cần quản trị viên chú ý là “single-thread” và “single-core” không giống nhau trên CPU có SMT. Một kết quả single-thread trên EPYC là một hardware thread trong hai thread của một core. Một kết quả single-core có thể dùng cả hai thread của core đó. ServeTheHome nhắc rằng SMT trên các CPU mới có thể tăng đáng kể hiệu năng: Zen 5 có thể thêm khoảng 32-33%, Xeon 6 khoảng 29-32%, Sapphire Rapids khoảng 23-25%. Nếu một CPU không có SMT hoặc vendor chọn cách trình bày theo thread, người đọc phải chuẩn hóa lại trước khi kết luận.

SMT performance impact across CPU architectures

Checklist cho đội IT

  • Không so trá»±c tiếp biểu đồ vendor nếu số nhân, socket, thế hệ RAM khác nhau.
  • Vá»›i workload AI agent, Ä‘o theo VM/container/sandbox thá»±c tế: 1, 2, 4 nhân trước khi Ä‘o toàn socket.
  • Kiểm tra NUMA, pinning, scheduler policy và placement trong Kubernetes hoặc hypervisor.
  • Tách benchmark single-thread, single-core, throughput toàn socket và latency tail.
  • Đưa chi phí nền tảng, Ä‘iện năng, phần mềm, driver và khả năng vận hành vào bài toán, không chỉ SPEC CPU2026.

Kết luận: NVIDIA Vera có thể là CPU rất đáng chú ý cho hạ tầng AI agent, đặc biệt khi cần băng thông bộ nhớ cao và topology ít hop trong phạm vi một socket. Nhưng so với AMD EPYC Turin, kết quả cần được chuẩn hóa theo số nhân, SMT, thế hệ bộ nhớ và mô hình triển khai. Nguồn: ServeTheHome, “Normalizing NVIDIA Vera Benchmarks to AMD EPYC Turin A Framework”.

EN: NVIDIA Vera vs AMD EPYC Turin: how to read the benchmark framing

The ServeTheHome source makes a practical point: NVIDIA Vera’s early CPU benchmarks are not necessarily wrong, but the framing can make the gap versus AMD EPYC Turin look larger or simpler than it is. Vera is NVIDIA’s Arm-compatible server CPU with custom Olympus cores, positioned for agentic AI infrastructure. The comparison target is AMD EPYC Turin, including high-core-count parts such as EPYC 9755. The important issues are the denominator used in per-core bandwidth, the real workload shape, and the difference between single-thread and single-core measurements.

NVIDIA’s memory bandwidth per-core figure, 12.7GB/s versus 3.1GB/s, looks dramatic. STH notes that the calculation divides Vera bandwidth by 88 cores, while the AMD side uses 128 cores. A 96-core EPYC 9655 would be closer to Vera’s core count and would make the ratio less dramatic. Vera also represents a newer 2026 memory subsystem, while Turin is a 2024 generation product. Some of the gain is therefore a normal platform-generation effect: more channels, faster memory, and a new I/O generation can move the numerator a lot.

Core-to-core latency is also real but contextual. Chiplets add hops, and hops add latency. However, many agent workloads run inside VMs, containers, or sandboxes using one to four cores. With sane scheduling, those jobs can stay inside one EPYC CCX, where latency is already low. Vera’s monolithic or less fragmented topology is an advantage when placement is poor or when jobs cross boundaries, but the advantage should not be blindly extended beyond one socket. If Vera needs a second socket to reach a 128-core comparison, the extra cores cross socket links, bringing higher latency and jitter.

For administrators, the takeaway is simple: normalize before buying. Test your own container sizes, NUMA policy, SMT behavior, tail latency, power, software stack, and operational support. Vera may be strong for AI-agent runtime infrastructure, but EPYC Turin remains competitive when workloads are scheduled well and compared on equivalent footing. Source: ServeTheHome.