Tin Công Nghệ
Đánh Giá CPU NVIDIA Vera: Kiến Trúc Olympus & Benchmark SPEC CPU 2026
Thị trường phần cứng máy chủ đang bước vào một tuần sôi động. Trước khi các sự kiện lớn như báo cáo tài chính của Intel hay hội nghị Advancing AI của AMD diễn ra, NVIDIA đã nổ phát súng đầu tiên khi công bố hàng loạt thông tin kỹ thuật chuyên sâu về CPU NVIDIA Vera và GPU Rubin.
Đáng chú ý nhất trong đợt công bố này là cuốn whitepaper (sách trắng) kiến trúc hoàn chỉnh dành cho CPU Vera và nhân CPU tùy chỉnh Olympus. Cùng với đó là những số liệu hiệu năng thực tế đầu tiên dựa trên bộ công cụ benchmark tiêu chuẩn ngành SPEC CPU 2026.
NVIDIA Vera là gì?
Đây là lần đầu tiên sau nhiều năm NVIDIA quay trở lại tự thiết kế một vi kiến trúc CPU tùy chỉnh. Điều này biến Vera trở thành mảnh ghép đáng chú ý nhất trong hệ sinh thái Vera Rubin, đánh dấu bước tiến của NVIDIA vào một thị trường CPU enterprise vốn đã rất chật chội với sự góp mặt của Intel, AMD và vô số nhà sản xuất vi xử lý dựa trên Arm.
NVIDIA đang đẩy mạnh việc biến Vera thành một mẫu CPU máy chủ đa năng. Dù không đối đầu trực diện với toàn bộ dải sản phẩm Intel Xeon hay AMD EPYC, NVIDIA muốn Vera xuất hiện phổ biến trong nhiều dạng máy chủ dữ liệu, đặc biệt là các hệ thống phục vụ Agentic AI (AI dạng đại lý).
Trái ngược với dòng chip Grace tiền nhiệm vốn chủ yếu đóng vai trò “môi giới” truyền dữ liệu cho GPU, CPU NVIDIA Vera được thiết kế để trở thành một bộ vi xử lý máy chủ độc lập và toàn diện. Nằm trong chiến lược khi Nvidia ra mắt siêu chip AI Vera Rubin mới nhất, NVIDIA không giấu giếm ý định đưa Vera cạnh tranh trực tiếp ở phân khúc máy chủ cao cấp, đặc biệt là tối ưu cho các khối lượng công việc AI dạng đại lý (Agentic AI).

Bảng so sánh thông số kỹ thuật chi tiết: NVIDIA Grace vs. NVIDIA Vera
| Thông số / Đặc tính | NVIDIA Grace | NVIDIA Vera |
| Nhân CPU (Architecture) | Arm Neoverse V2 | NVIDIA Olympus Cores (Custom) |
| Số nhân (Cores) | 72 cores | 88 cores |
| Số luồng (Threads) | 72 threads | 176 threads (Spatial Multithreading) |
| L2 Cache per core | 1 MB | 2 MB |
| Unified L3 Cache | 114 MB | 164 MB |
| Băng thông RAM | Tối đa 512 GB/s | Tối đa 1.2 TB/s |
| Dung lượng RAM hỗ trợ | Tối đa 480 GB LPDDR5X | Tối đa 1.5 TB LPDDR5X |
| Xử lý Vector (SIMD) | 4x 128b SVE2 | 6x 128b SVE2 (Thêm hỗ trợ FP8) |
| Giao tiếp NVLink-C2C | 900 GB/s | 1.8 TB/s |
| Giao tiếp PCIe / CXL | PCIe Gen5 | PCIe Gen6 / CXL 3.1 |
| Mức tiêu thụ điện (TDP) | 250W | 250W – 450W |
Bóc Tách Chi Tiết Vi Kiến Trúc Nhân NVIDIA Olympus
Thay vì đi theo một hướng đi quá dị biệt như dự án Denver trước đây, NVIDIA thiết kế nhân Olympus tuân theo các nguyên lý xây dựng CPU hiện đại nhưng được mở rộng quy mô (scale up) cực kỳ đồ sộ nhằm đạt chỉ số IPC (Số lệnh/chu kỳ) vượt trội.
Front-End: Tối Ưu Hóa Nạp Lệnh & Giải Mã Lớn
Neural Branch Predictor: Bộ dự đoán rẽ nhánh dựa trên mạng thần kinh (neural network) có khả năng đưa ra 2 nhánh dự đoán mỗi chu kỳ với độ chính xác cao, giảm thiểu tình trạng rẽ nhánh sai (branch misprediction) gây hoãn thi hành lệnh.
Instruction Fetch & Decoder: Khối lấy lệnh có thể nạp tới 16 lệnh (mỗi lệnh 64-bit) vào hàng đợi lệnh (Instruction Queue) có sức chứa 48 lệnh. Từ đây, hàng đợi có thể xuất ra tối đa 10 lệnh hợp nhất (fused instructions) cho bộ giải mã (10-wide decoder).
Bộ nhớ đệm L1: Mỗi nhân Olympus trang bị 64KB 4-way L1 Instruction Cache (gấp đôi dung lượng của AMD Zen 5 và tương đương Intel Cougar Cove) để xử lý các tập lệnh lớn, kết hợp với 96KB 6-way L1 Data Cache ở phần back-end.
Mid-Core: Công Nghệ Thực Thi Ngoài Trình Tự (Out-of-Order) Nâng Cao
Bộ máy thực thi của Olympus có khả năng đổi tên tới 10 micro-ops mỗi chu kỳ, giữ đúng nhịp độ với bộ giải mã 10-wide. Để khai thác tối đa tính song song cấp lệnh (ILP), NVIDIA áp dụng các kỹ thuật tiên tiến:
Memory Renaming (Đổi tên bộ nhớ): Tương tự các thiết kế AMD gần đây, kỹ thuật này đổi tên toàn bộ địa chỉ bộ nhớ để tách biệt các lệnh vốn dĩ phụ thuộc nhau, cho phép Olympus thực thi lệnh phụ thuộc ngay cả trước khi thao tác nạp dữ liệu (load) hoàn tất.
Value Prediction (Dự đoán giá trị): Nhận diện các mô hình lặp lại và đoán trước giá trị ngay cả trước khi nó được tạo ra (sau đó sẽ kiểm tra lại), giúp mở rộng khả năng thực thi đầu cơ.
Move Elimination: Nhận biết và loại bỏ các thao tác di chuyển dữ liệu không cần thiết trong bộ nhớ.
Back-End Đồ Sộ: 18 Đường Ống Thực Thi (Execution Pipes)
Back-end của Olympus được thiết kế rất rộng với 18 đường ống thực thi sắp xếp theo từng cặp (pairwise) — cơ sở quan trọng cho công nghệ đa luồng Partition-based Spatial Multithreading:
8 đường ống Số nguyên (Integer/ALU): Cả 8 đường ống đều xử lý được các phép toán đơn giản (cộng, trừ, logic). Trong đó có 2 đường ống phức tạp xử lý được phép nhân/chia và các thao tác chuyên dụng như CRC, dịch bit. Độ trễ phép toán ALU cơ bản chỉ mất 1 chu kỳ, phép nhân mất từ 2 chu kỳ, và phép chia biến thiên từ 5 đến 20 chu kỳ.
4 đơn vị Rẽ nhánh (Branch Units): Phân bổ đều giữa các đường ống ALU đơn giản và phức tạp.
6 đường ống Vector / SIMD: Mỗi nhân Olympus có thể xử lý đồng thời 6 lệnh vector SVE2 (tăng từ 4 trên Grace), tích hợp thêm định dạng FP8 cho các tác vụ AI. 2 trong số 6 đường ống này có thể đảm nhận các thao tác mã hóa vector (AES, SHA).
4 đường ống Load/Store: Gồm 2 đường ống dùng chung (Load/Store) và 2 đường ống chuyên dụng cho thao tác Load.
Bộ nạp trước dữ liệu dạng đồ thị (Novel Graph Prefetcher): Thiết kế tối ưu cho các cấu trúc dữ liệu kiểu đồ thị (graph) nhiều con trỏ. Graph Prefetcher nhận diện mối quan hệ giữa con trỏ và đích đến, sau đó nạp trước dữ liệu từ địa chỉ bộ nhớ đích trước khi con trỏ thực sự được giải mã.

Mạng Kết Nối Nhất Quán Scalable Coherency Fabric (SCF)
Khác với AMD (chia nhân CPU ra tới cả tá chiplet), NVIDIA gom toàn bộ 88 nhân CPU của Vera lên cùng một vi mạch silicon (monolithic compute die) và chỉ tách riêng phần I/O và bộ điều khiển RAM thành các chiplet chức năng.
Toàn bộ chiplet tính toán Vera được chia thành 4 góc/cụm (quadrants/clusters). Mỗi cụm được neo giữ bởi một Nút chuyển mạch nhất quán (Coherency Switch Node – CSN):
Mỗi CSN kết nối với 2 cụm nhân CPU (mỗi cụm chứa 11 nhân) và 2 khối L3 cache (20.5MB/khối).
Mỗi CSN liên kết với một Nút chuyển mạch Bộ nhớ (MSN) dẫn ra bộ điều khiển RAM LPDDR5X tương ứng, và một Nút chuyển mạch Cầu (BSN) dẫn ra các giao tiếp I/O.
Băng thông nội bộ: Mạng SCF đạt băng thông 3.4 TB/s nội bộ (gấp 2.8 lần băng thông bộ nhớ ngoài 1.2 TB/s).
Độ trễ giao tiếp (Core-to-Core Latency): Thiết kế cho phép các nhân CPU truy cập cache L2 hoặc MSN của cụm khác mà không chịu phạt độ trễ lớn. Phân nửa các cặp nhân có thể giao tiếp với nhau trong khoảng 40ns, và chỉ rất ít cặp nhân vượt quá ngưỡng 80ns.
Phân Tích Hiệu Năng Benchmark SPEC CPU 2026
NVIDIA đã công bố kết quả đo kiểm ước tính trên hệ thống Dual-Socket Vera tiền sản xuất bằng bộ công cụ SPEC CPU 2026, so sánh trực tiếp với AMD EPYC 9755 “Turin”.
Lưu ý về đối tượng so sánh: AMD EPYC 9755 là chip 128 nhân Zen 5 tối ưu cân bằng điện năng (boost 4.1GHz, TDP 500W), không phải dòng chuyên đơn nhân (như dòng EPYC F-suffix boost 5.0GHz) hay dòng tối ưu tổng năng suất đa nhân (như EPYC Turin Dense 192 nhân).
Hiệu Năng Đơn Luồng (Single-Threaded): Nhân Olympus Áp Đảo
Nhờ thiết kế IPC cực lớn, Vera áp đảo AMD EPYC 9755 trong tất cả các bài kiểm tra số nguyên đơn luồng (SPECrate2026_int 1T):
Tăng từ 1.9x đến 2.4x số thao tác nạp lệnh/chu kỳ (Instruction Fetch Ops/Cycle).
Tăng từ 2.3x đến 4.3x số thao tác xử lý back-end/chu kỳ.
Trong thuật toán duyệt đồ thị Google PageRank, hiệu năng của Vera mở rộng tới 29.3 lần khi chạy 32 nhân, trong khi hệ thống AMD EPYC bị khựng lại ở mức tăng hơn 10 lần.
Điểm Yếu Đa Nhân: Tổng Năng Suất (Multi-Core Throughput) Hạn Chế
Do chỉ sở hữu 88 nhân, bài kiểm tra tổng năng suất toàn chip (SPECrate2026_int_base nT) cho thấy hạn chế của Vera:
Hệ thống Vera Dual-Socket đạt 925 điểm, chỉ nhỉnh hơn 3% so với mức 898 điểm của EPYC 9755 tiêu chuẩn.
Nếu so với các hệ thống EPYC 9755 sử dụng trình biên dịch tối ưu của AMD (đạt >1000 điểm) hoặc dòng Turin Dense EPYC 99×5 (đạt >1200 điểm), Vera hoàn toàn lép vố về tổng năng suất xử lý đa nhiệm.

Đánh Giá Tổng Kết: Cơ Hội Và Thách Thức Cho NVIDIA Vera
Tài liệu kỹ thuật của NVIDIA đã làm rõ triết lý thiết kế của CPU Vera: Tối ưu hóa tối đa hiệu năng đơn nhân (IPC) phục vụ xử lý thuật toán AI phức tạp thay vì chạy đua số lượng nhân để lấy năng suất thô (Throughput).
Điểm mạnh: Kiến trúc nhân Olympus cực kỳ ấn tượng, băng thông nội bộ lớn, nạp trước đồ thị tiên tiến, hiệu năng đơn luồng vượt trội. Đây là bước nhảy vọt toàn diện so với Grace.
Thách thức: Số lượng 88 nhân khiến Vera thua thiệt trước các dòng CPU máy chủ nhiều nhân hiện tại (như EPYC Turin Dense hay Intel Xeon 6+ Clearwater Falls). Ngoài ra, khi Vera thương mại hóa rộng rãi, nó sẽ phải đối đầu trực tiếp với thế hệ AMD EPYC “Venice” (Zen 6) sắp ra mắt với 256 nhân, RAM server DDR5 16 kênh và băng thông vượt trội.
NVIDIA Vera không phải là một CPU phổ thông được tạo ra để lật đổ AMD hay Intel ở mọi ngóc ngách máy chủ. Mục tiêu tối thượng của Vera là trở thành một mắt xích hoàn hảo trong hệ sinh thái Vera Rubin, giúp NVIDIA duy trì thế chủ động tuyệt đối trong các hạ tầng máy chủ AI đại lý thế hệ mới.
Theo dõi và cập nhật thông tin công nghệ mới nhất cùng Máy Chủ Việt.
Nguồn: ServeTheHome

