0867.111.333

Icon Icon Icon

Tin Công Nghệ

AMD Helios: Siêu rack AI 72 GPU MI455X, 31TB HBM4 và mạng 260TB/s

77 10/08/2026

AMD Helios đánh dấu bước chuyển quan trọng trong chiến lược AI của AMD khi CPU, GPU, DPU và mạng tốc độ cao không còn được xem là những linh kiện riêng lẻ. Toàn bộ hệ thống được tích hợp ở cấp độ rack, tạo thành nền tảng AI với 72 GPU Instinct MI455X, 31TB HBM4 và hiệu năng lên tới 2,9 EFLOPS FP4.

AMD Helios là gì?

AMD Helios là nền tảng rack-scale AI dành cho trung tâm dữ liệu thế hệ mới. Thay vì chỉ cung cấp GPU hoặc một máy chủ tám accelerator, AMD xây dựng cả rack thành một hệ thống hoàn chỉnh, bao gồm CPU EPYC, GPU Instinct, NIC/DPU Pensando, mạng scale-up, scale-out, nguồn điện và làm mát bằng chất lỏng.

Một rack Helios tích hợp 72 GPU AMD Instinct MI455X cùng các CPU EPYC 9006 “Venice”. AMD công bố hệ thống đạt tối đa 2,9 EFLOPS FP4 và 1,4 EFLOPS FP8, hướng trực tiếp tới huấn luyện mô hình nền tảng và inference AI quy mô lớn.

Cách tiếp cận này đưa AMD vào cuộc cạnh tranh rack-scale, nơi hiệu năng GPU đơn lẻ chỉ là một phần của bài toán. Yếu tố quyết định ngày càng nằm ở khả năng truyền dữ liệu giữa hàng chục accelerator với độ trễ thấp và băng thông ổn định.

AMD Helios

AMD Helios

72 GPU MI455X cung cấp tới 31TB HBM4

Mỗi Instinct MI455X được trang bị 432GB HBM4. Nhân với 72 GPU, một rack Helios sở hữu khoảng 31TB bộ nhớ HBM4.

Băng thông bộ nhớ còn đáng chú ý hơn. Thông số được AMD công bố cho cấu hình rack đạt tới 23,3TB/s trên mỗi GPU, đưa tổng băng thông HBM4 lên xấp xỉ 1,7PB/s.

Dung lượng bộ nhớ lớn đặc biệt quan trọng với các mô hình AI hàng trăm tỷ hoặc nghìn tỷ tham số. Một lượng model weight và KV cache lớn hơn có thể nằm trực tiếp trên bộ nhớ accelerator, hạn chế việc phải liên tục chuyển dữ liệu từ RAM hệ thống hoặc thiết bị lưu trữ.

Bên trong mỗi compute tray của AMD Helios

Helios sử dụng 18 compute tray. Mỗi tray gồm một CPU EPYC Venice 96 nhân kết hợp bốn Instinct MI455X. Như vậy, thiết kế phân bổ một CPU cho bốn GPU.

CPU còn đi kèm 16 khe RDIMM được lắp đầy bằng module DDR5 ECC 64GB, cho tổng cộng 1TB RAM trên mỗi compute tray. ServeTheHome ghi nhận băng thông bộ nhớ CPU đạt khoảng 1,6TB/s.

Mỗi tray đồng thời có AMD Pensando Vulcano AI NIC cho mạng backend, Salina 400 DPU cho front-end và năm khe E1.S phục vụ lưu trữ cục bộ.

Điều đáng chú ý là Helios không đơn thuần ghép nhiều máy chủ GPU vào một rack. Mạng giữa các accelerator được thiết kế ngay từ đầu để biến toàn bộ 72 GPU thành một miền tính toán quy mô lớn.

AMD Helios

AMD Helios

Broadcom Tomahawk 6 trở thành mắt xích quan trọng

Một trong những chi tiết thú vị nhất của AMD Helios là sự xuất hiện của Broadcom Tomahawk 6.

Helios có sáu switch tray, mỗi tray chứa hai ASIC Tomahawk 6. Broadcom thiết kế Tomahawk 6 với năng lực chuyển mạch tối đa 102,4Tbps, hỗ trợ 512 lane 200Gbps và được tối ưu cho cả mạng AI scale-up lẫn scale-out.

AMD sử dụng UALoE – UALink over Ethernet trên Helios. Thay vì chờ các switch UALink chuyên dụng, hãng truyền giao thức scale-up qua nền tảng Ethernet tốc độ cao hiện có.

Đây là một lựa chọn thực dụng. AMD có thể tận dụng hệ sinh thái Ethernet đã trưởng thành, trong khi vẫn xây dựng kết nối GPU phù hợp với kiến trúc UALink.

Vì sao Helios vẫn dùng nhiều cáp đồng?

Mạng scale-up bên trong Helios chủ yếu sử dụng kết nối copper thay vì optical.

Ở khoảng cách ngắn trong một rack, cáp đồng có lợi thế về chi phí và điện năng. Tomahawk 6 cũng được Broadcom thiết kế với 200G SerDes có khả năng kéo dài phạm vi của passive copper, giúp giảm nhu cầu sử dụng transceiver quang.

Quang học vẫn sẽ đóng vai trò ngày càng lớn khi các hệ thống AI mở rộng khoảng cách, nhưng Helios cho thấy copper chưa biến mất khỏi những rack AI có mật độ cực cao.

Mạng scale-up 260TB/s biến 72 GPU thành một pod

AMD công bố tổng băng thông scale-up đạt 260TB/s. Mỗi MI455X có 36 liên kết UALoE và được kết nối tới hệ thống switch để GPU bất kỳ chỉ cách GPU khác tối đa một switch hop.

Đáng chú ý, topology được thiết kế để khoảng cách logic giữa các GPU đồng đều. GPU trong cùng compute tray cũng không được tạo một “đường tắt” đặc biệt so với GPU ở tray khác.

Mục tiêu là giảm vấn đề locality: phần mềm có thể nhìn 72 accelerator như một pool tài nguyên đồng nhất hơn thay vì phải tối ưu quá nhiều theo vị trí vật lý của từng GPU.

Bên cạnh scale-up trong rack, Helios có 43TB/s băng thông scale-out để kết nối nhiều rack thành cụm AI lớn hơn.

Một rack có thể tiêu thụ tới 245kW

Hiệu năng khổng lồ đi kèm yêu cầu hạ tầng tương ứng.

Helios sử dụng chuẩn Open Rack Wide rộng khoảng 120cm, với 18 compute tray, sáu switch tray, hệ thống nguồn và mạng được tích hợp dày đặc. Điện năng được phân phối qua busbar 50V.

ServeTheHome cho biết hệ thống làm mát bằng chất lỏng phải xử lý tới 245kW nhiệt, với lưu lượng coolant khoảng 385 lít/phút. Con số này cho thấy triển khai Helios không chỉ là mua một rack máy chủ server mới; trung tâm dữ liệu cũng cần hạ tầng điện và làm mát phù hợp.

AMD thiết kế Helios để tiếp tục hoạt động khi phần cứng lỗi

Với hàng chục GPU, switch, NIC và nhiều thành phần khác, lỗi phần cứng là điều không thể tránh khỏi ở quy mô vận hành lớn.

AMD giải quyết vấn đề này bằng nhiều lớp redundancy. Nếu một đường mạng hoặc switch tray gặp sự cố, lưu lượng có thể được chuyển sang các switch còn lại. Rack vẫn hoạt động nhưng tổng băng thông sẽ giảm.

Helios cũng có thể được chia thành nhiều virtual pod (vPod). Nếu một compute tray gặp lỗi nghiêm trọng, sự cố có thể được cô lập trong vPod tương ứng thay vì khiến toàn bộ rack ngừng hoạt động.

Khả năng chịu lỗi này quan trọng với AI training, bởi một job quy mô lớn có thể chạy trong nhiều giờ hoặc nhiều ngày. Việc phải khôi phục từ checkpoint sau mỗi lỗi phần cứng sẽ gây lãng phí đáng kể tài nguyên GPU.

AMD Helios

AMD Helios

Helios không còn chỉ là bản thiết kế

Helios đang chuyển từ roadmap sang sản phẩm thương mại. Microsoft đã xác nhận kế hoạch triển khai hệ thống trên Azure cho frontier model inference và các dịch vụ Azure AI. AMD cho biết Helios bắt đầu được giao cho khách hàng trong nửa cuối năm 2026.

AMD đồng thời xây dựng nhịp nâng cấp rack-scale hằng năm. Thế hệ Helios 500 dự kiến sử dụng GPU Instinct MI500, CPU EPYC “Verano” và mạng Pensando Como/Monza.

Điều này cho thấy AMD không xem Helios là một dự án đơn lẻ mà là nền móng cho dòng sản phẩm AI rack-scale dài hạn.

Bên cạnh việc mở rộng hạ tầng AI quy mô lớn với Helios, AMD ra mắt Ryzen Embedded AI X100: Bước tiến vào thị trường Physical AI, nền tảng hướng tới robot, hệ thống công nghiệp và thiết bị AI vận hành trực tiếp trong môi trường thực tế.

Câu hỏi thường gặp về AMD Helios

AMD Helios có bao nhiêu GPU?

Một rack Helios hoàn chỉnh có 72 GPU AMD Instinct MI455X, bố trí trong 18 compute tray.

AMD Helios có bao nhiêu bộ nhớ HBM4?

Tổng dung lượng đạt khoảng 31TB HBM4, với 432GB trên mỗi MI455X.

AMD Helios mạnh bao nhiêu?

AMD công bố tối đa 2,9 EFLOPS FP4 và 1,4 EFLOPS FP8 cho một rack.

Broadcom đóng vai trò gì trong AMD Helios?

Helios sử dụng Broadcom Tomahawk 6 làm switch ASIC cho mạng scale-up UALoE, kết nối 72 GPU trong rack.

Kết luận

AMD Helios cho thấy cuộc đua AI đang chuyển từ GPU sang thiết kế toàn hệ thống. 72 Instinct MI455X và 31TB HBM4 tạo nên sức mạnh tính toán, nhưng yếu tố giúp Helios trở thành một nền tảng rack-scale thực sự lại nằm ở kiến trúc mạng.

Việc kết hợp UALoE với Broadcom Tomahawk 6 cho phép AMD xây dựng mạng scale-up 260TB/s, đồng thời tận dụng hệ sinh thái Ethernet thay vì phụ thuộc hoàn toàn vào một interconnect độc quyền.

Với Microsoft chuẩn bị triển khai Helios trên Azure và Helios 500 đã nằm trong roadmap, nền tảng này có thể trở thành một trong những vũ khí quan trọng nhất của AMD trong cuộc cạnh tranh hạ tầng AI quy mô lớn từ năm 2026 trở đi.

Theo dõi và cập nhật thông tin công nghệ mới nhất cùng Máy Chủ Việt.

CHIA SẺ BÀI VIẾT

Icon Icon Icon
Đề nghị báo giá ngay
Chat qua zalo
Chat qua Facebook
Gọi ngay: 0867111333

Yêu Cầu Báo Giá

Họ và tên*

Số điện thoại*

Email*

Địa chỉ*

Ghi chú

Đã gửi thành công!