0867.111.333

Icon Icon Icon

Tin Công Nghệ

Giải Mã AMD Instinct MI455X: Bước Tiến Đột Phá Với Kiến Trúc CDNA 5

80 19/08/2026

AMD Instinct MI455X đánh dấu một trong những thay đổi kiến trúc lớn nhất của dòng GPU tăng tốc máy chủ AMD trong hơn một thập kỷ. Thay vì chỉ tăng số đơn vị tính toán, AMD làm mới gần như toàn bộ nền tảng với CDNA 5, tiến trình TSMC N2, HBM4, đóng gói CoWoS-L và hệ thống I/O dành cho các cụm AI quy mô rack.

Điểm đáng chú ý là AMD Instinct MI455X không chỉ nhắm đến nhiều FLOPS hơn. Kiến trúc mới tập trung đồng thời vào độ trễ lệnh, băng thông bộ nhớ và tốc độ liên kết giữa nhiều GPU – những yếu tố ngày càng quan trọng khi training và inference phải xử lý các mô hình AI lớn.

AMD Instinct MI455X thay đổi mạnh từ bên trong với CDNA 5

CDNA 5 là bước AMD rời xa nền tảng GCN/GFX9 đã tồn tại trong các thế hệ GPU máy chủ chính hãng suốt nhiều năm. Thay đổi quan trọng nhất nằm ở cách GPU tổ chức và thực thi luồng lệnh.

Các thế hệ trước sử dụng Wave64 kết hợp SIMD16. Một wavefront gồm 64 thread phải đi qua SIMD 16 lane trong bốn chu kỳ. Với CDNA 5, AMD chuyển sang Wave32 và SIMD32, cho phép một wavefront 32 thread được xử lý trong một chu kỳ.

Cách tổ chức mới mang lại ba lợi ích chính:

    • Giảm độ trễ khi thực thi lệnh vector.
    • Dễ duy trì mức sử dụng SIMD cao hơn.
    • Tăng lượng công việc xử lý trong mỗi chu kỳ.

AMD Instinct MI455X với kiến trúc CDNA 5 thế hệ mớiĐây là lý do AMD Instinct MI455X có thể tăng gấp đôi thông lượng vector dù vẫn giữ 256 Workgroup Processor như MI355X. Mỗi WGP mạnh hơn nhờ SIMD rộng hơn và các khối matrix được nâng cấp.

Ở các phép toán AI quan trọng, AMD cho biết CDNA 5 có thể tăng thông lượng matrix FP4 và FP8 lên tới 4 lần so với thế hệ trước, trong khi phần lớn định dạng khác đạt mức tăng tối đa khoảng 2 lần. Một GPU có thể đạt hơn 40 PFLOPS tensor FP4 dạng dense và khoảng 315 TFLOPS vector FP32.

Matrix unit còn hỗ trợ fractional scaling cho MXFP4 nhằm giảm sai số lượng tử hóa khi huấn luyện FP4. Vector unit bổ sung BF16, còn khối transcendental math được tăng gấp đôi thông lượng.

Những thay đổi này cho thấy mục tiêu của AMD Instinct MI455X không phải chỉ tăng một chỉ số benchmark, mà là cải thiện khả năng xử lý cả tensor lẫn vector trong pipeline AI thực tế.

Chiplet N2 và CoWoS-L tạo nền tảng cho 320 tỷ transistor

AMD tiếp tục theo đuổi thiết kế chiplet nhưng tổ chức lại rõ rệt. AMD Instinct MI455X gồm 8 XCD chuyên xử lý tính toán đặt trên 2 Fabric and Cache Die (FCD), trong khi 2 I/O Die đảm nhiệm giao tiếp ra ngoài chip.

Cách bố trí này cho phép AMD dùng tiến trình phù hợp với từng nhóm chức năng:

    • XCD sử dụng TSMC N2 2nm.
    • FCD sử dụng TSMC N3P.
    • IOD sử dụng TSMC N3P.
    • Tổng thiết kế đạt khoảng 320 tỷ transistor, tăng 72% so với thế hệ trước.

XCD chứa các khối compute cần hiệu năng cao nhất. FCD giữ Infinity Fabric, bộ điều khiển HBM và cache L2, còn IOD tập trung SerDes, UAL, xGMI và PCIe Gen6.

Một thay đổi lớn khác là việc chuyển từ CoWoS-S sang CoWoS-L. Thay vì cần một interposer silicon rất lớn dưới toàn bộ package, CoWoS-L dùng các vùng silicon interconnect cục bộ để nối các die. Điều này giúp AMD dễ mở rộng package khi số chiplet và HBM tăng.

Với AMD Instinct MI455X, CoWoS-L phải kết nối 8 XCD, 2 FCD, 2 IOD và 12 stack HBM4. Thiết kế chiplet vì vậy không chỉ giúp tăng mật độ tính toán mà còn cho phép AMD linh hoạt tái sử dụng một số thành phần trên các sản phẩm Instinct khác nhau.

HBM4 432GB giúp AMD Instinct MI455X giải bài toán dữ liệu của AI

Nếu CDNA 5 làm mới phần tính toán thì HBM4 là bước nâng cấp lớn ở phía data. AMD Instinct MI455X sử dụng 12 stack HBM4, nhiều hơn 4 stack so với MI355X dùng HBM3e.

Mỗi stack có dung lượng 36GB, đưa tổng bộ nhớ cục bộ lên 432GB. HBM4 cũng tăng bus của mỗi stack từ 1024-bit lên 2048-bit. Với 12 stack, GPU sở hữu bus bộ nhớ hiệu dụng rộng 24.576 bit và đạt băng thông khoảng 23,3TB/s, gần 2,9 lần MI355X.

Các thông số nổi bật gồm:

    • 12 stack HBM4.
    • Tổng dung lượng 432GB.
    • Bus bộ nhớ hiệu dụng 24.576 bit.
    • Băng thông khoảng 23,3TB/s.
    • Bộ nhớ chia đều cho hai FCD.

12 stack HBM4 cung cấp dung lượng và băng thông cực lớnDung lượng lớn giúp AMD Instinct MI455X giữ nhiều trọng số mô hình, KV cache và dữ liệu trung gian hơn ngay trên accelerator. Băng thông cao giúp dữ liệu đến các matrix/vector unit nhanh hơn, hạn chế tình trạng năng lực tính toán phải chờ bộ nhớ.

AMD cũng cho phép GPU hoạt động như một NUMA domain duy nhất hoặc chia thành hai NUMA domain để mỗi FCD ưu tiên vùng bộ nhớ gần hơn. Thiết bị còn có thể phân vùng tới từng XCD, tối đa 8 thiết bị độc lập và cách ly.

Với hạ tầng AI dùng chung, khả năng này giúp AMD Instinct MI455X linh hoạt hơn khi cần phân bổ tài nguyên cho nhiều workload.

Cache và luồng dữ liệu được thiết kế lại để giảm độ trễ

CDNA 5 thay đổi cả cách dữ liệu di chuyển bên trong GPU. Trên AMD Instinct MI455X, lớp cache L2 cũ trên XCD được loại bỏ, còn Infinity Cache trên FCD trở thành L2 chính của chip.

Tổng dung lượng L2 giảm từ 256MB trên MI355X xuống 192MB, chia thành 96MB trên mỗi FCD. Dù nhỏ hơn, băng thông L2 đạt khoảng 54TB/s, gấp 3 lần thế hệ trước.

Mỗi WGP chỉ truy cập L2 thuộc FCD của mình. Cách tổ chức này giúp giảm chi phí đồng bộ và cải thiện atomic operation. Local Data Store cũng tăng từ 160KB lên 320KB, gồm 256KB dữ liệu cục bộ và 64KB vector cache để giữ nhiều dữ liệu gần compute unit hơn.

Một broadcast arbitrator mới cho phép một lần đọc được multicast đến nhiều WGP trong cùng shader engine. Với AI, nhiều đơn vị tính toán có thể dùng chung weight hoặc activation mà không tạo ra hàng loạt yêu cầu đọc trùng lặp.

Tensor Data Mover cũng được nâng cấp để chuyển dữ liệu giữa LDS và DRAM mà không nhất thiết phải đi qua register file. Nhờ vậy, AMD Instinct MI455X giảm overhead di chuyển dữ liệu và dành nhiều tài nguyên compute hơn cho phép toán chính.

Đây là điểm quan trọng của CDNA 5: hiệu năng không chỉ đến từ nhiều ALU hơn, mà còn từ việc giảm thời gian các ALU phải chờ dữ liệu.

UALink và PCIe Gen6 biến AMD Instinct MI455X thành GPU cho rack-scale AI

Trong hệ thống AI lớn, hàng chục accelerator phải trao đổi dữ liệu liên tục. Vì vậy, I/O là một trong những thay đổi quan trọng nhất của AMD Instinct MI455X. AMD trang bị IOD riêng với UALink, UAL over Ethernet, PCIe Gen6 và xGMI. Tổng băng thông liên kết hai chiều của một chip đạt khoảng 4,6TB/s.

Một số thông số đáng chú ý:

    • 36 liên kết UALoE, mỗi liên kết 400Gbps.
    • Tổng UALoE hai chiều khoảng 3,6TB/s.
    • Cấu hình UALink đạt tổng 384GB/s.
    • PCIe Gen6 dưới dạng hai liên kết x16, tổng 256GB/s.
    • xGMI cung cấp 128GB/s giữa GPU và host CPU.

AMD Instinct MI455X trong nền tảng AI rack-scale HeliosxGMI trên thế hệ này đảm nhiệm kết nối CPU-GPU có tính nhất quán bộ nhớ cache. Trong Helios, AMD Instinct MI455X kết hợp với CPU server EPYC Venice và hạ tầng mạng Pensando để hình thành kiến trúc rack-scale thống nhất.

Sự kết hợp giữa GPU, CPU AMD EPYC và mạng tốc độ cao giúp Helios mở rộng tới 72 GPU trong một scale-up domain, thay vì mô hình 8 GPU của MI355X.

Các DMA engine cũng được chia thành front-end và backend. Backend có thể tự xử lý việc di chuyển dữ liệu giữa các node, giảm lượng công việc lập trình viên phải quản lý thủ công. Ở cấp độ phần mềm, cả cụm rack có thể được nhìn gần hơn như một hệ thống lớn thay vì hàng chục GPU rời rạc.

Đây là lý do AMD Instinct MI455X cần được đánh giá như một thành phần của Helios chứ không chỉ là accelerator độc lập.

AMD Instinct MI455X mở ra giai đoạn mới cho GPU AI của AMD

Bước tiến của AMD Instinct MI455X không nằm ở một thay đổi riêng lẻ. AMD đã đồng thời nâng cấp compute, memory, cache, packaging và networking để giải quyết những giới hạn xuất hiện khi AI chuyển từ cấp độ server sang rack-scale.

Các nâng cấp nổi bật gồm:

    • Wave32 + SIMD32 thay cho Wave64 + SIMD16.
    • 256 WGP với thông lượng trên mỗi WGP cao hơn.
    • Chiplet N2 trong thiết kế khoảng 320 tỷ transistor.
    • CoWoS-L để mở rộng số lượng die và HBM.
    • 432GB HBM4 với băng thông 23,3TB/s.
    • L2 192MB với băng thông khoảng 54TB/s.
    • UALink, UALoE, PCIe Gen6 và xGMI.
    • Khả năng tham gia miền 72 GPU trên nền tảng Helios.

Điểm đánh đổi dễ thấy là yêu cầu hạ tầng. Một nền tảng sử dụng AMD Instinct MI455X cần được thiết kế đồng bộ về máy chủ, mạng, nguồn điện, làm mát và lưu trữ để GPU có thể phát huy đúng năng lực. Với môi trường AI quy mô lớn, chỉ đầu tư accelerator mạnh nhưng thiếu băng thông mạng hoặc khả năng cấp dữ liệu sẽ dễ tạo ra nút thắt cho toàn hệ thống.

Xét trên phương diện kiến trúc, AMD Instinct MI455X là một dấu mốc lớn khi CDNA 5 đưa Instinct sang mô hình thực thi mới, đồng thời nâng mạnh băng thông bộ nhớ và khả năng liên kết giữa nhiều GPU. Đây cũng là lý do doanh nghiệp khi xây dựng hạ tầng AI cần đánh giá toàn bộ kiến trúc thay vì chỉ tập trung vào GPU. Máy Chủ Việt có thể hỗ trợ tư vấn cấu hình máy chủ, mạng, lưu trữ và hạ tầng phù hợp với workload AI thực tế.

Theo dõi và cập nhật thông tin công nghệ mới nhất cùng Máy Chủ Việt. 

Nguồn: Serverthehome.

CHIA SẺ BÀI VIẾT

Icon Icon Icon
Đề nghị báo giá ngay
Chat qua zalo
Chat qua Facebook
Gọi ngay: 0867111333

Yêu Cầu Báo Giá

Họ và tên*

Số điện thoại*

Email*

Địa chỉ*

Ghi chú

Đã gửi thành công!