Amazon dùng chip wafer-scale Cerebras tăng tốc AI trên AWS

AWS sẽ đưa bộ xử lý Cerebras vào các trung tâm dữ liệu của mình theo thỏa thuận nhiều năm nhằm tăng tốc AI inference, đặc biệt ở bước “decode”, để cải thiện tốc độ phản hồi cho các ứng dụng thời gian thực.

Hợp tác này giúp AWS tối ưu cách mô hình AI trả lời prompt, viết mã và xử lý yêu cầu trực tiếp của người dùng. Trọng tâm là triển khai công nghệ Cerebras (gồm Wafer-Scale Engine) cho suy luận trong hệ sinh thái Amazon Bedrock ngay داخل hạ tầng AWS.

NỘI DUNG CHÍNH
  • AWS triển khai hệ thống Cerebras trong data center để tăng tốc AI inference cho Bedrock.
  • AWS tách inference thành “prefill” và “decode”, dùng Trainium cho prefill và Cerebras CS-3 cho decode.
  • Thỏa thuận củng cố chiến lược chip AI nội bộ Trainium, gia tăng cạnh tranh với Nvidia và các hãng khác.

AWS tích hợp Cerebras vào trung tâm dữ liệu để tăng tốc AI inference

AWS sẽ đặt hệ thống Cerebras trong data center của mình và dùng chúng cho các tác vụ AI inference, nhắm đến tốc độ phản hồi nhanh hơn cho các ứng dụng như trợ lý lập trình và ứng dụng tương tác.

AWS cho biết hợp tác nhiều năm này tập trung vào AI inference, tức giai đoạn mô hình tạo ra câu trả lời sau khi đã được huấn luyện. Theo mô tả, AWS sẽ sử dụng công nghệ Cerebras, bao gồm Wafer-Scale Engine, để tăng tốc khâu suy luận.

Các bên không công bố điều khoản tài chính. Việc triển khai được lên kế hoạch cho Amazon Bedrock trong các trung tâm dữ liệu AWS, nghĩa là phần cứng Cerebras sẽ trở thành một phần của hạ tầng phục vụ sản phẩm AI chủ lực này.

AWS cho biết kiến trúc sẽ kết hợp máy chủ chạy Amazon Trainium, hệ thống Cerebras CS-3 và kết nối mạng Amazon Elastic Fabric Adapter (EFA) để phục vụ yêu cầu inference trong môi trường cloud.

AWS sẽ cung cấp mô hình mã nguồn mở và Amazon Nova trên phần cứng Cerebras

AWS dự kiến cuối năm nay sẽ chạy các mô hình ngôn ngữ lớn mã nguồn mở hàng đầu và Amazon Nova trên phần cứng Cerebras để mở rộng lựa chọn triển khai inference cho khách hàng.

David Brown, Phó chủ tịch Compute & ML Services tại AWS, nhấn mạnh nút thắt lớn của AI inference là tốc độ, đặc biệt với khối lượng công việc đòi hỏi phản hồi thời gian thực như hỗ trợ viết mã và ứng dụng tương tác.

“Inference là nơi AI mang lại giá trị thực cho khách hàng, nhưng tốc độ vẫn là nút thắt quan trọng đối với các workload đòi hỏi cao như hỗ trợ lập trình thời gian thực và các ứng dụng tương tác.”
– David Brown, Phó chủ tịch Compute & ML Services, AWS

AWS tách “prefill” và “decode” để tối ưu tốc độ suy luận

AWS áp dụng “inference disaggregation” bằng cách tách suy luận thành hai giai đoạn: xử lý prompt (prefill) và tạo đầu ra (decode), rồi phân công phần cứng khác nhau cho từng giai đoạn.

Đọc thêm:  Tiền crypto rót 72 triệu USD vào Reform UK trong hai ngày

AWS mô tả prefill có tính song song cao, nặng về tính toán và cần băng thông bộ nhớ ở mức vừa phải. Ngược lại, decode mang tính tuần tự, ít nặng về tính toán hơn nhưng phụ thuộc mạnh vào băng thông bộ nhớ.

Trong nhiều trường hợp, decode chiếm phần lớn thời gian vì mỗi token đầu ra phải được tạo lần lượt từng bước. Vì vậy, AWS gán Trainium xử lý prefill và Cerebras CS-3 xử lý decode để tăng thông lượng và giảm độ trễ.

EFA kết nối Trainium và CS-3 để vận hành như một dịch vụ thống nhất

AWS dùng mạng EFA có độ trễ thấp, băng thông cao để kết nối phần “prefill” và “decode”, giúp hai hệ thống hoạt động như một dịch vụ inference thống nhất dù chạy trên phần cứng khác nhau.

AWS cho biết EFA là lớp kết nối then chốt để đồng bộ luồng dữ liệu giữa Trainium và CS-3, đảm bảo mỗi bộ xử lý tập trung vào phần việc phù hợp nhất mà không làm tăng độ trễ tổng thể.

“Điều chúng tôi xây dựng cùng Cerebras giải quyết vấn đề đó: bằng cách tách workload inference giữa Trainium và CS-3, rồi kết nối chúng bằng Amazon Elastic Fabric Adapter, mỗi hệ thống làm tốt nhất phần việc của mình. Kết quả sẽ là inference nhanh hơn theo bậc độ lớn và hiệu năng cao hơn những gì hiện có hôm nay.”
– David Brown, Phó chủ tịch Compute & ML Services, AWS

Hệ thống chạy trên AWS Nitro để giữ nguyên bảo mật và khả năng cô lập

Dịch vụ sẽ chạy trên AWS Nitro System, nhằm duy trì bảo mật, cô lập và tính nhất quán tương tự các dịch vụ cloud hiện có của AWS cho cả Trainium và Cerebras CS-3.

Đọc thêm:  Kamino bổ nhiệm Michael Weisz làm CEO, chuyển hướng sang tín dụng RWA

AWS cho biết Nitro là lớp nền tảng hạ tầng cloud của hãng. Do đó, các hệ thống Cerebras CS-3 và các instance dùng Trainium được kỳ vọng vận hành theo cùng tiêu chuẩn kiểm soát, tách biệt tài nguyên và chính sách mà khách hàng AWS đã quen sử dụng.

AWS tăng tốc chiến lược Trainium để cạnh tranh GPU của Nvidia và các hãng khác

Thỏa thuận giúp AWS có thêm lợi thế để thúc đẩy chip AI nội bộ Trainium như một lựa chọn về hiệu năng mở rộng và tối ưu chi phí cho cả huấn luyện và inference, cạnh tranh với Nvidia, AMD và các nhà sản xuất khác.

Trong thông báo, AWS mô tả Trainium là chip AI “in-house” tối ưu cho khả năng mở rộng và hiệu quả chi phí. Xem chi tiết tại thông báo của AWS về hợp tác với Cerebras.

AWS cho biết có hai phòng thí nghiệm AI lớn đã cam kết sử dụng. Anthropic gọi AWS là đối tác huấn luyện chính và dùng Trainium để huấn luyện cũng như triển khai mô hình. OpenAI sẽ tiêu thụ 2 gigawatt năng lực Trainium thông qua hạ tầng AWS cho Stateful Runtime Environment, các mô hình frontier và các workload nâng cao khác.

AWS cũng nói Trainium3 ghi nhận mức độ tiếp nhận mạnh kể từ khi phát hành gần đây, với khách hàng đa ngành cam kết dung lượng lớn.

Cerebras CS-3 nhắm đến tăng tốc “decode” và token đầu ra

Cerebras CS-3 được AWS dùng cho giai đoạn decode, nhằm tăng tốc tạo token đầu ra, đặc biệt khi các mô hình suy luận tạo nhiều token hơn cho mỗi yêu cầu.

AWS cho biết CS-3 tập trung vào tăng tốc decode, giúp tạo token nhanh hơn. Cerebras tuyên bố CS-3 là hệ thống AI inference nhanh nhất thế giới và cung cấp băng thông bộ nhớ cao hơn “hàng nghìn lần” so với GPU nhanh nhất.

Cerebras nhận định các mô hình thiên về “reasoning” đang chiếm tỷ trọng lớn hơn trong khối lượng inference và thường tạo nhiều token hơn khi giải quyết vấn đề. Cerebras cũng cho biết OpenAI, Cognition, Mistral và các bên khác đang dùng hệ thống của hãng cho các workload yêu cầu cao, đặc biệt là agentic coding.

“Hợp tác với AWS để xây dựng giải pháp inference phân rã sẽ mang inference nhanh nhất đến một tập khách hàng toàn cầu.”
– Andrew Feldman, Nhà sáng lập kiêm CEO, Cerebras Systems

“Mọi doanh nghiệp trên toàn thế giới sẽ có thể hưởng lợi từ inference nhanh vượt trội ngay trong môi trường AWS hiện có của họ.”
– Andrew Feldman, Nhà sáng lập kiêm CEO, Cerebras Systems

Thỏa thuận làm gia tăng áp lực cạnh tranh lên Nvidia trong mảng inference

Việc AWS kết hợp Trainium và Cerebras cho inference tạo thêm áp lực lên Nvidia khi thị trường tăng tốc tìm kiến trúc và phần cứng tối ưu riêng cho suy luận, không chỉ dựa vào GPU truyền thống.

Đọc thêm:  BankChain Alliance: Ngân hàng nắm đường đến tiền on-chain, không phải crypto

Nội dung cũng đề cập Nvidia đã ký một thỏa thuận cấp phép trị giá 20 tỷ USD với Groq vào tháng 12 và dự kiến tuần tới công bố một hệ thống inference mới sử dụng công nghệ Groq, cho thấy cạnh tranh đang tập trung mạnh vào tốc độ suy luận.

Những câu hỏi thường gặp

AWS hợp tác với Cerebras để làm gì?

AWS đưa phần cứng Cerebras vào trung tâm dữ liệu để tăng tốc AI inference, đặc biệt nhằm cải thiện độ trễ và tốc độ phản hồi cho các ứng dụng thời gian thực như trợ lý lập trình và ứng dụng tương tác.

Inference disaggregation là gì trong thiết kế của AWS?

Đó là việc tách AI inference thành hai giai đoạn: prefill (xử lý prompt) và decode (tạo đầu ra). AWS dùng Trainium cho prefill và Cerebras CS-3 cho decode để tối ưu đặc tính tính toán và băng thông bộ nhớ của từng giai đoạn.

Vì sao “decode” thường là nút thắt tốc độ?

AWS cho biết decode mang tính tuần tự và phụ thuộc mạnh vào băng thông bộ nhớ; mỗi token đầu ra phải được tạo lần lượt, nên thường chiếm phần lớn thời gian trong suy luận.

EFA đóng vai trò gì trong hệ thống Trainium + CS-3?

Amazon Elastic Fabric Adapter (EFA) cung cấp kết nối độ trễ thấp và băng thông cao giữa phần xử lý prefill và decode, giúp hai hệ thống hoạt động như một dịch vụ thống nhất.

Triển khai này liên quan thế nào đến Amazon Bedrock?

AWS dự kiến triển khai cấu hình Trainium và Cerebras cho Amazon Bedrock ngay trong các trung tâm dữ liệu AWS, đưa hợp tác vào một sản phẩm AI trọng tâm của AWS.

BÀI VIẾT LIÊN QUAN

Ninepoint ra mắt ETF Mỹ đầu tiên về năng lượng Bắc Mỹ

Ninepoint ra mắt ETF Mỹ đầu tiên về năng...

Ninepoint Partners đã ra mắt Ninepoint North American Energy Independence ETF trên NYSE Arca với mã ENRG,...
Thượng nghị sĩ Cộng hòa Mỹ chất vấn các thương vụ crypto của Tổng thống Mỹ

Thượng nghị sĩ Cộng hòa Mỹ chất vấn các...

Thượng nghị sĩ John Curtis đề nghị điều tra hoạt động kinh doanh của Donald Trump Jr....
Spaces ra mắt Trust Anchor xác thực danh tính Bitcoin không tập trung

Spaces ra mắt Trust Anchor xác thực danh tính...

Spaces đã ra mắt Trust Anchor, công cụ cho phép ứng dụng xác minh định danh dễ...