NVIDIA ra mắt chip 20 tỷ USD, hứa hẹn vượt tốc độ ChatGPT

NVIDIA đang chuẩn bị ra mắt bộ xử lý AI tối ưu cho suy luận (inference) nhằm tăng tốc việc tạo phản hồi của chatbot, hướng tới hiệu năng vượt trội so với các hệ thống phổ biến hiện nay.

Nền tảng mới dự kiến được công bố tại hội nghị GTC của NVIDIA, tập trung vào giai đoạn mô hình đã huấn luyện tạo câu trả lời. Cách tiếp cận “chuyên suy luận” này nhắm tới tốc độ và hiệu suất cao hơn so với GPU đa dụng vừa huấn luyện vừa suy luận.

NỘI DUNG CHÍNH
  • NVIDIA được cho là sẽ giới thiệu chip AI chuyên tăng tốc suy luận tại GTC.
  • Thiết kế kiểu Groq có thể chuyển sang dùng SRAM để giảm phụ thuộc vào HBM đang khan hiếm.
  • NVIDIA dự kiến đưa dòng Vera Rubin ra thị trường nửa cuối 2026, bản “ultra” vào 2027.

Chip suy luận mới của NVIDIA nhắm tới tăng tốc phản hồi AI

Chip mới được tối ưu cho AI inference, giúp mô hình đã huấn luyện trả lời prompt nhanh và hiệu quả hơn so với GPU truyền thống phải cân bằng giữa huấn luyện và suy luận.

NVIDIA được cho là sẽ trình làng nền tảng tại hội nghị nhà phát triển thường niên GTC. Tâm điểm của sản phẩm là “inference”, giai đoạn mô hình tạo câu trả lời cho người dùng, nơi độ trễ và chi phí trên mỗi truy vấn trở thành yếu tố then chốt.

Khác với GPU đa dụng phục vụ cả training và inference, bộ xử lý mới tập trung vào tốc độ phản hồi và hiệu quả vận hành. Cách chuyên môn hóa này có thể phù hợp với các tác vụ thời gian thực như chatbot, tìm kiếm, hoặc trợ lý AI doanh nghiệp.

Nếu ra mắt, đây có thể là kết quả cụ thể đầu tiên từ thỏa thuận ký vào tháng 12 đưa các nhà sáng lập Groq gia nhập, trong bối cảnh Groq nổi bật với phần cứng xử lý AI tốc độ cao, độ trễ thấp.

Thương vụ với Groq được xem là nền tảng cho chip “kiểu Groq”

NVIDIA được cho là đã chi khoảng 20 tỷ USD để cấp phép công nghệ từ Groq và chiêu mộ nhân sự chủ chốt, bao gồm cả CEO, nhằm tăng tốc chiến lược phần cứng suy luận.

Theo thông tin được nhắc tới trong bài, thương vụ cuối năm trước tập trung vào việc tiếp cận công nghệ và đội ngũ có kinh nghiệm tối ưu đường đi dữ liệu, độ trễ và hiệu năng suy luận.

Đọc thêm:  Oracle vượt ước tính về đốt tiền mặt và đơn hàng tồn đọng

Mục tiêu được mô tả là tích hợp các bộ xử lý độ trễ thấp vào kiến trúc “AI factory” của NVIDIA để mở rộng năng lực phục vụ nhiều khối lượng công việc suy luận và thời gian thực.

“Chúng tôi dự định tích hợp các bộ xử lý độ trễ thấp của Groq vào kiến trúc nhà máy AI của NVIDIA, mở rộng nền tảng để phục vụ phạm vi rộng hơn cho các tác vụ suy luận AI và khối lượng công việc thời gian thực.”
– Jensen Huang, CEO NVIDIA

Khách hàng lớn như OpenAI có thể sớm áp dụng nền tảng suy luận mới

Báo cáo cho rằng các khách hàng hàng đầu, bao gồm OpenAI, có khả năng áp dụng chip suy luận mới; chip này thậm chí có thể xử lý gần 10% khối lượng suy luận của OpenAI.

Kỳ vọng này phản ánh nhu cầu tăng throughput cho các truy vấn phức tạp, đồng thời hạ độ trễ khi người dùng tương tác dạng hội thoại. Với các hệ thống phục vụ quy mô lớn, chỉ một phần tải suy luận cũng tương đương nhu cầu hạ tầng đáng kể.

Trọng tâm “tăng tốc suy luận” thường liên quan đến tối ưu bộ nhớ, băng thông, và lập lịch thực thi để mô hình trả lời nhanh hơn trên cùng mức tiêu thụ tài nguyên.

GTC được dự báo là nơi NVIDIA công bố nhiều sản phẩm mới

NVIDIA xác nhận sẽ công bố nhiều sản phẩm tại GTC, và giới phân tích cho rằng chip suy luận kiểu Groq có thể nằm trong danh mục ra mắt.

Trong một cuộc họp công bố kết quả kinh doanh, CEO NVIDIA gợi ý sẽ có nhiều cập nhật tại GTC, nơi thường được mô tả như “Super Bowl của AI”.

Trang sự kiện GTC của NVIDIA: Xem thông tin GTC trên website NVIDIA.

Chip kiểu Groq có thể dùng SRAM để giảm phụ thuộc HBM

Nguồn tin nội bộ cho rằng NVIDIA có thể dùng SRAM thay vì DRAM gắn với HBM, nhằm giải bài toán hạn chế nguồn cung HBM trong suy luận.

Các nền tảng suy luận thường dựa nhiều vào bộ nhớ băng thông cao (HBM) để đáp ứng nhu cầu truy cập tham số và kích hoạt trong mô hình. Tuy nhiên, HBM được nhận định là đang khó tìm nguồn cung.

Đọc thêm:  Nhân viên Google chuyển sang Gemini 3.8 Flash vì chi phí AI tăng

Việc chuyển sang SRAM được mô tả là có thể “dễ tiếp cận hơn” và giúp tăng hiệu năng cho các tác vụ suy luận mang tính lập luận (reasoning). Dù vậy, lựa chọn bộ nhớ luôn kéo theo đánh đổi về dung lượng, chi phí và thiết kế hệ thống.

Thị trường suy luận đang mở ra cạnh tranh ngoài hệ sinh thái NVIDIA

Ngay cả khi NVIDIA dẫn đầu huấn luyện AI, suy luận là sân chơi khác, nơi nhà phát triển có thể chọn đối thủ vì vận hành mô hình hoàn thiện không đòi hỏi cùng mức độ lập trình như huấn luyện.

Sid Sheth, nhà sáng lập kiêm CEO d-Matrix, cho rằng đào tạo mô hình và triển khai suy luận có động lực kỹ thuật khác nhau, khiến rào cản chuyển đổi nhà cung cấp ở suy luận có thể thấp hơn.

“Nhà phát triển có thể tìm đến các đối thủ ngoài NVIDIA vì việc chạy các mô hình AI đã hoàn thiện không đòi hỏi cùng kiểu lập trình như khi huấn luyện chúng.”
– Sid Sheth, Founder & CEO d-Matrix

Diễn biến cạnh tranh cũng được nhắc tới khi Meta công bố bốn bộ xử lý tối ưu cho suy luận, làm dấy lên nhận định rằng ngành có thể bước vào giai đoạn không còn “NVIDIA thống trị” tuyệt đối.

Ở góc độ triển khai hạ tầng, CEO FuriosaAI June Paik cảnh báo nhiều trung tâm dữ liệu không thể đáp ứng các GPU làm mát bằng chất lỏng đời mới, khiến nhu cầu phần cứng suy luận “dễ triển khai” trở nên đáng chú ý.

Dự báo chi tiêu trung tâm dữ liệu AI sẽ nghiêng về suy luận đến 2030

Theo các nhà phân tích Bank of America, khối lượng suy luận có thể chiếm 75% chi tiêu trung tâm dữ liệu AI vào năm 2030, khi thị trường đạt khoảng 1,2 nghìn tỷ USD.

Nhận định này cũng nêu rằng tỷ trọng suy luận vào “năm ngoái” khoảng 50%. Nếu xu hướng đúng, tối ưu suy luận sẽ trở thành ưu tiên hàng đầu của nhà cung cấp chip, nhà vận hành trung tâm dữ liệu và các công ty triển khai ứng dụng AI.

Ben Bajarin (Creative Strategies) bổ sung quan điểm rằng trung tâm dữ liệu tương lai khó theo mô hình “một kiểu cho mọi nhu cầu”, dự báo các công ty sẽ chọn chiến lược khác nhau về chip và thiết kế cơ sở hạ tầng.

Đọc thêm:  Mỹ thúc Mexico siết nguồn cung máy chủ AI theo USMCA

NVIDIA dự kiến đưa dòng Vera Rubin ra thị trường nửa cuối 2026

NVIDIA cho biết Vera Rubin sẽ lên kệ vào nửa cuối 2026 và có phiên bản “ultra” vào 2027, nhắm tới nhu cầu tính toán tăng mạnh từ các nền tảng AI thiên về lập luận.

NVIDIA gần đây cũng công bố thế hệ chip AI Vera Rubin, kỳ vọng các hệ thống reasoning AI sẽ khiến nhu cầu compute tăng thêm. Công ty cho rằng dòng chip này giúp huấn luyện mô hình lớn hơn và cung cấp đầu ra tinh vi hơn cho nhiều người dùng.

Theo CEO Jensen Huang, lịch phát hành hướng tới nửa cuối 2026, sau đó mở rộng với bản “ultra” vào 2027.

Vera Rubin được mô tả có cụm GPU lớn hơn nhiều so với Blackwell NVL72

NVIDIA cho biết một hệ thống Rubin có thể kết hợp 576 GPU, trong khi hệ thống Blackwell NVL72 hiện gom 72 GPU, hàm ý Rubin sẽ cần kiến trúc bộ nhớ tiên tiến hơn.

So sánh này cho thấy định hướng mở rộng theo cụm (cluster) để tăng tổng năng lực tính toán và băng thông bộ nhớ phục vụ huấn luyện và các tác vụ AI phức tạp.

Những câu hỏi thường gặp

Chip AI suy luận (inference) khác gì so với GPU đa dụng?

Chip suy luận tập trung tối ưu giai đoạn mô hình đã huấn luyện tạo câu trả lời, ưu tiên độ trễ thấp và hiệu suất tạo phản hồi. GPU đa dụng thường phải cân bằng cả huấn luyện và suy luận, nên không luôn tối ưu cho mục tiêu phản hồi nhanh nhất.

Vì sao NVIDIA có thể chọn SRAM thay vì HBM cho chip suy luận?

Nguồn tin cho rằng HBM đang khó tìm nguồn cung, còn SRAM có thể dễ tiếp cận hơn và giúp cải thiện hiệu năng cho các tác vụ suy luận/logic. Tuy nhiên, lựa chọn bộ nhớ phụ thuộc vào đánh đổi kỹ thuật của từng thiết kế.

Khi nào chip Vera Rubin của NVIDIA dự kiến ra mắt?

Theo Jensen Huang, Vera Rubin dự kiến ra thị trường vào nửa cuối năm 2026, và phiên bản cao cấp “ultra” dự kiến xuất hiện vào năm 2027.

BÀI VIẾT LIÊN QUAN

ASUS và Poesis thử nghiệm tác nhân AI tự hành giao dịch

ASUS và Poesis thử nghiệm tác nhân AI tự...

ASUS và Poesis đã thử nghiệm trong một tuần các tác nhân AI tự chủ có thể...
Apple đẩy mạnh AI, thử thách cam kết quyền riêng tư

Apple đẩy mạnh AI, thử thách cam kết quyền...

Apple đang mở rộng Apple Intelligence và Siri AI theo hướng cá nhân hóa hơn, khiến quyền...
Kho bạc Mỹ trừng phạt BitBank liên quan Iran

Kho bạc Mỹ trừng phạt BitBank liên quan Iran

Bộ Tài chính Mỹ áp đặt lệnh trừng phạt lên sàn tiền số BitBank vì cáo buộc...