Giải thích

Vì sao OpenAI ghép chip Jalapeño với CPU AMD EPYC Turin?

OpenAI đang triển khai chip suy luận Jalapeño cùng máy chủ AMD EPYC Turin. Cấu hình này cho thấy một quyết định ưu tiên độ trưởng thành của nền tảng và tốc độ triển khai hơn việc chọn CPU mới nhất trên giấy.

Tóm tắt nhanh

  • OpenAI triển khai ASIC suy luận Jalapeño cùng các máy chủ host dùng CPU AMD EPYC Turin.
  • Richard Ho, phụ trách phần cứng OpenAI, nói lựa chọn Turin giúp giảm rủi ro và hoàn thiện thiết kế nhanh; đối tác của hãng đã có kinh nghiệm với nền tảng này.
  • Kiến trúc SemiAnalysis mô tả gồm các khay CPU Katsu nối với khay ASIC Vindaloo; mỗi khay host có hai CPU Turin và 1,5 TB DRAM.
  • Điểm đáng chú ý không phải AMD thắng Nvidia, mà là OpenAI chọn nền tảng trưởng thành để đưa chip riêng vào vận hành mà không tự tăng thêm rủi ro tích hợp.

Jalapeño không thể tự vận hành nếu thiếu một máy chủ host

Chip ASIC Jalapeño của OpenAI
ASIC Jalapeño nằm giữa các linh kiện cấp nguồn trên bảng mạch thử nghiệm.

ASIC tăng tốc suy luận chỉ là một phần của hệ thống. Nó cần máy chủ host điều phối tác vụ, quản lý bộ nhớ và kết nối với hạ tầng dữ liệu. Vì vậy, việc Jalapeño đi cùng EPYC Turin không đơn thuần là chọn một CPU phụ trợ: OpenAI đang ghép chip tự thiết kế vào một nền tảng máy chủ đã có thể triển khai ở quy mô lớn.

SemiAnalysis mô tả mỗi khay Katsu chứa hai CPU AMD EPYC Turin và 1,5 TB DRAM, kết nối sang khay Vindaloo có tám ASIC Jalapeño qua tám cáp PCIe DAC. Hệ thống được thiết kế cùng Celestica. Cấu trúc này cho thấy công việc suy luận không nằm trên một con chip riêng lẻ; hiệu quả thực tế còn phụ thuộc cách CPU host, bộ nhớ, liên kết và ASIC phối hợp thành cụm.

Sơ đồ rack OpenAI Katsu và Vindaloo
Sơ đồ SemiAnalysis phân tách khay CPU Turin và khay ASIC Jalapeño thành hai rack phối hợp.

Turin là lựa chọn giảm rủi ro, không phải tuyên bố về ưu thế tuyệt đối

Richard Ho, Phó chủ tịch kiêm Trưởng bộ phận Phần cứng OpenAI, mô tả quyết định dùng Turin là thực dụng. Theo cuộc phỏng vấn của Tom’s Hardware, đội ngũ muốn giảm rủi ro thiết kế và hoàn thành nhanh; Turin đáp ứng yêu cầu, trong khi các đối tác đã có kinh nghiệm với nền tảng này.

Ho cũng nhận xét CPU Vera độc lập của Nvidia khi đó còn chậm hơn một chút về độ trưởng thành. Đây là đánh giá của lãnh đạo OpenAI về trạng thái sẵn sàng của nền tảng ở thời điểm thiết kế, không phải kết luận rằng Vera kém hơn về hiệu năng hay hiệu quả trong mọi tải công việc. Một CPU mới có thể hấp dẫn trên lộ trình dài hạn, nhưng đưa nó vào cùng lúc với ASIC mới sẽ khiến đội ngũ phải kiểm chứng thêm phần cứng, phần mềm và quy trình vận hành.

CPU AMD EPYC Turin
CPU EPYC trên bo mạch máy chủ là nền tảng host đã quen thuộc với đối tác của OpenAI.

Hệ thống AI được quyết định bởi cả cụm, không chỉ bởi chip tăng tốc

Thông tin về Katsu và Vindaloo cũng nhắc lại một điểm thường bị bỏ qua khi so sánh chip AI: bộ tăng tốc chỉ tạo ra giá trị khi máy chủ cấp dữ liệu đủ nhanh và hạ tầng có thể vận hành ổn định. Với 1,5 TB DRAM trên mỗi khay CPU, host đảm nhiệm vai trò đáng kể trong việc cung cấp và điều phối dữ liệu cho các tác vụ suy luận.

Đây là lý do các công ty có thể phát triển ASIC riêng nhưng vẫn dựa vào CPU thương mại. Tự thiết kế bộ tăng tốc cho phép tối ưu một phần hệ thống theo nhu cầu riêng; còn dùng CPU đã quen thuộc giúp giảm số biến phải giải quyết khi xây cụm máy chủ. Cách làm này không xóa bỏ sự phụ thuộc vào nhà cung cấp khác, nhưng thu hẹp phạm vi rủi ro mà đội ngũ phải gánh trong một dự án vốn đã có chip mới.

Với trung tâm dữ liệu, tiến độ triển khai có thể quan trọng hơn thông số trên giấy

OpenAI đang cạnh tranh về năng lực suy luận, nhưng một kiến trúc mới chỉ có ý nghĩa khi có thể được đưa vào vận hành với độ tin cậy cần thiết. Chọn Turin cho thấy hãng đặt tính sẵn sàng, kinh nghiệm của đối tác và thời gian hoàn thiện vào cùng phép tính với hiệu năng và chi phí.

Jalapeño vì thế nên được nhìn như một quyết định về thiết kế hệ thống hơn là cuộc đối đầu đơn giản giữa OpenAI, AMD và Nvidia. CPU host không phải phần gây chú ý nhất, nhưng một lựa chọn ít rủi ro ở tầng này có thể giúp nhóm tập trung nguồn lực vào việc tích hợp ASIC mới. Đối với các đơn vị vận hành trung tâm dữ liệu, bài học thực tế là hiệu năng lý thuyết không tự biến thành năng lực phục vụ nếu phần còn lại của cụm chưa đủ trưởng thành.

Chip Jalapeño và hệ thống host được thiết kế cho hạ tầng riêng của OpenAI, không phải linh kiện bán lẻ cho người dùng tại Việt Nam. Giá bán lẻ tại Việt Nam không áp dụng cho cấu hình nội bộ này.

Nguồn tham khảo: Tom’s Hardware; SemiAnalysis

Bài viết mới nhất