Kimi K3 và Nvidia Rubin: Cuộc chiến định giá lại nền tảng AI
Vũ Thịnh
72 GPU, 8 triệu đô la mỗi rack, và một tuyên bố táo bạo: ‘1.000 rack Rubin mỗi ngày’. Đó là con số Nvidia tung ra để giữ vững ngôi vương. Cùng tuần đó, Kimi K3 – một mô hình Trung Quốc với chi phí huấn luyện chỉ bằng một phần nhỏ – đạt điểm số ngang ngửa GPT-4 trên nhiều benchmark. Thị trường lao đao. Nhà đầu tư bắt đầu tự hỏi: liệu ‘đốt tiền vào GPU’ có còn là tấm vé vàng duy nhất?
Bối cảnh: hai con đường kỹ thuật đang đối đầu. Một bên là ‘scaling law’ thuần túy – đổ thêm tiền, xây thêm cụm GPU, mô hình to hơn, thông minh hơn. Nvidia Rubin là đỉnh cao của tư duy này: hệ thống rack trị giá 7-8 triệu đô, tiêu thụ điện như một nhà máy nhỏ, yêu cầu làm mát bằng chất lỏng và băng thông mạng khủng. Bên kia là ‘hiệu quả thuật toán’ – Kimi K3 chứng minh rằng với kiến trúc thông minh và chiến lược dữ liệu tối ưu, bạn có thể đạt hiệu suất cạnh tranh mà không cần đốt tiền vô tội vạ. Đây không chỉ là câu chuyện về hai sản phẩm, mà là sự va chạm của hai triết lý đầu tư.
Cốt lõi: thị trường đang phải đối mặt với một sự kiện ‘tái định giá hệ thống’. Trong 18 tháng qua, câu chuyện ‘chi phí cao là hàng rào bảo vệ’ đã thúc đẩy định giá của OpenAI, Anthropic và cả Nvidia. Kimi K3 phá vỡ giả định đó. Nếu một mô hình mở, giá rẻ có thể làm được nhiều việc như mô hình đóng tiền tỷ, thì ‘phần bù khả năng’ của các công ty Mỹ sẽ biến mất. Nhưng đừng vội bán Nvidia. Tôi đã từng audit hợp đồng thông minh của EOS năm 2017 và thấy cộng đồng phản ứng thái quá trước những phát hiện kỹ thuật. Lúc đó, ai cũng nghĩ EOS sẽ chết. Thực tế, lỗ hổng được vá, và dự án vẫn sống thêm vài năm. Kimi K3 cũng vậy – nó là tín hiệu, không phải tận thế. Nvidia đã chuyển từ bán chip sang bán cả hệ thống: gắn kết khách hàng qua network, memory, cooling. Kể cả khi khách hàng dùng chip inference của đối thủ, họ vẫn phải mua ‘cái xẻng’ Nvidia.
Tuy nhiên, có một góc nhìn phản trực giác: mô hình rẻ hơn sẽ mở rộng use case, cuối cùng kéo theo nhu cầu phần cứng lớn hơn. Đây là nghịch lý Jevons: khi động cơ hơi nước hiệu quả hơn, than được dùng nhiều hơn chứ không ít đi. Nếu Kimi K3 giúp AI ứng dụng vào SME, giáo dục, y tế với chi phí thấp, tổng lượng token được sinh ra sẽ tăng vọt. Điều đó có nghĩa là vẫn cần thêm GPU, thêm rack Rubin. Nhưng điều kiện tiên quyết: tốc độ mở rộng use case phải vượt tốc độ giảm chi phí mỗi token. Tôi chưa thấy dữ liệu nào khẳng định điều đó.
Takeaway: mùa báo cáo tài chính sắp tới sẽ là điểm uốn. Hãy nhìn vào chỉ dẫn chi tiêu vốn của các cloud provider. Nếu họ tăng mạnh, Rubin vẫn là vua. Nếu họ thận trọng, thị trường sẽ phải viết lại toàn bộ câu chuyện định giá. Còn Kimi K3? Nó là lời nhắc nhở rằng trong AI, không có ‘moat’ nào là vĩnh viễn – ngoại trừ khả năng thích nghi với dữ liệu thực tế.