Hook
KDA giảm băng thông truyền tải KV cache xuống 10 lần. Nghe như một bước đột phá về hiệu quả. Nhưng dòng tiền không biết nói dối: tổng nhu cầu mạng cho suy luận Kimi K3 lại tăng vọt. Một nghịch lý mang tên Jevons đang hiện hữu ngay trong kiến trúc 2,8 nghìn tỷ tham số.
Context
Kimi K3 là mô hình ngôn ngữ lớn thế hệ mới do Moonshot AI phát triển, sử dụng kiến trúc dense 2,8T tham số kết hợp Mixture-of-Experts với 896 expert. Điểm đặc biệt là cơ chế chú ý phụ thuộc bàn phím (KDA) giúp giảm băng thông KV cache khi suy luận. Tuy nhiên, để triển khai 896 expert trên nhiều GPU, nhóm phát triển áp dụng Wide Expert Parallelism (WideEP) – mỗi lượt forward yêu cầu hơn 120 lần phân phối và hợp nhất token giữa các node. Kết quả: băng thông mạng cần thiết cho mỗi bước suy luận lên tới hàng chục GB, vượt xa mức tiết kiệm từ KDA.

Core
Hãy mổ xẻ con số. Với MXFP4 (4-bit floating point), mỗi lần forward vẫn yêu cầu 1,5 TB băng thông HBM. Điều này đồng nghĩa GPU phải đạt ít nhất 3 TB/s – chỉ H100 (2 TB/s) hay B200 (4 TB/s) mới đáp ứng. Nhưng vấn đề thực sự nằm ở mạng. WideEP với 896 expert trải trên hàng trăm GPU yêu cầu giao tiếp all-to-all: mỗi token phải được gửi đến đúng expert, sau đó kết quả được tập hợp lại. Với mỗi layer, số lần all-to-all là 2 (phân phối + hợp nhất), nhân với số layer (thường 80-120), tổng cộng hơn 120 lần mỗi forward. Mỗi lần như vậy cần truyền đi hàng trăm MB kích hoạt. Tổng băng thông mạng mỗi bước lên tới 10-20 GB, gấp 5-10 lần so với mô hình dense cùng kích thước.
Đừng quên: KDA giảm KV cache bandwidth, nhưng KV cache chỉ là một phần nhỏ trong tổng lưu lượng. Băng thông cho expert communication chiếm ưu thế tuyệt đối. Ví empty ≠ sạch sẽ: giảm một đầu không đồng nghĩa tổng thể nhẹ đi. Thực tế, SemiAnalysis ước tính rằng mức giảm từ KDA (10x) bị lấn át hoàn toàn bởi mức tăng từ WideEP (ước tính 20-30x so với MoE thông thường). Kết quả: nhu cầu băng thông mạng tổng thể cho Kimi K3 cao hơn 2-3 lần so với GPT-4-class model.
Contrarian
Phe lạc quan sẽ nói: KDA là đột phá, giúp kéo dài context lên 500K token, mở ra ứng dụng mới. Đúng, nhưng có cái giá. KDA là cơ chế local attention – nó hy sinh độ chính xác ở context rất dài để đổi lấy băng thông. Trong các tác vụ yêu cầu suy luận đa bước trên 1M+ token (ví dụ phân tích hợp đồng pháp lý dài), KDA có thể gây mất mát thông tin toàn cục. Hơn nữa, 4-bit quantization làm giảm chất lượng đầu ra ở các tác vụ nhạy cảm như code generation hay toán học. Wash trading là tự hôn mình trong gương: cải thiện hiệu quả một mặt nhưng lại tạo ra gánh nặng vô hình ở mặt khác.
Takeaway
Kimi K3 là minh chứng sống cho Jevons Paradox trong AI: tối ưu cục bộ dẫn đến mở rộng tổng thể. Các nhà cung cấp switch mạng (Arista, Cisco, Huawei) và module quang 800G/1.6T sẽ hưởng lợi lớn nhất. Nhưng nhà đầu tư cần cảnh giác: nếu inference cost không giảm đủ nhanh, khả năng thương mại hóa của Kimi K3 sẽ bị bó hẹp trong phân khúc enterprise cao cấp. Câu hỏi cuối: liệu thị trường có sẵn sàng trả giá 5-10 lần cho một context window rộng hơn?