Assbiz
BTC $79,636.3 -2.15%
ETH $2,453.89 -2.39%
SOL $101.9 -2.29%
BNB $720.4 -1.06%
XRP $1.4 -4.15%
DOGE $0.0847 -3.82%
ADA $0.2105 -4.97%
AVAX $7.39 -1.79%
DOT $0.8916 +0.03%
LINK $11.63 -2.18%
⛽ ETH Gas 28 Gwei
Sợ&Tham
73

Hạ tầng Inference AI đang bước vào kỷ nguyên 'Session-Aware': Liệu Agentic Traffic có phá vỡ Batch Inference?

Ngô Tuấn
Hướng dẫn

Hook

Tại vLLM Conference 2025, diễn ra song song với Ray Summit, một loạt kỹ sư từ Intel, AMD, Prime Intellect và Anyscale đã đồng loạt trình bày về một kiến trúc inference mới: disaggregated prefill/decode serving. Họ cho rằng Agentic traffic – lưu lượng từ các tác nhân AI đa phiên, gọi công cụ, duy trì ngữ cảnh – đang phá vỡ mô hình batch inference truyền thống vốn được tối ưu cho throughput liên tục. Dữ liệu từ AMD cho thấy trên 8 node MI300X, kiến trúc này đạt goodput cao hơn 2.5 lần so với cách triển khai collocated hiện tại. Nhưng liệu đây là bước ngoặt thực sự hay chỉ là một câu chuyện hấp dẫn của vLLM ecosystem?

Context

Batch inference đã thống trị ngành AI kể từ kỷ nguyên Transformer. VLLM, framework phổ biến nhất hiện nay, cho phép xử lý hàng loạt request cùng lúc, tối đa hóa throughput GPU. Tuy nhiên, Agentic workloads – với các cuộc hội thoại nhiều lượt, tạm dừng chờ tool call, và yêu cầu giữ nguyên context qua nhiều bước – lại có tính chất rất khác: mỗi session sinh ra một chuỗi request không liên tục, latency-sensitive, và cần duy trì KV cache giữa các lượt. Khi các agent như AutoGPT, LangChain agents, hay các nền tảng AI agent enterprise bắt đầu chiếm tỷ trọng lớn hơn trong tổng inference traffic, các nhà phát triển hạ tầng nhận thấy rằng batch inference không còn phù hợp. Đây không phải là một phát minh lý thuyết mới, mà là sự hội tụ của nhiều nhóm nghiên cứu độc lập nhằm giải quyết một vấn đề chung: làm sao để phục vụ agent traffic hiệu quả?

Core

Cốt lõi của kiến trúc mới là tách rời hai giai đoạn của quá trình sinh token: prefill (tính toán attention cho toàn bộ prompt, compute-bound) và decode (sinh token từng bước, memory-bandwidth-bound). Trong collocated serving, cả hai giai đoạn chạy trên cùng một node GPU, dẫn đến xung đột tài nguyên: khi một request đang ở giai đoạn decode, nó giữ chặt memory bandwidth, làm chậm các request đang prefill. Disaggregated serving giải quyết bằng cách dành riêng các nhóm GPU cho mỗi giai đoạn, liên kết chúng qua RDMA để truyền KV cache giữa các node. VLLM Router sử dụng consistent hashing và sticky routing để đảm bảo mỗi session tiếp tục được decode trên cùng instance.

Theo thông tin từ hội nghị, vLLM hiện hỗ trợ hai KV connector: NixlConnector (mặc định từ v0.8, dựa trên RDMA) và MORI-IO (dành cho AMD, tận dụng Infinity Fabric). Prime Intellect thậm chí còn đưa KV cache xuống CPU memory và SSD, tạo thành hệ thống lưu trữ phân tán. Tuy nhiên, điều quan trọng là: các production user lớn như Meta, LinkedIn, Mistral vẫn đang chạy collocated architecture. Tính năng disaggregated prefill của vLLM hiện chỉ ở mức experimental. Điều này có nghĩa là kiến trúc này vẫn đang trong giai đoạn thử nghiệm, chưa được kiểm chứng ở quy mô thực tế.

Dữ liệu từ AMD cho thấy trên 8x MI300X, MORI-IO đạt 2.5x goodput so với collocated. Nhưng cần hỏi: load model trong thử nghiệm là gì? Tỷ lệ prefill/decode, độ dài context, số lượt conversation? Nếu load model chủ yếu là agent traffic với context dài, thì kết quả không thể suy rộng cho inference thông thường. The truth is always in the middle.

Contrarian

Đây là góc nhìn phản trực giác: Disaggregated serving giải quyết vấn đề latency của agent, nhưng nó tạo ra một hệ thống phức tạp và tập trung hơn, tương tự như nghịch lý trong DeFi: càng phi tập trung hóa, càng phụ thuộc vào các lớp trung gian tập trung. Trong thế giới crypto, chúng ta đã thấy cross-chain bridges làm phân mảnh thanh khoản thay vì kết nối. Ở đây, việc tách prefill và decode đòi hỏi một lớp routing, một lớp KV cache storage, và một lớp orchestration mới – tất cả đều là các điểm tập trung tiềm ẩn. Nếu agent traffic không tăng trưởng như kỳ vọng (ví dụ: chỉ chiếm 10% tổng inference), thì chi phí đầu tư vào hạ tầng RDMA, cluster phân tách, và vLLM Router là không hợp lý. The biggest risk is not taking one? Có thể, nhưng với các nhà đầu tư hạ tầng, rủi ro là bỏ tiền vào một câu chuyện chưa được chứng minh.

Thêm vào đó, cạnh tranh từ SGLang, TensorRT-LLM, hay Dynamo của OpenAI có thể đưa ra giải pháp tương tự nhưng ổn định hơn, làm vô hiệu hóa lợi thế first-mover của vLLM. The paradox of decentralization is centralization – vLLM đang cố gắng trở thành hạ tầng mở, nhưng nếu NVIDIA tích hợp disaggregated serving vào NIM, thì vLLM ecosystem có thể mất đi lợi thế phần cứng.

Takeaway

Hãy theo dõi sự chuyển đổi từ collocated sang disaggregated serving như một tín hiệu cho thấy ngành AI đang bước vào kỷ nguyên 'session-aware' infrastructure. Điều này sẽ mở ra cơ hội cho các dự án AI+Crypto tập trung vào bảo mật và phi tập trung hóa hạ tầng inference – nơi mà KV cache không bị độc quyền bởi một bên trung gian. Nhưng trước mắt, hãy để ý đến ba tín hiệu: (1) khi vLLM gỡ bỏ experimental label, (2) khi Meta hay LinkedIn công bố migration, và (3) khi các benchmark độc lập xuất hiện. The future is already here, it's just not evenly distributed. Và nó đang được phân phối bởi những câu chuyện hội nghị.

Giá thị trường

BTC Bitcoin
$79,636.3 -2.15%
ETH Ethereum
$2,453.89 -2.39%
SOL Solana
$101.9 -2.29%
BNB BNB Chain
$720.4 -1.06%
XRP XRP Ledger
$1.4 -4.15%
DOGE Dogecoin
$0.0847 -3.82%
ADA Cardano
$0.2105 -4.97%
AVAX Avalanche
$7.39 -1.79%
DOT Polkadot
$0.8916 +0.03%
LINK Chainlink
$11.63 -2.18%

Sợ & Tham

73

Tham lam

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$79,636.3
1
Ethereum ETH
$2,453.89
1
Solana SOL
$101.9
1
BNB Chain BNB
$720.4
1
XRP Ledger XRP
$1.4
1
Dogecoin DOGE
$0.0847
1
Cardano ADA
$0.2105
1
Avalanche AVAX
$7.39
1
Polkadot DOT
$0.8916
1
Chainlink LINK
$11.63

Công cụ

Tất cả →

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

🐋 Theo dõi cá voi

🟢
0x90fb...c79d
5 phút trước
Chuyển vào
42,243 SOL
🔵
0x20de...e679
5 phút trước
Stake
6,246,550 DOGE
🔴
0xded1...d5bf
12 phút trước
Chuyển ra
4,405 SOL

💡 Smart Money

0x8b6b...bfd1
Nhà đầu tư sớm
+$0.3M
88%
0x6ae3...99da
Nhà giao dịch on-chain dày dặn
+$3.4M
90%
0xaad6...8f47
Nhà đầu tư sớm
+$4.7M
74%