Khi benchmark AI bão hòa: Bài học từ DeFi về ‘thanh khoản đánh giá’ và chiến lược của kẻ đi sau
Lý Hưng
Tuần này, tôi đọc được một phát biểu của Scott Wu – CEO Cognition, công ty đứng sau Devin – khiến tôi nhớ ngay đến cú sập thanh khoản năm 2022. Anh ta nói: “Các mô hình ngày nay đã bão hòa ở mọi benchmark công khai. Ngành đang chuyển sang các phương pháp đánh giá độc quyền, tập trung vào hiệu quả thực tế.” Nghe quen không? Cũng giống như khi mọi pool thanh khoản trên Uniswap đều cho APY 0.5%, bạn không thể dựa vào con số đó để quyết định bỏ vốn vào đâu. Lúc ấy, đám smart money chạy sang các giao thức chuyên biệt, nơi yield thực sự đo lường bằng rủi ro on-chain chứ không phải APY ảo.
Bối cảnh mà Scott Wu đề cập không chỉ là câu chuyện của giới AI. Nó là một tín hiệu cấu trúc thị trường: khi tài sản (model) trở nên tương đồng về điểm số, giá trị thực sự nằm ở khả năng chứng minh hiệu quả trong môi trường sống. Như trong crypto, khi tất cả L1 đều đạt 10.000 TPS trên benchmark, ai sẽ trả premium cho Solana? Chỉ người nào chạy được ứng dụng thật trên mainnet. Cognition đang làm điều tương tự: họ muốn định nghĩa lại thước đo, để Devin không cạnh tranh trên HumanEval (đã bão hòa) mà trên các repo code thực tế. Đây là chiến lược “không gian riêng” – giống hệt cách các alt-L1 từng tạo ra hệ sinh thái riêng để thoát khỏi sự thống trị của Ethereum.
Phân tích dòng lệnh ở đây thú vị. Hãy nhìn vào dữ liệu: theo báo cáo của Epoch AI, từ tháng 1/2023 đến tháng 6/2024, GPT-4, Claude 3 và Gemini Ultra đều chạm ngưỡng 90%+ trên MMLU, GSM8K, HumanEval. Độ lệch chuẩn giữa các model giảm từ 15% xuống còn 2%. Đó là tình trạng “zero information gain” – giống như khi bạn nhìn vào cặp ETH/USDT với thanh khoản hàng trăm triệu mà spread chỉ vài cent, không còn cơ hội arbitrage. Nhưng bên dưới bề mặt, thanh khoản thực sự (khả năng thực hiện lệnh lớn mà không trượt giá) lại là một câu chuyện khác. Tương tự, model có thể đạt 99% trên HumanEval, nhưng khi gặp task tích hợp CI/CD thực tế, tỷ lệ thành công của GPT-4 chỉ ~18% theo một nghiên cứu của Microsoft Research. Đó là khoảng trống mà Cognition khai thác: họ xây dựng “vùng thanh khoản riêng” cho các tác vụ code.
Góc nhìn contrarian: Có một điểm mù trong luận điệu của Scott Wu mà ít người để ý. Anh ta cho rằng benchmark công khai đã chết, nhưng thực ra chúng vẫn có giá trị như một cơ sở hạ tầng so sánh tối thiểu – giống như TVL trong DeFi. TVL có thể bị thao túng, nhưng nó vẫn là điểm khởi đầu. Nếu không có benchmark, các nhà đầu tư nhỏ lẻ mất đi công cụ đối chiếu, và dễ bị dẫn dắt bởi các slide marketing lộng lẫy. Ở khía cạnh này, việc Cognition thúc đẩy “đánh giá độc quyền” giống như một dự án DeFi kêu gọi “chỉ sử dụng thanh khoản riêng” – nó tạo ra lợi thế cho họ nhưng làm suy yếu tính minh bạch của toàn thị trường. Tôi đã từng mất 30.000$ trong vụ rug pull FARM năm 2020 vì tin vào APY 1000% mà không kiểm tra contract. Lúc đó, nếu có một benchmark chuẩn cho các giao thức yield farming, có lẽ tôi đã tránh được. Cho nên, tôi không tin rằng benchmark công khai nên bị loại bỏ hoàn toàn. Chúng cần được cải tiến, không phải thay thế bằng blackbox.
Takeaway cho trader và builder trong mùa sideways này: thị trường đang tích lũy, và việc xếp hàng đúng chỗ là then chốt. Đừng nhìn vào những con số bão hòa – cả trong AI lẫn crypto. Thay vào đó, hãy tìm các dự án đang xây dựng “bộ đánh giá nội bộ” của riêng họ. Trong crypto, đó là các giao thức có private testnet với metrics thực tế (số lượng giao dịch, độ trễ, phí gas). Trong AI, đó là các công ty như Cognition dám công bố proof-of-work (theo nghĩa đen) dưới dạng các demo end-to-end. Kẻ đi sau không cạnh tranh trên bảng xếp hạng cũ – họ tạo ra bảng xếp hạng mới. Và nếu bạn không tham gia vào quá trình định nghĩa tiêu chuẩn mới, bạn sẽ bị đào thải khi thị trường breakout.