Hook:
Một model mới ra mắt, benchmark tăng 12-14%, giá giảm 17% – nghe có vẻ như Google vừa tung ra một siêu phẩm. Nhưng nếu bạn nhìn kỹ vào mã nguồn (hay đúng hơn là báo cáo kỹ thuật), bạn sẽ thấy: Gemini 3.6 Flash không phải là một bước nhảy vọt về kiến trúc. Nó chỉ là một bản tinh chỉnh, một chiếc áo khoác mới khoác lên con lừa già. Và điều đó, theo kinh nghiệm audit của tôi, thường là dấu hiệu của sự tuyệt vọng hơn là đổi mới.
Context:
Kể từ khi OpenAI tung ra GPT-4o, Google đã chạy đua để giành lại vị thế. Gemini 2.5 Flash là một sản phẩm tốt, nhưng không xuất sắc. Gemini 3.5 Flash là bản nâng cấp nhẹ. Và bây giờ, Gemini 3.6 Flash – một phiên bản củng cố. Đồng thời, Google thông báo đã bắt đầu pre-train Gemini 4, một dự án đầy tham vọng. Sự kết hợp này tạo ra một bức tranh: họ đang cố gắng giữ chân khách hàng với một sản phẩm trung gian, trong khi hy vọng đại bác Gemini 4 sẽ cứu vãn tình thế. Nhưng trong thế giới crypto, chúng ta đã thấy quá nhiều dự án làm điều tương tự: phát hành token phụ để kéo dài thời gian, trong khi mainnet thực sự vẫn chưa sẵn sàng. Và thường thì kết cục chẳng mấy tốt đẹp.
Core: Tháo gỡ từng lớp của Gemini 3.6 Flash
Hãy bắt đầu với con số. DeepSWE từ 37% lên 49% – tức là tăng 32% tương đối. MLE từ 49.7% lên 63.9% – tăng 28.5%. Đây là những benchmark về khả năng agent – tức là khả năng tự động hóa các tác vụ lập trình và machine learning. Google muốn bạn tin rằng đây là một bước tiến vượt bậc. Nhưng hãy nhìn vào bối cảnh: những benchmark này được thiết kế để đo lường khả năng tool-calling và planning, chứ không phải suy luận thuần túy. Một model có thể giỏi gọi API nhưng vẫn ngu ngốc về mặt logic. Và trên thực tế, Gemini 3.6 Flash không hề cải thiện trên các benchmark tổng quát như MMLU hay GSM8K – ít nhất là không được báo cáo. Đó là một dấu hiệu đỏ.
Điểm mấu chốt: Engineering optimization, không phải scientific breakthrough.
Google tuyên bố họ “giảm số bước suy luận, giảm số lần gọi tool, và giảm chi phí thực thi”. Nghe giống như một bản vá lỗi hiệu năng. Trong thế giới smart contract, chúng tôi gọi đó là “gas optimization”. Bạn không thay đổi logic, bạn chỉ viết lại code để tốn ít gas hơn. Kết quả: benchmark có thể tăng, nhưng nếu logic ban đầu đã sai, thì tối ưu hóa chỉ làm sai nhanh hơn.
Cụ thể: output token usage giảm 17%, output price giảm 16.7% ($9 → $7.5). Input price giữ nguyên. Điều này cho thấy trọng tâm là giảm chi phí cho các tác vụ sinh output dài – như code generation. Nhưng đồng thời, nó cũng tiết lộ rằng Google đang cố gắng cạnh tranh với GitHub Copilot và Cursor. Họ nhắm đến các nhà phát triển – những người sẵn sàng trả tiền cho mỗi token output. Và họ giảm giá để kéo khách hàng từ OpenAI (GPT-4o output $15) và Anthropic (Claude 3.5 Sonnet $15).
Nhưng đây là một canh bạc. Bởi vì nếu model không thực sự tốt hơn về chất lượng, việc giảm giá chỉ thu hút những người dùng nhạy cảm về giá, những người sẽ rời bỏ bạn ngay khi đối thủ giảm giá tiếp theo. Và trong ngành AI, vòng xoáy giảm giá đã bắt đầu.
Agent path compression: Con dao hai lưỡi
Bài báo gốc chỉ ra rằng Google đã “giảm số bước suy luận và tool calling loop”. Điều này có thể đạt được bằng cách distill từ một model lớn hơn, hoặc sử dụng kỹ thuật speculative sampling. Nhưng tôi nghi ngờ rằng họ đã cắt bỏ các bước kiểm tra an toàn. Trong các agent, việc giảm số lần gọi tool đồng nghĩa với việc model ít cơ hội hơn để tự sửa lỗi hoặc xác minh kết quả. Một agent có thể hoàn thành nhiệm vụ nhanh hơn, nhưng cũng dễ mắc lỗi nghiêm trọng hơn. Và khi lỗi xảy ra, chi phí sửa chữa có thể vượt xa số tiền tiết kiệm được từ output token.
Hãy nhìn vào con số: DeepSWE 49% có nghĩa là trong một bài kiểm tra gồm 100 task, model chỉ hoàn thành đúng 49 task. 51 task còn lại thất bại – và trong số đó, có thể có những lỗi nguy hiểm như xóa dữ liệu, chèn lỗi bảo mật, v.v. Đối với các doanh nghiệp, đây là rủi ro không thể chấp nhận. Và đó là lý do tại sao các công ty công nghệ lớn vẫn chưa dám để AI tự động hóa hoàn toàn quy trình phát triển.

Tokenomics mới: Bán rẻ để chiếm thị phần
Google đang thực hiện chiến lược “loss leader” – bán dưới giá vốn để giành thị phần, sau đó sẽ tăng giá sau. Nhưng trong ngành AI, điều này có thể gây phản tác dụng. Nếu khách hàng chỉ đến vì giá rẻ, họ sẽ đi khi có giá rẻ hơn. Và OpenAI, với nguồn lực tài chính khổng lồ, hoàn toàn có thể đáp trả bằng một đợt giảm giá khác.
Tôi đã thấy kịch bản này nhiều lần trong crypto. Các DEX như Uniswap từng miễn phí, nhưng khi thị trường dịch chuyển, họ phải thu phí. Các L2 từng tặng token để thu hút thanh khoản, nhưng khi phần thưởng kết thúc, người dùng bỏ đi. Google đang lặp lại sai lầm tương tự.
Gemini 4: Liều thuốc tinh thần
Việc thông báo pre-train Gemini 4 cùng lúc với ra mắt Gemini 3.6 Flash là một động thái tâm lý. Nó nói với thị trường: “Đừng lo, chúng tôi vẫn đang đầu tư lớn, đây chỉ là bước đệm”. Nhưng hãy nhìn vào lịch sử. Google đã hứa hẹn nhiều lần: Gemini 1, Gemini 2, Gemini 3… mỗi lần đều được quảng cáo là “bước ngoặt”, nhưng thực tế chỉ là cải tiến nhỏ. Và càng ngày, khoảng cách với OpenAI càng xa. Việc pre-train Gemini 4 có thể mất 6-12 tháng, tốn hàng tỷ đô, và kết quả vẫn chưa chắc chắn. Trong thời gian đó, OpenAI có thể ra mắt GPT-5, và Anthropic có thể ra Claude 4. Google sẽ lại rơi vào thế bị động.
Contrarian Angle: Phần bull đúng
Tuy nhiên, tôi phải thừa nhận rằng có một số điểm sáng. Việc tập trung vào agent và hiệu quả chi phí là đúng hướng. Thị trường AI đang chuyển từ “model nào thông minh nhất” sang “model nào giải quyết được vấn đề thực tế với chi phí thấp nhất”. Google đã nhận ra điều này và điều chỉnh. DeepSWE 49% và MLE 63.9% là những con số ấn tượng, nếu được xác thực độc lập. Thêm vào đó, việc giảm 31% chi phí tổng thể (17% output usage + 16.7% price) có thể đủ sức thuyết phục các startup và SME chuyển từ OpenAI sang Google Cloud Vertex AI.
Và nếu Gemini 4 thực sự thành công – nếu nó đạt đến trình độ của GPT-5 – thì Google sẽ có lợi thế lớn về tích hợp hệ sinh thái: Search, Cloud, YouTube, Android. Khi đó, Gemini 3.6 Flash chỉ là một món khai vị trước bữa chính. Nhưng đó là một “nếu” rất lớn.
Takeaway: Bỏ qua hype, nhìn vào on-chain reality
Trong crypto, chúng tôi có câu: “Don’t trust, verify.” Với AI cũng vậy. Đừng tin vào những con số benchmark do Google tự công bố. Hãy đợi các bài kiểm tra độc lập từ LMSYS, Artificial Analysis, và các nhà nghiên cứu. Hãy xem xét liệu model này có thực sự tốt hơn trong các tác vụ thực tế, hay chỉ tốt hơn trong phòng thí nghiệm.
Đối với các nhà đầu tư: Gemini 3.6 Flash không phải là game changer. Google vẫn đang chạy theo OpenAI. Nhưng nếu bạn muốn đặt cược vào khả năng phục hồi của Google, hãy nhìn vào Gemini 4 – nhưng hãy nhớ rằng trong AI, cũng như trong crypto, pre-train một model lớn không khác gì khởi động một mạng lưới mainnet: nó có thể thành công vang dội, hoặc thất bại thảm hại. Và khi đó, những người mua ở đỉnh sẽ là những người chịu thiệt.

Còn đối với các nhà phát triển: Hãy tận dụng giảm giá, nhưng đừng phụ thuộc vào một vendor duy nhất. Hãy giống như một on-chain detective: luôn có kế hoạch dự phòng, luôn kiểm tra mã nguồn, và luôn đặt câu hỏi: liệu sự tiện lợi hôm nay có đánh đổi bằng rủi ro ngày mai?