Hook
Một con số: 2.000 tỷ đến 3.000 tỷ tham số. Đó là những gì Moon’s Dark Side – startup AI Trung Quốc đình đám – vừa công bố cho mô hình Kimi K3. So với Claude 3.5 Sonnet của Anthropic (ước tính 1.800 tỷ tham số), con số này như một cú tát thẳng mặt. Nhưng với 26 năm trong ngành giao dịch định lượng, tôi biết rằng trong crypto cũng như AI, càng lớn chưa chắc càng tốt. Hãy nhìn cách các dự án layer-2 từng hét giá trị TVL khủng rồi sụp đổ. Tham số tổng cộng là một vanity metric, không khác gì total supply trong memecoin. Đã đến lúc mổ xẻ con số này bằng chính công cụ tôi dùng để audit smart contract: phân tích dữ liệu gốc.
Context
Đầu tháng 6/2025, Financial Times đưa tin Moon’s Dark Side (Công ty mẹ của Kimi Chat) đang phát triển Kimi K3 với tham số từ 2.000 tỷ đến 3.000 tỷ, nhắm trực tiếp vào Anthropic – đối thủ cạnh tranh hàng đầu trong lĩnh vực AI an toàn. Đây không phải lần đầu Moon’s Dark Side cao kỳ vọng. Họ từng gây chú ý năm 2023 với Kimi Chat hỗ trợ 2 triệu token tiếng Trung, dài hơn bất kỳ đối thủ nào. Nhưng lần này, tham số là vũ khí chính. Trong bối cảnh thị trường AI đang nóng với làn sóng ETF (tương tự ETF Bitcoin), các quỹ đầu tư mạo hiểm đổ hàng tỷ USD vào các startup AI. Moon’s Dark Side đã huy động khoảng 1 tỷ USD từ Alibaba, Sequoia, Tencent. K3 có thể là quân bài để bắt đầu vòng Series C với định giá tới 6-7 tỷ USD.
Tuy nhiên, cần hiểu bối cảnh kỹ thuật: Hầu hết mô hình ngôn ngữ lớn ngày nay (GPT-4, Claude 3.5) đều dùng kiến trúc Mixture-of-Experts (MoE). Tổng tham số bao gồm tất cả các “expert”, nhưng chỉ một phần nhỏ được kích hoạt cho mỗi token. Với 2.000-3.000 tỷ tham số, số lượng expert có thể lên tới 512-1024, nhưng chỉ 4-8 expert được kích hoạt, tương đương 200-300 tỷ tham số thực tế. Con số này ngang ngửa Claude 3.5. Vậy đâu là đột phá?
Core
Tôi sẽ phân tích từng lớp dữ liệu giống như khi tôi xây dựng bot trading: nếu – thì, kiểm tra tín hiệu thị trường.
1. Tham số tổng vs tham số kích hoạt Giả sử K3 có 2.500 tỷ tham số tổng, với 256 expert, tỷ lệ kích hoạt 2/256 (0,78%). Khi đó tham số kích hoạt chỉ ~19,5 tỷ – thậm chí thấp hơn cả GPT-3 (175 tỷ) nếu so sánh không đồng đều. Các báo cáo cho thấy GPT-4 có 1.800 tỷ tham số tổng, kích hoạt ~280 tỷ. Claude 3.5 kích hoạt ~200 tỷ. Như vậy, K3 chỉ vượt trội về tổng tham số, không phải về lượng tính toán mỗi token. Nếu Moon’s Dark Side không cung cấp con số kích hoạt, đó là dấu hiệu đỏ.
2. Chi phí đào tạo và định luật Chinchilla Theo định luật Chinchilla của DeepMind, với 2.500 tỷ tham số, cần ít nhất ~175 nghìn tỷ token dữ liệu. Con số này gấp đôi lượng dữ liệu công khai hiện có (The Pile, C4, Reddit, Wikipedia). Để có đủ dữ liệu chất lượng cao cho tiếng Trung và tiếng Anh, Moon’s Dark Side phải dùng dữ liệu tổng hợp hoặc web crawl cực lớn. Chi phí đào tạo: Với H100 (hiệu suất ~197 TFLOPs FP8), cần ~2×10^22 FLOPs, tương đương 1.000-2.000 giờ trên 10.000 GPU H100. Với giá thuê H100 ~3-4 USD/giờ, tổng chi phí 30-40 triệu USD chỉ riêng đào tạo. Nhưng Mỹ cấm xuất khẩu H100 sang Trung Quốc. Vậy Moon’s Dark Side đào tạo trên chip nào? Huawei Ascend 910B? Hiệu suất chỉ bằng 60-70% H100. Hoặc dùng đường ngầm? Nếu không có lời giải thích, con số tham số là “ảo”.
3. So sánh điểm chuẩn – sự vắng mặt đáng ngờ Bài báo Financial Times không đưa ra bất kỳ điểm chuẩn nào (MMLU, GSM8K, HumanEval, SWE-bench). Trái với báo cáo về dự án crypto, thông thường các đội ngũ uy tín sẽ công bố benchmark khi ra mắt mô hình mới. Việc chỉ công bố tham số là chiêu trò marketing điển hình: dùng số lớn để gây sốc. Nhìn lại lịch sử: Năm 2020, GPT-3 (175 tỷ) gây bão vì benchmark, không phải tham số. Năm 2024, Llama 3.1 405B công bố điểm số so với GPT-4. Còn K3 im lặng.
4. Bài học từ ICO và NFT Năm 2017, tôi từng xây dựng bộ lọc ICO dựa trên 7 dấu hiệu lừa đảo. Một trong số đó: “dự án chỉ nói về tổng vốn huy động, không nói về sản phẩm”. Tương tự, K3 chỉ nói về tham số, không nói về độ chính xác, độ trễ, context window. Đó là red flag số một. Năm 2021, tôi dùng ML dự đoán floor price của CryptoPunks: 78% chính xác nhờ phân tích metadata và lịch sử giao dịch. Ở đây, Moon’s Dark Side chưa cung cấp “metadata” (kiến trúc, tập dữ liệu, số GPU). Vậy không thể xác nhận.
Contrarian
Quan điểm phản trực giác: Tham số lớn hơn không giúp ích cho hầu hết ứng dụng thực tế. Trong giao dịch quant, yếu tố quyết định thường là tín hiệu đơn giản và quản lý rủi ro, không phải mô hình phức tạp nhất. Với AI, các nghiên cứu gần đây cho thấy mô hình nhỏ hơn nhưng có dữ liệu chất lượng và tập trung vào alignment (như Claude 3.5 Haiku) vượt trội hơn mô hình lớn không alignment trong các tác vụ an toàn. Moon’s Dark Side lại bỏ qua yếu tố an toàn. Họ không công bố bất kỳ kết quả red teaming hoặc đánh giá độc hại nào. So với Anthropic – công ty tự hào về Constitucional AI – thì K3 như một con robot khổng lồ không có phanh.
Thêm vào đó, commercial landscape: Moon’s Dark Side chưa có API pricing công khai, chưa có doanh thu B2B rõ ràng. Trong khi Anthropic có Claude Pro ($20/tháng) và doanh thu hàng trăm triệu USD từ API. Việc “thách thức Anthropic” chỉ là lời nói suông. Giống như khi các altcoin tuyên bố “thách thức Ethereum” nhưng không có hệ sinh thái dApp nào. Tôi từng chứng kiến bao nhiêu dự án layer-2 rồi? Họ nói về TPS, cuối cùng chẳng ai dùng.
Takeaway
Vậy câu hỏi cho độc giả: Bạn có sẵn sàng đặt cược vào một mô hình chỉ có con số tham số, không có benchmark, không có bằng chứng tính toán, và nằm dưới lệnh trừng phạt chip? Tôi sẽ không làm thế, vì kỷ luật cá nhân dạy tôi chỉ giao dịch dựa trên dữ liệu kiểm chứng được. Nếu K3 thực sự vượt trội, họ sẽ công bố điểm MMLU. Nếu không, đây chỉ là một bài PR khác trước vòng gọi vốn. Trong thị trường tăng này, FOMO mù quáng – dù là AI hay crypto – đều kết thúc giống nhau.