Đang giao dịch, tôi thấy một tín hiệu lạ: dòng lệnh mua vào GPU H100 của Nvidia trên thị trường chợ đen Trung Quốc đột ngột chững lại. Giá vẫn cao, nhưng volume giảm mạnh. Trong khi đó, cổ phiếu của các công ty chip nội địa như Moore Threads lại nhích nhẹ. Có gì đó đang thay đổi trong cách 'smart money' nhìn nhận về tương lai của inference (suy luận) AI.
Đây không phải là một bài phân tích về một đồng coin hay một blockchain. Đây là về hạ tầng của nền kinh tế AI đang hình thành, thứ sẽ quyết định tokenomics của hàng trăm dự án crypto trong tương lai.
Context: 'Chip Vạn Năng' Không Còn Là Chân Lý
Tuần trước, tôi đọc được bài phỏng vấn của Wang Dong, đồng sáng lập Moore Threads (Một trong những startup GPU đầy hứa hẹn nhất của Trung Quốc). Luận điểm của anh ta rất đơn giản: "Không có 'chip vạn năng' nào cho thị trường inference, mà chỉ có sự kết hợp của nhiều giải pháp".
Nếu bạn là một 'battle trader' kỳ cựu, bạn sẽ ngửi thấy ngay mùi của một 'narrative' mới. Nó giống như khi Vitalik tuyên bố 'Ethereum không thể là một lớp duy nhất cho mọi thứ' và khai sinh ra Rollup-centric roadmap vậy. Một lời thừa nhận rằng mô hình cũ (một chip cho mọi việc) đã chết.
Thị trường inference đang phân mảnh dữ dội: chat online cần độ trễ thấp, batch generation cần throughput cao, code completion cần streaming, video generation cần VRAM khổng lồ. Dùng một con chip 'vạn năng' cho mọi thứ giống như dùng một con dao đa năng để mổ bò vậy—vừa không hiệu quả, vừa tốn kém.
Core Insight: Sự Trỗi Dậy Của 'ISP' Và Bản Chất Của 'Combination'
Điểm cốt lõi trong phân tích của tôi là sự xuất hiện của một lớp trung gian mới: ISP (Inference Service Provider).
Đừng nhầm với ISP Internet Service Provider. Ở đây, ISP là những công ty chuyên 'đóng gói' và tối ưu hóa inference trên nhiều loại chip khác nhau (Nvidia, AMD, Intel, Moore Threads, Huawei...). Họ sẽ là những người xây dựng 'cỗ máy' tối ưu nhất cho từng mô hình AI cụ thể.
Hãy nghĩ về nó như một 'Aggregation Layer' trong DeFi vậy. Thay vì bạn phải tự đi tìm pool thanh khoản tốt nhất (từng con chip cho từng tác vụ), bạn chỉ cần gửi lệnh cho ISP (Aggregator), và nó sẽ tự động chọn con đường tối ưu.
Wang Dong nói: "Thông qua sự kết hợp phần mềm và phần cứng (software-hardware co-design), mỗi mô hình đều có thể tìm thấy tổ hợp phần cứng phù hợp nhất." Đây chính là lời kêu gọi cho một thị trường mở, nơi không ai độc quyền. Và điều này có lợi cho tất cả các 'ông lớn' ngoài Nvidia.
Từ kinh nghiệm audit code của tôi, tôi thấy sự tương đồng rõ rệt. Giống như việc tối ưu hóa smart contract trên Ethereum, việc tối ưu inference trên các chip khác nhau đòi hỏi sự hiểu biết sâu sắc về compiler, operator libraries và scheduling engine. Đây là mảnh đất màu mỡ cho các chuyên gia kỹ thuật, chứ không chỉ là câu chuyện về 'con chip nào mạnh hơn'.
Một dòng lệnh thanh lý sai, cả quỹ có thể bay màu. Một lựa chọn chip sai cho inference cũng vậy—bạn sẽ bị đối thủ cạnh tranh bỏ xa về chi phí.
Contrarian Angle: 'ISP' Là Cơ Hội Hay Cái Bẫy Của Các Startup Chip?
Đây là phần quan trọng nhất. Wang Dong vẽ ra một bức tranh đẹp: các ISP mọc lên như nấm, tạo ra một hệ sinh thái mở, phá vỡ thế độc tôn của Nvidia. Nhưng với tư cách là một 'battle trader', tôi nhìn thấy một 'contrarian signal' ở đây.
Tại sao Moore Threads lại phải kêu gọi một 'giải pháp kết hợp'? Bởi vì họ không thể tự mình làm được.
Nvidia có CUDA, một hệ sinh thái khép kín nhưng vô cùng mạnh mẽ. Nếu bạn mua một con chip Nvidia, bạn gần như được đảm bảo rằng mọi mô hình AI đều chạy được, có thể với hiệu suất không phải là tối ưu nhất, nhưng đủ để bạn 'plug and play'. Đối với một doanh nghiệp, sự tiện lợi này là vô giá.
Moore Threads không có điều đó. Họ không thể cạnh tranh trực tiếp với Nvidia trên mọi mặt trận. Vì vậy, họ phải tạo ra một 'narrative' mới, nơi mà sức mạnh đến từ sự kết hợp, và họ là một phần không thể thiếu trong 'bộ sưu tập' đó. Đây là một chiến thuật marketing thông minh, nhưng cũng là một sự thừa nhận về điểm yếu của chính họ.
'Chip vạn năng' thực ra đang tồn tại, đó là Nvidia H100. Vấn đề là nó quá đắt và bị hạn chế xuất khẩu vào Trung Quốc. Nếu không có lệnh trừng phạt, câu chuyện về 'ISP' và 'giải pháp kết hợp' sẽ khó có đất để sống.
Takeaway: Cơ Hội Cho Các 'DePIN' Và 'Compute Marketplaces'
Vậy điều này có ý nghĩa gì đối với thị trường crypto?
Tôi cho rằng luận điểm của Wang Dong là một tín hiệu cực kỳ tích cực cho các dự án DePIN (Mạng lưới hạ tầng vật lý phi tập trung) và các 'Compute Marketplace' (Chợ tính toán). Các dự án như io.net, Akash Network, hay Render Network từ lâu đã cố gắng tập hợp các GPU rải rác để tạo thành một 'siêu máy tính' phi tập trung. Nhưng họ luôn gặp phải một vấn đề: khó khăn trong việc tối ưu hóa inference trên các loại GPU khác nhau.
Nếu mô hình 'ISP' thành công, nó sẽ cung cấp một lớp trừu tượng hóa (abstraction layer) hoàn hảo cho các DePIN. ISP sẽ là bên chịu trách nhiệm về mặt kỹ thuật để 'chạy' mô hình trên bất kỳ loại chip nào, trong khi DePIN chỉ đơn giản là cung cấp nguồn lực tính toán.
Đây có thể là 'killer use case' cho các mạng lưới compute phi tập trung—giải quyết vấn đề về tính phức tạp kỹ thuật, vốn là rào cản lớn nhất của họ. Nếu điều này xảy ra, chúng ta sẽ chứng kiến một làn sóng đầu tư mới vào các dự án DePIN, và giá trị của các token liên quan đến compute power sẽ tăng vọt.
Nhưng cũng đừng quên, đây mới chỉ là một 'narrative'. Giống như nhiều 'narrative' khác trong crypto, nó có thể thành công hoặc thất bại. Hãy nhìn vào những con số: khối lượng giao dịch thực tế của các nền tảng DePIN, số lượng mô hình AI thực sự được chạy trên chúng, và các quan hệ đối tác với các ISP. Đó mới là 'on-chain data' thực sự cần được theo dõi.