89% chặn, 13,6% con người: Tại sao tôi không tin Claude Code Auto Mode?

DeFi | Đặng Quân |
89%. Đó là tỉ lệ các lệnh nguy hiểm mà Auto Mode của Claude Code chặn được trong thử nghiệm nội bộ của Anthropic. Trong cùng điều kiện, con người chỉ chặn được 13,6%. 97% yêu cầu quyền được phê duyệt mà không kiểm tra. Hơn 25% phiên làm việc tắt hẳn tính năng xác minh. Số liệu đẹp đến mức khó tin. Nhưng khoan. Tôi không hứng thú với việc Anthropic tung hô sản phẩm mới. Tôi hứng thú với một mối quan hệ nguy hiểm đang hình thành: khi AI bắt đầu tự giám sát chính nó, những lỗ hổng thuộc về con người sẽ lộ ra ở đâu? Sau hơn một thập kỷ audit smart contract và xây dựng hệ thống giao dịch, tôi đã thấy quá nhiều thứ được dán nhãn an toàn hóa ra chỉ là một bức tường sơn mỏng. Vấn đề xuất phát từ approval fatigue – sự mệt mỏi khi phải phê duyệt lặp đi lặp lại. Các công cụ lập trình AI như Claude Code ngày càng mạnh, chúng cần thực thi lệnh trên terminal, đọc file, gửi request. Mỗi hành động đều phải xin quyền. Người dùng bắt đầu với ý thức kiểm tra cẩn thận, nhưng sau một thời gian, họ bấm cho phép như một phản xạ. Anthropic công bố con số chấn động: 97% yêu cầu được chấp thuận, và sau 50 popup liên tiếp, tỉ lệ chặn của con người giảm xuống còn 5%. Vì vậy họ quyết định thực hiện một cuộc đổi mới: Auto Mode được bật mặc định. Thay vì hỏi người dùng, hệ thống dùng một bộ phân loại rủi ro – safety classifier – tự đánh giá từng hành động. Nếu hành động nguy hiểm như xóa dữ liệu hoặc gửi thông tin ra ngoài, nó chặn lại. Nếu an toàn, nó tự cho phép. Cơ chế này hợp lý về vận hành, nhưng mở ra một loạt câu hỏi chưa ai trả lời: ai kiểm tra người kiểm tra? Hãy nhìn vào kỹ thuật. Auto Mode không phải một agent mới. Nó là một lớp trung gian: một classifier được huấn luyện để quyết định hành động nào an toàn, hành động nào cần chặn. Mỗi quyết định tiêu tốn một lượng nhỏ token, nhưng Anthropic tuyên bố người dùng Pro, Max và Team không phải trả thêm phí. Điều này cho thấy classifier có thể là một mô hình nhẹ hoặc được chia sẻ tài nguyên với mô hình chính. Đây là một thiết kế thông minh, nhưng nó đặt trọn niềm tin vào một bộ lọc duy nhất. Nếu bộ lọc chặn nhầm một câu lệnh hợp lệ, người lập trình sẽ bực bội. Lặp lại nhiều lần, họ sẽ tắt Auto Mode. Và khi một cơ chế bảo vệ bị tắt vì khó chịu, hậu quả còn tồi tệ hơn là không có bảo vệ ngay từ đầu. Tôi từng thấy điều này trong thế giới crypto: các sàn giao dịch ép người dùng xác thực hai lớp, người dùng than phiền, sàn nới lỏng, sau đó một vụ hack lớn xảy ra. Lịch sử lặp lại đúng kịch bản đó. Vấn đề thứ nhất: tấn công đa bước. Kẻ tấn công thông minh sẽ không ra lệnh xóa toàn bộ dữ liệu ngay từ đầu. Hắn sẽ chèn một đoạn mã tưởng như vô hại, đợi phiên sau, rồi dùng biến môi trường để trích xuất dữ liệu. Classifier chỉ đánh giá từng thao tác riêng lẻ, nên không thể thấy bức tranh toàn cảnh. Trong những vụ audit smart contract tôi từng tham gia, cuộc tấn công nguy hiểm nhất thường trải qua nhiều bước, mỗi bước trông an toàn nếu đứng riêng. Vấn đề thứ hai: prompt injection. Đã có nhiều nghiên cứu cho thấy mô hình ngôn ngữ lớn có thể bị thao túng bằng các câu lệnh ẩn trong dữ liệu đầu vào. Một file code chứa chú thích độc hại có thể lái agent làm theo ý đồ xấu, vượt qua cả lớp bảo vệ. Anthropic chưa công bố kết quả red team độc lập, chưa nói rõ tỉ lệ chặn nhầm là bao nhiêu. Con số 89% nghe hoành tráng, nhưng nếu không biết 11% còn lại gồm những gì, bạn đang tự nguyện trao quyền cho một hộp đen. Điều khiến tôi bận tâm hơn là trách nhiệm. Khi con người phê duyệt sai một lệnh, họ chịu trách nhiệm. Khi Auto Mode tự cho phép một hành động nguy hiểm, ai chịu trách nhiệm? Người dùng vẫn là người gõ lệnh, nhưng quyết định đã được chuyển cho một cỗ máy. Trong tài chính, không ai chấp nhận một chiến lược tự động mà không có nút dừng khẩn cấp, không có log chi tiết, không có ai đứng ra chịu lỗi khi hệ thống khởi tạo lệnh sai. Nhưng Anthropic đang cung cấp Auto Mode như tính năng mặc định, trong khi tài liệu không nói rõ ai chịu trách nhiệm khi classifier đánh giá sai. Đó là một rủi ro pháp lý và kỹ thuật mà thị trường chưa định giá. Và đến phần tôi muốn nói riêng: con số 89% đẹp đến mức tôi nghi ngờ nó được chọn lọc rất kỹ. Giống như trong crypto, các dự án khoe TVL cao, khoe số người dùng, nhưng khi audit token thì không công bố báo cáo rò rỉ. Hãy thử hỏi: tập dữ liệu đánh giá là gì? Ai chọn ra các câu lệnh nguy hiểm đó? Có bao gồm prompt injection, tấn công đa bước, hay chỉ là các lệnh rm -rf đơn giản? Nếu bạn huấn luyện classifier để nhận diện một nhóm lệnh cụ thể, tỉ lệ 89% chỉ phản ánh khu vực bạn khoanh vùng, không phải thế giới thực. Việc miễn phí token cho Auto Mode không phải từ thiện. Mỗi lần classifier hoạt động, nó thu thập dữ liệu về hành vi người dùng, về cách họ phản ứng với cảnh báo. Người dùng nghĩ họ đang được bảo vệ, nhưng thực ra họ đang trở thành nhân viên không lương cho một hệ thống học máy khổng lồ. Chúng ta đang chứng kiến sự chuyển giao niềm tin từ con người sang thuật toán. Trong lịch sử, mọi hệ thống tự động hóa đều có một giai đoạn nông nổi, nơi tốc độ được đánh đổi bằng độ an toàn. Thị trường crypto từng trải qua giai đoạn đó với hợp đồng thông minh. Thị trường công cụ lập trình đang lặp lại. Tôi vẫn sẽ dùng Auto Mode. Nhưng tôi sẽ không bao giờ tin nó, bởi vì chặn được 89% mối nguy không có nghĩa là 11% còn lại không thể giết bạn. Mỗi lần chúng ta trao quyền cho AI tự giám sát, chúng ta trao luôn quyền định nghĩa điều gì là nguy hiểm. Nền tảng của sự an toàn không nằm ở một classifier tinh vi, mà nằm ở khả năng thiết kế hệ thống để cả AI lẫn con người đều có thể đặt câu hỏi tại sao, và bắt buộc phải được trả lời. Hãy theo dõi ba tháng tới, trước khi bạn để một cỗ máy quyết định số phận mã nguồn và dữ liệu khách hàng của mình. Số liệu không nói dối, nhưng người chọn số liệu luôn có chủ ý. Một bức tường cao không làm căn nhà an toàn nếu cửa chính vẫn mở toang. Khi con người bấm cho phép 97 lần, họ không còn là người giám sát, chỉ là một con dấu tự động.

89% chặn, 13,6% con người: Tại sao tôi không tin Claude Code Auto Mode?

89% chặn, 13,6% con người: Tại sao tôi không tin Claude Code Auto Mode?

Giá thị trường

BTC Bitcoin
$78,999.4 -2.14%
ETH Ethereum
$2,464.21 -1.75%
SOL Solana
$96.85 -4.63%
BNB BNB Chain
$699.9 -2.07%
XRP XRP Ledger
$1.44 -4.71%
DOGE Dogecoin
$0.0868 -6.01%
ADA Cardano
$0.2112 -6.18%
AVAX Avalanche
$7.4 -2.72%
DOT Polkadot
$0.8577 -5.79%
LINK Chainlink
$11.37 -3.44%

Sợ & Tham

65

Tham lam

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
1
Bitcoin
BTC
$78,999.4
1
Ethereum
ETH
$2,464.21
1
Solana
SOL
$96.85
1
BNB Chain
BNB
$699.9
1
XRP Ledger
XRP
$1.44
1
Dogecoin
DOGE
$0.0868
1
Cardano
ADA
$0.2112
1
Avalanche
AVAX
$7.4
1
Polkadot
DOT
$0.8577
1
Chainlink
LINK
$11.37

🐋 Theo dõi cá voi

🔵
0xe1cf...25e4
30 phút trước
Stake
19,390 BNB
🟢
0x6987...36ef
6 giờ trước
Chuyển vào
46,688 BNB
🔴
0x76c7...75c5
3 giờ trước
Chuyển ra
17,045 BNB

💡 Smart Money

0xb94e...3094
Nhà tạo lập thị trường
+$2.3M
66%
0x1632...d808
Thợ đào DeFi hàng đầu
-$4.1M
70%
0x10e4...de54
Thợ đào DeFi hàng đầu
-$4.3M
64%

🧮 Công cụ

Tất cả →