HomeTECH6TB dữ liệu, một router AI ở Trung Quốc,...

6TB dữ liệu, một router AI ở Trung Quốc, và lý do bạn không nên dán mật khẩu vào chatbot

Một nhà nghiên cứu vừa nói anh mua được 6TB dữ liệu lộ ra từ một dịch vụ trung gian AI ở Trung Quốc. Chuyện đó có thể chưa xác minh hết, nhưng cơ chế đứng sau nó thì đã được chứng minh, và nó liên quan trực tiếp đến cách rất nhiều người đang dùng AI mỗi ngày.

- Advertisement -

Nội dung

Ngày 10/9, một nhà nghiên cứu bảo mật tên Chaofan Shou đăng lên X rằng anh vừa mua được một bộ dữ liệu 6TB từ một trong những “router AI” lớn của Trung Quốc, và bên trong có đủ SSH key, cấu hình VPN, key Aliyun, token GitLab để chiếm quyền truy cập vào hệ thống của Huawei, Xiaomi, NIO, MiniMax cùng bảy cơ quan chính phủ Trung Quốc và các nước SNG. Đây không phải chuyện đọc trộm vài dòng chat vu vơ. Đó là chìa khóa thật, dẫn vào hạ tầng thật.

Câu hỏi đầu tiên khi đọc một tin như vậy không nên là nó có đáng sợ không, mà là nó có thật không, và nếu thật thì cơ chế nào khiến nó xảy ra được.

Router AI là gì, và tại sao nó thấy được mọi thứ?

Khi bạn hay một công cụ AI nào đó gọi đến một mô hình như Claude hay GPT, thay vì gọi thẳng đến hãng, rất nhiều nơi (đặc biệt là các đội dùng AI để code, chạy agent tự động) đi qua một lớp trung gian gọi là router. Router hứa hẹn ba thứ: rẻ hơn, tự động chuyển sang mô hình khác nếu một bên sập, và gộp nhiều nhà cung cấp vào một hóa đơn.

Nhưng router muốn làm được việc đó thì buộc phải đọc được toàn bộ nội dung đi qua nó, ở dạng chưa mã hóa. Không chỉ câu hỏi bạn gõ, mà cả lệnh mà AI agent sắp thực thi trên máy bạn, cả bất cứ thứ gì bạn dán vào để AI xử lý giúp, kể cả khi đó là một API key hay một private key bạn quên xóa trước khi gửi.

6TB dữ liệu, một router AI ở Trung Quốc, và lý do bạn không nên dán mật khẩu vào chatbot

Đây chính xác là điều một nhóm nghiên cứu (trong đó có Chaofan Shou) đã mô tả trong một paper học thuật công bố hồi tháng 4 năm nay, tên “Your Agent Is Mine”. Nhóm này mua và thu thập 428 router AI đang bán hoặc phát miễn phí trên Taobao, Xianyu và vài nơi khác, rồi kiểm tra xem chúng làm gì với dữ liệu đi qua. Kết quả: 9 router chèn thẳng mã độc vào lệnh mà AI trả về cho người dùng thực thi, 17 router chạm vào các khóa “mồi” (canary key) mà nhóm nghiên cứu cố tình cài để bẫy, và 1 router rút sạch ETH từ một ví thử nghiệm. Nhóm cũng nói thêm, ngoài phạm vi paper, rằng họ từng chứng kiến một router rút mất 500.000 đô của một khách hàng thật, và bản thân họ cũng dựng thử một router “đầu độc” để chuyển hướng traffic, chiếm được khoảng 400 máy chủ chỉ trong vài giờ.

Phần này thì không còn là lời một cá nhân. Đây là một paper được đăng công khai trên arXiv và đã được vài nghiên cứu khác trích dẫn lại, tức là có người ngoài đọc và không phản bác các con số. Nói cách khác: cơ chế “router đọc được, sửa được mọi thứ đi qua nó” là thật, đã được đo đếm cẩn thận, không phải suy đoán.

Còn vụ 6TB thì sao

Đây là phần cần thận trọng hơn. Tất cả những gì đang lan truyền về vụ 6TB, gồm cả con số 19 công ty và 7 cơ quan chính phủ, đều bắt nguồn từ đúng một bài đăng của Chaofan Shou. Vài trang công nghệ có đưa lại, nhưng tất cả đều dẫn về cùng một nguồn đó, không phải một nguồn xác nhận độc lập thứ hai. Huawei, Xiaomi, NIO, MiniMax hay bất kỳ cơ quan nào được nêu tên cũng chưa lên tiếng xác nhận hay phủ nhận tại thời điểm bài này được viết.

Điều đáng nói là Shou không phải người vô danh bịa chuyện để câu view. Anh từng phát hiện và công bố một vụ lộ mã nguồn của Claude Code (công cụ lập trình của Anthropic), từng kiếm khoảng 1,9 triệu đô tiền thưởng tìm lỗi bảo mật, và là đồng tác giả chính paper “Your Agent Is Mine” nói trên. Nên đây không phải kiểu tin đồn vô căn cứ, mà là một cáo buộc nghiêm túc, từ một người có hồ sơ đáng tin, nhưng vẫn đang ở dạng “một người nói vậy” chứ chưa phải “đã được xác minh bởi bên thứ ba”. Một chi tiết khác, con số “giá 5 con số” cho bộ dữ liệu, mình không tìm thấy ở bất kỳ nguồn nào, kể cả bài đăng gốc, nên xin phép bỏ qua, không đưa vào như một fact.

Vì sao chuyện này không chỉ là chuyện của dân code Trung Quốc?

Nếu chỉ dừng ở một vụ leak chưa xác minh hết, bài này không đáng viết. Cái đáng nói là bối cảnh phía sau nó lớn hơn nhiều. Báo cáo thường niên của GitGuardian, một công ty chuyên quét các credential bị lộ trên GitHub, công bố hồi tháng 3 năm nay cho thấy số secret liên quan đến dịch vụ AI bị lộ công khai tăng 81% chỉ trong một năm, lên hơn 1,27 triệu lượt. Cùng báo cáo đó ghi nhận các commit code có AI hỗ trợ để lộ secret với tỷ lệ gấp đôi commit do người viết hoàn toàn thủ công.

Nói thẳng ra: thói quen dán nguyên một đoạn log, một file cấu hình, hay một đoạn code có sẵn key vào khung chat AI để nhờ debug nhanh đang phổ biến hơn bao giờ hết, và phần lớn người làm việc đó không nghĩ đến việc đoạn hội thoại ấy sẽ đi qua bao nhiêu lớp trung gian trước khi đến được mô hình. Hồi còn vận hành M.T.V ở giai đoạn mạng xã hội, mình cũng từng phải quyết định nơi nào được phép chạm vào key thật của hệ thống, và bài học rút ra khi đó rất đơn giản: mỗi lớp trung gian thêm vào là một nơi nữa có thể đọc được thứ mình tưởng chỉ hai bên biết.

Vậy nên giữ lại điều gì?

Không cần hoảng loạn, và cũng không cần chờ vụ 6TB được xác minh xong mới hành động, vì bài học ở đây không phụ thuộc vào việc con số 19 công ty kia đúng hay sai. Vài việc cụ thể đáng làm ngay: đừng bao giờ dán nguyên văn API key, private key hay file .env vào bất kỳ khung chat AI nào, kể cả khi đang nhờ debug gấp. Nếu bắt buộc dùng router hoặc dịch vụ trung gian để tiết kiệm chi phí gọi model, ưu tiên chọn nơi có tên tuổi rõ ràng, chính sách không lưu log công khai, thay vì chọn theo giá rẻ nhất tìm được trên một group hay sàn thương mại không rõ ai đứng sau. Và nếu một key nào đó lỡ đi qua một kênh không chắc chắn, coi như nó đã lộ, thu hồi và đổi ngay, đừng đợi có bằng chứng bị lạm dụng mới hành động.

Cùng chuyên mục