An ninh mạng

Nghiên cứu của UpGuard phát hiện 16,326 cơ sở dữ liệu Supabase để lộ các bảng có thể đọc được

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

UpGuard vào ngày 25 tháng 9 năm 2026 nghiên cứu đã công bố xác định 16,326 cơ sở dữ liệu được lưu trữ trên nền tảng Supabase mà để lộ các bảng có thể đọc được trên web công cộng, trong một nghiên cứu mà công ty bảo mật mô tả là lớn nhất loại hình này.

Nghiên cứu được viết bởi Greg Pollock, Giám đốc Nghiên cứu và Phân tích của UpGuard. Nó báo cáo rằng hơn một nửa các cơ sở dữ liệu bị lộ cho thấy dấu hiệu của một số thông tin nhận dạng cá nhân, một tỷ lệ nhỏ hơn bao gồm mật khẩu hoặc token xác thực, và một số rất ít chứa dữ liệu thẻ tín dụng khả dĩ. Thông thường hơn, các nhà nghiên cứu đã phát hiện dấu hiệu rằng một hệ thống thanh toán đã được một trang web sử dụng, mà báo cáo lưu ý không nhạy cảm tự nó nhưng đánh dấu các trường hợp mà kẻ tấn công có thể can thiệp vào các giao dịch tài chính.

Supabase cung cấp các cơ sở dữ liệu Postgres được lưu trữ dưới dạng dịch vụ và, theo báo cáo, đã trở thành thành phần cốt lõi của các ứng dụng web được xây dựng thông qua “vibe coding” hỗ trợ AI. UpGuard cho biết Supabase đạt mức định giá 10 tỷ USD vào tháng 6 năm 2026 và mô tả nó là sản phẩm cơ sở dữ liệu được Claude Code đề xuất nhất. Trong các trường hợp mà nó xác định có mức độ lộ dữ liệu đáng kể, UpGuard cho biết đã thông báo cho các chủ sở hữu ứng dụng.

Phương pháp nghiên cứu

Thay vì liệt kê các ứng dụng mang dấu vết của các nền tảng vibe-coding như Lovable và Replit, các nhà nghiên cứu đã tìm kiếm các trang web độc lập hoạt động trên các tên miền chính của chúng. Báo cáo cho biết cách tiếp cận này nhằm nắm bắt các trang web được xây dựng bằng các tác nhân lập trình AI như Claude Code và Codex của OpenAI, cũng như các trang web hoạt động như doanh nghiệp thực tế thu thập dữ liệu khách hàng.

Theo báo cáo, các trang web sử dụng Supabase có thể được nhận dạng bằng cách tìm kiếm các tên khóa Supabase và địa chỉ cơ sở dữ liệu trong các tệp JavaScript công khai. Hai nguồn dữ liệu có giá trị nhất là BuiltWith, công cụ thực hiện nhận dạng công nghệ trên toàn web, và bộ dữ liệu Chrome UX Report trên BigQuery, cung cấp các tệp JavaScript thô có thể truy vấn để tìm các chỉ báo Supabase như địa chỉ cơ sở dữ liệu và khóa API.

Thông qua hai phương pháp này, nhóm đã thu thập khoảng 300,000 tên miền duy nhất có dấu hiệu sử dụng Supabase và truy vấn mỗi tên miền để tìm bảng “users”, dựa trên giả thiết rằng “users” là tên bảng phổ biến. Mỗi cơ sở dữ liệu trả về một trong ba phản hồi: không có dữ liệu có thể truy cập; không có bảng “users”, nhưng có gợi ý tên một bảng có thể truy cập; hoặc một trang kết quả. Do quy mô lớn của tập hợp ứng cử, các nhà nghiên cứu đã sử dụng sơ đồ bảng để đánh giá các loại dữ liệu có thể bị lộ thay vì đọc từng hàng, và thu thập nội dung trang chủ bằng mô hình AI phân loại mỗi mô hình kinh doanh là B2B, B2C, hỗn hợp, hoặc không áp dụng.

Các trường hợp rò rỉ dữ liệu đã được ghi nhận

Để xác nhận rằng các sơ đồ bị lộ chứa dữ liệu thực, các nhà nghiên cứu đã điều tra một tập con các cơ sở dữ liệu mà siêu dữ liệu cho thấy khả năng rò rỉ có ý nghĩa. Báo cáo chi tiết một số trường hợp.

Một cơ sở dữ liệu bị lộ liên quan đến dịch vụ mã xác thực một lần tại Philippines, gắn liền với một trang trại SIM, một hoạt động mà báo cáo mô tả là một phần của chuỗi cung ứng tội phạm mạng, trong đó một lượng lớn SIM điện thoại được sử dụng để đăng ký tài khoản giả trên nhiều nền tảng. Cơ sở dữ liệu này chứa hơn 2,000 người dùng với địa chỉ email, số điện thoại và số dư ví, cùng hơn 100,000 tin nhắn SMS chứa mã xác thực một lần, ID người gửi và mã SIM.

Theo báo cáo, 95% tin nhắn là mã xác thực, trong khi từ 2,000 đến 2,400 tin nhắn được lấy mẫu là các tin nhắn cá nhân thực, gần như toàn bộ là giao tiếp chia sẻ xe giữa tài xế và hành khách tại Philippines. Báo cáo cho biết những người này dường như không liên quan đến trang trại SIM và bị lộ do khối lượng lớn số điện thoại đi qua.

Một cơ sở dữ liệu khác thuộc về dịch vụ đỗ xe tại Đông Bắc Hoa Kỳ, sử dụng Supabase làm phần phụ trợ CRM. Nó để lộ hơn 100,000 khách hàng, mỗi người có số điện thoại, khoảng 43,000 trong số họ có địa chỉ email và họ tên đầy đủ, và khoảng 78,000 có số biển số xe, cùng với lịch sử lượt ghé thăm, giá trị trọn đời, lịch sử tiền boa và một trường ghi chú dạng văn bản tự do cho mỗi khách hàng. Bảng nhân viên chứa 665 hồ sơ nhân viên với địa chỉ email, số điện thoại và token push. Khoảng 11% địa chỉ email bị lộ (4,560) nằm trên các miền doanh nghiệp bên thứ ba, bao gồm các nhà tuyển dụng khu vực có thể nhận dạng như các trường đại học và các công ty trong Fortune 500, theo báo cáo.

Cơ sở dữ liệu cấu hình sai thứ ba chứa 25,000 người dùng với thông tin cá nhân và địa chỉ thực tế cho một lãnh sự quán do một chính phủ quốc gia châu Phi vận hành, bao gồm một trường xác định vị trí nhà ở khẩn cấp nơi các cá nhân hiện đang cư trú. UpGuard ghi chú rằng tính chất của hoạt động này có nghĩa là những người bị lộ thuộc vào nhóm dân cư dễ bị tổn thương.

Cơ sở dữ liệu thứ tư, dành cho dịch vụ cung cấp tư vấn di chuyển và nhập cư cho những người chuyển đến Canada, chứa gần 5,000 hồ sơ người dùng. Hầu hết đều bao gồm họ tên đầy đủ, địa chỉ email, số điện thoại và ngày sinh, và 884 hồ sơ cũng lưu mật khẩu dạng văn bản thuần, theo báo cáo.

Nghiên cứu trước đây và các mô hình rò rỉ

Vào tháng 3 năm 2025, nhà phát triển Matt Turner đã báo cáo về việc cấu hình sai rộng rãi của các cơ sở dữ liệu Supabase được tạo bởi nền tảng mã hóa vibe Lovable, một vấn đề được theo dõi dưới mã CVE-2025-48757. Kể từ đó, Supabase đã bật bảo mật cấp dòng (row level security) mặc định cho các bảng được tạo trong giao diện Table Editor, theo báo cáo. Các bảng được tạo bằng chương trình thông qua API, cách mà các tác nhân mã hóa tương tác với Supabase, không bật bảo mật này mặc định, và bảo mật cấp dòng cũng phải được cấu hình và sử dụng thông tin xác thực đúng cách để bảo vệ dữ liệu.

Nghiên cứu trích dẫn một số cuộc kiểm tra nhỏ hơn trước đây về cùng một vector lộ dữ liệu. Modern Pentest đã quét 107 công ty khởi nghiệp thuộc Y Combinator và phát hiện 28% đang để lộ thông tin cá nhân. Symbiotic Security đã quét 1.072 ứng dụng được mã hóa bằng vibe và tìm thấy 39 ứng dụng có các bảng có thể đọc được bằng khóa công khai của Supabase. Escape đã phát hiện 175 cơ sở dữ liệu rò rỉ thông tin cá nhân trên khoảng 1.400 ứng dụng mã hóa bằng vibe. Red Access đã quét 380.000 URL và tìm thấy 5.000 ứng dụng có thể truy cập, trong đó 2.000 đang để lộ dữ liệu nhạy cảm của doanh nghiệp, hoạt động hoặc cá nhân. Vào tháng 2 năm 2026, Wiz đã phát hiện rằng cơ sở dữ liệu Supabase phía sau Moltbook, một trang mạng xã hội cho các tác nhân AI, đã rò rỉ 35.000 địa chỉ email và 1,5 triệu token xác thực API.

Các cấu hình sai này đang xảy ra trên toàn thế giới thay vì tập trung ở một khu vực, theo báo cáo, mặc dù mức độ nghiêm trọng không đồng đều: các luật bảo vệ dữ liệu của châu Âu thường thúc đẩy thực hành tốt hơn, trong khi các khu vực đang phát triển có xu hướng có nhiều rò rỉ dữ liệu hơn. Theo ngành, các trang thương mại điện tử và nhà hàng là những nơi có khả năng xử lý thông tin cá nhân và hệ thống thanh toán tích hợp cao nhất, trong khi các trang cá cược trực tuyến không có giấy phép có xu hướng rò rỉ mật khẩu và các thông tin xác thực khác. Việc một trang web quảng cáo dịch vụ tiêu dùng hay doanh nghiệp không ảnh hưởng đến loại dữ liệu có khả năng bị lộ, báo cáo cho biết.

UpGuard kết luận rằng các rò rỉ dữ liệu là kết quả nhân lên của độ dễ dàng cấu hình sai của công nghệ và quy mô người dùng, và rằng các tác động lan rộng trên toàn thế giới, trên mọi ngành và mọi mô hình kinh doanh khi con người hoặc các tác nhân mã hóa AI của họ không hiểu đúng cách triển khai cấu hình bảo mật hợp lý.

Miles Okada là một nhà phân tích được tạo bởi AI tại Unite.AI, chuyên về trí tuệ nhân tạo và an ninh mạng với trọng tâm vào các mối đe dọa mới nổi, kiến trúc phòng thủ và động lực thay đổi giữa kẻ tấn công và hệ thống tự động. Công việc của ông nghiên cứu cách AI đang thay đổi hoạt động an ninh, từ việc phát hiện và phản ứng tự động với các mối đe dọa đến sự gia tăng của các kỹ thuật AI đối lập.

Với quan điểm kỹ thuật và điều tra, Miles phân tích nghiên cứu an ninh, tiết lộ sự cố và triển khai thực tế để hiểu nơi AI tăng cường phòng thủ - và nơi nó giới thiệu các điểm yếu mới. Ông đặc biệt chú ý đến việc khai thác mô hình, đầu độc dữ liệu, tự động hóa tấn công và thực tế hoạt động của việc bảo mật các hệ thống được cung cấp bởi AI ở quy mô lớn.

Các bài viết được viết bởi Miles Okada được tạo bởi AI và được xem xét bởi nhóm biên tập của Unite.AI để đảm bảo độ chính xác, nghiêm ngặt và phạm vi bảo vệ có trách nhiệm của cảnh quan an ninh AI đang thay đổi nhanh chóng.