Góc nhìn Anderson

Proxy dân cư: Mặt trận tiếp theo trong cuộc chiến AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Illustration depicting 'AI' associated with a suburban neighborhood. created in Photoshop using https://unsplash.com/photos/aerial-photography-of-city-during-daytime-IZypSha074U and https://unsplash.com/photos/glowing-ai-chip-on-a-circuit-board-w69Z8K-HGQU under the Unsplash license in each case. The image has then been enhanced in GPT Image 2.

Để ngăn nền tảng kiến thức của AI bị trì trệ hoặc suy thoái, các mô hình AI tiên phong phải tiếp tục hấp thụ một lượng khổng lồ dữ liệu hiện hành từ internet.

Về mặt này, các nhà cung cấp AI lớn cùng những đối thủ đầy tham vọng hiện đang gặp hai trở ngại: a) các nhà xuất bản, mạng xã hội, nền tảng và những nguồn dữ liệu mới khác nay đã nhận ra quyền truy cập này đáng giá đến mức nào và đang tìm cách kiếm tiền từ đó; và/hoặc b) các tên miền hiện bị những bot thu thập dữ liệu AI không ngừng nghỉ tấn công dữ dội nhằm thu hẹp “khoảng trống kiến thức”, đến mức phản ứng chống lại sự lạm dụng này đang trở nên khá cực đoan.

Từ góc nhìn của các nhà cung cấp, một giải pháp khả dĩ cho vấn đề thứ hai là yêu cầu người dùng phải đăng ký với tên miền và đăng nhập trước khi có thể truy cập những dữ liệu quý giá đó. Bằng cách này, khối lượng yêu cầu có thể được đánh giá theo một người dùng đã xác thực thay vì một địa chỉ IP (xem phần “IP đang nhìn bạn” bên dưới).

Tất nhiên, cũng thật trùng hợp, kịch bản này là giấc mơ của một nhà môi giới dữ liệu, vì nó buộc mọi người phải từ bỏ sự ẩn danh.

Đây là một trong những phản đối căn bản đối với luật năm 2026 của chính phủ Anh, yêu cầu người dùng ở Anh muốn truy cập các trang được xếp hạng “người lớn” phải nhận dạng và xác thực danh tính thông qua các nền tảng bên thứ ba.

Kết quả cuối cùng bị nhiều người coi là một “hiệu ứng răn đe” kiểu Đảng Cộng sản Trung Quốc đối với những người dùng trước đây vốn ẩn danh, đồng thời là bước khởi đầu của việc xác thực trực tuyến bắt buộc một cách ngầm định tại Anh, thay vì mục tiêu được công bố của luật là bảo vệ trẻ em khỏi nội dung NSFW.

Vì vậy, trong một thế giới nơi đăng nhập là điều bình thường, nếu không muốn nói là bắt buộc, nhà nước được hưởng lợi từ dữ liệu hậu cần hoặc thậm chí dữ liệu pháp y, cũng như từ một cộng đồng thận trọng hơn đôi chút khi lên mạng. Còn các nhà quảng cáo và bên kiếm tiền từ dữ liệu cuối cùng cũng thoát khỏi cuộc chiến kéo dài hàng thập kỷ nhằm gắn một người dùng với một mã định danh bền vững và khai thác dữ liệu của người đó theo nhiều cách, từ nhắm mục tiêu, đưa vào mô hình thống kê cho đến nhiều ứng dụng tiềm năng khác.

IP đang nhìn bạn

Có những phương pháp thay thế để nhận diện một người dùng quay lại ngoài địa chỉ IP của họ, chẳng hạn như nhiều dạng lấy dấu vân tay trình duyệt cùng các cách tiếp cận khác.

Tuy nhiên, vì hoàn toàn không thể có kết nối hay truy cập nếu không có địa chỉ IP, vấn đề này không dễ được xử lý bằng các bản cập nhật trình duyệt hoặc những phương pháp dựa trên phần mềm khác nhằm bảo vệ quyền riêng tư hay danh tính người dùng. Do đó, địa chỉ IP vẫn có độ tin cậy vừa phải như một giải pháp “rẻ tiền” để kiểm soát và giám sát quyền truy cập của người dùng.

Do kho địa chỉ IPV4 đã cạn kiệt từ lâu, còn hệ thống thay thế nó vẫn chật vật để được áp dụng rộng rãi, các IP thay thế trở nên rất quý giá. Vì vậy, các nhà cung cấp VPN thường không cho người dùng luân chuyển địa chỉ IP quá nhiều.

Trong hầu hết trường hợp, người dùng VPN tại nhà chọn quốc gia mà họ muốn được nhìn nhận là đang duyệt web từ đó, rồi nhận một địa chỉ IP khá cũ — gần như chắc chắn đã bị đưa vào nhiều danh sách chặn mà các cổng thông tin sử dụng để ngăn người dùng không thuộc quốc gia đó hoặc vì những lý do khác.

Nền tảng cung cấp danh tính bên thứ ba Yoti, được sử dụng trong chương trình xác minh độ tuổi của Anh, lưu ý:

“[Nhiều] nền tảng trực tuyến lớn đã chặn lưu lượng VPN đã biết. Các dịch vụ như BBC iPlayer, Netflix và những dịch vụ khác sử dụng các kỹ thuật đã được thiết lập để phát hiện và ngăn truy cập từ những địa chỉ IP VPN thường dùng hoặc đáng ngờ.

“Các biện pháp này bao gồm duy trì danh sách chặn cập nhật và giám sát lưu lượng lớn từ các nhóm IP đã biết. Ngay cả khi một số nhà cung cấp VPN đưa ra các dịch vụ tiên tiến hơn hoặc khó phát hiện hơn, chúng thường đắt đỏ, tạo thêm một tầng trở ngại và rào cản tài chính — đặc biệt với trẻ em và thanh thiếu niên.”

Về “chi phí” đó: nếu sẵn sàng chi nhiều tiền hơn đáng kể so với một gói VPN thông thường, proxy dân cư có thể vượt qua gần như mọi trở ngại này — ít nhất là vào lúc này.

Proxy dân cư là địa chỉ IP của một người dùng băng thông rộng tại nhà giống như bạn hay tôi. Người này có thể bán vị trí trông “an toàn” của mình cho một công ty thương mại để khách hàng của công ty đi nhờ trên IP đó nhằm tránh danh sách chặn; có thể vô tình cung cấp dịch vụ này mà không được trả tiền vì nó đi kèm một ứng dụng dành cho thiết bị; hoặc cung cấp dịch vụ do thiết bị đã bị xâm nhập và đưa vào một botnet.

Khi sử dụng proxy dân cư, toàn bộ lưu lượng của bạn được định tuyến qua một địa chỉ IP nội địa cấp người tiêu dùng, làm giảm khả năng bị chặn và can thiệp.

Khi sử dụng proxy dân cư, toàn bộ lưu lượng của bạn được định tuyến qua một địa chỉ IP nội địa cấp người tiêu dùng, làm giảm khả năng bị chặn và can thiệp.

Hầu hết “máy chủ” proxy dân cư bán quyền truy cập thông qua nhiều ứng dụng, hiện dẫn đầu là Honeygain lâu đời, với thu nhập trung bình từ 0,10 đến 0,80 USD cho mỗi GB lưu lượng.

Trong mọi trường hợp, nếu một người thuê IP trên tài khoản proxy dân cư bị nhà cung cấp mà họ nhắm tới chặn IP, họ có thể chuyển sang một IP mới. Địa chỉ này có thể mang theo hàng loạt vấn đề lịch sử từ những người thuê trước, nhưng không phải vấn đề cụ thể của người dùng đó.

Nói cách khác, những hành động trước đây trên địa chỉ IP đó có thể khiến nó bị Reddit, các mạng xã hội khác hoặc bất kỳ nhà cung cấp nào khác chặn. Nhưng nếu mục tiêu của người thuê mới không nằm trong số các bên chặn này, họ có thể bắt đầu lại từ đầu với mục tiêu đó. Nếu mục tiêu có chặn, người dùng chỉ cần thử một IP dân cư khác.

Đối với chủ máy, địa chỉ IP của chính họ — chắc chắn ngày càng bị làm “bẩn” — thường có thể được làm mới bằng cách ngắt kết nối một lúc và trong hầu hết trường hợp sẽ tự động được luân chuyển theo chu kỳ. Ngoài ra, chi phí và hệ quả tiềm tàng của việc đưa vĩnh viễn một địa chỉ IP riêng lẻ vào danh sách chặn có nghĩa là phần lớn các lệnh chặn như vậy cuối cùng sẽ được gỡ bỏ.

Kỷ nguyên kiểm tra độ tuổi

Khi giới hạn độ tuổi đã trở thành một phần cuộc sống tại Anh, sắp xuất hiện ở EU và Úc, đồng thời thỉnh thoảng được áp dụng tại Mỹ, việc sử dụng VPN — phương thức chủ yếu để tránh các cổng kiểm tra độ tuổi trực tuyến cấp quốc gia — đã bắt đầu trở thành mục tiêu của pháp luật, giám sát nhà nước, thậm chí lệnh cấm, như tại những quốc gia gồm Trung Quốc và Liên bang Nga.

Hai năm trước, có lẽ phần lớn chúng ta không biết hoặc không quan tâm rằng VPN tồn tại, ngoại trừ việc bộ phận CNTT của công ty có thể đã cài một VPN trên máy tính xách tay để truy cập an toàn vào mạng doanh nghiệp. Giờ đây, ít nhất tại Anh, EU và Úc, đây là một công nghệ được công chúng biết đến rộng rãi hơn nhiều.

“Bí mật ai cũng biết” tiếp theo có vẻ sẽ nổi lên — và trở thành mục tiêu của luật pháp, các ủy ban và hoạt động giám sát — trong mười hai tháng tới chính là proxy dân cư.

Thị trường dịch vụ thu thập dữ liệu web ngày càng phát triển thường cung cấp quyền truy cập proxy dân cư như một dịch vụ “cao cấp”. Bright Data đưa ra gói proxy dân cư với băng thông 798 GB với mức giá choáng váng 2.000 USD mỗi tháng; FireCrawl tính phí 8–15 USD mỗi GB; còn Apify khoảng 8 USD.

Nhiều nhà cung cấp lớn khác che giấu mức phí và hướng người dùng “liên hệ bộ phận bán hàng”. Trên thực tế, có thể lập luận rằng mọi gói thấp hơn được quảng cáo chỉ là màn chào hàng để dẫn tới cuộc trao đổi đó, bởi các công ty AI khát dữ liệu có những khoản tiền “đổi đời” để ném vào vấn đề này.

Đã lọt vào tầm ngắm..?

Dù proxy dân cư hiện còn xa mới là một hoạt động phi pháp, giống như mọi công nghệ hỗ trợ ẩn danh, chúng đang bắt đầu bị chỉ trích vì là công cụ ưa thích của tội phạm mạng, đặc biệt tại Nhật Bản.

Bất kỳ mối đe dọa nào đối với proxy dân cư dường như đều có thể gây hệ quả cho các công ty AI đang sử dụng chúng ngày càng nhiều. Một báo cáo gần đây, vào tháng 6 năm 2026, của công ty an ninh mạng Infoblox cho rằng AI đã trở thành động lực lớn thúc đẩy nhu cầu proxy dân cư.

Khi phân tích lưu lượng DNS trong toàn bộ cơ sở khách hàng, Infoblox nhận thấy số truy vấn hằng tháng tới các tên miền proxy dân cư tăng từ khoảng 400 tỷ lên hơn 500 tỷ trong giai đoạn từ tháng 1 năm 2025 đến tháng 4 năm 2026 — tăng khoảng 25%:

Những đợt tăng vọt trong tổng số điểm lưu lượng liên quan đến proxy dân cư trong năm 2026. Nguồn - https://www.infoblox.com/blog/threat-intelligence/residential-proxies-in-the-wild/

Những đợt tăng vọt trong tổng số điểm lưu lượng liên quan đến proxy dân cư trong năm 2026. Nguồn

Khi đó, công ty tuyên bố:

“Có thể có một số lời giải thích cho điều này: chắc chắn sự gia tăng hoạt động huấn luyện liên quan đến AI, vốn thường cần thu thập dữ liệu từ các trang web, là một động lực lớn của nhu cầu proxy dân cư. Proxy dân cư vượt qua nhiều biện pháp chống thu thập dữ liệu vì lưu lượng có vẻ xuất phát từ thiết bị của người thật.”

Đây là xu hướng tăng tương tự những đợt bùng nổ trước đây về sự quan tâm đến VPN khi các luật giới hạn độ tuổi xuất hiện, đồng thời bắt đầu đưa hoạt động này ra khỏi phạm vi “dân công nghệ doanh nghiệp” và vào tầm chú ý tiềm năng của công chúng.

Cloudflare mô tả thế hệ công cụ thu thập dữ liệu web mới tập trung vào AI là “được thiết kế để hòa lẫn”, đồng thời nhận xét: “Chúng có thể luân chuyển địa chỉ IP qua các proxy dân cư, tạo chuỗi user agent giống con người và mô phỏng những kiểu duyệt web hợp lý”. Công ty cũng báo cáo rằng hoạt động thu thập dữ liệu dùng cho huấn luyện chiếm 80% tổng hoạt động bot AI trong giai đoạn này.

Một báo cáo tháng 6 năm 2026 của Include Security đã cho thấy mức độ mà gã khổng lồ thu thập dữ liệu Bright Data — hiện tuyên bố có sẵn hơn 400 triệu IP tại 195 quốc gia — đã đưa một điểm cuối công khai không cần xác thực vào nhiều thiết bị tiêu dùng để cung cấp dịch vụ proxy dân cư thông qua việc cài đặt ứng dụng. Nói cách khác, các nhà phát triển bên thứ ba tích hợp Bright Data vào ứng dụng của mình nhằm kiếm tiền từ chúng.

Vào tháng 10 năm 2025, KrebsOnSecurity đưa tin rằng botnet Aisuru, vốn “phá kỷ lục về tấn công từ chối dịch vụ phân tán (DDoS)”, đã đổi chiến thuật từ DDoS truyền thống sang proxy dân cư:

“[M]ột lượng proxy dư thừa từ Aisuru và các nguồn khác đang tiếp sức cho những nỗ lực thu thập dữ liệu quy mô lớn gắn với nhiều dự án trí tuệ nhân tạo (AI), giúp các công cụ thu thập nội dung tránh bị phát hiện bằng cách định tuyến lưu lượng qua các kết nối dân cư có vẻ như thuộc về người dùng internet thông thường.”  

Vì gian lận và các loại hoạt động tội phạm mạng khác ngày càng gắn với việc sử dụng proxy dân cư, đây có thể là yếu tố cuối cùng khiến chúng biến mất khỏi thị trường. Và vì dịch vụ phần lớn được cung cấp qua các ứng dụng và SDK phân phối trên những nền tảng ứng dụng lớn, một yêu cầu buộc các nền tảng lưu trữ như iOS cấm hoặc sửa đổi chúng để việc lưu trữ proxy dân cư không còn nằm trong các dịch vụ được cung cấp sẽ làm suy yếu đáng kể nguồn cung của loại dịch vụ này.

Việc đồng thời nhắm vào các cổng và ứng dụng độc lập cũng có thể làm toàn bộ hệ sinh thái proxy dân cư chỉ còn mức phủ tối thiểu — và có lẽ đẩy giá lên đáng kể.

Câu hỏi là liệu các quốc gia rất ủng hộ AI, như Mỹ, có sẵn sàng cắt quyền truy cập của các công ty AI theo cách gần như chắc chắn không ảnh hưởng tới những công cụ thu thập dữ liệu của Trung Quốc hay không, bởi chúng có lẽ sẽ hoạt động theo nhu cầu của nhà nước thay vì các quy định pháp luật. Tâm lý hiện nay, ít nhất tại Mỹ, cho thấy điều đó khó xảy ra.

Kết luận

Proxy dân cư về bản chất là những VPN thực sự vẫn hoạt động, bởi các địa chỉ IP linh hoạt được cung cấp không bị đưa vào danh sách chặn và không cũ kỹ. Có bằng chứng đáng chú ý cho thấy các công ty AI đang chuyển sang sử dụng chúng khi hệ thống phòng thủ chống công cụ thu thập dữ liệu web cho AI trở nên phổ biến và phức tạp hơn.

Một phần tốc độ dữ dội của hoạt động thu thập dữ liệu web dựa trên AI — bao gồm tới 39.000 yêu cầu mỗi phút đối với một tên miền duy nhất, cùng việc hấp thụ rồi sau đó thiêu hủy sách — có lẽ nhằm tuyển chọn toàn bộ tri thức nhân loại tính đến nay, một cuộc “bắt kịp một lần”, nếu có thể gọi như vậy.

Tuy nhiên, tương lai nằm ở việc giành và duy trì quyền truy cập vào thông tin được tạo ra kể từ thời điểm này trở đi: bài đăng trên mạng xã hội, nghiên cứu học thuật, lịch biểu, blog, trang doanh nghiệp cùng hàng triệu nguồn dữ liệu liên tục khác — sự tiếp nối tri thức và tư tưởng chung của loài người.

Vì thế, người ta tự hỏi giá của một GB lưu lượng proxy dân cư có thể tăng cao đến đâu trước khi ngay cả các công ty AI tiên phong dồi dào tiền bạc cũng phải chùn bước, hoặc quyết định thu thập có chọn lọc hơn và cuối cùng chịu một giới hạn ngân sách nào đó.

Mức giá đó sẽ phụ thuộc vào khả năng các nền tảng dữ liệu hấp dẫn nhất đàm phán quyền truy cập hoặc đẩy lùi thành công những kẻ xâm nhập.

Một suy nghĩ cuối cùng: nếu điều hành một công ty AI nghìn tỷ đô la ngày càng phụ thuộc vào dịch vụ thu thập dữ liệu bên ngoài dựa trên proxy dân cư, tôi sẽ coi việc mua và vận hành công ty phù hợp nhất trong lĩnh vực này, hoặc tự xây dựng mạng proxy dân cư của riêng mình từ đầu — có lẽ thông qua một mê cung công ty vỏ bọc — là một lựa chọn kinh tế hợp lý.

 

Đăng lần đầu vào thứ Tư, ngày 16 tháng 9 năm 2026

Sửa đổi vào thứ Năm, ngày 17 tháng 9 năm 2026: Đổi cụm từ “để bí mật cung cấp dịch vụ proxy dân cư thông qua việc cài đặt ứng dụng” thành “để cung cấp dịch vụ proxy dân cư thông qua việc cài đặt ứng dụng”.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai