Góc nhìn Anderson

Liệu Trí Tuệ Nhân Tạo Sẽ Phát Triển Ngoài Vùng An Toàn Của Nó?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Chi phí và hạn chế của Trí Tuệ Nhân Tạo lớn, cũng như ảnh hưởng của nó đến chi phí phần cứng, đang buộc người dùng phải xây dựng hệ thống của riêng họ – giống như sự gia tăng của quy định đang đe dọa đóng cửa nền kinh tế ‘bóng tối’ của Trí Tuệ Nhân Tạo.

 

Ý Kiến Trong số nhiều ‘cái bẫy’ xuất hiện trong các bài nghiên cứu khoa học, một trong những thường xuyên nhất là vấn đề mà bài báo đang giải quyết đã được giải quyết ở nơi khác, và rằng đóng góp của nghiên cứu mới chỉ là INCIDENTAL hoặc tăng dần.

Điều này có thể xảy ra vì một số lý do: các nhà nghiên cứu hy vọng có một bước nhảy vĩ đại, nhưng chỉ nhận được một bước nhảy nhỏ; rằng các giải pháp trước đó của vấn đề đòi hỏi nhiều tài nguyên hơn so với đề xuất mới; hoặc đơn giản là mục tiêu của dự án đã thất bại hoàn toàn, nhưng văn hóa ‘xuất bản hoặc tiêu diệt’ của nghiên cứu học thuật đã buộc nhóm phải phát hành nó bất kể điều gì (thường bị chôn vùi trong số lượng lớn của một ngày xuất bản bận rộn nhất của một cổng thông tin).

Trong văn học học máy, tuy nhiên, một lý do tương đối mới và không xin lỗi đang trở nên phổ biến hơn: rằng tính năng hoặc chức năng được đề xuất chỉ có sẵn thông qua các cổng API đóng.

Tôi đã xem xét một bài báo như vậy vào sáng nay – một hợp tác giữa các trường đại học Trung Quốc và Amazon, giải quyết vấn đề tái phát của sự thất bại trong việc xóa đối tượng trong các hệ thống chỉnh sửa hình ảnh dựa trên sự khuếch tán, thường chỉ ‘làm đầy lại’ không gian mục tiêu với một đối tượng tương tự thay thế:

Ở phía xa bên trái là hình ảnh gốc; ở bên phải của nó, mặt nạ phân đoạn màu đỏ cho biết phần nào của hình ảnh để xóa; tiếp theo, 'Của chúng tôi', cho thấy một cách tiếp cận xóa đối tượng thành công – và hai hình ảnh còn lại cho thấy các hệ thống tương tự mà, thay vì xóa xe buýt, chỉ chèn một xe buýt khác vào.

Ở phía xa bên trái là hình ảnh gốc; ở bên phải của nó, mặt nạ phân đoạn màu đỏ cho biết phần nào của hình ảnh để xóa; tiếp theo, ‘Của chúng tôi’, cho thấy một cách tiếp cận xóa đối tượng thành công – và hai hình ảnh còn lại cho thấy các hệ thống tương tự mà, thay vì xóa xe buýt, chỉ chèn một xe buýt khác vào. Nguồn

Trong ví dụ trên, hình ảnh trung tâm cho thấy cách tiếp cận mới thành công trong việc xóa xe buýt và tạo một nền tảng hợp lý, so với hai phương pháp trước (hai hình ảnh bên trái nhất), mỗi phương pháp xóa xe buýt, nhưng sau đó chèn một xe buýt khác vào hình ảnh!

Cái Bẫy!

Bỏ qua lý do và nguyên nhân của thách thức này cho một thời điểm khác (và đó là một chủ đề thú vị ), tôi sau đó gặp một ‘cái bẫy’ kinh điển, đọc qua bài báo mới: sự thừa nhận của các tác giả rằng các hệ thống độc quyền đắt tiền có thể thực hiện nhiệm vụ này một cách đáng tin cậy – điều mà tôi biết, từ một vài năm sử dụng Adobe Firefly trong Photoshop, cùng với các hệ thống độc quyền khác:

‘[Các phương pháp dựa trên sự khuếch tán] thường ảo giác bằng cách chèn các đối tượng không mong muốn sau khi xóa các đối tượng mục tiêu, dẫn đến kết quả không nhất quán về mặt ngữ cảnh.

‘Mặt khác, các mô hình đa phương tiện độc quyền gần đây như ChatGPT và Nano Banana, mặc dù mạnh mẽ hơn trong việc xóa đối tượng, nhưng liên quan đến số lượng tham số lớn và chi phí tính toán cao, cản trở việc triển khai thực tế trên các thiết bị cạnh.

‘Do đó, điều quan trọng là phải phát triển một mô hình xóa đối tượng chuyên dụng không chỉ cho phép hiệu suất xóa vượt trội mà còn tận hưởng độ trễ suy luận thấp và số lượng tham số ít hơn đáng kể.’

Giải thích này, tập trung vào các chướng ngại vật kỹ thuật, che giấu sự thật hiển nhiên rằng các kiến trúc độc quyền như ChatGPT và Nano Banana không có sẵn để cài đặt cục bộ. Mặc dù khả năng sản xuất tài liệu tranh cãi của các hệ thống như vậy đã cho họ sự biện minh công khai trong việc kiểm soát cổng thông tin trong năm qua, nhưng các cổng thông tin của loại này là độc quyền chủ yếu vì các động cơ thương mại.

Về cơ bản, bài báo mới ngụ ý rằng mặc dù vấn đề mục tiêu đã được giải quyết trong các hệ thống thương mại, điều này có thể không liên quan đến phần còn lại của chúng ta, những người cần phải học cách giải quyết nó trong ‘thế giới thực’ – tức là trong các hệ thống mã nguồn mở, cho dù chúng có thể được cài đặt cục bộ một cách thực tế hay không.

Phát Triển Song Song

Tuy nhiên, tại sao lại giải quyết một vấn đề vẫn phụ thuộc vào một hệ thống trả phí, không phải vì các hạn chế độc quyền, mà vì các yêu cầu tính toán GPU vượt quá khả năng của bất kỳ thiết lập cục bộ nào? Hầu hết các ‘bài báo mở’ và kho mã mới này đều có các thiết lập đào tạo/suy luận với nhu cầu tài nguyên quá mức, chẳng hạn như các cụm A100.

Well, điều đó phụ thuộc vào việc bạn nghĩ rằng tất cả các trung tâm dữ liệu Trí Tuệ Nhân Tạo đang chờ xử lý sẽ thực hiện khi chúng cuối cùng đi vào hoạt động. Các nỗi sợ hãi của người dân và hy vọng của giới tinh hoa đều hình dung ra các hệ thống độc quyền, moat hóa, Trí Tuệ Nhân Tạo sẽ thay thế công việc, đồng thời liên tục tăng chi phí đăng ký và giảm mức độ dịch vụ, để đáp ứng nhu cầu vốn đầu tư sớm phải chờ 3-5 năm để hoạt động.

Tuy nhiên, một xu hướng ngày càng tăng trong văn học dường như đang hỗ trợ một tương lai thay thế, và tinh thần ‘tự đi’ của nhiều cộng đồng trực tuyến như subreddit r/stablediffusion, hiện có 920.000 người dùng, và đã từ lâu cấm các bài đăng liên quan đến các hệ thống tạo hình ảnh/đối tượng độc quyền:

Trong tương lai thay thế này, nguồn cung cấp mới toàn cầu về các trung tâm dữ liệu Trí Tuệ Nhân Tạo sẽ tạo điều kiện cho tính toán thô cho các hệ thống được người dùng cấu hình, thay vì đáp ứng nhu cầu của các khuôn khổ ‘hộp đen’ khổng lồ như ChatGPT và Adobe Firefly.

Ma Sát Bề Mặt

Nhìn qua các hướng dẫn từ xa phức tạp, được khai thác bởi Patreon, tại r/stablediffusion, mọi thứ dường như không thể tại thời điểm này: các mô hình thường xuyên thay đổi mục tiêu với mỗi cập nhật; chúng khó triển khai cục bộ, thậm chí trong các khuôn khổ dễ sử dụng và thân thiện với người dùng nhất; và nói chung, lượng ma sát liên quan cho thấy một việc chỉ dành cho những người đam mê công nghệ và những công ty phi Trí Tuệ Nhân Tạo muốn phát triển và duy trì các hệ thống cục bộ của riêng họ, thay vì thuê các khả năng như vậy:

Tuy nhiên, trong 30 năm qua, mọi công nghệ có nhu cầu lớn về sự đơn giản hóa và phổ biến hóa dân chủ đã có xu hướng nhận được điều đó, với các giải pháp phổ biến nhất thường xuất hiện từ sự căng thẳng giữa các hệ thống thương mại và các giải pháp thay thế và sáng kiến mã nguồn mở.

Các hoạt động từng là ‘nơi ẩn náu của những kẻ tinh nghịch’ như kết nối internet, hệ thống quản lý nội dung và các khuôn khổ blog, cũng như bảo mật internet, nhiếp ảnh và quản lý phương tiện, đã tiến hóa từ sự phức tạp khó hiểu đến sự đơn giản và tiện ích.

Do đó, cảnh quan Trí Tuệ Nhân Tạo sau này có thể đa dạng và đầy những người chơi nhỏ hơn và cạnh tranh thực sự hơn so với những người dẫn đầu thị trường Trí Tuệ Nhân Tạo hiện tại có thể mong muốn.

Tự Hiện Thực Hóa, Bằng Sự Cần Thiết

Một cách iron, ‘Trí Tuệ Nhân Tạo lớn’ đang góp phần rất nhiều vào một tinh thần độc lập đang xuất hiện giữa người dùng cuối, bằng cách hút tất cả các thành phần máy tính – đặc biệt là DRAM – mà nếu không sẽ đi đến ‘người tiêu dùng thông thường’.

Do đó, nhiều người đang hình dung một tương lai nơi các tài nguyên Trí Tuệ Nhân Tạo độc quyền được truy cập thông qua các máy khách mỏng yếu và phát triển một sự quan tâm ngày càng tăng trong việc duy trì thiết bị hiện có của họ.

CUộc tấn công của Trí Tuệ Nhân Tạo vào các chuỗi cung ứng công nghệ cũng đã khiến các nhà cung cấp dịch vụ công nghệ tăng giá trong 3-6 tháng qua, hoặc vì các công ty nhỏ đang bị siết chặt bởi cơn đói phần cứng, hoặc chỉ vì Trí Tuệ Nhân Tạo.

Điều này đã dẫn đến sự gia tăng của sự quan tâm đến việc tự tổ chức và trên tiền đề – bao gồm tự tổ chức mạng lưới học máy.

Tôi đã bị cuốn vào điều này gần đây, chuyển sang lưu trữ LAN cục bộ cho ảnh và video, cũng như sao lưu tệp. Đối với cái trước, tôi đã sử dụng máy chủ truyền thông đa nền tảng miễn phí và mã nguồn mở Immich, giúp tôi chuyển khỏi sự tăng giá (và các vấn đề khác) của các nhà cung cấp lưu trữ đám mây như iCloud:

Nền tảng Immich miễn phí có thể giữ phương tiện của bạn trên thiết bị của bạn và riêng tư cho các kênh của bạn. Trong trường hợp này, tôi cũng sử dụng Immich trên Docker để phục vụ GPU NVIDIA 3090 của tôi qua LAN đến nơi ảnh và video được lưu, để GPU mạnh mẽ hơn có thể xử lý bất kỳ quá trình xử lý hình ảnh/đối tượng nặng nào.

Nền tảng Immich miễn phí có thể giữ phương tiện của bạn trên thiết bị của bạn và riêng tư cho các kênh của bạn. Trong trường hợp này, tôi cũng sử dụng Immich trên Docker để phục vụ GPU NVIDIA 3090 của tôi qua LAN đến nơi ảnh và video được lưu, để GPU mạnh mẽ hơn có thể xử lý bất kỳ quá trình xử lý hình ảnh/đối tượng nặng nào.

Nếu kinh nghiệm của tôi là một dấu hiệu đại diện, lập trình vibe – hiện đang bị nguyền rủa trong nhiều cộng đồng trực tuyến ‘thuần túy’ – đang thúc đẩy làn sóng độc lập này (ngay cả khi nó có thể đe dọa các kho mã nguồn mở mà nó dựa vào).

Ví dụ, mạng đã luôn là điểm yếu của tôi trong tính toán, vì vậy sự hỗ trợ của Trí Tuệ Nhân Tạo là cần thiết để tôi có thể chạy một VPS an toàn, để hỗ trợ một loạt các dịch vụ tự tổ chức mới.

Theo cách này, ‘Trí Tuệ Nhân Tạo lớn’ có thể được coi là đang trao quyền cho ‘Trí Tuệ Nhân Tạo nhỏ’; do đó, có thể chúng ta có thể coi sự gia tăng hiện tại của các công ty Trí Tuệ Nhân Tạo siêu lớn, siêu định giá là một trạng thái cần thiết nhưng chỉ là tạm thời trước khi một xã hội Trí Tuệ Nhân Tạo dân chủ và trao quyền cho người dùng hơn xuất hiện, loại bỏ các công ty tìm kiếm moat, tìm kiếm tiền thuê như các tên lửa đã qua sử dụng – giống như vụ sụp đổ dot-com năm 2000 để lại cơ sở hạ tầng có thể khai thác mà sẽ tăng tốc đáng kể cho web lâu sau khi các công ty đã trả tiền cho nó đã sụp đổ.

Thời Đại Tuân Thủ

Well, điều đó có thể không lặp lại lần này.

Ngay cả khi chúng ta đang có xu hướng hình thành một loại xã hội ‘hậu moat’ nào đó, quy định xung quanh Trí Tuệ Nhân Tạo, kết hợp với xu hướng toàn cầu hiện tại về xác minh tuổi, dường như có khả năng dự đoán và chặn các con đường phát triển này.

Neo ancor để ngăn chặn một ‘nền kinh tế Trí Tuệ Nhân Tạo bóng tối’ là quy định. Hiện tại, các kho trung tâm như GitHubHugging Face thường yêu cầu đăng nhập trực tuyến trước khi cho phép người dùng nhân bản kho cục bộ, tùy thuộc vào cài đặt của kho.

Do đó, các cơ chế để thực thi giám sát các khuôn khổ Trí Tuệ Nhân Tạo rộng rãi hơn so với thực hành hiện tại đã tồn tại; và sự quyết tâm để tăng cường giám sát này đang được củng cố từ các sáng kiến chính phủ cá nhân thành một động lực toàn cầu.

Vậy, nếu các lực thị trường và sự sáng tạo của phong trào mã nguồn mở có thể loại bỏ ma sát khỏi việc triển khai Trí Tuệ Nhân Tạo thông thường, các chướng ngại vật dường như sẽ trở lại dưới dạng yêu cầu quản lý: các yêu cầu tuân thủ mà, mặc dù khó khăn, nhưng đáng giá cho các công ty, nhưng có thể không phải cho các cá nhân – tương tự như ma sát đã được thêm vào các hệ thống thanh toán trực tuyến của người tiêu dùng kể từ thời đại vàng của PayPal vào những năm 2000.

Cho dù Meta đã chi 2 tỷ đô la để vận động cho kiểm soát tuổi trên cấp độ hệ điều hành vì đầu tư Trí Tuệ Nhân Tạo đáng kể của họ, hoặc vì lợi ích thu thập dữ liệu của họ, kết quả của việc các công ty công nghệ lớn ủng hộ kiểm soát tuổi là ‘Trí Tuệ Nhân Tạo cục bộ’ có thể trở nên được quản lý như một chất được kiểm soát; và, giống như DMCA được thiết kế để hình sự hóa ý định chứ không phải là một cơ chế cụ thể để tránh bản quyền, các quy định Trí Tuệ Nhân Tạo quốc tế có thể, trong một kịch bản như vậy, làm cho tất cả việc sử dụng máy học không tuân thủ trở thành một hành vi bất hợp pháp, với rất ít chi phí (về giám sát tích cực).

Điều này có thể đã có vẻ như một quan điểm quá u ám một năm trước – nhưng đó là trước khi Californiasystemd đứng sau ý tưởng về xác minh tuổi ở cấp độ phần cứng, hiện được nhiều người coi là một đại diện cho một cấm đối với tính ẩn danh trực tuyến theo kiểu CCP.

Kết Luận

Vậy, trong khi bối cảnh pháp lý và lập pháp đang chuẩn bị, có lẽ, để đưa Trí Tuệ Nhân Tạo vào một không gian được quản lý cao, để người dùng thông thường không thể ‘nấu’ Trí Tuệ Nhân Tạo của riêng họ hơn là họ có thể trồng hoặc lên men các chất được kiểm soát mà không có sự cho phép, lĩnh vực nghiên cứu vẫn duy trì quan điểm lạc quan hơn – rằng Trí Tuệ Nhân Tạo sẽ trở thành một lực lượng dân chủ và có lợi cho xã hội rộng lớn hơn là chỉ những người theo đuổi nhà cung cấp độc quyền phổ biến nhất trong ngày.

Nhiều điều phụ thuộc vào việc xử lý các tàn dư sau khi bong bóng Trí Tuệ Nhân Tạo vỡ – ít nhất là ở mức độ mà các nhà cung cấp либо hợp nhất, hoặc thị trường ổn định thành sự phân mảnh lâu dài – điều này có thể đòi hỏi một sự chạm nhẹ hơn về quy định.

 

Được xuất bản lần đầu vào thứ Tư, ngày 1 tháng 4 năm 2026

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]