Lãnh đạo tư tưởng

Tái đánh giá Mở nguồn trong Thời đại Trí tuệ Nhân tạo Tạo sinh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Mô hình mã nguồn mở – một triết lý phát triển phần mềm trong đó mã nguồn được cung cấp miễn phí cho công chúng để phân phối lại hoặc sửa đổi – đã trở thành chất xúc tác cho sự đổi mới trong nhiều năm. Ý tưởng này được sinh ra vào năm 1983 khi Richard Stallman, một nhà phát triển phần mềm, cảm thấy thất vọng với tính chất “hộp đen” của máy in mã nguồn đóng của mình.

Tầm nhìn của ông đã tạo ra phong trào phần mềm miễn phí, mở đường cho hệ sinh thái mã nguồn mở đang cung cấp năng lượng cho phần lớn internet và đổi mới phần mềm ngày nay.

Nhưng điều đó đã xảy ra hơn 40 năm trước.

Ngày nay, Trí tuệ Nhân tạo Tạo sinh, với những thách thức kỹ thuật và đạo đức độc đáo, đang thay đổi ý nghĩa của “mở”, đòi hỏi chúng ta phải xem xét lại và thích nghi với mô hình mã nguồn mở – không phải từ bỏ nó, mà để thích nghi với nó.

Trí tuệ Nhân tạo và Tự do Mở nguồn

Bốn quyền tự do cơ bản của phần mềm mã nguồn mở – khả năng chạy, nghiên cứu, sửa đổi và phân phối lại bất kỳ mã phần mềm nào – mâu thuẫn với bản chất của trí tuệ nhân tạo tạo sinh theo nhiều cách:

  • Chạy: Các mô hình AI thường yêu cầu cơ sở hạ tầng và chi phí tính toán rất cao, điều này giới hạn truy cập do các hạn chế về tài nguyên.
  • Nghiên cứu và sửa đổi: Các mô hình AI vô cùng phức tạp, vì vậy hiểu và thay đổi chúng mà không có quyền truy cập vào cả mã và dữ liệu thông tin là một thách thức đáng kể.
  • Phân phối lại: Nhiều mô hình AI giới hạn phân phối lại theo thiết kế, đặc biệt là những mô hình có trọng số đã được đào tạo và tập dữ liệu độc quyền thuộc về nhà cung cấp nền tảng.

Sự xói mòn của những nguyên tắc cốt lõi này không phải do ý định độc ác mà là do sự phức tạp và chi phí của các hệ thống AI hiện đại. Thực tế, chi phí đào tạo các mô hình AI tiên tiến đã tăng vọt trong những năm gần đây – OpenAI’s GPT-4 được cho là đã chi lên đến 78 triệu đô la, không bao gồm lương nhân viên, với tổng chi phí vượt quá 100 triệu đô la. ​

Sự Phức tạp của “Mã nguồn Mở” AI

Một mô hình AI thực sự mở sẽ yêu cầu sự minh bạch hoàn toàn của mã nguồn suy luận, mã nguồn đào tạo, trọng số mô hình và dữ liệu đào tạo. Tuy nhiên, nhiều mô hình được dán nhãn là “mở” sẽ chỉ phát hành mã suy luận hoặc trọng số một phần, trong khi những mô hình khác cung cấp giấy phép hạn chế hoặc hạn chế sử dụng thương mại hoàn toàn.

Sự minh bạch không thiên vị này tạo ra ảo giác về các nguyên tắc mã nguồn mở, trong khi không đạt được trong thực tế.

Hãy xem xét rằng một phân tích của Sáng kiến Mã nguồn Mở (OSI) đã phát hiện ra rằng một số mô hình ngôn ngữ lớn phổ biến được cho là mã nguồn mở – bao gồm Llama2 và Llama 3.x (được phát triển bởi Meta), Grok (X), Phi-2 (Microsoft) và Mixtral (Mistral AI) – không tương thích về mặt cấu trúc với các nguyên tắc mã nguồn mở.

Thách thức về Khả năng Tính toán và Khuyến khích

Hầu hết phần mềm mã nguồn mở được xây dựng trên các nỗ lực do tình nguyện viên hoặc tài trợ, chứ không phải trên cơ sở hạ tầng tốn kém và đòi hỏi tính toán cao. Các mô hình AI, mặt khác, tốn kém để đào tạo và duy trì, và chi phí chỉ dự kiến sẽ tăng. CEO của Anthropic, Dario Amodei, dự đoán rằng cuối cùng nó có thể tốn $100 tỷ để đào tạo một mô hình tiên tiến.

Không có mô hình tài trợ bền vững hoặc cấu trúc khuyến khích, các nhà phát triển phải đối mặt với lựa chọn giữa việc hạn chế truy cập thông qua mã nguồn đóng hoặc giấy phép phi thương mại, hoặc rủi ro sụp đổ tài chính.

Sự Lầm tưởng về “Trọng số Mở” và Giấy phép

Khả năng tiếp cận mô hình AI đã trở nên ngày càng lẫn lộn, với nhiều nền tảng tự quảng cáo là “mở” trong khi áp dụng các hạn chế mâu thuẫn với các nguyên tắc mã nguồn mở thực sự. Sự “mánh lới” này thể hiện theo nhiều cách:

  • Các mô hình được dán nhãn là “trọng số mở” có thể cấm sử dụng thương mại hoàn toàn, duy trì chúng nhiều hơn như những tò mò học thuật hơn là những công cụ kinh doanh thực tế cho công chúng để khám phá và phát triển.
  • Một số nhà cung cấp cấp quyền truy cập vào các mô hình đã được đào tạo trước nhưng bảo vệ dữ liệu đào tạo và phương pháp của họ, khiến việc tái tạo hoặc xác minh các phát hiện của họ một cách có ý nghĩa là không thể.
  • Nhiều nền tảng áp dụng các hạn chế phân phối lại ngăn cản các nhà phát triển xây dựng hoặc cải tiến các mô hình cho cộng đồng của họ, ngay cả khi họ có thể truy cập đầy đủ vào mã.

Trong những trường hợp này, “mở cho nghiên cứu” chỉ là một cách nói khác của “đóng cho kinh doanh”. Kết quả là một hình thức khóa nhà cung cấp không trung thực, nơi các tổ chức đầu tư thời gian và tài nguyên vào các nền tảng dường như có thể truy cập được một cách cởi mở, chỉ để phát hiện ra những hạn chế quan trọng khi cố gắng mở rộng quy mô hoặc thương mại hóa các ứng dụng.

Sự nhầm lẫn này không chỉ làm thất vọng các nhà phát triển. Nó tích cực phá hoại niềm tin trong hệ sinh thái AI. Nó tạo ra những kỳ vọng không thực tế trong số các bên liên quan, những người hợp lý cho rằng “mở” AI tương đương với các cộng đồng phần mềm mã nguồn mở, nơi tính minh bạch, quyền sửa đổi và tự do thương mại được duy trì.

Độ trễ Pháp lý

Sự tiến bộ nhanh chóng của GenAI đã vượt qua sự phát triển của các khuôn khổ pháp lý phù hợp, tạo ra một mạng lưới phức tạp về các thách thức về quyền sở hữu trí tuệ đang tồn tại.

Trận chiến pháp lý đầu tiên tập trung vào việc sử dụng dữ liệu đào tạo. Các mô hình học sâu lấy các tập dữ liệu lớn từ Internet, chẳng hạn như hình ảnh và văn bản của các trang web. Việc thu thập dữ liệu khổng lồ này đã gây ra những cuộc tranh luận gay gắt về quyền sở hữu trí tuệ. Các công ty công nghệ cho rằng các hệ thống AI của họ nghiên cứu và học hỏi từ các tài liệu có bản quyền để tạo ra nội dung mới, chuyển đổi. Tuy nhiên, các chủ sở hữu bản quyền lại cho rằng những công ty AI này sao chép trái phép các tác phẩm của họ, tạo ra nội dung cạnh tranh đe dọa đến sinh kế của họ.

Quyền sở hữu của các tác phẩm phái sinh được tạo ra bởi AI đại diện cho một sự mơ hồ pháp lý khác. Không ai chắc chắn làm thế nào để phân loại nội dung được tạo ra bởi AI, ngoại trừ Văn phòng Bản quyền Hoa Kỳ, tuyên bố rằng “nếu AI hoàn toàn tạo ra nội dung, nó không thể được bảo vệ bởi bản quyền.”

Sự không chắc chắn pháp lý xung quanh GenAI – đặc biệt là liên quan đến việc vi phạm bản quyền, quyền sở hữu của các tác phẩm được tạo ra bởi AI và nội dung không được cấp phép trong dữ liệu đào tạo – trở nên phức tạp hơn khi các mô hình AI cơ bản xuất hiện như các công cụ quan trọng về mặt địa chính trị: Các quốc gia đang chạy đua để phát triển các khả năng AI vượt trội có thể ít quan tâm đến việc hạn chế quyền truy cập vào dữ liệu, đặt các quốc gia có sự bảo vệ IP nghiêm ngặt vào tình thế bất lợi.

Điều mà Mã nguồn Mở Phải Trở thành trong Thời đại Trí tuệ Nhân tạo

Tàu GenAI đã rời ga và không có dấu hiệu chậm lại. Chúng tôi hy vọng xây dựng một tương lai nơi AI khuyến khích sự đổi mới thay vì kìm hãm nó. Trong trường hợp đó, các nhà lãnh đạo công nghệ cần một khuôn khổ đảm bảo sử dụng thương mại an toàn và minh bạch, thúc đẩy đổi mới có trách nhiệm, giải quyết vấn đề sở hữu và cấp phép dữ liệu, và phân biệt giữa “mở” và “miễn phí.”

Một khái niệm mới nổi, Giấy phép Nguồn Thương mại Mở, có thể cung cấp một con đường phía trước bằng cách đề xuất quyền truy cập miễn phí cho sử dụng phi thương mại, quyền truy cập có giấy phép cho sử dụng thương mại và công nhận và tôn trọng nguồn gốc và quyền sở hữu của dữ liệu.​​

Để thích nghi với thực tế mới này, cộng đồng mã nguồn mở phải phát triển các mô hình cấp phép mở đặc biệt cho AI, hình thành các quan hệ đối tác công-tư để tài trợ cho các mô hình này và thiết lập các tiêu chuẩn đáng tin cậy về tính minh bạch, an toàn và đạo đức.

Mã nguồn mở đã thay đổi thế giới một lần. Trí tuệ Nhân tạo Tạo sinh đang thay đổi nó một lần nữa. Để bảo tồn tinh thần cởi mở, chúng ta phải phát triển luật của nó, công nhận những yêu cầu độc đáo của AI trong khi giải quyết các thách thức một cách trực diện để tạo ra một hệ sinh thái bao gồm và bền vững.

Dr. Yair Adato là người sáng lập và CEO của Bria, công ty được thành lập để tạo ra một nền tảng AI tạo sinh không rủi ro. Tầm nhìn của ông là tạo ra một nền tảng AI tạo sinh tuân theo các nguyên tắc AI có trách nhiệm và định nghĩa lại các khái niệm về bản quyền và sở hữu trí tuệ để dữ liệu sở hữu và AI tạo sinh có thể cùng tồn tại.
Ông là một tầm nhìn trong lĩnh vực của mình, Dr. Adato nắm giữ bằng Tiến sĩ về Khoa học Máy tính trong lĩnh vực tầm nhìn máy tính từ Đại học Ben-Gurion hợp tác với Đại học Harvard. Với hơn 50 bằng sáng chế xây cầu nối giữa AI và sử dụng thương mại, Dr. Adato tự hào có một hồ sơ ấn tượng về việc thúc đẩy sự đổi mới của AI. Trước khi lãnh đạo Bria, Dr. Adato từng là CTO tại Trax Retail, cho phép Trax phát triển nhanh chóng từ một công ty khởi nghiệp giai đoạn đầu với 20 nhân viên đến một công ty kỳ lân với gần 1000 nhân viên. Ông từng là thành viên hội đồng tư vấn cho một số công ty bao gồm Sparx, Vicomi, Tasq, DataGen và Anima.