Phỏng vấn

Alex Ratner, CEO & Co-Founder của Snorkel AI – Phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Alex Ratner là CEO & Co-Founder của Snorkel AI, một công ty được thành lập từ phòng thí nghiệm trí tuệ nhân tạo của Stanford.

Snorkel AI làm cho việc phát triển AI trở nên nhanh chóng và thực tế bằng cách chuyển đổi các quy trình phát triển AI thủ công thành các giải pháp lập trình. Snorkel AI cho phép các doanh nghiệp phát triển AI hoạt động cho các khối lượng công việc độc đáo của họ bằng cách sử dụng dữ liệu và kiến thức độc quyền của họ với tốc độ nhanh hơn 10-100 lần.

Điều gì đã thu hút bạn đến với khoa học máy tính?

Có hai khía cạnh thú vị của khoa học máy tính khi bạn còn trẻ. Một, bạn có thể học hỏi nhanh như bạn muốn từ việc thử nghiệm và xây dựng, nhờ vào phản hồi tức thời, chứ không phải chờ đợi một giáo viên. Hai, bạn có thể xây dựng nhiều mà không cần phải xin phép ai!

Tôi bắt đầu lập trình khi còn là một đứa trẻ vì những lý do này. Tôi cũng yêu thích sự chính xác mà nó yêu cầu. Tôi thích quá trình trừu tượng hóa các quy trình và routine phức tạp, và sau đó mã hóa chúng theo cách mô-đun.

Sau này, khi đã trưởng thành, tôi quay lại với khoa học máy tính chuyên nghiệp thông qua một công việc tư vấn, nơi tôi được giao nhiệm vụ viết các kịch bản để thực hiện một số phân tích cơ bản về tập hợp các bằng sáng chế. Tôi bị thu hút bởi lượng kiến thức của con người – bất cứ điều gì mà bất kỳ ai đã từng coi là có thể cấp bằng sáng chế – đều có sẵn, nhưng lại khó tiếp cận vì rất khó để thực hiện thậm chí các phân tích đơn giản nhất trên văn bản kỹ thuật phức tạp và dữ liệu đa phương tiện.

Điều này đã dẫn tôi quay lại với khoa học máy tính, và cuối cùng quay lại trường đại học Stanford, tập trung vào NLP, đó là lĩnh vực sử dụng ML/AI trên ngôn ngữ tự nhiên.

Bạn đã bắt đầu và lãnh đạo dự án Snorkel mã nguồn mở khi còn tại Stanford, bạn có thể cho chúng tôi biết về hành trình của những ngày đầu không?

Vào thời điểm đó, chúng tôi tập trung vào việc phát triển các thuật toán mới và – tức là tất cả những thứ “phức tạp” về học máy mà mọi người trong cộng đồng nghiên cứu và xuất bản.

Tuy nhiên, chúng tôi luôn cam kết gắn liền với các vấn đề thực tế – chủ yếu với các bác sĩ và nhà khoa học tại Stanford. Nhưng mỗi khi chúng tôi trình bày một mô hình hoặc thuật toán mới, phản hồi trở thành “được, chúng tôi sẽ thử, nhưng chúng tôi cần tất cả dữ liệu đào tạo có nhãn mà chúng tôi không có thời gian để tạo!”

Chúng tôi nhận thấy rằng vấn đề lớn chưa được nói đến là về quá trình gắn nhãn và thu thập dữ liệu đào tạo – vì vậy chúng tôi đã chuyển tất cả sự tập trung của mình vào đó, và đó là cách dự án Snorkel và ý tưởng về “trí tuệ nhân tạo dựa trên dữ liệu” bắt đầu.

Snorkel có một cách tiếp cận trí tuệ nhân tạo dựa trên dữ liệu, bạn có thể định nghĩa điều này là gì và nó khác với phát triển trí tuệ nhân tạo dựa trên mô hình như thế nào?

Trí tuệ nhân tạo dựa trên dữ liệu có nghĩa là tập trung vào việc xây dựng dữ liệu tốt hơn để xây dựng mô hình tốt hơn.

Điều này trái ngược với – nhưng hoạt động cùng với – phát triển trí tuệ nhân tạo dựa trên mô hình. Trong phát triển trí tuệ nhân tạo dựa trên mô hình, các nhà khoa học dữ liệu hoặc nhà nghiên cứu giả định rằng dữ liệu là tĩnh và đổ năng lượng của họ vào việc điều chỉnh kiến trúc mô hình và tham số để đạt được kết quả tốt hơn.

Những nhà nghiên cứu vẫn làm việc tuyệt vời trong phát triển trí tuệ nhân tạo dựa trên mô hình, nhưng các mô hình và kỹ thuật học máy tự động đã cải thiện rất nhiều đến mức việc chọn mô hình đã trở thành một thứ hàng hóa tại thời điểm sản xuất. Khi đó, cách tốt nhất để cải thiện những mô hình này là cung cấp cho chúng nhiều dữ liệu tốt hơn.

Các nguyên tắc cốt lõi của một cách tiếp cận trí tuệ nhân tạo dựa trên dữ liệu là gì?

Nguyên tắc cốt lõi của trí tuệ nhân tạo dựa trên dữ liệu là đơn giản: dữ liệu tốt hơn xây dựng mô hình tốt hơn.

Trong công việc học thuật của chúng tôi, chúng tôi đã gọi đây là “lập trình dữ liệu”. Ý tưởng là nếu bạn cung cấp cho một mô hình đủ mạnh đủ nhiều ví dụ về đầu vào và đầu ra mong muốn, mô hình sẽ học cách nhân bản những mẫu đó.

Điều này đưa ra một thách thức lớn hơn bạn có thể tưởng tượng. Hầu hết dữ liệu không có nhãn – hoặc ít nhất, không có nhãn hữu ích cho ứng dụng của bạn. Gắn nhãn dữ liệu bằng tay đòi hỏi sự nhàm chán, thời gian và công sức của con người.

Có một tập dữ liệu đã được gắn nhãn cũng không đảm bảo chất lượng. Lỗi của con người len lỏi vào mọi nơi. Mỗi ví dụ không chính xác trong tập dữ liệu cơ bản sẽ làm giảm hiệu suất của mô hình cuối cùng. Không có lượng điều chỉnh tham số nào có thể che giấu thực tế đó. Các nhà nghiên cứu thậm chí đã tìm thấy các bản ghi không chính xác trong các tập dữ liệu mã nguồn mở cơ bản.

Bạn có thể giải thích thêm về việc trí tuệ nhân tạo dựa trên dữ liệu là lập trình như thế nào?

Gắn nhãn dữ liệu bằng tay đưa ra những thách thức nghiêm trọng. Việc này đòi hỏi nhiều giờ làm việc của con người, và đôi khi những giờ làm việc đó có thể rất tốn kém. Các tài liệu y tế, ví dụ, chỉ có thể được gắn nhãn bởi các bác sĩ.

Bên cạnh đó, các dự án gắn nhãn bằng tay thường chỉ là các dự án một lần. Những người gắn nhãn gắn nhãn dữ liệu theo một lược đồ cứng nhắc. Nếu nhu cầu của doanh nghiệp thay đổi và yêu cầu một tập hợp các nhãn khác, những người gắn nhãn phải bắt đầu lại từ đầu.

Các phương pháp lập trình cho trí tuệ nhân tạo dựa trên dữ liệu giảm thiểu cả hai vấn đề này. Hệ thống gắn nhãn lập trình của Snorkel AI kết hợp các tín hiệu đa dạng – từ các mô hình cũ đến các nhãn hiện có đến các cơ sở tri thức bên ngoài – để phát triển các nhãn xác suất với quy mô lớn. Nguồn tín hiệu chính của chúng tôi đến từ các chuyên gia trong lĩnh vực hợp tác với các nhà khoa học dữ liệu để xây dựng các hàm gắn nhãn. Những hàm này mã hóa phán quyết chuyên môn của họ thành các quy tắc có thể mở rộng, cho phép nỗ lực đầu tư vào một quyết định ảnh hưởng đến hàng chục hoặc hàng trăm điểm dữ liệu.

Khung này cũng linh hoạt. Thay vì bắt đầu từ đầu khi nhu cầu kinh doanh thay đổi, người dùng thêm, xóa và điều chỉnh các hàm gắn nhãn để áp dụng các nhãn mới trong vài giờ thay vì vài ngày.

Làm thế nào cách tiếp cận dựa trên dữ liệu này cho phép mở rộng nhanh chóng dữ liệu không có nhãn?

Cách tiếp cận lập trình của chúng tôi cho trí tuệ nhân tạo dựa trên dữ liệu cho phép mở rộng nhanh chóng dữ liệu không có nhãn bằng cách khuếch đại tác động của mỗi lựa chọn. Một khi các chuyên gia trong lĩnh vực thiết lập một tập hợp nhỏ ban đầu của dữ liệu cơ bản, họ bắt đầu hợp tác với các nhà khoa học dữ liệu để lặp lại nhanh chóng. Họ định nghĩa một số hàm gắn nhãn, đào tạo một mô hình nhanh, phân tích tác động của các hàm gắn nhãn của họ, và sau đó thêm, xóa hoặc điều chỉnh các hàm gắn nhãn khi cần.

Mỗi chu kỳ cải thiện hiệu suất của mô hình cho đến khi nó đáp ứng hoặc vượt quá mục tiêu của dự án. Điều này có thể giảm thời gian gắn nhãn dữ liệu từ vài tháng xuống chỉ vài giờ. Trong một dự án nghiên cứu của Snorkel, hai nhà nghiên cứu của chúng tôi đã gắn nhãn 20.000 tài liệu trong một ngày – một khối lượng công việc có thể mất vài tuần hoặc thậm chí vài tháng nếu làm thủ công.

Snorkel cung cấp nhiều giải pháp AI, bao gồm Snorkel Flow, Snorkel GenGlow và Snorkel Foundry. Sự khác biệt giữa những giải pháp này là gì?

Bộ giải pháp Snorkel AI cho phép người dùng tạo các hàm gắn nhãn (ví dụ: tìm kiếm từ khóa hoặc mẫu trong tài liệu) để gắn nhãn lập trình hàng triệu điểm dữ liệu trong vài phút, thay vì gắn nhãn thủ công từng điểm dữ liệu một.

Nó nén thời gian cần thiết cho các công ty để chuyển đổi dữ liệu độc quyền của họ thành mô hình sẵn sàng sản xuất và bắt đầu trích xuất giá trị từ chúng. Snorkel AI cho phép các doanh nghiệp mở rộng các phương pháp dựa trên con người trong vòng lặp bằng cách kết hợp hiệu quả kiến thức và chuyên môn của con người.

Điều này dẫn đến AI minh bạch và giải thích được hơn, giúp các doanh nghiệp quản lý偏见 và cung cấp kết quả có trách nhiệm.

Xuống đến các chi tiết, Snorkel AI cho phép các doanh nghiệp Fortune 500:

  • Phát triển dữ liệu đã được gắn nhãn chất lượng cao để đào tạo mô hình hoặc cải thiện RAG;
  • Tùy chỉnh các mô hình ngôn ngữ lớn với việc tinh chỉnh;
  • Chắt lọc các mô hình ngôn ngữ lớn thành các mô hình chuyên dụng nhỏ hơn và rẻ hơn để vận hành;
  • Xây dựng các mô hình ngôn ngữ lớn chuyên về lĩnh vực và nhiệm vụ cụ thể với việc tiền huấn luyện.

Bạn đã viết một số bài báo đột phá, theo bạn, bài báo nào là quan trọng nhất?

Một trong những bài báo quan trọng là bài báo gốc về lập trình dữ liệu (gắn nhãn dữ liệu đào tạo lập trình) và về Snorkel.

Tầm nhìn của bạn cho tương lai của Snorkel là gì?

Tôi thấy Snorkel trở thành một đối tác đáng tin cậy cho tất cả các doanh nghiệp lớn nghiêm túc về AI.

Snorkel Flow nên trở thành một công cụ phổ biến cho các nhóm khoa học dữ liệu tại các doanh nghiệp lớn – cho dù họ đang tinh chỉnh các mô hình ngôn ngữ lớn tùy chỉnh cho tổ chức của mình, xây dựng các mô hình phân loại hình ảnh, hoặc xây dựng các mô hình hồi quy logistic đơn giản và có thể triển khai.

Dù doanh nghiệp cần loại mô hình nào, họ sẽ cần dữ liệu đã được gắn nhãn chất lượng cao để đào tạo nó.

Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập Snorkel AI,

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.