Phỏng vấn

Saurabh Vij, CEO & Co-Founder của MonsterAPI – Chuỗi Phỏng Vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Saurabh Vij là CEO và đồng sáng lập của MonsterAPI. Ông từng làm việc như một nhà vật lý hạt tại CERN và nhận ra tiềm năng của tính toán phân tán từ các dự án như LHC@home.

MonsterAPI tận dụng các GPU hàng hóa giá thấp từ các trang trại khai thác tiền điện tử đến các trung tâm dữ liệu nhỏ không hoạt động để cung cấp cơ sở hạ tầng GPU có thể mở rộng và giá cả phải chăng cho học máy, cho phép các nhà phát triển truy cập, tinh chỉnh và triển khai các mô hình AI với chi phí giảm đáng kể mà không cần viết một dòng mã.

Trước MonsterAPI, ông đã điều hành hai công ty khởi nghiệp, bao gồm một công ty phát triển thiết bị an toàn đeo được cho phụ nữ ở Ấn Độ, hợp tác với Chính phủ Ấn Độ và IIT Delhi.

Bạn có thể chia sẻ câu chuyện về sự ra đời của MonsterGPT?

Sứ mệnh của chúng tôi luôn là “giúp các nhà phát triển phần mềm tinh chỉnh và triển khai các mô hình AI nhanh hơn và dễ dàng nhất có thể.” Chúng tôi nhận ra rằng có nhiều thách thức phức tạp mà họ phải đối mặt khi muốn tinh chỉnh và triển khai một mô hình AI.

Từ việc xử lý mã đến thiết lập các container Docker trên GPU và mở rộng quy mô của chúng theo nhu cầu

Và tốc độ mà hệ sinh thái đang di chuyển, chỉ tinh chỉnh là không đủ. Nó cần được thực hiện theo cách đúng: Tránh underfitting, overfitting, tối ưu hóa siêu tham số, tích hợp các phương pháp mới nhất như LORA và Q-LORA để thực hiện tinh chỉnh nhanh hơn và tiết kiệm hơn. Một khi đã tinh chỉnh, mô hình cần được triển khai hiệu quả.

Điều này khiến chúng tôi nhận ra rằng việc cung cấp chỉ một công cụ cho một phần nhỏ của quy trình là không đủ. Một nhà phát triển cần toàn bộ quy trình tối ưu hóa kết hợp với một giao diện tuyệt vời mà họ quen thuộc. Từ tinh chỉnh đến đánh giá và triển khai cuối cùng của các mô hình của họ.

Tôi đã tự hỏi mình một câu hỏi: Là một nhà vật lý hạt former, tôi hiểu tác động sâu sắc mà AI có thể có đối với công việc khoa học, nhưng tôi không biết bắt đầu từ đâu. Tôi có ý tưởng sáng tạo nhưng thiếu thời gian để học tất cả các kỹ năng và sắc thái của học máy và cơ sở hạ tầng.

Điều gì nếu tôi có thể chỉ nói chuyện với một AI, cung cấp yêu cầu của mình và có nó xây dựng toàn bộ quy trình cho tôi, cung cấp điểm cuối API yêu cầu?

Điều này dẫn đến ý tưởng về một hệ thống dựa trên trò chuyện để giúp các nhà phát triển tinh chỉnh và triển khai một cách dễ dàng.

MonsterGPT là bước đầu tiên trong hành trình này.

Có hàng triệu nhà phát triển phần mềm, nhà đổi mới và nhà khoa học như chúng tôi có thể tận dụng phương pháp này để xây dựng các mô hình lĩnh vực cụ thể hơn cho các dự án của họ.

Bạn có thể giải thích công nghệ cơ bản đằng sau tác nhân triển khai GPT của Monster API?

MonsterGPT tận dụng các công nghệ tiên tiến để triển khai và tinh chỉnh hiệu quả các mô hình ngôn ngữ lớn mã nguồn mở (LLM) như Phi3 từ Microsoft và Llama 3 từ Meta.

  1. RAG với cấu hình ngữ cảnh: Tự động chuẩn bị cấu hình với các siêu tham số đúng cho việc tinh chỉnh LLM hoặc triển khai mô hình sử dụng các API REST có thể mở rộng từ MonsterAPI.
  2. LoRA (Low-Rank Adaptation): Cho phép tinh chỉnh hiệu quả bằng cách cập nhật chỉ một tập hợp con của các tham số, giảm tải tính toán và yêu cầu bộ nhớ.
  3. Các kỹ thuật lượng tử hóa: Sử dụng GPT-Q và AWQ để tối ưu hóa hiệu suất mô hình bằng cách giảm độ chính xác, giảm dấu chân bộ nhớ và tăng tốc độ suy luận mà không mất nhiều độ chính xác.
  4. Động cơ vLLM: Cung cấp dịch vụ LLM có hiệu suất cao với các tính năng như đợt liên tục, các nhân CUDA được tối ưu hóa và các thuật toán giải mã song song cho suy luận quy mô lớn hiệu quả.
  5. GPU phân tán cho khả năng mở rộng và chi phí thấp: Các công việc tinh chỉnh và triển khai của chúng tôi chạy trên một mạng lưới GPU giá thấp từ nhiều nhà cung cấp từ các trung tâm dữ liệu nhỏ hơn đến các đám mây GPU mới nổi như coreweave cho khả năng chi phí thấp, tùy chọn cao và sẵn sàng của GPU để đảm bảo xử lý hiệu quả và có thể mở rộng.

Hãy xem blog mới nhất này về việc triển khai Llama 3 bằng MonsterGPT:

Nó streamlines quy trình tinh chỉnh và triển khai như thế nào?

MonsterGPT cung cấp một giao diện trò chuyện với khả năng hiểu các hướng dẫn bằng ngôn ngữ tự nhiên để khởi chạy, theo dõi và quản lý các công việc tinh chỉnh và triển khai hoàn chỉnh. Khả năng này trừu tượng hóa nhiều bước phức tạp như:

  • Xây dựng một đường ống dữ liệu
  • Xác định cơ sở hạ tầng GPU đúng cho công việc
  • Cấu hình các siêu tham số phù hợp
  • Cài đặt môi trường ML với các framework và thư viện tương thích
  • Triển khai các kịch bản tinh chỉnh cho LoRA/QLoRA tinh chỉnh hiệu quả với các chiến lược lượng tử hóa.
  • Đebug các vấn đề như bộ nhớ hết và lỗi mã.
  • Thiết kế và triển khai đa nút tự động mở rộng với các động cơ phục vụ có hiệu suất cao như vLLM cho các triển khai LLM.

Loại giao diện người dùng và lệnh nào mà các nhà phát triển có thể mong đợi khi tương tác với giao diện trò chuyện của Monster API?

Giao diện người dùng là một giao diện trò chuyện đơn giản trong đó người dùng có thể yêu cầu tác nhân tinh chỉnh một LLM cho một nhiệm vụ cụ thể như tóm tắt, hoàn thành cuộc trò chuyện, tạo mã, viết blog, v.v. và sau đó, một khi đã tinh chỉnh, GPT có thể được hướng dẫn thêm để triển khai LLM và truy vấn mô hình đã triển khai từ giao diện GPT chính nó. Một số ví dụ về lệnh bao gồm:

  • Tinh chỉnh một LLM cho việc tạo mã trên tập dữ liệu X
  • Tôi muốn một mô hình được tinh chỉnh cho việc viết blog
  • Cung cấp cho tôi một điểm cuối API cho mô hình Llama 3.
  • Triển khai một mô hình nhỏ cho trường hợp sử dụng viết blog

Điều này cực kỳ hữu ích vì việc tìm kiếm mô hình đúng cho dự án của bạn có thể thường trở thành một nhiệm vụ tốn thời gian. Với các mô hình mới xuất hiện hàng ngày, nó có thể dẫn đến rất nhiều sự nhầm lẫn.

Làm thế nào giải pháp của Monster API so sánh về tính dễ sử dụng và hiệu quả so với các phương pháp truyền thống để triển khai các mô hình AI?

Giải pháp của Monster API tăng cường đáng kể tính dễ sử dụng và hiệu quả so với các phương pháp truyền thống để triển khai các mô hình AI.

Về Tính Dễ Sử Dụng:

  1. Cấu hình Tự động: Các phương pháp truyền thống thường yêu cầu thiết lập thủ công các siêu tham số và cấu hình, điều này có thể dễ bị lỗi và tốn thời gian. MonsterAPI tự động hóa quá trình này bằng cách sử dụng RAG với ngữ cảnh, đơn giản hóa thiết lập và giảm khả năng xảy ra lỗi.
  2. API REST có thể mở rộng: MonsterAPI cung cấp các API REST trực quan để triển khai và tinh chỉnh mô hình, khiến nó trở nên dễ tiếp cận ngay cả đối với người dùng có kiến thức hạn chế về học máy. Các phương pháp truyền thống thường yêu cầu kiến thức kỹ thuật sâu và mã hóa phức tạp để triển khai.
  3. Nền tảng Thống Nhất: Nó tích hợp toàn bộ quy trình, từ tinh chỉnh đến triển khai, trong một nền tảng duy nhất. Các phương pháp truyền thống có thể liên quan đến các công cụ và nền tảng riêng biệt, dẫn đến sự không hiệu quả và thách thức tích hợp.

Về Hiệu Quả:

MonsterAPI cung cấp một quy trình tinh chỉnh và triển khai được tối ưu hóa với tinh chỉnh LoRA tích hợp và lượng tử hóa để sử dụng bộ nhớ hiệu quả và động cơ vLLM cho dịch vụ LLM có hiệu suất cao với đợt liên tục, nhân CUDA được tối ưu hóa và thuật toán giải mã song song cho suy luận quy mô lớn hiệu quả.

Toàn bộ quy trình này tăng cường năng suất của nhà phát triển bằng cách cho phép tạo ra các ứng dụng LLM tùy chỉnh cấp sản xuất trong khi giảm nhu cầu về kỹ năng kỹ thuật phức tạp.

Bạn có thể cung cấp các ví dụ về các trường hợp sử dụng mà Monster API đã giảm đáng kể thời gian và tài nguyên cần thiết cho việc triển khai mô hình?

Một công ty tư vấn CNTT cần tinh chỉnh và triển khai mô hình Llama 3 để đáp ứng nhu cầu kinh doanh của khách hàng. Nếu không có MonsterAPI, họ sẽ cần một đội gồm 2-3 kỹ sư MLOps với kiến thức sâu về tinh chỉnh siêu tham số để cải thiện chất lượng mô hình trên tập dữ liệu cung cấp, và sau đó lưu trữ mô hình đã tinh chỉnh như một điểm cuối API REST có thể mở rộng bằng cách sử dụng tự động mở rộng và điều phối, có thể trên Kubernetes. Ngoài ra, để tối ưu hóa kinh tế của việc phục vụ mô hình, họ muốn sử dụng các framework như LoRA cho việc tinh chỉnh và vLLM cho việc phục vụ mô hình để cải thiện các chỉ số chi phí trong khi giảm tiêu thụ bộ nhớ. Điều này có thể là một thách thức phức tạp cho nhiều nhà phát triển và có thể mất vài tuần hoặc thậm chí vài tháng để đạt được một giải pháp sẵn sàng cho sản xuất. Với MonsterAPI, họ có thể thử nghiệm với nhiều lần tinh chỉnh trong một ngày và lưu trữ mô hình đã tinh chỉnh với điểm đánh giá tốt nhất trong vài giờ, mà không cần nhiều tài nguyên kỹ thuật với kỹ năng MLOps sâu.

Monster API tiếp cận việc dân chủ hóa việc truy cập vào các mô hình AI tạo ra như thế nào cho các nhà phát triển nhỏ hơn và các công ty khởi nghiệp?

Các nhà phát triển nhỏ và các công ty khởi nghiệp thường gặp khó khăn trong việc sản xuất và sử dụng các mô hình AI chất lượng cao do thiếu vốn và kỹ năng kỹ thuật. Các giải pháp của chúng tôi trao quyền cho họ bằng cách giảm chi phí, đơn giản hóa quy trình và cung cấp các công cụ không mã/low-code mạnh mẽ để thực hiện các đường ống AI sẵn sàng cho sản xuất.

Bằng cách tận dụng đám mây GPU phân tán của chúng tôi, chúng tôi cung cấp tài nguyên GPU có thể mở rộng và giá cả phải chăng, giảm đáng kể rào cản chi phí cho việc triển khai mô hình hiệu suất cao. Cấu hình tự động và tinh chỉnh siêu tham số của nền tảng đơn giản hóa quy trình, loại bỏ nhu cầu về kiến thức kỹ thuật sâu.

Các API REST trực quan và quy trình tích hợp của chúng tôi kết hợp tinh chỉnh và triển khai vào một quy trình duy nhất, làm cho các công nghệ AI tiên tiến trở nên dễ tiếp cận ngay cả đối với những người có kinh nghiệm hạn chế. Ngoài ra, việc sử dụng các kỹ thuật tinh chỉnh LoRA hiệu quả và lượng tử hóa như GPT-Q và AWQ đảm bảo hiệu suất tối ưu trên phần cứng ít tốn kém hơn, giảm thêm chi phí đầu vào.

Phương pháp này trao quyền cho các nhà phát triển nhỏ và các công ty khởi nghiệp để thực hiện và quản lý các mô hình AI tạo ra một cách hiệu quả và hiệu quả.

Bạn hình dung gì về bước tiến lớn tiếp theo hoặc tính năng mà Monster API sẽ mang đến cho cộng đồng phát triển AI?

Chúng tôi đang làm việc trên một số sản phẩm đổi mới để thúc đẩy thêm luận điểm của mình: Giúp các nhà phát triển tùy chỉnh và triển khai mô hình nhanh hơn, dễ dàng hơn và tiết kiệm nhất.

Ngay lập tức, chúng tôi đang phát triển một Trợ lý AI MLOps toàn diện thực hiện nghiên cứu về các chiến lược tối ưu hóa mới cho LLMOps và tích hợp chúng vào các quy trình hiện có để giảm nỗ lực của nhà phát triển trong việc xây dựng các mô hình mới và tốt hơn trong khi cũng cho phép tùy chỉnh và triển khai hoàn toàn các đường ống LLM cấp sản xuất.

Giả sử bạn cần tạo 1 triệu hình ảnh mỗi phút cho trường hợp sử dụng của mình. Điều này có thể cực kỳ tốn kém. Thông thường, bạn sẽ sử dụng mô hình Stable Diffusion và mất hàng giờ để tìm và thử các framework tối ưu hóa như TensorRT để cải thiện thông lượng của mình mà không ảnh hưởng đến chất lượng và độ trễ của đầu ra.

Tuy nhiên, với Trợ lý MLOps của MonsterAPI, bạn sẽ không cần lãng phí tất cả các tài nguyên đó. Trợ lý sẽ tìm framework tốt nhất cho yêu cầu của bạn, tận dụng các tối ưu hóa như TensorRT được thiết kế cho trường hợp sử dụng cụ thể của bạn.

Làm thế nào Monster API dự định tiếp tục hỗ trợ và tích hợp các mô hình mã nguồn mở mới khi chúng xuất hiện?

Theo 3 cách chính:

  1. Mang lại khả năng truy cập vào các mô hình mã nguồn mở mới nhất
  2. Cung cấp giao diện đơn giản nhất cho tinh chỉnh và triển khai
  3. Tối ưu hóa toàn bộ ngăn xếp cho tốc độ và chi phí với các framework và thư viện mạnh mẽ nhất

Sứ mệnh của chúng tôi là giúp các nhà phát triển ở mọi cấp độ kỹ năng áp dụng Gen AI nhanh hơn, giảm thời gian từ ý tưởng đến điểm cuối API được hoàn thiện.

Chúng tôi sẽ tiếp tục nỗ lực cung cấp khả năng truy cập vào các framework và thư viện mới nhất và mạnh mẽ nhất, tích hợp vào một quy trình không gián đoạn để thực hiện LLMOps từ đầu đến cuối. Chúng tôi cam kết giảm sự phức tạp cho các nhà phát triển với các công cụ không mã của chúng tôi, do đó tăng cường năng suất của họ trong việc xây dựng và triển khai các mô hình AI.

Để đạt được điều này, chúng tôi liên tục hỗ trợ và tích hợp các mô hình mã nguồn mở mới, framework tối ưu hóa và thư viện bằng cách theo dõi các tiến bộ trong cộng đồng AI. Chúng tôi duy trì một đám mây GPU phân tán có thể mở rộng và tích cực tham gia với các nhà phát triển để có quyền truy cập sớm và phản hồi. Bằng cách tận dụng các đường ống tự động cho tích hợp không gián đoạn, tăng cường API linh hoạt và hình thành các quan hệ đối tác chiến lược với các tổ chức nghiên cứu AI, chúng tôi đảm bảo rằng nền tảng của chúng tôi vẫn ở cấp độ tiên tiến.

Ngoài ra, chúng tôi cung cấp tài liệu toàn diện và hỗ trợ kỹ thuật mạnh mẽ, cho phép các nhà phát triển nhanh chóng áp dụng và sử dụng các mô hình mới nhất. MonsterAPI giữ cho các nhà phát triển ở tiền phong của công nghệ AI tạo ra, trao quyền cho họ để đổi mới và thành công.

Monster API có những mục tiêu dài hạn gì về phát triển công nghệ và phạm vi thị trường?

Dài hạn, chúng tôi muốn giúp 30 triệu kỹ sư phần mềm trở thành nhà phát triển MLOps với sự giúp đỡ của Trợ lý MLOps của chúng tôi và tất cả các công cụ chúng tôi đang xây dựng.

Điều này sẽ yêu cầu chúng tôi xây dựng không chỉ một trợ lý toàn diện mà còn nhiều công nghệ cơ bản độc quyền xung quanh các framework tối ưu hóa, phương pháp container hóa và điều phối.

Chúng tôi tin rằng sự kết hợp giữa các giao diện tuyệt vời, đơn giản, 10 lần hiệu suất cao hơn và GPU phân tán chi phí thấp có tiềm năng chuyển đổi năng suất của một nhà phát triển và do đó tăng tốc việc áp dụng GenAI.

Tất cả nghiên cứu và nỗ lực của chúng tôi đều theo hướng này.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập MonsterAPI.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.