Phỏng vấn
Jason Knight là Đồng sáng lập và Phó Chủ tịch ML tại OctoAI – Loạt phỏng vấn

Jason Knight là Đồng sáng lập và Phó Chủ tịch Máy học tại OctoAI, nền tảng cung cấp một ngăn xếp hoàn chỉnh cho các nhà xây dựng ứng dụng để chạy, điều chỉnh và mở rộng các ứng dụng AI của họ trên đám mây hoặc tại chỗ.
OctoAI được tách ra từ Đại học Washington bởi những người tạo ra Apache TVM, một ngăn xếp mã nguồn mở cho khả năng di chuyển và hiệu suất của Máy học. TVM cho phép các mô hình Máy học chạy hiệu quả trên bất kỳ phần cứng nào, và đã trở thành một phần quan trọng của kiến trúc của các thiết bị tiêu dùng phổ biến như Amazon Alexa.
Bạn có thể chia sẻ cảm hứng đằng sau việc thành lập OctoAI và vấn đề cốt lõi mà bạn nhằm giải quyết?
Truyền thống, AI là một lĩnh vực phức tạp chỉ có thể tiếp cận được bởi những người thoải mái với toán học và tính toán hiệu suất cao cần thiết để tạo ra một thứ gì đó với nó. Nhưng AI mở khóa các giao diện tính toán tối thượng, đó là văn bản, giọng nói và hình ảnh được lập trình bởi các ví dụ và phản hồi, và mang lại toàn bộ sức mạnh của tính toán cho mọi người trên Trái đất. Trước AI, chỉ có các lập trình viên mới có thể làm cho máy tính thực hiện những gì họ muốn bằng cách viết các văn bản ngôn ngữ lập trình bí ẩn.
OctoAI được tạo ra để tăng tốc con đường của chúng tôi đến thực tế đó để nhiều người hơn có thể sử dụng và hưởng lợi từ AI. Và người dân, đến lượt họ, có thể sử dụng AI để tạo ra nhiều lợi ích hơn bằng cách tăng tốc các khoa học, y học, nghệ thuật và hơn thế nữa.
Khi nhìn lại kinh nghiệm của bạn tại Intel (INTC ), làm thế nào các vai trò trước đây của bạn chuẩn bị cho bạn việc đồng sáng lập và lãnh đạo sự phát triển tại OctoAI?
Intel và các công ty khởi nghiệp về phần cứng AI và sinh học trước đó đã cho tôi cái nhìn về việc làm thế nào khó khăn AI đối với thậm chí các công ty công nghệ tinh vi nhất, và tuy nhiên, nó có thể có giá trị như thế nào đối với những người đã tìm ra cách sử dụng nó. Và thấy rằng khoảng cách giữa những người được hưởng lợi từ AI so với những người chưa được hưởng lợi từ AI chủ yếu là một vấn đề về cơ sở hạ tầng, tính toán và các phương pháp hay nhất – không phải là ma thuật.
Điều gì phân biệt OctoStack với các giải pháp triển khai AI khác có sẵn trên thị trường ngày nay?
OctoStack là ngăn xếp công nghệ hoàn chỉnh đầu tiên được thiết kế đặc biệt cho việc cung cấp các mô hình AI tạo sinh ở bất kỳ nơi nào. Nó cung cấp một nền tảng sản xuất hoàn chỉnh cung cấp suy luận tối ưu hóa cao, tùy chỉnh mô hình và quản lý tài sản ở quy mô doanh nghiệp.
OctoStack cho phép các tổ chức đạt được tự chủ AI bằng cách chạy bất kỳ mô hình nào trong môi trường ưa thích của họ với quyền kiểm soát đầy đủ đối với dữ liệu, mô hình và phần cứng. Nó cũng cung cấp hiệu suất và hiệu quả chi phí không thể sánh được, với tiết kiệm lên đến 12 lần so với các giải pháp khác như GPT-4.
Bạn có thể giải thích các lợi thế của việc triển khai các mô hình AI trong môi trường riêng tư sử dụng OctoStack?
Các mô hình ngày nay rất phổ biến, nhưng việc lắp ráp cơ sở hạ tầng đúng để chạy các mô hình và áp dụng chúng với dữ liệu của riêng bạn là nơi bánh xe kinh doanh thực sự bắt đầu quay. Sử dụng các mô hình này trên dữ liệu nhạy cảm nhất của bạn, và sau đó chuyển đổi nó thành thông tin, kỹ thuật nhắc nhở tốt hơn, đường ống RAG và tinh chỉnh là nơi bạn có thể nhận được giá trị nhất từ AI tạo sinh. Nhưng nó vẫn khó khăn cho tất cả các công ty, ngoại trừ những công ty tinh vi nhất, để làm điều này một mình, đó là nơi một giải pháp hoàn chỉnh như OctoStack có thể tăng tốc và mang lại các phương pháp hay nhất cùng nhau trong một nơi cho các nhà thực hành của bạn.
Triển khai các mô hình AI trong môi trường riêng tư sử dụng OctoStack cung cấp một số lợi thế, bao gồm tăng cường bảo mật và kiểm soát đối với dữ liệu và mô hình. Khách hàng có thể chạy các ứng dụng AI tạo sinh trong VPC hoặc tại chỗ của riêng họ, đảm bảo rằng dữ liệu của họ vẫn an toàn và trong môi trường được chọn của họ. Cách tiếp cận này cũng cung cấp cho các doanh nghiệp sự linh hoạt để chạy bất kỳ mô hình nào, dù là mã nguồn mở, tùy chỉnh hay độc quyền, trong khi vẫn hưởng lợi từ việc giảm chi phí và cải thiện hiệu suất.
Thách thức mà bạn gặp phải khi tối ưu hóa OctoStack để hỗ trợ một loạt các phần cứng, và làm thế nào những thách thức này được vượt qua?
Tối ưu hóa OctoStack để hỗ trợ một loạt các phần cứng liên quan đến việc đảm bảo tính tương thích và hiệu suất trên các thiết bị khác nhau, chẳng hạn như GPU NVIDIA (NVDA ) và AMD và AWS Inferentia. OctoAI đã vượt qua những thách thức này bằng cách tận dụng chuyên môn sâu về hệ thống AI, được phát triển thông qua nhiều năm nghiên cứu và phát triển, để tạo ra một nền tảng liên tục cập nhật và hỗ trợ thêm các loại phần cứng, trường hợp sử dụng GenAI và các phương pháp hay nhất. Điều này cho phép OctoAI cung cấp hiệu suất và hiệu quả chi phí hàng đầu.
Ngoài ra, việc đưa các khả năng mới nhất của AI tạo sinh, chẳng hạn như đa phương thức, gọi hàm, tuân thủ lược đồ JSON nghiêm ngặt, lưu trữ tinh chỉnh hiệu quả và hơn thế nữa, vào tay các nhà phát triển nội bộ sẽ tăng tốc điểm cất cánh AI của bạn.
OctoAI có một lịch sử phong phú về việc tận dụng Apache TVM. Làm thế nào khuôn khổ này đã ảnh hưởng đến khả năng của nền tảng của bạn?
Chúng tôi đã tạo ra Apache TVM để làm cho nó dễ dàng hơn cho các nhà phát triển tinh vi viết thư viện AI hiệu quả cho GPU và tăng tốc hơn. Chúng tôi đã làm điều này vì việc nhận được hiệu suất tốt nhất từ phần cứng GPU và tăng tốc là rất quan trọng đối với suy luận AI lúc đó cũng như bây giờ.
Chúng tôi đã tận dụng cùng một tư duy và chuyên môn cho toàn bộ ngăn xếp phục vụ Gen AI để cung cấp tự động hóa cho một tập hợp các nhà phát triển rộng lớn hơn.
Bạn có thể thảo luận về bất kỳ cải tiến hiệu suất đáng kể nào mà OctoStack cung cấp, chẳng hạn như mức tăng hiệu suất 10 lần trong các triển khai quy mô lớn?
OctoStack cung cấp các cải tiến hiệu suất đáng kể, bao gồm tiết kiệm lên đến 12 lần so với các mô hình khác như GPT-4 mà không hy sinh tốc độ hoặc chất lượng. Nó cũng cung cấp khả năng sử dụng GPU tốt hơn 4 lần và giảm 50% chi phí hoạt động, cho phép các tổ chức chạy các triển khai quy mô lớn một cách hiệu quả và tiết kiệm chi phí.
Bạn có thể chia sẻ một số trường hợp sử dụng đáng chú ý mà OctoStack đã cải thiện đáng kể việc triển khai AI cho khách hàng của bạn?
Một trường hợp sử dụng đáng chú ý là Apate.ai, một dịch vụ toàn cầu chống lại các cuộc gọi gian lận điện thoại sử dụng AI trò chuyện tạo sinh. Apate.ai đã tận dụng OctoStack để chạy hiệu quả bộ ứng dụng mô hình ngôn ngữ của họ trên nhiều địa lý, hưởng lợi từ tính linh hoạt, quy mô và bảo mật của OctoStack. Việc triển khai này cho phép Apate.ai cung cấp các mô hình tùy chỉnh hỗ trợ nhiều ngôn ngữ và phương ngữ khu vực, đáp ứng các yêu cầu về hiệu suất và bảo mật của họ.
Ngoài ra, chúng tôi phục vụ hàng trăm tinh chỉnh cho khách hàng OpenPipe của chúng tôi. Nếu họ phải tạo các thể hiện chuyên dụng cho từng thể hiện này, các trường hợp sử dụng của khách hàng sẽ không thể thực hiện được khi họ phát triển và tiến hóa các trường hợp sử dụng của mình và liên tục tái đào tạo các tinh chỉnh hiệu quả tham số của họ để có chất lượng đầu ra tối đa với giá cả phải chăng.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập OctoAI.












