Phỏng vấn

Kirill Solodskih, Đồng sáng lập và CEO của TheStage AI – Phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Kirill Solodskih, PhD, là Đồng sáng lập và CEO của TheStage AI, cũng như một nhà nghiên cứu và doanh nhân AI kỳ cựu với hơn một thập kỷ kinh nghiệm trong việc tối ưu hóa mạng nơ-ron cho các ứng dụng kinh doanh thực tế. Vào năm 2024, anh đã đồng sáng lập TheStage AI, đã đảm bảo 4,5 triệu đô la tiền vốn để tự động hóa hoàn toàn gia tốc mạng nơ-ron trên mọi nền tảng phần cứng.

Trước đó, với tư cách là Trưởng nhóm tại Huawei, Kirill đã dẫn đầu việc tăng tốc ứng dụng camera AI cho Qualcomm (QCOM ) NPUs, đóng góp vào hiệu suất của điện thoại thông minh P50 và P60 và kiếm được nhiều bằng sáng chế cho các đổi mới của mình. Nghiên cứu của anh đã được giới thiệu tại các hội nghị hàng đầu như CVPRECCV , nơi nó nhận được giải thưởng và công nhận trong ngành. Anh cũng tổ chức một podcast về tối ưu hóa và suy luận AI.

Điều gì đã truyền cảm hứng cho bạn để đồng sáng lập TheStage AI, và bạn đã chuyển từ học thuật và nghiên cứu sang tối ưu hóa suy luận như một người sáng lập startup?

Những nền tảng cho điều cuối cùng trở thành TheStage AI bắt đầu với công việc của tôi tại Huawei, nơi tôi đã深入 vào việc tự động hóa triển khai và tối ưu hóa mạng nơ-ron. Những sáng kiến này đã trở thành nền tảng cho một số đổi mới đột phá của chúng tôi, và đó là nơi tôi nhìn thấy thách thức thực sự. Việc đào tạo một mô hình là một việc, nhưng việc đưa nó vào hoạt động hiệu quả trong thế giới thực và làm cho nó dễ tiếp cận với người dùng là một việc khác. Việc triển khai là nút thắt cổ chai đang giữ lại nhiều ý tưởng tuyệt vời từ việc trở thành hiện thực. Để tạo ra một thứ gì đó dễ sử dụng như ChatGPT, có rất nhiều thách thức phía sau.

Tối ưu hóa suy luận thủ công đã trở thành một nút thắt cổ chai trong AI. Bạn có thể giải thích cách TheStage AI tự động hóa quá trình này và tại sao nó lại là một yếu tố thay đổi cuộc chơi?

TheStage AI giải quyết một nút thắt cổ chai chính trong AI: nén và tăng tốc mạng nơ-ron thủ công. Mạng nơ-ron có hàng tỷ tham số, và việc xác định những tham số nào cần loại bỏ để cải thiện hiệu suất gần như không thể thực hiện được bằng tay. ANNA (Automated Neural Networks Analyzer) tự động hóa quá trình này, xác định các lớp cần loại bỏ khỏi tối ưu hóa, tương tự như cách nén ZIP được tự động hóa lần đầu tiên.

Điều này thay đổi cuộc chơi bằng cách làm cho việc áp dụng AI trở nên nhanh chóng và tiết kiệm hơn. Thay vì dựa vào các quy trình thủ công tốn kém, các công ty khởi nghiệp có thể tối ưu hóa mô hình tự động. Công nghệ này cung cấp cho doanh nghiệp cái nhìn rõ ràng về hiệu suất và chi phí, đảm bảo hiệu quả và khả năng mở rộng mà không cần phải đoán già đoán non.

TheStage AI tuyên bố giảm chi phí suy luận lên đến 5 lần — điều gì làm cho công nghệ tối ưu hóa của bạn hiệu quả so với các phương pháp truyền thống?

TheStage AI cắt giảm chi phí đầu ra lên đến 5 lần với một phương pháp tối ưu hóa vượt qua các phương pháp truyền thống. Thay vì áp dụng cùng một thuật toán cho toàn bộ mạng nơ-ron, ANNA chia nó thành các lớp nhỏ hơn và quyết định thuật toán nào để áp dụng cho từng phần để cung cấp nén mong muốn trong khi tối đa hóa chất lượng mô hình. Bằng cách kết hợp các mẹo toán học thông minh với các xấp xỉ hiệu quả, phương pháp của chúng tôi có khả năng mở rộng cao và làm cho việc áp dụng AI trở nên dễ dàng hơn cho các doanh nghiệp mọi quy mô. Chúng tôi cũng tích hợp các cài đặt trình biên dịch linh hoạt để tối ưu hóa mạng cho phần cứng cụ thể như iPhone hoặc GPU NVIDIA. Điều này cho chúng tôi nhiều quyền kiểm soát hơn để tinh chỉnh hiệu suất, tăng tốc độ mà không mất chất lượng.

Làm thế nào gia tốc suy luận của TheStage AI so với trình biên dịch gốc của PyTorch, và những lợi thế nào mà nó mang lại cho các nhà phát triển AI?

TheStage AI tăng tốc đầu ra vượt xa trình biên dịch gốc của PyTorch. PyTorch sử dụng một phương pháp biên dịch “just-in-time”, biên dịch mô hình mỗi khi nó chạy. Điều này dẫn đến thời gian khởi động dài, đôi khi mất vài phút hoặc thậm chí lâu hơn. Trong môi trường có thể mở rộng, điều này có thể tạo ra sự không hiệu quả, đặc biệt khi cần đưa các GPU mới trực tuyến để xử lý tải người dùng tăng, gây ra sự chậm trễ ảnh hưởng đến trải nghiệm người dùng.

Ngược lại, TheStage AI cho phép mô hình được biên dịch trước, vì vậy một khi mô hình đã sẵn sàng, nó có thể được triển khai ngay lập tức. Điều này dẫn đến việc triển khai nhanh hơn, hiệu quả dịch vụ được cải thiện và tiết kiệm chi phí. Các nhà phát triển có thể triển khai và mở rộng mô hình AI nhanh hơn, mà không có các nút thắt cổ chai của trình biên dịch truyền thống, làm cho nó hiệu quả và phản hồi hơn cho các trường hợp sử dụng có nhu cầu cao.

Bạn có thể chia sẻ thêm về công cụ QLIP của TheStage AI và cách nó cải thiện hiệu suất mô hình trong khi duy trì chất lượng?

QLIP, công cụ của TheStage AI, là một thư viện Python cung cấp một tập hợp các nguyên thủy thiết yếu để xây dựng nhanh các thuật toán tối ưu hóa mới được điều chỉnh cho các phần cứng khác nhau, như GPU và NPU. Công cụ bao gồm các thành phần như lượng tử hóa, cắt tỉa, đặc tả, biên dịch và phục vụ, tất cả đều quan trọng cho việc phát triển các hệ thống AI hiệu quả và có thể mở rộng.

Điều làm cho QLIP khác biệt là sự linh hoạt của nó. Nó cho phép các kỹ sư AI tạo mẫu và thực hiện các thuật toán mới chỉ với vài dòng mã. Ví dụ, một bài báo hội nghị AI gần đây về mạng nơ-ron lượng tử có thể được chuyển đổi thành một thuật toán hoạt động sử dụng các nguyên thủy của QLIP trong vài phút. Điều này làm cho nó dễ dàng cho các nhà phát triển tích hợp các nghiên cứu mới nhất vào mô hình của họ mà không bị giới hạn bởi các khuôn khổ cứng nhắc.

Không giống như các khuôn khổ mã nguồn mở truyền thống, QLIP cho phép bất kỳ ai thêm các kỹ thuật tối ưu hóa mới. Sự thích nghi này giúp các đội ngũ duy trì lợi thế trong bối cảnh AI đang phát triển nhanh chóng, cải thiện hiệu suất trong khi đảm bảo sự linh hoạt cho các đổi mới trong tương lai.

Bạn đã đóng góp vào các khuôn khổ lượng tử hóa AI được sử dụng trong máy ảnh P50 và P60 của Huawei. Kinh nghiệm đó đã định hình cách tiếp cận của bạn đối với tối ưu hóa AI như thế nào?

Kinh nghiệm làm việc trên các khuôn khổ lượng tử hóa AI cho máy ảnh P50 và P60 của Huawei đã mang lại cho tôi những hiểu biết quý giá về cách tối ưu hóa có thể được tự động hóa và mở rộng. Khi tôi bắt đầu với PyTorch, làm việc với đồ thị thực hiện hoàn chỉnh của mạng nơ-ron là cứng nhắc, và các thuật toán lượng tử hóa phải được thực hiện thủ công, lớp theo lớp. Tại Huawei, tôi đã xây dựng một khuôn khổ tự động hóa quá trình này. Bạn chỉ cần nhập mô hình, và nó sẽ tự động tạo mã cho lượng tử hóa, loại bỏ công việc thủ công.

Điều này đã giúp tôi nhận ra rằng tự động hóa trong tối ưu hóa AI là về việc cho phép tốc độ mà không hy sinh chất lượng. Một trong những thuật toán tôi đã phát triển và cấp bằng sáng chế đã trở thành thiết yếu cho Huawei, đặc biệt là khi họ phải chuyển từ bộ xử lý Kirin sang Qualcomm do các lệnh trừng phạt. Nó cho phép nhóm nhanh chóng thích nghi mạng nơ-ron với kiến trúc của Qualcomm mà không mất hiệu suất hoặc độ chính xác.

Bằng cách tự động hóa và tinh gọn quá trình, chúng tôi đã cắt giảm thời gian phát triển từ hơn một năm xuống chỉ vài tháng. Điều này đã có tác động lớn đến một sản phẩm được sử dụng bởi hàng triệu người và đã định hình cách tiếp cận của tôi đối với tối ưu hóa, tập trung vào tốc độ, hiệu quả và mất chất lượng tối thiểu. Đó là tư duy mà tôi mang đến cho ANNA ngày nay.

Nghiên cứu của bạn đã được giới thiệu tại CVPR và ECCV — những đột phá chính nào trong hiệu quả AI mà bạn tự hào nhất?

Khi được hỏi về những thành tựu của tôi trong hiệu quả AI, tôi luôn nghĩ về bài báo của chúng tôi được chọn để trình bày miệng tại CVPR 2023. Việc được chọn để trình bày miệng tại một hội nghị như vậy là hiếm, vì chỉ có 12 bài báo được chọn. Điều này cộng với việc AI tạo thường chiếm ưu thế trong sự chú ý, và bài báo của chúng tôi đã tiếp cận theo một cách khác, tập trung vào mặt toán học, cụ thể là phân tích và nén mạng nơ-ron.

Chúng tôi đã phát triển một phương pháp giúp chúng tôi hiểu được số lượng tham số mà một mạng nơ-ron thực sự cần để hoạt động hiệu quả. Bằng cách áp dụng các kỹ thuật từ phân tích hàm và chuyển từ một định dạng rời rạc sang một định dạng liên tục, chúng tôi đã có thể đạt được kết quả nén tốt trong khi vẫn giữ được khả năng tích hợp những thay đổi này trở lại vào mô hình. Bài báo cũng giới thiệu một số thuật toán mới mà cộng đồng chưa từng sử dụng và tìm thấy ứng dụng thêm.

Đây là một trong những bài báo đầu tiên của tôi trong lĩnh vực AI, và quan trọng là, nó là kết quả của nỗ lực tập thể của nhóm chúng tôi, bao gồm cả các đồng sáng lập. Đó là một cột mốc quan trọng đối với tất cả chúng tôi.

Bạn có thể giải thích cách các Mạng nơ-ron Tích phân (INNs) hoạt động và tại sao chúng lại là một đổi mới quan trọng trong học sâu?

Mạng nơ-ron truyền thống sử dụng các ma trận cố định, tương tự như bảng tính Excel, nơi kích thước và tham số được xác định trước. INNs, tuy nhiên, mô tả mạng như các hàm liên tục, cung cấp nhiều sự linh hoạt hơn. Hãy nghĩ về nó như một tấm thảm với các ghim ở các độ cao khác nhau, và điều này đại diện cho sóng liên tục.

Điều làm cho INNs thú vị là khả năng “nén” hoặc “mở rộng” động dựa trên tài nguyên có sẵn, tương tự như cách một tín hiệu tương tự được số hóa thành âm thanh. Bạn có thể thu nhỏ mạng mà không mất chất lượng, và khi cần, mở rộng nó trở lại mà không cần đào tạo lại.

Chúng tôi đã thử nghiệm điều này, và trong khi các phương pháp nén truyền thống dẫn đến mất chất lượng đáng kể, INNs vẫn duy trì chất lượng gần như ban đầu ngay cả dưới sự nén cực đoan. Toán học đằng sau nó không quá thông thường đối với cộng đồng AI, nhưng giá trị thực sự nằm ở khả năng cung cấp kết quả thực tế vững chắc với nỗ lực tối thiểu.

TheStage AI đã làm việc trên các thuật toán ủ lượng tử — bạn nhìn thấy tính toán lượng tử đóng vai trò gì trong tối ưu hóa AI trong tương lai gần?

Khi nói đến tính toán lượng tử và vai trò của nó trong tối ưu hóa AI, điểm mấu chốt là các hệ thống lượng tử cung cấp một cách tiếp cận hoàn toàn khác để giải quyết các vấn đề như tối ưu hóa. Mặc dù chúng tôi không tạo ra các thuật toán ủ lượng tử từ đầu, nhưng các công ty như D-Wave cung cấp các thư viện Python để xây dựng các thuật toán lượng tử cụ thể cho các nhiệm vụ tối ưu hóa rời rạc, lý tưởng cho máy tính lượng tử.

Ý tưởng ở đây là chúng tôi không tải trực tiếp mạng nơ-ron vào máy tính lượng tử. Điều đó không thể với kiến trúc hiện tại. Thay vào đó, chúng tôi xấp xỉ cách mạng nơ-ron hoạt động dưới các loại suy giảm khác nhau, khiến chúng phù hợp với một hệ thống mà chip lượng tử có thể xử lý.

Trong tương lai, các hệ thống lượng tử có thể mở rộng và tối ưu hóa mạng với độ chính xác mà các hệ thống truyền thống khó có thể sánh kịp. Ưu điểm của các hệ thống lượng tử nằm ở sự song song được tích hợp sẵn, điều mà các hệ thống cổ điển chỉ có thể mô phỏng bằng cách sử dụng thêm tài nguyên. Điều này có nghĩa là tính toán lượng tử có thể tăng tốc đáng kể quá trình tối ưu hóa, đặc biệt là khi chúng ta tìm ra cách mô hình hóa các mạng lớn và phức tạp một cách hiệu quả.

Tiềm năng thực sự đến từ việc sử dụng tính toán lượng tử để giải quyết các nhiệm vụ tối ưu hóa khổng lồ và phức tạp, và chia nhỏ các tham số thành các nhóm nhỏ hơn, dễ quản lý hơn. Với các công nghệ như lượng tử và tính toán quang học, có vô số khả năng để tối ưu hóa AI vượt xa những gì tính toán truyền thống có thể cung cấp.

Visions dài hạn của bạn cho TheStage AI là gì? Bạn nhìn thấy tối ưu hóa suy luận sẽ đi đến đâu trong 5-10 năm tới?

Trong dài hạn, TheStage AI nhằm trở thành một Trung tâm Mô hình Toàn cầu nơi bất kỳ ai cũng có thể dễ dàng truy cập vào một mạng nơ-ron được tối ưu hóa với các đặc điểm mong muốn, cho dù đó là điện thoại thông minh hay bất kỳ thiết bị nào khác. Mục tiêu là cung cấp một trải nghiệm kéo và thả, nơi người dùng nhập các tham số và hệ thống tự động tạo ra mạng. Nếu mạng không tồn tại, nó sẽ được tạo tự động bằng cách sử dụng ANNA.

Mục tiêu của chúng tôi là khiến mạng nơ-ron chạy trực tiếp trên thiết bị của người dùng, cắt giảm chi phí từ 20 đến 30 lần. Trong tương lai, điều này có thể gần như loại bỏ hoàn toàn chi phí, vì thiết bị của người dùng sẽ xử lý tính toán thay vì dựa vào máy chủ đám mây. Điều này, kết hợp với những tiến bộ trong nén mô hình và tăng tốc phần cứng, có thể làm cho việc triển khai AI trở nên hiệu quả hơn đáng kể.

Chúng tôi cũng dự định tích hợp công nghệ của mình với các giải pháp phần cứng, chẳng hạn như cảm biến, chip và robot, cho các ứng dụng trong lĩnh vực như lái xe tự động và robot. Ví dụ, chúng tôi nhằm mục đích xây dựng các máy ảnh AI có thể hoạt động trong bất kỳ môi trường nào, cho dù đó là không gian hay trong điều kiện cực đoan như bóng tối hoặc bụi. Điều này sẽ làm cho AI có thể sử dụng trong một loạt các ứng dụng và cho phép chúng tôi tạo ra các giải pháp tùy chỉnh cho phần cứng và trường hợp sử dụng cụ thể.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập TheStage AI.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.