Phỏng vấn
Jay Dawani là Đồng sáng lập & CEO của Lemurian Labs – Loạt phỏng vấn

Jay Dawani là Đồng sáng lập & CEO của Lemurian Labs. Lemurian Labs đang trên một nhiệm vụ cung cấp máy tính AI giá cả phải chăng, dễ tiếp cận và hiệu quả, được thúc đẩy bởi niềm tin rằng AI không nên là một thứ xa xỉ mà là một công cụ mà mọi người có thể tiếp cận. Đội ngũ sáng lập tại Lemurian Labs kết hợp chuyên môn trong lĩnh vực AI, trình biên dịch, thuật toán số và kiến trúc máy tính, được đoàn kết bởi một mục đích duy nhất: tái tưởng tượng tính toán gia tốc.
Bạn có thể chia sẻ về nền tảng và những gì đã đưa bạn vào lĩnh vực AI từ đầu?
Tất nhiên. Tôi đã bắt đầu lập trình từ khi 12 tuổi và xây dựng các trò chơi của riêng mình, nhưng tôi thực sự bước vào lĩnh vực AI khi 15 tuổi nhờ một người bạn của bố tôi, người đã say mê máy tính. Anh ấy đã kích thích sự tò mò của tôi và cho tôi đọc những cuốn sách như “The Computer and The Brain” của Von Neumann, “Perceptrons” của Minsky, “AI A Modern Approach” của Russel và Norvig. Những cuốn sách này đã ảnh hưởng rất nhiều đến tư duy của tôi và dường như rõ ràng rằng AI sẽ là một lĩnh vực biến đổi và tôi chỉ cần phải là một phần của lĩnh vực này.
Khi tôi đi học đại học, tôi thực sự muốn học về AI nhưng tôi không tìm thấy bất kỳ trường đại học nào cung cấp chuyên ngành này, vì vậy tôi quyết định học toán ứng dụng thay thế. Và một thời gian sau khi tôi vào đại học, tôi nghe nói về kết quả của AlexNet trên ImageNet, điều này thực sự rất thú vị. Lúc đó, tôi đã có một khoảnh khắc “bây giờ hoặc không bao giờ” trong đầu và tôi đã dốc toàn bộ tâm huyết vào việc đọc mọi bài báo và cuốn sách liên quan đến mạng nơ-ron và tìm kiếm tất cả các chuyên gia hàng đầu trong lĩnh vực này để học hỏi từ họ, vì bạn không thường xuyên có cơ hội được ở đó vào thời điểm ra đời của một ngành công nghiệp mới và học hỏi từ những người tiên phong của nó.
Rất nhanh chóng, tôi nhận ra rằng tôi không thích nghiên cứu, nhưng tôi thích giải quyết vấn đề và xây dựng sản phẩm được hỗ trợ bởi AI. Điều này đã dẫn tôi đến việc làm việc trên xe tự hành và robot, AI cho khám phá vật liệu, mô hình sinh cho mô phỏng đa vật lý, mô拟 dựa trên AI cho đào tạo lái xe chuyên nghiệp và giúp thiết lập xe, robot không gian, giao dịch thuật toán, và nhiều hơn nữa.
Bây giờ, sau khi làm tất cả những việc đó, tôi đang cố gắng kiểm soát chi phí đào tạo và triển khai AI vì đó sẽ là rào cản lớn nhất mà chúng ta phải đối mặt trên con đường cho phép mọi người và công ty có thể tiếp cận và hưởng lợi từ AI một cách kinh tế nhất.
Nhiều công ty làm việc trong lĩnh vực tính toán gia tốc có người sáng lập đã xây dựng sự nghiệp trong lĩnh vực bán dẫn và cơ sở hạ tầng. Bạn nghĩ kinh nghiệm trong quá khứ của bạn về AI và toán học ảnh hưởng như thế nào đến khả năng hiểu thị trường và cạnh tranh hiệu quả?
Tôi thực sự nghĩ rằng việc không đến từ ngành công nghiệp này mang lại cho tôi lợi thế của người ngoài. Tôi đã tìm thấy rất nhiều trường hợp rằng không có kiến thức về các chuẩn mực của ngành hoặc sự khôn ngoan thông thường cho phép một người tự do khám phá nhiều hơn và đi sâu hơn vào vấn đề so với những người khác, vì bạn không bị cản trở bởi những thành kiến.
Tôi có tự do để hỏi những câu hỏi “ngu ngốc” và kiểm tra các giả định theo cách mà hầu hết mọi người khác không làm, vì rất nhiều thứ được chấp nhận là sự thật. Trong hai năm qua, tôi đã có một số cuộc trò chuyện với những người trong ngành và họ rất giáo điều về một số điều, nhưng họ không thể cho tôi biết nguồn gốc của ý tưởng đó, điều mà tôi thấy rất khó hiểu. Tôi thích hiểu tại sao một số lựa chọn nhất định đã được thực hiện và những giả định hoặc điều kiện nào đã có tại thời điểm đó và liệu chúng có còn đúng hay không.
Từ góc độ AI, tôi có xu hướng xem xét nơi các khối lượng công việc hiện tại và tất cả các cách chúng có thể thay đổi theo thời gian, và xây dựng toàn bộ đường ống ML cho đào tạo và suy luận để hiểu các nút thắt, điều này cho tôi biết nơi có cơ hội để mang lại giá trị. Và vì tôi đến từ một nền tảng toán học, tôi thích xây dựng các mô hình để đến gần với sự thật nhất có thể và để điều đó hướng dẫn tôi. Ví dụ, chúng tôi đã xây dựng các mô hình để tính toán hiệu suất hệ thống cho tổng chi phí sở hữu và chúng tôi có thể đo lường lợi ích mà chúng tôi có thể mang lại cho khách hàng với phần mềm và/hoặc phần cứng và để hiểu rõ hơn về các hạn chế và các nút điều khiển khác nhau có sẵn cho chúng tôi, và hàng chục mô hình khác cho các điều khác. Chúng tôi rất dựa trên dữ liệu và sử dụng những hiểu biết từ các mô hình này để hướng dẫn nỗ lực và sự đánh đổi của chúng tôi.
Dường như tiến bộ trong AI chủ yếu đến từ việc mở rộng quy mô, điều này đòi hỏi phải tính toán và năng lượng theo cấp số nhân. Dường như chúng ta đang trong một cuộc đua vũ trang với mọi công ty đều cố gắng xây dựng mô hình lớn nhất, và dường như không có hồi kết. Bạn nghĩ có cách nào để thoát khỏi tình trạng này?
Luôn có cách. Việc mở rộng quy mô đã chứng minh là rất hữu ích, và tôi không nghĩ chúng ta đã thấy kết thúc của nó. Chúng ta sẽ sớm thấy các mô hình được đào tạo với chi phí ít nhất một tỷ đô la. Nếu bạn muốn là một người dẫn đầu trong AI sinh và tạo ra các mô hình cơ sở tiên tiến, bạn sẽ cần phải chi ít nhất vài tỷ đô la mỗi năm cho tính toán. Bây giờ, có những giới hạn tự nhiên cho việc mở rộng quy mô, chẳng hạn như khả năng xây dựng một tập dữ liệu đủ lớn cho một mô hình có kích thước như vậy, có được quyền truy cập vào những người có kiến thức phù hợp và có được đủ khả năng tính toán.
Sự mở rộng quy mô liên tục của kích thước mô hình là không thể tránh khỏi, nhưng chúng ta cũng không thể biến toàn bộ bề mặt Trái đất thành một siêu máy tính cỡ hành tinh để đào tạo và phục vụ các mô hình LLM cho những lý do rõ ràng. Để kiểm soát điều này, chúng ta có một số nút điều khiển có thể chơi: tập dữ liệu tốt hơn, kiến trúc mô hình mới, phương pháp đào tạo mới, trình biên dịch tốt hơn, cải tiến thuật toán và khai thác, kiến trúc máy tính tốt hơn, v.v. Nếu chúng ta làm tất cả những điều đó, có khoảng ba bậc độ cải tiến có thể được tìm thấy. Đó là cách tốt nhất để thoát.
Bạn là một người tin vào tư duy dựa trên nguyên tắc đầu tiên, làm thế nào điều này định hình tư duy của bạn khi bạn điều hành Lemurian Labs?
Chúng tôi chắc chắn sử dụng rất nhiều tư duy dựa trên nguyên tắc đầu tiên tại Lemurian. Tôi đã luôn tìm thấy sự khôn ngoan thông thường rất lừa dối vì kiến thức đó được hình thành tại một thời điểm nhất định khi các giả định nhất định được giữ, nhưng mọi thứ luôn thay đổi và bạn cần phải kiểm tra lại các giả định thường xuyên, đặc biệt là khi sống trong một thế giới thay đổi nhanh chóng.
Tôi thường tự hỏi những câu hỏi như “điều này dường như là một ý tưởng rất hay, nhưng tại sao nó không hoạt động”, hoặc “cái gì cần phải đúng để điều này hoạt động”, hoặc “chúng ta biết những gì là sự thật tuyệt đối và những gì là giả định chúng ta đang thực hiện và tại sao?”, hoặc “tại sao chúng ta tin rằng phương pháp này là cách tốt nhất để giải quyết vấn đề này”. Mục tiêu là để vô hiệu hóa và giết chết các ý tưởng một cách nhanh chóng và rẻ nhất có thể. Chúng tôi muốn cố gắng tối đa hóa số lượng thứ mà chúng tôi đang thử tại bất kỳ thời điểm nào.
Tư duy dựa trên nguyên tắc đầu tiên không chỉ hữu ích bằng chính nó. Chúng tôi có xu hướng kết hợp nó với việc dự báo ngược, điều này cơ bản là tưởng tượng một kết quả lý tưởng hoặc mong muốn và làm việc ngược lại để xác định các bước hoặc hành động cần thiết để hiện thực hóa nó. Điều này đảm bảo rằng chúng tôi hội tụ vào một giải pháp có ý nghĩa không chỉ sáng tạo mà còn dựa trên thực tế. Nó không có ý nghĩa khi dành thời gian để nghĩ ra một giải pháp hoàn hảo chỉ để nhận ra rằng nó không khả thi để xây dựng vì một loạt các hạn chế của thế giới thực như tài nguyên, thời gian, quy định hoặc xây dựng một giải pháp dường như hoàn hảo nhưng sau đó phát hiện ra rằng bạn đã làm cho nó quá khó cho khách hàng để áp dụng.
Thỉnh thoảng, chúng tôi tìm mình trong một tình huống mà chúng tôi cần phải đưa ra quyết định nhưng không có dữ liệu, và trong trường hợp này, chúng tôi sử dụng các giả thuyết có thể kiểm tra tối thiểu, điều này cung cấp cho chúng tôi một tín hiệu về việc liệu điều gì đó có ý nghĩa để theo đuổi với mức năng lượng thấp nhất.
Tất cả những điều này kết hợp lại để mang lại cho chúng tôi sự linh hoạt, chu kỳ lặp lại nhanh để giảm thiểu rủi ro một cách nhanh chóng, và đã giúp chúng tôi điều chỉnh chiến lược với sự tự tin cao và đạt được rất nhiều tiến bộ trên các vấn đề khó khăn trong một khoảng thời gian rất ngắn.
Ban đầu, bạn tập trung vào AI biên, điều gì đã khiến bạn thay đổi và chuyển sang tính toán đám mây?
Chúng tôi bắt đầu với AI biên vì vào thời điểm đó, tôi rất tập trung vào việc giải quyết một vấn đề cụ thể mà tôi đã gặp phải khi cố gắng đưa một thế giới robot tự hành vào cuộc sống. Robot tự hành giữ lời hứa sẽ là bước chuyển đổi lớn nhất trong lịch sử tập thể của chúng ta, và dường như chúng tôi đã có mọi thứ cần thiết để xây dựng một mô hình cơ sở cho robot nhưng chúng tôi thiếu một con chip suy luận lý tưởng với sự cân bằng đúng giữa thông lượng, độ trễ, hiệu quả năng lượng và khả năng lập trình để chạy mô hình đó.
Tôi không nghĩ về trung tâm dữ liệu vào thời điểm đó vì đã có đủ công ty tập trung vào đó và tôi dự kiến họ sẽ giải quyết vấn đề. Chúng tôi đã thiết kế một kiến trúc rất mạnh mẽ cho không gian ứng dụng này và chúng tôi đã sẵn sàng để sản xuất, và sau đó nó trở nên rõ ràng rằng thế giới đã thay đổi và vấn đề thực sự là ở trung tâm dữ liệu. Tốc độ mà các mô hình LLM đang mở rộng và tiêu thụ tính toán vượt xa tốc độ tiến bộ trong tính toán, và khi bạn tính đến việc áp dụng, nó bắt đầu vẽ một bức tranh đáng lo ngại.
Nó cảm thấy như đó là nơi chúng tôi nên tập trung nỗ lực của mình, để giảm chi phí năng lượng của AI trong trung tâm dữ liệu càng nhiều càng tốt mà không áp đặt bất kỳ hạn chế nào về nơi và cách AI nên phát triển. Và vì vậy, chúng tôi bắt đầu giải quyết vấn đề này.
Bạn có thể chia sẻ câu chuyện về việc đồng sáng lập Lemurian Labs?
Câu chuyện bắt đầu vào đầu năm 2018. Tôi đang làm việc trên việc đào tạo một mô hình cơ sở cho sự tự hành tổng quát cùng với một mô hình cho mô phỏng đa vật lý sinh và đào tạo tác nhân trong đó và tinh chỉnh nó cho các ứng dụng khác nhau, và một số điều khác để giúp mở rộng quy mô vào môi trường đa tác nhân. Nhưng rất nhanh chóng, tôi đã cạn kiệt số tính toán mà tôi có, và tôi ước tính cần hơn 20.000 GPU V100. Tôi đã cố gắng huy động đủ tiền để có được quyền truy cập vào tính toán nhưng thị trường chưa sẵn sàng cho quy mô như vậy vào thời điểm đó. Điều này đã khiến tôi nghĩ về phía triển khai và tôi ngồi xuống để tính toán hiệu suất mà tôi sẽ cần để phục vụ mô hình này trong môi trường mục tiêu và tôi nhận ra rằng không có chip nào tồn tại có thể giúp tôi đạt được điều đó.
Một vài năm sau, vào năm 2020, tôi đã gặp Vassil – người đồng sáng lập sau này của tôi – để bắt kịp và tôi đã chia sẻ những thách thức mà tôi đã trải qua trong việc xây dựng một mô hình cơ sở cho sự tự hành, và anh ấy đã đề xuất xây dựng một con chip suy luận có thể chạy mô hình cơ sở, và anh ấy đã chia sẻ rằng anh ấy đã suy nghĩ rất nhiều về các định dạng số và các biểu diễn tốt hơn sẽ giúp không chỉ giữ lại độ chính xác của mạng nơ-ron ở độ rộng bit thấp hơn mà còn tạo ra các kiến trúc mạnh mẽ hơn.
Đó là một ý tưởng thú vị nhưng nằm ngoài phạm vi của tôi. Nhưng nó không rời khỏi tôi, điều này đã khiến tôi dành nhiều tháng để học về những phức tạp của kiến trúc máy tính, tập lệnh, thời gian chạy, trình biên dịch và mô hình lập trình. Cuối cùng, việc xây dựng một công ty bán dẫn bắt đầu có ý nghĩa và tôi đã hình thành một luận điểm về vấn đề là gì và làm thế nào để tiếp cận nó. Và sau đó, vào cuối năm, chúng tôi đã bắt đầu Lemurian.
Bạn đã nói trước đó về nhu cầu phải giải quyết vấn đề phần mềm trước khi xây dựng phần cứng, bạn có thể giải thích thêm về quan điểm của mình về việc tại sao vấn đề phần cứng trước hết là một vấn đề phần mềm?
Điều mà nhiều người không nhận ra là rằng phía phần mềm của bán dẫn khó hơn rất nhiều so với chính phần cứng. Xây dựng một kiến trúc máy tính hữu ích cho khách hàng sử dụng và có được lợi ích từ nó là một vấn đề toàn bộ ngăn xếp, và nếu bạn không có sự hiểu biết và chuẩn bị này khi bắt đầu, bạn sẽ kết thúc với một kiến trúc đẹp, hiệu suất cao và hiệu quả, nhưng hoàn toàn không thể sử dụng được bởi các nhà phát triển, điều này thực sự quan trọng.
Có những lợi ích khác khi tiếp cận phần mềm trước,当然, chẳng hạn như thời gian đưa sản phẩm ra thị trường nhanh hơn. Điều này rất quan trọng trong thế giới đang thay đổi nhanh chóng ngày nay, nơi việc quá tự tin vào một kiến trúc hoặc tính năng có thể có nghĩa là bạn bỏ lỡ thị trường hoàn toàn.
Không tiếp cận phần mềm trước thường dẫn đến việc không giảm thiểu được những điều quan trọng cần thiết cho việc áp dụng sản phẩm trên thị trường, không thể phản ứng với những thay đổi trong thị trường, chẳng hạn như khi các khối lượng công việc phát triển theo một cách không dự kiến, và có phần cứng không được sử dụng hết. Tất cả đều không phải là những điều tốt. Đó là một lý do lớn tại sao chúng tôi quan tâm đến việc tập trung vào phần mềm và tại sao quan điểm của chúng tôi là bạn không thể là một công ty bán dẫn nếu không thực sự là một công ty phần mềm.
Bạn có thể thảo luận về mục tiêu ngăn xếp phần mềm ngay lập tức của mình?
Khi chúng tôi thiết kế kiến trúc và nghĩ về con đường phía trước và nơi có cơ hội để mang lại hiệu suất và hiệu quả năng lượng, nó bắt đầu trở nên rõ ràng rằng chúng tôi sẽ thấy nhiều sự dị hình hơn, điều này sẽ tạo ra nhiều vấn đề về phần mềm. Và chúng tôi không chỉ cần có khả năng lập trình các kiến trúc dị hình một cách hiệu quả, chúng tôi phải đối mặt với chúng ở quy mô trung tâm dữ liệu, điều này là một thách thức mà chúng tôi chưa từng gặp trước đây.
Điều này khiến chúng tôi lo lắng vì lần cuối cùng chúng tôi phải trải qua một sự chuyển đổi lớn là khi ngành công nghiệp chuyển từ kiến trúc đơn lõi sang đa lõi, và vào thời điểm đó, nó đã mất 10 năm để làm cho phần mềm hoạt động và mọi người bắt đầu sử dụng nó. Chúng tôi không thể chờ đợi 10 năm để tìm ra phần mềm cho sự dị hình ở quy mô lớn, nó phải được giải quyết ngay bây giờ. Vì vậy, chúng tôi đã bắt đầu tìm hiểu về vấn đề và những gì cần phải tồn tại để ngăn xếp phần mềm này có thể tồn tại.
Chúng tôi hiện đang hợp tác với nhiều công ty bán dẫn hàng đầu và các nhà cung cấp dịch vụ đám mây/hyperscalers và sẽ phát hành ngăn xếp phần mềm của mình trong vòng 12 tháng tới. Đó là một mô hình lập trình thống nhất với trình biên dịch và thời gian chạy có thể nhắm đến bất kỳ loại kiến trúc nào, và điều phối công việc trên các cụm được cấu thành từ các loại phần cứng khác nhau, và có khả năng mở rộng từ một nút đơn đến một cụm 1000 nút để đạt được hiệu suất cao nhất.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập Lemurian Labs.












