Phỏng vấn
Elad Raz, CEO của NextSilicon – Loạt phỏng vấn

Elad Raz, CEO của NextSilicon, là một doanh nhân giàu kinh nghiệm và lãnh đạo công nghệ được kính trọng rộng rãi vì chuyên môn sâu về hệ thống cấp thấp, bảo mật, mạng và phát triển hệ thống tệp. Trong sự nghiệp bao gồm các vai trò kỹ sư quân sự hàng đầu, lãnh đạo phần mềm cấp cao, xây dựng công ty và đầu tư dài hạn, Raz đã dẫn đầu các dự án phức tạp, quan trọng về mặt nhiệm vụ trên các thành phần bên trong của hệ điều hành và tích hợp phần cứng-phần mềm. Trước khi thành lập NextSilicon, ông đã xây dựng và rời bỏ nhiều công ty công nghệ, giữ các vai trò lãnh đạo cấp cao tại một công ty bán dẫn hàng đầu và đầu tư vào một danh mục đầu tư đa dạng các công ty khởi nghiệp, kết hợp độ sâu kỹ thuật thực tế với khả năng thực thi mạnh mẽ và tầm nhìn chiến lược dài hạn.
NextSilicon là một công ty tính toán hiệu suất cao và bán dẫn của Israel được thành lập vào năm 2017, đang định nghĩa lại kiến trúc tính toán cho các khối lượng công việc đòi hỏi cao như AI và tính toán khoa học. Công ty đã phát triển một nền tảng tính toán thông minh được định nghĩa bằng phần mềm, được thiết kế để cung cấp hiệu suất cao và hiệu quả mà không yêu cầu các nhà phát triển phải viết lại các ứng dụng. Bằng cách tập trung vào khả năng thích ứng ở cấp độ phần cứng, NextSilicon nhằm mục đích giải quyết các nút thắt cơ bản trong các trung tâm dữ liệu và môi trường siêu tính toán hiện đại, định vị mình như một giải pháp thay thế thế hệ tiếp theo cho các gia tốc truyền thống.
Bạn có thể cho chúng tôi biết về hành trình của bạn dẫn đến việc thành lập NextSilicon không? Ý tưởng ban đầu được kích hoạt như thế nào và những trải nghiệm đầu tiên của bạn với máy tính đã định hình tầm nhìn của bạn như thế nào?
Tôi đã bị thu hút bởi máy tính từ khi còn là một đứa trẻ. Sự thu hút đó đã dẫn tôi từ việc chỉnh sửa các máy Commodore 64 và Atari cũ (mà tôi vẫn sưu tầm cho đến ngày nay) đến việc đồng sáng lập các công ty khởi nghiệp và cuối cùng là bán công ty trước đó của tôi cho Mellanox. Nhưng ngay cả với những thành công ban đầu đó, tôi vẫn tiếp tục thấy thách thức giống nhau trong ngành này. Khi các khối lượng công việc tính toán trở nên phức tạp hơn, kiến trúc CPU và GPU truyền thống đang đạt đến giới hạn về hiệu suất, hiệu quả năng lượng và khả năng mở rộng. Cho dù tối ưu hóa thuật toán hay chạy các mô phỏng quy mô lớn, điều đã trở nên rõ ràng là kiến trúc hiện tại đang buộc các khối lượng công việc phải thích nghi với phần cứng – không phải ngược lại.
Ngọn lửa cho NextSilicon bắt nguồn từ thách thức lặp đi lặp lại này và đặt ra câu hỏi: Nếu chúng ta có thể lật ngược kịch bản và xây dựng kiến trúc tính toán thích nghi với các khối lượng công việc, thay vì buộc các khối lượng công việc phải thích nghi với phần cứng? Những trải nghiệm đầu tiên của tôi với thiết kế thuật toán và phần cứng đã dạy tôi rằng đột phá thực sự sẽ đến từ việc kết hợp cả hai trong thời gian thực. Đó là nền tảng của Kiến trúc Tính toán Thông minh (ICA) của chúng tôi và tầm nhìn định hướng của NextSilicon từ đầu.
Maverick-2 được mô tả là một gia tốc tính toán thông minh thích nghi với các khối lượng công việc thời gian thực. Kiến trúc của nó khác với GPU hoặc FPGA truyền thống như thế nào và điều gì cho phép mức độ thích nghi đó?
CPU và GPU đã biến đổi thế giới của chúng ta và phục vụ chúng ta tốt. Nhưng chúng không được thiết kế để đáp ứng nhu cầu của các khối lượng công việc AI và tính toán hiệu suất cao (HPC) hiện đại trong các lĩnh vực như khoa học, thời tiết, năng lượng và quốc phòng. Các khối lượng công việc này có sự phụ thuộc dữ liệu phức tạp, mẫu truy cập bộ nhớ và mẫu tính toán mà các bộ xử lý hiện nay không được thiết kế để xử lý. Kết quả là các nút thắt làm chậm sự đổi mới.
Sự khác biệt chính của Maverick-2 là cách tiếp cận mới kết hợp một động cơ dữ liệu có thể cấu hình lại với tối ưu hóa phần mềm thời gian thực. Sự khác biệt kiến trúc chính là phần cứng được cấu hình dựa trên khối lượng công việc của bạn, không phải ngược lại. Đối với Maverick-2, tính khả dụng của dữ liệu thúc đẩy tính toán, chứ không phải một chương trình đếm thúc đẩy việc thực hiện lệnh như trong các bộ xử lý truyền thống. Điều này cho phép chúng tôi tạo ra các đơn vị xử lý ảo được định nghĩa bằng phần mềm có thể được cấu hình và cấu hình lại trong thời gian thực để phù hợp với các mẫu khối lượng công việc cụ thể.
Kết quả nói lên tất cả: Maverick-2 cung cấp hơn 4 lần hiệu suất trên watt so với GPU và hơn 20 lần so với CPU, đồng thời giảm chi phí hoạt động hơn một nửa. Do đó, các nhà nghiên cứu và kỹ sư có thể chạy các mô phỏng lớn, không đều trong một phần nhỏ của thời gian.
Bạn đã báo cáo đạt được hơn 4 lần hiệu suất trên watt so với GPU và hơn 20 lần so với CPU. Những đổi mới chính nào thúc đẩy những lợi ích về hiệu suất trong các khối lượng công việc thực tế?
Các lợi ích về hiệu suất đến từ một số đổi mới chính hoạt động cùng nhau.
Trước hết, chúng tôi đã rời bỏ mô hình Von Neumann đã thống trị tính toán trong 80 năm. Thay vì thực hiện lệnh tuần tự, Maverick-2 sử dụng kiến trúc dữ liệu luồng nơi tính toán theo sự sẵn có của dữ liệu. Điều này cơ bản tốt hơn cho các khối lượng công việc không đều, đòi hỏi bộ nhớ.
Thứ hai, kiến trúc tự tối ưu hóa của chúng tôi tạo ra các lõi xử lý được định nghĩa bằng phần mềm trong thời gian thực. Phần cứng thích nghi với nhu cầu của từng ứng dụng mà không yêu cầu viết lại mã – bạn có được tối ưu hóa mà không có overhead.
Thứ ba, và điều này rất quan trọng: chúng tôi tập trung vào hiệu suất thực tế, bền vững, không phải đỉnh lý thuyết. Nhiều kiến trúc trông tuyệt vời trên giấy nhưng thất bại trong các khối lượng công việc thực tế. Maverick-2 duy trì hiệu quả trên AI, HPC và cơ sở dữ liệu vector bằng cách liên tục thích nghi với nhu cầu của khối lượng công việc.
Maverick-2 hỗ trợ C/C++, Fortran, OpenMP và Kokkos mà không cần thay đổi mã. Các nhà phát triển đã phản ứng như thế nào với sự tương thích này và kế hoạch của bạn để hỗ trợ CUDA, ROCm hoặc các khuôn khổ AI phổ biến là gì?
Các nhà phát triển yêu thích Maverick-2 vì nó là một sự thay thế “thả và chạy” thực sự. Họ có thể chạy các ứng dụng hiện có ngay lập tức mà không có rào cản cổng. Chúng tôi hiện hỗ trợ C/C++, Fortran, OpenMP và Kokkos, với CUDA, ROCm và các khuôn khổ AI chính như TensorFlow, JAX, PyTorch và ONNX đang được phát triển tích cực. Điều này loại bỏ sự khóa của nhà cung cấp và viết lại mã tốn kém, cho phép khách hàng đánh giá và áp dụng các kiến trúc mới mà không làm gián đoạn quy trình làm việc của họ.
Làm thế nào hệ thống tối ưu hóa dựa trên đo lường của Maverick-2 hoạt động phía sau cảnh? Những gì được tham gia trong việc tạo hồ sơ và cấu hình lại chip trong thời gian thực?
Hãy nghĩ về tối ưu hóa hệ thống của chúng tôi như một vòng lặp liên tục: trong quá trình thực hiện, hệ thống đo lường của chúng tôi đo hàng trăm chỉ số hiệu suất (ví dụ: băng thông bộ nhớ, sử dụng, độ sâu hàng đợi). Tất cả dữ liệu đó được cung cấp cho một bộ tối ưu hóa thời gian chạy xác định xem cấu hình phần cứng hiện tại vẫn tối ưu cho khối lượng công việc và nhu cầu dự kiến của nó hay không. Nếu không, nó có thể phân vùng lại tài nguyên, sắp xếp lại đường dẫn dữ liệu và điều chỉnh đường ống tính toán liên tục, có nghĩa là ứng dụng không ngừng. Điều này xảy ra trong vài milligiây, vì vậy ứng dụng duy trì hiệu quả đỉnh nhất quán khi hồ sơ tính toán của nó thay đổi.
Có những loại khối lượng công việc hoặc trường hợp cụ thể nào mà việc điều chỉnh hiệu suất thời gian chạy không hiệu quả hoặc giới thiệu các thỏa hiệp trong độ trễ hoặc năng lượng?
Bất kỳ kiến trúc nào cũng sẽ có những thỏa hiệp. Maverick-2 vượt trội trong các khối lượng công việc phức tạp, không đều với các mẫu tính toán và truy cập dữ liệu thay đổi. Đối với các khối lượng công việc dự đoán cao, cố định, một GPU được điều chỉnh tốt có thể rất hiệu quả mà không có overhead của sự thích nghi. Trong những trường hợp đó, khả năng thích nghi của chúng tôi vẫn cung cấp hiệu suất vững chắc, nhưng lợi thế tương đối có thể nhỏ hơn.
Thiết kế của NextSilicon là tất cả về sự đa năng và cạnh tranh trong các trường hợp đơn giản, nhưng chuyển đổi trong các trường hợp thách thức.
Tại sao bạn quyết định ưu tiên thị trường HPC sớm, khi hầu hết các công ty khởi nghiệp đang vội vàng tham gia vào AI? Làm thế nào điều đó đã định hình chiến lược sản phẩm và kinh doanh của bạn?
HPC đại diện cho tiền tuyến của sự phức tạp tính toán và giải quyết vấn đề cho các tập dữ liệu lớn, truy cập bộ nhớ không đều và mẫu tính toán không thể đoán trước. Nếu bạn có thể xây dựng một kiến trúc có thể phát triển mạnh ở đó – chẳng hạn như chạy các mô phỏng quy mô exabyte trong mô hình hóa khí hậu hoặc vật lý hạt, nó sẽ vượt trội trong AI cũng vậy.
Bằng cách tập trung vào HPC trước, chúng tôi đã chứng minh Maverick-2 trên các khối lượng công việc đòi hỏi nhất trong mô hình hóa khí hậu, vật lý và khoa học sự sống. Điều đó đã mang lại cho chúng tôi uy tín, dữ liệu hiệu suất thực tế và một sản phẩm trưởng thành trước khi chuyển sâu vào các thị trường AI. Bây giờ, chúng tôi được định vị để phục vụ cả hai, mà không phải hy sinh kiến trúc của chúng tôi để tận dụng các xu hướng hoặc nhu cầu ngắn hạn.
Giờ mà Maverick-2 đã được sản xuất và triển khai trên hàng chục khách hàng, bạn có thể chia sẻ các ví dụ về cách nó đang được sử dụng không? Có kết quả hoặc điểm chuẩn cụ thể nào từ các triển khai hàng đầu?
Một ví dụ nổi bật là việc triển khai của chúng tôi tại Phòng thí nghiệm Quốc gia Sandia, nơi Maverick-2 đang cung cấp năng lượng cho siêu máy tính Spectra của họ như một phần của chương trình Vanguard-II. Chúng tôi đang thấy kết quả hiệu suất vượt trội mà không cần thay đổi mã. Chúng tôi cũng đang làm việc với ODISSEE (Giải pháp trực tuyến cho khoa học trong kỷ nguyên exabyte), mang lại các tổ chức nghiên cứu hàng đầu để xử lý dữ liệu exabyte từ Máy va chạm Hadron Large Luminosity của CERN và Đài quan sát Square Kilometre Array. Vai trò Maverick-2 sẽ đóng là giải quyết thách thức xử lý petabyte dữ liệu thực nghiệm thô trong một phần nhỏ của thời gian và năng lượng trước đây.
Bạn đã huy động được hơn 300 triệu đô la, với các vòng vốn lớn được công bố vào năm 2021 và gần đây. Bạn có thể chia sẻ cách tài trợ đó đã tăng tốc phát triển sản phẩm và phạm vi thị trường của bạn không?
Tài trợ cho phép chúng tôi làm ba điều. Đầu tiên, chúng tôi có thể đẩy kiến trúc xa hơn, không chỉ cải tiến dần dần, mà là những tiến bộ cơ bản đã khiến Maverick-2 sẵn sàng sản xuất. Thứ hai, chúng tôi đã mở rộng quy trình sản xuất và chuỗi cung ứng của mình để đáp ứng nhu cầu ngày càng tăng, một thách thức không hề nhỏ đối với silicon mới. Thứ ba, chúng tôi đã mở rộng hệ sinh thái phần mềm của mình để cho phép khách hàng tích hợp và triển khai nhanh hơn.
Nó cũng cho phép chúng tôi hợp tác chiến lược với các trung tâm siêu tính toán và nhà cung cấp dịch vụ đám mây, cho phép chúng tôi简 hóa quy trình từ khái niệm đến triển khai và mở rộng nhanh hơn nhiều so với các công ty khởi nghiệp phần cứng truyền thống.
Trong một cảnh quan bao gồm Cerebras (CBRS ), SambaNova và Nvidia (NVDA ), bạn nhìn thấy NextSilicon định vị mình như thế nào? Chiến lược tiếp cận thị trường của bạn như một nhà thách thức là gì?
Chúng tôi xem NextSilicon như một công ty công nghệ hơn là chỉ một công ty chip. Chúng tôi tối ưu hóa mọi khối lượng công việc, cung cấp khả năng thích nghi và không khóa khách hàng vào lập trình hoặc phần cứng độc quyền. Khách hàng của chúng tôi có thể mang mã hiện có của họ và đạt được gia tốc ngay lập tức mà không có chu kỳ cổng dài hoặc khóa nhà cung cấp vào một hệ sinh thái duy nhất, chẳng hạn như CUDA. Điều này đặc biệt quan trọng khi các khối lượng công việc AI phát triển vượt ra ngoài đào tạo thuần túy. Các mô hình suy luận, suy luận mở rộng và cửa sổ ngữ cảnh lớn đòi hỏi các mẫu tính toán khác nhau: truy cập bộ nhớ động, tính toán có độ dài thay đổi và phân bổ tài nguyên thích nghi. Đây không phải là những vấn đề bạn giải quyết bằng cách thêm nhiều kiến trúc cố định.
Chiến lược tiếp cận thị trường của chúng tôi tập trung vào việc giải quyết các vấn đề khó khăn nhất trước: làm việc với các tổ chức nghiên cứu, phòng thí nghiệm quốc gia và doanh nghiệp nơi hiệu suất, hiệu quả năng lượng và sự linh hoạt là quan trọng. Từ đó, chúng tôi mở rộng vào các thị trường AI và dữ liệu rộng lớn hơn. Ngành công nghiệp này bị chi phối bởi các kiến trúc cố định. Chúng tôi đang cung cấp một cái gì đó khác biệt, khả năng thích nghi được xây dựng từ đầu. AI đang chuyển từ quy mô thuần túy sang trí tuệ. Các mô hình lớn hơn đang cho phép suy luận thông minh hơn, từ các lời nhắc ngắn đến hiểu biết ngữ cảnh dài. Trong quá trình chuyển đổi này, các kiến trúc có thể thích nghi sẽ không chỉ là mới mẻ; chúng sẽ là thiết yếu.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập NextSilicon.












