Phỏng vấn

Moshe Tanach, CEO và Đồng sáng lập tại NeuReality – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Moshe Tanach là CEO và đồng sáng lập của NeuReality. Trước khi thành lập NeuReality, Moshe từng là Giám đốc Kỹ thuật tại Marvell và Intel (INTC ), nơi ông dẫn đầu việc phát triển các sản phẩm không dây và mạng phức tạp đến sản xuất hàng loạt. Ông cũng từng là Phó Chủ tịch Phát triển tại DesignArt Networks (sau đó được Qualcomm (QCOM ) mua lại), nơi ông đóng góp vào việc phát triển các sản phẩm trạm gốc 4G.

NeuReality có sứ mệnh đơn giản hóa việc áp dụng AI. Bằng cách tiếp cận hệ thống đối với AI, đội ngũ chuyên gia của NeuReality cung cấp suy luận AI một cách toàn diện, xác định các điểm đau và cung cấp các giải pháp suy luận AI được thiết kế riêng, giúp AI trở nên vừa túi tiền và dễ tiếp cận.

Với kinh nghiệm sâu rộng trong việc lãnh đạo các dự án kỹ thuật tại Marvell, Intel và DesignArt-Networks, điều gì đã truyền cảm hứng cho bạn để đồng sáng lập NeuReality, và làm thế nào các vai trò trước đây của bạn ảnh hưởng đến tầm nhìn và định hướng của công ty?

NeuReality được xây dựng từ đầu để giải quyết các vấn đề về chi phí, phức tạp và khí hậu trong tương lai mà suy luận AI – việc triển khai các mô hình AI được đào tạo và phần mềm vào các trung tâm dữ liệu sản xuất – sẽ gặp phải. Trong khi đào tạo AI là cách tạo ra AI; suy luận AI là cách sử dụng nó và cách nó tương tác với hàng tỷ người và thiết bị trên toàn thế giới.

Chúng tôi là một đội các kỹ sư hệ thống, vì vậy chúng tôi xem xét tất cả các góc độ, tất cả các khía cạnh của suy luận AI từ đầu đến cuối, bao gồm cả GPU và tất cả các loại gia tốc器 AI được thiết kế riêng. Vào năm 2015, đã rõ ràng với chúng tôi rằng các chip và hệ thống AI dựa trên CPU – đó là mọi GPU, TPU, LPU, NRU, ASIC và FPGA – sẽ gặp phải một rào cản đáng kể vào năm 2020. Đó là hạn chế của hệ thống, nơi mà gia tốc器 AI đã trở nên tốt hơn và nhanh hơn về hiệu suất thô, nhưng cơ sở hạ tầng cơ bản không theo kịp.

Kết quả là, chúng tôi quyết định phá vỡ các gã khổng lồ bị mắc kẹt trong quan liêu bảo vệ các doanh nghiệp thành công, như các nhà sản xuất CPU và NIC, và phá vỡ ngành công nghiệp bằng một kiến trúc AI tốt hơn, mở, trung lập và được thiết kế riêng cho suy luận AI. Một trong những kết luận của việc tưởng tượng lại suy luận AI lý tưởng là rằng trong việc tăng cường sử dụng GPU và hiệu suất hệ thống, kiến trúc máy tính và mạng mới của chúng tôi – được cung cấp bởi chip NR1 mới của chúng tôi, thay thế CPU chủ và NIC. Là một thương hiệu thành phần và người bạn đồng hành của bất kỳ GPU hoặc gia tốc器 AI nào, chúng tôi có thể loại bỏ các rào cản thị trường mà ngăn cản 65% tổ chức đổi mới và áp dụng AI ngày nay – các GPU dưới mức sử dụng, dẫn đến mua nhiều hơn những gì thực sự cần (vì chúng chạy nhàn rỗi > 50% thời gian) – đồng thời giảm tiêu thụ năng lượng, thách thức không gian trung tâm dữ liệu AI và chi phí hoạt động.

Đây là một cơ hội duy nhất để thực sự biến đổi kiến trúc hệ thống AI cho tốt hơn dựa trên mọi thứ tôi đã học và thực hành trong 30 năm, mở cửa cho các nhà đổi mới AI mới trên các ngành công nghiệp và loại bỏ các nút thắt CPU, phức tạp và dấu chân carbon.

Sứ mệnh của NeuReality là dân chủ hóa AI. Bạn có thể giải thích rõ hơn về ý nghĩa của “AI cho tất cả mọi người” đối với bạn và làm thế nào NeuReality dự định đạt được tầm nhìn này?

Sứ mệnh của chúng tôi là dân chủ hóa AI bằng cách làm cho nó trở nên dễ tiếp cận và vừa túi tiền hơn cho tất cả các tổ chức, lớn và nhỏ – bằng cách giải phóng tối đa khả năng của bất kỳ GPU hoặc gia tốc器 AI nào; nói cách khác, nhận được nhiều hơn từ khoản đầu tư GPU của bạn, thay vì mua nhiều GPU hơn mà chạy nhàn rỗi > 50% thời gian. Chúng tôi có thể tăng cường các gia tốc器 AI lên đến 100% khả năng đầy đủ, đồng thời cung cấp hiệu suất năng lượng lên đến 15 lần và giảm chi phí hệ thống lên đến 90%. Đây là những cải tiến đáng kể.

Để đạt được tầm nhìn này, chúng tôi dự định sử dụng giải pháp Suy luận AI NR1, kiến trúc hệ thống trung tâm dữ liệu đầu tiên được thiết kế dành riêng cho thời đại AI. Nó chạy các đường ống dữ liệu AI lớn, đa dạng với chi phí hợp lý và hiệu quả, cùng với lợi ích của việc giảm dấu chân carbon.

Đạt được AI cho tất cả mọi người cũng có nghĩa là làm cho nó dễ sử dụng. Tại NeuReality, chúng tôi đơn giản hóa việc triển khai, quản lý và khả năng mở rộng cơ sở hạ tầng AI, nâng cao các quy trình kinh doanh và lợi nhuận, và thúc đẩy các lĩnh vực như y tế công cộng, an toàn, thực thi pháp luật và dịch vụ khách hàng. Tác động của chúng tôi bao gồm các lĩnh vực như hình ảnh y tế, thử nghiệm lâm sàng, phát hiện gian lận, tạo nội dung AI và nhiều hơn nữa.

Hiện tại, các thiết bị NR1-S AI Inference đầu tiên của chúng tôi đã có sẵn với gia tốc器 Qualcomm Cloud AI 100 Ultra và thông qua Cirrascale, một nhà cung cấp dịch vụ đám mây.

Giải pháp Suy luận AI NR1 được coi là kiến trúc hệ thống trung tâm dữ liệu đầu tiên được thiết kế dành riêng cho thời đại AI, và được thiết kế riêng cho suy luận AI. Những đổi mới và đột phá chính nào đã dẫn đến sự phát triển của NR1?

NR1 là tên của toàn bộ kiến trúc hệ thống silicon đến phần mềm mà chúng tôi đã thiết kế và cung cấp cho ngành công nghiệp AI – như một cơ sở hạ tầng tính toán và mạng AI mở, tương thích hoàn toàn và bổ sung cho bất kỳ gia tốc器 AI và GPU nào. Nếu tôi phải phân tích các đổi mới và đột phá độc đáo và thú vị nhất dẫn đến giải pháp NR1 toàn diện này và phân biệt chúng tôi, tôi sẽ nói:

  • Biểu đồ tính toán AI được tối ưu hóa: Đội ngũ của chúng tôi đã thiết kế một gia tốc器 thực hiện biểu đồ có thể lập trình để tối ưu hóa việc xử lý các biểu đồ tính toán, điều này rất quan trọng đối với AI và các khối lượng công việc khác như xử lý phương tiện, cơ sở dữ liệu và nhiều hơn nữa. Biểu đồ tính toán đại diện cho một loạt các hoạt động với các依赖, và khả năng áp dụng rộng rãi này đặt NR1 vào vị trí có thể trở nên đột phá ngoài việc tăng cường GPU và các gia tốc器 AI khác. Nó đơn giản hóa việc triển khai mô hình AI bằng cách tạo ra các biểu đồ tính toán được tối ưu hóa (CG) dựa trên dữ liệu AI được tiền xử lý và API phần mềm, dẫn đến lợi ích hiệu suất đáng kể.
  • NR1 NAPU (Đơn vị xử lý có thể định địa chỉ mạng): Kiến trúc suy luận AI của chúng tôi được cung cấp bởi NR1 NAPU – một chip máy chủ 7nm cho phép truy cập mạng trực tiếp cho tiền xử lý và hậu xử lý AI. Chúng tôi đóng gói 6,5 lần sức mạnh trên một chip NR1 nhỏ hơn so với CPU chủ mục đích chung. Thông thường, các nhiệm vụ tiền xử lý (như làm sạch dữ liệu, định dạng và trích xuất tính năng) và nhiệm vụ hậu xử lý (như giải thích kết quả và định dạng) được xử lý bởi CPU. Bằng cách offload các nhiệm vụ này sang NR1 NAPU, chúng tôi loại bỏ cả CPU và NIC. Điều này giảm các nút thắt cho phép xử lý tổng thể nhanh hơn, thời gian phản hồi nhanh như chớp và chi phí thấp hơn.
  • Công nghệ AI-Hypervisor NR1: AI-Hypervisor dựa trên phần cứng của NR1 tối ưu hóa việc dàn xếp nhiệm vụ AI và sử dụng tài nguyên, cải thiện hiệu suất và giảm các nút thắt.
  • Động cơ mạng AI-over-Fabric NR1: NR1 bao gồm một động cơ mạng AI-over-Fabric độc đáo đảm bảo kết nối mạng liền mạch và mở rộng hiệu quả tài nguyên AI trên nhiều chip NR1 – được kết hợp với bất kỳ GPU hoặc gia tốc器 AI nào – trong cùng một máy chủ suy luận hoặc thiết bị NR1-S.

Hiệu suất gần đây của NeuReality nhấn mạnh việc tiết kiệm chi phí và năng lượng đáng kể. Bạn có thể cung cấp thêm chi tiết về cách NR1 đạt được tiết kiệm chi phí lên đến 90% và hiệu suất năng lượng tốt hơn 15 lần so với các hệ thống truyền thống?

NR1 của NeuReality giảm chi phí và tiêu thụ năng lượng của suy luận AI lên đến 90% và 15 lần, tương ứng. Điều này đạt được thông qua:

  • Silicon chuyên dụng: Cơ sở hạ tầng suy luận AI được thiết kế riêng của chúng tôi được cung cấp bởi chip NR1 NAPU, hấp thụ chức năng của CPU và NIC thành một – và loại bỏ nhu cầu về CPU trong suy luận. Cuối cùng, NR1 tối đa hóa đầu ra của bất kỳ gia tốc器 AI hoặc GPU nào theo cách hiệu quả nhất có thể.
  • Kiến trúc được tối ưu hóa: Bằng cách tối ưu hóa dòng dữ liệu AI và kết hợp tiền xử lý và hậu xử lý AI trực tiếp trong NR1 NAPU, chúng tôi offload và thay thế CPU. Điều này dẫn đến độ trễ giảm, khả năng mở rộng tuyến tính và chi phí thấp hơn trên mỗi truy vấn AI.
  • Triển khai linh hoạt: Bạn có thể mua NR1 theo hai cách chính: 1) bên trong mô-đun NR1-M, là một thẻ PCIe chứa nhiều NR1 NAPU (thường là 10) được thiết kế để kết hợp với thẻ gia tốc器 AI của bạn. 2) bên trong thiết bị NR1-S, kết hợp NR1 NAPU với số lượng gia tốc器 AI (GPU, ASIC, FPGA, v.v.) như một hệ thống suy luận AI sẵn sàng sử dụng.

Tại Supercomputing 2024 vào tháng 11, bạn sẽ thấy chúng tôi trình diễn một thiết bị NR1-S với 4 chip NR1 trên 16 gia tốc器 Qualcomm Cloud AI 100 Ultra. Chúng tôi đã thử nghiệm cùng với chip suy luận AI Nvidia (NVDA ). NeuReality đang cách mạng hóa suy luận AI với kiến trúc mở, được thiết kế riêng.

NR1-S Thiết bị suy luận AI của chúng tôi so với máy chủ suy luận CPU truyền thống với GPU Nvidia H100 hoặc L40S trong các ứng dụng thực tế?

NR1, kết hợp với gia tốc器 Qualcomm Cloud AI 100 hoặc Nvidia H100 hoặc L40S GPU, mang lại một lượng lớn hiệu suất trong các ứng dụng AI thực tế trên các mô hình ngôn ngữ lớn như Llama 3, tầm nhìn máy tính, xử lý ngôn ngữ tự nhiên và nhận dạng giọng nói. Nói cách khác, chạy hệ thống suy luận AI của bạn với NR1 tối ưu hóa hiệu suất, chi phí hệ thống, hiệu suất năng lượng và thời gian phản hồi trên hình ảnh, âm thanh, ngôn ngữ và văn bản – riêng biệt (chế độ đơn) hoặc cùng nhau (đa chế độ).

Kết quả? Khi kết hợp với NR1, khách hàng nhận được nhiều hơn từ khoản đầu tư GPU đắt tiền mà họ thực hiện, thay vì mua nhiều GPU hơn để đạt được hiệu suất mong muốn.

Beyond việc tối đa hóa sử dụng GPU, NR1 mang lại hiệu suất đặc biệt, dẫn đến hiệu suất/giá tốt hơn 50-90% và hiệu suất năng lượng lên đến 13-15 lần. Điều này chuyển thành tiết kiệm chi phí đáng kể và giảm dấu chân môi trường cho cơ sở hạ tầng AI của bạn.

Thiết bị NR1-S thể hiện khả năng mở rộng tuyến tính mà không có sự sụt giảm hiệu suất. Bạn có thể giải thích các khía cạnh kỹ thuật cho phép khả năng mở rộng liền mạch như vậy?

Thiết bị NR1-S, kết hợp chip NR1 của chúng tôi với các gia tốc器 AI của bất kỳ loại hoặc số lượng nào, tái định nghĩa cơ sở hạ tầng AI. Chúng tôi đã vượt qua các hạn chế dựa trên CPU để đạt được mức hiệu suất và hiệu quả mới.

Thay vì nút thắt truyền thống từ NIC đến CPU đến gia tốc器, NR1-S tích hợp truy cập mạng trực tiếp, tiền xử lý và hậu xử lý AI trong các Đơn vị xử lý có thể định địa chỉ mạng (NAPU) của chúng tôi. Với thường là 10 NAPU trên mỗi hệ thống, mỗi NAPU xử lý các nhiệm vụ như xử lý tầm nhìn, âm thanh và xử lý tín hiệu số, và AI-Hypervisor của chúng tôi dàn xếp các khối lượng công việc, dòng dữ liệu AI được tối ưu hóa được thực hiện. Điều này chuyển thành khả năng mở rộng tuyến tính: thêm nhiều gia tốc器, nhận được hiệu suất tương ứng.

Kết quả? Sử dụng 100% các gia tốc器 AI được quan sát một cách nhất quán. Trong khi tổng chi phí và hiệu suất năng lượng thay đổi tùy thuộc vào các chip AI cụ thể được sử dụng, đầu tư phần cứng tối đa hóa và hiệu suất được cải thiện được cung cấp một cách nhất quán. Khi nhu cầu suy luận AI mở rộng, NR1-S cung cấp một giải pháp thay thế hấp dẫn cho các kiến trúc truyền thống.

NeuReality nhằm mục đích giải quyết các rào cản đối với việc áp dụng AI rộng rãi. Những thách thức đáng kể nhất mà các doanh nghiệp gặp phải khi áp dụng AI là gì, và công nghệ của bạn giúp vượt qua những thách thức này như thế nào?

Khi được triển khai kém, phần mềm và giải pháp AI có thể trở nên khó khăn. Nhiều doanh nghiệp không thể áp dụng AI do chi phí và phức tạp của việc xây dựng và mở rộng các hệ thống AI. Các giải pháp AI ngày nay không được tối ưu hóa cho suy luận, với các pod đào tạo thường có hiệu suất thấp và máy chủ suy luận có các nút thắt cao. Để đối mặt với thách thức này và làm cho AI trở nên dễ tiếp cận hơn, chúng tôi đã phát triển giải pháp suy luận AI hoàn chỉnh đầu tiên – một cơ sở hạ tầng tính toán và mạng được cung cấp bởi NAPU của chúng tôi – giúp tối đa hóa các gia tốc器 AI đồng hành và giảm các rào cản thị trường xung quanh chi phí và tiêu thụ năng lượng quá mức.

Cách tiếp cận hệ thống đối với suy luận AI – thay vì cố gắng phát triển một GPU hoặc gia tốc器 AI tốt hơn, nơi có sự đổi mới và cạnh tranh – có nghĩa là chúng tôi đang lấp đầy một khoảng trống đáng kể trong ngành công nghiệp cho hàng chục nhà đổi mới chip và hệ thống suy luận AI. Đội ngũ của chúng tôi đã tấn công các điểm yếu trong suy luận AI một cách hệ thống và toàn diện, bằng cách xác định các điểm đau, khoảng trống kiến trúc và dự báo khối lượng công việc AI – để cung cấp kiến trúc suy luận AI được thiết kế riêng, không dựa trên CPU đầu tiên. Và bằng cách phát triển một ngăn xếp phần mềm AI từ trên xuống với các tiêu chuẩn mở từ Python và Kubernetes kết hợp với Công cụ chuỗi, Cung cấp và API suy luận của NeuReality, bộ công cụ phần mềm tích hợp của chúng tôi kết hợp tất cả các thành phần vào một giao diện người dùng chất lượng cao.

Trong một thị trường AI cạnh tranh, điều gì giúp NeuReality khác biệt với các nhà cung cấp giải pháp suy luận AI khác?

Để nói đơn giản, chúng tôi là mở và trung lập với gia tốc器. Cơ sở hạ tầng suy luận NR1 của chúng tôi siêu tăng cường bất kỳ gia tốc器 AI – GPU, TPU, LPU, ASIC, bạn có thể đặt tên – tạo ra một hệ thống cuối cùng được tối ưu hóa. Các gia tốc器 AI ban đầu được đưa vào để giúp CPU xử lý các nhu cầu của các mạng nơ-ron và học máy lớn, nhưng bây giờ các gia tốc器 AI đã trở nên mạnh mẽ đến mức chúng đang bị kìm hãm bởi chính các CPU mà chúng được thiết kế để hỗ trợ.

Giải pháp của chúng tôi? NR1. Đó là một kiến trúc suy luận AI hoàn chỉnh, được tưởng tượng lại. Vũ khí bí mật của chúng tôi? NR1 NAPU được thiết kế như một thành phần đồng hành để tối đa hóa hiệu suất của gia tốc器 AI mà không tiêu thụ thêm năng lượng hoặc làm tăng chi phí. Chúng tôi đã xây dựng một hệ sinh thái mở, tích hợp liền mạch với bất kỳ chip suy luận AI và các khuôn khổ phần mềm phổ biến như Kubernetes, Python, TensorFlow và nhiều hơn nữa.

NeuReality cách tiếp cận mở có nghĩa là chúng tôi không cạnh tranh với cảnh quan AI; chúng tôi ở đây để bổ sung cho nó thông qua các quan hệ đối tác chiến lược và hợp tác công nghệ. Chúng tôi cung cấp mảnh ghép còn thiếu: một kiến trúc suy luận được thiết kế riêng, không dựa trên CPU giúp không chỉ mở khóa các gia tốc器 AI để đạt được hiệu suất chuẩn, mà còn giúp các doanh nghiệp và chính phủ dễ dàng áp dụng AI. Hãy tưởng tượng việc giải phóng toàn bộ sức mạnh của Nvidia H100, Google (GOOGL ) TPU hoặc AMD MI300 – mang lại cho chúng cơ sở hạ tầng mà chúng xứng đáng.

NeuReality kiến trúc mở giúp tạo điều kiện cho sự cạnh tranh công bằng, làm cho AI trở nên dễ tiếp cận và vừa túi tiền hơn cho mọi người. Tôi đam mê việc thấy các ngành công nghiệp khác nhau – tài chính, sinh học, y tế – trải nghiệm lợi thế NR1 trực tiếp. So sánh các giải pháp AI của bạn trên các hệ thống CPU truyền thống so với cơ sở hạ tầng NR1 hiện đại và chứng kiến sự khác biệt. Ngày nay, chỉ 35% doanh nghiệp và chính phủ đã áp dụng AI và đó là dựa trên các tiêu chí đủ điều kiện rất thấp. Hãy cùng nhau làm cho nó có thể cho hơn 50% khách hàng doanh nghiệp áp dụng AI vào thời điểm này trong năm tới mà không làm tổn hại đến hành tinh hoặc làm vỡ ngân sách.

Nhìn về tương lai, tầm nhìn dài hạn của NeuReality cho vai trò của AI trong xã hội là gì, và bạn nhìn thấy công ty của mình đóng góp vào tương lai này như thế nào?

Tôi hình dung một tương lai nơi AI mang lại lợi ích cho mọi người, thúc đẩy đổi mới và cải thiện cuộc sống. Chúng tôi không chỉ xây dựng công nghệ; chúng tôi đang xây dựng nền tảng cho một tương lai tốt hơn.

NR1 của chúng tôi là chìa khóa cho tầm nhìn đó. Đó là một giải pháp suy luận AI hoàn chỉnh giúp phá vỡ các rào cản về chi phí và phức tạp mà đang cản trở việc áp dụng AI trong kinh doanh. Chúng tôi đã tưởng tượng lại cả cơ sở hạ tầng và kiến trúc, cung cấp một hệ thống cách mạng giúp tối đa hóa đầu ra của bất kỳ GPU hoặc gia tốc器 AI nào mà không tăng chi phí hoạt động hoặc tiêu thụ năng lượng.

Mô hình kinh doanh thực sự quan trọng để mở rộng quy mô và cung cấp cho khách hàng cuối cùng thực sự có lựa chọn thay thế sự thống trị AI tập trung như tôi đã viết trước đó. Thay vào đó, chúng tôi đang xây dựng một hệ sinh thái mở, nơi silicon của chúng tôi hoạt động với silicon khác, không phải chống lại nó. Đó là lý do tại sao chúng tôi thiết kế NR1 để tích hợp liền mạch với tất cả các gia tốc器 AI và với các mô hình và phần mềm mở, giúp dễ dàng cài đặt, quản lý và mở rộng.

Chúng tôi không dừng lại ở đó. Chúng tôi đang hợp tác với các đối tác để xác thực công nghệ của chúng tôi trên các khối lượng công việc AI khác nhau và cung cấp “suy luận như một dịch vụ” và “LLM như một dịch vụ” thông qua các nhà cung cấp dịch vụ đám mây, siêu máy tính và trực tiếp với các nhà sản xuất chip đồng hành. Chúng tôi muốn làm cho AI tiên tiến trở nên dễ tiếp cận và vừa túi tiền cho mọi người.

Hãy tưởng tượng những khả năng nếu chúng ta có thể tăng cường hiệu suất suy luận AI, hiệu suất năng lượng và chi phí lên đến hai con số. Hãy tưởng tượng một xã hội mạnh mẽ, được AI kích hoạt với nhiều tiếng nói và lựa chọn trở thành hiện thực. Vì vậy, chúng ta phải làm việc chăm chỉ để chứng minh tác động kinh doanh và ROI khi AI được triển khai trong các hoạt động hàng ngày của trung tâm dữ liệu. Hãy tập trung vào việc triển khai AI cách mạng, không chỉ khả năng của mô hình AI.

Đây là cách chúng tôi đóng góp vào một tương lai nơi AI mang lại lợi ích cho mọi người – một chiến thắng cho lợi nhuận, con người và hành tinh.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập NeuReality.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.