Интервью
Моше Танах, генеральный директор и сооснователь NeuReality – Интервью

Моше Танах является генеральным директором и сооснователем NeuReality. До основания NeuReality Моше занимал должность директора по инженерии в Marvell и Intel (INTC ), где он руководил разработкой сложных беспроводных и сетевых продуктов для массового производства. Он также занимал должность вице-президента по исследованиям и разработкам в DesignArt Networks (позже приобретенной Qualcomm (QCOM )), где он внес вклад в разработку продуктов базовых станций 4G.
NeuReality ставит своей миссией упростить внедрение искусственного интеллекта. Принимая системный подход к ИИ, команда экспертов NeuReality обеспечивает вывод ИИ в целом, выявляя болевые точки и предоставляя специально разработанные решения для вывода ИИ, которые делают ИИ доступным и доступным.
С учетом вашего обширного опыта руководства проектами по инженерии в Marvell, Intel и DesignArt-Networks, что вдохновило вас на основание NeuReality, и как ваши предыдущие роли повлияли на видение и направление компании?
NeuReality была создана с целью решить проблемы будущих затрат, сложности и климатических проблем, которые были бы неизбежны при выводе ИИ – что является развертыванием обученных моделей и программного обеспечения ИИ в производственные центры данных ИИ. Где обучение ИИ – это то, как ИИ создается; вывод ИИ – это то, как он используется и как он взаимодействует с миллиардами людей и устройств по всему миру.
Мы являемся командой системных инженеров, поэтому мы рассматриваем все аспекты, все многочисленные аспекты вывода ИИ, включая GPU и все классы специализированных ускорителей ИИ. Стало ясно, что к 2015 году CPU-зависимые чипы и системы ИИ – которые являются каждым GPU, TPU, LPU, NRU, ASIC и FPGA – столкнутся с существенной проблемой к 2020 году. Это системные ограничения, где ускоритель ИИ стал лучше и быстрее в плане сырой производительности, но базовая инфраструктура не поспевала.
В результате мы решили уйти от больших гигантов, запутанных в бюрократии, которые защищают успешный бизнес, как производители CPU и NIC, и нарушить отрасль с помощью лучшей архитектуры ИИ, которая является открытой, агностической и разработанной специально для вывода ИИ. Одним из выводов идеального вывода ИИ является то, что, увеличивая использование GPU и системную эффективность, наша новая вычислительная и сетевая инфраструктура ИИ – работающая на нашем новом сервере-чипе NR1, который заменяет хост-CPU и NIC. Как ингредиентный бренд и компаньон для любого GPU или ускорителя ИИ, мы можем удалить рыночные барьеры, которые сдерживают 65% организаций от инноваций и внедрения ИИ сегодня – недоиспользуемые GPU, что приводит к покупке больше, чем действительно нужно (поскольку они простаивают > 50% времени) – при этом снижая потребление энергии, проблемы с центрами данных ИИ и операционные затраты.
Это уникальная возможность действительно преобразовать архитектуру системы ИИ в лучшую сторону, основанную на всем, что я узнал и практиковал в течение 30 лет, открывая двери для новых инноваторов ИИ в различных отраслях и удаляя CPU-бутылки, сложность и углеродный след.
Миссия NeuReality – демократизировать ИИ. Можете ли вы подробнее рассказать о том, что “ИИ для всех” означает для вас и как NeuReality планирует достичь этой цели?
Наша миссия – демократизировать ИИ, сделав его более доступным и доступным для всех организаций, больших и малых – путем освобождения максимальной мощности любого GPU или любого ускорителя ИИ, чтобы вы получили больше от ваших инвестиций; другими словами, получить БОЛЬШЕ от GPU, которые вы покупаете, а не покупать больше GPU, которые простаивают > 50% времени. Мы можем увеличить ускорители ИИ до 100% полной мощности, обеспечивая при этом до 15-кратную энергоэффективность и снижая системные затраты до 90%. Это заказные улучшения. Мы планируем достичь этой цели с помощью нашего решения NR1 AI Inference, первой в мире архитектуры системы центров данных, разработанной для эпохи ИИ. Она выполняет высокообъемные, разнообразные потоки данных ИИ доступно и эффективно с дополнительной выгодой в виде снижения углеродного следа.
Достижение ИИ для всех также означает сделать его простым в использовании. В NeuReality мы упрощаем развертывание, управление и масштабируемость инфраструктуры ИИ, повышаем бизнес-процессы и прибыльность, а также продвигаем сектора, такие как общественное здравоохранение, безопасность, правоохранительные органы и обслуживание клиентов. Наше влияние распространяется на сектора, такие как медицинская визуализация, клинические испытания, обнаружение мошенничества, создание контента ИИ и многие другие.
В настоящее время наши первые коммерчески доступные устройства NR1-S AI Inference доступны с ускорителями Qualcomm Cloud AI 100 Ultra и через Cirrascale, провайдера облачных услуг.
Решение NR1 AI Inference считается первой архитектурой системы центров данных, разработанной для эпохи ИИ, и разработанной специально для вывода ИИ. Какие были ключевые инновации и прорывы, которые привели к разработке NR1?
NR1 – это название всей системы архитектуры, которую мы разработали и доставили в отрасль ИИ – как открытую, полностью совместимую вычислительную и сетевую инфраструктуру, которая полностью дополняет любой ускоритель ИИ и GPU. Если бы мне пришлось разбить это на самые уникальные и интересные инновации, которые привели к этому комплексному решению NR1 и отличают нас, я бы сказал:
- Оптимизированные графы ИИ: Наша команда разработала ускоритель программирования графов для оптимизации обработки графов, которые имеют решающее значение для ИИ и различных других рабочих нагрузок, таких как обработка медиа, базы данных и многое другое. Графы представляют собой серию операций с зависимостями, и эта более широкая применимость позиционирует NR1 как потенциально разрушительную не только за счет суперусиления GPU и других ускорителей ИИ. Она упрощает развертывание моделей ИИ, генерируя оптимизированные графы на основе предварительно обработанных данных ИИ и программных API, что приводит к значительному повышению производительности.
- NR1 NAPU (Network Addressable Processing Unit): Наша архитектура вывода ИИ работает на NR1 NAPU – 7-нм сервер-чипе, который обеспечивает прямой доступ к сети для предварительной и постобработки ИИ. Мы упаковываем в 6,5 раза больше мощности на меньшем чипе NR1, чем на типичном общем CPU. Традиционно задачи предварительной обработки (например, очистка данных, форматирование и извлечение функций) и задачи постобработки (например, интерпретация и форматирование результатов) обрабатываются CPU. Отдавая эти задачи в NR1 NAPU, мы удаляем как CPU, так и NIC. Это снижает бутылочные горлышки, позволяя выполнять более быструю общую обработку, молниеносные времена ответа и более низкую стоимость за запрос ИИ. Это снижает бутылочные горлышки и позволяет выполнять более быструю общую обработку.
- Технология NR1 AI-Hypervisor: Патентованная аппаратная технология AI-Hypervisor оптимизирует оркестровку задач ИИ и использование ресурсов, повышая эффективность и снижая бутылочные горлышки.
- Двигатель сети NR1 AI-over-Fabric: NR1 включает в себя уникальный двигатель сети AI-over-Fabric, который обеспечивает бесперебойную сетевую связь и эффективное масштабирование ресурсов ИИ на нескольких чипах NR1 – которые соединены с любым GPU или ускорителем ИИ – в пределах одного сервера вывода или устройства NR1-S.
Недавние данные о производительности NeuReality подчеркивают значительную экономию затрат и энергопотребления. Можете ли вы предоставить более подробную информацию о том, как NR1 достигает до 90% экономии затрат и 15-кратной лучшей энергоэффективности по сравнению с традиционными системами?
NeuReality NR1 снижает стоимость и потребление энергии вывода ИИ до 90% и 15-кратной соответственно. Это достигается за счет:
- Специализированного кремния: Наша инфраструктура вывода ИИ, разработанная специально для этого, работает на сервер-чипе NR1 NAPU, который поглощает функциональность CPU и NIC в один – и устраняет необходимость в CPU при выводе. В конечном итоге NR1 максимизирует выход любого ускорителя ИИ или GPU наиболее эффективным образом.
- Оптимизированной архитектуры: Стримлайнинг потока данных ИИ и включение предварительной и постобработки ИИ непосредственно в NR1 NAPU, мы отдаём и заменяем CPU. Это приводит к снижению задержки, линейной масштабируемости и более низкой стоимости за запрос ИИ.
- Гибкой развертываемости: Вы можете купить NR1 двумя основными способами: 1) внутри модуля NR1-M, который представляет собой карту PCIe, содержащую несколько NAPU (обычно 10), разработанную для пары с вашими существующими картами ускорителей ИИ. 2) внутри устройства NR1-S, которое сочетает NAPU с равным количеством ускорителей (GPU, ASIC, FPGA и т. д.) в виде готовой системы вывода ИИ.
На Supercomputing 2024 в ноябре вы увидите, как мы демонстрируем устройство NR1-S с 4 чипами NR1 на 16 ускорителей Qualcomm Cloud AI 100 Ultra. Мы протестировали то же самое с чипами вывода ИИ Nvidia (NVDA ). NeuReality революционизирует вывод ИИ с помощью своей открытой, разработанной специально для этого архитектуры.
Как устройство NR1-S AI Inference с ускорителями Qualcomm Cloud AI 100 сравнивается с традиционными серверами вывода, ориентированными на CPU, с GPU Nvidia H100 или L40S в реальных приложениях?
NR1, в сочетании с ускорителями Qualcomm Cloud AI 100 или Nvidia H100 или L40S, обеспечивает значительный прирост производительности по сравнению с традиционными серверами вывода, ориентированными на CPU, в реальных приложениях ИИ, таких как большие языковые модели, компьютерное зрение, обработка естественного языка и распознавание речи. Другими словами, запуск системы вывода ИИ с NR1 оптимизирует производительность, стоимость системы, энергоэффективность и время ответа на изображения, звук, язык и текст – как отдельно (одиночная модальность), так и вместе (мультимодальность).
Результат? Когда NR1 сочетается с ускорителем, клиент получает БОЛЬШЕ от дорогостоящих инвестиций в GPU, а не покупает БОЛЬШЕ GPU для достижения желаемой производительности.
За пределами максимизации использования GPU NR1 обеспечивает исключительную эффективность, что приводит к 50-90% лучшей цене и производительности и до 13-15-кратной энергоэффективности. Это переводится в значительную экономию затрат и снижение воздействия на окружающую среду для вашей инфраструктуры ИИ.
Устройство NR1-S демонстрирует линейную масштабируемость без снижения производительности. Можете ли вы объяснить технические аспекты, которые позволяют такую бесперебойную масштабируемость?
Устройство NR1-S, сочетающее наши чипы NR1 с ускорителями ИИ любого типа или количества, переопределяет инфраструктуру ИИ. Мы перешли за пределы ограничений, ориентированных на CPU, и достигли нового уровня производительности и эффективности.
Вместо традиционного бутылочного горлышка NIC-CPU-ускоритель NR1-S интегрирует прямой доступ к сети, предварительную и постобработку в наших сетевых адресуемых процессорных единицах (NAPU). С обычно 10 NAPU на систему, каждая из которых обрабатывает задачи, такие как обработка изображений, аудио и цифровой обработки сигналов, и наш AI-Hypervisor, оркестрирующий рабочие нагрузки, мы достигаем бесперебойного потока данных ИИ. Это переводится в линейную масштабируемость: добавление больше ускорителей приводит к пропорциональному увеличению производительности.
Результат? 100% использование ускорителей ИИ постоянно наблюдается. Хотя общая стоимость и энергоэффективность варьируются в зависимости от конкретных чипов ИИ, используемых, максимизированные инвестиции в оборудование и улучшенная производительность постоянно обеспечиваются. По мере роста потребностей в выводе ИИ устройство NR1-S обеспечивает убедительную альтернативу традиционным архитектурам.
NeuReality стремится устранить барьеры на пути к широкому внедрению ИИ. Какие являются наиболее значительными проблемами, с которыми сталкиваются предприятия при внедрении ИИ, и как ваша технология помогает преодолеть эти проблемы?
Когда ИИ реализуется неправильно, программное обеспечение и решения ИИ могут стать проблематичными. Многие предприятия не могут внедрить ИИ из-за стоимости и сложности создания и масштабирования систем ИИ. Сегодня решения ИИ не оптимизированы для вывода, а серверы вывода имеют высокие бутылочные горлышки. Чтобы решить эту проблему и сделать ИИ более доступным, мы разработали первое полное решение для вывода ИИ – вычислительную и сетевую инфраструктуру, работающую на нашем NAPU, которая делает наиболее эффективное использование своего компаньона-ускорителя ИИ и снижает рыночные барьеры вокруг чрезмерных затрат и потребления энергии.
Наш системный подход к выводу ИИ – а не попытка разработать лучший GPU или ускоритель ИИ, где уже существует много инноваций и конкуренции – означает, что мы заполняем значущий пробел в отрасли для десятков инноваторов чипов и систем вывода ИИ. Наша команда атаковала недостатки вывода ИИ системно и целостно, определяя болевые точки, пробелы в архитектуре и прогнозы рабочих нагрузок ИИ – чтобы доставить первое специально разработанное, кремниевое-программное решение вывода ИИ, свободное от CPU. Разработав верхний и нижний программный стек ИИ с открытыми стандартами от Python и Kubernetes в сочетании с инструментами, обеспечением и API NeuReality, наш интегрированный набор программных инструментов объединяет все компоненты в единый высококачественный интерфейс.
В конкурентном рынке ИИ, что отличает NeuReality от других поставщиков решений для вывода ИИ?
Просто говоря, мы открыты и агностичны к ускорителям. Наша инфраструктура вывода ИИ NR1 суперзаряжает ЛЮБОЙ ускоритель ИИ – GPU, TPU, LPU, ASIC, назовите – создавая действительно оптимизированную систему от конца до конца. Ускорители ИИ изначально были введены, чтобы ПОМОЧЬ CPU справиться с требованиями нейронных сетей и машинного обучения в больших масштабах, но теперь ускорители ИИ стали настолько мощными, что они теперь ограничены самими CPU, которые они должны были помочь.
Наше решение? NR1. Это полное, переосмысленное решение для вывода ИИ. Наш секретный оружие? NR1 NAPU был разработан как ко-ингредиент, чтобы максимизировать производительность ускорителя ИИ без дополнительного потребления энергии или разорения. Мы построили открытую экосистему, бесперебойно интегрирующуюся с любым чипом вывода ИИ и популярными программными фреймворками, такими как Kubernetes, Python, TensorFlow и многое другое.
Открытый подход NeuReality означает, что мы не конкурируем с ландшафтом ИИ; мы здесь, чтобы дополнить его посредством стратегических партнерств и технологического сотрудничества. Мы предоставляем недостающую часть пазла: разработанную специально для этого, БЕСПЛАТНУЮ от CPU архитектуру вывода, которая не только разблокирует ускорители ИИ до эталонной производительности, но и делает его проще для предприятий и правительств внедрять ИИ. Представьте себе освобождение полной мощности NVIDIA H100, Google (GOOGL ) TPUs или AMD MI300 – давая им инфраструктуру, которую они заслуживают.
Открытая, эффективная архитектура NeuReality выравнивает поле, делая ИИ более доступным и доступным для всех. Я страстно отношусь к тому, чтобы увидеть различные отрасли – финтех, биотех, хайтек – испытать преимущество NR1 на собственном опыте. Сравните свои решения ИИ на традиционных системах, ориентированных на CPU, с современной инфраструктурой NR1 и увидьте разницу. Сегодня только 35% предприятий и правительств внедрили ИИ, и это основано на невероятно низких квалификационных критериях. Давайте сделаем это возможным для более 50% корпоративных клиентов внедрить ИИ в течение следующего года без вреда для планеты или разорения.
Взглянув вперед, какова долгосрочная видение NeuReality для роли ИИ в обществе, и как вы видите вклад вашей компании в это будущее?
Я представляю себе будущее, где ИИ приносит пользу всем, способствуя инновациям и улучшая жизнь. Мы не просто строим технологию; мы строим основу для лучшего будущего.
Наш NR1 является ключом к этому видению. Это полное решение для вывода ИИ, которое начинает разрушать барьеры стоимости и сложности, препятствующие массовому внедрению бизнеса ИИ. Мы переосмыслили как инфраструктуру, так и архитектуру, доставляя революционную систему, которая максимизирует выход любого GPU, любого ускорителя ИИ, не увеличивая операционные затраты или потребление энергии.
Бизнес-модель действительно имеет значение для масштабирования и предоставления конечным клиентам реальных выборов над集中ной автократией ИИ, как я написал ранее. Итак, вместо этого мы строим открытую экосистему, где наш кремний работает ВМЕСТЕ с другими кремниевыми продуктами, а не против них. Это почему мы разработали NR1 для интеграции бесперебойно с любыми ускорителями ИИ и с открытыми моделями и программным обеспечением, делая его как можно проще для установки, управления и масштабирования.
Но мы не останавливаемся на этом. Мы сотрудничаем с партнерами, чтобы проверить нашу технологию на различных рабочих нагрузках ИИ и доставить “вывод как услугу” и “LLM как услугу” через провайдеров облачных услуг, гипермасштабированных компаний и напрямую с производителями компаньонских чипов. Мы хотим сделать передовой ИИ доступным и доступным для всех.
Представьте себе возможности, если бы мы могли повысить производительность вывода ИИ, энергоэффективность и доступность на двузначные проценты. Представьте себе прочное, ИИ-обеспеченное общество с большим количеством голосов и выборов, становящееся реальностью. Итак, мы все должны сделать требовательную работу по доказательству бизнес-воздействия и ROI, когда ИИ реализуется в ежедневных операциях центров данных. Давайте сосредоточимся на революционной реализации ИИ, а не только на возможностях модели ИИ.
Это то, как мы вносим вклад в будущее, где ИИ приносит пользу всем – победа для прибыльных марж, людей и планеты.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить NeuReality.












