Интервью
Джеронимо Де Леон, старший менеджер продукта по ИИ в Backblaze – Интервью

Джеронимо Де Леон – опытный лидер в области управления продуктами с более чем 10-летним опытом внедрения инноваций, основанных на ИИ, в корпоративной и стартап-среде. В настоящее время он занимает должность старшего менеджера продукта по ИИ в компании Backblaze, где он руководит разработкой функций ИИ/МЛ, фокусируется на том, как Backblaze улучшает цикл жизни данных ИИ для архитектур MLOps клиентов, и реализует инструменты и агенты ИИ для оптимизации внутренних операций.
Backblaze – компания, предоставляющая облачное хранилище и резервное копирование, которое предлагает неограниченное автоматическое резервное копирование компьютеров для физических и юридических лиц, а также масштабируемые решения для хранения объектов для корпоративных, медиа- и приложений с большими рабочими нагрузками. Услуги компании фокусируются на доступности, безопасности данных, легкой восстановлении и бесшовной совместимости с существующими системами.
Вы приносите более десяти лет опыта в управлении продуктами, основанными на ИИ – от работы с большими языковыми моделями в Intelas и RAG в Welcome.AI до запуска чат-бота Bloomberg и现在 руководства усилиями по ИИ в Backblaze. Как эти опыт сформировали ваше мнение о роли облачного хранилища в масштабировании рабочих процессов ИИ/МЛ?
С тех пор, как я начал работать над проектами ИИ в IBM Watson, я увидел, как темп инноваций резко ускорился. То, что раньше занимало годы, чтобы перейти от исследования к производству, теперь происходит за месяцы. Однако фундаментальные инфраструктурные проблемы остаются прежними: где находятся данные, где мы храним их и как мы получаем к ним доступ эффективно?
Раньше ограничениями были вычислительные ресурсы и модели, но сейчас у нас есть избыток предобученных моделей, и есть много поставщиков вычислительных ресурсов. Однако, когда мы начинали проект ранее, мы обычно должны были начинать с сбора и обработки данных, и это остается прежним сегодня. Я постоянно вижу, как организации сталкиваются с одной и той же проблемой консолидации данных из различных источников. Организации, которые преуспевают, – это те, которые решают проблему доступности данных на ранней стадии, создавая основу, которая масштабируется с их зрелостью ИИ. Ваши решения по архитектуре хранилища определяют, насколько быстро вы можете приступить к обучению моделей и инновациям.
Где вы видите облачное хранилище, играющее наиболее критические роли на протяжении всего цикла ИИ – от сбора и обработки данных до обучения, тонкой настройки, вывода и мониторинга?
Облачное хранилище имеет решающее значение на протяжении всего цикла ИИ, с ключевыми этапами в агрегации данных, обработке, обучении и выводе. На начальном этапе систематическая консолидация, каталогизация и обеспечение безопасности архивов ускоряет начало новых проектов и делает его легким для тестирования новых моделей. Чистые, хорошо обработанные данные часто превосходят наличие большего количества данных, что делает хранилище центральным для качества, а также для масштаба. Одним из моих любимых выражений Backblaze является: “Это не хранение, если это данные”. Вы никогда не знаете, насколько они будут ценными, поэтому организации должны собирать как можно больше данных. Во время обучения масштабируемое хранилище обеспечивает пропускную способность огромных наборов данных, а на этапе вывода захват выводов прогнозов и обратной связи пользователей позволяет непрерывно совершенствовать модель. В конечном итоге хранилище является основой, которая определяет, насколько быстро вы можете инновировать с помощью ИИ.
Какие самые большие препятствия организации сталкиваются при масштабировании хранилища для ИИ, и как эти проблемы различаются между небольшими стартапами и крупными корпорациями?
Самые большие препятствия при масштабировании хранилища для ИИ – это стоимость, управление данными и доступность. Хранение больших объемов данных – это только часть проблемы; данные также должны быть организованы, извлекаемы и управляемы с правильными контролями. Чистые, хорошо структурированные данные часто более ценны, чем просто наличие большего количества данных.
Для стартапов первым вызовом является получение достаточного количества данных для обучения и совершенствования их моделей. Как только они получают эти данные, стоимость и архитектура становятся следующими барьерами.
Для крупных корпораций вызовом является сложность. У них много данных, но они фрагментированы по разным системам, наследственным системам и режимам соответствия требованиям, что делает консолидацию и доступность данных сложными.
Организации, которые преуспевают, рассматривают хранилище как стратегическое средство, которое масштабируется по стоимости, производительности и доступности вместе с их зрелостью ИИ.
Среди стоимости, задержки, безопасности и соответствия требованиям, какой из них вы считаете наиболее важным барьером для масштабирования ИИ сегодня, и как организации должны расставлять приоритеты в решении этой проблемы?
Среди стоимости, задержки, безопасности и соответствия требованиям задержка является одним из наиболее важных барьеров. Она напрямую влияет на обучение и вывод моделей, и вывод в частности формирует опыт пользователя. Организации делают все возможное, чтобы уменьшить задержку на этом этапе, поскольку задержки в предоставлении прогнозов могут подорвать принятие.
Стоимость остается постоянным вызовом, поскольку объемы данных растут, и соответствие требованиям становится более важным, поскольку организации масштабируются, особенно в регулируемых отраслях. Стартапы часто фокусируются в первую очередь на стоимости и задержке, в то время как корпорации должны балансировать задержку с управлением и требованиями регулирования. Приоритетом должно быть создание хранилища, которое минимизирует задержку для обучения и вывода, при этом будучи экономически эффективным и соответствующим требованиям при расширении принятия ИИ.
Корпорации часто подчеркивают необходимость гибкости и легкого доступа к данным для стимулирования инноваций ИИ. С вашей точки зрения, как выглядит真正ая гибкость в доступе к данным, и почему она так важна?
В недавней речи я подчеркнул идею умного архивирования.真正ая гибкость в доступе к данным начинается с централизации информации в структурированном, поисковом архиве. Это означает унификацию различных форматов, нормализацию и标记рование для последовательности, а также обеспечение индексации для будущих запросов. Этот подход гарантирует, что данные не только хранятся, но и становятся полезными.
Это важно, потому что оно создает основу для аналитики и моделирования. Когда данные структурированы и поисковы, команды могут работать быстрее, экспериментировать более свободно и уменьшать задержку как в обучении, так и в выводе. Без такой гибкости хранилище быстро становится узким местом, а не средством для инноваций ИИ.
Можете ли вы поделиться реальными примерами – такими как с клиентами Decart AI или Wynd Labs – которые демонстрируют, как правильный подход к облачному хранилищу может直接 стимулировать инновации ИИ?
Это два отличных примера того, как правильный подход к облачному хранилищу может напрямую стимулировать инновации ИИ. Decart фокусировался на обучении моделей, где перемещение данных в вычислительные ресурсы было критически важным. С помощью Backblaze B2 они масштабировались до 16 ПБ за 90 дней, обучали на нескольких кластерах GPU без дополнительной стоимости и достигали эффективности в 10 раз выше, чем у конкурентов. Эта надежность и эффективность позволили им инновировать быстрее.
Wynd Labs фокусировался на доступе клиентов к данным. Они ежедневно получают петабайты данных и обслуживают десятки петабайтов в месяц. С помощью высокопроизводительного хранилища Backblaze и бесплатного вывода данных они могли масштабироваться до корпоративного спроса и инвестировать ресурсы в разработку продукта. Эта возможность предоставления доступа к данным в масштабе открыла новые возможности для их платформы.
В обоих случаях правильная стратегия хранилища превратила инфраструктуру из ограничения в средство, позволяющее компаниям фокусироваться на инновациях в ИИ, а не на управлении стоимостью и сложностью.
Когда модели и наборы данных ИИ становятся более сложными, какую рекомендацию вы даете организациям, пытающимся сбалансировать производительность хранилища с экономической эффективностью?
Организациям необходимо думать о долгосрочном использовании данных с учетом их продукта. Сбор, обработка, перемещение и вывод данных будут основными для того, как их продукт будет развиваться. Если они не учтут это сейчас, затраты и проблемы хранилища будут только увеличиваться со временем. Поскольку ИИ будет важной частью их продукта и организации, хранилище должно быть спроектировано заранее, чтобы сбалансировать производительность с экономической эффективностью, чтобы оно могло масштабироваться гладко, когда они растут.
Безопасность и соответствие требованиям особенно важны в регулируемых отраслях. Как вы видите эволюцию облачного хранилища для поддержки потребностей управления, сохраняя при этом возможность для команд быстро инновировать?
Управление является важной частью хранилища. Упрощение доступа с помощью прочной основы для управления данными, безопасности и аудита является критически важным. Я вижу, как облачное хранилище эволюционирует с более сильными встроенными контролями, такими как шифрование по умолчанию, тонкая настройка разрешений, аудиторские следы и варианты резиденции данных. Не менее важно и происхождение данных. В ИИ важно знать, откуда взялись данные, как они были обработаны и как они влияют на модели. Это важно как для соответствия требованиям, так и для доверия.
В то же время платформы хранилища улучшают удобство использования, чтобы команды могли работать быстро. Когда управление, происхождение и доступность работают вместе, организации могут соответствовать требованиям регулирования, продолжая инновировать в ИИ с высокой скоростью.
Для организаций, оценивающих или мигрирующих в B2, какую рекомендацию или руководство вы предоставляете в отношении реализации – в частности, касающейся миграции данных, интеграции с существующими стеками MLOps или вычислений, или оптимизации для пропускной способности и вывода?
Поскольку B2 совместимо с S3, оно интегрируется напрямую в существующие стеки MLOps и вычислений без необходимости реархитектуры. Мы часто работаем с клиентами над концепцией доказательства, чтобы проверить миграцию, производительность и интеграцию перед масштабированием. Далее фокусируется на оптимизации пропускной способности, перемещения данных и оркестровки данных, чтобы команды могли обучать на кластерах, запускать вывод и совершенствовать модель без замедления из-за ограничений инфраструктуры.
Когда рабочие нагрузки ИИ продолжают масштабироваться – особенно с учетом тенденций вокруг больших языковых моделей, наборов данных эксабайтов и гибридных или многооблачных стратегий – как Backblaze эволюционирует свои предложения хранилища, чтобы удовлетворять эти новые потребности?
В Backblaze мы фокусируемся не только на том, как данные используются сегодня, но и на том, как они будут оркестроваться в будущем. Хранилище больше не является только архивом; оно становится инструментом, который обеспечивает быстрый доступ, эффективное перемещение и надежную оркестровку данных в различных средах. С учетом больших языковых моделей и наборов данных эксабайтов эта основа быстрого доступа и высокой пропускной способности будет критически важной не только для обучения и вывода, но и для нового класса агентов ИИ, которые полагаются на данные для автоматизации процессов. Результатом является основа хранилища, которая позволяет инновациям сегодня и готовит организации к тому, что будет дальше.
Спасибо за отличное интервью. Читателям, которые хотят узнать больше, мы рекомендуем посетить Backblaze.












