Интервью
Эрик Ландау, сооснователь и CEO Encord – Интервью

Эрик Ландау является CEO и сооснователем Encord, платформы активного обучения для компьютерного зрения. Эрик был ведущим количественным исследователем на глобальном рынке акций delta-one, где он запустил в производство тысячи моделей. До Encord он провел почти десятилетие в высокочастотной торговле в DRW. Он имеет степень магистра в области прикладной физики в Гарвардском университете, степень магистра в области электротехники и степень бакалавра в области физики в Стэнфордском университете.
В свободное время Эрик любит играть с ChatGPT и большими языковыми моделями, а также заниматься приготовлением коктейлей.
Что вдохновило вас на создание Encord, и как ваш опыт в физике частиц и количественной финансе повлиял на ваш подход к решению “проблемы данных” в ИИ?
Я впервые начал думать о машинном обучении, работая в физике частиц и имея дело с очень большими наборами данных во время моего пребывания в Стэнфордском линейном ускорителе (SLAC). Я использовал программное обеспечение, разработанное физиками для физиков, которое означало, что было много желаний в плане приятного пользовательского опыта. С более простыми инструментами я смог бы запускать анализ намного быстрее.
Позже, работая в количественной финансе в DRW, я был ответственным за создание тысяч моделей, которые были развернуты в производстве. Аналогично моему опыту в физике, я обнаружил, что высококачественные данные были важны для создания точных моделей, и что управление сложными, крупномасштабными данными было сложным. Ульрик имел аналогичный опыт визуализации больших наборов изображений для компьютерного зрения.
Когда я услышал о его первоначальной идее Encord, я сразу же согласился и понял важность. Вместе с Ульриком мы увидели огромную возможность построить платформу для автоматизации и оптимизации процесса разработки данных ИИ, что сделало бы проще для команд получить лучшие данные в модели и создать надежные системы ИИ.
Можете ли вы рассказать о видении Encord и как оно сравнивается с ранними днями вычислений или интернета в плане потенциала и проблем?
Видение Encord – быть основной платформой, на которую предприятия будут полагаться для преобразования своих данных в функциональные модели ИИ. Мы являемся слоем между данными компании и их ИИ.
Во многих отношениях ИИ отражает предыдущие парадигмальные сдвиги, такие как персональные компьютеры и интернет, в том, что он станет неотъемлемой частью рабочих процессов для каждого человека, бизнеса, нации и отрасли. В отличие от предыдущих технологических революций, которые были в основном ограничены законом Мура о сложном росте вычислительной мощности в 30 раз каждые 10 лет, разработка ИИ выиграла от одновременных инноваций. Таким образом, она движется намного быстрее. По словам Дженсена Хуанга из NVIDIA (NVDA ): “Впервые мы видим сложные экспоненты… Мы компонуем в миллион раз каждые десять лет. Не в сто раз, не в тысячу раз, а в миллион раз.” Без преувеличения мы свидетели самой быстрорастущей технологии в истории человечества.
Потенциал здесь огромен: автоматизируя и масштабируя управление высококачественными данными для ИИ, мы решаем проблему, которая мешает более широкому внедрению ИИ. Проблемы напоминают ранние проблемы в предыдущих технологических эрах: изоляция, отсутствие лучших практик, ограничения для непрофессиональных пользователей и нехватка хорошо определенных абстракций.
Encord Index позиционируется как ключевой инструмент для управления и курирования данных ИИ. Как он отличается от других платформ управления данными, доступных в настоящее время?
Есть несколько способов, которыми Encord Index выделяется:
Index масштабируем: Позволяет пользователям управлять миллиардами, а не миллионами, данных. Другие инструменты сталкиваются с проблемами масштабируемости для неструктурированных данных и ограничены в консолидации всех релевантных данных в организации.
Index гибок: Интегрируется напрямую с частным хранилищем данных и облачными провайдерами хранения, такими как AWS, GCP и Azure. В отличие от других инструментов, которые ограничены одним облачным провайдером или внутренней системой хранения, Index агностичен к местонахождению данных. Он позволяет управлять данными из многих источников с соответствующим управлением и контролем доступа, что позволяет разрабатывать безопасные и соответствующие приложения ИИ.
Index многомодальный: Поддерживает многомодальный ИИ, управляя данными в форме изображений, видео, аудио, текста, документов и т. д. Index не ограничен одной формой данных, как многие инструменты LLM сегодня. Человеческое восприятие многомодальное, и мы считаем, что многомодальный ИИ будет в сердце следующей волны достижений ИИ, которые заменят чат-боты и LLM.
Как Encord Index улучшает процесс выбора правильных данных для моделей ИИ, и какое влияние это оказывает на производительность модели?
Encord Index улучшает выбор данных, автоматизируя курирование больших наборов данных, помогая командам выявить и сохранить только самые релевантные данные, удалив незначимые или предвзятые данные. Этот процесс не только уменьшает размер наборов данных, но также значительно улучшает качество данных, используемых для обучения моделей ИИ. Наши клиенты увидели до 20% улучшения в своих моделях, достигнув 35% сокращения размера набора данных и сэкономив сотни тысяч долларов на вычислительных и человеческих затратах на аннотацию.
Как Encord остается впереди в быстро меняющемся ландшафте ИИ, учитывая быструю интеграцию передовых технологий, таких как модель Segment Anything от Meta?
Мы намеренно построили платформу, чтобы она могла быстро адаптироваться к новым технологиям. Мы фокусируемся на предоставлении масштабируемого, программного подхода, который легко включает в себя достижения, такие как SAM, гарантируя, что наши пользователи всегда оснащены последними инструментами, чтобы оставаться конкурентоспособными.
Мы планируем оставаться впереди, фокусируясь на многомодальном ИИ. Платформа Encord уже может управлять сложными типами данных, такими как изображения, видео и текст, поэтому, когда появляются новые достижения в многомодальном ИИ, мы готовы.
Какие самые распространенные проблемы, с которыми сталкиваются компании при управлении данными ИИ, и как Encord помогает решить эти проблемы?
Существует 3 основные проблемы, с которыми сталкиваются компании:
- Плохая организация и контроль данных: Когда предприятия готовятся реализовать решения ИИ, они часто сталкиваются с реальностью изолированных и неорганизованных данных, которые не готовы к ИИ. Эти данные часто не имеют сильного управления вокруг них, что ограничивает их использование в системах ИИ.
- Отсутствие человеческих экспертов: Когда модели ИИ решают все более сложные проблемы, скоро будет нехватка человеческих экспертов для подготовки и проверки данных. Когда требования ИИ компании увеличиваются, масштабирование этой человеческой рабочей силы является сложным и дорогим.
- Немасштабируемое инструментирование: Производительные модели ИИ очень требовательны к данным для тонкой настройки, проверки, RAG и других рабочих процессов. Предыдущее поколение инструментов не способно управлять количеством и типами данных, необходимых для современных моделей производства.
Encord решает эти проблемы, автоматизируя процесс курирования данных в масштабе, что делает проще выявление эффективных данных из проблемных данных и гарантируя создание эффективных наборов данных для обучения и проверки. Он использует программный подход, который легко масштабируется вверх или вниз по мере изменения потребностей в управлении данными. Наши инструменты аннотации ИИ, поддерживаемые человеком, позволяют экспертам в области увеличить эффективность рабочего процесса. Этот процесс особенно важен в отраслях, таких как финансовые услуги и здравоохранение, где тренеры ИИ дороги. Мы делаем проще управление и понимание всех неструктурированных данных организации, уменьшая потребность в ручном труде.
Как Encord решает проблему предвзятости данных и недопредставленных областей внутри наборов данных, чтобы гарантировать справедливые и сбалансированные модели ИИ?
Решение проблемы предвзятости данных является критическим для нас в Encord. Наша платформа автоматически выявляет и выделяет области, где данные могут быть предвзятыми, что позволяет командам ИИ решить эти проблемы до того, как они повлияют на производительность модели. Мы также гарантируем, что недопредставленные области внутри наборов данных правильно включены, что помогает в разработке более справедливых и сбалансированных моделей ИИ. Используя наши инструменты курирования, команды могут быть уверены, что их модели обучаются на разнообразных и представительных данных.
Encord недавно получил 30 миллионов долларов в рамках финансирования серии B. Как это финансирование ускорит вашу дорожную карту продукта и планы расширения?
30 миллионов долларов в рамках финансирования серии B будут использованы для значительного увеличения размера наших команд продукта, инженерии и исследований ИИ в течение следующих шести месяцев и ускорения разработки Encord Index и других новых функций. Мы также расширяем свое присутствие в Сан-Франциско с новым офисом, и это финансирование поможет нам масштабировать наши операции, чтобы поддержать наш растущий базу клиентов.
Как самый молодой ИИ-компания из Y Combinator, получившая финансирование серии B, что вы приписываете быстрому росту и успеху Encord?
Одной из причин, по которой мы смогли быстро расти, является то, что мы приняли крайне клиентоориентированный фокус во всех областях компании. Мы постоянно общаемся с клиентами, внимательно слушаем их проблемы и “обнимаем” их, чтобы получить решения. Фокусируясь на потребностях клиентов, а не на шуме, мы создали платформу, которая резонирует с лучшими командами ИИ в различных отраслях. Наши клиенты были инструментальными в том, чтобы привести нас туда, где мы находимся сегодня. Наша способность быстро масштабироваться и эффективно управлять сложностью данных ИИ сделала нас привлекательным решением для предприятий.
Мы также обязаны нашему успеху нашим коллегам, партнерам и инвесторам, которые все работали неустанно, чтобы поддержать Encord. Работа с мировыми командами продукта, инженерии и выхода на рынок была чрезвычайно эффективной в нашем росте.
Учитывая растущую важность данных в ИИ, как вы видите эволюцию роли платформ данных ИИ, таких как Encord, в течение следующих пяти лет?
По мере роста сложности приложений ИИ потребность в эффективных и масштабируемых решениях управления данными будет только увеличиваться. Я считаю, что каждое предприятие в конечном итоге будет иметь отдел ИИ, как и отделы ИТ сегодня. Encord будет единственной платформой, которая понадобится им для управления огромными объемами данных, необходимых для ИИ, и быстрого вывода моделей в производство.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Encord.












