Основы ИИ

Готовые против индивидуальных моделей машинного обучения?

mm
Добавьте Unite.AI в избранные источники в Google

Когда лучше строить, чем покупать готовое решение?

Компании могут использовать различные подходы к разработке моделей. От полностью управляемых сервисов машинного обучения до индивидуальных моделей. В зависимости от бизнес-требований, доступной экспертизы и ограничений планирования, они должны сделать выбор: стоит ли разрабатывать индивидуальные решения с нуля или выбрать готовый сервис?

На всех этапах работы с машинным обучением необходимо принять решение о том, как разные части будут работать вместе. От сбора и подготовки данных до разработки и оценки моделей, инженеры по машинному обучению постоянно задают себе один и тот же вопрос: будет ли это индивидуальное решение, написанное и разработанное с нуля, или готовый сервис?

Но когда лучше строить, чем покупать готовое решение? Основными различиями между двумя подходами являются: усилия по предобработке, скорость разработки и необходимая экспертиза.

Что следует учитывать при выборе между готовыми и индивидуальными моделями машинного обучения?

Усилия по предобработке

Проекты по машинному обучению сталкиваются с различными проблемами, но, возможно, самой большой проблемой является доступность обучающих данных. Недостаток обучающих данных может остановить проект до его начала. До начала проекта он может столкнуться с значительными затратами на предобработку данных, маркировку данных, очистку и предобработку. Это хорошо известная ловушка, в которой многие проекты по машинному обучению терпят неудачу: предобработка занимает 80% выделенных ресурсов, в то время как остальные ресурсы остаются для фактической разработки и оценки моделей.

Готовые решения облегчают нагрузку и боль предобработки. Они разработаны для выполнения наиболее распространенных операций с минимальной конфигурацией. Лучшее в них то, что готовые решения существуют для всех этапов работы с машинным обучением.

С другой стороны, индивидуальные решения обычно требуют больше усилий по предобработке. Это не означает, что их следует полностью отвергнуть: они все еще необходимы для тонкой настройки определенного этапа машинного обучения в соответствии с конкретной задачей. Особенно “грязный” набор данных может потребовать специальных правил очистки. В то же время определенный набор функций может потребовать индивидуальной разработки функций, как и нейронные архитектуры могут потребовать небольших корректировок. В этом случае индивидуальные решения, разработанные с нуля, вероятно, будут удовлетворять всем потребностям.

Скорость разработки

Готовые решения фокусируются на конфигурации, а не на реализации. Вместо выделения ресурсов на определение того, что должно быть сделано, команды по машинному обучению будут сосредоточены на как разные части будут работать вместе. Этот подход позволяет компаниям, исследователям и инженерам быстро реализовывать прототипы и демонстрации. Вместо того, чтобы изобретать велосипед, готовые решения позволяют использовать существующие знания, тем самым экономя время разработки.

Индивидуальные решения, разработанные с нуля, известны своей медленной скоростью разработки. Это связано с их повышенными требованиями к обслуживанию: инженеры должны определить и что, и как решения. Кроме того, чем более сложное решение, тем больше времени требуется для обеспечения его масштабируемости и доступности при работе в производственной среде. С этой точки зрения, индивидуальные решения и временные затраты прямо пропорциональны: чем более сложное решение, тем больше времени оно потребует.

Обычно, однако, правда находится где-то посередине: существующая база кода будет переработана и адаптирована к потребностям текущего проекта. Таков случай хорошо известного подхода к обучению моделей с помощью передачи знаний.

Экспертиза

Как и существует несколько уровней, на которых выполняется машинное обучение, существует несколько уровней экспертизы, на которых могут быть разработаны модели машинного обучения, от интерфейсов без кода до разработки моделей с нуля.

Готовые решения существуют, для которых требуется очень мало экспертизы в области машинного обучения. Используя интуитивно понятные интерфейсы и даже подходы с перетаскиванием, стало чрезвычайно простым для любого (от бизнес-аналитиков до инженеров-программистов) создать и развернуть некоторую модель машинного обучения. Хотя этот простой подход к разработке моделей может работать для прототипирования, он вряд ли удовлетворит требованиям производственных систем.

Экспертиза все еще требуется для правильной настройки, установки и обслуживания готовых решений в производстве. Обходные пути, патчи кода, подключение к разным интерфейсам API и решение проблем с развертыванием являются обычными задачами, необходимыми для обеспечения производительности моделей в производственных средах.

Индивидуальные решения обычно реализуются на уровне инфраструктуры, и нет другого выхода: экспертиза определенно требуется. В зависимости от размера компании и целей проекта могут потребоваться мультидисциплинарные команды для поддержки производственных систем. Ученые-исследователи данных, инженеры по машинному обучению и бизнес-аналитики объединяются, чтобы понять результаты вывода и поддерживать производственные модели.

Что следует использовать: готовое или индивидуальное решение машинного обучения?

Решение по машинному обучению будет состоять из многих отдельных компонентов и сервисов, которые должны работать вместе как целостное решение. Это никогда не означает полный переход на индивидуальное или готовое решение, поскольку разные бизнес-задачи требуют разных решений. Чаще всего решения на основе машинного обучения строятся путем комбинации обоих: готовых сервисов для получения общих сведений и индивидуальных моделей для повышения точности и моделирования знаний в конкретной области.

Секрет заключается в том, чтобы знать, когда реализовывать индивидуальные решения с нуля и какие части проекта могут использовать преимущества готовых сервисов. Это сильно зависит от типа проблемы, бизнес-требований, доступных данных и общих ограничений среды разработки.

Для получения дополнительной информации об ИИ и технологических тенденциях обратитесь к Джошу Мираманту, генеральному директору Blue Orange Digital, который предоставляет решения на основе данных для цепочки поставок, автоматизации документооборота в сфере здравоохранения и многого другого.

Вам также может быть интересно:

Использовать НЛП для классификации комментариев в социальных сетях

Как обработка языка улучшается с помощью открытой модели BERT от Google (GOOGL )  

Джош Мирамант является генеральным директором и основателем Blue Orange Digital, ведущего агентства по науке о данных и машинному обучению с офисами в Нью-Йорке и Вашингтоне. Мирамант является популярным спикером, футурологом и стратегическим бизнес- и технологическим консультантом для крупных компаний и стартапов. Он помогает организациям оптимизировать и автоматизировать свой бизнес, реализовывать аналитические методы, основанные на данных, и понимать последствия новых технологий, таких как искусственный интеллект, большие данные и Интернет вещей.