Основы ИИ
Готовые против индивидуальных моделей машинного обучения?
Когда лучше строить, чем покупать готовое решение?
Компании могут использовать различные подходы к разработке моделей. От полностью управляемых сервисов машинного обучения до индивидуальных моделей. В зависимости от бизнес-требований, доступной экспертизы и ограничений планирования, они должны сделать выбор: стоит ли разрабатывать индивидуальные решения с нуля или выбрать готовый сервис?
На всех этапах работы с машинным обучением необходимо принять решение о том, как разные части будут работать вместе. От сбора и подготовки данных до разработки и оценки моделей, инженеры по машинному обучению постоянно задают себе один и тот же вопрос: будет ли это индивидуальное решение, написанное и разработанное с нуля, или готовый сервис?
Но когда лучше строить, чем покупать готовое решение? Основными различиями между двумя подходами являются: усилия по предобработке, скорость разработки и необходимая экспертиза.
Что следует учитывать при выборе между готовыми и индивидуальными моделями машинного обучения?
Усилия по предобработке
Проекты по машинному обучению сталкиваются с различными проблемами, но, возможно, самой большой проблемой является доступность обучающих данных. Недостаток обучающих данных может остановить проект до его начала. До начала проекта он может столкнуться с значительными затратами на предобработку данных, маркировку данных, очистку и предобработку. Это хорошо известная ловушка, в которой многие проекты по машинному обучению терпят неудачу: предобработка занимает 80% выделенных ресурсов, в то время как остальные ресурсы остаются для фактической разработки и оценки моделей.
Готовые решения облегчают нагрузку и боль предобработки. Они разработаны для выполнения наиболее распространенных операций с минимальной конфигурацией. Лучшее в них то, что готовые решения существуют для всех этапов работы с машинным обучением.
С другой стороны, индивидуальные решения обычно требуют больше усилий по предобработке. Это не означает, что их следует полностью отвергнуть: они все еще необходимы для тонкой настройки определенного этапа машинного обучения в соответствии с конкретной задачей. Особенно “грязный” набор данных может потребовать специальных правил очистки. В то же время определенный набор функций может потребовать индивидуальной разработки функций, как и нейронные архитектуры могут потребовать небольших корректировок. В этом случае индивидуальные решения, разработанные с нуля, вероятно, будут удовлетворять всем потребностям.
Скорость разработки
Готовые решения фокусируются на конфигурации, а не на реализации. Вместо выделения ресурсов на определение того, что должно быть сделано, команды по машинному обучению будут сосредоточены на как разные части будут работать вместе. Этот подход позволяет компаниям, исследователям и инженерам быстро реализовывать прототипы и демонстрации. Вместо того, чтобы изобретать велосипед, готовые решения позволяют использовать существующие знания, тем самым экономя время разработки.
Индивидуальные решения, разработанные с нуля, известны своей медленной скоростью разработки. Это связано с их повышенными требованиями к обслуживанию: инженеры должны определить и что, и как решения. Кроме того, чем более сложное решение, тем больше времени требуется для обеспечения его масштабируемости и доступности при работе в производственной среде. С этой точки зрения, индивидуальные решения и временные затраты прямо пропорциональны: чем более сложное решение, тем больше времени оно потребует.
Обычно, однако, правда находится где-то посередине: существующая база кода будет переработана и адаптирована к потребностям текущего проекта. Таков случай хорошо известного подхода к обучению моделей с помощью передачи знаний.
Экспертиза
Как и существует несколько уровней, на которых выполняется машинное обучение, существует несколько уровней экспертизы, на которых могут быть разработаны модели машинного обучения, от интерфейсов без кода до разработки моделей с нуля.
Готовые решения существуют, для которых требуется очень мало экспертизы в области машинного обучения. Используя интуитивно понятные интерфейсы и даже подходы с перетаскиванием, стало чрезвычайно простым для любого (от бизнес-аналитиков до инженеров-программистов) создать и развернуть некоторую модель машинного обучения. Хотя этот простой подход к разработке моделей может работать для прототипирования, он вряд ли удовлетворит требованиям производственных систем.
Экспертиза все еще требуется для правильной настройки, установки и обслуживания готовых решений в производстве. Обходные пути, патчи кода, подключение к разным интерфейсам API и решение проблем с развертыванием являются обычными задачами, необходимыми для обеспечения производительности моделей в производственных средах.
Индивидуальные решения обычно реализуются на уровне инфраструктуры, и нет другого выхода: экспертиза определенно требуется. В зависимости от размера компании и целей проекта могут потребоваться мультидисциплинарные команды для поддержки производственных систем. Ученые-исследователи данных, инженеры по машинному обучению и бизнес-аналитики объединяются, чтобы понять результаты вывода и поддерживать производственные модели.
Что следует использовать: готовое или индивидуальное решение машинного обучения?
Решение по машинному обучению будет состоять из многих отдельных компонентов и сервисов, которые должны работать вместе как целостное решение. Это никогда не означает полный переход на индивидуальное или готовое решение, поскольку разные бизнес-задачи требуют разных решений. Чаще всего решения на основе машинного обучения строятся путем комбинации обоих: готовых сервисов для получения общих сведений и индивидуальных моделей для повышения точности и моделирования знаний в конкретной области.
Секрет заключается в том, чтобы знать, когда реализовывать индивидуальные решения с нуля и какие части проекта могут использовать преимущества готовых сервисов. Это сильно зависит от типа проблемы, бизнес-требований, доступных данных и общих ограничений среды разработки.
Для получения дополнительной информации об ИИ и технологических тенденциях обратитесь к Джошу Мираманту, генеральному директору Blue Orange Digital, который предоставляет решения на основе данных для цепочки поставок, автоматизации документооборота в сфере здравоохранения и многого другого.
Вам также может быть интересно:
Использовать НЛП для классификации комментариев в социальных сетях
Как обработка языка улучшается с помощью открытой модели BERT от Google (GOOGL )












