Лидеры мнений

Тесты для моделей обработки естественного языка

mm
Добавьте Unite.AI в избранные источники в Google

Понимание роли и ограничений тестов в оценке производительности моделей обработки естественного языка. Изучение методов разработки прочных моделей.

Модели обработки естественного языка в последние годы приобрели огромную популярность. Я имею в виду, вы видели это. Исключительная способность моделей обработки естественного языка понимать команды на человеческом языке сделала их идеальным дополнением для бизнеса, поддерживающим критически важные рабочие процессы и автоматизирующим задачи для максимальной эффективности. Кроме того, за пределами понимания обычного пользователя существует гораздо больше того, что могут делать модели обработки естественного языка. И по мере того, как наша зависимость от них растет, мы действительно должны уделять больше внимания мерам, обеспечивающим необходимую точность и надежность. Это глобальная задача, которая касается целых учреждений, но в области бизнеса существуют несколько тестов, которые можно использовать для оценки производительности моделей обработки естественного языка в различных областях. Эти тесты могут проверять способности модели в понимании, логическом рассуждении, математике и т. д., и результаты определяют, готова ли модель обработки естественного языка к развертыванию в бизнесе.

В этой статье я собрал всесторонний список наиболее популярных тестов для оценки моделей обработки естественного языка. Мы рассмотрим каждый тест подробно и увидим, как различные модели обработки естественного языка справляются с критериями оценки. Но сначала давайте более подробно рассмотрим оценку моделей обработки естественного языка.

Что такое оценка моделей обработки естественного языка?

Как и другие модели ИИ, модели обработки естественного языка также нуждаются в оценке по определенным тестам, которые оценивают различные аспекты производительности модели обработки естественного языка: знания, точность, надежность и последовательность. Стандарт обычно включает:

  1. Понимание запросов пользователя: Оценка способности модели точно понимать и интерпретировать широкий спектр входных данных пользователя.
  2. Проверка вывода: Проверка ответов, сгенерированных ИИ, против доверенной базы знаний, чтобы убедиться, что они правильны и актуальны.
  3. Прочность: Измерение того, насколько хорошо модель работает с неоднозначными, неполными или шумными входными данными.

Оценка моделей обработки естественного языка дает разработчикам возможность выявить и устранить ограничения эффективно, чтобы улучшить общий пользовательский опыт. Если модель обработки естественного языка тщательно оценена, она будет точной и прочной enough, чтобы справиться с различными реальными приложениями, включая те, которые имеют неоднозначные или неожиданные входные данные.

Тесты

Модели обработки естественного языка являются одной из самых сложных технологий на сегодняшний день и могут обеспечивать даже самые сложные приложения. Поэтому процесс оценки просто должен быть таким же сложным, проверяя мыслительный процесс и техническую точность.

Тест использует конкретные наборы данных, метрики и задачи оценки для проверки производительности модели обработки естественного языка, что позволяет сравнивать различные модели обработки естественного языка и измерять их точность, что, в свою очередь, стимулирует прогресс в отрасли за счет улучшения производительности.

Вот некоторые из наиболее типичных аспектов производительности модели обработки естественного языка:

  • Знания: Знания модели необходимо проверить в различных областях. Для этого и существует тест знаний. Он оценивает, насколько эффективно модель может вспомнить информацию из различных областей, таких как физика, программирование, география и т. д.
  • Логическое рассуждение: Это означает проверку способности модели «думать» шаг за шагом и вывести логический вывод, обычно включающий сценарии, в которых модель должна выбрать наиболее правдоподобное продолжение или объяснение на основе повседневных знаний и логического рассуждения.
  • Понимание текста: Модели должны быть превосходны в интерпретации естественного языка и генерации ответов соответственно. Тест похож на ответы на вопросы на основе текста, чтобы оценить понимание, вывод и сохранение деталей. Как в школьном тесте на чтение.
  • Понимание кода: Это необходимо для измерения профессионализма модели в понимании, написании и отладке кода. Эти тесты предоставляют модели задачи по программированию или проблемы, которые модель должна решить точно, часто покрывая ряд языков программирования и парадигм.
  • Знания о мире: Чтобы оценить понимание модели общих знаний о мире. Эти наборы данных обычно содержат вопросы, требующие широких, энциклопедических знаний для правильного ответа, что отличает их от более конкретных и специализированных тестов знаний.

Тесты знаний

MMLU (Мультимодальное понимание языка)

Этот тест предназначен для проверки понимания модели обработки естественного языка фактических знаний в различных темах, таких как гуманитарные науки, социальные науки, история, информатика и даже право. 57 вопросов и 15 000 задач направлены на то, чтобы убедиться, что модель имеет отличные способности рассуждения. Это делает MMLU хорошим инструментом для оценки фактических знаний и рассуждений модели при работе с различными темами.

Недавно он стал ключевым тестом для оценки моделей обработки естественного языка в вышеуказанных областях. Разработчики всегда хотят оптимизировать свои модели, чтобы превзойти другие в этом тесте, что делает его де-факто стандартом для оценки продвинутого рассуждения и знаний в моделях обработки естественного языка. Большие модели предприятия показали впечатляющие результаты в этом тесте, включая GPT-4-omni с результатом 88,7%, Claude 3 Opus с результатом 86,8%, Gemini 1.5 Pro с результатом 85,9% и Llama-3 70B с результатом 82%. Меньшие модели обычно не показывают такого же уровня производительности в этом тесте, обычно не превышая 60-65%, но недавний результат Phi-3-Small-7b с результатом 75,3% является чем-то, о чем стоит подумать.

Однако MMLU не идеален: он имеет известные проблемы, такие как неоднозначные вопросы, неправильные ответы и отсутствие контекста. И многие считают, что некоторые его задачи слишком просты для правильной оценки моделей обработки естественного языка.

Я хотел бы подчеркнуть, что тесты, подобные MMLU, не идеально отражают реальные сценарии. Если модель обработки естественного языка показывает отличный результат в этом тесте, это не всегда означает, что она стала экспертом в предмете. Тесты действительно ограничены по объему и часто полагаются на вопросы с несколькими вариантами ответов, которые не могут полностью отражать сложность и контекст реальных взаимодействий. Истинное понимание требует знаний фактов и динамического применения этих знаний, что предполагает критическое мышление, решение проблем и контекстуальное понимание. По этим причинам модели обработки естественного языка постоянно нуждаются в совершенствовании и обновлении, чтобы модель поддерживала актуальность и эффективность теста.

GPQA (Тест вопросов и ответов, подтвержденный экспертами)

Этот тест оценивает модели обработки естественного языка на логическом рассуждении с помощью набора данных с 448 вопросами. Эксперты в этой области разработали его, и он охватывает темы биологии, физики и химии.

Каждый вопрос проходит через следующий процесс проверки:

  1. Эксперт в этой области отвечает на вопрос и предоставляет подробную обратную связь.
  2. Автор вопроса пересматривает вопрос на основе этой обратной связи.
  3. Второй эксперт отвечает на пересмотренный вопрос.

Этот процесс может фактически гарантировать, что вопросы объективны, точны и сложны для модели языка. Даже опытные PhD-школяры достигают точности только 65% на этих вопросах, в то время как GPT-4-omni достигает только 53,6%, подчеркивая разрыв между человеческим и машинным интеллектом.

Из-за высоких требований к квалификации набор данных фактически довольно мал, что ограничивает его статистическую мощность для сравнения точности и требует больших эффектов. Эксперты, которые создали и проверили эти вопросы, пришли из Upwork, поэтому они потенциально ввели предубеждения, основанные на их экспертизе и охватываемых темах.

Тесты кода

HumanEval

164 задачи по программированию, настоящий тест для способностей модели по кодированию. Это HumanEval. Он предназначен для проверки базовых навыков программирования больших моделей языка. Он использует метрику pass@k для оценки функциональной точности генерируемого кода, которая выводит вероятность того, что хотя бы один из лучших k образцов кода, сгенерированного моделью, пройдет тестовые случаи.

Хотя набор данных HumanEval включает сигнатуры функций, докстринги, тела кода и несколько единиц тестирования, он не охватывает весь диапазон реальных задач программирования, что неадекватно проверяет способность модели генерировать правильный код для различных сценариев.

MBPP (Основное программирование на Python)

MBPP состоит из 1000 задач по программированию на Python, полученных из краудсорсинга. Эти задачи являются базовыми и фокусируются на фундаментальных навыках программирования. Он использует подходы few-shot и fine-tuning для оценки производительности модели, при этом более крупные модели обычно показывают лучшие результаты в этом наборе данных. Однако, поскольку набор данных содержит в основном базовые программы, он все еще не полностью представляет сложность и проблемы реальных приложений.

Математические тесты

Хотя большинство моделей обработки естественного языка довольно хорошо справляются со стандартными ответами, математическое рассуждение является гораздо более сложной задачей для них. Почему? Потому что для этого требуются навыки, связанные с пониманием вопроса, логическим подходом с математическим рассуждением и получением правильного ответа.

Метод «Цепочка рассуждений» (CoT) предназначен для оценки моделей обработки естественного языка на математических тестах, он предполагает побуждение моделей объяснить свой пошаговый процесс рассуждения при решении проблемы. Есть несколько преимуществ этого. Он делает процесс рассуждения более прозрачным, помогает выявить недостатки в логике модели и позволяет более детально оценить навыки решения проблем. Разбивая сложные проблемы на серию более простых шагов, CoT может улучшить производительность модели на математических тестах и предоставить более глубокие знания о ее способностях рассуждения.

GSM8K: Популярный математический тест

Одним из известных тестов для оценки математических способностей моделей обработки естественного языка является набор данных GSM8K. GSM8K состоит из 8,5 тысяч задач математики средней школы, которые требуют нескольких шагов для решения, и решения в основном включают выполнение последовательности элементарных вычислений. Обычно более крупные модели или те, которые специально обучены для математического рассуждения, показывают лучшие результаты в этом тесте, например, модели GPT-4 показывают результат 96,5%, в то время как DeepSeekMATH-RL-7B немного отстает с результатом 88,2%.

Хотя GSM8K полезен для оценки способности модели справиться с задачами математики средней школы, он может не полностью отражать способность модели решать более сложные или разнообразные математические задачи, что ограничивает его эффективность как всесторонней меры математических способностей.

Математический набор данных: Всесторонняя альтернатива

Математический набор данных устраняет недостатки тестов, таких как GSM8K. Этот набор данных более обширен, охватывая арифметику начальной школы до задач высшей школы и даже колледжа. Он также сравнивается с человеческими результатами, при этом студент-компьютерщик, который не любит математику, достигает точности 40%, а золотой медалист достигает точности 90%.

Он обеспечивает более всестороннюю оценку математических способностей модели обработки естественного языка. Он гарантирует, что модель профессионал в базовой арифметике и компетентна в сложных областях, таких как алгебра, геометрия и исчисление. Однако возросшая сложность и разнообразие задач могут сделать его сложным для моделей достижения высокой точности, особенно для тех, которые не явно обучены на широком спектре математических концепций. Кроме того, различные форматы задач в математическом наборе данных могут ввести несоответствия в производительности модели, что затрудняет получение окончательных выводов о математической профессионализме модели.

Использование метода «Цепочка рассуждений» с математическим набором данных может улучшить оценку, поскольку оно раскрывает пошаговые способности рассуждения моделей обработки естественного языка в широком спектре математических задач. Такой комбинированный подход гарантирует, что оценка математических способностей модели обработки естественного языка более прочна и детальна.

Тесты на понимание текста

Оценка понимания текста оценивает способность модели понимать и обрабатывать сложный текст, что особенно важно для приложений, таких как поддержка клиентов, генерация контента и извлечение информации. Существует несколько тестов, предназначенных для оценки этого навыка, каждый со своими уникальными характеристиками, которые способствуют всесторонней оценке способностей модели.

RACE (Набор данных для понимания текста из экзаменов)

Тест RACE имеет почти 28 000 текстов и 100 000 вопросов, собранных из английских экзаменов для китайских студентов средней и высшей школы в возрасте от 12 до 18 лет. Он не ограничивает вопросы и ответы, извлекаемые из заданных текстов, что делает задачи еще более сложными.

Он охватывает широкий спектр тем и типов вопросов, что обеспечивает тщательную оценку и включает вопросы различных уровней сложности. Кроме того, вопросы в RACE специально разработаны для проверки навыков чтения у людей и созданы экспертами в этой области.

Однако тест имеет некоторые недостатки. Поскольку он разработан на основе китайских образовательных материалов, он склонен вводить культурные предубеждения, не отражающие глобальный контекст. Кроме того, высокий уровень сложности некоторых вопросов не совсем соответствует типичным реальным задачам, что может привести к неточным оценкам.

DROP (Дискретное рассуждение над абзацами)

Другой значимый подход — DROP (Дискретное рассуждение над абзацами), который бросает вызов моделям выполнить дискретное рассуждение над абзацами. Он имеет 96 000 вопросов для проверки способностей рассуждения моделей обработки естественного языка, и вопросы извлекаются из Википедии и краудсорсинга из Amazon Mechanical Turk. Вопросы DROP часто требуют от моделей выполнения математических операций, таких как сложение, вычитание и сравнение, на основе информации, разбросанной по всему абзацу.

Вопросы сложны. Они требуют от моделей обработки естественного языка найти несколько чисел в абзаце и добавить или вычесть их, чтобы получить окончательный ответ. Большие модели, такие как GPT-4 и Palm, достигают 80% и 85% соответственно, в то время как люди достигают 96% в наборе данных DROP.

Тесты на здравый смысл

Проверка здравого смысла в языковых моделях является интересной, но также важной, поскольку она оценивает способность модели делать суждения и выводы, соответствующие человеческому рассуждению. В отличие от людей, которые развивают всестороннюю модель мира через практический опыт, языковые модели обучаются на огромных наборах данных без внутреннего понимания контекста. Это означает, что модели испытывают трудности с задачами, требующими интуитивного понимания повседневных ситуаций, логического рассуждения и практических знаний, которые крайне важны для прочных и надежных приложений ИИ.

HellaSwag (Более сложные окончания, более длинные контексты и низкокадровые активности для ситуаций с генерацией противников)

Hellaswag был разработан Rowan Zellers и коллегами в Университете Вашингтона и Институте искусственного интеллекта Аллена. Он предназначен для проверки способности модели предсказать наиболее правдоподобное продолжение данного сценария. Этот тест разработан с помощью метода Adversarial Filtering (AF), где серия дискриминаторов итеративно выбирает генерируемые машинами неправильные ответы. Этот метод создает набор данных с тривиальными примерами для людей, но сложными для моделей, в результате чего получается «зона сложности», подобная «золотому середине».

Хотя Hellaswag был сложным для более ранних моделей, современные модели, такие как GPT-4, достигли уровня производительности, близкого к человеческой точности, что указывает на значительный прогресс в этой области. Однако эти результаты подчеркивают необходимость непрерывного развития тестов, чтобы идти в ногу с достижениями в области ИИ.

Openbook

Набор данных Openbook состоит из 5957 вопросов с несколькими вариантами ответов по элементарной науке. Вопросы собраны из открытых экзаменов и разработаны для оценки человеческого понимания предмета.

Тест Openbook требует способности рассуждения, выходящей за рамки извлечения информации. GPT-4 достигает наивысшей точности 95,9% на данный момент.

OpenbookQA моделируется по аналогии с открытыми экзаменами и состоит из 5957 вопросов с несколькими вариантами ответов по элементарной науке. Эти вопросы предназначены для проверки понимания 1326 основных научных фактов и их применения в новых ситуациях.

Аналогично Hellaswag, более ранние модели испытывали трудности с OpenbookQA, но современные модели, такие как GPT-4, достигли уровня производительности, близкого к человеческому. Этот прогресс подчеркивает важность разработки еще более сложных и нюансов тестов для дальнейшего продвижения границ понимания ИИ.

Достаточно ли тестов для оценки производительности моделей обработки естественного языка?

Да, хотя они обеспечивают стандартизированный подход к оценке производительности моделей обработки естественного языка, они также могут быть вводящими в заблуждение. Организация крупных моделей говорит, что хороший тест для модели обработки естественного языка должен быть масштабируемым, способным оценивать новые модели с относительно небольшим количеством испытаний, и обеспечивать уникальный порядок ранжирования для всех моделей. Но есть причины, по которым они могут быть недостаточными. Вот некоторые из них:

Утечка тестов

Это распространенная проблема, и она возникает, когда обучающие данные перекрываются с тестовыми данными, что приводит к вводящей в заблуждение оценке. Если модель уже встретила некоторые тестовые вопросы во время обучения, ее результат может не точно отражать ее истинные способности. Но идеальный тест должен минимизировать запоминание и отражать реальные сценарии.

Оценочная предвзятость

Таблицы лидеров тестов моделей обработки естественного языка используются для сравнения их производительности на различных задачах. Однако полагаться на эти таблицы лидеров для сравнения моделей может быть вводящим в заблуждение. Простые изменения в тестах, такие как изменение порядка вопросов, могут сдвинуть рейтинг моделей на восемь позиций. Кроме того, модели обработки естественного языка могут показывать разную производительность в зависимости от методов оценки, что подчеркивает важность учета оценочных предубеждений.

Открытость

Реальное взаимодействие с моделью обработки естественного языка включает проектирование подсказок для генерации желаемых выходных данных ИИ. Выходные данные модели зависят от эффективности подсказок, и тесты предназначены для проверки контекстно-зависимых способностей модели. Хотя тесты предназначены для проверки контекстно-зависимых способностей модели, они не всегда переводятся напрямую в реальную производительность. Например, модель, достигающая 100% результата в наборе данных теста, такого как LSAT, не гарантирует тот же уровень точности в практических приложениях. Это подчеркивает важность учета открытой природы реальных задач при оценке моделей обработки естественного языка.

Эффективная оценка для прочных моделей обработки естественного языка

Итак, теперь вы знаете, что тесты не всегда являются лучшим вариантом, поскольку они не всегда могут обобщаться на все проблемы. Но есть другие способы.

Пользовательские тесты

Они идеальны для проверки конкретных поведений и функций в сценариях, специфичных для задач. Скажем, если модель обработки естественного языка предназначена для медицинских работников, наборы данных, собранные из медицинских учреждений, эффективно отражают реальные сценарии. Эти пользовательские тесты могут фокусироваться на понимании языка в конкретной области, производительности и уникальных контекстных требованиях. Выравнивая тесты с возможными реальными сценариями, вы можете гарантировать, что модель работает хорошо в целом и превосходит в конкретных задачах, для которых она предназначена. Это может помочь выявить и устранить любые пробелы или слабости в способностях модели на ранней стадии.

Пайплайн обнаружения утечки данных

Если вы хотите, чтобы ваши оценки «показывали» целостность, наличие пайплайна тестов, свободного от утечки данных, очень важно. Утечка данных происходит, когда данные теста включены в предварительно обученный корпус модели, что приводит к искусственно высоким показателям производительности. Чтобы избежать этого, тесты должны быть сопоставлены с предварительно обученными данными. Кроме того, необходимо предпринять шаги, чтобы избежать любой ранее виденной информации. Это может включать использование проприетарных или недавно собранных наборов данных, которые хранятся отдельно от пайплайна обучения модели — это гарантирует, что метрики производительности, которые вы получаете, отражают способность модели обобщать хорошо.

Оценка человеком

Автоматические метрики сами по себе не могут захватить весь спектр производительности модели, особенно когда речь идет о очень тонких и субъективных аспектах понимания и генерации языка. Здесь оценка человеком обеспечивает гораздо лучшую оценку:

  • Наем профессионалов, которые могут предоставить подробные и надежные оценки, особенно для специализированных областей.
  • Краудсорсинг! Платформы, такие как Amazon Mechanical Turk, позволяют собирать разнообразные человеческие суждения быстро и с минимальными затратами.
  • Обратная связь сообщества: Использование платформ, таких как арена лидерборда LMSYS, где пользователи могут голосовать и сравнивать модели, добавляет дополнительный слой информации. Например, арена чат-ботов LMSYS Hard особенно эффективна в подчеркивании тонких различий между лучшими моделями через прямые взаимодействия пользователей и голоса.

Заключение

Без оценки и тестирования мы не имели бы возможности знать, является ли способность модели обработки естественного языка справляться с реальными задачами такой же точной и применимой, как мы думаем. Но, как я сказал, тесты не являются полностью надежным способом проверки этого, они могут привести к пробелам в производительности моделей обработки естественного языка. Это также может замедлить развитие моделей обработки естественного языка, которые действительно прочны для работы.

Это то, как все должно быть в идеальном мире. Модели обработки естественного языка понимают запросы пользователя, выявляют ошибки в подсказках, выполняют задачи по инструкции и генерируют надежные выходные данные. Результаты уже хороши, но не идеальны. Это где пользовательские тесты оказываются очень полезными, как и оценка человеком и обнаружение утечки тестов. Используя их, мы получаем шанс производить действительно прочные модели обработки естественного языка.

Ирина Барская, PhD, - известный dữ scientist с более чем десятилетним опытом, включающим как продукт-аналитику, так и аналитику для передовых технологий. Она возглавляла создание и аналитику для Yasmina, первого полностью функционального локализованного AI-основанного голосового помощника для Саудовской Аравии, обрабатывающего сложную локализацию данных и маркировку для современного стандартного арабского и саудовских диалектов. В настоящее время Ирина возглавляет качественную аналитику в Yandex, стимулируя развитие технологий ИИ.