Лидеры мнений
AI не готов к реальной работе: Почему модели проваливают сложные задачи

Инвесторы в пузыре ИИ умоляют профессионалов белых воротничков передать им свои самые сложные задачи и обещают сотрудникам, что они вернут им послеобеденное время, если они просто отдадут чуть больше своих данных. Сложный анализ, решения, требующие суждения, и рабочие процессы, разработанные годами, поглощаются моделью, якобы освобождая людей для чего‑то лучшего. Это доминирующий нарратив в корпоративной Америке сегодня, и это ловушка.
Миф о Способностях: Почему Модели Проваливают Сложные Задачи
A new исследование из Калифорнийского университета в Беркли протестировало ведущие ИИ‑агенты на реальных профессиональных задачах в 55 отраслях, от здравоохранения до финансов и права. Общая эффективность составила менее 25 %. Затем исследователи выделили самую сложную задачу в каждой области — работу, которая отличает старшего специалиста от младшего — и каждый отдельный модель провалилась. Оценки были не просто низкими. Они были нулевыми.
Можно было бы подумать, что такой результат сам по себе изменил бы нарратив, но этого не произошло. По отраслям инвесторы в ИИ слишком заинтересованы в убеждении профессионалов, что большинство текущих моделей ИИ продвинуто дальше, чем они есть на самом деле. Но самый интересный вопрос не в том, может ли ИИ выполнять самые сложные части работы сегодня, потому что мы и все, кто продаёт ИИ, уже знаем ответ на это.
Итак, возникает другой вопрос. Что происходит с суждением молодого специалиста, когда он принимает такой обмен данными, пока его собственное рассуждение ещё не полностью сформировано?
Выводы из Миннесоты: Как ИИ Выравнивает Навыки К Среднему Уровню
A new empirical исследование из Юридической школы Университета Миннесоты предлагает реальный ответ, используя право в качестве тестового случая. Исследователи провели около сотни студентов старших курсов юридического факультета через последовательность реалистичных задач: синтезирование права из исходных материалов, ответы на закрытые вопросы для проверки усвоенного, применение этого права к фактическому сценарию и последующее редактирование своей работы. Одна группа имела доступ к ИИ только на самом первом и самом последнем этапах. Другая не имела ИИ до конца.
Студенты, использовавшие ИИ для создания первого черновика, создали более качественную работу и сделали это быстрее, что не является полностью удивительным. Однако удивительно то, что последовало дальше. Исследователи ожидали, что раннее использование ИИ оставит пробел в понимании, который проявится позже, когда инструмент будет отнят. Но этого не случилось. Студенты, использовавшие ИИ для синтеза права, на самом деле лучше его поняли, чем студенты, работавшие без него, после холодного тестирования. Независимое рассуждение не разрушилось. Оно удержалось, а в некоторых случаях даже улучшилось.
Поворот произошёл на последнем этапе, когда у каждого студента был доступ к ИИ для редактирования своей работы. Студенты, начавшие с более слабого мемо, использовали этот доступ, чтобы действительно улучшить его. Студенты, начавшие с более сильного мемо, ухудшили его. Оставшись одни с мощным инструментом и без дальнейшей структуры его использования, навык не усиливался, а выравнивался к среднему уровню.
Эти два исследования вместе дают резкую истину: ИИ не заменяет профессиональное суждение, и цифры из Беркли должны окончательно закрыть этот разговор. Однако ИИ также не является разъедающей силой, разрушающей рассуждение при контакте. Его эффект полностью зависит от того, где он появляется в процессе.
Последовательность Над Замещением: Сохранение Суждения в Центре
Это применимо и за пределами юридической практики. Каждая интеллектуальная профессия сейчас проводит свою версию этого эксперимента: врач решает, позволить ли модели составить дифференциальный диагноз, аналитик решает, позволить ли модели построить первый вариант модели, а сотрудник решает, позволить ли модели структурировать аргумент, прежде чем они сами проработают его. Результаты из Миннесоты показывают, что ответ не является универсальным «да» или «нет» ко всем формам ИИ. Это вопрос последовательности. ИИ подходит для начальных, рутинных задач и тех частей работы, которые создают трения, но не для суждения. Он не должен находиться в центре задачи, за которую клиент действительно платит, и сейчас он не может туда попасть, даже если бы попытался.
Компании, которые всё ещё обещают иное, продают версию ИИ, которой, согласно данным, не существует. Те, кто построит свои продукты и отношения с клиентами, исходя из той линии, которую действительно показывает исследование, будут теми, кому профессионалы будут доверять через пять лет. Все остальные будут тратить время на объяснение очень дорогого недоразумения.












