Взгляд Anderson
Голос в настоящее время является худшим способом общения с ИИ

Новые исследования предполагают, что наиболее популярный метод взаимодействия с ИИ, изображенный в научной фантастике, может фактически давать худшие результаты, чем даже плохо набранные подсказки.
От HAL до Deep Thought, от C3P0 до Wall-E, идеализированная форма человеческих отношений с ИИ всегда центрировалась вокруг голосового управления; и это проявилось в реальном мире, от ранних систем помощников, таких как Siri и Alexa, до языковых запросов и разговоров с текущим рядом передовых моделей LLM.
Эта идея возникла в менее эмансипированные эпохи, где – с исключением авторов и журналистов – сам акт набора текста считался ‘полукувалифицированным трудом’, и выполнялся почти исключительно женщинами – с самими женщинами редко создававшими содержание, которое они набирали.
Власть и агентство символизировались вместо этого дискурсом: встречами и саммитами. Казалось очевидным, поэтому, что с сложным языком символизирующим интеллект, устная речь неизбежно станет естественным средством ИИ.
Помимо любых других соображений, текстовые обмены не были хорошо приспособлены для телевидения и фильмов; даже смелые научно-фантастические триллеры, такие как Colossus: The Forbin Project (1970), которые изображали компьютер, реагирующий на голосовые команды человека в письменной форме, быстро переключались на полностью вокализированные ответы:

Сцена из ‘Colossus: The Forbin Project’ (1970), на которой изображен огромный суперкомпьютер, который быстро превышает границы текстового языка, становясь вокальным и деспотичным вскоре после включения. Источник: Universal Pictures
Набирать или говорить?
Несмотря на то, что ведущие модели ИИ предлагают родные аудиоинтерфейсы для пользователей, новые исследования из США пришли к выводу, что разговор с ИИ, скорее всего, является наименее эффективным способом получить желаемые результаты от него – особенно если вы ожидаете значительных форм вывода, таких как код, в ответ на ваш запрос.
Согласно статье, говорение к модели LLM, такой как ChatGPT или Gemini, в настоящее время дает худшие результаты, чем набор подсказки или запроса, даже когда набранная подсказка содержит обычные ошибки.
Это связано с тем, что голосовой ввод более вероятно будет переструктурирован транскрипционными системами способами, которые удаляют информацию, от которой зависит модель. Это происходит потому, что транскрипция из аудио должна удалять нефлюентности, такие как ‘эрм’ и ‘как’, а также тенденцию к ложным началам (т. е. ‘начинать заново’), а также ориентироваться в неоднозначностях грамматики и ‘неформальной’ конструкции (т. е. предложения, которые переходят в совершенно новые предложения, не завершаясь).
Авторы заявляют:
‘Говорение теперь является первоклассным путем в языковую модель, а не нишевым. Агенты кодирования, такие как Claude Code и Codex, принимают диктованные инструкции. Помощники телефона, такие как Google Assistant и Siri, направляют голосовой запрос на бэкэнд LLM. Интерфейсы диктовки, такие как Typeless, добавляют еще один слой, оснащенный LLM, который очищает и переформатирует запрос пользователя перед его отправкой.
‘В каждом случае модель получает транскрипт, и в каждом случае диктор может не проверить строку, которая была фактически отправлена. Что остается после транскрипционной трубы, или переписывается, это то, что модель должна ответить.’
Это развеивает любое предубеждение, что ввод текста превосходен, потому что он ‘родной’; он не является родным в каком-либо смысле, поскольку а) он всегда либо тайно, либо открыто переписан каким-то образом перед передачей ИИ, и б) текстовый язык является только одним компонентом в латентном пространстве, которое возвращает ответ.
Эксперименты, проведенные в рамках исследования, показали, что обычные ошибки набора текста имели только скромное влияние на производительность, в то время как разговорная речь, очищенные транскрипты и особенно транскрипции, сжатые ИИ, постоянно вызывали гораздо большие снижения точности в задачах рассуждения и генерации кода.
Новая работа называется Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations, и исходит от четырех авторов из Santa Monica College и Университета Южной Калифорнии.
(Примечание: Это конкретное исследование переплетает ‘Метод’ и ‘Тесты/Результаты’ таким образом, что их нельзя легко разделить на мой обычный порядок анализа. Поэтому я вынужден сжимать и выбирать с более тяжелой рукой, чем обычно.)
Метод
Набор ‘perturbation’, называемый Human Input Variation Engine (HIVE), был разработан авторами для симуляции типов ошибок, введенных при наборе подсказок на клавиатуре QWERTY или говорении их через систему транскрипции голоса:

Концептуальная схема для Human Input Variation Engine (HIVE). Запрос пользователя достигает языковой модели через голос, клавиатуру QWERTY или прямую копию и вставку, при этом последняя служит ‘чистой’ ссылкой. Цвет идентифицирует канал ввода, а не метод реализации, при этом операторы голоса объединяют стиль передачи LLM и детерминистические правила, а операторы клавиатуры полагаются исключительно на детерминистические правила. Правая панель показывает диапазон ответов, которые может произвести модель под деградированным вводом. Источник
HIVE моделирует три пути, по которым подсказки достигают языковой модели: через голос; клавиатуру QWERTY; или прямую копию и вставку – при этом последняя служит неизменной ссылкой, с которой сравниваются все остальные входные данные. Два дополнительных оператора функционируют как экспериментальные контроли, переставляя вопрос и его контекст или переставляя варианты ответов с несколькими вариантами.
Операторы perturbation сами реализуются либо через детерминистические правила, либо через передачу LLM с несколькими выстрелами, используя Qwen2.5-7B. Это позволило оценить оба метода ввода в контролируемых и直接 сопоставимых условиях.
Условия тестирования и результаты
Эксперименты проводились на Llama-3.1-8B; Qwen2.5-7B; Qwen3-8B; Mistral-7B-v0.3; и Phi-4, используя пять семян. Шесть используемых эталонов были GSM8K; GSM-Symbolic; GSM1k; HumanEval; MMLU-Pro STEM; и TruthfulQA MC1.
Тестовый набор использовал 200 элементов на каждый эталон, с 164 элементами для полного набора HumanEval. Жадное декодирование (выбор наиболее вероятного следующего токена каждый раз) использовалось, так что каждая искаженная подсказка могла быть сравнена со своей собственной чистой аналогом в одном и том же запуске модели, производя 550 000 оцененных ответов по семнадцати изменениям подсказок и двум контрольным тестам (сравнительным тестам, используемым для изоляции конкретных эффектов).
Были приняты меры, чтобы обеспечить, что загрязнение тестового набора (перекрытие с данными, которые модель могла видеть во время обучения) не произошло:

Полный набор perturbation, использованный в исследовании, показывающий, как точность изменилась против чистых подсказок через изменения транскрипции голоса, ошибки клавиатуры QWERTY и контрольные тесты. Первый ряд дает базовую точность, в то время как последующие ряды показывают изменения в процентных пунктах. Красный цвет отмечает наиболее вредный оператор в каждом блоке и столбце, синий – наименее вредный.
Самый ясный результат в исследовании заключается в том, что голосовой ввод был более вредным, чем ввод с клавиатуры, через основные условия тестирования, с изменениями речи, снижающими точность модели примерно в три раза больше, чем ошибки набора текста. Самые худшие результаты получились, когда устные запросы автоматически переписывались, чтобы звучать чище и более кратко, потому что эта очистка часто меняла структуру запроса, полученного моделью.
Это имеет значение, потому что более слабые результаты для голоса не были в первую очередь вызваны очевидными ‘отходами’ речи: хотя заполнители, такие как ‘эрм’ и ‘как’, имели значение (поскольку добавление их к чистым письменным подсказкам снижало точность), удаление заполнителей из транскрипций речи не восстановило производительность.
Самосохранение
Следовательно, более крупной проблемой было то, как устные подсказки были переструктурированы перед достижением модели.
Центральным вопросом для исследования было, получает ли модель достаточно исходной подсказки, чтобы восстановить намерение пользователя; ошибки набора текста часто повреждают ‘поверхность’ слова без удаления слова целиком, так что контекст, окружающий слово, все еще может помочь модели сделать вывод о том, что было подразумеваемо.
Напротив, ‘очищенная’ транскрипция голоса может заменить исходную фразу пользователя на более короткую и гладкую версию которая больше не сохраняет те же отношения между фактами.
Это объясняет, почему ошибки набора текста часто были менее вредными: исследователи обнаружили, что транспонированные буквы, дублированные буквы, пропущенные пробелы и ошибки соседних клавиш обычно оставляли большую часть исходного текста восстанавливаемым, в то время как очистка речи чаще удаляла или перестраивала информацию, прежде чем модель имела возможность интерпретировать ее.
Потерянный в переводе
Один пример того, как референт может ‘потеряться’ при perturbation на этих путях от пользователя к LLM, представлен в статье, где фраза ‘она дала равное количество [книг] своим детям’ была переинтерпретирована как означающая деньги (а не книги). В этом случае термин ‘количество’ стал отсоединенным от его референта и был ошибочно применен к его наиболее распространенному ассоциативному значению (деньги):

Сколько исходного вопроса выживает после каждого изменения ввода. Большие точки показывают отдельные типы perturbation, в то время как маленькие точки показывают более сильные версии одних и тех же ошибок клавиатуры.
Этот эффект был наиболее выражен, когда модель должна была построить ответ из подсказки, а не выбрать из вариантов, уже предоставленных: арифметические и задачи генерации кода пострадали больше, потому что они зависели от сохранения точных отношений в запросе, в то время как тесты с несколькими вариантами ответов были менее подвержены этому типу повреждения.
Авторы заключили:
‘Мы обнаружили, что говорение является дорогим каналом, что то, что повреждение стоит, это то, сколько исходной токенизации вопроса оно уничтожает, и что ни загрязнение тестового набора, ни легкая адаптация не объясняют или не исправляют вред.
‘Несколько выводов следуют. Если вы набираете текст, модель рассуждения поглощает ваши ошибки. Если вы диктуете, она не делает этого, поэтому фраза, которую вы говорите, является фразой, с которой работает модель.
‘И если вы строите инструменты диктовки, не переформатируйте и не перестраивайте то, что сказал пользователь: минимизируйте удаление нефлюентностей и оставьте омонимы в покое.
‘И последнее имеет наибольшее значение, потому что интерфейсы диктовки становятся стандартным способом достижения модели, а их слой переписывания является наиболее значимым вредом, который мы измеряем, и является самым дешевым, что можно изменить.’
Вывод
Кто-либо, кто когда-либо имел возможность вручную транскрибировать интервью (общую и одиночную журналистскую обязанность в до-ИИ эпохе), будет знать, насколько интерпретативным может быть этот процесс, если только интервьюируемый или говорящий не является необычно артикулированным или – как часто бывает – просто повторяет свою обычную риторику в рутинном порядке.
Помимо таких особых случаев, когда мы говорим с людьми, мы автоматически дисконтируем нефлюентности и рассчитываем смысл. Это неизбежно делает полезную транскрипцию интерпретативным актом, в результате чего получается текст, представляющий намерения говорящего лучше, чем буквальная, идеальная транслитерация; и интересно отметить, что аудиомосты к LLM борются подобным образом, чтобы сохранить или даже получить тот же смысл, что и текстовые эквиваленты.
Естественно ожидать, что более поздние рамки будут выигрывать от дальнейшего исследования и (надеюсь) населенных наборов данных, которые помогут мостить пропасти, описанные в новой работе. До того времени новое исследование показывает, что голосовая связь с ИИ может быть более подходящей для именно того типа коротких команд, которые характеризовали потребительские системы ‘помощников’.
Опубликовано впервые в среду, 12 августа 2026 года












