Anderson의 관점

음성이 현재 AI와 의사소통하는 최악의 방법

mm
Unite.AI를 Google의 선호 소스에 추가
David Bowman (Keir Dullea) sits at a dark control console, speaking with super-computer HAL 9000, surrounded by illuminated panels, amber buttons, blue displays and rectangular light panels, in Stanley Kubrick's '2001: A Space Odyssey' (1968). Credit: MGM/Allstar

새 연구는 SF에서 가장 흔히 묘사하는 AI 소통 방식이 오타가 있는 프롬프트보다도 나쁜 결과를 낼 수 있음을 시사합니다.

HAL부터 Deep Thought, C3P0부터 Wall-E까지 이상적인 인간·AI 관계의 중심에는 늘 음성 제어가 있었습니다. 현실에서도 초기 Siri·Alexa부터 현재 최첨단 LLM과의 언어 질의·대화로 이어졌습니다.

이 생각은 지금보다 해방이 덜 이뤄진 시대에 나타났습니다. 작가와 기자를 제외하면 타이핑 자체가 “반숙련 노동”으로 여겨졌고 거의 전적으로 여성이 맡았습니다 . 타이핑하는 여성 자신이 그 내용을 처음 작성한 경우는 드물었습니다.

권력과 주도권은 대신 회의와 정상회담 같은 담론으로 표현됐습니다. 복잡한 언어가 지능을 나타낸다면 말이 AI의 자연스러운 매체가 되리라는 생각은 당연해 보였습니다.

다른 이유를 떠나 텍스트 교환은 TV·영화에 적합하지 않았습니다. 인간 음성 명령에 컴퓨터가 글로 답하는 모습을 보여 준 대담한 SF 스릴러 Colossus: The Forbin Project (1970)조차 곧 완전한 음성 응답으로 전환했습니다.

A scene from 'Colossus: The Forbin Project' (1970), featuring a vast supercomputer that quickly exceeds the boundaries of text-based language, becoming vocal and despotic shortly after being turned on. Source: Universal Pictures

영화 Colossus: The Forbin Project(1970)의 한 장면. 거대한 슈퍼컴퓨터가 작동 직후 텍스트 언어의 한계를 넘어 말을 하고 독재적으로 변합니다. 출처: Universal Pictures

타이핑할까, 말할까?

주요 AI 모델이 자체 오디오 인터페이스를 제공하지만 미국의 새 연구는 AI에 말하는 것이 원하는 결과를 얻는 가장 효과가 낮은 방법일 가능성이 있다고 결론 내렸습니다. 특히 코드처럼 상당한 결과물을 기대할 때 그렇습니다.

논문에 따르면 ChatGPT나 Gemini 같은 LLM에 말로 요청하면 현재는 일반적인 오타가 있는 경우까지 포함해 프롬프트나 질문을 타이핑할 때보다 결과가 나쁩니다.

음성 입력이 전사 시스템에서 재구성될 가능성이 더 높고 그 과정에서 모델이 의존하는 정보가 사라지기 때문입니다. 오디오를 글로 옮길 때는 “음”, “그러니까” 같은 비유창성 표현, 말을 꺼냈다 다시 시작하는 현상, 문법적 모호함, 한 문장을 끝내지 않고 다른 문장으로 넘어가는 일상적 구성을 처리해야 합니다.

저자들은 다음과 같이 말합니다:

“말하기는 이제 언어 모델에 접근하는 특수한 방법이 아니라 주요 경로입니다. Claude Code와 Codex 같은 코딩 에이전트는 음성 지시를 받습니다. Google Assistant와 Siri는 음성 요청을 LLM으로 전달합니다. Typeless 같은 받아쓰기 인터페이스는 전송 전에 요청을 정리하고 서식을 바꾸는 LLM 기반 단계를 더합니다.

“각 경우 모델이 받는 것은 전사문이며, 화자는 실제 전송된 문자열을 교정하지 않을 수 있습니다. 전사 과정에서 남기거나 다시 쓴 내용이 모델이 답해야 할 대상입니다.”

이는 타이핑 입력이 “본래의 형식”이라서 우월하다는 선입견을 깨뜨립니다. 저자의 설명대로라면 AI에 보내기 전에 드러나게든 보이지 않게든 어떤 형태로 재작성되고, 글말 역시 답을 만드는 잠재 공간 의 한 구성 요소일 뿐이므로 그런 의미에서 본래의 형식이 아닙니다.

실험에서는 일상적인 오타가 성능에 주는 영향은 비교적 작았지만 대화체 음성, 정리된 전사문, 특히 AI가 압축한 전사문은 추론·코드 생성에서 지속적으로 훨씬 큰 정확도 하락을 일으켰습니다.

이 새 연구 의 제목은 Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations이며 산타모니카 칼리지와 서던캘리포니아대 소속 저자 네 명이 참여했습니다.

(참고: 이 연구는 방법과 시험·결과를 서로 엮어 제가 평소 사용하는 분석 순서로 쉽게 분리하기 어렵습니다. 따라서 평소보다 더 많이 압축하고 선별해 설명합니다.)

방법

저자들은 QWERTY 키보드로 프롬프트를 입력하거나 음성 전사 시스템으로 말할 때 생기는 오류를 모사하는 변형 도구 모음 Human Input Variation Engine(HIVE)을 개발했습니다.

A diagram illustrating the Human Input Variation Engine (HIVE). A user's prompt reaches a language model through voice, a QWERTY keyboard or direct copy-and-paste, with the latter serving as the clean reference. Color identifies the input channel rather than the implementation method, with the voice operators combining few-shot LLM style transfer and deterministic rules, while the keyboard operators rely entirely on deterministic rules. The right-hand panel shows the range of responses a model can produce under degraded input. Source - https://arxiv.org/pdf/2608.03970

HIVE의 개념도. 프롬프트는 음성, QWERTY 키보드, 직접 복사·붙여넣기로 모델에 전달되며 마지막 경로가 변형 없는 기준입니다. 색상은 구현 방식이 아니라 입력 경로를 나타냅니다. 음성 변형은 소수 예시를 이용한 LLM 문체 변환과 결정론적 규칙을 결합하고 키보드 변형은 규칙만 사용합니다. 오른쪽은 손상된 입력에서 모델이 낼 수 있는 응답 범위를 보여 줍니다. 출처

HIVE는 음성, QWERTY 키보드, 직접 복사·붙여넣기의 세 경로를 모사하며 마지막을 다른 입력과 비교할 수정 없는 기준으로 삼습니다. 질문과 맥락의 순서를 바꾸거나 객관식 보기 순서를 바꾸는 두 연산은 실험 대조군입니다.

변형 연산은 결정론적 규칙이나 Qwen2.5-7B  를 이용한 소수 예시 문체 변환으로 구현했습니다. 두 입력 방식을 통제되고 직접 비교 가능한 조건에서 평가할 수 있게 합니다.

시험 조건과 결과

실험은 Llama-3.1-8B, Qwen2.5-7B, Qwen3-8B, Mistral-7B-v0.3, Phi-4에서 다섯 개의 시드를 사용해 수행했습니다. 벤치마크는 GSM8K, GSM-Symbolic, GSM1k, HumanEval, MMLU-Pro STEM, TruthfulQA MC1의 여섯 가지입니다.

벤치마크마다 200개 항목을 썼고 HumanEval은 전체 164개를 사용했습니다. 매번 가장 확률이 높은 다음 토큰을 선택하는 탐욕적 디코딩 으로 같은 모델 실행에서 변형 프롬프트와 그 원본을 비교했습니다. 프롬프트 변형 17종과 두 대조 시험 (특정 효과를 분리하기 위한 비교)을 통해 평가한 답변은 55만 개입니다.

모델이 학습 때 봤을 수 있는 데이터와 겹치는 시험 데이터 오염 이 발생하지 않도록 조치했습니다.

The full perturbation suite used in the study, showing how accuracy changed against clean prompts across voice transcription changes, QWERTY keyboard errors and control tests. The first row gives clean baseline accuracy, while later rows show percentage-point changes. Red marks the most damaging operator in each block and column, blue the least damaging.

연구의 전체 변형 도구 모음. 음성 전사 변형, QWERTY 오류, 대조 시험에서 원본 대비 정확도 변화를 보여 줍니다. 첫 행은 원본 기준 정확도이며 이후는 퍼센트포인트 변화입니다. 빨간색은 각 구획·열에서 가장 해로운 변형, 파란색은 가장 덜 해로운 변형입니다.

가장 분명한 결과는 주요 조건에서 음성 입력의 손상이 키보드보다 컸다는 점입니다. 음성 기반 변형에 따른 정확도 감소 폭은 오타에 따른 감소 폭의 약 세 배였습니다. 음성 요청을 더 깔끔하고 간결하게 자동 재작성할 때 가장 나빴는데, 정리 과정이 모델에 전달되는 요청 구조를 바꾸는 경우가 많았기 때문입니다.

음성의 약점이 주로 군더더기 때문이 아니었다는 점이 중요합니다. “음”, “그러니까”를 깨끗한 글 프롬프트에 추가하면 정확도가 낮아졌으므로 영향은 있었지만, 음성 전사문에서 제거해도 성능은 회복되지 않았습니다 .

원래 정보를 얼마나 보존하는가

더 큰 문제는 음성 프롬프트가 모델에 도달하기 전에 재구성되는 방식이었습니다.

모델이 사용자 의도를 재구성할 만큼 원래 프롬프트를 받는지가 핵심 질문이었습니다. 오타는 단어를 완전히 없애기보다 표면을 손상시키므로 주변 맥락이 의도 추론을 도울 수 있습니다.

반대로 정리된 음성 전사문은 원래 표현을 더 짧고 매끄럽게 바꾸면서 사실들 사이의 원래 관계를 보존하지 않을 수 있습니다.

이 때문에 키보드 오류는 덜 해로운 경우가 많았습니다. 글자 순서 뒤바뀜, 중복, 띄어쓰기 누락, 인접 키 오타는 보통 원래 표현을 상당 부분 복구할 수 있게 남기지만 음성 정리는 모델이 해석하기 전에 정보를 삭제하거나 재배열하는 일이 더 잦았습니다.

전달 과정에서 사라지는 의미

논문의 한 예는 사용자에서 LLM으로 가는 변형 과정에서 지시 대상이 사라지는 모습을 보여 줍니다. “그녀는 아이들에게 같은 양[의 책]을 주었다” 라는 문장이 책이 아니라 돈으로 해석됐습니다. amount가 원래 대상을 잃고 가장 흔한 연상인 돈에 잘못 연결된 것입니다.

How much of the original question survives each input change. Large dots show individual perturbation types, while small dots show stronger versions of the same keyboard errors.

입력 변형마다 원래 질문이 얼마나 남는지 보여 주는 그림. 큰 점은 개별 변형 유형, 작은 점은 같은 키보드 오류의 더 강한 형태를 나타냅니다.

이미 주어진 보기에서 고르는 대신 프롬프트로부터 답을 구성해야 할 때 이 효과가 가장 컸습니다. 산술·코드 생성은 요청 안의 정확한 관계를 보존해야 해 더 큰 피해를 봤고 객관식은 이런 손상에 덜 노출됐습니다.

저자들의 결론입니다:

“음성이 더 큰 비용을 치르는 경로이며, 손상의 비용은 질문의 원래 토큰화를 얼마나 파괴하는지에 달렸습니다. 시험 데이터 오염이나 가벼운 적응으로는 이 피해를 설명하거나 복구할 수 없었습니다.

“시사점은 여러 가지입니다. 타이핑하면 추론 모델이 오류를 흡수하지만 말로 입력하면 그렇지 않습니다. 따라서 말한 표현이 모델이 작업하는 기반이 됩니다.

“받아쓰기 도구를 만든다면 사용자의 말을 다시 서식화하거나 재구성하지 마세요. 비유창성은 최소한만 제거하고 동음이의어는 그대로 두세요.

“마지막이 가장 중요합니다. 받아쓰기 인터페이스가 모델 접근의 기본 경로가 되고 있으며, 재작성 단계는 측정한 가장 큰 피해 요인이자 가장 적은 비용으로 바꿀 수 있는 부분입니다.”

결론

인터뷰를 직접 전사해 본 사람이라면 그 과정에 얼마나 많은 해석이 필요한지 압니다. AI 이전 기자에게 흔하고 고독한 노동이었습니다. 화자가 유난히 명료하거나, 흔히 그렇듯 익숙한 일화를 기계적으로 반복하는 경우는 예외입니다.

그런 예외를 제외하면 대화할 때 우리는 자동으로 비유창성을 걸러 의미를 계산합니다. 따라서 유용한 전사는 필연적으로 해석 행위이며 소리를 한 치 오차 없이 글자로 옮기는 것보다 화자의 의도를 더 잘 나타내는 텍스트를 만듭니다. LLM에 연결되는 음성 경로도 대응하는 텍스트의 의미를 얻거나 유지하는 데 비슷한 어려움을 겪는다는 점이 흥미롭습니다.

후속 체계가 추가 연구와 충분한 규모의 데이터셋을 통해 이번 연구가 드러낸 간극을 줄일 것으로 기대할 수 있습니다. 그때까지는 AI와의 음성 소통이 기존 소비자용 보조 시스템의 특징인 짧은 명령에 더 적합할 수 있다는 것이 새 연구의 시사점입니다.

2026년 8월 12일 수요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai