Anderson의 관점

음성이 현재 AI와 의사소통하는 최악의 방법

mm
Unite.AI를 Google의 선호 소스에 추가
David Bowman (Keir Dullea) sits at a dark control console, speaking with super-computer HAL 9000, surrounded by illuminated panels, amber buttons, blue displays and rectangular light panels, in Stanley Kubrick's '2001: A Space Odyssey' (1968). Credit: MGM/Allstar

새로운 연구에 따르면 SF에서 가장 인기 있는 AI와 인터페이싱하는 방법은 실제로 잘못된 프롬프트보다 더 나쁜 결과를 생산할 수 있습니다.

 

HAL에서 Deep Thought, C3P0에서 Wall-E까지, 인간과 AI의 이상적인 형태는 항상 음성 제어를 중심으로 해왔으며, 이는 실제 세계에서 초기 보조 시스템인 Siri와 Alexa, 현재의 언어 기반 쿼리 및 대화와 같은 프롬티어 LLM에 반영되어 있습니다.

이 아이디어는 타이핑이 ‘반숙련 노동’으로 간주되는 시대에 등장했으며, 저자와 저널리스트를 제외한 대부분의 사람들은 거의 여성만이 수행했습니다. 이러한 여성들은 자주 내용을 생성하지 않았습니다.

권한과 대리는 회의와 정상으로 표시되었습니다. 복잡한 언어는 지능을 나타내므로, 말한 단어가 AI의 자연스러운 매체가 될 것이라고 생각했습니다.

다른 고려 사항을 제외하고, 텍스트 교환은 TV와 영화에 잘 적응되지 않았습니다. 심지어 대담한 SF 스릴러인 Colossus: The Forbin Project(1970)도 컴퓨터가 인간의 음성 명령에 대한 서면 응답을 표시하는 것을 보여주었지만, 완전히 음성 응답으로 전환했습니다.

1970년 영화 'Colossus: The Forbin Project'의 한 장면. 거대한 슈퍼컴퓨터가 텍스트 기반 언어의 경계를 넘어서고 음성 및 전제가 됩니다.

1970년 영화 ‘Colossus: The Forbin Project’의 한 장면. 거대한 슈퍼컴퓨터가 텍스트 기반 언어의 경계를 넘어서고 음성 및 전제가 됩니다.

타이핑 또는 대화?

세계 최고의 AI 모델은 사용자에게 네이티브 오디오 인터페이스를 제공하지만, 새로운 연구에 따르면 AI와 대화하는 것은 원하는 결과를 얻는 가장 비효율적인 방법일 수 있습니다. 특히 코드와 같은 중요한 출력을 기대하는 경우에 그렇습니다.

연구에 따르면, 대화를 하는 것은 ChatGPT 또는 Gemini와 같은 LLM에 프롬프트 또는 쿼리를 타이핑하는 것보다 더 나쁜 결과를 생산할 수 있습니다. 심지어 타이핑한 프롬프트에 일반적인 오류가 포함된 경우에도 마찬가지입니다.

이는 음성 입력이 더 많이 전사 시스템에 의해 재구성될 가능성이 있기 때문입니다. 이는 전사에서 ‘erm’이나 ‘like’와 같은 불필요한 단어를 제거해야 하며, 또한 문법과 구문의 모호성을 처리해야 하기 때문입니다.

연구자들은 다음과 같이 말합니다.

‘대화는 이제 언어 모델에 대한 1등급 경로입니다. Claude Code와 Codex와 같은 코딩 에이전트는 음성 지시를 받습니다. Google Assistant와 Siri와 같은 전화 보조기는 음성 요청을 LLM 백엔드로 라우팅합니다. Typeless와 같은 음성 전사 프론트엔드는 사용자의 음성 요청을 청소하고 다시 형식화하는 추가 LLM 파워드 계층을 추가합니다.

‘각 경우에 모델은 전사본을 받으며, 각 경우에 화자는 실제로 전송된 문자열을 校正하지 않을 수 있습니다. 전사 파이프라인이 남겨두거나 다시 작성하는 것은 모델이 답변해야 하는 것입니다.’

이것은 타이핑 입력이 우수한 것이 아니라는 것을 보여줍니다. 연구자들은 타이핑 오류가 모델의 성능에 미치는 영향이 미미하다는 것을 발견했습니다. 반면에, 음성 대화, 청소된 전사본, 특히 AI 압축 전사본은 일관되게 더 큰 정확도 하락을 일으켰습니다.

연구의 실험은 Llama-3.1-8B, Qwen2.5-7B, Qwen3-8B, Mistral-7B-v0.3, Phi-4를 사용하여 수행되었습니다.

Human Input Variation Engine(HIVE)의 개념적 스키마

Human Input Variation Engine(HIVE)의 개념적 스키마

테스트 세트는 200개 항목으로 구성되었습니다. Greedy decoding을 사용하여 각 perturbed 프롬프트를 비교했습니다.

테스트 결과, 음성 입력은 키보드 입력보다 정확도가 약 3배 더 낮았습니다. 음성 요청이 자동으로 더 깨끗하고 간결하게 다시 작성되면, 모델이 받는 요청의 구조가 변경되었습니다.

이것은 중요합니다. 음성 입력의 약한 결과는 주로 음성의 ‘ごみ’로 인한 것이 아닙니다. 음성 전사에서 불필요한 단어를 제거하면 정확도가 회복되지 않았습니다.

자아 보존

더 큰 문제는 음성 프롬프트가 모델에 도달하기 전에 재구성되었습니다.

연구의 핵심 질문은 모델이 사용자의 의도를 재구성할 수 있는 충분한 정보를 받았는지 여부입니다. 타이핑 오류는 단어의 ‘표면’을 손상시키지만, 주변 문맥은 여전히 모델이 무엇을 의미하는지 추론하는 데 도움이 될 수 있습니다.

반면에, ‘청소된’ 음성 전사본은 사용자의 원래 문구를 더 짧고 더 매끄럽게 다시 작성할 수 있습니다. 그러나 이는 모델이 받는 정보의 구조를 변경할 수 있습니다.

이것이 키보드 오류가 덜 유해한 이유입니다. 연구자들은 타이핑 오류가 대부분 원래 단어를 유지하는 반면, 음성 전사본은 정보를 제거하거나 재구성할 수 있습니다.

번역에서 잃어버린 것

음성 프롬프트가 모델에 도달하기 전에 정보가 어떻게 손실될 수 있는지 보여주는 예는 연구에서 설명되어 있습니다. 예를 들어, ‘그녀는 아이들에게 동일한 양의 [도서]를 주었다’는 문장이 ‘돈’으로 해석될 수 있습니다.

원래 질문이 각 입력 변경으로 얼마나 살아남는지 보여주는 그래프

원래 질문이 각 입력 변경으로 얼마나 살아남는지 보여주는 그래프

이 효과는 모델이 프롬프트에서 답변을 구축해야 할 때 가장 강했습니다. 산술 및 코드 생성 작업은 정확한 관계를 유지해야 하므로 더 많이 손상되었습니다.

연구자들은 다음과 같이 결론을 내렸습니다.

‘우리는 음성이 가장 비싼 채널이며, 손상 비용은 질문의 원래 토큰화가 얼마나 파괴되는지에 달려 있으며, 테스트 세트 오염이나 경량 적응은 손상을 설명하거나 수리하지 않는다는 것을 발견했습니다.

‘여러 가지 결론이 따릅니다. 타이핑을 하면 이유 모델이 오류를 흡수합니다. 음성을 사용하면 그렇지 않습니다. 따라서 모델이 작동하는 것은 음성입니다.

‘또한 음성 전사 도구를 구축하는 경우, 사용자가 말한 것을 다시 형식화하거나 재구성하지 마십시오. 불필요한 단어를 최소한으로 제거하고 동음이의어를 그대로 두십시오.

‘그 마지막 것이 가장 중요합니다. 음성 전사 프론트엔드는 모델에 도달하는 기본 방법이 되고 있으며, 다시 작성 계층이 가장 큰 손상이며, 변경하기 가장 저렴한 것입니다.’

결론

인터뷰를 수동으로 전사해야 하는 경우(예전에는 흔한 일이었음), 인터뷰 대상자나 화자가 매우 분명하거나(종종 경우에 따라) 일반적으로 사용하는 일련의 일화만 반복하는 경우를 제외하고, 대화는 해석 가능한 과정입니다. 이는 유용한 전사를 수행하는 경우, 텍스트가 말하는 사람의 의도를 더 잘 나타낼 수 있음을 의미합니다.

이것은 음성 브리지가 텍스트와 같은 의미를 얻거나 유지하는 데 어려움을 겪을 수 있음을 시사합니다.

향후 프레임워크가 더욱 연구되고(희망적으로) 인구 통계 데이터셋의 도움을 받아서 새로 제시된 격차를 메울 수 있기를 기대합니다. 그 때까지, 새로운 연구는 음성 통신이 소비자 수준의 ‘보조’ 시스템에서 특징적인 짧은 명령에 더 적합할 수 있음을 나타냅니다.

 

2026년 8월 12일 처음 게시

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai