인터뷰
보컬 이미지의 닉 라호이카, 공동 창립자 및 CEO – 인터뷰 시리즈

닉 라호이카는 보컬 이미지의 공동 창립자이자 CEO입니다. 보컬 이미지(Vocal Image)는 사람들이 소프트 스킬을 개발하도록 도와주는 코칭 스타트업입니다. 10년 이상의 IT 및 비즈니스 개발 경험을 가진 연쇄 창업가인 닉은 보컬 이미지를 만들기 전에 두 번의 벤처를 성공적으로 매각했습니다. 닉의 여정은 매우 개인적입니다. 그는 학교에서 불분명한 발음으로 인해 괴롭힘을 받았고, 사람들이 더 잘 소통하도록 도와주는 그의 사명을 영감을 주었습니다.
2020년 혁명 이후 그의 고향을 떠나 에스토니아에 도착한 닉은 영어를 거의 구사하지 못했지만, 자신의 앱을 사용하여 목소리를 훈련시키고, 6개월 이내에 첫 번째 펀딩 라운드를 확보했습니다. AWS AI 챌린지와 Meta x Hugging Face 유럽 AI 스타트업 프로그램의 수상자인 보컬 이미지는 최근 Educapital(프랑스)이 주도하는 360만 달러의 시드 라운드를 조달하고, 1,400만 달러의 연간 재생 수익을 달성했습니다.
2021년에 보컬 이미지를 설립했습니다. AI 소프트 스킬 코치를 구축하도록 무엇이 영감을 주었나요? 그리고 처음에 어떤 문제를 해결하려고 했나요?
말하기에 대한 불안감은 내 삶의 일부였습니다. 학교에서 불분명한 발음으로 인해 괴롭힘을 받았고, 그 경험은 정말로 내게 남아 있습니다. 나중에 IT 학생 인턴으로서, 나는 고위 클라이언트에게 발표해야 했고, 같은 страх이 다시 돌아왔습니다.
그런 다음 2021년, 벨라루스에서 혁명이 실패한 후, 나는 밤새 유럽으로 이사해야 했습니다.突然私は영어를 거의 구사하지 못했지만 투자자들에게 피칭해야 했습니다. 그것은 두려웠지만, 선택의 여지가 없었습니다. 나는 매일 몇 시간씩 매우 초기 버전의 보컬 이미지를 사용하여 발음을 연습했습니다. 심지어 “V” 소리를 제대로 발음하는 법을 배우기 위해 몇 주가 걸렸습니다. 그래서 나는 내 회사의 이름을 제대로 발음할 수 있었습니다.
우리는 기본적으로 유튜브와 같은 앱으로 시작했지만, 내장된 음성 녹음기와 댓글 기능이 있었습니다. 사용자는 비디오를 시청하고, 줄을 따라 말하고, 자신의 녹음을 들을 수 있었습니다. 사용자가 어떻게 사용하는지 보면서, 우리는 즉시 피드백이 필요하다는 것을 빠르게 깨달았습니다. 초기 사용자들은 단순히 콘텐츠를 소비하는 것이 실제 결과를 얻기에는 충분하지 않다는 것을 보여주었습니다. 그들은 즉각적인 피드백이 필요했습니다. 우리는 인간 코치를 통해 피드백을 제공하려고 시도했지만, 그 접근 방식은 확장할 수 없었습니다. 그래서 우리는 AI를 사용하기로 결정했습니다.
내 개인적인 통찰력은 내가 플랫폼을 사용하여 첫 번째 피칭을 연습할 수 있었고, 사람 앞에서 연습할 필요가 없다는 것이었습니다. 압박이나 판단이 없었습니다. 그 자유는 모든 것을 바꿨습니다. 한 번 내 문제를 해결한 후, 나는 많은 사람들이 같은 문제를 직면한다는 것을 깨달았습니다. 2억 명이 넘는 사람들이 말하기에 대한 불안감을 겪고 있습니다.
보컬 이미지를 만들기 전에, 당신은 댄스 스튜디오를 운영했습니다. 움직임과 표현에 대한你的 배경은 어떻게 소통과 목소리 자신감에 대한 접근 방식을影响했나요?
나는 댄서가 아니었습니다. 나는 실제로 자기 표현과 사람들에 대한 비즈니스를 구축했습니다. 그것은 통해私は 사람들이 자기 자신을 표현하는 방식으로 많은 것을 알 수 있다는 것을 깨달았습니다.
움직임도 표현하는 방식에 큰 역할을 합니다. 당신의 자세, 호흡, 그것은 모두 소통의 일부입니다. đó에서 AI 코칭이 강력해집니다. 그것은 모든 영역에서 사람들을 훈련시킬 수 있습니다.
이전에는 회사가 여러 코치를 고용해야 했습니다. 퍼블릭 스피킹을 위한 코치, 바디 랭귀지를 위한 코치, 자신감을 위한 코치. 이제, AI를 사용하면 모두 연결됩니다. 당신은 소통의 전체 그림을 구축할 수 있습니다. 단지 한 부분만이 아닙니다.
대부분의 AI 커뮤니케이션 툴과 달리, 당신은 ChatGPT를 기반으로 코치를 만들지 않기로 결정했습니다. 어떤 결정이 있었나요?
ChatGPT에 대한 호재는 우리에게 큰 전환점이 되었습니다. 그것이 주류가 되면서, AI에 대한 신뢰가 크게 증가했고, 우리는 우리의 기술을 믿도록 사람들을 설득할 수 있었습니다.
하지만, 우리는 그것을 우리의 기반으로 사용하지 않기로 결정했습니다. 우리의 목표는 우리의 고유한 모델을 사용하여 사람들의 목소리와 발화 패턴을 평가하는 것이었습니다. 우리는 Gemini, Claude, ChatGPT와 같은 대규모 언어 모델 및 커뮤니케이션 문헌의 지식과 팁을 사용합니다. 그러나 그것들이 우리의 피드백 메커니즘의 핵심은 아닙니다. 실제 피드백의 기초는 인간의 입력입니다.
AI 코칭이 기계적으로 느껴질 수 있다는 두려움은 실제입니다. 그것을 대처하기 위해, 우리는 보컬 이미지를 사용하여 사람들이 즉시 연결하고, 자기 자신을 개선하는 공동의 목표를 공유하며, 서로의 여정을 지원하는 커뮤니티를 조성했습니다. 그리고 이 커뮤니티는 끊임없이 성장하고 우리의 AI를 개선합니다.
인간의 목소리만으로 AI를 훈련시키는 것은 전통적인 LLM 기반 접근 방식과 어떻게 다른가요? 결과와 진실성의 관점에서?
우리는 평가와 맥락을 위해 대규모 언어 모델을 사용합니다. 그러나 우리 시스템의 실제 기초는 데이터입니다. 우리의 핵심 모델은 자기 자신을 개선하기 위해 모인 사람들의 커뮤니티에서 훈련되었습니다.
AI는 학습한 인간만큼 좋습니다. 우리의 고유한 데이터 세트에는 현재 100만 개가 넘는 고유한 인간 목소리가 포함되어 있으며, 각 목소리는 음调, 리듬, 감정을 지니고 있습니다. 모두가 소통의 실제 본질을 나타냅니다.
100만 개가 넘는 인간 목소리가 포함된 데이터 세트를 구축하는 데 어떤 도전을 직면했나요?
모든 데이터 포인트에 동일하게 의존할 수 없습니다. 일부 사용자는 주의 깊게 평가하지만, 다른 사용자는 단순히 클릭합니다. 우리는 신중한 피드백과 노이즈를 구분하는 시스템을 설계해야 했습니다. 시간이 지나면서, 우리는 일관된 참여와 신뢰할 수 있는 판단을 가진 사용자에게 더 많은 가중치를 주는 것을 배웠습니다. 그리고 무작위적인 입력을 필터링했습니다.
가장 어려운 부분은 운영적이었으며, 품질을 양보다 우선하는 평가 생태계를 구축하는 것이었습니다. 그것은 우리의 커뮤니티가 귀중하게 되었습니다. 이들은 무작위적인 인터넷 사용자가 아닙니다. 이들은 실제로 자기 자신의 소프트 스킬을 개선하고 다른 사람을 도와주는 사람들입니다. 모든 평가가 익명으로 진행되므로 피드백은 편향되지 않고 진실합니다.
“팅커처럼” 평가 메커니즘은 매우 흥미롭습니다. 어떻게 피드백 루프가 AI의 지속적인 학습을 형성합니까?
모든 평가, 모든 언어로, 우리의 모델을 더 정교하게 만드는 지능의 작은 조각이 됩니다. 그것은 살아있는 피드백 루프입니다. 더 많은 사람들이 훈련하고 평가할수록, 시스템은 발화와 감정의 뉴앙스를 인식하는 데 더 똑똑해지고, 사람들이 실제로 어떻게 신뢰, 따뜻함, 권위와 같은 것을 지각하는지 배우게 됩니다.
소프트 스킬 중심의 AI 모델을 개발하면서 배운 주요 교훈은 무엇인가요?
주된 도전은 측정했습니다. “신뢰할 수 있음” 또는 “카리스마”에 대한 보편적인 지표는 없습니다. 우리는 우리의 것을 만들었습니다.
이것은 대규모 법칙이 작용했습니다. 10만 명의 사람들이 특정 목소리가 신뢰할 수 있거나 감정이 풍부하다고 동의한다면, 당신은 그 집단적 인식을 신뢰할 수 있습니다. 시간이 지나면서, 우리는 우리의 AI가 주관적인 품질, 즉 단순히 옳다거나 그르다로 평가할 수 없는 것을 예측하도록 가르쳤습니다. 그것은 돌파구였습니다. 언제나 추상적인 것으로 여겨졌던 것을 양적으로 측정하는 법을 배우는 것이었습니다.
1,400만 달러의 연간 재생 수익과 360만 달러의 신선한 시드 라운드를 고려할 때, 성장의 다음 단계에서 주요 우선순위는 무엇인가요? AI 모델을 발전시키는 것, 사용자 기반을 확장하는 것, 커뮤니티 경험을 심화시키는 것 중에서?
우리의 임무는 항상 인간 중심적이었습니다. 우리는 사람들이 더 자신감 있고 진정성 있게 소통하도록 도와줍니다.
다음 단계는 그 영향을全球적으로 확장하는 것입니다. 우리는 새로운 언어와 지리적 지역으로 확장하고, 협상, 적극적인 듣기, 웅변과 같은 새로운 소프트 스킬 모듈을 개발하고 있습니다.
많은 사용자가 AI 코치가 기계적으로 느껴진다고 말합니다. 보컬 이미지는 어떻게 감정적으로 공감하고 맥락을 이해하는 피드백을 제공합니까?
우리는 초 개인화를 중점적으로 다룹니다. 첫 상호작용부터, 우리는 당신이 누구인지, 당신의 억양, 나이, 전문적 맥락, 발화 패턴을 배우게 됩니다. 시간이 지나면서, 우리는 기억을 가지고, 당신이 어떻게 개선되었는지, 당신이 어려움을 겪는 곳, 그리고 어떤 피드백이 가장 공鳴하는지 회상합니다.
그것은 AI가 동적으로 적응하도록 허용합니다. 경험은 개인적인 것입니다. 그것은 완전히 당신의 데이터와 당신의 여정에 의해 형성됩니다. 일반적인 스크립트에 의해 형성되지 않습니다.
앞으로, 생성적 AI와 감정 AI가 성숙함에 따라 소프트 스킬 코칭은 어떻게 발전할 것이라고 생각합니까?
인간의 발달은 항상 천성과 양육의 혼합입니다. 과학은 리더십이 약 절반은 타고난 것, 절반은 배운 것이라고 말합니다. 배운 부분은 이전에 고가의 코치를 고용할 수 있는 임원들에게만 예약되어 있었습니다. 회사들은 한 명의 리더를 코칭하기 위해 1년 동안 7,000달러에서 25,000달러를 지불해야 했습니다. AI는 그것을 변경합니다.
또한, 인간 트레이너와 상호작용하는 것은 여러 개별 코치를 고용하는 것을 필요로 하지만, AI 코치는 모두를 대체할 수 있습니다.
현재, 우리는 다양한 모델의 파이프라인을 사용하여 소통의 다양한 측면을 분석하지만, 미래는 홀로서기 평가하고 가이드하는 통합 시스템입니다. 이 기술은 성장을 민주화할 것입니다. 당신은 카리스마적이거나 큰 기업 예산을 가지지 않아도 소통을 마스터할 수 있습니다. 당신은 단지 호기심과 접근권이 필요합니다. 그리고 그 환경을 조성하는 것이 날마다 나를 움직입니다.
감사합니다. 더 많은 정보를 배우고 싶은 독자들은 보컬 이미지를 방문하십시오.












