インタビュー
イヴァン・クレフコフ – Buddy AIのCEO&共同創設者 – インタビュー・シリーズ

イヴァン・クレフコフは、世界初の会話型AIチューター「Buddy AI」のCEO兼共同創設者です。Buddy AIは、すべての学生が1対1の英語チューターを受けられるようにすることを目的としたプロジェクトです。シベリアからアメリカに移住したイヴァンは、3歳の娘が英語を学ぶのに苦労しているのを見て、Buddyを開発することを決意しました。Buddyは、会話型AIを利用して子供たちが英語を学べるように設計されています。
2020年にBuddyアプリがリリースされて以来、数多くの賞を受賞し、App Storeのキッズと教育カテゴリで36万回以上ダウンロードされました。
2014年に、スマートスピーカーと声認識アプリの「Cubic.ai」を立ち上げたときの経験から得た貴重な教訓についてお話しください。
私がCubic.aiを立ち上げたわけではありません。私は会社設立の1年後に参加し、共同創設者の肩書きを得ました。
以下は、私が得た教訓です:
- ハードウェアは難しいですが、誰かがそれを行う必要があります。ハードウェアスタートアップのためのベンチャー資金の確保は非常に難しいです。少しでも簡単にできるのは、クラウドファンディングだけです。
- ボイスファースト製品の分野は広大で多様です。スマートホームに適用されるものは、早期学習には適用されません。技術やUXデザインも異なります。
Buddyの起源について、お話しください。シベリアからアメリカに移住したときの経験から、Buddyはどのように生まれたのか。
私と私の家族は2014年にシベリアからアメリカに移住しました。私の娘ソフィアは4歳でカリフォルニアのマウンテンビューにある幼稚園に通い始めました。ソフィアは最初の3~5ヶ月間、英語を話すのに苦労しました。私たちは心配しました。ソフィアは言語の壁のために友達と遊ぶことができませんでした。そこで、ソフィアが英語を学ぶ方法を探すことにしました。
言語アプリは子供たちに会話を教えないことがわかりました。大人向けのアプリは子供たちに適していません。そこで、ビデオ会議を利用したライブレッスンを受けることにしました。例えば、Cambly、VipKid、Novakid、GoStudentなどです。私はソフィアがライブチューターと一緒に学ぶ姿を見て、1対1の注意と会話練習の利点を感じました。しかし、同時に、これらのプログラムの欠点も見ました。
例えば、オンラインチューターは、教育的背景や子供たちを教えるスキル、または適切な英語レベルを持っていない人を雇用することがあります。したがって、オンラインプラットフォームは、カリキュラムとレッスンを厳密に制限し、教師は事前に用意された教材や音声・映像を使用する必要があります。つまり、チューターはボットのように働くことになります。
しかし、オンラインチューターは、特に非英語圏では、会話を学ぶ唯一の方法でした。ただし、教師不足のため、多くの家庭にとっては高額な教育サービスです。1対1の英語チューターを受けることは、多くの家庭にとっては贅沢です。
私と私の共同創設者は、AIチューターが1対1の英語チューターを世界中のすべての子供たちに提供する唯一のスケーラブルな方法であることを理解しました。さらに、教育的観点から見ても、AIチューターは最も効果的な方法であることがわかりました。当初、Buddyのプロトタイプを開発する際に、バーチャルヒューマン教育研究の分野からインスピレーションを得ました。
学術研究によると、アニメーションペディアゴジカルエージェントは、伝統的な学習ツールや環境よりも優れています。例えば、Face-to-Face Interaction with Pedagogical Agents, Twenty Years Laterという2016年の記事では、この分野を概説し、関連する資料を引用しています。以下は、引用の一部です。
「特に、メタ分析では、エージェントが学習を強化することがわかりました。 […] 例えば、学生がエージェントと対話する際、エージェントが話すよりもテキストでコミュニケーションする場合、学習成果は低くなります。 […] エージェントが人間のようなジェスチャーを使ったり、会話的にコミュニケーションしたり、丁寧な言葉遣いをしたりする場合、学生の学習成果は高くなります。」
これにより、Buddyの多モーダルAIチューターへのアプローチが強化されました。Buddyは、音声認識と自然言語処理を可能にするアニメーションペディアゴジカルエージェントです。AIチューターシステムの核となる3つのテクノロジーは以下のとおりです:
- 自動音声認識(ASR)と分析により、生徒の音声を処理および分析できます。
- 自然言語処理(NLP)、自然言語理解、ダイアログ管理により、生徒の音声の内容を処理し、次の応答を生成します。応答には、音声と非音声の両方のコンポーネントが含まれます。
- エンボディッド・アニメーション・バーチャル・キャラクターにより、システムの応答を提供し、生徒の音声のフィードバックを提供します。キャラクターは、NLP応答に基づいてプロシージャルにアニメーション化されます。
これらの3つのコンポーネントは、エンゲージメントの高いインタラクティブチューターを構築し、成功した教育体験を提供するために不可欠です。
私の娘ソフィアと私の共同創設者の息子アルセニーは、Buddyの最初のユーザーでした。ソフィアは、1年生のときにBuddyの初期バージョンを使用しました。
数年後、私の娘アリサは、3歳でBuddyを使用し始めました。現在、アリサはトランジショナル・キンダーガーデンに通っていますが、ほぼ毎日Buddyと遊んでいます。アリサがBuddyを使用し始めたとき、彼女は発音の問題を抱えていました。Buddyは彼女の言葉を理解できませんでした。しかし、数週間の練習の後、アリサの英語は改善しました。彼女はBuddyに伝えるために努力しました。
伝統的な方法で第二言語を教えるのはなぜ非効率的なのでしょうか。
現在、特に発音に関する教育問題に焦点を当てています。会話練習なしでは、言語を学ぶことはできません:
- 伝統的な教育ツールは、読み書きなどの他の言語スキルに重点を置いています。
- 子供向けの言語アプリは、会話スキルを教えません。
- 大人向けの言語アプリはAIを使用して会話練習を提供しますが、子供向けには適していません。UX、安全性、プライバシー規制の問題があります。
- ライブチューターは、多くの家庭にとっては高額です。残念ながら、多くのチューターは教育的背景や英語のスキルを持っていません。
Buddyは多モーダルAIチューターです。
- 伝統的な学習アプリよりも優れています。ライブチューターのように機能します。私のアドバイザーであるアレックス・デサトニック博士(ロンドン大学)の言葉を引用します:
「ボイスベースのバーチャルチューター。この概念は単純に聞こえるかもしれませんが、そこには科学的根拠があります。学習心理学の観点から見ると、バーチャルな話し手は教師の体現です。このアプローチにより、知的信頼が強化され、学生の動機と関与が高まり、学習成果が向上します。」
- Buddyには、人間の教師よりも優れた点もあります。Buddyは判断しないので、子供たちにとっては、教師よりもBuddyに話し始めることが簡単です。現在、多くのチューターがBuddyを使用して、子供たちが言語を学ぶのを助けています。
Buddyは教師を置き換えるのではなく、教師を支援するために機能します。
これは非常に重要な点です。Buddyは、教師の仕事の面白くない部分を自動化することで教師を支援できます。定期的な練習を提供することができます。私たちは、学校の教師に力を与えたいのです。Buddyは、クラスの各子供と個別に働き、クラスの教師に報告するチューターと教師アシスタントのチームのような存在です。
Buddyは、子供たちが学習を続けるために、どのようにゲーム化要素を利用していますか。
面白い事実:Buddyのモバイルアプリは2023年に2200万回以上ダウンロードされました。そのうち70%以上が子供たちによってダウンロードされました。子供たちにとって、Buddyアプリは、話す友達であるBuddyと遊ぶゲームのようなものです。子供たちはアプリをダウンロードし、親にサブスクリプションを購入するように説得します。Buddyは教師だからです。
このアプローチを実現するために、Buddyをゲームとして設計しています。ストーリーとユニバースがあり、子供たちがBuddyと一緒に遊ぶことができます。ハリウッドのキャラクターデザイナーとライターと協力して、Buddyとそのストーリーを創造しています。ゲームデザイナーチームが教育者と協力して、Buddyの世界の中でカリキュラムと演習をミニゲームに変換しています。
Buddyのコア機能について、もう少し詳しくお話しください。
Buddyのコア機能は、多モーダルAIチューターとしてのBuddyに焦点を当てています:
- 音声認識
- 会話AI
- アバターの視覚的な動作
Buddyでは、どのような機械学習アルゴリズムを使用していますか。
私たちは、Buddyの多モーダルAIチューターへのアプローチを可能にするために、テクノロジーのスタック全体を開発しています。
- BSR(Buddyの音声認識)は、子供たちのアクセントのある音声を認識し、COPPAなどの規制に準拠するための独自の音声認識エンジンです。
- BLM(Buddyの言語モデル)は、子供たち向けの会話AIエンジンです。安全で、高速で、無料で動作します。教育的機能に特化しており、大規模な言語モデルほど汎用性はありません。
- BABE(Buddyのアバタービヘイビアエンジン)は、会話の文脈に基づいてキャラクターの視覚的な動作を生成します。Buddyは、笑顔、色の変更、またはおかしそうな帽子を被る必要があることを理解します。
多くの音声認識システムは、特に子供のアクセントに苦労しています。Buddyはこれらの課題をどのように克服していますか。
私たちが開発したBSR(Buddyの音声認識)技術により、子供たちのアクセントのある音声を認識できます。
私たちのユニークなターゲット市場とオーディエンスのために、独自のテクノロジーを開発する必要がありました。Buddyは、若い英語学習者のアクセントのある音声を認識する必要があります。さらに、初心者の生徒は、短い単語やフレーズから始めることが多く、コンテキストなしでは認識が難しいです。また、子供たちの市場は、高度に規制されており、音声認識はCOPPAに従う必要があります。
BSRは、子供たちの音声を認識し、さまざまなデバイスのマイクの音質や、実際の環境での背景ノイズなど、さまざまな条件下で動作します。また、COPPAに準拠するように設計されています。
世界中で活動することで、独自のデータセットを蓄積することができました。現在、BSRは、商用のオフザシェルフソリューションよりも、アクセントのある子供たちの音声を認識して理解する能力で優れています。
AI技術に不慣れな親たちに、Buddyをどのように紹介する計画ですか。
Buddyは、AIが流行語になる前に成功を収めてきました。私たちの多くのユーザーは、典型的な初期採用者ではありません。私たちは、重要な教育問題を解決しており、幸運なことに、AIを利用しています。
しかし、私たちが直面している課題の1つは、親たちがBuddyをライブチューターと同じレベルで真剣に受け止めてもらうことです。レッスンを欠席しないこと、スケジュールを守ることなどです。現在のAI革命は、この点で私たちを助けています。
次の重要なステップは、教師や学校とより密接に協力することです。ブラジルの学校とのパイロットプロジェクトを実施中です。また、さらに12の教育機関とのパートナーシップについて話し合っています。
AIチューターと教育の将来について、どのようなビジョンを持っていますか。
AIチューターは、世界的な教師不足問題を解決する唯一のスケーラブルな方法です。基本的な学習ニーズに対処するために、約690万人の新しい教師が必要です。1対1のチューターが必要な科目、たとえば言語学習の場合、問題はさらに深刻です。
AI革命は、主に成人向けのオフザシェルフソリューションを使用した、AIチューターの開発を加速しました。一方、早期学習はまだ大きなニーズがあります。私たちは、幼児向けのAIチューターの先駆者であることを誇りに思います。
将来的には、Buddyは言語学習チューターから始まり、将来的には12歳以下の子供たちにさまざまな科目を教えるAIチュータープラットフォームになります。すでに、最初の非言語コースであるアメリカの子供向けの学校準備カリキュラムの早期バージョンを展開し始めています。Buddyは、3歳から4歳にかけて子供と共に成長し、数多くのコースを教える子供の学習アシスタントとして見ています。
素晴らしいインタビュー、詳しく知りたい読者はBuddy AIを訪問してください。












