تمويل
Modulate تجمع $25M لبناء طبقة الذكاء للذكاء الاصطناعي الصوتي

Modulate جمعت $25 مليون تمويل جديد بينما تسعى الشركة التي تتخذ من بوسطن مقراً لها إلى الاستفادة من تحدٍ متزايد في الذكاء الاصطناعي: تعليم الآلات فهم ليس فقط ما يقوله الناس، بل كيف يقولونه.
Future Ventures قادت الجولة، بمشاركة من Hyperplane وLakestar. يجلب هذا التمويل إجمالي تمويل Modulate إلى $60 مليون وسيُستخدم لتوسيع أبحاثها في الذكاء الاصطناعي، وفِرَق الهندسة، وأدوات المطورين، والشراكات، وخيارات النشر.
يأتي الاستثمار في الوقت الذي يصبح فيه الصوت بشكل متزايد واجهة لوكلاء الذكاء الاصطناعي، ومنصات خدمة العملاء، وبيئات الألعاب، وأنظمة الأمن. بينما تحسّن تقنية تحويل الكلام إلى نص بشكل كبير، تراهن Modulate على أن النصوص وحدها تترك الكثير من المعلومات الموجودة في الكلام البشري.
تقنيتها تحلل بدلاً من ذلك الصوت الأساسي لاستخراج إشارات مثل العاطفة، والنبرة، والنية، والتوقفات، والكلام الصناعي، وسلوك المحادثة.
التجاوز عن تحويل الكلام إلى نص
يتبع معظم مكدس الذكاء الاصطناعي الصوتي اليوم بنية بسيطة نسبياً: تحويل الكلام إلى نص ثم إرسال النص الناتج إلى نموذج لغة كبير (LLM).
هذا يعمل جيداً عندما تحتوي الكلمات نفسها على معظم المعلومات ذات الصلة. يصبح أكثر تقييداً عندما يعتمد المعنى على السخرية، أو الإحباط، أو التردد، أو التوتر، أو الانقطاعات، أو تغيّر النبرة.
قامت Modulate ببناء منصتها الرائدة Velma حول فكرة أن هذه الإشارات يجب تحليلها مباشرة من الصوت بدلاً من إعادة بنائها لاحقاً من النص.
تصف الشركة Velma بأنها نظام ذكاء محادثة أصلي للصوت قادر على إنتاج النصوص مع تحديد المتحدثين، والعواطف، ومواضيع المحادثة، والمشاعر، وأكثر من 150 سلوكاً في الوقت نفسه. يمكن للمطورين أيضاً تعريف سلوكيات مخصصة باستخدام أوصاف بلغة طبيعية.
يفتح ذلك التقنية لتطبيقات تتراوح بين تحديد عميل محبط قبل تدهور المكالمة إلى اكتشاف سلوك مريب أثناء معاملة مالية أو تحديد متى يتصرف وكيل صوتي ذكي بشكل غير متوقع.
في يونيو، فتحت Modulate منصة Velma مباشرة للمطورين عبر واجهة برمجة تطبيقات (API)، موسعةً الوصول إلى ما بعد عمليات النشر المؤسسية السابقة.
Modulate تتبع نهجًا جماعيًا للذكاء الاصطناعي الصوتي
البنية التحتية تحت Velma هي ما تسميه Modulate Ensemble Listening Model، أو ELM.
بدلاً من استخدام نموذج ضخم واحد لأداء كل مهمة، ينسق ELM أكثر من 100 نموذج متخصص، حيث تحلل المكونات الفردية خصائص مختلفة لتدفق الصوت.
يمكن لتلك النماذج فحص خصائص أساسية مثل تغيّر المتحدثين والتوقفات إلى جانب إشارات أعلى مستوى مثل العاطفة، والنية المتصورة، وعلامات الصوت الصناعي، والارتباك، أو أنماط السلوك. ثم يجمع طبقة التنسيق تلك الملاحظات في تفسير أوسع للمحادثة.
إنها فلسفة مختلفة بوضوح عن الاستراتيجية المتزايدة الشيوع لتطبيق نماذج أساسية متعددة الوسائط متزايدة الحجم على الصوت.
تجادل Modulate بأن التخصص يسمح لبنيتها بتقديم مخرجات أكثر شفافية مع تقليل كمية الحوسبة المطلوبة. لتطبيقات المؤسسات مثل اكتشاف الاحتيال والامتثال، قد تكون القدرة على فهم سبب إطلاق النظام لتنبيه ما مهمة تقريباً بقدر أهمية التنبيه نفسه.
وفقاً للشركة، يمكن أن يكون النهج أكثر كفاءة حسابية حتى 1,000 مرة مقارنةً باستخدام نموذج كبير واحد لبعض أعباء تحليل الصوت.
الذكاء الاصطناعي الصوتي يخلق مشكلة مراقبة جديدة
يتزامن توقيت التمويل أيضاً مع تحول أوسع يحدث عبر الذكاء الاصطناعي المؤسسي.
أنظمة الذكاء الاصطناعي أصبحت قادرة بشكل متزايد على إجراء محادثات صوتية كاملة مع العملاء. وهذا يعني أن الشركات الآن تحتاج إلى مراقبة التفاعلات التي تشمل ليس فقط الموظفين البشر، بل الوكلاء المستقلين الذين يعملون عبر آلاف أو ربما ملايين المحادثات.
قد يتبع وكيل صوتي نصاً تقنياً بينما يواصل مقاطعة العملاء بشكل متكرر، أو يفشل في التعرف على الإحباط، أو يسيء فهم النية، أو يرد بشكل سيء على المواقف العاطفية.
ترى Modulate فرصة لتصبح طبقة استماع مستقلة تجلس إلى جانب تلك الوكلاء.
تم تصميم تقنية الوكيل الصوتي لديها لتحديد إشارات مثل الانقطاعات، والتوقفات، والعواطف، واللهجات، وغيرها من الخصائص التي يصعب التقاطها من النص وحده، مما يسمح للمطورين بتعديل سلوك الوكيل أثناء استمرار المحادثات.
يمكن تطبيق نفس البنية التحتية على المحادثات البشرية حيث تحتاج المؤسسات إلى تحديد الاحتيال، ومخاطر الامتثال، والتحرش، أو غيرها من الأحداث المحتملة ذات الأهمية في الوقت الفعلي.
من مراقبة الألعاب إلى الذكاء الصوتي الأوسع
تمثل طموحات Modulate الحالية توسعًا كبيرًا مقارنةً مع تركيزها السابق على الألعاب عبر الإنترنت.
أحد أشهر منتجاتها، ToxMod، تم تطويره لتحليل الاتصالات الصوتية الحية على منصات الألعاب والاجتماعية وتحديد التحرش والتهديدات والاستدراج وسلوكيات ضارة أخرى.
لا يزال ذلك جزءًا مهمًا من الأعمال. تقول Modulate إن ToxMod يمكنه الاندماج مباشرةً مع البنية الصوتية القائمة مع تحويل التفاعلات المحتملة الإشكالية إلى أنظمة الإشراف أو إلى مراجعين بشريين.
عملت الشركة مع كبرى شركات الألعاب بما في ذلك Activision وRiot Games وRockstar Games وRec Room.
لكن التكنولوجيا الأساسية المطلوبة لفهم السمية في لعبة متعددة اللاعبين يمكن تكييفها أيضًا مع بيئات أخرى حيث يكون السياق مهمًا.
تضع Modulate الآن تقنيتها في مجالات منع الاحتيال، ومراكز الاتصال، وإشراف الوكلاء الذكائيين، واكتشاف التزييف العميق، وتجربة العملاء، والثقة والسلامة.
توفر منصة المطورين الخاصة بها حاليًا عائلات نماذج متعددة تشمل النسخ، واكتشاف التزييف العميق، وإزالة الصوت، وذكاء المحادثة، وغيرها من قدرات تحليل الصوت.
التزييفات العميقة تضيف سببًا آخر لفهم الصوت مباشرةً
الصوت الاصطناعي يصبح جزءًا مهمًا آخر من تلك الفرصة.
مع توافر استنساخ الصوت بشكل مقنع بشكل متزايد، تحتاج المؤسسات التي تتعامل مع المعاملات المالية أو المعلومات الحساسة إلى تحديد ليس فقط ما يقوله المتصل، بل ما إذا كان الصوت نفسه أصليًا.
وبالتالي وسعت Modulate نطاقها إلى اكتشاف التزييف العميق، حيث تجمع بين تحليل الصوت الاصطناعي والمعلومات السياقية الأوسع المتاحة عبر نماذجها الصوتية.
تقول الشركة إن تقنيتها تحلل حاليًا أكثر من 10 ملايين ساعة من الصوت شهريًا، وقد عالجت أكثر من 600 مليون ساعة إجمالًا.
يوضح توسعها إلى مجالات مثل اكتشاف الموسيقى التي يولدها الذكاء الاصطناعي أيضًا مدى إمكانية تطبيق بنية التجميع الأساسية على نطاق واسع. على سبيل المثال، يقوم نظام اكتشاف الموسيقى الخاص بـ Modulate بتقييم وجود الموسيقى، والغناء الذي يولده الذكاء الاصطناعي، والآلات الموسيقية التي يولدها الذكاء الاصطناعي بشكل منفصل قبل دمج الإشارات للحصول على نتيجة قابلة للتفسير.
التحدي التالي للذكاء الاصطناعي الصوتي هو الفهم، لا التحدث
توفر الاستثمارات بقيمة 25 مليون دولار لـ Modulate موارد إضافية لتوسيع أبحاثها وهندستها وأدوات المطورين وشراكاتها. وعلى نطاق أوسع، تعكس هذه الاستثمارات تحديًا متزايدًا للذكاء الاصطناعي الصوتي: فالتحدث بطبيعية هو نصف المحادثة فقط.
مع انتقال وكلاء الصوت إلى خدمات العملاء والرعاية الصحية والخدمات المالية ومجالات أخرى، سيتعين على الأنظمة فهم الإشارات التي غالبًا ما تغفل عنها النصوص، بما في ذلك الإحباط، والتردد، والتأكيد، والنبرة، وإمكانية وجود صوت اصطناعي.
يمكن أن يخلق ذلك طبقة ذكاء جديدة حول التفاعلات الصوتية، تساعد الأنظمة على اكتشاف الاحتيال، والتعرف على استياء العملاء، أو تحديد متى يسيء وكيل الذكاء الاصطناعي فهم أو معالجة المحادثة.
لكن هذه التقنية تثير أيضًا تساؤلات حول الخصوصية والدقة والتحيز. إن استنتاج العاطفة أو النية من الكلام أكثر ذاتية من نسخ الكلمات، خاصةً عبر لهجات ولغات وثقافات مختلفة.
مع تزايد قدرة الذكاء الاصطناعي على التحدث كإنسان، قد تكون الجبهة التالية هي تحديد مدى قدرة الآلات على الاستماع فعليًا — ومدى استخدام هذه القدرات بمسؤولية.












