مقابلات
مات هوكينج، المؤسس المشارك لشركة WellSaid Labs – سلسلة المقابلات

مات هوكينج هو المؤسس المشارك لشركة WellSaid Labs، وهي شركة رائدة في مجال التكنولوجيا الصوتية للمؤسسات. لديه أكثر من 15 عامًا من الخبرة في قيادة الفرق وتطوير حلول تكنولوجية على نطاق واسع.
خلفيتك تعتبر رواد أعمال بشكل جيد، كيف بدأت في مجال الذكاء الاصطناعي؟
أعتقد أنني دائمًا ما اعتبرت نفسي رواد أعمال. بدأت أول مشروع لي بعد التخرج، وبدوري في التصميم، وجدت نفسي أتجه نحو مساعدة الأشخاص في الأفكار الأولية. خلال مسيرتي المهنية، كنت محظوظًا بحيث عملت مع العديد من الشركات الناشئة التي حققت نجاحات كبيرة. خلال تلك التجارب، حظيت بفرصة للتعرف على العديد من المؤسسين المتميزين، مما ألهمني لمتابعة أفكاري الخاصة كمسسس. كان الذكاء الاصطناعي جديدًا بالنسبة لي عندما انضممت إلى AI2، ومع ذلك، قدمت لي تلك التجربة فرصة لتطبيق منظور المنتج والبدء في بعض الأبحاث الرائعة وتخيل كيف يمكن لهذه التقنيات الجديدة مساعدة الكثير من الناس في السنوات القادمة. هدفي منذ البداية كان تطوير أعمال حقيقية للناس الحقيقيين، وأعتقد أن الذكاء الاصطناعي يمكن أن يخلق فرصًا وفرصًا مثيرة في المستقبل إذا تم تطبيقه بفكر متعمد.
يمكنك أن تشاركنا قصة كيف تم إعداد فكرة WellSaid Labs عندما كنت رواد أعمال في معهد آلن للذكاء الاصطناعي؟
انضممت إلى معهد آلن للذكاء الاصطناعي (AI2) كرواد أعمال في عام 2018. يمكن القول إنها واحدة من أكثر الحاضنات ابتكارًا في العالم، حيث تضم ألمع الأعelm في مجال الذكاء الاصطناعي الذين يطبقون حلولًا من حافة ما هو ممكن اليوم إلى منتجات ملموسة تحل مشاكل حول العالم. خلفيتي في التصميم والتكنولوجيا غذت اهتمامي الطويل بالأعمال الإبداعية، ومع اندفاع الذكاء الاصطناعي الذي نشهده اليوم، أردت استكشاف طريقة لربط هذه الحقول. تم تقديمي إلى مايكل بيتروتشوك (المؤسس المشارك والCTO لشركة WellSaid Labs) أثناء تطوير تطبيق صحي تفاعلي يوجه المريض خلال سيناريوهات حساسة مختلفة. خلال عملية تطوير المحتوى للتجربة، عمل فريقي مع مواهب صوتية لتقديم آلاف السطور من الصوت للمساعدة في تجسيد الشخصية. عندما تعرضت لبعض الإنجازات التي حققها مايكل خلال بحثه، رأينا سريعًا قيمة كيف يمكن أن تحقق التكنولوجيا الصوتية المتطابقة مع البشر تحولًا ليس فقط في المنتج الذي كنت أعمل عليه ولكن أيضًا في تطبيقات وصناعات أخرى. كانت التكنولوجيا والأدوات قد عانت في مواكبة احتياجات المنتجين الذين يعتمدون على الصوت كوسيلة.
WellSaid Labs هي واحدة من الشركات القليلة التي توفر للمواهب الصوتية طريقًا ل进入 مجال الصوت الاصطناعي. لماذا كنت تعتقد أن دمج الأصوات الحقيقية في المنتج كان أمرًا مهمًا؟
إجابتنا لهذا السؤال ثنائية: أولًا، أردنا إنشاء حلول تكمّل قدرات المواهب الصوتية، مما يوسع فرص الصوت. ثانيًا، نسعى جاهدين لتحقيق أعلى مستوى من الجودة البشرية في منتجاتنا. مواهبنا الصوتية هم شركاؤنا المتعاونون على المدى الطويل ويتلقون تعويضًا و حصة إيرادات لكل بيانات الصوت وال내용 الذي يتم إنتاجه باستخدامها. كل موهبة صوتية نستأجرها لإنشاء صورة صوتية اصطناعية تشبه صوتها يتم دفعها بناءً على مقدار استخدام صوتها على منصتنا. نشجع المواهب على التعاون معنا؛ التعويض العادل لمساهمتهم مهم جدًا لنا.
لنقدم أعلى مستوى من منتجات الجودة البشرية في السوق، يجب أن نكون صارمين فيما يتعلق بمصدر بياناتنا. هذا الإجراء يعطينا المزيد من التحكم في الجودة، حيث نقوم بتدريب نماذج التعلم العميق لتنطق بالتساوي مع البشر وبالأسلوب المحدد سياقيًا. لا ننشئ فقط صوتًا يقرأ المدخلات المُقدمة. نماذجنا الصوتية تقدم مجموعة من أساليب الصوت التي تقوم بما هو مكتوب على الصفحة. سواء كان المستخدمون يخلقون صوتًا باستخدام صورة من مكتبتنا أو إنشاء صوت مخصص ل علامتهم التجارية، نستخدم بيانات صوت حقيقية لضمان عملية سلسة وسهلة الاستخدام. إذا كان العملاء بحاجة إلى تعديل وتحرير أصواتنا في مرحلة ما بعد الإنتاج، سيكون عملية غير مريحة وطويلة. أصواتنا تأخذ سياق المحتوى المكتوب وتقدم قراءة دقيقة سياقيًا.
نحن نقوم بتحديث منتجاتنا وأضافها باستمرار لضمان تمثيل أصوات عملائنا. في استوديو WellSaid Labs، يمكن للعملاء والشركات محاولة أصوات مختلفة بناءً على المنطقة والنمط والحالة، مما يسمح بإنتاج صوتي موحد أكثر سلاسة-personalized للمُنتج. بمجرد تسجيل التسجيل الأولي، يمكن للمستخدمين إشارة إلى كلمات معينة وتركيبات وتنطيق لضمان أن الصوت الاصطناعي يتكلم بشكل محدد لاحتياجاتهم.
WellSaid Labs تطرح نفسها كأول منصة صوت اصطناعي أخلاقية. لماذا تعتبر أخلاقيات الذكاء الاصطناعي مهمة بالنسبة لك؟
随着 زيادة اعتماد الذكاء الاصطناعي وانتشاره، تزداد مخاوف من حالات استخدام ضارة وشرير. الصوت الاصطناعي ليس استثناءً؛ تقريبًا كل يوم، يظهر تقرير جديد عن مشاهير أو شخصيات عامة أو سياسيين يتم تحويلهم للاعلانات أو الأغراض السياسية. على الرغم من أن التنظيم الفيدرالي الرسمي لهذه التكنولوجيا لا يزال قيد التطوير، فإن اكتشاف ومكافحة الجهات الفاعلة الضارة واستخدامات الصوت الاصطناعي ستصبح أكثر صعوبة مع تقدم التكنولوجيا.
قادمين من AI2، حيث أخلاقيات الذكاء الاصطناعي هي مبدأ أساسي، كان لدينا هذه المناقشات منذ اليوم الأول. إن تطوير تكنولوجيا الصوت الاصطناعي يأتي مع مسؤوليات كبيرة تتعلق بالموافقة والخصوصية والأمان بشكل عام. نعرف أننا، كمطورين، يجب أن نبني تكنولوجيتنا بأمان، ونعالج القضايا الأخلاقية، ونضع الأساس لتطوير الأصوات الاصطناعية في المستقبل. نعترف ب潜能 تكنولوجيا الصوت الاصطناعي للاستخدام الخاطئ ونتبنى مسؤوليتنا لتقليل إمكانية سوء استخدام منتجاتنا. يجب أن نبني هذا الأساس منذ اليوم الأول بدلاً من السير بسرعة وارتكاب الأخطاء على طول الطريق. هذا لن يكون صحيحًا لعملائنا و مواهبنا الصوتية الذين يعتمدون علينا لبناء منتج عالي الجودة وموثوق.
نحن ندعم تمامًا الدعوة إلى تشريعات في هذا المجال؛ ومع ذلك، لن ننتظر حتى يتم سن القوانين الفيدرالية. لقد أولينا الأولوية دائمًا لممارسات تدعم الخصوصية والأمان والشفافية والمساءلة.
نلتزم بشكل صارم بميثاق نوايانا الأخلاقي، الذي يعتمد على بناء الابتكار المسؤول في كل قرار نتخذه. هذا يصب في مصلحة عملائنا العالميين – العلامات التجارية للمؤسسات.
كيف يمكن تطوير منصة صوت اصطناعي أخلاقية؟
كانت WellSaid Labs ملتزمة بالابتكار الأخلاقي منذ البداية. نحن نركز على الثقة والشفافية من خلال استخدام نماذج البيانات الداخلية، ومتطلبات الموافقة الصريحة، وبرنامج تعديل المحتوى، والالتزام بحماية العلامة التجارية. في WellSaid، نعتمد على مبادئ الذكاء الاصطناعي المسؤول لتشكيل قراراتنا وتصميماتنا، وتلك المبادئ تمتد لاستخدام أصواتنا. رمز سلوكنا يمثل هذه المبادئ كالمساءلة، الشفافية، الخصوصية والأمان، والعدالة.
المساءلة: نحافظ على معايير صارمة للمحتوى المناسب، ونحظر استخدام أصواتنا للمحتوى الذي يضر أو يكره أو يخدع أو يهدف إلى التحريض على العنف. فريقنا لثقة وأمان يحافظ على هذه المعايير من خلال برنامج تعديل المحتوى القاسي، ويعطل ويزيل المستخدمين الذين يحاولون انتهاك شروط الخدمة.
الشفافية: نحن نطلب الموافقة الصريحة قبل بناء صوت اصطناعي باستخدام بيانات صوت شخص ما. المستخدمون لا يستطيعون تحميل بيانات صوت من سياسيين أو مشاهير أو أي شخص آخر لإنشاء نسخة من صوتهم إلا إذا كنا حصلنا على موافقته المكتوبة الصريحة.
الخصوصية والأمان: نحن نحمي هويات مواهبنا الصوتية باستخدام صور مخزنة وأسماء مستعارة لتمثيل الأصوات الاصطناعية. نحن نشجعهم أيضًا على توخي الحذر حول كيفية مشاركة علاقتهم مع WellSaid Labs أو شركات الصوت الاصطناعي الأخرى لتقليل فرصة سوء استخدام صوتهم.
العدالة: نحن ندفع لمواهبنا الصوتية الذين يقدمون بيانات صوتية لمنصتنا، ونقدم لهم حصة إيرادات مستمرة لاستخدام الصوت الاصطناعي الذي نبنيه باستخدام بياناتهم.
بالإضافة إلى هذه المبادئ، نحن نحترم أيضًا حقوق الملكية الفكرية بشكل صارم. لا نطالب بالملكية على المحتوى الذي يقدمه مستخدمونا أو مواهبنا الصوتية. أولوياتنا هي النزاهة والعدالة والشفافية في كل ما نقوم به، مما يضمن أن تكنولوجيا الصوت الاصطناعي تستخدم بشكل مسؤول وأخلاقي. نحن نبحث عن الشراكات مع أصوات من خلفيات وخبرات متنوعة لضمان تقديم صوت للجميع.
التزامنا بالابتكار المسؤول وتطوير تكنولوجيا الصوت الاصطناعي مع الأخذ في الاعتبار الأخلاقيات يُميّزنا عن الآخرين في هذا المجال الذين يسعون للاستفادة من صناعة غير منظمة من خلال أي وسيلة. استثماراتنا المبكرة في الأخلاقيات والسلامة والخصوصية تضع الأساس للثقة والولاء في مواهبنا الصوتية وعملائنا، الذين يبحثون بشكل متزايد عن منتجات وخدمات أخلاقية من الشركات في طليعة الابتكار.
WellSaid Labs أنشأت نموذجها الصوتي الداخلي الخاص الذي مكّن أصواتها الاصطناعية من تحقيق التماثل البشري، وقد حقق ذلك من خلال إحضار العيوب التي يمتلكها البشر إلى المحادثات. ما هو الشيء الذي يجعل هذه العيوب تجعل الذكاء الاصطناعي أفضل، وكيف يتم تنفيذ هذه العيوب؟
WellSaid Labs ليست مجرد مولد صوتي آخر. حيث كانت التكنولوجيا الصوتية المبكرة غير قادرة على التعرف على جودة الصوت البشري مثل النبرة واللهجة التي تنقل السياق والانفعال خلف الكلمات، فإن أصوات WellSaid قد حققت التماثل البشري، مما يجلب عيوبًا فريدة من البشر إلى الكلام الاصطناعي.
معيارنا الرئيسي لجودة الصوت هو والذي كان دائمًا الطبيعة البشرية. هذا المعتقد التوجيهي قد شكل تكنولوجيتنا في كل مرحلة، من مكتبات النصوص التي بنيناها إلى التعليمات التي ننقلها للمواهب، وأخيرًا كيف نكرر على خوارزميات التكنولوجيا الصوتية الأساسية. نحن نتدرب على التعبيرات الصوتية البشرية الحقيقية. مواهبنا الصوتية تقرأ نصوصها بشكل حقيقي ومشوق عندما يسجلون لنا. الكمال الصوتي، من ناحية أخرى، هو مفهوم ميكانيكي يؤدي إلى مخرجات غير طبيعية و机械ية. عندما يؤدي مواهبنا الصوتية المهنية، تتغير معدلات كلامهم. يزداد صخبهم في تناغم مع المحتوى الذي يقرأونه. قد يرتفع صوتهم في مقطع يتطلب قراءة مثيرة، وينخفض مرة أخرى في سطر أكثر جديّة. هذه التباينات الديناميكية تشكل أداءً صوتيًا بشريًا مثيرًا.
من خلال بناء عمليات الذكاء الاصطناعي التي تعمل بالتنسيق مع الأداء الديناميكي لمواهبنا الصوتية، بنينا منصة تكنولوجيا صوتية حقيقية. لقد طوّرنا أول نظام صوتي طويل المدى مع عناصر تحكم توقعية في جميع مراحل العملية الإبداعية. مكتبتنا الصوتية تحتوي على مجموعة متنوعة من بيانات الصوت، مما يسمح للمستخدمين بدمج إشارات صوتية محددة، مثل إرشادات النطق أو القدرة على التحكم، في النموذج خلال مرحلة الإنتاج. في منصة واحدة، يمكن لمستخدمي WellSaid تسجيل وتحرير وتخصيص الصوت بدون الحاجة إلى استيراد بيانات خارجية.
يمكنك أن تناقش بعض التحديات التي واجهتها في بناء شركة صوتية اصطناعية؟
تطوير تكنولوجيا الصوت الاصطناعي قد خلق مجموعة جديدة من العقبات لكل من منتجيها ومستخدميها. واحدة من التحديات الرئيسية هي عدم الانجرار في الضوضاء والهياج الذي يغمر قطاع الذكاء الاصطناعي. كما تكنولوجيا جديدة ومثيرة، العديد من المنظمات تحاول الاستفادة من تطورات الصوت الاصطناعي على المدى القصير. نحن نريد تقديم صوت للجميع، مدفوعين بمبادئ أخلاقية مركزية وصدق. هذا الالتزام بالصدق يمكن أن يؤخر تطوير وتطوير تكنولوجياتنا، ولكنه يعزز سلامة وأمان أصوات WellSaid وبياناتها.
تحدي آخر في تطوير منصتنا الصوتية كان وضع إرشادات موافقة محددة لضمان أن المنظمات أو الممثلون الفرديون لن يسيئوا استخدام تكنولوجيتنا. لمواجهة هذا التحدي، نبحث عن شراكات طويلة الأمد ونتفاعل بشكل كامل مع تطوير الصوت لزيادة المساءلة والشفافية وأمان المستخدم. نحن نبحث عن شراكات مع مواهب صوتية من خلفيات وخبرات متنوعة لضمان أن مكتبة WellSaid Labs من الأصوات تعكس منشئيها وجماهيرها. هذه العمليات مصممة لتكون متعمدة ومتعمقة لضمان استخدام تكنولوجيتنا بأمان وبالتأكيد بأخلاقيات.
ما هو رؤيتك لمستقبل الأصوات الاصطناعية التوليدية؟
لمدة طويلة، لم تصل تكنولوجيا الصوت الاصطناعي إلى جودة كافية لتمكين الشركات من إنشاء محتوى ذو معنى على نطاق واسع. الآن، مع عدم الحاجة إلى معدات باهظة التكلفة وأجهزة قديمة، يمكن إنتاج ونشر كل المحتوى المكتوب في صيغة صوتية لإنشاء تجارب تفاعلية متعددة الوسائط.
اليوم، يمكن للأصوات الاصطناعية إنتاج صوت بشري وتصوير النعومة المطلوبة لجعل القصص الرقمية أكثر سهولة وطبيعية. مستقبل الأصوات الاصطناعية التوليدية سيكون تجارب صوتية شاملة تلمس كل جانب من جوانب حياتنا. مع استمرار تقدم التكنولوجيا، سنرى أصواتًا اصطناعية أكثر طبيعية وتعبريًا تختفي الحدود بين الصوت البشري والآلي – مما يفتح أبوابًا جديدة للأعمال والاتصالات والوصول وطريقة تفاعلنا مع العالم من حولنا.
ستجد الشركات تحسينات في تخصيص واجهات الصوت الاصطناعي وستستخدمها لجعل التفاعلات مع المساعدين الافتراضيين أكثر غمرة وسهولة في الاستخدام. هذه التحسينات تحدث بالفعل، من وكلاء مركز الاتصال الذكي إلى محطات الطعام السريع. ستشهد صناعة إنشاء المحتوى، بما في ذلك الإعلان وتسويق المنتج والقصص الصحفية والبودكاست والكتب الصوتية والمultimedia الأخرى، زيادة في الكفاءة باستخدام أدوات لتطوير محتوى جذاب – مما يزيد في النهاية من الرفع والإيرادات للمنظمات، خاصة الآن مع نماذج متعددة اللغات يمكنها توسيع نطاق شركة من نقطة واحدة إلى وجود عالمي. ستجد فرق الإنتاج فوائد كبيرة في الأصوات الاصطناعية لإنشاء أصوات مخصصة لاحتياجات العلامة التجارية أو مخصصة للمستمع.
قبل إدخال الذكاء الاصطناعي، كانت تكنولوجيا الصوت الاصطناعي تفتقر إلى القدرة الحاسمة على العاطفة والتنغيم والنطق المطلوبة لرواية قصة كاملة بسهولة وبتصميم جيد. الآن، تقدم تكنولوجيا الصوت الاصطناعي القائمة على الذكاء الاصطناعي تجارب أكثر غمرة وسهولة الوصول، بما في ذلك القدرات الصوتية الحقيقية وتكنولوجيا المحادثات التفاعلية.
تحقيق القدرات الصوتية البشرية المماثلة كان رحلة، ولكن الآن بعد أن أصبح ذلك ممكنًا، نشهد نطاقًا كاملاً للصوت الاصطناعي لإنشاء قيمة أعمال حقيقية للمنظمات.
شكرًا على المقابلة الرائعة، القراء الذين يرغبون في معرفة المزيد يجب أن يزوروا WellSaid Labs.












