مقابلات

ديلان فوكس، الرئيس التنفيذي ومؤسس AssemblyAI – سلسلة المقابلات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

ديلان فوكس هو الرئيس التنفيذي ومؤسس AssemblyAI، منصة تقوم تلقائيًا بتحويل الملفات الصوتية والفيديوية والتدفقات الصوتية الحية إلى نص باستخدام واجهات برمجة التطبيقات Speech-to-Text من AssemblyAI.

ما الذي جذبك في البداية إلى تعلم الآلة؟

بدأت بتعلم البرمجة وحضور اجتماعات Python في واشنطن العاصمة، حيث درست في الكلية. من خلال دورات الكلية، وجدت نفسي أتجه أكثر إلى مشاكل البرمجة من نوع الخوارزمية، والتي أدت بشكل طبيعي إلى تعلم الآلة واللغة الطبيعية.

قبل تأسيس AssemblyAI، كنت مهندس برمجيات كبير في Cisco، ماذا كنت تعمل عليه؟

في Cisco، كنت مهندس برمجيات كبير يركز على تعلم الآلة لمنتجاتهم التعاونية.

كيف عملت في Cisco ومشكلة الحصول على تقنية التعرف على الكلام启فتك لlaunch AssemblyAI؟

في بعض وظائفي السابقة، كان لدي فرصة للعمل على العديد من مشاريع الذكاء الاصطناعي، بما في ذلك مشاريع تتطلب التعرف على الكلام. لكن جميع الشركات التي تقدم التعرف على الكلام كخدمة كانت قديمة الطراز، صعبة الشراء منها، وتعمل على تقنيات الذكاء الاصطناعي القديمة.

随着 زيادة اهتمامي بأبحاث الذكاء الاصطناعي، لاحظت أن هناك الكثير من العمل يتم القيام به في مجال التعرف على الكلام وكيف تحسن الأبحاث بسرعة. لذلك كان مزيج من العوامل الذي أثارني التفكير في “ماذا لو قمت ببناء شركة واجهة برمجة التطبيقات على غرار Twilio باستخدام أحدث أبحاث الذكاء الاصطناعي التي كانت أكثر سهولة للمطورين للوصول إلى نماذج الذكاء الاصطناعي المتقدمة للتعرف على الكلام، مع تجربة مطور أفضل؟ “

من هناك نمت فكرة AssemblyAI.

ما هو أكبر تحدي وراء بناء تقنية التعرف على الكلام الدقيقة والموثوقة؟

التكلفة والموهبة هما أكبر التحديات لأي شركة لتackle بناء تقنية التعرف على الكلام الدقيقة والموثوقة.

البيانات مكلفة الحصول عليها، وغالبًا ما تحتاج إلى مئات الآلاف من الساعات لإنشاء نظام تعرف على الكلام قوي. بالإضافة إلى ذلك، تتطلب متطلبات الحوسبة巨ة لتدريب هذه النماذج، وتقديمها في الإنتاج مكلفة أيضًا، وتتطلب مواهب متخصصة لتحسينها وجعلها اقتصادية.

بناء هذه التقنيات يتطلب أيضًا مهارات متخصصة من الصعب العثور عليها. هذا هو السبب في أن العملاء يأتون إلينا للحصول على نماذج الذكاء الاصطناعي القوية التي نبحث عنها وندربها وننشرها داخل الشركة. يحصلون على وصول إلى سنوات من الأبحاث في نماذج الذكاء الاصطناعي المتقدمة للتعرف على الكلام واللغة الطبيعية، كل ذلك من خلال واجهة برمجة تطبيقات بسيطة.

خارج مجرد تحويل المحتوى الصوتي والفيديوي، تقدم AssemblyAI نماذج إضافية، هل يمكنك مناقشة ما هي هذه النماذج؟

مجموعة نماذج الذكاء الاصطناعي الخاصة بنا تمتد إلى ما هو أبعد من مجرد التحويل الفوري والتحويل غير الفوري. نسمي هذه النماذج الإضافية نماذج الذكاء الصوتي لأنها تساعد العملاء على تحليل وفهم بيانات الصوت بشكل أفضل.

نموذجنا للتلخيص يقدم تلخيصًا عامًا، بالإضافة إلى تلخيصات مدونة بالزمن التي تقوم تلقائيًا بتقسيم وتوليد تلخيص لكل “فصل” كما تتغير مواضيع المحادثة (مثل فصول يوتيوب).

نموذجنا لتحليل المشاعر يكتشف مشاعر كل جملة من الكلام المنطوق في الملفات الصوتية. يمكن وضع علامة على كل جملة في النص بدرجة إيجابية أو سلبية أو محايدة.

نموذجنا لتحديد الكيانات يعرف مجموعة واسعة من الكيانات التي يتم التحدث عنها في الملفات الصوتية، مثل أسماء الأشخاص أو الشركات، وعناوين البريد الإلكتروني، والتواريخ، والأماكن.

نموذجنا لتحديد الموضوع يضع علامات على المواضيع التي يتم التحدث عنها في الصوت والفيديو. تتبع علامات الموضوع المتوقعة تصنيف IAB الموحد، مما يجعلها مناسبة للاستهداف السياقي.

نموذجنا لمراقبة المحتوى يكتشف المحتوى الحساس في الملفات الصوتية والفيديوية — مثل خطاب الكراهية، والعنف، والقضايا الاجتماعية الحساسة، والكحول، والمخدرات، وغيرها.

ما هي أكبر الحالات الاستخدامية للشركات التي تستخدم AssemblyAI؟

تتوزع أكبر الحالات الاستخدامية للشركات التي تستخدم AssemblyAI على أربع فئات: الهاتف، والفيديو، والاجتماعات الافتراضية، والوسائط.

CallRail هو مثال رائع على عميل في مجال الهاتف، الذي يستخدم نماذج الذكاء الاصطناعي من AssemblyAI — النص الأصلي، والتسليط الضوئي التلقائي للنص، والتحديد والحذف التلقائي للمعلومات الشخصية — لتسليم حل ذكاء محادثة قوي لعملائه.

ببساطة، يمكن لـCallRail الآن أن يظهر تلقائيًا ويحدد المحتوى المهم في مكالمات الهاتف الخاصة بهم لعملائه على نطاق واسع — مثل الطلبات المحددة للعملاء، والأسئلة الشائعة، والكلمات الرئيسية والعبارات الشائعة.

نموذجنا للتحديد والحذف التلقائي للمعلومات الشخصية يساعدهم على الكشف تلقائيًا وإزالة البيانات الحساسة الموجودة في نصوص النص (مثل أرقام التأمين الاجتماعي، وأرقام بطاقات الائتمان، وعناوين المنازل، وغيرها).

فيديو الحالات الاستخدامية تتراوح من منصات بث الفيديو إلى محررين فيديو مثل Veed، الذين يستخدمون نماذج النص الأصلي من AssemblyAI لتبسيط عملية تحرير الفيديو للمستخدمين. يسمح Veed لمستخدميه بنسخ الفيديوهات وتحريرها مباشرة باستخدام التعليقات.

في الاجتماعات الافتراضية، شركات برمجيات تسجيل الاجتماعات مثل Fathom تستخدم AssemblyAI لبناء ميزات ذكية تساعد مستخدميها على نسخ وتسليط الضوء على اللحظات الرئيسية من مكالمات Zoom، مما يؤدي إلى تحسين مشاركة الاجتماعات وإزالة المهام المملة أثناء وبعد الاجتماعات (مثل كتابة الملاحظات).

في الوسائط، نرى منصات استضافة بودكاست على سبيل المثال، تستخدم نماذج مراقبة المحتوى وتحديد الموضوع من AssemblyAI حتى يتمكنوا من تقديم أدوات إعلانية أفضل لحالات أمان العلامة التجارية وتنويع المحتوى الذي يتم إنشاؤه بواسطة المستخدم مع الإعلانات الديناميكية.

AssemblyAI رفع مؤخرًا جولة تمويل سلسلة B بقيمة 30 مليون دولار. كيف سيزيد هذا من مهمة AssemblyAI؟

الprogress الذي يتم إحرازه في مجال الذكاء الاصطناعي مثير بشكل لا يصدق. هدفنا هو كشف هذا التقدم عن كل مطور وفريق منتج على الإنترنت — من خلال مجموعة بسيطة من واجهات برمجة التطبيقات. مع استمرارنا في البحث وتدريب نماذج الذكاء الاصطناعي المتقدمة لمهام التعرف على الكلام واللغة الطبيعية (مثل التعرف على الكلام، والتلخيص، وتمييز اللغة، وغيرها من المهام)، سنستمر في كشف هذه النماذج الذكاء الاصطناعي للمطورين والفرق المنتجة من خلال واجهات برمجة التطبيقات البسيطة — متاحة مجانًا.

AssemblyAI هو مكان يمكن للمطورين والفرق المنتجة أن يأتوا إليه للحصول على وصول سهل إلى النماذج المتقدمة من الذكاء الاصطناعي التي يحتاجونها لإنشاء منتجات وخدمات وشركات جديدة مثيرة.

خلال الستة أشهر الماضية، قمنا بتشغيل دعم التعرف على الكلام ل 15 لغة جديدة — بما في ذلك الإسبانية والألمانية والفرنسية والإيطالية والهندية واليابانية — وأصدرنا تحسينات كبيرة لنموذج التلخيص، ونموذج التعرف على الكلام في الوقت الفعلي، ونموذج مراقبة المحتوى، و تحديثات المنتج العديدة الأخرى.

لم نستخدم بعد سوى جزء صغير من أموال جولة التمويل السابقة، ولكن هذا التمويل الجديد سيعطينا القدرة على تسريع جهودنا بشكل جريء — دون المساس بمسارنا.

مع هذا التمويل الجديد، سنتمكن من تسريع خارطة طريق المنتج، وبناء بنية تحتية أفضل للذكاء الاصطناعي لتسريع محرك الأبحاث والاستدلال، وزيادة فريق أبحاث الذكاء الاصطناعي — والذي يتضمن اليوم باحثين من DeepMind، وGoogle Brain، وMeta AI، وBMW، وCisco.

هل هناك شيء آخر تود أن تشاركه حول AssemblyAI؟

مهمتنا هي جعل نماذج الذكاء الاصطناعي المتقدمة متاحة للمطورين والفرق المنتجة على نطاق كبير جدًا من خلال واجهة برمجة تطبيقات بسيطة.

شكرًا على المقابلة الرائعة، القراء الذين يرغبون في معرفة المزيد يجب أن يزوروا AssemblyAI.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.