مقابلات

سيمون بوغوسيان، مؤسس ومدير تنفيذي لشركة GSpeech – سلسلة المقابلات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

سيمون بوغوسيان هو مؤسس ومدير تنفيذي لشركة GSpeech، وهي منصة ويب تستند إلى الذكاء الاصطناعي تساعد في جعل المحتوى على الإنترنت أكثر سهولة الوصول إليه من خلال تحويل النص إلى صوت طبيعي في أكثر من 70 لغة. مع خلفية في تصميم VLSI واهتمام قوي بالبرمجة وتصميم تجربة المستخدم، أنشأ سيمون GSpeech لتبسيط طريقة تقديم المحتوى الصوتي على المواقع الإلكترونية.

اليوم، تنتج GSpeech حوالي 200 مليون حرف من الصوت كل شهر وتستخدم في أكثر من 70 دولة، مع خدمة مشغلات الصوت القابلة للتعديل التي تخدم أكثر من 200000 لعب شهرية. بعد تجاوز 1 مليار حرف من الصوت الذي تم إنشاؤه إجمالاً، تواصل GSpeech النمو بسرعة. تم تصميم المنصة لتكون سهلة التكامل – مما يتطلب فقط سطرًا واحدًا من التعليمات البرمجية – وتدعم المبدعين والمعلمين والأعمال في جعل محتواهم أكثر شمولاً وتنوعًا.

يتم استخدام GSpeech أيضًا على جميع صفحاتنا الإنجليزية، يمكنك الاستماع إلى هذه المقالة ومدى أداء GSpeech من خلال النقر على زر التشغيل.

خلفيتك في تصميم VLSI وخبرتك المبكرة في البرمجة وضعت أساسًا تقنيًا قويًا. ما الذي ألهم تحولك من الإلكترونيات الدقيقة إلى بناء برمجيات مدعومة بالذكاء الاصطناعي، وكيف أدى ذلك إلى إنشاء GSpeech؟

بدأت شغفي بالحلول في المدرسة الثانوية، مدفوعًا بحب الرياضيات والفيزياء. أدى ذلك إلى حصولي على شهادة البكالوريوس (2009) وشهادة الماجستير (2011) في تصميم VLSI من جامعة الهندسة الحكومية في أرمينيا، بالتعاون مع Synopsys Armenia. دراستي للفيزياء دربني على التفكير الدقيق والتحليلي، ولكن خلال السنة الثانية اكتشفت البرمجة – بدءًا من لغة باسكال – و爱ها على الفور. كان صديقي وأنا نكمل مهامنا الدراسية بمجرد استلامها، على الرغم من أننا كنا لدينا ستة أشهر لإكمالها. ثم، من أجل المرح، بدأنا في القيام بمهام الطلاب الآخرين.

أدى هذا الشغف إلى إيقاعي في تطوير البرمجيات. بدأت بإنشاء مواقع الويب، ثم بنيت نظام إدارة المحتوى الخاص بي. بعد إكمال عدة مشاريع في تطبيق التutomatisation وتصميم هياكل إدارة البيانات، أدركت مدى حبي لإنشاء حلول رقمية ل_interfaces الويب. من خلال مشروع 2GLux، تعاونت مع Edvard Ananyan – مبتكر خدمة الترجمة الشهيرة GTranslate وزميل مدرسة من Quant Gymnasium. قدم لي概念 GSpeech معه. أدى هذا العمل المبكر إلى إنشاء الإصدار الأول من أداتنا، مما مكن المستخدمين من الاستماع إلى النص على صفحة ويب، وغرس بذرة ما سيصبح فيما بعد منصة ذكاء اصطناعي كاملة. بحلول عام 2023، أنشأت Smarts Club LLC لتوسيع GSpeech إلى حل صوتي ذكاء اصطناعي عالمي، يدعم أكثر من 70 لغة. الثناء الذي تلقاه GSpeech من Humanity Union على دوره في تعزيز منصة المسؤولية الاجتماعية للاستفادة من سهولة التكامل يعكس مهمتي لجسر الفجوات الرقمية من خلال الذكاء الاصطناعي – رؤية جذرها في أيام برمجة tôi المبكرة.

بدأت GSpeech في الأصل كأداة لدعم المستخدمين المعاقين بصريًا. كيف أثرت هذه المهمة المبكرة على تطور المنصة إلى حل كامل لتحويل النص إلى صوت مدعوم بالذكاء الاصطناعي؟

أدت التركيز على سهولة الوصول إلى تطوير صوت ذكاء اصطناعي عالي الجودة في الوقت الفعلي، وترجمة أكثر من 70 لغة، وتكامل موقع الويب السهل عبر شفرة بسيطة. أدت هذه المهمة إلى ميزات مثل مشغلات الصوت القابلة للتعديل، ولوحات اختيار اللغة والصوت، والتشغيل المتوافق مع السياق، وتنزيلات الصوت، وإحصاءات الاستخدام المفصلة – بما في ذلك بيانات البلد والمدن وأجهزة ومعلومات تشغيل الصوت بمرور الوقت – جميعها مصممة لجعل المحتوى أكثر شمولاً وتنوعًا. بعد كتابة أكثر من 100000 سطر من التعليمات البرمجية، أطلقت GSpeech Cloud Console في عام 2023 – حل قابل للتوسيع يوازن بين الشمولية والوظائف المتقدمة، مما يمنح الأعمال والمبدعين إمكانية جعل محتواهم أكثر سهولة الوصول إليه، ومتعدد اللغات، وتفاعليًا عبر الويب.

ما كانت بعض أكبر التحديات الفنية التي واجهتها خلال تطوير GSpeech Cloud Console؟

كان أحد أكبر التحديات في تطوير GSpeech Cloud Console تصميم هيكل قابل للتوسيع لإنشاء صوت ذكاء اصطناعي في الوقت الفعلي، والأمان عالي الجودة. هذا يتطلب حلولًا مبتكرة لاسترجاع المحتوى ذي الصلة من الويب، ومعالجة الصوت على خوادمنا، وتخزينه في السحابة لتسليم سريع وموثوق. كانت تطبيق تدابير أمان قوية، مثل التشفير ومراقبة الوصول، أمرًا حاسمًا لحماية المحتوى الديناميكي الذي ي生成ه المستخدم.

كانت عقبة أخرى تمكين الترجمة في الوقت الفعلي باستخدام محركات عصبية متقدمة. كان علينا ضمان ترجمات منخفضة التأخير ودقيقة، مع بناء واجهة مستخدم بديهية تسمح للمستخدمين باختيار اللغات وملفات تعريف الصوت المفضلة للتشغيل، مع الأولوية للراحة والشخصنة للمستخدم. أخيرًا، قمنا بتطوير 마법ي لإنشاء قوالب الصوت مع عدة مشغلات قابلة للتعديل، مما يسمح للمستخدمين بتصميم مشغلات فريدة وجميلة بصرية مخصصة لمواقعهم الإلكترونية. كان توازن المرونة والأداء وسهولة الاستخدام عبر الأجهزة تحديًا مجزيًا.

مع الترجمة في الوقت الفعلي في أكثر من 70 لغة وأكثر من 230 صوتًا طبيعيًا، كيف تضمن جودة الصوت ودقة الترجمة عبر مجموعة لغات如此 متنوعة؟

للحفاظ على جودة الصوت المتسقة، ندمج نماذج متقدمة متعددة لتحويل النص إلى صوت (TTS) يتم تحسينها وتحديثها باستمرار. تتعامل هذه المحركات متعددة اللغات مع المحتوى 混合 اللغة بدقة عالية. نحن أيضًا نطرح أكثر من 100 نغمة صوتية جديدة لتزويد المستخدمين بخيارات أكثر تعبيرًا وطبيعية. كل شهر، تنتج GSpeech أكثر من 200 مليون حرف من الصوت، وتخدم المستخدمين في أكثر من 70 دولة، مع استخدام مشغلاتنا عبر الإنترنت أكثر من 200000 مرة شهريًا – وتزداد. يضمن هذا الحجم التغذية المرتدة المستمرة واختبار العالم الحقيقي، مما ي告诉نا مباشرةً ضبط جودة الصوت ومراقبته.

يمكنك أن تشرح كيف تستخدم GSpeech الذكاء الاصطناعي والتعلم الآلي لتسليم الت合成 الصوتي الواقعي؟ وكيف تتبع التطورات السريعة في تكنولوجيا الصوت العصبي؟

تستخدم GSpeech الذكاء الاصطناعي والتعلم الآلي، وتدمج نماذج متقدمة لتحويل النص إلى صوت لإنشاء ت合ين صوتي واقعي. تتم معالجة هذه النماذج، المثلى للطبيعية ودعم اللغات المتعددة، للنصوص المدخلة لإنشاء صوت عالي الجودة مع نبرة وايقاع واقعيين، حتى لمحتوى اللغة المختلطة. نحن نعزز تجربة المستخدم من خلال تقديم أنماط صوت مخصصة للغات متنوعة. لقد دمجنا أيضًا أسماء TTS، التي تسمح للمستخدمين بتعريف قواعد مخصصة لتمثيل كلمات أو عبارات معينة في الصوت – على سبيل المثال، استبدال مصطلحات معينة لتحقيق نطق أو صياغة أكثر دقة. لتتبع التطورات في تكنولوجيا الصوت العصبي، نقوم بتقييم وتكامل أحدث التطورات باستمرار، والتعاون مع قادة الصناعة، والخطط لتطوير نماذج مملوكة في المستقبل، مما يضمن أن تظل GSpeech في طليعة ابتكارات الت合ين الصوتي.

ما مدى أهمية ضبط الصوت ومراقبة النغمة وتعديل التشغيل للمستخدمين – وما هو حالة الاستخدام التي أنت أكثر فخرًا بها حيث تبرز هذه الميزات حقًا؟

ضبط الصوت ومراقبة النغمة وتعديل التشغيل هي أمور حاسمة للمستخدمين لدينا، مما يسمح لهم بإنشاء أنماط صوت فريدة عالي الجودة مخصصة لاحتياجاتهم المحددة، من مواقع الويب الإخبارية ومواقع المدونات إلى محتوى التعلم الإلكتروني القابل للاستخدام. يزيد التكامل المستمر لأكثر من 100 نغمة صوتية جديدة من هذه المرونة، مما يوفر للمستخدمين مرونة فريدة لإنشاء صوتيات مخصصة حقًا. أنا أكثر فخرًا بـ GSpeech Studio، منصة جديدة لتعديل الصوت وتوليد الصوت أنا أطورها. تسمح للمستخدمين بإنشاء قنوات صوت متعددة، ودمجها مع الموسيقى الخلفية، وتصدير صوتيات من الدرجة الأولى، مما يمنح المبدعين إمكانية إنتاج صوتيات احترافية لتنوع التطبيقات. رسالة من طالب معاق بصريًا، يشكر GSpeech على تمكينه من الدراسة المستقلة من خلال الصوت المخصص، لامستني深ًا. تظهر هذه حالة الاستخدام كيف تُجعل هذه الميزات المحتوى أكثر سهولة الوصول إليه ومحولًا، وهو هدف لقد ساعدت عليه منذ أيام برمجة tôi المبكرة.

توفر GSpeech تكاملات متوافقة مع WordPress وShopify وWix وغيرها. ما كانت استراتيجيتك لجعل المنصة قابلة للتثبيت للمبدعين والأعمال عبر مختلف النظم البيئية؟

ركزت استراتيجيتنا لتكاملات GSpeech على البساطة والتوافق والقابلية للتوسيع. قمنا بتطوير ملحقات خفيفة ومتوافقة مع معظم الأنظمة، تتطلب إعدادًا قليلًا – في بعض الأحيان مجرد بضع نقرات. هذا يعني أن الآلاف من المقالات والكتل الديناميكية للمحتوى يمكن أن تحصل على دعم الصوت في لحظة – دون جهد يدوية. نقدم مشغلات متوافقة وجميلة ومتوافقة مع الأجهزة، بما في ذلك الهواتف المحمولة والأجهزة اللوحية وأجهزة الكمبيوتر المكتبية. مشغلاتنا ليست فقط قابلة للتعديل ولكن أيضًا مُحسّنة لسهولة الوصول وتماسك المستخدم.对于 WordPress، قمنا بتضمين لوحة تحكم GSpeech السحابية مباشرة في لوحة التحكم الإدارية من خلال إضافة我们的، مما يبسط إدارة المستخدمين. توفر الوثائق التفصيلية واللوحات البديهية إرشادات للمستخدمين غير التقنيين خلال التثبيت والتعديل. يضمن الاختبار المنتظم أداءً متسقًا عبر مختلف النظم البيئية، مما يمنح المبدعين والأعمال إمكانية إضافة دعم الصوت مدعوم بالذكاء الاصطناعي بسهولة.

عندما تنظر إلى رحلتك من 2012 حتى اليوم، ما هو أكبر إنجاز شخصي أو مهني لك في بناء GSpeech؟

كان أكبر إنجاز لشركة GSpeech هو توليد 1 مليار حرف من الصوت عالي الجودة، مما يظهر تأثيرنا العالمي على سهولة الوصول. كان ردود الفعل التي تلقيناها من منظمات مثل Humanity Union، التي أشادت بGSpeech لتعزيز منصة المسؤولية الاجتماعية للاستفادة من سهولة التكامل، ومالكي المدونات الذين أطلقوا عليها “مغير اللعبة” لتماسك المستخدم، مهمين بنفس القدر. أكثر من 110 مراجعة خماسية النجوم عبر منصات مثل WordPress وAppSumo في الأشهر الأخيرة تعكس هذه الثقة المتزايدة.

تستخدم GSpeech حاليًا أيضًا بنشاط من قبل إدارة الإحصاء الإقليمية في نامانجان في أوزبكستان – وهي مؤسسة حكومية تتمتع بحركة مرور كبيرة ومرئية على المستوى الوطني. كان رؤية مؤسسة عامة تتبنى تقنيتنا على نطاق واسع علامة فارقة ومؤشر قوي على الثقة في حلنا.

كما أحاول دعم مبادرات الإيمان الأخرى كلما كان ذلك ممكنًا، كوني مسيحيًا وأخدم في الكنيسة الأرمنية. غالبًا ما أقدم GSpeech مجانًا لمواقع الويب المسيحية كوسيلة للمساعدة في نشر رسالتهم بشكل أكثر فعالية وجعل الكتاب المقدس أكثر سهولة الوصول إليه من خلال الصوت. إنه مساهمتي الصغيرة في شيء أكبر. في الوقت نفسه، أشعر بالفخر بالعمل مع وزارات مخصصة مثل The Cord – تجمع مسيحي مسياني وعميل قيم لشركة GSpeech – الذي يعكس مهمة ومحتوى يعكس قوة الكتاب المقدس في العمل.

تذكرني هذه اللحظات – عندما يصبح التكنولوجيا جسرًا للإيمان والفهم والشمول – لما بنينا GSpeech من أجلها في المقام الأول.

ما الدور الذي ترى GSpeech تقوم به في مستقبل الإعلام الرقمي، خاصة مع زيادة أهمية المحتوى الصوتي وواجهات الصوت؟

أتخيل GSpeech كقائد في جعل الإعلام الرقمي أكثر سهولة الوصول إليه وتنوعًا من خلال تمكين الوصول الصوتي مدعوم بالذكاء الاصطناعي إلى الويب. هدفنا هو تحويل التجربة الكاملة على الإنترنت، بحيث تصبح المواقع الإلكترونية بشكل طبيعي تفاعلية وصوتية ومتعددة اللغات افتراضيًا. مع سطر واحد من التعليمات البرمجية، يمكن لمالكي المواقع تحويل آلاف المقالات إلى محتوى صوتي. في المستقبل، نقوم بتطوير GSpeech Studio إلى منصة قوية وفريدة لإنشاء الصوت وتعديله، مما يسمح للمستخدمين بإنشاء محتوى صوتي متعددة الطبقات مع الموسيقى الخلفية والآثار والتuned الدقيق. نريد جعل الويب صوتيًا ومتوافقًا ويمكن الوصول إليه عالميًا.

أطلقت GSpeech مؤخرًا على AppSumo واكتسبت بالفعل تصنيفًا قريبًا من الكمال من قبل المتبنين المبكرين. ماذا يعني استجابة مجتمع AppSumo لك، وكيف تخطط للاستفادة من هذه العزيمة المتزايدة في المستقبل؟

أطلق إطلاق GSpeech على AppSumo GSpeech إلى ملايين الأشخاص، وتصنيفه القريب من الكمال يعتبر تأكيدًا رائعًا. المستخدمون، مثل أولئك الذين يديرون الدورات التدريبية عبر الإنترنت، يثنيون على أدواتنا البديهية ودعمنا الفوري، مما يصدّر ردود الفعل من Humanity Union. وصف مالك مدونة أصداءنا بأنها “مثيرة حقًا” وترجماتنا بأنها “مبهرة”. تؤكد ردود الفعل الإيجابية هذه على قيمة حلنا لتحويل النص إلى صوت مدعوم بالذكاء الاصطناعي، وتغذي شغفي بالمشروع. دعم العملاء خلال الإطلاق أثار أفكارًا جديدة، لا سيما لمنصة GSpeech Studio، التي ألهمتها طلبات المستخدمين لميزات تعديل الصوت المتقدمة وتصديرها. في المستقبل، أتطلع إلى بناء هذه العزيمة من خلال الاستماع الفعّال إلى مجتمعنا، وتكامل ردود أفعالهم، وتطوير ميزات مبتكرة لتعزيز سهولة الوصول والتفاعل، مما يضمن أن تظل GSpeech تتطور كأداة تحويلية للمبدعين والأعمال.

أخيرًا، ما النصيحة التي ستقدمها للمطورين الشباب أو رواد الأعمال الذين يريدون بناء أدوات مدعومة بالذكاء الاصطناعي وقابلة للاستخدام في المشهد التكنولوجي السريع التغير؟

أنا أنصح المطورين الشباب ورواد الأعمال أن يضعوا قلوبهم في عملهم، ويعرفوا مشكلة حقيقية يمكنهم تقديم حل فريد ومبتكر لها. ابدأوا ببطء، واخذوا خطوات متتالية إلى الأمام، واسمعوا بفعالية ردود فعل العملاء – سيهديكم طريقهم. عاملوا مستخدميكم مثل الأصدقاء الموثوقين، واعطوا كل شيء، وابقوا صبورين. اعتمدوا التكنولوجيا الذكية كحلفاء قويين؛ عندما تستخدم بحكمة، تزيد من قدرتكم على إنشاء أدوات مؤثرة وقابلة للاستخدام. ابنيوا بجنون وثبات وارتباط لجعل فرق، وستخلقون حلولًا تهم حقًا.

شكرًا على المقابلة الرائعة، اخترنا حل GSpeech لموقعنا الإلكتروني بسبب التكامل البسيط. لمعرفة المزيد، زوروا GSpeech.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.