Phỏng vấn
Amr Nour-Eldin, Phó Chủ tịch Công nghệ tại LXT – Loạt Phỏng vấn

Amr Nour-Eldin là Phó Chủ tịch Công nghệ tại LXT. Amr là một nhà khoa học nghiên cứu tiến sĩ với hơn 16 năm kinh nghiệm chuyên môn trong lĩnh vực xử lý giọng nói và âm thanh cũng như học máy trong bối cảnh Nhận dạng Giọng nói Tự động (ASR), với sự tập trung và kinh nghiệm thực tế trong những năm gần đây về các kỹ thuật học sâu cho nhận dạng giọng nói đầu cuối.
LXT là một công ty dẫn đầu trong lĩnh vực đào tạo dữ liệu AI để cung cấp công nghệ thông minh cho các tổ chức toàn cầu. Thông qua mạng lưới cộng tác viên quốc tế, LXT thu thập và chú thích dữ liệu trên nhiều phương thức với tốc độ, quy mô và sự linh hoạt mà các doanh nghiệp yêu cầu. Chuyên môn toàn cầu của họ bao gồm hơn 145 quốc gia và hơn 1000 vị trí ngôn ngữ.
Bạn đã theo đuổi bằng tiến sĩ về Xử lý Tín hiệu tại Đại học McGill, điều gì ban đầu thu hút bạn vào lĩnh vực này?
Tôi luôn muốn học kỹ thuật, và thực sự thích khoa học tự nhiên nói chung, nhưng lại bị thu hút nhiều hơn vào toán học và vật lý. Tôi luôn cố gắng tìm hiểu cách thức hoạt động của tự nhiên và cách áp dụng sự hiểu biết đó để tạo ra công nghệ. Sau khi tốt nghiệp trung học, tôi đã có cơ hội theo học y học và các ngành nghề khác, nhưng tôi đã chọn kỹ thuật vì nó đại diện cho sự kết hợp hoàn hảo giữa lý thuyết và ứng dụng trong hai lĩnh vực gần gũi nhất với trái tim tôi: toán học và vật lý. Và khi tôi đã chọn nó, có nhiều con đường có thể đi – cơ khí, dân sự, v.v. Nhưng tôi đã chọn kỹ thuật điện vì nó gần gũi nhất và khó khăn nhất trong quan điểm của tôi với các vấn đề toán học và vật lý mà tôi luôn thấy thách thức và do đó, tôi thích hơn, cũng như là nền tảng của công nghệ hiện đại đã thúc đẩy tôi.
Trong kỹ thuật điện, có nhiều chuyên ngành để lựa chọn, thường rơi vào hai loại chính: viễn thông và xử lý tín hiệu, và loại liên quan đến điện và kỹ thuật điện. Khi đến lúc phải chọn giữa hai lựa chọn đó, tôi đã chọn viễn thông và xử lý tín hiệu vì nó gần gũi hơn với cách chúng ta mô tả tự nhiên thông qua vật lý và phương trình. Bạn đang nói về tín hiệu, dù đó là âm thanh, hình ảnh hay video; hiểu cách chúng ta giao tiếp và những gì các giác quan của chúng ta nhận thức, và cách đại diện toán học cho thông tin đó theo cách cho phép chúng ta tận dụng kiến thức đó để tạo ra và cải tiến công nghệ.
Có thể bạn thảo luận về nghiên cứu của mình tại Đại học McGill về khía cạnh lý thuyết thông tin của kỹ thuật mở rộng băng tần (BWE) nhân tạo?
Sau khi tôi hoàn thành bằng cấp của mình, tôi muốn tiếp tục theo đuổi lĩnh vực Xử lý Tín hiệu một cách học thuật. Sau một năm học về Quang học như một phần của bằng Thạc sĩ về Vật lý, tôi quyết định quay lại kỹ thuật để theo đuổi bằng Thạc sĩ về Xử lý Tín hiệu Âm thanh và Giọng nói, tập trung vào nhận dạng giọng nói. Khi đến lúc làm luận án tiến sĩ, tôi muốn mở rộng lĩnh vực của mình một chút vào xử lý âm thanh và giọng nói nói chung cũng như các lĩnh vực liên quan đến Học máy và Lý thuyết Thông tin, thay vì chỉ tập trung vào ứng dụng nhận dạng giọng nói.
Nghiên cứu của tôi tập trung vào việc mở rộng băng tần của giọng nói hẹp băng. Giọng nói hẹp băng đề cập đến giọng nói điện thoại thông thường. Nội dung tần số của giọng nói mở rộng đến khoảng 20 kilohertz, nhưng phần lớn nội dung thông tin tập trung vào tần số lên đến 4 kilohertz. Mở rộng băng tần đề cập đến việc mở rộng nội dung giọng nói từ 3,4 kilohertz, đó là giới hạn tần số trên trong điện thoại thông thường, lên trên đó, lên đến tám kilohertz hoặc hơn. Để tái tạo nội dung tần số cao bị thiếu một cách tốt hơn, chỉ dựa trên nội dung hẹp băng có sẵn, trước tiên phải định lượng thông tin tương hỗ giữa nội dung giọng nói trong hai băng tần, sau đó sử dụng thông tin đó để đào tạo một mô hình học được thông tin chia sẻ; một mô hình mà, một khi được đào tạo, có thể được sử dụng để tạo ra nội dung băng tần cao cho chỉ giọng nói hẹp băng và những gì mô hình đã học về mối quan hệ giữa giọng nói hẹp băng có sẵn và nội dung băng tần cao bị thiếu. Định lượng và đại diện cho thông tin “tương hỗ” đó là nơi lý thuyết thông tin tham gia. Lý thuyết thông tin là nghiên cứu về việc định lượng và đại diện cho thông tin trong bất kỳ tín hiệu nào. Do đó, nghiên cứu của tôi là về việc kết hợp lý thuyết thông tin để cải thiện mở rộng băng tần nhân tạo của giọng nói. Như vậy, luận án tiến sĩ của tôi là một hoạt động nghiên cứu liên ngành nơi tôi kết hợp xử lý tín hiệu với lý thuyết thông tin và học máy.
Bạn từng là Nhà khoa học Giọng nói Chính tại Nuance Communications, hiện là một phần của Microsoft (MSFT ), trong hơn 16 năm, những kết luận chính nào bạn có từ kinh nghiệm này?
Từ quan điểm của tôi, lợi ích quan trọng nhất là tôi luôn làm việc trên các kỹ thuật học máy và xử lý tín hiệu tiên tiến và áp dụng công nghệ đó vào các ứng dụng thực tế. Tôi đã có cơ hội áp dụng những kỹ thuật đó vào các sản phẩm Trí tuệ Nhân tạo Đối thoại trên nhiều lĩnh vực. Những lĩnh vực này bao gồm doanh nghiệp, chăm sóc sức khỏe, ô tô, di động, v.v. Một số ứng dụng cụ thể bao gồm trợ lý ảo, phản hồi giọng nói tương tác, chuyển đổi giọng nói sang văn bản, và những ứng dụng khác nơi đại diện và chuyển录 chính xác là quan trọng, chẳng hạn như trong chăm sóc sức khỏe với tương tác bác sĩ-bệnh nhân. Trong suốt 16 năm đó, tôi may mắn được chứng kiến và là một phần của sự tiến hóa của Trí tuệ Nhân tạo Đối thoại, từ những ngày sử dụng mô hình thống kê bằng cách sử dụng Mô hình Markov Hidden, thông qua sự tiếp quản dần dần của Học sâu, đến bây giờ nơi học sâu phổ biến và thống trị gần như tất cả các khía cạnh của AI, bao gồm cả AI Tạo và AI Dự đoán truyền thống. Một kết luận quan trọng khác từ kinh nghiệm này là vai trò quan trọng mà dữ liệu đóng vai trò, thông qua số lượng và chất lượng, như một yếu tố chính thúc đẩy khả năng và hiệu suất của mô hình AI.
Bạn đã xuất bản một tá bài báo, bao gồm cả những ấn phẩm nổi tiếng như IEEE. Theo quan điểm của bạn, bài báo nào là có ảnh hưởng nhất mà bạn đã xuất bản và tại sao nó lại quan trọng?
Bài báo có ảnh hưởng nhất, theo số lượng trích dẫn trên Google (GOOGL ) Scholar, sẽ là một bài báo năm 2008 có tiêu đề “Mel-Frequency Cepstral Coefficient-Based Bandwidth Extension of Narrowband Speech”. Ở mức độ cao, trọng tâm của bài báo này là về cách tái tạo nội dung giọng nói bằng cách sử dụng đại diện tính năng được sử dụng rộng rãi trong lĩnh vực nhận dạng giọng nói tự động (ASR), các hệ số cepstral tần số mel.
Tuy nhiên, bài báo sáng tạo hơn trong quan điểm của tôi là một bài báo với số trích dẫn thứ hai, một bài báo năm 2011 có tiêu đề “Memory-Based Approximation of the Gaussian Mixture Model Framework for Bandwidth Extension of Narrowband Speech“. Trong công việc đó, tôi đã đề xuất một kỹ thuật mô hình hóa thống kê mới kết hợp thông tin thời gian trong giọng nói. Ưu điểm của kỹ thuật đó là cho phép mô hình hóa thông tin dài hạn trong giọng nói với độ phức tạp tối thiểu và theo cách vẫn cho phép tạo ra giọng nói băng tần rộng trong thời gian thực.
Vào tháng 6 năm 2023, bạn đã được tuyển dụng làm Phó Chủ tịch Công nghệ tại LXT, điều gì thu hút bạn đến vị trí này?
Trong suốt kinh nghiệm học thuật và chuyên môn trước khi đến LXT, tôi luôn làm việc trực tiếp với dữ liệu. Trên thực tế, như tôi đã lưu ý trước đó, một kết luận quan trọng cho tôi từ công việc với khoa học giọng nói và học máy là vai trò quan trọng của dữ liệu trong chu kỳ sống của mô hình AI. Có đủ dữ liệu chất lượng trong đúng định dạng là, và vẫn là, điều quan trọng cho sự thành công của các mô hình AI tiên tiến dựa trên học sâu. Do đó, khi tôi ở một giai đoạn trong sự nghiệp của mình mà tôi đang tìm kiếm một môi trường giống như một công ty khởi nghiệp nơi tôi có thể học hỏi, mở rộng kỹ năng của mình, cũng như tận dụng kinh nghiệm về giọng nói và AI của mình để có tác động lớn nhất, tôi đã có cơ hội tham gia LXT. Đó là sự phù hợp hoàn hảo. Không chỉ LXT là một nhà cung cấp dữ liệu AI đang phát triển với tốc độ ấn tượng và nhất quán, mà tôi cũng nhìn thấy nó ở giai đoạn hoàn hảo về sự phát triển của kiến thức AI cũng như về quy mô và đa dạng khách hàng, và do đó về các loại dữ liệu AI và loại dữ liệu. Tôi đã tận hưởng cơ hội tham gia và giúp đỡ trong hành trình phát triển của nó; để có tác động lớn bằng cách mang lại quan điểm của người dùng dữ liệu cuối cùng sau khi đã là người dùng khoa học dữ liệu AI trong nhiều năm.
Ngày làm việc trung bình của bạn tại LXT trông như thế nào?
Ngày làm việc trung bình của tôi bắt đầu bằng việc xem xét các nghiên cứu mới nhất về một chủ đề hoặc chủ đề khác, gần đây tập trung vào AI tạo và cách chúng ta có thể áp dụng nó vào nhu cầu của khách hàng. May mắn thay, tôi có một đội xuất sắc rất giỏi trong việc tạo ra và điều chỉnh các giải pháp cho nhu cầu dữ liệu AI chuyên biệt của khách hàng. Vì vậy, tôi làm việc chặt chẽ với họ để đặt chương trình nghị sự đó.
Cũng có kế hoạch chiến lược hàng năm và hàng quý, và việc chia nhỏ các mục tiêu chiến lược thành các mục tiêu nhóm và theo dõi tiến độ theo các kế hoạch đó. Đối với việc phát triển tính năng mà chúng tôi đang thực hiện, chúng tôi thường có hai đường công nghệ. Một là đảm bảo chúng tôi có các mảnh ghép phù hợp để cung cấp kết quả tốt nhất cho các dự án hiện tại và mới. Đường khác là cải thiện và mở rộng khả năng công nghệ của chúng tôi, tập trung vào việc tích hợp học máy vào chúng.
Có thể bạn thảo luận về các loại thuật toán học máy mà bạn làm việc tại LXT?
Các giải pháp trí tuệ nhân tạo đang biến đổi doanh nghiệp trên tất cả các ngành công nghiệp, và chúng tôi tại LXT vinh dự cung cấp dữ liệu chất lượng cao để đào tạo các thuật toán học máy cung cấp năng lượng cho chúng. Khách hàng của chúng tôi đang làm việc trên một loạt các ứng dụng, bao gồm thực tế ảo và thực tế tăng cường, tầm nhìn máy tính, trí tuệ nhân tạo đối thoại, AI tạo, tìm kiếm liên quan và xử lý ngôn ngữ tự nhiên (NLP), v.v. Chúng tôi cam kết cung cấp năng lượng cho các thuật toán học máy và công nghệ của tương lai thông qua việc tạo và cải tiến dữ liệu trên mọi ngôn ngữ, văn hóa và phương thức.
Trong nội bộ, chúng tôi cũng đang tích hợp học máy để cải thiện và tối ưu hóa các quy trình nội bộ, từ tự động hóa xác thực chất lượng dữ liệu đến việc cho phép mô hình gắn nhãn con người trong tất cả các phương thức dữ liệu chúng tôi làm việc.
Xử lý giọng nói và âm thanh đang nhanh chóng đạt đến mức gần như hoàn hảo khi nói đến tiếng Anh và đặc biệt là người da trắng. Bạn dự đoán sẽ mất bao lâu để đạt được sân chơi bình đẳng trên tất cả các ngôn ngữ, giới tính và chủng tộc?
Đây là một câu hỏi phức tạp, và phụ thuộc vào nhiều yếu tố, bao gồm kinh tế, chính trị, xã hội và công nghệ, v.v. Nhưng điều rõ ràng là sự phổ biến của tiếng Anh là điều đã thúc đẩy AI đến nơi chúng ta đang có ngày nay. Vì vậy, để đạt đến một nơi mà đó là một sân chơi bình đẳng thực sự phụ thuộc vào tốc độ mà đại diện dữ liệu từ các dân tộc và quần thể khác nhau phát triển trực tuyến, và tốc độ mà nó phát triển là điều sẽ quyết định khi nào chúng ta sẽ đến đó.
Tuy nhiên, LXT và các công ty tương tự có thể có vai trò quan trọng trong việc thúc đẩy chúng ta hướng tới một sân chơi bình đẳng hơn. Miễn là dữ liệu cho các ngôn ngữ, giới tính và chủng tộc ít được đại diện vẫn khó tiếp cận hoặc đơn giản là không có sẵn, sự thay đổi đó sẽ đến chậm hơn. Nhưng chúng tôi đang cố gắng làm phần việc của mình. Với phạm vi bao phủ hơn 1.000 vị trí ngôn ngữ và kinh nghiệm ở 145 quốc gia, LXT giúp làm cho việc tiếp cận nhiều ngôn ngữ dữ liệu trở nên khả thi hơn.
Ở LXT, tầm nhìn của bạn cho việc tăng tốc nỗ lực AI cho các khách hàng khác nhau là gì?
Mục tiêu của chúng tôi tại LXT là cung cấp các giải pháp dữ liệu cho phép phát triển AI hiệu quả, chính xác và nhanh hơn. Thông qua 12 năm kinh nghiệm trong lĩnh vực dữ liệu AI, không chỉ chúng tôi đã tích lũy kiến thức sâu rộng về nhu cầu của khách hàng liên quan đến tất cả các khía cạnh của dữ liệu, mà chúng tôi cũng liên tục tinh chỉnh các quy trình của mình để cung cấp dữ liệu chất lượng cao nhất với tốc độ nhanh nhất và điểm giá tốt nhất. Do đó, như một kết quả của cam kết không ngừng của chúng tôi trong việc cung cấp cho khách hàng sự kết hợp tối ưu giữa chất lượng dữ liệu AI, hiệu quả và giá cả, chúng tôi đã trở thành một đối tác dữ liệu AI đáng tin cậy, như thể hiện qua khách hàng lặp lại của chúng tôi, những người tiếp tục quay lại với LXT để đáp ứng nhu cầu dữ liệu AI ngày càng phát triển và thay đổi của họ. Tầm nhìn của tôi là để củng cố, cải thiện và mở rộng “phương thức hoạt động” của LXT đối với tất cả các phương thức dữ liệu chúng tôi làm việc cũng như đối với tất cả các loại phát triển AI mà chúng tôi hiện đang phục vụ, bao gồm cả AI tạo. Việc đạt được mục tiêu này xoay quanh việc mở rộng chiến lược khả năng học máy và khoa học dữ liệu của chính chúng tôi, cả về công nghệ và tài nguyên.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập LXT.












