Mô hình và nền tảng AI
Tương lai của Đánh giá Giọng nói – Các Lãnh đạo Tư duy
Trên toàn thế giới, số lượng người học tiếng Anh tiếp tục tăng. Các cơ sở giáo dục và nhà tuyển dụng cần phải đánh giá khả năng tiếng Anh của người học – đặc biệt là khả năng nói, vì ngôn ngữ nói vẫn là một trong những kỹ năng ngôn ngữ quan trọng nhất. Thách thức, cả đối với nhà phát triển đánh giá và người dùng cuối, là tìm cách làm điều này một cách chính xác, nhanh chóng và tiết kiệm chi phí. Như một phần của thách thức này, việc chấm điểm các đánh giá này đi kèm với một loạt các yếu tố, đặc biệt là khi chúng ta xem xét các lĩnh vực khác nhau (giọng nói, viết, v.v.) mà một người được kiểm tra. Với nhu cầu về kỹ năng tiếng Anh trên toàn cầu chỉ dự kiến sẽ tăng, tương lai của việc chấm điểm giọng nói cần phải như thế nào để đáp ứng nhu cầu này?
Câu trả lời cho câu hỏi đó, một phần, được tìm thấy trong sự tiến hóa của việc chấm điểm giọng nói cho đến nay. Việc chấm điểm các phản hồi nói được xây dựng đã được thực hiện lịch sử bằng cách sử dụng người chấm điểm. Quá trình này, tuy nhiên, có xu hướng tốn kém và chậm, và có những thách thức bổ sung bao gồm khả năng mở rộng và các hạn chế của chính người chấm điểm (ví dụ: chủ quan hoặc thiên vị của người chấm điểm). Như đã thảo luận trong cuốn sách của chúng tôi Đánh giá Nói Tự động: Sử dụng Công nghệ Ngôn ngữ để Chấm điểm Nói Tự phát, để giải quyết những thách thức này, ngày càng nhiều đánh giá hiện sử dụng công nghệ chấm điểm giọng nói tự động như nguồn chấm điểm duy nhất hoặc kết hợp với người chấm điểm. Trước khi triển khai động cơ chấm điểm tự động, tuy nhiên, hiệu suất của chúng cần được đánh giá kỹ lưỡng, đặc biệt là liên quan đến độ tin cậy của điểm, tính hợp lệ (hệ thống có đo lường những gì nó được thiết kế để đo lường không?) và công bằng (tức là hệ thống không nên giới thiệu thiên vị liên quan đến các phân khúc dân số như giới tính hoặc ngôn ngữ bản địa).
Kể từ năm 2006, động cơ chấm điểm giọng nói của ETS, SpeechRater®, đã được vận hành trong đánh giá Thực hành Trực tuyến TOEFL (TPO) (được sử dụng bởi những người dự định tham gia kỳ thi TOEFL iBT) và kể từ năm 2019, SpeechRater cũng đã được sử dụng, cùng với người chấm điểm, để chấm điểm phần nói của kỳ thi TOEFL iBT. Động cơ này đánh giá một loạt các kỹ năng nói, bao gồm phát âm và lưu loát, phạm vi từ vựng và ngữ pháp, và các kỹ năng nói cấp cao hơn liên quan đến sự mạch lạc và tiến triển của ý tưởng. Những tính năng này được tính toán bằng cách sử dụng xử lý ngôn ngữ tự nhiên (NLP) và thuật toán xử lý giọng nói. Một mô hình thống kê sau đó được áp dụng cho các tính năng này để gán một điểm cuối cùng cho phản hồi của người tham gia kiểm tra.
Mặc dù mô hình này được đào tạo trên dữ liệu đã quan sát trước đó được chấm điểm bởi người chấm điểm, nó cũng được xem xét bởi các chuyên gia nội dung để tối đa hóa tính hợp lệ. Nếu một phản hồi được tìm thấy là không thể chấm điểm do chất lượng âm thanh hoặc các vấn đề khác, động cơ có thể đánh dấu nó để xem xét thêm để tránh tạo ra một điểm có thể không đáng tin cậy hoặc không hợp lệ. Người chấm điểm luôn tham gia vào việc chấm điểm các phản hồi nói trong đánh giá nói TOEFL iBT có mức độ rủi ro cao.
Khi người chấm điểm và SpeechRater hiện đang được sử dụng cùng nhau để chấm điểm phản hồi của người tham gia kiểm tra trong các đánh giá nói có mức độ rủi ro cao, cả hai đều đóng vai trò trong tương lai của việc chấm điểm khả năng tiếng Anh. Người chấm điểm có khả năng hiểu nội dung và tổ chức diễn ngôn của một phản hồi nói một cách sâu sắc. Ngược lại, các động cơ chấm điểm giọng nói tự động có thể đo lường chính xác hơn một số khía cạnh chi tiết của giọng nói, chẳng hạn như lưu loát hoặc phát âm, thể hiện sự nhất quán hoàn hảo theo thời gian, có thể giảm thời gian và chi phí chấm điểm tổng thể và có thể dễ dàng mở rộng để hỗ trợ số lượng kiểm tra lớn. Khi người chấm điểm và hệ thống chấm điểm giọng nói tự động được kết hợp, hệ thống kết quả có thể tận dụng được điểm mạnh của mỗi phương pháp chấm điểm.
Để liên tục phát triển các động cơ chấm điểm giọng nói tự động, nghiên cứu và phát triển cần tập trung vào các khía cạnh sau, trong số những khía cạnh khác:
- Xây dựng hệ thống nhận dạng giọng nói tự động với độ chính xác cao hơn: Vì hầu hết các tính năng của hệ thống chấm điểm giọng nói phụ thuộc trực tiếp hoặc gián tiếp vào thành phần của hệ thống này, chuyển đổi giọng nói của người tham gia kiểm tra thành bản chuyển录 văn bản, việc nhận dạng giọng nói tự động chính xác cao là rất quan trọng để có được các tính năng hợp lệ;
- Khám phá các cách mới để kết hợp điểm của người chấm điểm và điểm tự động: Để tận dụng tối đa điểm mạnh của điểm của người chấm điểm và điểm của động cơ tự động, cần phải khám phá thêm các cách kết hợp bằng chứng này;
- Định lượng các bất thường trong phản hồi, cả về mặt kỹ thuật và hành vi: Cần có các bộ lọc hiệu suất cao có khả năng đánh dấu các phản hồi như vậy và loại chúng khỏi việc chấm điểm tự động để giúp đảm bảo tính hợp lệ và độ tin cậy của điểm đánh giá kết quả;
- Đánh giá giọng nói tự phát hoặc giao tiếp xảy ra thường nhất trong cuộc sống hàng ngày: Mặc dù việc chấm điểm tự động các loại giọng nói tương tác này là một mục tiêu quan trọng, nhưng những mục này lại đưa ra nhiều thách thức về chấm điểm, bao gồm cả đánh giá và chấm điểm tổng thể;
- Khám phá công nghệ học sâu cho việc chấm điểm giọng nói tự động: Mô hình tương đối mới này trong học máy đã tạo ra sự tăng hiệu suất đáng kể trên nhiều nhiệm vụ trí tuệ nhân tạo (AI) trong những năm gần đây (ví dụ: nhận dạng giọng nói, nhận dạng hình ảnh), và do đó, việc chấm điểm tự động cũng có thể được hưởng lợi từ việc sử dụng công nghệ này. Tuy nhiên, vì hầu hết các hệ thống này có thể được coi là các phương pháp “hộp đen”, sự chú ý đến khả năng giải thích của điểm số kết quả sẽ rất quan trọng để duy trì một mức độ minh bạch nhất định.
Để đáp ứng nhu cầu ngày càng tăng và thay đổi của người học tiếng Anh, các hệ thống chấm điểm giọng nói thế hệ tiếp theo phải mở rộng tự động hóa và phạm vi những gì chúng có thể đo lường, cho phép tính nhất quán và khả năng mở rộng. Điều đó không có nghĩa là yếu tố con người sẽ bị loại bỏ, đặc biệt là đối với các đánh giá có mức độ rủi ro cao. Người chấm điểm có thể vẫn là yếu tố quan trọng để nắm bắt một số khía cạnh của giọng nói sẽ vẫn khó đánh giá chính xác bởi các hệ thống chấm điểm tự động trong một thời gian dài, bao gồm cả các khía cạnh chi tiết của nội dung nói và diễn ngôn. Sử dụng các hệ thống chấm điểm giọng nói tự động một cách cô lập cho các đánh giá có hậu quả cũng có nguy cơ không xác định được các phản hồi có vấn đề của người tham gia kiểm tra – ví dụ, phản hồi không liên quan hoặc bị đạo văn, và do đó, có thể dẫn đến giảm tính hợp lệ và độ tin cậy. Sử dụng cả người chấm điểm và hệ thống chấm điểm tự động cùng nhau có thể là cách tốt nhất để chấm điểm giọng nói trong các đánh giá có mức độ rủi ro cao trong tương lai gần, đặc biệt là nếu giọng nói tự phát hoặc giao tiếp được đánh giá.
Được viết bởi: Keelan Evanini, Giám đốc Nghiên cứu Giọng nói, ETS & Klaus Zechner, Nhà khoa học Nghiên cứu Senior Quản lý, Giọng nói, ETS
ETS làm việc với các cơ sở giáo dục, doanh nghiệp và chính phủ để tiến hành nghiên cứu và phát triển các chương trình đánh giá cung cấp thông tin có ý nghĩa mà họ có thể dựa vào để đánh giá người và chương trình. ETS phát triển, quản lý và chấm điểm hơn 50 triệu bài kiểm tra mỗi năm tại hơn 180 quốc gia tại hơn 9.000 địa điểm trên toàn thế giới. Chúng tôi thiết kế các đánh giá của mình với kiến thức sâu sắc của ngành, nghiên cứu nghiêm ngặt và một cam kết không妥協 về chất lượng để chúng tôi có thể giúp các cộng đồng giáo dục và nơi làm việc đưa ra quyết định sáng suốt. Để tìm hiểu thêm, hãy truy cập ETS.













