Lãnh đạo tư tưởng

Tại Sao Trí Tuệ Nhân Tạo Tổng Quát Không Đủ Để Hỗ Trợ Trẻ Em

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Bạn có biết rằng rối loạn ngôn ngữ ở trẻ em đã tăng hơn gấp đôi kể từ đại dịch? Đồng thời, Đánh giá Giáo dục Quốc gia cho thấy điểm đọc giảm hai điểm, mặc dù có nhiều sáng kiến để chống lại sự mất mát học tập do tài trợ liên bang. Kết quả là nhu cầu can thiệp sớm chưa bao giờ lớn đến thế, với nhiều người đang chuyển sang trí tuệ nhân tạo và công nghệ để giúp đỡ. Sau tất cả, các công cụ nhận dạng giọng nói đang ở khắp mọi nơi – từ trợ lý ảo đến phần mềm lớp học. Nhưng đây là vấn đề: nhiều công cụ này chỉ được xây dựng cho giọng nói của người lớn.

Hệ thống nhận dạng giọng nói tự động (ASR) hiện đại thường được đào tạo trên dữ liệu từ người nói tiếng Anh, thường là những người có mẫu nói rõ ràng và nhất quán. Vì vậy, khi một đứa trẻ nói, những mô hình này thường xuyên hiểu lầm từ ngữ của chúng hoặc không phản hồi hoàn toàn. Điều này không chỉ là một sự cố kỹ thuật. Khi trí tuệ nhân tạo không hiểu được những gì một đứa trẻ đang nói, đó là một cơ hội bỏ lỡ để hỗ trợ việc học, đánh dấu những lo ngại về phát triển tiềm năng hoặc cung cấp các can thiệp kịp thời.

Tin tốt là vấn đề này có thể giải quyết được. Nhưng trước tiên, chúng ta cần hiểu tại sao những khoảng trống này tồn tại và những gì cần thiết để lấp đầy chúng.

Tại Sao Ngôn Ngữ Trẻ Em Làm Cho Trí Tuệ Nhân Tạo Bối Rối

Ngôn ngữ của trẻ em cơ bản khác với người lớn,考虑 đến cách nói của một đứa trẻ có thể ít dự đoán được và thường chứa những bất thường về ngữ pháp hoặc phát âm. Không giống như người lớn, trẻ em cũng thường xuyên ngừng nói giữa câu hoặc sử dụng từ vựng đang phát triển – tạo ra sự biến đổi khó khăn hơn cho trí tuệ nhân tạo để xử lý. Theo Thư viện Y học Quốc gia, hệ thống nhận dạng giọng nói tạo ra tỷ lệ lỗi từ hai đến năm lần cao hơn ở trẻ em so với người lớn, trích dẫn sự khác biệt về âm cao, biến đổi phát âm và sự không phù hợp của đường dẫn giọng.

Và không chỉ là như thế nào trẻ em nói, mà còn là ở đâu chúng nói. Các bản ghi âm giọng nói của trẻ em thường diễn ra trong môi trường áp đảo như lớp học hoặc trường mẫu giáo, nơi nhiều giọng nói chồng chéo và tiếng ồn nền liên tục. Các mô hình ASR tiêu chuẩn gặp khó khăn trong việc cô lập một người nói duy nhất trong những điều kiện như vậy, chưa kể đến việc chuyển录 chính xác từ ngữ của chúng. Thậm chí các kỹ thuật tiên tiến như phân biệt người nói, khả năng xác định giọng nói thuộc về đứa trẻ, giáo viên hoặc người hướng dẫn, thường không đạt được khi áp dụng cho các tình huống nhiều người nói và tiếng ồn cao. Nếu không có nó, hệ thống có nguy cơ gán sai giọng nói, giảm thêm độ chính xác và tính hữu dụng.

Một thách thức quan trọng khác là thiếu chuyển录 âm vị trong nhiều hệ thống ASR. Việc chia nhỏ giọng nói thành các âm vị riêng lẻ cho phép mô hình theo dõi những phát âm không chính xác, do dự và lưu loát với độ chính xác cao hơn nhiều. Cách tiếp cận chi tiết này đặc biệt có giá trị trong môi trường giáo dục và trị liệu, nơi hiểu những khác biệt tinh tế trong giọng nói có thể thông báo các can thiệp.

Những tính năng này hoạt động tốt nhất khi được sử dụng cùng nhau. Chúng không thay thế các mô hình ngôn ngữ tổng quát, mà tinh chỉnh chúng với dữ liệu đặc biệt cho trẻ em, được thu thập một cách có đạo đức, để thực hiện chính xác trong những tình huống quan trọng nhất.

Thiếu Dữ Liệu và Tại Sao Công Nghệ Lớn Không Giải Quyết Vấn Đề

Gốc rễ của vấn đề nằm ở dữ liệu – hoặc thiếu dữ liệu. Vì hầu hết các mô hình ngôn ngữ được đào tạo trên các tập dữ liệu thống trị bởi giọng nói người lớn, giọng nói của trẻ em, đặc biệt là những người từ các nền tảng ngôn ngữ và văn hóa đa dạng, bị lãng quên. Việc thu thập dữ liệu giọng nói chất lượng cao, đại diện cho trẻ em cần thiết để đào tạo mô hình trí tuệ nhân tạo cũng là một việc phức tạp, và vì lý do chính đáng. Các quy định như COPPA (Đạo luật Bảo vệ Quyền riêng tư Trẻ em Trực tuyến) áp đặt những hạn chế nghiêm ngặt đối với các công ty muốn biên soạn và phân tích dữ liệu từ trẻ em dưới 13 tuổi. Mặc dù những quy định này là quan trọng để bảo vệ quyền riêng tư của trẻ em, nhưng chúng vô tình tạo ra những rào cản cho sự phát triển trí tuệ nhân tạo mạnh mẽ.

Đối với nhiều công ty công nghệ, phân tích chi phí – lợi ích và cơ hội thị trường không đủ để biện minh cho khoản đầu tư. Hỗ trợ nhận dạng giọng nói đặc biệt cho trẻ em thường được coi là một nhiệm vụ cao, lợi nhuận thấp. Thị trường nhỏ hơn so với các giải pháp tập trung vào doanh nghiệp và người lớn, và các rào cản quy định khiến nó ít hấp dẫn hơn. Kết quả là, việc cải thiện ASR cho trẻ em hiếm khi được ưu tiên hàng đầu.

Tại Sao Trí Tuệ Nhân Tạo Chính Xác và Có Đạo Đức Quan Trọng Đối Với Kết Quả Giáo Dục Công Bằng

Mặc dù những thách thức này, trí tuệ nhân tạo ngôn ngữ vẫn đóng một vai trò quan trọng trong các lớp học và phiên trị liệu – cho việc đánh giá đọc, chương trình giáo dục sớm và thậm chí là sàng lọc các rối loạn học tập. Nhưng độ chính xác là điều quan trọng. Trong một nghiên cứu, hệ thống ASR hoạt động tốt nhất chỉ chuyển录 chính xác 18% từ ngữ của trẻ 5 tuổi. Các lỗi nhận dạng có thể làm sai lệch dữ liệu mà các giáo viên và chuyên gia dựa vào. Điều này có thể dẫn đến việc đánh giá thấp mức độ đọc của một đứa trẻ hoặc trì hoãn việc xác định các vấn đề về ngôn ngữ hoặc học tập tiềm ẩn

Khi trí tuệ nhân tạo ngôn ngữ thất bại, nó không chỉ ảnh hưởng đến kết quả học tập. Nó làm rộng khoảng cách công bằng. Trẻ em với giọng nói đa dạng, người học đa dạng và học sinh song ngữ bị ảnh hưởng không tương xứng bởi sự không chính xác của ASR. Những nhóm này đã có nguy cơ cao hơn bị hiểu lầm bởi các mô hình tổng quát, và khi trí tuệ nhân tạo ngôn ngữ thất bại, nó có thể làm trầm trọng thêm những bất bình đẳng hiện có trong giáo dục và chăm sóc sức khỏe. Đối với những người thực hành trí tuệ nhân tạo, điều này nhấn mạnh nhu cầu thiết kế các hệ thống không chỉ chính xác mà còn công bằng.

Các xem xét về đạo đức cũng là điều quan trọng không kém. Dữ liệu của trẻ em rất nhạy cảm và phải được xử lý một cách cẩn thận và minh bạch. Nhiều công cụ hiện có dựa vào máy chủ của bên thứ ba để xử lý dữ liệu giọng nói – một thực hành có thể đủ cho một rô-bốt trò chuyện dịch vụ khách hàng nhưng hoàn toàn không phù hợp cho trẻ em học tập. May mắn thay, việc xử lý dữ liệu tại địa phương và trên cơ sở đang xuất hiện như một thực hành tốt nhất, vì nó đảm bảo dữ liệu không bao giờ rời khỏi thiết bị, phù hợp với các luật hạn chế thu thập dữ liệu, quảng cáo có mục tiêu và lưu giữ.

Đóng Gaps Với Công Cụ Được Xây Dựng Mục Đích

Để thực sự hỗ trợ trẻ em, trí tuệ nhân tạo ngôn ngữ phải vượt ra ngoài việc chuyển录 cơ bản và được xây dựng đặc biệt cho những phức tạp của thế giới thực trong các lớp học, phòng khám và các môi trường học tập động khác. Vai trò của nó nên là tăng cường, không thay thế, chuyên môn của con người. Những hệ thống hiệu quả nhất không chỉ gán điểm số hoặc nhãn; chúng cung cấp thông tin chi tiết, có thể hành động thông qua các tính năng như dấu thời gian, chuyển录 âm vị và chỉ báo do dự.

Bằng cách trang bị cho các giáo viên và nhà trị liệu những dữ liệu tinh tế, đáng tin cậy, trí tuệ nhân tạo có thể trao quyền cho các chuyên gia đưa ra quyết định thông minh, phù hợp với nhu cầu của từng đứa trẻ. Khi được thiết kế một cách cẩn thận và có đạo đức, trí tuệ nhân tạo ngôn ngữ trở thành hơn một công cụ. Nó trở thành một đối tác đáng tin cậy trong việc thúc đẩy năng lực đọc, công bằng và kết quả học tập có ý nghĩa cho mọi đứa trẻ.

Bohdan Khomych là Giám đốc Điều hành Sản phẩm Nghiên cứu và Phát triển tại SoftServe, một nhà cung cấp dịch vụ tư vấn công nghệ thông tin và dịch vụ kỹ thuật số hàng đầu. Ông làm việc chặt chẽ với các nhà khoa học để nghiên cứu, phát triển và thương mại hóa các công nghệ mới nổi nhằm thúc đẩy tiến bộ của loài người. Lĩnh vực tập trung của ông bao gồm các tác nhân trí tuệ nhân tạo, trí tuệ nhân tạo tạo sinh, tính toán lượng tử, đổi mới sinh học và tính toán hiệu suất cao. Bohdan sở hữu bằng cấp về Quản lý Công nghệ từ Đại học Công giáo Ukraine và Kỹ thuật mạng từ Đại học Quốc gia Kyiv.