Mô hình và nền tảng AI
Các Hệ Thống Trí Tuệ Nhân Tạo Có Thể Ưu Tiên Ngôn Ngữ Con Người Thay Vì Dữ Liệu Số

Nghiên cứu mới từ Columbia Engineering gợi ý rằng các hệ thống trí tuệ nhân tạo (AI) ưu tiên ngôn ngữ con người thay vì dữ liệu số như 1 và 0. Nghiên cứu mới này đến từ Giáo sư Cơ khí Hod Lipson và sinh viên tiến sĩ Boyuan Chen, và nó đã chứng minh rằng các hệ thống AI có thể đạt được hiệu suất cao hơn nếu được lập trình với tệp âm thanh ngôn ngữ con người.
Trong một so sánh song song, các nhà nghiên cứu đã phát hiện ra rằng một mạng nơ-ron được đào tạo bằng tệp âm thanh đạt được hiệu suất cao hơn trong việc xác định đối tượng so với mạng nơ-ron khác được lập trình với đầu vào nhị phân đơn giản.
Lipson là Giáo sư James và Sally Scapa về Đổi mới và là thành viên của Viện Khoa học Dữ liệu Columbia.
“Để hiểu tại sao phát hiện này quan trọng, điều hữu ích là hiểu cách các mạng nơ-ron thường được lập trình, và tại sao sử dụng âm thanh của giọng nói con người là một thí nghiệm táo bạo,” ông nói.
Sử dụng số nhị phân là紧凑 và chính xác, trong khi ngôn ngữ con người phức tạp và không nhị phân khi được ghi lại trong tệp số. Các lập trình viên thường không偏离 khỏi số khi phát triển một mạng nơ-ron vì nó hiệu quả cao.
Đội ngũ này đã bắt đầu nghiên cứu này sau khi suy nghĩ rằng các mạng nơ-ron không đạt được tiềm năng đầy đủ của chúng, và họ tin rằng chúng có thể nhanh hơn và tốt hơn nếu được đào tạo với giọng nói con người và từ ngữ cụ thể.
Đào Tạo Các Mạng Lưới
Khi kiểm tra một kỹ thuật học máy mới, các nhà nghiên cứu AI thường đào tạo một mạng nơ-ron để nhận biết các đối tượng và động vật cụ thể trong một bộ sưu tập ảnh.
Đội ngũ này, bao gồm Chen, Lipson, Yu Li và Susan Raghupathi, đã thiết lập một thí nghiệm kiểm soát để kiểm tra giả thuyết của họ, và họ đã tạo ra hai mạng nơ-ron mới. Họ đã đào tạo chúng để nhận biết 10 loại đối tượng khác nhau trong 50.000 ảnh được gọi là “hình ảnh đào tạo.”
Một trong các hệ thống AI được đào tạo theo cách truyền thống với giá trị số, trong khi mạng nơ-ron thí nghiệm được đào tạo rất khác. Nó được cung cấp một bảng dữ liệu với các hàng chứa ảnh của một động vật hoặc đối tượng, và cột thứ hai có tệp âm thanh giọng nói, nói từ của động vật hoặc đối tượng. Không có 1 và 0 nào được sử dụng với mạng nơ-ron thí nghiệm.
Cả hai hệ thống AI đều được đào tạo trong tổng cộng 15 giờ. Kết quả cho thấy mạng nơ-ron ban đầu trả lời bằng một loạt 10 số 1 và 0, trong khi mạng nơ-ron thí nghiệm tạo ra giọng nói rõ ràng đang cố gắng “nói” đối tượng trong ảnh là gì. Mặc dù giọng nói ban đầu không rõ ràng, nhưng nó cuối cùng đã đạt đến điểm gần như chính xác.
Hai mạng nơ-ron hoạt động tương đương, nhận biết động vật hoặc đối tượng chính xác 92% thời gian. Các nhà nghiên cứu sau đó quyết định chạy thí nghiệm lần thứ hai, nhưng lần này họ sử dụng ít ảnh hơn trong quá trình.
Mạng nơ-ron truyền thống hoạt động kém do dữ liệu thưa, như dự kiến, giảm xuống khoảng 35% độ chính xác. Tuy nhiên, mạng nơ-ron thí nghiệm hoạt động tốt hơn gấp đôi, với độ chính xác 70%, mặc dù có ít dữ liệu hơn.
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
Kết Quả Bất Ngờ
Lần tiếp theo, đội ngũ này đã sử dụng ảnh khó hơn, chẳng hạn như ảnh bị hỏng của một con chó. Ngay cả với ảnh khó hơn, mạng nơ-ron được đào tạo bằng giọng nói vẫn chính xác khoảng 50% thời gian, trong khi mạng nơ-ron truyền thống chỉ chính xác 20%.
Boyuan Chen là nhà nghiên cứu chính của nghiên cứu này.
“Phát hiện của chúng tôi đi ngược lại với cách nhiều chuyên gia đã được đào tạo để nghĩ về máy tính và số; đó là một giả định chung rằng đầu vào nhị phân là cách hiệu quả hơn để truyền đạt thông tin cho máy tính so với luồng âm thanh của thông tin ‘giàu’ tương tự,” Chen giải thích. “Trên thực tế, khi chúng tôi gửi nghiên cứu này đến một hội nghị AI lớn, một người đánh giá匿名 từ chối bài báo của chúng tôi chỉ vì họ cảm thấy kết quả của chúng tôi quá ‘bất ngờ và không trực quan’.”
“Nếu bạn nghĩ về việc ngôn ngữ con người đã trải qua một quá trình tối ưu hóa trong hàng chục nghìn năm, thì nó hoàn toàn hợp lý khi những từ ngữ nói của chúng ta đã tìm thấy một sự cân bằng tốt giữa nhiễu và tín hiệu,” Lipson nói. “Do đó, khi xem xét dưới góc độ của Shannon Entropy, nó hợp lý khi một mạng nơ-ron được đào tạo bằng ngôn ngữ con người sẽ vượt trội so với một mạng nơ-ron được đào tạo bằng 1 và 0 đơn giản.”
Nghiên cứu này sẽ được trình bày tại Hội nghị Quốc tế về Học đại diện vào ngày 3 tháng 5 năm 2021.
“Chúng ta nên nghĩ về việc sử dụng các cách mới và tốt hơn để đào tạo các hệ thống AI thay vì thu thập dữ liệu lớn hơn,” Chen nói. “Nếu chúng ta thay đổi cách chúng ta trình bày dữ liệu đào tạo cho máy tính, chúng ta có thể làm tốt hơn trong vai trò của một giáo viên.”
“Một trong những bí ẩn lớn nhất của sự tiến hóa con người là làm thế nào tổ tiên của chúng ta có được ngôn ngữ, và làm thế nào trẻ em học nói một cách dễ dàng,” Lipson thêm. “Nếu trẻ em học tốt nhất với hướng dẫn nói lặp lại, thì có thể các hệ thống AI cũng có thể như vậy.”












