Nền tảng AI
AI Cảm Xúc (Affective Computing) là gì và Tại sao nó lại quan trọng?
AI Cảm Xúc, thường được gọi là tính toán cảm xúc, áp dụng tính toán vào các tín hiệu liên quan đến cảm xúc, chẳng hạn như ngôn ngữ, ngữ điệu giọng nói, chuyển động khuôn mặt, tư thế, sinh lý, hoặc các mẫu tương tác. Hệ thống có thể phân loại một nhãn, ước lượng các chiều như giá trị cảm xúc và mức kích thích, hoặc điều chỉnh giao diện.
Kết quả là một suy luận — không phải là việc đọc trực tiếp trạng thái cảm xúc bên trong. Biểu hiện thay đổi tùy theo cá nhân, văn hoá, ngữ cảnh, sức khỏe và hoàn cảnh, vì vậy cùng một tín hiệu quan sát được có thể hỗ trợ nhiều giải thích khác nhau. Các trường hợp có rủi ro cao đòi hỏi bằng chứng mạnh, sự đồng ý và đánh giá pháp lý.
Những điểm chính
- Xác định mục tiêu quan sát một cách chính xác; cảm xúc, biểu hiện, tâm trạng, căng thẳng và sự tham gia không thể hoán đổi cho nhau.
- Xác thực trên nhóm dân số và môi trường mục tiêu, không chỉ dựa vào bộ chuẩn được chọn lọc.
- Ưu tiên hỗ trợ và kiểm soát của người dùng hơn là giám sát ẩn hoặc phán đoán tự động có hậu quả.
- Ghi lại sự không chắc chắn, quyền dữ liệu, thời gian lưu trữ, hiệu suất của các nhóm phụ, và quy trình khiếu nại quyết định.

Tín hiệu và mục tiêu mô hình
Mô hình văn bản có thể ước lượng tâm trạng được biểu đạt; mô hình âm thanh sử dụng thời gian, cao độ và năng lượng; mô hình thị giác phân tích các chuyển động; hệ thống sinh lý có thể dùng nhịp tim hoặc độ dẫn điện da. Các hệ thống đa mô hình kết hợp các tín hiệu, nhưng việc có nhiều cảm biến hơn không tự động tạo ra nhãn chính xác hơn.
Một nhãn như ‘bị bực bội’ phụ thuộc vào hướng dẫn chú thích và ngữ cảnh. Phân tích tâm trạng của từ ngữ hẹp hơn so với việc suy ra tình trạng cảm xúc của một người, và cả hai đều không nên bị nhầm lẫn với đánh giá lâm sàng.
Tại sao ngữ cảnh và sự không chắc chắn lại chi phối
Mọi người có thể che giấu, phóng đại hoặc biểu lộ cảm xúc một cách khác nhau. Khuyết tật, ngôn ngữ, ánh sáng, chất lượng micro và chuẩn mực xã hội có thể thay đổi các tín hiệu quan sát được. Các bộ dữ liệu trong phòng thí nghiệm có thể không đại diện cho trung tâm cuộc gọi, lớp học, phương tiện hoặc phòng khám.
Đánh giá việc hiệu chỉnh, từ chối dự đoán, lỗi theo nhóm, hiệu suất đa miền và các lựa chọn thay thế. Ma trận nhầm lẫn giúp hiển thị nhãn nào bị trộn lẫn, nhưng cần xem xét định tính để hiểu nguyên nhân.
Ứng dụng hữu ích và rủi ro
Các ứng dụng do người dùng kiểm soát có thể hỗ trợ khả năng tiếp cận, nhật ký phản chiếu, đào tạo thích nghi, hoặc cảnh báo an toàn. Những sử dụng này cần làm rõ những gì được đo, cho phép sửa chữa và tránh phóng đại độ chắc chắn.
Việc sử dụng trong tuyển dụng, giáo dục, bảo hiểm, thực thi pháp luật và quyết định y tế tạo ra mức độ rủi ro cao hơn nhiều. Đạo luật AI của EU cấm một số việc nhận dạng cảm xúc trong nơi làm việc và giáo dục, với các ngoại lệ được quy định, và phân loại các mục đích khác theo mức độ rủi ro. Các yêu cầu thay đổi tùy theo khu vực pháp lý và thời gian.
Triển khai có trách nhiệm
Hãy tự hỏi liệu nhiệm vụ có thực sự cần suy luận cảm xúc hay không. Áp dụng nguyên tắc giảm thiểu dữ liệu, mục đích rõ ràng, thời gian lưu trữ ngắn, bảo mật, kiểm tra độc lập, thông báo cho người dùng và đánh giá của con người. Tránh xây dựng hồ sơ phụ từ các tín hiệu được thu thập cho mục đích khác.
Áp dụng các thực tiễn AI giải thích được mà không ngụ ý rằng bản đồ nổi bật chứng minh một cảm xúc. Truyền đạt sự không chắc chắn bằng ngôn ngữ đơn giản và cung cấp cách thức có ý nghĩa để từ chối hoặc khiếu nại kết quả có hậu quả.
Cách biểu diễn cảm xúc
Các mô hình phân loại dự đoán các nhãn như vui, giận, sợ, buồn hoặc trung tính. Các mô hình chiều đo ước lượng các giá trị liên tục như giá trị cảm xúc, mức kích thích và quyền lực. Các mô hình đánh giá mô tả cách một người đánh giá một sự kiện. Những biểu diễn này là lý thuyết và lựa chọn đo lường, không phải là sự thật nền tảng có thể hoán đổi.
Chú thích có thể đến từ người trải nghiệm sự kiện, người quan sát, bác sĩ hoặc quy trình thí nghiệm. Báo cáo tự thân có giới hạn về tự quan sát và trí nhớ; nhãn của người quan sát suy ra trạng thái từ hành vi; đo lường sinh lý phản ánh mức kích thích và nhiều quá trình không liên quan đến cảm xúc. Bộ dữ liệu nên nêu rõ quan điểm nào mà nhãn đại diện.
Mô hình thời gian quan trọng vì cảm xúc diễn ra theo thời gian. Nhãn khuôn mặt ở mức khung hình có thể phản ứng quá mức với chuyển động ngắn hạn, trong khi trung bình ở mức câu nói có thể che giấu sự thay đổi. Độ dài cửa sổ, đồng bộ giữa các cảm biến, kênh thiếu và chuẩn cơ bản của người nói đều ảnh hưởng đến kết quả.
Quy trình mô hình hoá theo phương thức
Quy trình thị giác phát hiện và căn chỉnh khuôn mặt hoặc cơ thể, trích xuất khung hình hoặc các điểm mốc, sau đó phân loại các đặc trưng không gian và thời gian. Sự che khuất, góc camera, nén, tông da, kính mắt, khác biệt khuôn mặt và biểu hiện cố ý có thể làm thay đổi hiệu suất. Các đơn vị hành động khuôn mặt mô tả chuyển động một cách trực tiếp hơn so với cảm xúc được khẳng định và có thể là mục tiêu an toàn hơn.
Quy trình âm thanh tách giọng nói, chuẩn hoá mức âm và mô hình hoá các mẫu phổ, ngữ điệu và thời gian. Cao độ tăng có thể chỉ ra sự hưng phấn, căng thẳng, một câu hỏi hoặc thói quen của người nói. Quy trình văn bản nắm bắt đánh giá và ngữ cảnh nhưng mất đi giọng điệu nếu không kết hợp với âm thanh. Hợp nhất đa mô hình có thể diễn ra ở lớp đặc trưng, quyết định hoặc lớp chú ý chéo.
Cá nhân hoá có thể hiệu chỉnh dựa trên mức chuẩn của từng cá nhân, nhưng đòi hỏi nhiều dữ liệu hơn và tạo ra hồ sơ dọc thời gian nhạy cảm. Các hệ thống nên ưu tiên thích nghi cục bộ hoặc ngắn hạn khi có thể và phải tránh sử dụng dữ liệu của một người để đưa ra suy luận không liên quan nếu không có mục đích hợp lệ.
Đánh giá, yếu tố con người và biện pháp bảo vệ
Việc ngẫu nhiên chia các khung hình từ cùng một video giữa tập huấn luyện và kiểm tra gây rò rỉ dữ liệu. Giữ lại người, phiên, thiết bị, địa điểm và khoảng thời gian theo tuyên bố dự định. Báo cáo các chỉ số macro để các lớp phổ biến không che giấu thất bại trên các trạng thái hiếm, và bao gồm tùy chọn từ chối đối với đầu vào mơ hồ.
Các nghiên cứu người dùng nên đo lường liệu việc thích nghi có thực sự hữu ích hay không. Giao diện thay đổi giọng điệu dựa trên suy luận sai có thể gây cảm giác xâm phạm hoặc khinh thường. Cho phép người dùng sửa hệ thống, lựa chọn mức độ thích nghi và xem lý do chức năng của phản hồi mà không bị gán nhãn cảm xúc cố định.
Triển khai rủi ro cao cần đánh giá tác động, xem xét pháp lý, bảo mật và cấm sử dụng phụ. Lưu trữ video hoặc dữ liệu sinh trắc học thô chỉ khi cần thiết, hạn chế quyền truy cập và xác định việc xóa bỏ. Không sử dụng điểm cảm xúc làm bằng chứng duy nhất cho việc lừa đảo, hiệu suất, năng lực, ý định hoặc sức khỏe tâm thần.
Đánh giá trường hợp sử dụng AI Cảm Xúc trước khi triển khai
Bắt đầu bằng việc xác định cấu trúc được khẳng định: chuyển động khuôn mặt, ngữ điệu giọng nói, cảm giác tự báo cáo, hành vi quan sát hoặc trạng thái lâm sàng không thể hoán đổi cho nhau. Xác định quyết định sẽ sử dụng kết quả và liệu một tín hiệu ít xâm phạm hơn có thể đáp ứng được không. Hệ thống điều chỉnh độ khó trò chơi dựa trên phản hồi bực bội rõ ràng có hồ sơ bằng chứng và rủi ro khác so với việc suy ra sự trung thực của nhân viên từ webcam.
Việc xác thực cần những người, văn hoá, ngôn ngữ, thiết bị, ngữ cảnh và điều kiện ghi âm đại diện, với dữ liệu thực tế phù hợp với tuyên bố. So sánh với các chuẩn cơ bản đơn giản và báo cáo sự không chắc chắn, lỗi nhóm phụ, bất đồng giữa các người đánh giá và hiệu suất ngoài phòng thí nghiệm. Không chuyển đổi điểm xác suất thành tuyên bố phân loại về cảm xúc của người nào. Cung cấp cho người dùng khả năng sửa lỗi, từ chối và một lộ trình không dựa trên sinh trắc học khi có thể.
Cấm các quyết định có hậu quả dựa hoàn toàn trên cảm xúc suy ra, đặc biệt trong tuyển dụng, giáo dục, bảo hiểm, thực thi pháp luật, chăm sóc sức khỏe và tiếp cận dịch vụ. Giảm thiểu thời gian lưu trữ âm thanh và video thô, cô lập các định danh sinh trắc học và kiểm soát việc sử dụng phụ. Tài liệu nên giải thích ngữ cảnh đào tạo, mục đích sử dụng, các mục đích không hợp lệ và các yếu tố gây nhiễu đã biết như khuyết tật, che giấu, căng thẳng, văn hoá hoặc thuốc. AI Cảm Xúc là một tuyên bố đo lường cần bằng chứng, không phải một cửa sổ thần kỳ vào trải nghiệm nội tâm.
Danh sách kiểm tra triển khai thực tiễn
Biến ý tưởng thành quy trình làm việc có giới hạn, có thể kiểm thử: quan sát → tiền xử lý → suy luận → hiệu chỉnh → hỗ trợ → giám sát. Chỉ định người chịu trách nhiệm, ghi lại dữ liệu và các phụ thuộc, thiết lập chuẩn cơ bản đơn giản, đặt tiêu chí chấp nhận và dừng, kiểm thử các lỗi đại diện, và xác định giám sát, khôi phục và đánh giá trước khi mở rộng phạm vi. Ghi lại các phiên bản và giả định để đội khác có thể tái tạo kết quả và hiểu những gì đã thay đổi.
Trước khi ra mắt, tiến hành đánh giá sẵn sàng có tài liệu với những người xây dựng, vận hành, bảo mật và chịu ảnh hưởng của hệ thống. Kiểm thử các trường hợp bình thường, điều kiện biên, lỗi phụ thuộc và lạm dụng; bảo quản bằng chứng và rủi ro chưa giải quyết. Xác định người có thể phê duyệt phát hành, thay đổi ngưỡng, ghi đè kết quả hoặc dừng hoạt động. Xem lại quyết định sau khi dữ liệu thực tế xuất hiện, vì một thí điểm thành công về mặt kỹ thuật không đảm bảo hiệu suất đáng tin cậy ở quy mô lớn hơn.
- TÍN HIỆU: khuôn mặt, giọng nói, văn bản, cơ thể hoặc sinh lý.
- NGỮ CẢNH: người, văn hoá, nhiệm vụ và môi trường.
- QUYỀN HẠN: thông báo, kiểm soát, sửa lỗi và kháng cáo.
Câu hỏi thường gặp
AI có thể đọc chính xác cảm xúc từ khuôn mặt không?
Nó có thể dự đoán các nhãn trong bộ dữ liệu dựa trên chuyển động khuôn mặt, nhưng những chuyển động đó không xác định duy nhất một cảm xúc nội tại. Độ chính xác phụ thuộc mạnh vào ngữ cảnh, nhóm dân số, nhãn và thiết kế đo lường.
AI Cảm Xúc có hợp pháp không?
Điều này phụ thuộc vào cách sử dụng, dữ liệu, đối tượng và khu vực pháp lý. Một số ngữ cảnh bị cấm hoặc có rủi ro cao. Các tổ chức cần tư vấn pháp lý hiện hành, không phải một danh sách kiểm tra kỹ thuật chung.












