Góc nhìn Anderson

AI Mới Dự Đoán Phản Ứng Tiếp Theo Của Bạn Dựa Trên Các Cuộc Trò Chuyện Trước Đó

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
AI-generated image (GPT Image 2): street scene showing a woman in a beige coat looking at her smartwatch beside an orange notification reading 'You regretted your last rushed purchase', with blurred pedestrians and shopfronts in the background, enclosed within a distressed yellow-and-black border labeled 'AI FANTASY INSIDE' and 'REALITY OUTSIDE' with arrows and hazard markings.

Các nhà nghiên cứu tại MIT đã phát triển một hệ thống dựa trên mô hình ngôn ngữ lớn (LLM) học các mô hình lặp lại từ vài tuần các cuộc trò chuyện thực tế của một người, để dự đoán hành vi hội thoại tiếp theo có khả năng xảy ra của họ.

 

Nếu AI có thể thực sự truy cập vào cuộc sống của bạn, và có thể thực sự được phép hiểu bạn trong một khoảng thời gian kéo dài hoặc thậm chí liên tục, thì nó có khả năng học cách dự đoán hành động, quyết định – và ngay cả câu nói tiếp theo mà bạn có khả năng nói; tất cả dựa trên những gì nó đã tổng hợp từ hàng ngàn giờ phân tích các tương tác của bạn.

Những người trong chúng ta đã quen dùng các Mô hình Ngôn ngữ Lớn (LLM) như ChatGPT và Claude chắc đã nhận ra xu hướng “dự đoán nhu cầu” này, rõ ràng dựa trên lịch sử sử dụng của chúng ta; và, có lẽ, đã hoan nghênh nó, vì việc ghi nhớ và ngữ cảnh hiện đã trở thành một điểm ma sát quan trọng trong việc xây dựng một mối quan hệ làm việc hiệu quả với hệ thống AI.

Tuy nhiên, việc cung cấp thông tin tạm thời và ngay cả ‘trực tiếp truyền phát’ thông tin về cuộc sống và các cuộc liên lạc của bạn cho một hệ thống AI do công ty vì lợi nhuận vận hành, có thể nói, là một rủi ro tiềm ẩn về quyền riêng tư và bảo mật; trong khi dịch vụ sẽ trở nên hữu ích hơn rất nhiều đối với bạn, sự cám dỗ cho công ty chia sẻ dữ liệu của bạn, kết hợp với nguy cơ một rò rỉ trực tuyến hoặc trộm dữ liệu, có thể khiến mức độ tích hợp AI/người này trở thành một triển vọng không khôn ngoan.

Nếu Chúng Ta Có Thể Có Những Điều Tốt Đẹp…

Thật ra, tôi phải đưa ra “cảnh báo dịch vụ công” trước khi đề cập tới một bài báo mới thú vị từ MIT, dường như tồn tại trong một thế giới tốt hơn, nơi dữ liệu kiểu này có thể được bao gói trong các vòng tròn an toàn và thực sự đáng tin cậy, để sức mạnh thực sự của AI phân tích có thể được dùng vì lợi ích thực sự của cá nhân.

Bài nghiên cứu mới đề xuất một hệ thống, với sự cho phép của người dùng và với quyền kiểm soát dữ liệu thu thập được, một chiếc đồng hồ thông minh mà người dùng đeo liên tục ghi lại các cuộc trò chuyện nhằm khai thác các mô hình hành vi:

From the new MIT paper, an illustration of the proposed behavioral prediction pipeline. Conversations collected over several weeks reveal a recurring behavioral pattern, which is then used to predict the user's likely next behavior and deliver a smartwatch reminder before the anticipated action occurs. Source - https://arxiv.org/pdf/2608.13454

Từ bài báo mới của MIT, minh họa quy trình dự đoán hành vi được đề xuất. Các cuộc trò chuyện được thu thập trong vài tuần cho thấy một mô hình hành vi lặp lại, sau đó được dùng để dự đoán hành vi tiếp theo có khả năng của người dùng và gửi lời nhắc trên đồng hồ thông minh trước khi hành động dự kiến xảy ra. Nguồn

Bài báo – có tựa đề Before You Say It: Anticipating Verbal Behavior from Longitudinal Everyday Conversations with LLMs – ghi lại một thí nghiệm trong đó hơn 1.000 giờ các cuộc trò chuyện tự nhiên (tức là cơ hội, thực tế) từ 14 người tham gia được thu thập qua đồng hồ thông minh, sau đó được chép lại, chuyển thành lịch sử hành vi có cấu trúc, và cung cấp cho Gemini 2.5 Pro, kèm theo các lời nhắc có liên quan đến hành vi và các quy tắc hành vi được trích xuất, để dự đoán hành vi hội thoại tiếp theo có khả năng của mỗi người dùng.

(Và giờ có thể rõ ràng vì sao bài báo mới này cần một số bối cảnh về quyền riêng tư)

Nghiên cứu mới thực chất là một thí nghiệm thực địa cho (một số) công trình trước đó của các tác giả vào năm 2026 Mind Mapper* , mở rộng công trình ấy bằng cách đưa lý thuyết vào thực tiễn, và kiểm tra xem các mô hình hành vi đã khai thác có thực sự dự đoán được hành vi hội thoại tiếp theo của người dùng trong thời gian thực, chứ không chỉ mô tả các xu hướng lặp lại.

Bốn tác giả cho biết:

‘Kết quả của chúng tôi cho thấy các mô hình hành vi cụ thể theo tình huống, được khai thác từ các cuộc trò chuyện dài hạn, có thể cải thiện đáng kể việc dự đoán xu hướng hành vi lời nói của người dùng. Một điểm mạnh then chốt của phương pháp của chúng tôi là biểu diễn chúng dưới dạng các mô hình hành vi có thể đọc được bởi con người, có điều kiện ngữ cảnh, kèm theo các điều kiện ngoại lệ rõ ràng mà người dùng có thể xem xét và tinh chỉnh.’

‘Người tham gia đánh giá cao tính minh bạch này, [nhiều người] cảm thấy hài lòng khi có thể đọc, chỉnh sửa và đặt mục tiêu cá nhân cho các mô hình đã suy ra.’

‘Người tham gia cũng suy ngẫm về chiến lược cá nhân để thay đổi hành vi, gợi ý cách các hệ thống chủ động có thể hỗ trợ bằng cách chuyển hướng chú ý, đề xuất các lựa chọn thay thế, và đưa ra các cách diễn giải mới gắn liền với mục tiêu của họ.’

‘Điều này mở ra khả năng AI dự đoán, làm việc cùng người dùng — dựa trên các mô hình mà họ nhận ra và các chiến lược mà họ đã thấy hiệu quả.’

Phương Pháp

Công trình đã đề cập, Mind Mapper là nền tảng của hệ thống mới. Quy trình này được thiết kế để học các quy tắc hành vi lặp lại từ những cuộc trò chuyện do đồng hồ thông minh ghi lại trong nhiều tuần, thay vì dự đoán trực tiếp lời nói tương lai hoặc dựa vào các bộ dữ liệu chung hay có sẵn. Trong quy trình Mind Mapper, toàn bộ cuộc trò chuyện được phiên âm, ẩn danh và xử lý qua nhiều giai đoạn của quy trình GPT-5**.

(Lưu ý rằng do các biện pháp bảo vệ bài báo cũ, chúng tôi không thể cung cấp hình ảnh từ bài báo như thường lệ, vì những bản độ phân giải thấp được công khai quá khó đọc.)

Illustration of the behavioral prediction pipeline. Conversations collected over several weeks are converted into context-dependent behavioral rules, which are refined with supporting and contradictory evidence before being applied to new conversations to predict the user's most likely next conversational response.

Từ bài báo mới, minh họa quy trình dự đoán hành vi. Các cuộc trò chuyện được thu thập trong vài tuần được chuyển thành các quy tắc hành vi phụ thuộc vào ngữ cảnh, sau đó được tinh chỉnh bằng bằng chứng ủng hộ và phản bác, trước khi áp dụng cho các cuộc trò chuyện mới nhằm dự đoán phản hồi hội thoại tiếp theo có khả năng nhất của người dùng.

Quy trình tạo ra các quy tắc hành vi ứng viên dạng “nếu–thì” tức là các quy tắc liên kết tình huống hội thoại với phản hồi có khả năng xảy ra; tìm bằng chứng ủng hộ và phản bác; hợp nhất những quy tắc chồng lấn; loại bỏ giả thuyết yếu; đồng thời gán ước lượng độ tin cậy và xác suất.

Người tham gia

Mười bốn người trưởng thành nói tiếng Anh đeo đồng hồ thông minh trong sinh hoạt thường ngày từ bảy đến mười ngày. Bộ phát hiện hoạt động giọng nói trên thiết bị chỉ ghi âm khi nhận thấy có lời nói, rồi gửi các đoạn âm thanh dài 2–3 phút đến máy chủ từ xa để xử lý.

Người tham gia nhận 100 USD và phải thông báo cho những người ở gần rằng cuộc trò chuyện đang được ghi âm, đồng thời xin sự đồng ý của người khác trước mỗi lần tương tác như vậy.

Phiên âm và loại bỏ thông tin nhận dạng

Các đoạn âm thanh được xử lý bằng mô hình Nova-3-meeting của Deepgram để phiên âm hội thoại và phân biệt người nói. Sau đó, SpeechBrain được dùng làm mô hình xác minh người nói, đối chiếu giọng của người tham gia với mẫu đăng ký dài 20 giây.

Mô hình spaCy nhận dạng thực thể có tên (NER) thay thế mọi tên được nhắc đến cùng các thông tin nhận dạng cá nhân khác bằng ký hiệu ẩn danh. Âm thanh gốc sau đó bị xóa; chỉ các bản phiên âm được mã hóa bằng AES-256-GCM được lưu cục bộ trên đồng hồ thông minh.

Sau giai đoạn thu thập, người tham gia có thể xem lại từng bản phiên âm hội thoại của mình qua giao diện web, xóa nội dung không muốn đưa vào nghiên cứu và sửa nhãn người nói hoặc bối cảnh hội thoại khi cần.

Trung bình, chỉ 0,16% bản phiên âm bị xóa và 2,48% phân đoạn được đánh dấu là phân loại sai, để lại bộ dữ liệu gồm 15.066 lượt phát ngôn của 14 người tham gia: 57% thuộc về người đeo đồng hồ và 43% thuộc về người nói khác. Độ dài trung bình mỗi lượt phát ngôn là 49 từ.

(Tuy bài báo không đề cập, có thể cho rằng người tham gia vẫn tương đối cảnh giác với việc tham gia các trao đổi lời nói quá riêng tư khi đeo đồng hồ.)

Các bản phiên âm được làm sạch thêm bằng cách loại bỏ những trao đổi quá ngắn và những tiếng ngập ngừng thường gặp như “err” và “um”; sau đó ghép các câu bị chia nhỏ thành lượt phát ngôn hoàn chỉnh. Bước này đưa bộ dữ liệu cuối cùng xuống còn 9.901 lượt phát ngôn.

Để đánh giá phương pháp, Gemini 2.5 Pro được yêu cầu dự đoán phản hồi tiếp theo của từng người tham gia dựa trên phần hội thoại đã diễn ra. Hiệu quả sau đó được so sánh với ba loại đầu vào: chỉ lịch sử hội thoại; bản tóm tắt hội thoại cô đọng; và các quy tắc hành vi Mind Mapper mới. Cách này cho phép đo trực tiếp đóng góp của những mẫu hành vi đã học.

GPT-5 được dùng làm bộ chấm điểm tự động cho các dự đoán; một đợt đánh giá riêng của con người xác nhận độ tin cậy của việc chấm điểm này.

Dữ Liệu và Kiểm Thử

Kết quả kiểm tra cho thấy phương pháp dựa trên mẫu hành vi của nhóm tác giả vượt đáng kể các phương pháp cơ sở được thử nghiệm. Độ chính xác liên tục cải thiện khi dữ liệu hội thoại tích lũy thêm:

Test results comparing three prediction approaches. Left, prediction accuracy improves steadily as more conversational data becomes available only when the system used learns behavioral patterns, while the baseline approaches change little. Right, the same approach achieves substantially higher scores on participant-identified intention-to-change conversations.

Kết quả kiểm tra so sánh ba phương pháp dự đoán. Bên trái, độ chính xác dự đoán tăng dần khi dữ liệu hội thoại ngày càng sẵn sàng, nhưng chỉ khi hệ thống học được các mô hình hành vi; trong khi các phương pháp cơ sở thay đổi ít. Bên phải, cùng một phương pháp đạt điểm cao đáng kể trên các cuộc trò chuyện mà người tham gia xác định có ý định thay đổi.

Nhóm tác giả cho rằng hệ thống đặc biệt hiệu quả trong việc dự đoán những hành vi mà người tham gia đã nêu rõ là muốn thay đổi.

Một nghiên cứu xác thực với 40 người đánh giá độc lập xác nhận kết quả đánh giá tự động. Phương pháp dựa trên mẫu hành vi được xếp cao nhất trong 43% tình huống thử nghiệm, so với 24% cho phương pháp dùng toàn bộ ngữ cảnh, 18% cho phương pháp zero-shot và 15% cho bản tóm tắt dạng tường thuật.

Đánh giá của con người phù hợp chặt chẽ với cách chấm điểm của mô hình trên các phương diện ý định giao tiếp, mức độ cụ thểvà độ phức tạp chức năng. Theo nhóm tác giả, điều này xác nhận tính phù hợp của việc dùng bộ chấm tự động cho hành vi hội thoại.

Hai nghiên cứu tiếp nối kiểm tra phản ứng của mọi người đối với các mẫu hành vi được khai thác từ dữ liệu của họ và xem những dự đoán này có thực sự giúp thay đổi thói quen hay không. Trước hết, người tham gia xem lại các quy tắc để đánh dấu những hành vi muốn bỏ. Một số người quay lại vài tháng sau để thảo luận về các chiến lược đã thử và những kiểu nhắc nhở nhẹ của trợ lý có thể giúp ích trong đời sống thường ngày.

Người tham gia đánh dấu 114 thói quen muốn bỏ, tương ứng 912 thời điểm hội thoại. Khi thử nghiệm trên những trao đổi này, phương pháp dựa trên mẫu hành vi vượt các phương pháp tiêu chuẩn khoảng 40%. Nhóm tác giả cho rằng hệ thống hoạt động tốt nhất khi dự đoán những thói quen đã ăn sâu mà người dùng chủ động muốn thay đổi.

Nhóm tác giả kết luận:

‘Tổng thể, các phát hiện của chúng tôi cung cấp bằng chứng rằng hành vi lời nói riêng biệt của mỗi người có thể được dự đoán từ dữ liệu hội thoại dài hạn.’

‘Điều này mở ra những khả năng mới cho các hệ thống AI tiềm năng trong tương lai, có khả năng nhận thức ngữ cảnh, dự đoán, chủ động và cá nhân hoá.’

Kết Luận

Ngoài các ứng dụng được chính phủ quản lý chặt chẽ, chủ yếu trong y tế công và chăm sóc tâm thần, đồng thời không có bất kỳ sự ép buộc công khai hay ngầm nào buộc người dân tham gia, chẳng hạn giảm phí bảo hiểm nhà nước nếu họ đồng ý… khó có thể hình dung một cách sử dụng phương pháp này mà không đe dọa quyền riêng tư và sự bất khả xâm phạm đời tư của người tham gia, đặc biệt nếu kết hợp với các tác nhân AI có thể đối chiếu dữ liệu hội thoại đã ghi với dữ liệu số hoặc những loại dữ liệu khác liên quan đến cá nhân đó.

Bài báo của MIT đặt phương pháp này trong một bối cảnh thú vị và có phần mang tính hỗ trợ trị liệu, chẳng hạn gửi lời nhắc về chế độ ăn phù hợp với hoàn cảnh. Tuy nhiên, một hệ thống như vậy dường như có khả năng thu hút sự quan tâm và đầu tư mạnh hơn từ các nhà quảng cáo, cơ quan quản lý người được tha có điều kiện và nhà tù, công ty bảo hiểm cùng nhiều tổ chức doanh nghiệp hoặc nhà nước muốn biết thêm điều chúng ta đang nghĩ.

Nếu có một lý do thật thuyết phục để sử dụng AI cục bộ được cách ly bảo vệ và hoàn toàn thuộc quyền sở hữu của người dùng, thì đó chính là những hệ thống như thế này, nơi việc dữ liệu bị xâm phạm có thể gây hậu quả nghiêm trọng.

Dù vậy, lịch sử công nghệ quảng cáo và giám sát trong những năm gần đây đã cho thấy xu hướng người tiêu dùng thờ ơ — liệu sự thiếu quan tâm ấy có thể kéo dài đến cả một hệ thống xâm nhập sâu và hiện diện khắp nơi như thế này không?

 

* Một ấn bản được bảo vệ chặt chẽ hơn nhiều, không có hình ảnh độ phân giải cao công khai, mặc dù nội dung văn bản có thể được đọc bằng cách vượt qua một vài rào cản.

** Không muốn làm quá mức, nhưng bài báo cũ khó tiếp cận hơn đáng kể, vì vậy xin hãy kiên trì!

Được xuất bản lần đầu vào thứ Năm, ngày 20 tháng 8 năm 2026

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai