Mô hình và nền tảng AI
NLU (Natural Language Understanding) là gì?
Natural language understanding (NLU) là một khái niệm kỹ thuật trong lĩnh vực xử lý ngôn ngữ tự nhiên. NLU là quá trình chịu trách nhiệm dịch ngôn ngữ tự nhiên, ngôn ngữ của con người thành định dạng mà máy tính có thể giải thích. Về cơ bản, trước khi máy tính có thể xử lý dữ liệu ngôn ngữ, nó phải hiểu dữ liệu.
Các kỹ thuật cho NLU bao gồm sử dụng cú pháp và quy tắc ngữ pháp chung để cho phép máy tính hiểu ý nghĩa và ngữ cảnh của ngôn ngữ tự nhiên của con người. Mục tiêu cuối cùng của các kỹ thuật này là máy tính sẽ có một sự “hiểu biết trực giác” về ngôn ngữ, có thể viết và hiểu ngôn ngữ giống như con người, mà không cần thường xuyên tham khảo định nghĩa của từ.
Định nghĩa NLU (Natural Language Understanding)
Có nhiều kỹ thuật mà các nhà khoa học máy tính và chuyên gia NLP sử dụng để cho phép máy tính hiểu ngôn ngữ của con người. Hầu hết các kỹ thuật này thuộc loại “phân tích cú pháp”. Các kỹ thuật phân tích cú pháp bao gồm:
- lemmatization
- stemming
- phân đoạn từ
- parsing
- phân đoạn hình thái
- ngắt câu
- gán nhãn phần của câu
Các kỹ thuật phân tích cú pháp này áp dụng các quy tắc ngữ pháp cho các nhóm từ và cố gắng sử dụng các quy tắc này để suy ra ý nghĩa. Ngược lại, NLU hoạt động bằng cách sử dụng các kỹ thuật “phân tích ngữ nghĩa”.
Phân tích ngữ nghĩa áp dụng các thuật toán máy tính cho văn bản, cố gắng hiểu ý nghĩa của từ trong ngữ cảnh tự nhiên của chúng, thay vì dựa vào các phương pháp dựa trên quy tắc. Sự chính xác về mặt ngữ pháp của một cụm từ không nhất thiết tương quan với tính hợp lệ của cụm từ. Có thể có những cụm từ chính xác về mặt ngữ pháp nhưng không có nghĩa, và những cụm từ không chính xác về mặt ngữ pháp nhưng có nghĩa. Để phân biệt các khía cạnh có nghĩa nhất của từ, NLU áp dụng nhiều kỹ thuật nhằm nắm bắt ý nghĩa của một nhóm từ với sự phụ thuộc ít hơn vào cấu trúc và quy tắc ngữ pháp.
NLU là một lĩnh vực đang phát triển và thay đổi, và nó được coi là một trong những vấn đề khó khăn của trí tuệ nhân tạo. Các kỹ thuật và công cụ khác nhau đang được phát triển để giúp máy tính hiểu ngôn ngữ của con người. Hầu hết các hệ thống NLU đều có một số thành phần cốt lõi chung. Một từ vựng cho ngôn ngữ là cần thiết, cũng như một loại trình phân tích văn bản và các quy tắc ngữ pháp để hướng dẫn việc tạo ra các biểu diễn văn bản. Hệ thống cũng yêu cầu một lý thuyết ngữ nghĩa để cho phép hiểu các biểu diễn. Có nhiều lý thuyết ngữ nghĩa được sử dụng để giải thích ngôn ngữ, như phân tích ngữ nghĩa ngẫu nhiên hoặc ngữ nghĩa đơn giản.
Các kỹ thuật NLU phổ biến bao gồm:
Nhận dạng thực thể có tên là quá trình nhận dạng “thực thể có tên”, đó là những người, địa điểm và thứ quan trọng. Nhận dạng thực thể có tên hoạt động bằng cách phân biệt các khái niệm cơ bản và tham chiếu trong một văn bản, xác định thực thể có tên và đặt chúng vào các loại như vị trí, ngày, tổ chức, người, tác phẩm, v.v. Các mô hình được giám sát dựa trên các quy tắc ngữ pháp thường được sử dụng để thực hiện các nhiệm vụ NER.
Loại bỏ sự mơ hồ từ là quá trình xác định ý nghĩa, hoặc nghĩa, của một từ dựa trên ngữ cảnh mà từ đó xuất hiện. Loại bỏ sự mơ hồ từ thường sử dụng các thẻ phần của câu để ngữ cảnh hóa từ mục tiêu. Các phương pháp được giám sát của loại bỏ sự mơ hồ từ bao gồm việc sử dụng máy vector hỗ trợ và học tập dựa trên bộ nhớ. Tuy nhiên, hầu hết các mô hình loại bỏ sự mơ hồ từ đều là mô hình bán giám sát, sử dụng cả dữ liệu được gắn nhãn và không được gắn nhãn.
Ví dụ về NLU (Natural Language Understanding)
Các ví dụ phổ biến về NLU bao gồm Lý luận Tự động, Định tuyến Vé Tự động, Dịch Máy và Trả lời Câu hỏi.
Lý luận Tự động
Lý luận tự động là một lĩnh vực nhằm cung cấp cho máy tính một loại logic hoặc lý luận. Đó là một nhánh của khoa học nhận thức nhằm đưa ra các suy luận dựa trên chẩn đoán y tế hoặc giải quyết tự động các định lý toán học. NLU được sử dụng để giúp thu thập và phân tích thông tin và đưa ra kết luận dựa trên thông tin.
Định tuyến Vé Tự động
NLU thường được sử dụng để tự động hóa các nhiệm vụ dịch vụ khách hàng. Khi một vé dịch vụ khách hàng được tạo, các rô-bốt trò chuyện và máy tính khác có thể giải thích bản chất cơ bản của nhu cầu của khách hàng và định tuyến họ đến bộ phận chính xác. Các công ty nhận được hàng nghìn yêu cầu hỗ trợ mỗi ngày, vì vậy các thuật toán NLU hữu ích trong việc ưu tiên vé và cho phép các đại lý hỗ trợ xử lý chúng một cách hiệu quả hơn.
Dịch Máy
Thật khó để dịch chính xác lời nói hoặc văn bản từ một ngôn ngữ sang một ngôn ngữ khác. Trên thực tế, dịch máy là một trong những vấn đề khó khăn nhất trong NLP và NLU. Nhiều hệ thống dịch máy dựa trên các quy tắc ngôn ngữ để dịch giữa các ngôn ngữ, nhưng các nhà nghiên cứu đang theo đuổi các phương pháp dịch phức tạp hơn. Dịch máy NLU cố gắng cho phép dịch chính xác hơn bằng cách bảo tồn ngữ cảnh và thông tin ngữ nghĩa liên quan đến văn bản đích. Các hệ thống dịch máy chính xác nhất kết hợp các quy tắc ngôn ngữ với các thuật toán trích xuất ý nghĩa ngữ nghĩa.
Trả lời Câu hỏi
Nhận dạng giọng nói sử dụng các kỹ thuật NLU để cho phép máy tính hiểu câu hỏi được đặt ra bằng ngôn ngữ tự nhiên. NLU được sử dụng để cung cấp cho người dùng thiết bị một phản hồi trong ngôn ngữ tự nhiên của họ, thay vì cung cấp cho họ một danh sách các câu trả lời có thể. Khi bạn hỏi một trợ lý kỹ thuật số một câu hỏi, NLU được sử dụng để giúp máy tính hiểu câu hỏi, chọn câu trả lời phù hợp nhất dựa trên các tính năng như thực thể được nhận dạng và ngữ cảnh của các câu trước.












