Lãnh đạo tư tưởng
Làm thế nào để các mô hình LLM thực sự suy luận thông qua các vấn đề phức tạp?
Sự giới thiệu và phát triển của trí tuệ nhân tạo sinh đã diễn ra rất nhanh và mạnh mẽ đến mức thật khó để đánh giá đầy đủ mức độ thay đổi mà công nghệ này đã mang lại cho cuộc sống của chúng ta.
Hãy nhìn lại ba năm trước. Vâng, trí tuệ nhân tạo đã trở nên phổ biến hơn, ít nhất là trên lý thuyết. Nhiều người biết một số điều nó có thể làm, mặc dù ngay cả với điều đó, vẫn có những hiểu lầm lớn về khả năng của trí tuệ nhân tạo. Một cách nào đó, công nghệ này đã được trao đồng thời không đủ và quá nhiều tín nhiệm cho những gì nó thực sự có thể đạt được. Tuy nhiên, người bình thường có thể chỉ ra ít nhất một hoặc hai lĩnh vực nơi trí tuệ nhân tạo đang hoạt động, thực hiện các nhiệm vụ chuyên môn khá tốt, trong các môi trường được kiểm soát chặt chẽ. Mọi thứ ngoài điều đó đều nằm trong phòng thí nghiệm nghiên cứu, hoặc đơn giản là không tồn tại.
So sánh điều đó với ngày nay. Với không có kỹ năng nào khác ngoài khả năng viết một câu hoặc đặt câu hỏi, thế giới nằm trong tầm tay chúng ta. Chúng ta có thể tạo ra hình ảnh, âm nhạc và thậm chí cả phim mà thực sự độc đáo và tuyệt vời, và có khả năng phá vỡ toàn bộ ngành công nghiệp. Chúng ta có thể tăng cường quá trình tìm kiếm của mình, đặt một câu hỏi đơn giản mà nếu được đặt đúng, có thể tạo ra nhiều trang nội dung tùy chỉnh đủ tốt để vượt qua một nhà học giả được đào tạo tại trường đại học … hoặc một học sinh lớp ba trung bình nếu chúng ta chỉ định quan điểm. Mặc dù chúng đã trở nên phổ biến trong một hoặc hai năm, những khả năng này đã được coi là hoàn toàn không thể chỉ một vài năm trước. Lĩnh vực trí tuệ nhân tạo sinh đã tồn tại nhưng chưa thực sự cất cánh bằng bất kỳ cách nào.
Ngày nay, nhiều người đã thử nghiệm với trí tuệ nhân tạo sinh như ChatGPT, Midjourney hoặc các công cụ khác. Những người khác đã tích hợp chúng vào cuộc sống hàng ngày của mình. Tốc độ mà chúng đã phát triển là đáng kinh ngạc đến mức gần như đáng lo. Và với những tiến bộ trong sáu tháng qua, chúng ta chắc chắn sẽ bị choáng ngợp, lại và lại, trong vài năm tới.
Một công cụ cụ thể đang hoạt động trong trí tuệ nhân tạo sinh là hiệu suất của các hệ thống Tạo sinh tăng cường Tìm kiếm (RAG) và khả năng suy nghĩ thông qua các truy vấn phức tạp. Sự giới thiệu của bộ dữ liệu FRAMES, được giải thích chi tiết trong một bài viết về cách bộ dữ liệu đánh giá hoạt động, cho thấy cả trạng thái hiện tại của nghệ thuật và nơi nó đang đi. Ngay cả kể từ khi giới thiệu FRAMES vào cuối năm 2024, một số nền tảng đã phá vỡ các kỷ lục mới về khả năng suy luận thông qua các truy vấn khó khăn và phức tạp.
Hãy cùng khám phá FRAMES được thiết kế để đánh giá và hiệu suất của các mô hình trí tuệ nhân tạo sinh khác nhau. Chúng ta có thể thấy cả sự phi tập trung hóa và các nền tảng mã nguồn mở không chỉ đứng vững (đáng chú ý là Sentient Chat), mà còn cho phép người dùng có cái nhìn rõ ràng về khả năng suy luận đáng kinh ngạc mà một số mô hình trí tuệ nhân tạo có thể đạt được.
FRAMES như một Cửa sổ vào Não bộ GenAI
Bộ dữ liệu FRAMES và quá trình đánh giá của nó tập trung vào 824 câu hỏi “đa bước” được thiết kế để yêu cầu suy luận, kết nối logic, sử dụng nhiều nguồn khác nhau để thu thập thông tin quan trọng và khả năng suy luận logic để ghép chúng lại với nhau để trả lời câu hỏi. Câu hỏi cần từ hai đến 15 tài liệu để trả lời chúng chính xác, và cũng bao gồm các ràng buộc, tính toán toán học và suy luận, cũng như khả năng xử lý logic dựa trên thời gian. Nói cách khác, những câu hỏi này cực kỳ khó khăn và thực sự đại diện cho các nhiệm vụ nghiên cứu thực tế mà con người có thể thực hiện trên internet. Chúng ta đối mặt với những thách thức này mọi lúc, và phải tìm kiếm những mảnh thông tin quan trọng bị phân tán trong biển các nguồn internet, ghép thông tin lại với nhau dựa trên các trang web khác nhau, tạo ra thông tin mới bằng cách tính toán và suy luận, và hiểu cách hợp nhất những sự kiện này vào một câu trả lời chính xác cho câu hỏi.
Những gì các nhà nghiên cứu tìm thấy khi bộ dữ liệu được phát hành và thử nghiệm đầu tiên là các mô hình GenAI hàng đầu có thể đạt được độ chính xác khoảng 40% khi chúng phải trả lời bằng phương pháp đơn bước, nhưng có thể đạt được độ chính xác 73% nếu được phép thu thập tất cả các tài liệu cần thiết để trả lời câu hỏi. Vâng, 73% có thể không giống như một cuộc cách mạng. Nhưng nếu bạn hiểu chính xác những gì cần được trả lời, con số trở nên ấn tượng hơn nhiều.
Ví dụ, một câu hỏi cụ thể là: “Năm nào là năm sinh của người lãnh đạo nhóm đã biểu diễn bài hát được lấy mẫu trong bài hát Power của Kanye West?” Làm thế nào một con người sẽ giải quyết vấn đề này? Người đó có thể thấy rằng họ cần thu thập các yếu tố thông tin khác nhau, chẳng hạn như lời bài hát của bài hát Power của Kanye West, và sau đó có thể nghe bài hát (ngay cả khi không quen với nó) và có thể xác định thời điểm một bài hát khác được lấy mẫu.
Nhưng hãy nghĩ về nó: những gì một GenAI phải đạt được để phát hiện một bài hát khác ngoài bản gốc trong khi “nghe” nó? Đây là nơi một câu hỏi cơ bản trở thành một thử nghiệm tuyệt vời về trí tuệ nhân tạo thực sự thông minh. Và nếu chúng ta có thể tìm thấy bài hát, nghe nó và xác định lời bài hát được lấy mẫu, đó chỉ là bước 1. Chúng ta vẫn cần tìm ra tên của bài hát, tên của ban nhạc, ai là người lãnh đạo của ban nhạc đó và sau đó là năm sinh của người đó.
FRAMES cho thấy rằng để trả lời các câu hỏi thực tế, một lượng lớn quá trình suy nghĩ là cần thiết. Hai điều đến tâm trí ở đây.
Thứ nhất, khả năng của các mô hình GenAI phi tập trung không chỉ cạnh tranh, mà còn có khả năng thống trị kết quả, là điều đáng kinh ngạc. Một số lượng ngày càng tăng các công ty đang sử dụng phương pháp phi tập trung để mở rộng khả năng xử lý của họ trong khi đảm bảo rằng một cộng đồng lớn sở hữu phần mềm, không phải là một hộp đen tập trung sẽ không chia sẻ tiến bộ của nó. Các công ty như Perplexity và Sentient đang dẫn đầu xu hướng này, mỗi công ty có các mô hình mạnh mẽ hoạt động trên các kỷ lục độ chính xác ban đầu khi FRAMES được phát hành.
Yếu tố thứ hai là một số mô hình trí tuệ nhân tạo này không chỉ phi tập trung, mà còn mã nguồn mở. Ví dụ, Sentient Chat là cả hai, và các thử nghiệm ban đầu cho thấy sự phức tạp của suy luận của nó, nhờ vào quyền truy cập mã nguồn mở vô giá. Câu hỏi FRAMES ở trên được trả lời bằng quy trình suy nghĩ tương tự như con người sẽ sử dụng, với chi tiết suy luận của nó có sẵn để xem xét. Có thể thậm chí còn thú vị hơn, nền tảng của họ được cấu trúc như một số mô hình có thể tinh chỉnh một quan điểm và hiệu suất nhất định, ngay cả khi quá trình tinh chỉnh trong một số mô hình GenAI dẫn đến độ chính xác giảm. Trong trường hợp của Sentient Chat, nhiều mô hình khác nhau đã được phát triển. Ví dụ, một mô hình gần đây gọi là “Dobby 8B” có thể không chỉ vượt qua điểm chuẩn FRAMES, mà còn phát triển một thái độ ủng hộ tiền điện tử và tự do, điều này ảnh hưởng đến quan điểm của mô hình khi nó xử lý các mảnh thông tin và phát triển một câu trả lời.
Trên Đường chân trời
Chìa khóa cho tất cả những đổi mới đáng kinh ngạc này là tốc độ nhanh chóng đã mang chúng ta đến đây. Chúng ta phải thừa nhận rằng, nhanh như công nghệ này đã phát triển, nó sẽ chỉ tiếp tục phát triển nhanh hơn trong tương lai gần. Chúng ta sẽ có thể thấy, đặc biệt là với các mô hình GenAI phi tập trung và mã nguồn mở, ngưỡng quan trọng mà trí tuệ của hệ thống bắt đầu vượt qua ngày càng nhiều trí tuệ của chúng ta, và điều đó có nghĩa là gì cho tương lai.












