Lãnh đạo tư tưởng

Làm Thế Nào Mô Hình Ngôn Ngữ Lớn (LLM) Sẽ Đưa Động Lực Cho Các Ứng Dụng Trong Tương Lai

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo tạo ra và đặc biệt là hương vị ngôn ngữ – ChatGPT đang ở mọi nơi. Công nghệ Mô hình Ngôn ngữ Lớn (LLM) sẽ đóng vai trò quan trọng trong việc phát triển các ứng dụng trong tương lai. LLM rất tốt trong việc hiểu ngôn ngữ nhờ quá trình đào tạo trước rộng lớn đã được thực hiện cho các mô hình cơ sở trên hàng nghìn tỷ dòng văn bản thuộc phạm vi công cộng, bao gồm mã. Các phương pháp như tinh chỉnh giám sát và học tập tăng cường với phản hồi của con người (RLHF) làm cho các LLM này trở nên hiệu quả hơn trong việc trả lời các câu hỏi cụ thể và trò chuyện với người dùng. Khi chúng ta bước vào giai đoạn tiếp theo của các ứng dụng AI được cung cấp bởi LLM – các thành phần chính sau sẽ rất quan trọng cho các ứng dụng thế hệ tiếp theo. Hình dưới đây cho thấy sự tiến bộ này, và khi bạn di chuyển lên chuỗi, bạn xây dựng nhiều trí tuệ và tự chủ hơn trong các ứng dụng của mình. Hãy cùng xem các cấp độ khác nhau này.

LLM calls:

Đây là các cuộc gọi trực tiếp đến mô hình hoàn thành hoặc trò chuyện bởi một nhà cung cấp LLM như Azure OpenAI hoặc Google PaLM hoặc Amazon Bedrock. Các cuộc gọi này có một lời nhắc rất cơ bản và chủ yếu sử dụng bộ nhớ nội bộ của LLM để tạo ra đầu ra.

Ví dụ: Hỏi một mô hình cơ bản như “text-davinci” để “kể một câu chuyện cười”. Bạn đưa rất ít ngữ cảnh và mô hình dựa vào bộ nhớ đã được đào tạo trước của nó để đưa ra câu trả lời (được đánh dấu màu xanh lá cây trong hình dưới – sử dụng Azure OpenAI).

Prompts:

Cấp độ trí tuệ tiếp theo là thêm nhiều ngữ cảnh hơn vào lời nhắc. Có các kỹ thuật về kỹ thuật lời nhắc có thể được áp dụng cho LLM để chúng đưa ra các phản hồi được tùy chỉnh. Ví dụ, khi tạo một email cho người dùng, một số ngữ cảnh về người dùng, mua hàng trước đó và mẫu hành vi có thể phục vụ như lời nhắc để tùy chỉnh email tốt hơn. Người dùng quen thuộc với ChatGPT sẽ biết các phương pháp khác nhau của lời nhắc như đưa ra ví dụ được sử dụng bởi LLM để xây dựng phản hồi. Lời nhắc bổ sung cho bộ nhớ nội bộ của LLM với ngữ cảnh thêm. Ví dụ dưới đây.

Embeddings:

Embeddings đưa lời nhắc lên cấp độ tiếp theo bằng cách tìm kiếm một kho kiến thức để có ngữ cảnh và lấy ngữ cảnh đó và附加 vào lời nhắc. Ở đây, bước đầu tiên là tạo một cửa hàng tài liệu lớn với văn bản không cấu trúc có thể được tìm kiếm bằng cách lập chỉ mục văn bản và tạo một cơ sở dữ liệu vector. Để làm điều này, một mô hình nhúng như ‘ada’ của OpenAI được sử dụng, nó lấy một phần văn bản và chuyển đổi nó thành một vector n chiều. Những embedding này nắm bắt được ngữ cảnh của văn bản, vì vậy các câu giống nhau sẽ có embedding gần nhau trong không gian vector. Khi người dùng nhập một truy vấn, truy vấn đó cũng được chuyển đổi thành embedding và vector đó được khớp với vector trong cơ sở dữ liệu. Vì vậy, chúng ta có được 5 hoặc 10 mảnh văn bản phù hợp hàng đầu cho truy vấn đó, tạo thành ngữ cảnh. Truy vấn và ngữ cảnh được truyền đến LLM để trả lời câu hỏi một cách giống con người.

Chains:

Hiện tại, Chains là công nghệ tiên tiến và trưởng thành nhất có sẵn, được sử dụng rộng rãi để xây dựng các ứng dụng LLM. Chains là quyết định, nơi một chuỗi các cuộc gọi LLM được kết nối với nhau với đầu ra từ một cuộc gọi LLM chảy vào một hoặc nhiều LLM khác. Ví dụ, chúng ta có thể có một cuộc gọi LLM truy vấn một cơ sở dữ liệu SQL và nhận được danh sách email của khách hàng và gửi danh sách đó đến một LLM khác sẽ tạo ra email được cá nhân hóa cho khách hàng. Những chuỗi LLM này có thể được tích hợp vào các luồng ứng dụng hiện có để tạo ra kết quả có giá trị hơn. Sử dụng chuỗi, chúng ta có thể tăng cường các cuộc gọi LLM với các đầu vào bên ngoài như cuộc gọi API và tích hợp với đồ thị kiến thức để cung cấp ngữ cảnh. Hơn nữa, hiện tại với nhiều nhà cung cấp LLM có sẵn như OpenAI, AWS Bedrock, Google PaLM, MosaicML, v.v., chúng ta có thể kết hợp và kết hợp các cuộc gọi LLM vào chuỗi. Đối với các phần tử chuỗi có trí tuệ hạn chế, một LLM thấp hơn như ‘gpt3.5-turbo’ có thể được sử dụng, trong khi đối với các nhiệm vụ tiên tiến hơn, ‘gpt4’ có thể được sử dụng. Chains cung cấp một trừu tượng cho dữ liệu, ứng dụng và các cuộc gọi LLM.

Agents:

Agents là một chủ đề của nhiều cuộc tranh luận trực tuyến, đặc biệt là liên quan đến trí tuệ nhân tạo tổng quát (AGI). Agents sử dụng một LLM tiên tiến như ‘gpt4’ hoặc ‘PaLM2’ để lên kế hoạch cho các nhiệm vụ thay vì có các chuỗi được định nghĩa trước. Vì vậy, bây giờ khi có yêu cầu của người dùng, dựa trên truy vấn, agent quyết định tập hợp các nhiệm vụ để gọi và động态 xây dựng một chuỗi. Ví dụ, khi chúng ta cấu hình một agent với một lệnh như “thông báo cho khách hàng khi lãi suất cho vay thay đổi do cập nhật quy định của chính phủ”. Khung agent tạo một cuộc gọi LLM để quyết định các bước cần thực hiện hoặc chuỗi cần xây dựng. Ở đây, nó sẽ liên quan đến việc gọi một ứng dụng để thu thập thông tin từ các trang web quy định và trích xuất lãi suất APR mới nhất, sau đó một cuộc gọi LLM tìm kiếm cơ sở dữ liệu và trích xuất email của khách hàng bị ảnh hưởng và cuối cùng một email được tạo để thông báo cho mọi người.

Final Thoughts

LLM là một công nghệ đang phát triển mạnh và các mô hình và ứng dụng tốt hơn đang được ra mắt hàng tuần. LLM đến Agents là thang trí tuệ và khi chúng ta di chuyển lên, chúng ta xây dựng các ứng dụng tự chủ phức tạp. Các mô hình tốt hơn sẽ có nghĩa là các agent hiệu quả hơn và các ứng dụng thế hệ tiếp theo sẽ được cung cấp bởi những mô hình này. Thời gian sẽ cho thấy các ứng dụng thế hệ tiếp theo sẽ tiến bộ như thế nào và sẽ được cung cấp bởi những mẫu nào.

Dattaraj Rao, Chief Data Scientist tại Persistent Systems, là tác giả của cuốn sách “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Tại Persistent Systems, Dattaraj lãnh đạo AI Research Lab khám phá các thuật toán tiên tiến trong Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI, v.v. và chứng minh tính khả dụng trong lĩnh vực Y tế, Ngân hàng và Công nghiệp. Dattaraj có 11 bằng sáng chế trong Machine Learning và Computer Vision.