Mô hình và nền tảng AI

Mamba: Định nghĩa lại Mô hình Chuỗi và Outforming Kiến trúc Transformer

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong bài viết này về Mamba, chúng tôi sẽ khám phá cách mô hình trạng thái không gian (SSM) đổi mới này cách mạng hóa mô hình chuỗi. Được phát triển bởi Albert Gu và Tri Dao, Mamba được phân biệt bởi hiệu quả của nó trong việc xử lý các chuỗi phức tạp trong các lĩnh vực như xử lý ngôn ngữ, genomics và phân tích âm thanh. Mô hình chuỗi tuyến tính theo thời gian với không gian trạng thái chọn lọc đảm bảo hiệu suất vượt trội trên các phương thức đa dạng này.

Chúng tôi sẽ đi sâu vào khả năng của Mamba trong việc vượt qua các thách thức tính toán mà các mô hình Transformer truyền thống phải đối mặt, đặc biệt là với các chuỗi dài. Cách tiếp cận chọn lọc trong các mô hình trạng thái không gian cho phép thực hiện suy luận nhanh hơn và tỷ lệ tuyến tính với độ dài chuỗi, cải thiện đáng kể hiệu suất.

Mamba’s uniqueness lies in its rapid processing capability, selective SSM layer, and hardware-friendly design inspired by FlashAttention. These features enable Mamba to outperform many existing models, including those based on the transformer approach, making it a noteworthy advancement in machine learning.

Transformers vs Mamba

Transformers, như GPT-4, đã thiết lập các tiêu chuẩn trong xử lý ngôn ngữ tự nhiên. Tuy nhiên, hiệu quả của chúng giảm khi các chuỗi dài hơn. Đây là nơi Mamba vượt lên, với khả năng xử lý các chuỗi dài hơn một cách hiệu quả và kiến trúc độc đáo của nó giúp đơn giản hóa toàn bộ quá trình.

Transformers có khả năng xử lý các chuỗi dữ liệu, chẳng hạn như văn bản cho các mô hình ngôn ngữ. Không giống như các mô hình trước đó xử lý dữ liệu tuần tự, Transformers xử lý toàn bộ chuỗi đồng thời, cho phép chúng nắm bắt các mối quan hệ phức tạp trong dữ liệu.

Họ sử dụng cơ chế chú ý, cho phép mô hình tập trung vào các phần khác nhau của chuỗi khi thực hiện dự đoán.

Cơ chế chú ý này được tính toán bằng cách sử dụng ba tập hợp trọng số: truy vấn, khóa và giá trị, được dẫn xuất từ dữ liệu đầu vào. Mỗi phần tử trong một chuỗi được so sánh với mọi phần tử khác, cung cấp một trọng số thể hiện mức độ quan trọng, hoặc “chú ý”, mà mỗi phần tử nên nhận được khi dự đoán phần tử tiếp theo trong chuỗi.

Transformers duy trì hai khối chính: bộ mã hóa, xử lý dữ liệu đầu vào, và bộ giải mã, tạo ra đầu ra. Bộ mã hóa bao gồm nhiều lớp, mỗi lớp chứa hai lớp con: cơ chế chú ý tự đa đầu và một mạng nơ-ron hồi quy vị trí đơn giản. Bình thường hóa và kết nối dư được sử dụng tại mỗi lớp con để giúp trong việc đào tạo các mạng sâu.

Bộ giải mã cũng có các lớp với hai lớp con tương tự như bộ mã hóa nhưng thêm một lớp con thứ ba thực hiện chú ý đa đầu trên đầu ra của bộ mã hóa. Bản chất tuần tự của bộ giải mã đảm bảo rằng các dự đoán cho một vị trí chỉ có thể xem xét các vị trí trước đó, giữ nguyên tính tự hồi.

Ngược lại, mô hình Mamba sử dụng một cách tiếp cận khác. Trong khi Transformers giải quyết vấn đề về các chuỗi dài bằng cách sử dụng các cơ chế chú ý phức tạp hơn, Mamba sử dụng không gian trạng thái chọn lọc, cung cấp một phương pháp hiệu quả hơn.

Đây là một cái nhìn tổng quan cao cấp về cách một transformer hoạt động:

  1. Xử lý Đầu vào: Transformers đầu tiên mã hóa dữ liệu đầu vào thành một định dạng mà mô hình có thể hiểu, thường sử dụng các bản nhúng cũng kết hợp vị trí của mỗi phần tử trong chuỗi.
  2. Cơ chế Chú ý: Tại lõi của nó, cơ chế chú ý tính toán một điểm số thể hiện mức độ tập trung vào các phần khác của chuỗi đầu vào khi hiểu một phần tử hiện tại.
  3. Kiến trúc Bộ mã hóa – Bộ giải mã: Mô hình transformer được cấu thành từ một bộ mã hóa để xử lý đầu vào và một bộ giải mã để tạo ra đầu ra. Mỗi bộ bao gồm nhiều lớp mà tinh chỉnh sự hiểu biết của mô hình về đầu vào.
  4. Chú ý Đa đầu: Trong cả bộ mã hóa và bộ giải mã, chú ý đa đầu cho phép mô hình đồng thời chú ý đến các phần khác nhau của chuỗi từ các không gian đại diện khác nhau, cải thiện khả năng học hỏi từ các ngữ cảnh đa dạng.
  5. Mạng Nơ-ron Hồi quy Vị trí: Sau khi chú ý, một mạng nơ-ron đơn giản xử lý đầu ra của mỗi vị trí riêng biệt và giống nhau. Điều này được kết hợp với đầu vào thông qua một kết nối dư và theo sau là bình thường hóa lớp.
  6. Tạo Đầu ra: Bộ giải mã sau đó dự đoán một chuỗi đầu ra, bị ảnh hưởng bởi ngữ cảnh của bộ mã hóa và những gì nó đã tạo ra cho đến nay.

Khả năng của transformer trong việc xử lý các chuỗi song song và cơ chế chú ý mạnh mẽ của nó làm cho nó mạnh mẽ cho các nhiệm vụ như dịch và tạo văn bản.

Ngược lại, mô hình Mamba hoạt động khác bằng cách sử dụng không gian trạng thái chọn lọc để xử lý các chuỗi. Cách tiếp cận này giải quyết sự không hiệu quả tính toán trong Transformers khi đối mặt với các chuỗi dài. Thiết kế của Mamba cho phép suy luận nhanh hơn và tỷ lệ tuyến tính với độ dài chuỗi, thiết lập một mô hình mới cho mô hình chuỗi có thể hiệu quả hơn, đặc biệt là khi các chuỗi trở nên dài hơn.

Mamba

</div

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.