Mô hình và nền tảng AI

MambaOut: Liệu Mamba Có Thực Sự Cần Thiết Cho Vision?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong các khung máy học và trí tuệ nhân tạo hiện đại, các bộ chuyển đổi là một trong những thành phần được sử dụng rộng rãi nhất trên các lĩnh vực khác nhau, bao gồm cả loạt GPT và BERT trong Xử lý Ngôn ngữ Tự nhiên, cũng như Vision Transformers trong các nhiệm vụ tầm nhìn máy tính. Mặc dù việc bao gồm các bộ chuyển đổi trong kiến trúc mô hình mang lại sự cải thiện đáng kể về hiệu suất của mô hình, nhưng mô块 chú ý trong Bộ chuyển đổi có độ phức tạp bậc hai với chiều dài chuỗi, dẫn đến thách thức tính toán lớn. Trong những năm qua, các mô hình khác nhau đã khám phá các chiến lược khác nhau để giải quyết thách thức tính toán, bao gồm các phương pháp như kernel hóa, nén bộ nhớ lịch sử, giới hạn phạm vi trộn token và các phương pháp hạng thấp. Gần đây, các Mạng nơ-ron hồi quy như Mamba và RWKV đã thu hút sự chú ý đáng kể nhờ vào kết quả hứa hẹn của chúng trong các mô hình ngôn ngữ lớn.

Mamba, một họ mô hình có kiến trúc với một bộ trộn token giống như mạng nơ-ron hồi quy của một mô hình không gian trạng thái, đã được giới thiệu gần đây để giải quyết độ phức tạp bậc hai của các cơ chế chú ý và sau đó được áp dụng cho các nhiệm vụ tầm nhìn. Các nhà nghiên cứu đã khám phá cách kết hợp Mamba và SSM hoặc Mô hình Không gian Trạng thái vào các nhiệm vụ nhận dạng tầm nhìn, và Vision Mamba, kết hợp Mamba để phát triển các mô hình tầm nhìn đẳng hướng giống như Vision Transformer, là một ví dụ tuyệt vời về điều này. Mặt khác, LocalMamba kết hợp các thiên vị cảm ứng cục bộ để nâng cao các mô hình tầm nhìn Mamba, và khuôn khổ VMamba sử dụng mô hình Mamba cơ bản để xây dựng các mô hình phân cấp giống như ResNet và AlexNet. Tuy nhiên, liệu khuôn khổ Mamba có thực sự cần thiết cho các nhiệm vụ nhận dạng tầm nhìn? Câu hỏi này xuất hiện vì hiệu suất của họ mô hình Mamba cho các nhiệm vụ tầm nhìn đã không ấn tượng so với các mô hình truyền thống dựa trên chú ý và các mô hình convolutional.

MambaOut cố gắng trả lời liệu Mamba có phù hợp với các nhiệm vụ có đặc điểm tự hồi quy và chuỗi dài. Khuôn khổ MambaOut đưa ra giả thuyết rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn vì việc phân loại hình ảnh không phù hợp với các đặc điểm tự hồi quy hoặc chuỗi dài. Mặc dù các nhiệm vụ phân đoạn và phát hiện cũng không tự hồi quy, chúng thể hiện các đặc điểm chuỗi dài, dẫn đến khuôn khổ MambaOut đưa ra giả thuyết về tiềm năng của Mamba cho các nhiệm vụ này. Khuôn khổ MambaOut được xây dựng bằng cách xếp chồng các khối Mamba lên nhau trong khi loại bỏ mô hình không gian trạng thái, bộ trộn token cốt lõi của nó. Các kết quả thực nghiệm hỗ trợ giả thuyết được đưa ra bởi khuôn khổ MambaOut vì nó có thể vượt qua tất cả các mô hình tầm nhìn Mamba trên khuôn khổ phân loại hình ảnh ImageNet, chỉ ra rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn. Mặt khác, đối với các nhiệm vụ phát hiện và phân đoạn, khuôn khổ MambaOut không thể tái tạo hiệu suất được cung cấp bởi mô hình Mamba hiện đại, chứng tỏ tiềm năng của họ mô hình Mamba cho các nhiệm vụ tầm nhìn chuỗi dài.

Bài viết này nhằm mục đích giới thiệu khuôn khổ MambaOut một cách sâu sắc, và chúng tôi khám phá cơ chế, phương pháp, kiến trúc của khuôn khổ cùng với so sánh của nó với các khuôn khổ hiện đại.

MambaOut: Liệu Mamba Có Thực Sự Cần Thiết Cho Vision?

Với sự tiến bộ của các ứng dụng và khả năng của máy học, các Bộ chuyển đổi đã nổi lên như xương sống chính cho nhiều nhiệm vụ, cung cấp năng lượng cho các mô hình nổi bật bao gồm Vision Transformers, loạt GPT, BERT và một số khác. Tuy nhiên, bộ trộn token của bộ chuyển đổi gây ra độ phức tạp bậc hai với chiều dài chuỗi, và tạo ra thách thức tính toán lớn. Để giải quyết vấn đề này, nhiều bộ trộn token có độ phức tạp tuyến tính với chiều dài token như Linformer, Longformer, Performer, Dynamic Convolution và Big Bird đã được giới thiệu. Tuy nhiên, gần đây, các mô hình giống như Mạng nơ-ron hồi quy đang trở nên nổi bật nhờ khả năng đào tạo song song và hiệu suất hiệu quả trên các chuỗi dài. Được hướng dẫn bởi kết quả đáng chú ý của các mô hình giống như RNN, các nhà nghiên cứu đang cố gắng giới thiệu và sử dụng họ mô hình Mamba vào các nhiệm vụ nhận dạng tầm nhìn vì bộ trộn token của mô hình Mamba là mô hình không gian trạng thái có cấu trúc theo tinh thần của Mạng nơ-ron hồi quy. Tuy nhiên, kết quả thực nghiệm cho thấy rằng các khuôn khổ dựa trên mô hình không gian trạng thái cho tầm nhìn hoạt động không ấn tượng trên các nhiệm vụ tầm nhìn thực tế khi so sánh với các mô hình dựa trên chú ý và các mô hình convolutional hiện đại.

MambaOut là một nỗ lực nhằm khám phá bản chất của họ mô hình Mamba, và kết luận rằng Mamba phù hợp với các nhiệm vụ có đặc điểm tự hồi quy hoặc chuỗi dài. MambaOut đưa ra giả thuyết rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn vì việc phân loại hình ảnh không phù hợp với các đặc điểm tự hồi quy hoặc chuỗi dài. Mặc dù các nhiệm vụ phân đoạn và phát hiện cũng không tự hồi quy, chúng thể hiện các đặc điểm chuỗi dài, dẫn đến MambaOut đưa ra giả thuyết về tiềm năng của Mamba cho các nhiệm vụ này. MambaOut được xây dựng bằng cách xếp chồng các khối Mamba lên nhau trong khi loại bỏ mô hình không gian trạng thái, bộ trộn token cốt lõi của nó. Kết quả thực nghiệm cho thấy rằng khuôn khổ MambaOut không có mô hình không gian trạng thái có thể vượt qua các mô hình tầm nhìn Mamba trên khuôn khổ phân loại hình ảnh ImageNet, chỉ ra rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn. Mặt khác, đối với các nhiệm vụ phát hiện và phân đoạn, khuôn khổ MambaOut không thể tái tạo hiệu suất được cung cấp bởi mô hình Mamba hiện đại, chứng tỏ tiềm năng của họ mô hình Mamba cho các nhiệm vụ tầm nhìn chuỗi dài.

Những Nhiệm Vụ Nào Mamba Phù Hợp?

Bộ trộn token của khuôn khổ Mamba là một mô hình không gian trạng thái chọn lọc định nghĩa bốn tham số đầu vào phụ thuộc. Tính chất hồi quy của khuôn khổ phân biệt các mô hình không gian trạng thái giống như RNN với chú ý nhân quả. Trạng thái ẩn có thể được xem như một bộ nhớ có kích thước cố định lưu trữ thông tin lịch sử. Kích thước cố định có nghĩa là bộ nhớ bị mất, nhưng nó cũng đảm bảo rằng độ phức tạp tính toán của việc tích hợp bộ nhớ với đầu vào hiện tại vẫn không đổi. Ngược lại, các lớp chú ý nhân quả lưu trữ tất cả các khóa và giá trị từ các token trước, và mở rộng bằng cách thêm khóa và giá trị của token hiện tại với mỗi đầu vào mới, và bộ nhớ này không bị mất, về lý thuyết. Tuy nhiên, kích thước bộ nhớ tăng lên khi nhiều token được nhập, làm tăng độ phức tạp của việc tích hợp bộ nhớ với đầu vào hiện tại. Sự khác biệt giữa các cơ chế bộ nhớ giữa chú ý nhân quả và các mô hình giống như RNN được minh họa trong hình sau.

Vì bộ nhớ của mô hình không gian trạng thái vốn bị mất, nó không thể sánh với bộ nhớ không bị mất của chú ý nhân quả, và kết quả là, các mô hình Mamba không thể thể hiện sức mạnh của mình trong việc xử lý các chuỗi ngắn, một lĩnh vực mà cơ chế chú ý nhân quả hoạt động tốt với sự dễ dàng. Tuy nhiên, trong các tình huống liên quan đến các chuỗi dài, cách tiếp cận chú ý nhân quả gặp khó khăn do độ phức tạp bậc hai. Trong tình huống này, khuôn khổ Mamba thể hiện hiệu quả của mình trong việc trộn bộ nhớ với đầu vào hiện tại, và có thể xử lý các chuỗi dài một cách mượt mà, chỉ ra rằng họ mô hình Mamba phù hợp với việc xử lý các chuỗi dài.

Điều đáng chú ý là tính chất hồi quy của mô hình không gian trạng thái cho phép các mô hình Mamba xử lý các chuỗi dài một cách hiệu quả, nhưng nó cũng giới thiệu một số hạn chế vì nó chỉ có thể truy cập thông tin từ thời điểm hiện tại và trước đó, và loại trộn token này được gọi là chế độ nhân quả. Do tính chất nhân quả của nó, phương pháp này phù hợp với các nhiệm vụ tạo tự hồi quy.

Chế độ có thể nhìn thấy đầy đủ phù hợp với các nhiệm vụ hiểu biết nơi mô hình có thể truy cập tất cả các đầu vào cùng một lúc. Hơn nữa, chú ý nằm trong chế độ có thể nhìn thấy đầy đủ theo mặc định, và nó có thể được chuyển thành chế độ nhân quả một cách dễ dàng bằng cách áp dụng các mặt nạ nhân quả cho các bản đồ chú ý, và các mô hình giống như RNN hoạt động vốn trong chế độ nhân quả do tính chất hồi quy của chúng. Để tóm tắt, khuôn khổ Mamba phù hợp với các nhiệm vụ liên quan đến việc xử lý các chuỗi dài hoặc các nhiệm vụ yêu cầu chế độ trộn token nhân quả.

Nhiệm Vụ Nhận Dạng Tầm Nhìn, Mã Trộn Token Nhân Qua và Các Chuỗi Rất Lớn

Như đã thảo luận trước đó, chế độ trộn token có thể nhìn thấy đầy đủ cho phép phạm vi trộn không bị giới hạn, trong khi chế độ nhân quả giới hạn token hiện tại chỉ có thể truy cập thông tin từ các token trước đó. Hơn nữa, nhận dạng tầm nhìn được phân loại là một nhiệm vụ hiểu biết nơi mô hình có thể nhìn thấy toàn bộ hình ảnh cùng một lúc, và điều này loại bỏ nhu cầu về các hạn chế đối với việc trộn token, và việc áp đặt các hạn chế bổ sung đối với việc trộn token có thể làm giảm hiệu suất của mô hình một cách tiềm năng. Generally, chế độ có thể nhìn thấy đầy đủ phù hợp với các nhiệm vụ hiểu biết, trong khi chế độ nhân quả phù hợp hơn với các nhiệm vụ tự hồi quy. Hơn nữa, tuyên bố này được hỗ trợ thêm bởi thực tế rằng các mô hình BeRT và ViT được sử dụng nhiều hơn cho các nhiệm vụ hiểu biết so với các mô hình GPT.

Xác Minh Thực Nghiệm và Kết Quả

Bước tiếp theo là xác minh các giả thuyết được đề xuất bởi khuôn khổ MambaOut một cách thực nghiệm. Như được minh họa trong hình ảnh sau, khối Mamba dựa trên khối Mạng nơ-ron tích hợp cổng, và kiến trúc meta của các khối Mamba và Mạng nơ-ron tích hợp cổng có thể được xem như một tích hợp đơn giản của bộ trộn token của khuôn khổ MetaFormer và một MLP.

Khối Mamba mở rộng Mạng nơ-ron tích hợp cổng với một mô hình không gian trạng thái bổ sung, và sự hiện diện của mô hình không gian trạng thái là điều phân biệt khối Mạng nơ-ron tích hợp cổng và khối Mamba. Hơn nữa, để cải thiện tốc độ thực tế, khuôn khổ MambaOut chỉ thực hiện phép tích chập theo chiều sâu trên các kênh một phần, và như được minh họa trong thuật toán sau, việc thực hiện khối Mạng nơ-ron tích hợp cổng là đơn giản, hiệu quả và tinh tế.

Nhiệm Vụ Phân Loại Hình Ảnh

ImageNet đóng vai trò là điểm chuẩn cho các nhiệm vụ phân loại hình ảnh vì nó bao gồm hơn một nghìn lớp phổ biến, hơn 1,3 triệu hình ảnh đào tạo và hơn 50.000 hình ảnh xác thực. Dữ liệu tăng cường được sử dụng cho thí nghiệm bao gồm cắt hình ảnh ngẫu nhiên, Mixup, thay đổi màu sắc, xóa ngẫu nhiên, CutMix và Rand Augment. Bảng sau tóm tắt hiệu suất của họ mô hình Mamba, mô hình MambaOut và các mô hình dựa trên chú ý và convolutional khác trên tập dữ liệu ImageNet. Như có thể thấy, khuôn khổ MambaOut không có mô hình không gian trạng thái vượt qua các mô hình tầm nhìn Mamba một cách nhất quán trên tất cả các kích thước mô hình.

Ví dụ, mô hình MambaOut-Nhỏ trả về điểm số độ chính xác hàng đầu là hơn 84%, cao hơn 0,4% so với đối thủ Mamba gần nhất. Kết quả này hỗ trợ mạnh mẽ giả thuyết đầu tiên cho rằng việc giới thiệu mô hình không gian trạng thái cho các nhiệm vụ phân loại hình ảnh là không cần thiết.

Nhiệm Vụ Phát Hiện Đối Tượng và Phân Đoạn

COCO đóng vai trò là điểm chuẩn cho các nhiệm vụ phát hiện đối tượng và phân đoạn. Mặc dù khuôn khổ MambaOut có thể vượt qua hiệu suất của một số mô hình tầm nhìn Mamba, nhưng nó vẫn không thể sánh với các mô hình tầm nhìn Mamba hiện đại, bao gồm LocalVMamba và VMamba. Sự chênh lệch về hiệu suất của MambaOut so với các mô hình tầm nhìn hiện đại nhấn mạnh vào lợi ích của việc tích hợp họ mô hình Mamba vào các nhiệm vụ tầm nhìn chuỗi dài. Tuy nhiên, điều đáng chú ý là vẫn còn một khoảng cách hiệu suất đáng kể giữa các mô hình convolution-attention-hybrid hiện đại và các mô hình tầm nhìn Mamba.

Suy Nghĩ Cuối Cùng

Họ mô hình Mamba dường như phù hợp với các nhiệm vụ liên quan đến đặc điểm tự hồi quy và chuỗi dài. Khuôn khổ MambaOut đưa ra giả thuyết rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn vì việc phân loại hình ảnh không phù hợp với các đặc điểm tự hồi quy hoặc chuỗi dài. Mặc dù các nhiệm vụ phân đoạn và phát hiện cũng không tự hồi quy, chúng thể hiện các đặc điểm chuỗi dài, dẫn đến khuôn khổ MambaOut đưa ra giả thuyết về tiềm năng của Mamba cho các nhiệm vụ này. Khuon khổ MambaOut được xây dựng bằng cách xếp chồng các khối Mamba lên nhau trong khi loại bỏ mô hình không gian trạng thái, bộ trộn token cốt lõi của nó. Các kết quả thực nghiệm hỗ trợ giả thuyết được đưa ra bởi khuôn khổ MambaOut vì nó có thể vượt qua tất cả các mô hình tầm nhìn Mamba trên khuôn khổ phân loại hình ảnh ImageNet, chỉ ra rằng Mamba không cần thiết cho các nhiệm vụ tầm nhìn. Mặt khác, đối với các nhiệm vụ phát hiện và phân đoạn, khuôn khổ MambaOut không thể tái tạo hiệu suất được cung cấp bởi mô hình Mamba hiện đại, chứng tỏ tiềm năng của họ mô hình Mamba cho các nhiệm vụ tầm nhìn chuỗi dài.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.