Mô hình và nền tảng AI
Mô hình LLM mã nguồn mở mạnh nhất hiện nay: Meta LLAMA 3.1-405B
Llama 3.1-405B, được phát triển bởi Meta AI, đại diện cho một bước tiến quan trọng trong các mô hình ngôn ngữ mã nguồn mở. Với 405 tỷ tham số, nó đứng là mô hình ngôn ngữ công khai lớn nhất cho đến nay, cạnh tranh và thậm chí vượt qua một số mô hình độc quyền tiên tiến nhất trong các điểm chuẩn khác nhau.
Tính năng chính:
- 405 tỷ tham số
- Độ dài ngữ cảnh 128K token
- Hỗ trợ đa ngôn ngữ (8 ngôn ngữ)
- Phiên bản điều chỉnh hướng dẫn có sẵn
- Mã nguồn mở với giấy phép permissive
Việc phát hành một mô hình mạnh như vậy trong lĩnh vực mã nguồn mở là một bước ngoặt, dân chủ hóa việc tiếp cận các khả năng AI tiên tiến và thúc đẩy đổi mới trên toàn ngành.
Kiến trúc và huấn luyện mô hình
Quá trình bắt đầu với việc chuyển đổi các token văn bản đầu vào thành các bản nhúng token. Các bản nhúng này đi qua nhiều lớp tự chú ý và mạng nơ-ron cấp tiến, cho phép mô hình nắm bắt các mối quan hệ và phụ thuộc phức tạp trong văn bản. Cơ chế giải mã tự hồi quy sau đó tạo ra các token văn bản đầu ra, hoàn thành quá trình.

-
Chú ý nhóm truy vấn (GQA)
Llama 3.1 sử dụng Chú ý nhóm truy vấn, đây là một kỹ thuật tối ưu quan trọng không được đề cập đầy đủ trong phản hồi trước. Hãy cùng khám phá kỹ hơn:
Chú ý nhóm truy vấn (GQA) là một biến thể của chú ý đa đầu, nhằm giảm chi phí tính toán và sử dụng bộ nhớ trong quá trình suy luận, đặc biệt là đối với các chuỗi dài. Trong mô hình Llama 3.1 405B, GQA được thực hiện với 8 đầu khóa-giá trị.
Dưới đây là cách GQA hoạt động:
- Thay vì có các dự án khóa và giá trị riêng biệt cho mỗi đầu chú ý, GQA nhóm nhiều đầu truy vấn để chia sẻ cùng các đầu khóa và giá trị.
- Việc nhóm này giảm đáng kể số lượng tham số trong các dự án khóa và giá trị, dẫn đến kích thước mô hình nhỏ hơn và tốc độ suy luận nhanh hơn.
- Tính toán chú ý có thể được biểu thị như:
Chú ý(Q, K, V) = softmax(QK^T / sqrt(d_k))VTrong đó Q được nhóm thành g nhóm, và K và V có ít đầu hơn Q.
Lợi ích của GQA trong Llama 3.1 405B bao gồm:
- Giảm bộ nhớ: Ít dự án khóa và giá trị hơn có nghĩa là ít bộ nhớ hơn được yêu cầu để lưu trữ các tham số mô hình.
- Tốc độ suy luận nhanh hơn: Với ít tính toán hơn cần thiết cho các dự án khóa và giá trị, tốc độ suy luận được cải thiện.
- Hiệu suất được duy trì: Mặc dù giảm tham số, GQA đã được chứng minh là duy trì hiệu suất so sánh với chú ý đa đầu tiêu chuẩn trong nhiều nhiệm vụ.
-
Huấn luyện tiền xử lý hai giai đoạn cho ngữ cảnh mở rộng
Bài viết đề cập đến quá trình huấn luyện tiền xử lý hai giai đoạn để đạt được cửa sổ ngữ cảnh 128K token. Đây là một khía cạnh quan trọng của khả năng của Llama 3.1 405B:
Giai đoạn 1: Huấn luyện tiền xử lý ban đầu trên 8K token
- Mô hình được huấn luyện trước trên các chuỗi lên đến 8K token.
- Giai đoạn này cho phép mô hình học hiểu và tạo ngôn ngữ chung.
Giai đoạn 2: Huấn luyện tiếp theo để mở rộng ngữ cảnh
- Sau khi huấn luyện ban đầu, mô hình trải qua quá trình huấn luyện tiếp theo để tăng độ dài ngữ cảnh lên 128K token.
- Giai đoạn này liên quan đến các chế độ huấn luyện được thiết kế cẩn thận để giúp mô hình tổng quát hóa lên các chuỗi dài hơn mà không mất khả năng xử lý các ngữ cảnh ngắn hơn.
-
Khả năng đa phương tiện
Mặc dù phản hồi trước đã đề cập đến khả năng đa phương tiện, chúng ta có thể mở rộng về cách Llama 3.1 405B thực hiện khả năng này:
Phương pháp thành phần:
- Llama 3.1 405B sử dụng các bộ mã hóa riêng biệt cho các phương tiện khác nhau (ví dụ: hình ảnh, giọng nói).
- Những bộ mã hóa này chuyển đổi đầu vào từ các phương tiện khác nhau thành không gian nhúng chung mà mô hình ngôn ngữ có thể hiểu.
Tích hợp với mô hình ngôn ngữ:
- Đầu ra từ các bộ mã hóa chuyên dụng này sau đó được đưa vào mô hình ngôn ngữ chính.
- Điều này cho phép Llama 3.1 405B xử lý và hiểu các loại dữ liệu khác nhau đồng thời, cho phép nó thực hiện các nhiệm vụ liên quan đến nhiều phương tiện.
Cơ chế chú ý chéo:
- Để xử lý tích hợp các phương tiện khác nhau, Llama 3.1 405B có thể sử dụng các cơ chế chú ý chéo.
- Những cơ chế này cho phép mô hình chú ý đến thông tin liên quan từ các phương tiện khác nhau khi tạo văn bản hoặc thực hiện các nhiệm vụ khác.
Khả năng đa phương tiện của Llama 3.1 405B mở ra nhiều ứng dụng, chẳng hạn như:
- Tạo chú thích hình ảnh và trả lời câu hỏi hình ảnh
- Chuyển đổi giọng nói sang văn bản với hiểu biết ngữ cảnh
- Nhiệm vụ lý luận đa phương tiện kết hợp văn bản, hình ảnh và có thể các loại dữ liệu khác
Chi tiết huấn luyện
- Được huấn luyện trên hơn 15 nghìn tỷ token
- Cụm GPU tùy chỉnh với 39,3 triệu giờ GPU cho mô hình 405B
- Thu thập dữ liệu đa dạng cho khả năng đa ngôn ngữ
Phiên bản điều chỉnh hướng dẫn đã trải qua quá trình huấn luyện bổ sung:
- Huấn luyện tinh chỉnh trên các tập dữ liệu hướng dẫn công khai
- Hơn 25 triệu ví dụ được tạo tổng hợp
- Huấn luyện tinh chỉnh có giám sát (SFT) và Học tăng cường với phản hồi của con người (RLHF)
Điểm chuẩn hiệu suất
Bảng so sánh Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni và Claude 3.5 Sonnet. Các điểm chuẩn chính bao gồm các nhiệm vụ chung như MMLU và IFEval, nhiệm vụ mã như HumanEval và GSM8K, và nhiệm vụ lý luận như Thử thách ARC. Mỗi điểm chuẩn phản ánh khả năng của mô hình trong việc hiểu và tạo văn bản giống con người, giải quyết vấn đề phức tạp và thực hiện mã. Đặc biệt, Llama 3.1 405B và Claude 3.5 Sonnet vượt trội trong nhiều điểm chuẩn, thể hiện khả năng tiên tiến của chúng trong cả nhiệm vụ chung và nhiệm vụ chuyên ngành.
Tương lai
Việc phát hành Llama 3.1-405B có khả năng sẽ thúc đẩy đổi mới trong một số lĩnh vực:
- Cải thiện các kỹ thuật huấn luyện tinh chỉnh cho các lĩnh vực chuyên biệt
- Phát triển các phương pháp suy luận hiệu quả hơn
- Tiến bộ trong nén mô hình và truyền đạt
Kết luận
Llama 3.1-405B đại diện cho một cột mốc quan trọng trong lĩnh vực AI mã nguồn mở, cung cấp khả năng mà trước đây chỉ có trong các mô hình độc quyền.
Khi chúng ta tiếp tục khám phá sức mạnh của mô hình này, điều quan trọng là phải tiếp cận việc sử dụng nó với trách nhiệm và xem xét đạo đức. Các công cụ và biện pháp bảo vệ đi kèm với mô hình cung cấp một khuôn khổ cho việc triển khai có trách nhiệm, nhưng sự cảnh giác và hợp tác liên tục của cộng đồng sẽ là chìa khóa để đảm bảo rằng công nghệ mạnh mẽ này được sử dụng vì lợi ích của xã hội.














