Mô hình và nền tảng AI
MPT-30B: MosaicML Vượt Trội GPT-3 Với Mô Hình LLM Mới Để Đẩy Ranh Giới Của NLP
MosaicML là một công ty trí tuệ nhân tạo tạo sinh cung cấp các giải pháp triển khai và mở rộng quy mô AI. Mô hình ngôn ngữ lớn (LLM) MPT-30B mới nhất của họ đang tạo ra sóng gió trong cộng đồng AI.
Hành trình LLM của MosaicML bắt đầu với việc phát hành MPT-7B (Mosaic Pretrained Transformer) vào tháng 5 năm 2023, bao gồm ba biến thể:
- MPT-7B-StoryWriter-65k+ (để tạo ra câu chuyện dài)
- MPT-7B-Instruct (để thực hiện các hướng dẫn ngắn)
- MPT-7B-Chat (để tạo ra hội thoại)
Các mô hình này đã chứng kiến thành công lớn trong cộng đồng ML vì tính chất mã nguồn mở, khả năng sử dụng thương mại và khả năng xử lý các cửa sổ ngữ cảnh mở rộng.
Điều quan trọng nhất là mô hình này đã đạt được trình độ tương đương và thậm chí vượt qua các mô hình khác có thể so sánh được (LLaMA-7B, StableLM 7B, v.v.). Vào tháng 6, loạt MPT-7B đã được tải xuống hơn 3 triệu lần. Vào ngày 22 tháng 6, MosaicML đã phát hành MPT-30B, nâng cao tiêu chuẩn cho các mô hình nền tảng mã nguồn mở.
MPT-30B: Một Mô Hình LLM Động Lực Vượt Trội GPT-3
MPT-30B là một mô hình LLM dựa trên bộ giải mã, mã nguồn mở và được cấp phép thương mại, mạnh hơn GPT-3-175B với chỉ 17% số tham số của GPT-3, tức là 30B. Nó vượt qua GPT-3 trong nhiều nhiệm vụ. Dưới đây là một so sánh giữa MPT-30B và GPT-3.
MPT-30B xây dựng trên mô hình MPT-7B trước đó. Nó hiệu quả về mặt tính toán để đào tạo so với các mô hình có kích thước tương tự. Ví dụ, LLaMA-30B sử dụng khoảng 1,44 lần nhiều FLOPs hơn MPT-30B, trong khi Falcon-40B có 1,27 lần FLOPs cao hơn MPT-30B. Dưới đây là một minh họa về sự cải tiến của MPT-30B trên các nhiệm vụ khác nhau so với người tiền nhiệm.
Một số tính năng đặc biệt của MPT-30B bao gồm:
Cửa Sổ Ngữ Cảnh 8k Token
Cửa sổ ngữ cảnh trong LLM đề cập đến phạm vi các token mà mô hình có thể xem xét trước khi tạo ra đầu ra. MPT-30B có cửa sổ ngữ cảnh là 8000 token tại thời điểm đào tạo. Nó được đào tạo trên 1T token sử dụng các chuỗi 2k token và sau đó là 50B token của các chuỗi 8k token (khoảng 6000 từ).
Hỗ Trợ ALiBi
Để giải thích tính năng này, hãy xem xét một câu hỏi:
Làm thế nào MPT-30B có thể hiểu và dự đoán các chuỗi dài hơn những gì nó được đào tạo?
MPT-30B sử dụng kỹ thuật Chú ý với Hệ số Tuyến tính (ALiBi) để hiểu các chuỗi dài hơn và mở rộng cửa sổ ngữ cảnh vượt quá 8k token trong quá trình tinh chỉnh hoặc suy luận.
Thay vì tính toán các bản nhúng vị trí trong đó chúng ta gán một vector cho mỗi từ trong chuỗi, ALiBi tính toán các điểm chú ý giữa các token khóa và truy vấn. Khi các token khóa và truy vấn gần nhau, phạt thấp nhưng cao hơn nếu không. Do đó, kiến trúc transformer cơ bản có thể ngoại suy đến các đầu vào dài.
Hiệu Suất Tinh Luyện & Huấn Luyện Hiệu Quả qua FlashAttention
Chú ý, tức là tập trung vào các phần liên quan của chuỗi đầu vào, là một thành phần quan trọng của các transformer, nhưng nó có thể chậm và tốn nhiều bộ nhớ, đặc biệt khi xử lý các chuỗi văn bản dài.
FlashAttention là một phương pháp được đề xuất bởi các nhà nghiên cứu tại Đại học Cornell nhằm giải quyết vấn đề này cho MPT-30B. Sử dụng một kỹ thuật gọi là gạch ngang, FlashAttention giảm số lần mô hình cần đọc từ hoặc viết vào bộ nhớ, tăng tốc quá trình xử lý. Do đó, mô hình này sử dụng kỹ thuật FlashAttention tiên tiến và thư viện tối ưu hóa FasterTransformer của NVIDIA (NVDA ) cho hiệu suất đào tạo và suy luận hiệu quả.
Dễ Dàng Huấn Luyện & Triển Khai
Các nhà phát triển có thể đào tạo MPT-30B từ đầu hoặc sử dụng các điểm kiểm tra của MosaicML để triển khai nhanh hơn. Ngoài ra, nó có thể được tinh chỉnh cho các trường hợp sử dụng cụ thể cho miền trên một tập dữ liệu cụ thể.
Kích thước mô hình được chọn để cho phép triển khai dễ dàng trên một GPU duy nhất, cụ thể là 1xA100-80GB ở độ chính xác 16 bit hoặc 1xA100-40GB ở độ chính xác 8 bit. Điều này có nghĩa là mô hình được thiết kế để phù hợp trong giới hạn bộ nhớ của các GPU này.
Khả Năng Lập Trình
MPT-30B cũng cung cấp khả năng lập trình xuất sắc. HumanEval là một tập dữ liệu được phát hành bởi OpenAI, bao gồm 164 vấn đề lập trình được tạo thủ công. Trên tập dữ liệu HumanEval, mô hình này vượt qua các mô hình LLM được xây dựng dành riêng, chẳng hạn như StarCoder series.
Biến Thể Tinh Luyện: MPT-30B-Instruct & MPT-30B-Chat
MPT-30B-Instruct
LLM chủ yếu được sử dụng cho các hướng dẫn như trả lời câu hỏi, tóm tắt văn bản, dịch ngôn ngữ, v.v. MPT-30B-Instruct là một biến thể của MPT-30B được tinh chỉnh cụ thể cho các nhiệm vụ thực hiện hướng dẫn. Để tinh chỉnh, các tập dữ liệu sau đã được sử dụng:
- FLAN
- P3
- Alpaca
- Dolly-15k
Tập dữ liệu Dolly đã được tăng cường thêm với tập dữ liệu Helpful và Harmless của Anthropic cho việc tinh chỉnh hướng dẫn. Ngoài ra, một loạt các tập dữ liệu đa dạng đã được sử dụng để tăng cường dữ liệu, bao gồm:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat là một phiên bản tinh luyện của MPT-30B cho việc tạo ra hội thoại. Nó là một sản phẩm nghiên cứu được phát hành dưới giấy phép CC-By-NC-SA-4.0, cho phép sử dụng phi thương mại. Mô hình này đã được tinh luyện sử dụng các ngôn ngữ đa dạng, bao gồm:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM chiếm một phần lớn trong thị trường tỷ đô la về trí tuệ nhân tạo tạo sinh, đã trải qua sự tăng trưởng đáng kể trong thời gian ngắn sau khi ChatGPT cách mạng hóa cảnh quan vào năm ngoái. Gia đình MPT là một phần quan trọng của cuộc cách mạng này. Trong tương lai gần, chúng ta có thể mong đợi thấy các mô hình mã nguồn mở thương mại có sẵn, mạnh mẽ và hiệu quả hơn nhiều so với gia đình MPT.
Để cập nhật tin tức AI mới nhất, hãy truy cập unite.ai.















