Mô hình và nền tảng AI
Gemma: Google Mang lại Các Tính Năng Trí Tuệ Nhân Tạo Tiên Tiến Thông Qua Mở Nguồn
Lĩnh vực trí tuệ nhân tạo (AI) đã chứng kiến sự tiến bộ đáng kể trong những năm gần đây, chủ yếu được thúc đẩy bởi sự phát triển của học sâu và xử lý ngôn ngữ tự nhiên (NLP). Ở tiền phong của những tiến bộ này là mô hình ngôn ngữ lớn (LLM) – hệ thống AI được đào tạo trên lượng lớn dữ liệu văn bản có thể tạo ra văn bản giống con người và tham gia vào các nhiệm vụ đối thoại.
LLM như PaLM của Google , Claude của Anthropic và Gopher của DeepMind đã thể hiện khả năng đáng kinh ngạc, từ mã hóa đến lý luận thông thường. Tuy nhiên, hầu hết các mô hình này chưa được phát hành công khai, hạn chế khả năng tiếp cận của chúng cho nghiên cứu, phát triển và ứng dụng có lợi.
Điều này đã thay đổi với việc phát hành mã nguồn mở gần đây của Gemma – một họ mô hình LLM từ DeepMind của Google dựa trên mô hình Gemini độc quyền mạnh mẽ. Trong bài đăng này, chúng tôi sẽ tìm hiểu về Gemma, phân tích kiến trúc, quá trình đào tạo, hiệu suất và phát hành có trách nhiệm của nó.
Tổng Quan Về Gemma
Vào tháng 2 năm 2023, DeepMind phát hành mã nguồn mở hai phiên bản mô hình Gemma – phiên bản 2 tỷ tham số được tối ưu hóa cho triển khai trên thiết bị và phiên bản 7 tỷ tham số được thiết kế cho sử dụng GPU/TPU.
Gemma tận dụng kiến trúc transformer dựa trên và phương pháp đào tạo tương tự như mô hình Gemini hàng đầu của DeepMind. Nó được đào tạo trên tới 6 nghìn tỷ token văn bản từ tài liệu web, toán học và mã code.
DeepMind phát hành cả điểm kiểm tra trước đào tạo thô của Gemma và các phiên bản tinh chỉnh với học có giám sát và phản hồi của con người để tăng cường khả năng trong các lĩnh vực như đối thoại, thực hiện hướng dẫn và mã hóa.
Bắt Đầu Với Gemma
Phát hành mã nguồn mở của Gemma làm cho các khả năng AI tiên tiến của nó trở nên dễ tiếp cận với các nhà phát triển, nhà nghiên cứu và những người đam mê. Dưới đây là hướng dẫn nhanh để bắt đầu:
Triển Khai Đa Nền Tảng
Một điểm mạnh của Gemma là sự linh hoạt – bạn có thể chạy nó trên CPU, GPU hoặc TPU. Đối với CPU, hãy tận dụng TensorFlow Lite hoặc HuggingFace Transformers. Đối với hiệu suất tăng tốc trên GPU/TPU, sử dụng TensorFlow. Dịch vụ đám mây như Vertex AI của Google cũng cung cấp khả năng mở rộng liền mạch.
Truy Cập Mô Hình Đã Được Đào Tạo
Gemma có sẵn trong các biến thể đã được đào tạo trước tùy thuộc vào nhu cầu của bạn. Các mô hình 2B và 7B cung cấp khả năng tạo ra mạnh mẽ ngay từ đầu. Đối với tinh chỉnh tùy chỉnh, các mô hình 2B-FT và 7B-FT là điểm khởi đầu lý tưởng.
Xây Dựng Ứng Dụng Thú Vị
Bạn có thể xây dựng nhiều ứng dụng khác nhau với Gemma, như tạo câu chuyện, dịch ngôn ngữ, trả lời câu hỏi và sản xuất nội dung sáng tạo. Chìa khóa là tận dụng điểm mạnh của Gemma thông qua tinh chỉnh trên dữ liệu riêng của bạn.
Kiến Trúc
Gemma sử dụng kiến trúc transformer chỉ có bộ giải mã, xây dựng trên các tiến bộ như chú ý đa truy vấn và nhúng vị trí quay:
- Transformer: Giới thiệu vào năm 2017, kiến trúc transformer dựa hoàn toàn trên cơ chế chú ý đã trở thành phổ biến trong NLP. Gemma kế thừa khả năng của transformer trong việc mô hình hóa sự phụ thuộc dài hạn trong văn bản.
- Chỉ Bộ Giải Mã: Gemma chỉ sử dụng ngăn xếp bộ giải mã transformer, không giống như các mô hình mã hóa-giải mã như BART hoặc T5. Điều này cung cấp khả năng tạo ra mạnh mẽ cho các nhiệm vụ như tạo văn bản.
- Chú Ý Đa Truy Vấn: Gemma sử dụng chú ý đa truy vấn trong mô hình lớn hơn của nó, cho phép mỗi đầu chú ý xử lý nhiều truy vấn song song để tăng tốc độ suy luận.
- Nhúng Vị Trí Quay: Gemma đại diện cho thông tin vị trí bằng cách sử dụng nhúng quay thay vì mã hóa vị trí tuyệt đối. Kỹ thuật này giảm kích thước mô hình trong khi vẫn giữ lại thông tin vị trí.
Sử dụng các kỹ thuật như chú ý đa truy vấn và nhúng vị trí quay cho phép các mô hình Gemma đạt được sự cân bằng tối ưu giữa hiệu suất, tốc độ suy luận và kích thước mô hình.
Dữ Liệu Và Quá Trình Đào Tạo
Gemma được đào tạo trên tới 6 nghìn tỷ token dữ liệu văn bản, chủ yếu là tiếng Anh. Điều này bao gồm tài liệu web, văn bản toán học và mã code. DeepMind đã đầu tư nhiều nỗ lực vào việc lọc dữ liệu, loại bỏ nội dung độc hại hoặc có hại bằng cách sử dụng các bộ phân loại và quy tắc.
Đào tạo được thực hiện bằng cách sử dụng cơ sở hạ tầng TPUv5 của Google, với tối đa 4096 TPU được sử dụng để đào tạo Gemma-7B. Các kỹ thuật song song mô hình và dữ liệu hiệu quả cho phép đào tạo các mô hình lớn với phần cứng hàng tiêu dùng.
Đào tạo theo giai đoạn được sử dụng, liên tục điều chỉnh phân phối dữ liệu để tập trung vào văn bản chất lượng cao, liên quan. Các giai đoạn tinh chỉnh cuối cùng sử dụng hỗn hợp các ví dụ hướng dẫn theo dõi được tạo bởi con người và tổng hợp để tăng cường khả năng.
Hiệu Suất Của Mô Hình
DeepMind đã đánh giá nghiêm ngặt các mô hình Gemma trên một tập hợp rộng lớn gồm hơn 25 điểm chuẩn, bao gồm trả lời câu hỏi, lý luận, toán học, mã hóa, lý luận thông thường và khả năng đối thoại.
Gemma đạt được kết quả hàng đầu so với các mô hình mã nguồn mở tương tự về kích thước trên hầu hết các điểm chuẩn. Một số điểm nổi bật:
- Toán Học: Gemma vượt trội trong các bài kiểm tra lý luận toán học như GSM8K và MATH, vượt qua các mô hình như Codex và Claude của Anthropic hơn 10 điểm.
- Mã Hóa: Gemma匹 hoặc vượt qua hiệu suất của Codex trên các điểm chuẩn lập trình như MBPP, mặc dù không được đào tạo cụ thể trên mã.
- Đối Thoại: Gemma thể hiện khả năng đối thoại mạnh mẽ với tỷ lệ thắng 51,7% so với Mistral-7B của Anthropic trong các thử nghiệm ưa thích của con người.
- Lý Luận: Trong các nhiệm vụ yêu cầu suy luận như ARC và Winogrande, Gemma vượt qua các mô hình 7B khác 5-10 điểm.
Khả năng đa năng của Gemma trên nhiều lĩnh vực thể hiện khả năng thông minh tổng thể mạnh mẽ. Mặc dù vẫn còn khoảng cách với hiệu suất của con người, Gemma đại diện cho một bước nhảy vọt trong NLP mã nguồn mở.
An Toàn Và Trách Nhiệm
Phát hành mã nguồn mở của các mô hình lớn giới thiệu thách thức về việc sử dụng sai và thiên vị mô hình nội tại. DeepMind đã thực hiện các bước để giảm thiểu rủi ro:
- Lọc Dữ Liệu: Văn bản có thể độc hại, bất hợp pháp hoặc thiên vị đã được loại bỏ khỏi dữ liệu đào tạo bằng cách sử dụng các bộ phân loại và quy tắc.
- Đánh Giá: Gemma đã được thử nghiệm trên hơn 30 điểm chuẩn được thiết kế để đánh giá an toàn, công bằng và độ bền. Nó đã匹 hoặc vượt qua các mô hình khác.
- Tinh Chỉnh: Quá trình tinh chỉnh mô hình tập trung vào việc cải thiện khả năng an toàn như lọc thông tin và hành vi từ chối/hạn chế phù hợp.
- Điều Khoản Sử Dụng: Điều khoản sử dụng cấm các ứng dụng tấn công, bất hợp pháp hoặc không đạo đức của mô hình Gemma. Tuy nhiên, việc thực thi vẫn còn là một thách thức.
- Thẻ Mô Hình: Các thẻ mô tả khả năng, hạn chế và thiên vị của mô hình đã được phát hành để thúc đẩy tính minh bạch.
Mặc dù rủi ro từ việc phát hành mã nguồn mở tồn tại, DeepMind đã xác định rằng việc phát hành Gemma mang lại lợi ích xã hội ròng dựa trên hồ sơ an toàn và khả năng thúc đẩy nghiên cứu. Tuy nhiên, việc theo dõi chặt chẽ các tác hại tiềm ẩn vẫn sẽ rất quan trọng.
Khuyến Khích Làn Sóng Tiếp Theo Của Đổi Mới Trí Tuệ Nhân Tạo
Phát hành Gemma như một họ mô hình mã nguồn mở có thể mở khóa tiến bộ trên toàn cộng đồng AI:
- Khả Năng Tiếp Cận: Gemma giảm rào cản cho các tổ chức muốn xây dựng với NLP tiên tiến, những tổ chức trước đây phải đối mặt với chi phí tính toán và dữ liệu cao để đào tạo mô hình LLM của riêng họ.
- Ứng Dụng Mới: Bằng cách phát hành các điểm kiểm tra đã được đào tạo trước và tinh chỉnh, DeepMind cho phép phát triển dễ dàng hơn các ứng dụng có lợi trong các lĩnh vực như giáo dục, khoa học và khả năng tiếp cận.
- Tùy Chỉnh: Các nhà phát triển có thể tùy chỉnh Gemma cho các ứng dụng cụ thể cho ngành hoặc lĩnh vực thông qua đào tạo tiếp tục trên dữ liệu riêng.
- Nghiên Cứu: Các mô hình mã nguồn mở như Gemma thúc đẩy sự minh bạch và kiểm toán của các hệ thống NLP hiện tại, chỉ ra hướng nghiên cứu trong tương lai.
- Đổi Mới: Sự sẵn có của các mô hình cơ sở mạnh mẽ như Gemma sẽ tăng tốc tiến bộ trong các lĩnh vực như giảm thiên vị, tính xác thực và an toàn AI.
Bằng cách cung cấp khả năng của Gemma cho tất cả mọi người thông qua mã nguồn mở, DeepMind hy vọng sẽ thúc đẩy sự phát triển có trách nhiệm của AI vì lợi ích xã hội.
Con Đường Tiếp Theo
Với mỗi bước nhảy vọt trong AI, chúng ta tiến gần hơn đến các mô hình có thể sánh ngang hoặc vượt qua trí thông minh của con người trên tất cả các lĩnh vực. Các hệ thống như Gemma nhấn mạnh cách các tiến bộ nhanh chóng trong các mô hình tự giám sát đang mở khóa các khả năng nhận thức tiên tiến ngày càng tăng.
Tuy nhiên, vẫn còn nhiều việc phải làm để cải thiện độ tin cậy, khả năng giải thích và kiểm soát của AI – những lĩnh vực mà trí thông minh của con người vẫn vượt trội. Các lĩnh vực như toán học làm nổi bật những khoảng cách dai dẳng này, với Gemma đạt 64% trên MMLU so với hiệu suất ước tính 89% của con người.
Đóng các khoảng cách này đồng thời đảm bảo an toàn và đạo đức của các hệ thống AI ngày càng mạnh mẽ sẽ là những thách thức trung tâm trong những năm tới. Việc tìm kiếm sự cân bằng đúng giữa tính cởi mở và thận trọng sẽ rất quan trọng, vì DeepMind nhằm mục đích dân chủ hóa việc tiếp cận các lợi ích của AI đồng thời quản lý các rủi ro mới nổi.
Các sáng kiến nhằm thúc đẩy an toàn AI – như ANC của Dario Amodei, nhóm Ethics & Society của DeepMind và Constitutional AI của Anthropic – cho thấy sự nhận thức ngày càng tăng về nhu cầu tinh tế này. Tiến bộ có ý nghĩa sẽ đòi hỏi sự đối thoại cởi mở, dựa trên bằng chứng giữa các nhà nghiên cứu, nhà phát triển, nhà hoạch định chính sách và công chúng.
Nếu được điều hướng một cách có trách nhiệm, Gemma đại diện không phải là đỉnh cao của AI, mà là một trạm căn cứ cho thế hệ tiếp theo của các nhà nghiên cứu AI theo bước chân của DeepMind hướng tới trí tuệ nhân tạo tổng thể công bằng và có lợi.
Kết Luận
Phát hành mô hình Gemma của DeepMind đánh dấu một kỷ nguyên mới cho AI mã nguồn mở – một kỷ nguyên vượt qua các điểm chuẩn hẹp và đi vào khả năng thông minh tổng thể. Được thử nghiệm rộng rãi về an toàn và khả năng tiếp cận rộng, Gemma thiết lập một tiêu chuẩn mới cho việc phát hành mã nguồn mở có trách nhiệm trong AI.
Được thúc đẩy bởi tinh thần cạnh tranh được điều tiết bởi các giá trị hợp tác, việc chia sẻ các đột phá như Gemma nâng cao tất cả các bên trong hệ sinh thái AI. Toàn bộ cộng đồng hiện có quyền truy cập vào một họ mô hình LLM đa năng để thúc đẩy hoặc hỗ trợ các sáng kiến của họ.
Mặc dù rủi ro vẫn còn, sự cẩn thận về mặt kỹ thuật và đạo đức của DeepMind mang lại sự tự tin rằng lợi ích của Gemma vượt qua các tác hại tiềm ẩn của nó. Khi khả năng AI trở nên tiên tiến hơn, việc duy trì sự tinh tế này giữa tính cởi mở và thận trọng sẽ rất quan trọng.
Gemma đưa chúng ta gần hơn một bước đến AI mang lại lợi ích cho tất cả nhân loại. Nhưng nhiều thách thức lớn vẫn còn chờ đợi dọc theo con đường đến trí tuệ nhân tạo tổng thể có lợi. Nếu các nhà nghiên cứu AI, nhà phát triển và xã hội nói chung có thể duy trì tiến bộ hợp tác, Gemma có thể một ngày nào đó được coi là một căn cứ lịch sử, chứ không phải là đỉnh cao cuối cùng.












