Mô hình và nền tảng AI

Năm Đầu Tiên Của ChatGPT: Tái Định Hình Tương Lai Của Sự Tương Tác Trí Tuệ Nhân Tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khi nhìn lại năm đầu tiên của ChatGPT, rõ ràng rằng công cụ này đã thay đổi đáng kể cảnh quan trí tuệ nhân tạo. Ra mắt vào cuối năm 2022, ChatGPT nổi bật với phong cách đối thoại thân thiện, người dùng, khiến việc tương tác với trí tuệ nhân tạo cảm giác giống như trò chuyện với một người hơn là một máy móc. Cách tiếp cận mới này nhanh chóng thu hút sự chú ý của công chúng. Chỉ trong năm ngày sau khi phát hành, ChatGPT đã thu hút một triệu người dùng. Đến đầu năm 2023, con số này tăng lên khoảng 100 triệu người dùng hàng tháng, và đến tháng 10, nền tảng này đã thu hút khoảng 1,7 tỷ lượt truy cập trên toàn thế giới. Những con số này nói lên rất nhiều về mức độ phổ biến và hữu ích của nó.

Trong suốt năm qua, người dùng đã tìm ra nhiều cách sáng tạo để sử dụng ChatGPT, từ các nhiệm vụ đơn giản như viết email và cập nhật hồ sơ đến việc bắt đầu các doanh nghiệp thành công. Nhưng điều đó không chỉ là về cách mọi người sử dụng nó; công nghệ bản thân đã phát triển và cải thiện. Ban đầu, ChatGPT là một dịch vụ miễn phí cung cấp các phản hồi văn bản chi tiết. Giờ đây, có ChatGPT Plus, bao gồm ChatGPT-4. Phiên bản cập nhật này được đào tạo trên nhiều dữ liệu hơn, cung cấp ít câu trả lời sai hơn và hiểu các lệnh phức tạp tốt hơn.

Một trong những bản cập nhật lớn nhất là ChatGPT có thể tương tác theo nhiều cách – nó có thể nghe, nói và thậm chí xử lý hình ảnh. Điều này có nghĩa bạn có thể trò chuyện với nó thông qua ứng dụng di động và hiển thị hình ảnh để nhận phản hồi. Những thay đổi này đã mở ra những khả năng mới cho trí tuệ nhân tạo và đã thay đổi cách mọi người nhìn và suy nghĩ về vai trò của trí tuệ nhân tạo trong cuộc sống của chúng ta.

Từ khi bắt đầu như một bản demo công nghệ đến vị thế hiện tại là một nhân vật chính trong thế giới công nghệ, hành trình của ChatGPT khá ấn tượng. Ban đầu, nó được coi là một cách để kiểm tra và cải thiện công nghệ bằng cách nhận phản hồi từ công chúng. Nhưng nó nhanh chóng trở thành một phần quan trọng của cảnh quan trí tuệ nhân tạo. Sự thành công này cho thấy hiệu quả của việc tinh chỉnh các mô hình ngôn ngữ lớn (LLM) với cả học có giám sát và phản hồi từ con người. Kết quả là, ChatGPT có thể xử lý một loạt các câu hỏi và nhiệm vụ.

Cuộc đua để phát triển các hệ thống trí tuệ nhân tạo khả năng và đa năng nhất đã dẫn đến sự phổ biến của cả các mô hình mã nguồn mở và độc quyền như ChatGPT. Để hiểu khả năng chung của chúng, cần có các điểm chuẩn toàn diện trên một loạt các nhiệm vụ. Phần này khám phá các điểm chuẩn này, làm sáng tỏ cách các mô hình khác nhau, bao gồm ChatGPT, xếp chồng lên nhau.

Đánh Giá LLM: Các Điểm Chuẩn

  1. MT-Bench: Điểm chuẩn này kiểm tra khả năng trò chuyện nhiều lượt và thực hiện lệnh trên tám lĩnh vực: viết, vai trò, trích xuất thông tin, lý luận, toán, lập trình, kiến thức STEM và khoa học xã hội/humanities. Các LLM mạnh hơn như GPT-4 được sử dụng làm người đánh giá.
  2. AlpacaEval: Dựa trên tập dữ liệu đánh giá AlpacaFarm, điểm chuẩn này đánh giá các mô hình dựa trên phản hồi từ các LLM tiên tiến như GPT-4 và Claude, tính toán tỷ lệ thắng của các mô hình ứng viên.
  3. Bảng Xếp Hạng LLM Mở: Sử dụng Khung Đánh Giá Mô Hình Ngôn Ngữ, bảng xếp hạng này đánh giá LLM trên bảy điểm chuẩn chính, bao gồm cả thách thức lý luận và kiểm tra kiến thức chung, trong cả cài đặt không có dữ liệu và có ít dữ liệu.
  4. BIG-bench: Điểm chuẩn hợp tác này bao gồm hơn 200 nhiệm vụ ngôn ngữ mới, bao gồm nhiều chủ đề và ngôn ngữ. Nó nhằm mục đích kiểm tra LLM và dự đoán khả năng tương lai của chúng.
  5. ChatEval: Một khuôn khổ tranh luận đa tác nhân cho phép các nhóm thảo luận và đánh giá tự động chất lượng phản hồi từ các mô hình khác nhau trên các câu hỏi mở và nhiệm vụ tạo ngôn ngữ tự nhiên truyền thống.

Hiệu Suất So Sánh

Về các điểm chuẩn chung, các LLM mã nguồn mở đã cho thấy tiến bộ đáng kể. Llama-2-70B, ví dụ, đã đạt được kết quả ấn tượng, đặc biệt là sau khi tinh chỉnh với dữ liệu hướng dẫn. Biến thể của nó, Llama-2-chat-70B, đã vượt trội trong AlpacaEval với tỷ lệ thắng 92,66%, vượt qua GPT-3.5-turbo. Tuy nhiên, GPT-4 vẫn là người dẫn đầu với tỷ lệ thắng 95,28%.

Zephyr-7B, một mô hình nhỏ hơn, đã chứng minh khả năng tương đương với các LLM lớn 70B, đặc biệt là trong AlpacaEval và MT-Bench. Trong khi đó, WizardLM-70B, tinh chỉnh với một loạt các dữ liệu hướng dẫn đa dạng, đã đạt điểm cao nhất trong số các LLM mã nguồn mở trên MT-Bench. Tuy nhiên, nó vẫn còn tụt lại phía sau GPT-3.5-turbo và GPT-4.

Một mục nhập thú vị, GodziLLa2-70B, đã đạt được điểm cạnh tranh trên Bảng Xếp Hạng LLM Mở,展示 tiềm năng của các mô hình thử nghiệm kết hợp các tập dữ liệu đa dạng. Tương tự, Yi-34B, được phát triển từ đầu, đã nổi bật với điểm số tương đương với GPT-3.5-turbo và chỉ hơi thấp hơn GPT-4.

UltraLlama, với việc tinh chỉnh trên dữ liệu đa dạng và chất lượng cao, đã匹配 GPT-3.5-turbo trong các điểm chuẩn được đề xuất và thậm chí vượt qua nó trong các lĩnh vực kiến thức thế giới và chuyên môn.

Tăng Cấp: Sự Phát Triển Của Các LLM Khổng Lồ

LLM models

Top LLM models since 2020

Một xu hướng đáng chú ý trong việc phát triển LLM là việc tăng quy mô mô hình. Các mô hình như Gopher, GLaM, LaMDA, MT-NLG và PaLM đã đẩy ranh giới, kết thúc với các mô hình có tới 540 tỷ tham số. Những mô hình này đã chứng minh khả năng đặc biệt, nhưng bản chất độc quyền của chúng đã hạn chế ứng dụng rộng rãi hơn. Điều này đã kích thích sự quan tâm đến việc phát triển các LLM mã nguồn mở, một xu hướng đang ngày càng phổ biến.

Bên cạnh việc tăng quy mô mô hình, các nhà nghiên cứu đã khám phá các chiến lược thay thế. Thay vì chỉ làm cho mô hình lớn hơn, họ đã tập trung vào việc cải thiện quá trình tiền huấn luyện của các mô hình nhỏ hơn. Ví dụ bao gồm Chinchilla và UL2, đã chứng minh rằng nhiều hơn không phải lúc nào cũng tốt hơn; các chiến lược thông minh có thể mang lại kết quả hiệu quả quá. Hơn nữa, có sự quan tâm đáng kể đến việc tinh chỉnh ngôn ngữ theo hướng dẫn, với các dự án như FLAN, T0 và Flan-T5 đã đóng góp đáng kể vào lĩnh vực này.

ChatGPT Là Catalyst

Sự ra mắt của ChatGPT của OpenAI đã đánh dấu một bước ngoặt trong nghiên cứu NLP. Để cạnh tranh với OpenAI, các công ty như Google (GOOGL ) và Anthropic đã ra mắt các mô hình của riêng họ, Bard và Claude, tương ứng. Mặc dù các mô hình này cho thấy hiệu suất tương đương với ChatGPT trong nhiều nhiệm vụ, nhưng chúng vẫn tụt lại phía sau mô hình mới nhất của OpenAI, GPT-4. Sự thành công của các mô hình này chủ yếu được quy cho việc học tăng cường từ phản hồi của con người (RLHF), một kỹ thuật đang nhận được sự quan tâm nghiên cứu ngày càng tăng để cải thiện thêm.

Đồn Thổi và Guesswork Về Q* (Q-Star) Của OpenAI

Các báo cáo gần đây cho thấy rằng các nhà nghiên cứu tại OpenAI có thể đã đạt được một bước tiến đáng kể trong AI với sự phát triển của một mô hình mới gọi là Q* (được phát âm là Q sao). Allegedly, Q* có khả năng thực hiện toán học ở cấp độ trường tiểu học, một kỳ công đã kích thích các cuộc thảo luận giữa các chuyên gia về tiềm năng của nó như một bước tiến tới trí tuệ nhân tạo tổng quát (AGI). Mặc dù OpenAI chưa bình luận về các báo cáo này, nhưng khả năng được đồn đoán của Q* đã tạo ra sự phấn khích và suy đoán đáng kể trên mạng xã hội và trong số các người hâm mộ AI.

Sự phát triển của Q* đáng chú ý vì các mô hình ngôn ngữ hiện có như ChatGPT và GPT-4, mặc dù có khả năng thực hiện một số nhiệm vụ toán học, nhưng không đặc biệt giỏi trong việc xử lý chúng một cách đáng tin cậy. Thách thức nằm ở nhu cầu của các mô hình AI không chỉ nhận ra các mẫu, như chúng hiện đang làm thông qua học sâu và biến đổi, mà còn phải lý luận và hiểu các khái niệm trừu tượng. Toán học, là một điểm chuẩn cho lý luận, đòi hỏi AI phải lập kế hoạch và thực hiện nhiều bước, thể hiện sự hiểu biết sâu sắc về các khái niệm trừu tượng. Khả năng này sẽ đánh dấu một bước nhảy vọt đáng kể trong khả năng của AI, có thể mở rộng ra ngoài toán học đến các nhiệm vụ phức tạp khác.

Tuy nhiên, các chuyên gia cảnh báo chống lại việc thổi phồng sự phát triển này. Mặc dù một hệ thống AI có thể giải toán một cách đáng tin cậy sẽ là một thành tựu ấn tượng, nhưng nó không nhất thiết phải báo hiệu sự xuất hiện của siêu trí tuệ nhân tạo hoặc AGI. Nghiên cứu AI hiện tại, bao gồm cả nỗ lực của OpenAI, đã tập trung vào các vấn đề cơ bản, với mức độ thành công khác nhau trong các nhiệm vụ phức tạp hơn.

Khả năng ứng dụng của các tiến bộ như Q* là rất lớn, từ việc hướng dẫn cá nhân hóa đến hỗ trợ nghiên cứu khoa học và kỹ thuật. Tuy nhiên, cũng quan trọng là phải quản lý kỳ vọng và nhận ra các hạn chế và lo ngại về an toàn liên quan đến những tiến bộ này. Các lo ngại về AI gây ra rủi ro tồn tại, một mối quan tâm cơ bản của OpenAI, vẫn còn phù hợp, đặc biệt là khi các hệ thống AI bắt đầu giao tiếp nhiều hơn với thế giới thực.

Phong Trào LLM Mở

Để thúc đẩy nghiên cứu LLM mã nguồn mở, Meta đã phát hành loạt mô hình Llama, kích hoạt một làn sóng phát triển mới dựa trên Llama. Điều này bao gồm các mô hình tinh chỉnh với dữ liệu hướng dẫn, như Alpaca, Vicuna, Lima và WizardLM. Nghiên cứu cũng đang mở rộng sang việc tăng cường khả năng của tác nhân, lý luận logic và mô hình hóa ngữ cảnh dài trong khuôn khổ Llama.

Hơn nữa, có một xu hướng ngày càng tăng trong việc phát triển các LLM mạnh mẽ từ đầu, với các dự án như MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok và Yi. Những nỗ lực này phản ánh cam kết nhằm dân chủ hóa khả năng của các LLM độc quyền, làm cho các công cụ AI tiên tiến trở nên dễ tiếp cận và hiệu quả hơn.

Tác Động Của ChatGPT và Mô Hình Mở Trong Chăm Sóc Sức Khỏe

Chúng ta đang hướng tới một tương lai nơi LLM hỗ trợ việc ghi chú lâm sàng, điền biểu mẫu cho việc hoàn trả và hỗ trợ bác sĩ trong việc chẩn đoán và lập kế hoạch điều trị. Điều này đã thu hút sự chú ý của cả các công ty công nghệ và các tổ chức chăm sóc sức khỏe.

Microsoft (MSFT ) đã thảo luận với Epic, một nhà cung cấp phần mềm hồ sơ sức khỏe điện tử hàng đầu, về việc tích hợp LLM vào chăm sóc sức khỏe. Các sáng kiến đã được triển khai tại UC San Diego Health và Trung tâm Y học Đại học Stanford. Tương tự, các đối tác của Google với Mayo Clinic và việc ra mắt HealthScribe, một dịch vụ ghi chú lâm sàng AI của Amazon (AMZN ) Web Services, đánh dấu những bước tiến đáng kể trong lĩnh vực này.

Tuy nhiên, những triển khai nhanh chóng này cũng đặt ra lo ngại về việc giao quyền kiểm soát y tế cho các lợi ích doanh nghiệp. Bản chất độc quyền của các LLM này khiến chúng khó đánh giá. Việc sửa đổi hoặc ngừng sử dụng chúng vì lý do lợi nhuận có thể ảnh hưởng đến chăm sóc bệnh nhân, quyền riêng tư và an toàn.

Cần thiết là phải có một cách tiếp cận mở và bao gồm trong việc phát triển LLM cho chăm sóc sức khỏe. Các tổ chức chăm sóc sức khỏe, nhà nghiên cứu, bác sĩ lâm sàng và bệnh nhân phải hợp tác toàn cầu để xây dựng LLM mã nguồn mở cho chăm sóc sức khỏe. Cách tiếp cận này, tương tự như Trillion Parameter Consortium, sẽ cho phép kết hợp tài nguyên tính toán, tài chính và chuyên môn.

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.