Mô hình và nền tảng AI

Trí tuệ nhân tạo đa phương thức tiến hóa khi ChatGPT có được tầm nhìn với GPT-4V(ision)

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong nỗ lực không ngừng để làm cho trí tuệ nhân tạo trở nên giống con người hơn, các mô hình GPT của OpenAI đã liên tục đẩy ranh giới. GPT-4 hiện có thể nhận các lệnh của cả văn bản và hình ảnh.

Đa phương thức trong trí tuệ nhân tạo tạo ra đề cập đến khả năng của một mô hình tạo ra các đầu ra đa dạng như văn bản, hình ảnh hoặc âm thanh dựa trên đầu vào. Các mô hình này, được đào tạo trên dữ liệu cụ thể, học các mẫu cơ bản để tạo ra dữ liệu mới tương tự, làm giàu các ứng dụng trí tuệ nhân tạo.

Các bước tiến gần đây trong trí tuệ nhân tạo đa phương thức

Một bước nhảy vọt đáng chú ý gần đây trong lĩnh vực này là sự tích hợp của DALL-E 3 vào ChatGPT, một bản nâng cấp đáng kể trong công nghệ văn bản-sang-hình ảnh của OpenAI. Sự kết hợp này cho phép tương tác mượt mà hơn nơi ChatGPT hỗ trợ tạo ra các lệnh chính xác cho DALL-E 3, biến ý tưởng của người dùng thành nghệ thuật được tạo ra bởi trí tuệ nhân tạo sống động. Vì vậy, trong khi người dùng có thể tương tác trực tiếp với DALL-E 3, việc có ChatGPT trong hỗn hợp làm cho quá trình tạo nghệ thuật trí tuệ nhân tạo trở nên dễ sử dụng hơn nhiều.

Xem thêm về DALL-E 3 và tích hợp của nó với ChatGPT tại đây. Sự hợp tác này không chỉ展示 sự tiến bộ trong trí tuệ nhân tạo đa phương thức mà còn làm cho việc tạo nghệ thuật trí tuệ nhân tạo trở nên dễ dàng cho người dùng.

Google’s health on the other hand introduced Med-PaLM M in June this year. It is a multimodal generative model adept at encoding and interpreting diverse biomedical data. This was achieved by fine-tuning PaLM-E, a language model, to cater to medical domains utilizing an open-source benchmark, MultiMedBench. This benchmark, consists of over 1 million samples across 7 biomedical data types and 14 tasks like medical question-answering and radiology report generation.

Various industries are adopting innovative multimodal AI tools to fuel business expansion, streamline operations, and elevate customer engagement. Progress in voice, video, and text AI capabilities is propelling multimodal AI’s growth.

Enterprises seek multimodal AI applications capable of overhauling business models and processes, opening growth avenues across the generative AI ecosystem, from data tools to emerging AI applications.

Post GPT-4’s launch in March, some users observed a decline in its response quality over time, a concern echoed by notable developers and on OpenAI’s forums. Initially dismissed by an OpenAI, a later study confirmed the issue. It revealed a drop in GPT-4’s accuracy from 97.6% to 2.4% between March and June, indicating a decline in answer quality with subsequent model updates.

chatgpt-ai

ChatGPT (Blue) & Artificial intelligence (Red) Google Search Trend

The hype around Open AI’s ChatGPT is back now. It now comes with a vision feature GPT-4V, allowing users to have GPT-4 analyze images given by them. This is the newest feature that’s been opened up to users.

Adding image analysis to large language models (LLMs) like GPT-4 is seen by some as a big step forward in AI research and development. This kind of multimodal LLM opens up new possibilities, taking language models beyond text to offer new interfaces and solve new kinds of tasks, creating fresh experiences for users.

The training of GPT-4V was finished in 2022, with early access rolled out in tháng 3 2023. The visual feature in GPT-4V is powered by GPT-4 tech. The training process remained the same. Initially, the model was trained to predict the next word in a text using a massive dataset of both text and images from various sources including the internet.

Later, it was fine-tuned with more data, employing a method named reinforcement learning from human feedback (RLHF), to generate outputs that humans preferred.

Cơ chế tầm nhìn của GPT-4

Khả năng ngôn ngữ tầm nhìn đáng chú ý của GPT-4, mặc dù ấn tượng, có các phương pháp cơ bản vẫn còn trên bề mặt.

To khám phá giả thuyết này, một mô hình ngôn ngữ tầm nhìn mới, MiniGPT-4 được giới thiệu, sử dụng một mô hình ngôn ngữ tiên tiến tên là Vicuna. Mô hình này sử dụng một bộ mã hóa tầm nhìn với các thành phần được đào tạo trước cho nhận thức thị giác, căn chỉnh các tính năng thị giác được mã hóa với mô hình ngôn ngữ Vicuna thông qua một lớp dự án đơn. Kiến trúc của MiniGPT-4 đơn giản nhưng hiệu quả, tập trung vào việc căn chỉnh các tính năng thị giác và ngôn ngữ để cải thiện khả năng trò chuyện thị giác.

MiniGPT-4

Kiến trúc của MiniGPT-4 bao gồm một bộ mã hóa tầm nhìn với các thành phần được đào tạo trước là ViT và Q-Former, một lớp dự án tuyến tính đơn và một mô hình ngôn ngữ tiên tiến Vicuna.

Xu hướng của các mô hình ngôn ngữ tự hồi quy trong các nhiệm vụ ngôn ngữ tầm nhìn cũng đã tăng trưởng, tận dụng việc chuyển giao chéo mô thức để chia sẻ kiến thức giữa ngôn ngữ và các lĩnh vực đa phương thức.

MiniGPT-4 bắc cầu giữa các lĩnh vực thị giác và ngôn ngữ bằng cách căn chỉnh thông tin thị giác từ một bộ mã hóa tầm nhìn được đào tạo trước với một mô hình ngôn ngữ tiên tiến. Mô hình này sử dụng Vicuna làm bộ giải mã ngôn ngữ và tuân theo một quy trình đào tạo hai giai đoạn. Ban đầu, nó được đào tạo trên một tập dữ liệu lớn của các cặp hình ảnh-văn bản để nắm bắt kiến thức ngôn ngữ tầm nhìn, sau đó được tinh chỉnh trên một tập dữ liệu nhỏ hơn, chất lượng cao hơn để tăng cường độ tin cậy và khả năng sử dụng của việc tạo ngôn ngữ.

Để cải thiện tính tự nhiên và khả năng sử dụng của ngôn ngữ được tạo ra trong MiniGPT-4, các nhà nghiên cứu đã phát triển một quy trình căn chỉnh hai giai đoạn, giải quyết sự thiếu hụt của các tập dữ liệu căn chỉnh ngôn ngữ tầm nhìn đầy đủ. Họ đã tạo ra một tập dữ liệu chuyên dụng cho mục đích này.

Ban đầu, mô hình tạo ra các mô tả chi tiết của hình ảnh đầu vào, tăng cường chi tiết bằng cách sử dụng một lệnh đối thoại được căn chỉnh với định dạng của mô hình ngôn ngữ Vicuna. Giai đoạn này nhằm tạo ra các mô tả hình ảnh toàn diện hơn.

Lệnh mô tả hình ảnh ban đầu:

###Human: <Img><ImageFeature></Img>Mô tả hình ảnh này chi tiết. Hãy cho biết càng nhiều chi tiết càng tốt. Hãy nói tất cả những gì bạn thấy. ###Assistant:

Đối với quá trình hậu xử lý dữ liệu, bất kỳ sự không nhất quán hoặc lỗi trong các mô tả được tạo ra đều được sửa chữa bằng ChatGPT, sau đó được xác minh thủ công để đảm bảo chất lượng cao.

Lệnh tinh chỉnh giai đoạn hai:

###Human: <Img><ImageFeature></Img><Instruction>###Assistant:

Khám phá này mở ra một cửa sổ để hiểu về cơ chế của trí tuệ nhân tạo tạo ra đa phương thức như GPT-4, làm sáng tỏ cách các phương thức tầm nhìn và ngôn ngữ có thể được tích hợp hiệu quả để tạo ra các đầu ra mạch lạc và phong phú về ngữ cảnh.

Khám phá tầm nhìn của GPT-4

Xác định nguồn gốc hình ảnh với ChatGPT

Tầm nhìn của GPT-4 tăng cường khả năng của ChatGPT trong việc phân tích hình ảnh và xác định nguồn gốc địa lý của chúng. Tính năng này chuyển đổi tương tác của người dùng từ chỉ văn bản sang sự kết hợp của văn bản và hình ảnh, trở thành một công cụ tiện ích cho những người tò mò về các địa điểm khác nhau thông qua dữ liệu hình ảnh.

Chatgpt-vision-GPT-4

Hỏi ChatGPT nơi một hình ảnh địa danh được chụp

Các khái niệm toán học phức tạp

Tầm nhìn của GPT-4 vượt trội trong việc khám phá các ý tưởng toán học phức tạp bằng cách phân tích các biểu thức đồ họa hoặc viết tay. Tính năng này hoạt động như một công cụ hữu ích cho những người muốn giải quyết các vấn đề toán học phức tạp, đánh dấu tầm nhìn của GPT-4 là một công cụ hỗ trợ đáng kể trong các lĩnh vực giáo dục và học thuật.

Chatgpt-vision-GPT-4

Hỏi ChatGPT hiểu một khái niệm toán học phức tạp

Chuyển đổi đầu vào viết tay thành mã LaTeX

Một trong những khả năng đáng chú ý của GPT-4V là khả năng dịch đầu vào viết tay thành mã LaTeX. Tính năng này là một lợi ích cho các nhà nghiên cứu, học giả và sinh viên thường cần chuyển đổi các biểu thức toán học viết tay hoặc thông tin kỹ thuật khác thành định dạng kỹ thuật số. Sự chuyển đổi từ viết tay sang LaTeX mở rộng chân trời của việc số hóa tài liệu và đơn giản hóa quá trình viết kỹ thuật.

GPT-4V's ability to convert handwritten input into LaTeX codes

Khả năng của GPT-4V để chuyển đổi đầu vào viết tay thành mã LaTeX

Trích xuất chi tiết bảng

GPT-4V thể hiện kỹ năng trong việc trích xuất chi tiết từ bảng và trả lời các câu hỏi liên quan, một tài sản quan trọng trong phân tích dữ liệu. Người dùng có thể sử dụng GPT-4V để sàng lọc bảng, thu thập thông tin chính và giải quyết câu hỏi, làm cho nó trở thành một công cụ mạnh mẽ cho các nhà phân tích dữ liệu và các chuyên gia khác.

GPT-4V deciphering table details and responding to related queries

GPT-4V giải mã chi tiết bảng và trả lời các câu hỏi liên quan

Hiểu chỉ dẫn thị giác

Khả năng duy nhất của GPT-4V để hiểu chỉ dẫn thị giác thêm một chiều mới vào tương tác của người dùng. Bằng cách hiểu các tín hiệu thị giác, GPT-4V có thể trả lời các câu hỏi với sự hiểu biết ngữ cảnh cao hơn.

GPT-4V-demonstrates-the-unique-capability-of-understanding-visual-pointing

GPT-4V展示 khả năng duy nhất để hiểu chỉ dẫn thị giác

Xây dựng trang web mô hình đơn giản bằng cách vẽ

Được truyền cảm hứng bởi tweet này, tôi đã cố gắng tạo một mô hình cho trang web unite.ai.

Kết quả không hoàn toàn giống với tầm nhìn ban đầu của tôi, nhưng đây là kết quả tôi đã đạt được.

ChatGPT Vision based output HTML Frontend

Giao diện người dùng HTML dựa trên tầm nhìn của ChatGPT

Giới hạn và khiếm khuyết của GPT-4V(ision)

Để phân tích GPT-4V, nhóm Open AI đã thực hiện các đánh giá định tính và định lượng. Các đánh giá định tính bao gồm các thử nghiệm nội bộ và đánh giá của các chuyên gia bên ngoài, trong khi các đánh giá định lượng đo lường việc từ chối của mô hình và độ chính xác trong các tình huống khác nhau như xác định nội dung có hại, nhận dạng nhân khẩu học, lo ngại về quyền riêng tư, định vị địa lý, an ninh mạng và các cuộc tấn công đa phương thức.

Tuy nhiên, mô hình vẫn không hoàn hảo.

Bài báo này làm nổi bật các giới hạn của GPT-4V, như suy luận không chính xác và thiếu văn bản hoặc ký tự trong hình ảnh. Nó có thể tưởng tượng hoặc tạo ra các sự kiện. Đặc biệt, nó không phù hợp để xác định các chất nguy hiểm trong hình ảnh, thường nhầm lẫn chúng.

Trong hình ảnh y tế, GPT-4V có thể cung cấp các phản hồi không nhất quán và thiếu nhận thức về các thực hành tiêu chuẩn, dẫn đến các chẩn đoán sai lầm tiềm ẩn.

Unreliable performance for medical purposes.

Hiệu suất không đáng tin cậy cho mục đích y tế (Nguồn)

Nó cũng không thể nắm bắt được các sắc thái của một số biểu tượng thù hận và có thể tạo ra nội dung không phù hợp dựa trên đầu vào thị giác. OpenAI khuyên không nên sử dụng GPT-4V cho các giải thích quan trọng, đặc biệt là trong các ngữ cảnh y tế hoặc nhạy cảm.

Kết luận

Created using Fast Stable Diffusion XL

Tạo bằng Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Sự ra đời của GPT-4 Vision (GPT-4V) mang lại nhiều khả năng thú vị và thách thức mới. Trước khi phát hành, rất nhiều nỗ lực đã được đầu tư để đảm bảo rằng các rủi ro, đặc biệt là liên quan đến hình ảnh của con người, được xem xét kỹ lưỡng và giảm thiểu. Điều ấn tượng là thấy GPT-4V đã tiến bộ như thế nào, thể hiện nhiều hứa hẹn trong các lĩnh vực khó khăn như y học và khoa học.

Bây giờ, có một số câu hỏi lớn trên bàn. Ví dụ, các mô hình này có nên có khả năng xác định các nhân vật nổi tiếng từ hình ảnh không? Chúng có nên đoán giới tính, chủng tộc hoặc cảm xúc của một người từ hình ảnh không? Và, có nên có các điều chỉnh đặc biệt để giúp những người khiếm thị không? Những câu hỏi này mở ra một hộp đạn về quyền riêng tư, công bằng và cách trí tuệ nhân tạo nên phù hợp vào cuộc sống của chúng ta, điều mà mọi người nên có tiếng nói.

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.