Kỹ thuật prompt

Nhìn gần hơn vào DALL-E 3 của OpenAI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
DALL·E 3

Trong thế giới Trí tuệ nhân tạo tạo sinh, việc cập nhật với những thông tin mới nhất là điều quan trọng. Và khi nói đến việc tạo ra hình ảnh, Stable Diffusion và Midjourney là những nền tảng được mọi người nhắc đến – cho đến bây giờ.

OpenAI, được hỗ trợ bởi gã khổng lồ công nghệ Microsoft (MSFT ), đã giới thiệu DALL·E 3 vào ngày 20 tháng 9 năm 2023.

DALL-E 3 không chỉ là về việc tạo ra hình ảnh; nó là về việc đưa ý tưởng của bạn vào cuộc sống, chính xác như bạn tưởng tượng. Và điều tốt nhất? Nó rất nhanh, như, thực sự nhanh. Bạn có một ý tưởng, bạn cho nó vào DALL-E 3, và boom, hình ảnh của bạn đã sẵn sàng.

Vậy, trong bài viết này, chúng tôi sẽ đi sâu vào những gì DALL-E 3 là tất cả về. Chúng tôi sẽ nói về cách nó hoạt động, những gì làm cho nó khác biệt với phần còn lại, và tại sao nó có thể chỉ là công cụ bạn không biết bạn cần. Cho dù bạn là một nhà thiết kế, một nghệ sĩ, hay chỉ là một người có nhiều ý tưởng cool, bạn sẽ muốn ở lại đây.

Điều mới mẻ với DALL·E 3 là nó hiểu ngữ cảnh tốt hơn nhiều so với DALL·E 2. Các phiên bản trước có thể bỏ lỡ một số chi tiết cụ thể hoặc bỏ qua một số chi tiết ở đây và ở đó, nhưng DALL·E 3 là chính xác. Nó chọn lên các chi tiết chính xác của những gì bạn đang yêu cầu, đưa cho bạn một bức tranh gần với những gì bạn tưởng tượng.

Điều thú vị? DALL·E 3 và ChatGPT hiện đã được tích hợp cùng nhau. Họ làm việc cùng nhau để giúp tinh chỉnh ý tưởng của bạn. Bạn bắn một khái niệm, ChatGPT giúp tinh chỉnh lời nhắc, và DALL·E 3 đưa nó vào cuộc sống. Nếu bạn không phải là người hâm mộ hình ảnh, bạn có thể yêu cầu ChatGPT điều chỉnh lời nhắc và DALL·E 3 thử lại. Với một khoản phí hàng tháng là 20$, bạn sẽ có quyền truy cập vào GPT-4, DALL·E 3 và nhiều tính năng khác.

Trợ lý ảo Bing Chat của Microsoft đã có được DALL·E 3 thậm chí trước khi ChatGPT của OpenAI làm được, và bây giờ không chỉ là các doanh nghiệp lớn mà mọi người đều có thể chơi với nó miễn phí. Sự tích hợp vào Bing Chat và Bing Image Creator khiến nó dễ sử dụng hơn cho bất kỳ ai.

Sự trỗi dậy của các mô hình khuếch tán

Trong 3 năm qua, trí tuệ nhân tạo thị giác đã chứng kiến sự trỗi dậy của các mô hình khuếch tán, đạt được một bước tiến đáng kể, đặc biệt là trong việc tạo ra hình ảnh. Trước các mô hình khuếch tán, Mạng nơ-ron đối kháng tạo sinh (GANs) là công nghệ được sử dụng để tạo ra hình ảnh thực tế.

GANs

GANs

Tuy nhiên, chúng có những thách thức của riêng mình, bao gồm nhu cầu về lượng dữ liệu và sức mạnh tính toán lớn, điều này thường khiến chúng khó xử lý.

Đó là khi các mô hình khuếch tán xuất hiện. Chúng nổi lên như một giải pháp thay thế ổn định và hiệu quả hơn cho GANs. Không giống như GANs, các mô hình khuếch tán hoạt động bằng cách thêm nhiễu vào dữ liệu, che giấu nó cho đến khi chỉ còn lại sự ngẫu nhiên. Sau đó, chúng làm việc ngược lại để đảo ngược quá trình này, tái tạo dữ liệu có ý nghĩa từ nhiễu. Quá trình này đã chứng minh là hiệu quả và ít tốn tài nguyên hơn, khiến các mô hình khuếch tán trở thành chủ đề nóng trong cộng đồng trí tuệ nhân tạo.

Điểm chuyển biến thực sự xảy ra vào khoảng năm 2020, với một loạt các bài báo đổi mới và sự ra đời của công nghệ CLIP của OpenAI, đã thúc đẩy đáng kể khả năng của các mô hình khuếch tán. Điều này đã khiến các mô hình khuếch tán trở nên đặc biệt tốt trong việc tổng hợp hình ảnh từ văn bản, cho phép chúng tạo ra hình ảnh thực tế từ mô tả văn bản. Những đột phá này không chỉ trong việc tạo ra hình ảnh, mà còn trong các lĩnh vực như sáng tác nhạcnghiên cứu sinh học y học.

Ngày nay, các mô hình khuếch tán không chỉ là chủ đề của sự quan tâm học thuật mà còn được sử dụng trong các kịch bản thực tế, thế giới thực.

Mô hình hóa tạo sinh và lớp tự chú ý: DALL-E 3

Một trong những tiến bộ quan trọng trong lĩnh vực này là sự tiến hóa của mô hình hóa tạo sinh, với các phương pháp lấy mẫu như mô hình hóa tạo sinh tự hồi quy và các quá trình khuếch tán dẫn đầu, đã dẫn đến sự cải thiện đáng kể về hiệu suất. Bằng cách chia nhỏ việc tạo ra hình ảnh thành các bước rời rạc, những mô hình này đã trở nên dễ dàng hơn cho mạng nơ-ron để học.

Song song, việc sử dụng các lớp tự chú ý đã đóng vai trò quan trọng. Những lớp này, khi được xếp chồng lên nhau, đã giúp tạo ra hình ảnh mà không cần có sự thiên vị không gian ngầm, một vấn đề phổ biến với các convolution. Sự thay đổi này đã cho phép các mô hình văn bản-sang-hình ảnh có thể mở rộng và cải thiện một cách đáng tin cậy, nhờ vào các tính chất mở rộng đã được hiểu rõ của các transformer.

Thách thức và giải pháp trong tạo ra hình ảnh

Mặc dù có những tiến bộ, việc kiểm soát trong tạo ra hình ảnh vẫn còn là một thách thức. Các vấn đề như việc tuân theo lời nhắc, nơi mô hình có thể không tuân theo sát văn bản đầu vào, đã phổ biến. Để giải quyết vấn đề này, các phương pháp mới như cải thiện chú thích đã được đề xuất, nhằm mục đích nâng cao chất lượng của các cặp văn bản và hình ảnh trong tập dữ liệu đào tạo.

Cải thiện chú thích: Một phương pháp mới

Cải thiện chú thích liên quan đến việc tạo ra các chú thích chất lượng cao hơn cho hình ảnh, điều này sau đó giúp đào tạo các mô hình văn bản-sang-hình ảnh chính xác hơn. Điều này được thực hiện thông qua một hệ thống chú thích hình ảnh mạnh mẽ tạo ra các mô tả chi tiết và chính xác của hình ảnh. Bằng cách đào tạo trên những chú thích cải thiện này, DALL-E 3 đã đạt được kết quả đáng chú ý, gần giống với các bức tranh và tác phẩm nghệ thuật do con người tạo ra.

Đào tạo trên dữ liệu tổng hợp

Khái niệm đào tạo trên dữ liệu tổng hợp không mới. Tuy nhiên, đóng góp độc đáo ở đây là việc tạo ra một hệ thống chú thích hình ảnh mới, mô tả. Tác động của việc sử dụng các chú thích tổng hợp để đào tạo các mô hình tạo sinh đã đáng kể, dẫn đến sự cải thiện trong khả năng của mô hình trong việc tuân theo lời nhắc một cách chính xác.

Đánh giá DALL-E 3

Thông qua nhiều đánh giá và so sánh với các mô hình trước đó như DALL-E 2 và Stable Diffusion XL, DALL-E 3 đã thể hiện hiệu suất vượt trội, đặc biệt là trong các nhiệm vụ liên quan đến việc tuân theo lời nhắc.

So sánh các mô hình văn bản-sang-hình ảnh trên các đánh giá khác nhau

So sánh các mô hình văn bản-sang-hình ảnh trên các đánh giá khác nhau

Sử dụng các đánh giá tự động và các điểm chuẩn đã cung cấp bằng chứng rõ ràng về khả năng của nó, củng cố vị trí của nó như một mô hình văn bản-sang-hình ảnh hàng đầu.

DALL-E 3: Lời nhắc và khả năng

DALL-E 3 cung cấp một cách tiếp cận logic và tinh chỉnh hơn để tạo ra hình ảnh. Khi bạn cuộn qua, bạn sẽ nhận thấy cách DALL-E tạo ra từng hình ảnh, với sự kết hợp giữa độ chính xác và trí tưởng tượng mà phù hợp với lời nhắc cho trước.

Không giống như phiên bản trước, phiên bản nâng cấp này vượt trội trong việc sắp xếp các vật thể một cách tự nhiên trong một cảnh và thể hiện các đặc điểm của con người một cách chính xác, xuống đến số lượng ngón tay trên một bàn tay. Những cải tiến này mở rộng đến các chi tiết tinh tế và hiện có ở độ phân giải cao hơn, đảm bảo một đầu ra thực tế và chuyên nghiệp hơn.

Khả năng hiển thị văn bản cũng đã được cải thiện đáng kể. Trong khi các phiên bản trước của DALL-E tạo ra văn bản không có nghĩa, DALL-E 3 có thể tạo ra văn bản có thể đọc được và được thiết kế chuyên nghiệp (thỉnh thoảng), và thậm chí cả logo sạch sẽ vào một số dịp.

Khả năng hiểu các yêu cầu hình ảnh phức tạp và tinh vi của mô hình đã được cải thiện đáng kể. DALL-E 3 có thể tuân theo các mô tả chi tiết, thậm chí trong các kịch bản có nhiều yếu tố và hướng dẫn cụ thể, thể hiện khả năng tạo ra hình ảnh hợp lý và được sắp xếp tốt.

Hãy cùng khám phá một số lời nhắc và đầu ra tương ứng mà chúng tôi đã nhận được:

Thiết kế bao bì cho một dòng trà hữu cơ. Bao gồm không gian cho tên sản phẩm và mô tả.

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản (Lưu ý rằng áp phích bên trái có lỗi chính tả)

Tạo một banner web quảng cáo cho một buổi bán hàng mùa hè về đồ nội thất ngoài trời. Hình ảnh sẽ có một bối cảnh bãi biển với các món đồ nội thất ngoài trời khác nhau và văn bản thông báo 'Tiết kiệm mùa hè lớn!'

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Một áp phích du lịch cổ điển về Paris với văn bản đậm và kiểu cách ở dưới cùng nói 'Thăm Paris'.

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản (Lưu ý rằng cả hai áp phích đều có lỗi chính tả)

Một cảnh nhộn nhịp của lễ hội Diwali ở Ấn Độ, với các gia đình thắp đèn, pháo hoa trên bầu trời và đồ trang trí truyền thống.
Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Tạo một hình ảnh chi tiết về một chợ ở La Mã cổ, với người dân mặc quần áo phù hợp với thời kỳ, các loại hàng hóa khác nhau để bán và kiến trúc của thời kỳ đó.
Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Tạo một hình ảnh của một nhân vật lịch sử nổi tiếng, như Cleopatra hoặc Leonardo da Vinci, đặt trong một bối cảnh hiện đại, sử dụng công nghệ hiện đại như điện thoại thông minh hoặc máy tính xách tay.
Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Hình ảnh DALL-E 3 dựa trên lời nhắc văn bản

Giới hạn và Rủi ro của DALL-E 3

OpenAI đã thực hiện các bước quan trọng để lọc nội dung rõ ràng khỏi dữ liệu đào tạo của DALL-E 3, nhằm giảm thiểu các thiên vị và cải thiện đầu ra của mô hình. Điều này bao gồm việc áp dụng các bộ lọc cụ thể cho các loại nội dung nhạy cảm và sửa đổi các ngưỡng cho các bộ lọc rộng hơn. Bộ ngăn chặn cũng bao gồm nhiều lớp bảo vệ, chẳng hạn như cơ chế từ chối trong ChatGPT cho các chủ đề nhạy cảm, phân loại đầu vào lời nhắc để ngăn chặn vi phạm chính sách, danh sách đen cho các loại nội dung cụ thể và biến đổi để đảm bảo lời nhắc tuân theo hướng dẫn.

Mặc dù có những tiến bộ, DALL-E 3 vẫn có những hạn chế trong việc hiểu các mối quan hệ không gian, hiển thị văn bản dài chính xác và tạo ra hình ảnh cụ thể. OpenAI công nhận những thách thức này và đang làm việc trên các cải tiến cho các phiên bản trong tương lai.

Công ty cũng đang làm việc trên các cách để phân biệt hình ảnh được tạo ra bởi AI với những hình ảnh được tạo ra bởi con người, phản ánh cam kết của họ đối với tính minh bạch và sử dụng AI có trách nhiệm.

DALL·E

DALL·E 3

DALL-E 3, phiên bản mới nhất, sẽ được phát hành theo từng giai đoạn, bắt đầu với các nhóm khách hàng cụ thể và sau đó mở rộng đến các phòng thí nghiệm nghiên cứu và dịch vụ API. Tuy nhiên, ngày phát hành công khai miễn phí vẫn chưa được xác nhận.

OpenAI thực sự đang thiết lập một tiêu chuẩn mới trong lĩnh vực AI với DALL-E 3, kết nối liền mạch các khả năng kỹ thuật phức tạp và giao diện người dùng thân thiện. Việc tích hợp DALL-E 3 vào các nền tảng được sử dụng rộng rãi như Bing phản ánh một sự thay đổi từ các ứng dụng chuyên dụng sang các hình thức giải trí và tiện ích rộng lớn hơn, dễ tiếp cận hơn.

Trò chơi thay đổi thực sự trong những năm tới sẽ có khả năng là sự cân bằng giữa đổi mới và trao quyền cho người dùng. Các công ty thành công sẽ là những công ty không chỉ đẩy ranh giới của những gì AI có thể đạt được, mà còn cung cấp cho người dùng sự tự chủ và kiểm soát mà họ mong muốn. OpenAI, với cam kết về AI đạo đức, đang đi trên con đường này một cách cẩn thận. Mục tiêu rõ ràng: tạo ra các công cụ AI không chỉ mạnh mẽ, mà còn đáng tin cậy và bao gồm, đảm bảo rằng lợi ích của AI có thể tiếp cận được với tất cả.

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.