Mô hình và nền tảng AI

Các tác nhân di động tự động: Tác nhân thiết bị di động đa phương thức tự động với nhận thức hình ảnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Sự ra đời của các mô hình ngôn ngữ lớn đa phương thức (MLLM) đã mở ra một kỷ nguyên mới cho các tác nhân thiết bị di động, có khả năng hiểu và tương tác với thế giới thông qua văn bản, hình ảnh và giọng nói. Những tác nhân này đánh dấu một bước tiến đáng kể so với trí tuệ nhân tạo truyền thống, cung cấp một cách thức phong phú và trực quan hơn cho người dùng tương tác với thiết bị của họ. Bằng cách tận dụng MLLM, những tác nhân này có thể xử lý và tổng hợp lượng thông tin khổng lồ từ các phương thức khác nhau, cho phép chúng cung cấp sự hỗ trợ cá nhân hóa và nâng cao trải nghiệm người dùng theo những cách trước đây không thể tưởng tượng được.

Những tác nhân này được trang bị các kỹ thuật học máy tiên tiến và khả năng xử lý ngôn ngữ tự nhiên nâng cao, cho phép chúng hiểu và tạo ra văn bản giống con người, cũng như diễn giải dữ liệu hình ảnh và âm thanh với độ chính xác đáng kinh ngạc. Từ việc nhận dạng đối tượng và cảnh trong hình ảnh đến hiểu lệnh nói và phân tích cảm xúc văn bản, những tác nhân đa phương thức này được trang bị để xử lý một loạt các đầu vào một cách mượt mà. Tiềm năng của công nghệ này là vô tận, cung cấp các dịch vụ tinh vi và nhận thức ngữ cảnh hơn, chẳng hạn như trợ lý ảo được điều chỉnh theo cảm xúc con người và công cụ giáo dục thích ứng với phong cách học tập cá nhân. Chúng cũng có khả năng cách mạng hóa khả năng tiếp cận, làm cho công nghệ trở nên thân thiện hơn trên các rào cản ngôn ngữ và cảm giác.

Trong bài viết này, chúng ta sẽ thảo luận về Mobile-Agents, một tác nhân thiết bị di động tự động đa phương thức đầu tiên tận dụng khả năng của các công cụ nhận thức hình ảnh để xác định và định vị chính xác các yếu tố hình ảnh và văn bản trong giao diện người dùng của ứng dụng di động. Sử dụng bối cảnh hình ảnh này, khuôn khổ Mobile-Agent tự động lên kế hoạch và phân tích nhiệm vụ phức tạp, điều hướng qua các ứng dụng di động qua các hoạt động từng bước. Khung Mobile-Agent khác với các giải pháp hiện có vì nó không dựa vào siêu dữ liệu hệ thống di động hoặc tệp XML của ứng dụng di động, cho phép khả năng thích ứng cao hơn trên các môi trường di động đa dạng theo cách tập trung vào hình ảnh.

Các tác nhân di động tự động: Tác nhân thiết bị di động đa phương thức tự động

Trong thế giới di động đang phát triển nhanh chóng, một khái niệm tiên phong nổi lên như một điểm nổi bật: Các mô hình ngôn ngữ lớn, đặc biệt là các mô hình ngôn ngữ lớn đa phương thức hoặc MLLM, có khả năng tạo ra nhiều loại văn bản, hình ảnh, video và giọng nói trên các ngôn ngữ khác nhau. Sự phát triển nhanh chóng của các khuôn khổ MLLM trong những năm gần đây đã dẫn đến một ứng dụng mới và mạnh mẽ của MLLM: các tác nhân di động tự động. Các tác nhân di động tự động là các thực thể phần mềm hoạt động, di chuyển và hoạt động độc lập, không cần lệnh trực tiếp từ con người, được thiết kế để điều hướng qua mạng hoặc thiết bị để thực hiện nhiệm vụ, thu thập thông tin hoặc giải quyết vấn đề.

Các tác nhân di động được thiết kế để vận hành thiết bị di động của người dùng dựa trên hướng dẫn của người dùng và hình ảnh trên màn hình, một nhiệm vụ đòi hỏi các tác nhân phải có khả năng hiểu ngữ nghĩa và nhận thức hình ảnh. Tuy nhiên, các tác nhân di động hiện có còn xa mới hoàn hảo vì chúng dựa trên các mô hình ngôn ngữ lớn đa phương thức, và ngay cả các khuôn khổ MLLM hiện tại như GPT-4V cũng thiếu khả năng nhận thức hình ảnh cần thiết để trở thành một tác nhân di động hiệu quả.

Để giải quyết vấn đề này, một số khuôn khổ đã chọn tận dụng các tệp bố cục giao diện người dùng để hỗ trợ GPT-4V hoặc các MLLM khác với khả năng định vị, với một số khuôn khổ quản lý để trích xuất các vị trí hoạt động trên màn hình bằng cách truy cập vào các tệp XML của ứng dụng, trong khi các khuôn khổ khác chọn sử dụng mã HTML từ các ứng dụng web. Như có thể thấy, hầu hết các khuôn khổ này phụ thuộc vào việc truy cập vào các tệp ứng dụng và địa phương, khiến phương pháp này gần như không hiệu quả nếu khuôn khổ không thể truy cập vào các tệp này. Để giải quyết vấn đề này và loại bỏ sự phụ thuộc của các tác nhân địa phương vào các tệp cơ sở và phương pháp định vị, các nhà phát triển đã làm việc trên Mobile-Agent, một tác nhân di động tự động với khả năng nhận thức hình ảnh ấn tượng.

Ngoài ra, khuôn khổ Mobile-Agents nhằm tận dụng khả năng ngữ cảnh của các khuôn khổ MLLM hiện đại như GPT-4V để đạt được khả năng tự lập kế hoạch, cho phép mô hình lên kế hoạch nhiệm vụ dựa trên lịch sử hoạt động, hướng dẫn người dùng và hình ảnh chụp màn hình một cách toàn diện. Để tăng cường khả năng của tác nhân trong việc xác định hướng dẫn không đầy đủ và hoạt động không chính xác, khuôn khổ Mobile-Agent giới thiệu một phương pháp tự phản ánh. Theo hướng dẫn của các lệnh được tạo ra cẩn thận, tác nhân phản ánh về các hoạt động không chính xác và không hợp lệ một cách nhất quán, và dừng hoạt động khi nhiệm vụ hoặc hướng dẫn đã được hoàn thành.

Tổng quan, những đóng góp của khuôn khổ Mobile-Agent có thể được tóm tắt như sau:

  1. Mobile-Agent hoạt động như một tác nhân thiết bị di động tự động, sử dụng các công cụ nhận thức hình ảnh để thực hiện định vị hoạt động. Nó lên kế hoạch từng bước một cách có hệ thống và tham gia vào việc tự phản ánh. Đặc biệt, Mobile-Agent chỉ dựa vào hình ảnh chụp màn hình của thiết bị, không sử dụng bất kỳ mã hệ thống nào, thể hiện một giải pháp hoàn toàn dựa trên kỹ thuật hình ảnh.
  2. Mobile-Agent giới thiệu Mobile-Eval, một chuẩn mực được thiết kế để đánh giá các tác nhân thiết bị di động. Chuẩn mực này bao gồm 10 ứng dụng di động phổ biến nhất, cùng với các hướng dẫn thông minh cho các ứng dụng này, được phân loại thành ba mức độ khó khăn.

Mobile-Agent: Kiến trúc và Phương pháp luận

Ở cốt lõi, khuôn khổ Mobile-Agent bao gồm một mô hình ngôn ngữ lớn đa phương thức hiện đại, GPT-4V, một mô-đun phát hiện văn bản được sử dụng cho các nhiệm vụ định vị văn bản. Cùng với GPT-4V, Mobile-Agent cũng sử dụng một mô-đun phát hiện biểu tượng cho việc định vị biểu tượng.

Nhận thức hình ảnh

Như đã đề cập trước đó, mô hình MLLM GPT-4V mang lại kết quả hài lòng cho các hướng dẫn và hình ảnh chụp màn hình, nhưng nó không thể xuất ra vị trí hiệu quả nơi các hoạt động diễn ra. Do hạn chế này, khuôn khổ Mobile-Agent thực hiện mô hình GPT-4V cần phải dựa vào các công cụ bên ngoài để hỗ trợ việc định vị hoạt động, do đó tạo điều kiện cho việc xuất ra hoạt động trên màn hình di động.

Định vị văn bản

Khuôn khổ Mobile-Agent thực hiện một công cụ OCR để phát hiện vị trí của văn bản tương ứng trên màn hình mỗi khi tác nhân cần chạm vào một văn bản cụ thể được hiển thị trên màn hình di động. Có ba kịch bản định vị văn bản độc đáo.

Kịch bản 1: Không phát hiện văn bản được chỉ định

Vấn đề: OCR không thể phát hiện văn bản được chỉ định, điều này có thể xảy ra trong các hình ảnh phức tạp hoặc do các hạn chế của OCR.

Phản hồi: Hướng dẫn cho tác nhân để:

  • Chọn lại văn bản để chạm, cho phép sửa đổi thủ công sự bỏ sót của OCR, hoặc
  • Chọn một hoạt động thay thế, chẳng hạn như sử dụng một phương pháp nhập khác hoặc thực hiện một hành động khác liên quan đến nhiệm vụ đang thực hiện.

Lý do: Sự linh hoạt này là cần thiết để quản lý các sai sót hoặc ảo giác偶爾 của GPT-4V, đảm bảo tác nhân vẫn có thể tiếp tục hiệu quả.

Kịch bản 2: Phát hiện một thể hiện của văn bản được chỉ định

Hoạt động: Tự động tạo ra một hành động để nhấp vào tọa độ trung tâm của hộp văn bản được phát hiện.

Giải thích: Với chỉ một thể hiện được phát hiện, khả năng nhận dạng chính xác là cao, làm cho nó hiệu quả để tiếp tục với một hành động trực tiếp.

Kịch bản 3: Phát hiện nhiều thể hiện của văn bản được chỉ định

Đánh giá: Đầu tiên, đánh giá số thể hiện được phát hiện:

Nhiều thể hiện: Chỉ ra một màn hình bị lộn xộn với nội dung tương tự, làm phức tạp quá trình chọn.

Hành động: Yêu cầu tác nhân chọn lại văn bản, nhằm tinh chỉnh lựa chọn hoặc điều chỉnh các tham số tìm kiếm.

Ít thể hiện: Một số thể hiện có thể quản lý được cho phép một cách tiếp cận tinh tế hơn.

Hành động: Cắt các khu vực xung quanh những thể hiện này, mở rộng các hộp văn bản ra ngoài để thu thập thêm ngữ cảnh. Việc mở rộng này đảm bảo rằng nhiều thông tin hơn được bảo tồn, hỗ trợ việc ra quyết định.

Bước tiếp theo: Vẽ các hộp phát hiện trên các hình ảnh đã cắt và trình bày chúng cho tác nhân. Sự hỗ trợ trực quan này giúp tác nhân trong việc quyết định thể hiện nào để tương tác, dựa trên các gợi ý ngữ cảnh hoặc yêu cầu nhiệm vụ.

Cách tiếp cận có cấu trúc này tối ưu hóa sự tương tác giữa kết quả OCR và hoạt động của tác nhân, nâng cao độ tin cậy và khả năng thích ứng của hệ thống trong việc xử lý các nhiệm vụ dựa trên văn bản trên các kịch bản khác nhau. Toàn bộ quá trình được minh họa trong hình ảnh sau.

Định vị biểu tượng

Khuôn khổ Mobile-Agent thực hiện một công cụ phát hiện biểu tượng để định vị vị trí của một biểu tượng khi tác nhân cần nhấp vào nó trên màn hình di động. Cụ thể hơn, khuôn khổ đầu tiên yêu cầu tác nhân cung cấp các thuộc tính cụ thể của hình ảnh, bao gồm hình dạng và màu sắc, và sau đó khuôn khổ thực hiện phương pháp Grounding DINO với lệnh biểu tượng để xác định tất cả các biểu tượng chứa trong hình ảnh chụp màn hình. Cuối cùng, Mobile-Agent sử dụng khuôn khổ CLIP để tính toán sự tương似 giữa mô tả của khu vực nhấp và tính toán sự tương似 giữa các biểu tượng đã xóa, và chọn khu vực có sự tương似 cao nhất để nhấp.

Thực hiện hướng dẫn

Để chuyển đổi các hành động thành hoạt động trên màn hình bởi các tác nhân, khuôn khổ Mobile-Agent định nghĩa 8 hoạt động khác nhau.

  • Khởi chạy ứng dụng (Tên ứng dụng): Khởi động ứng dụng được chỉ định từ giao diện desktop.
  • Chạm vào văn bản (Nhãn văn bản): Tương tác với phần màn hình hiển thị nhãn.
  • Tương tác với biểu tượng (Mô tả biểu tượng, Vị trí): Nhắm vào và chạm vào khu vực biểu tượng được chỉ định, nơi “Mô tả biểu tượng” chi tiết các thuộc tính như màu sắc và hình dạng của biểu tượng. Chọn “Vị trí” từ các tùy chọn như trên, dưới, trái, phải hoặc trung tâm, có thể kết hợp hai để điều hướng chính xác và giảm thiểu sai sót.
  • Nhập văn bản (Văn bản nhập): Nhập văn bản đã cho vào trường văn bản đang hoạt động.
  • Kéo lên và xuống: Điều hướng lên hoặc xuống qua nội dung của trang hiện tại.
  • Quay lại: Quay lại trang trước.
  • Đóng: Quay lại màn hình chính trực tiếp từ màn hình hiện tại.
  • Dừng: Kết thúc hoạt động khi nhiệm vụ được hoàn thành.

Tự lập kế hoạch

Mỗi bước của hoạt động được thực hiện một cách lặp lại bởi khuôn khổ, và trước khi bắt đầu mỗi lần lặp lại, người dùng được yêu cầu cung cấp hướng dẫn nhập, và mô hình Mobile-Agent sử dụng hướng dẫn để tạo một lệnh hệ thống cho toàn bộ quá trình. Hơn nữa, trước khi bắt đầu mỗi lần lặp lại, khuôn khổ chụp một hình ảnh chụp màn hình và cung cấp nó cho tác nhân. Tác nhân sau đó quan sát hình ảnh chụp màn hình, lịch sử hoạt động và lệnh hệ thống để xuất ra bước tiếp theo của hoạt động.

Tự phản ánh

Trong quá trình hoạt động, tác nhân có thể gặp phải các lỗi ngăn cản nó thực hiện lệnh một cách thành công. Để nâng cao tỷ lệ hoàn thành hướng dẫn, một phương pháp tự đánh giá đã được thực hiện, hoạt động dưới hai hoàn cảnh cụ thể. Đầu tiên, nếu tác nhân thực hiện một hành động không chính xác hoặc không hợp lệ khiến tiến trình bị dừng lại, chẳng hạn như khi nó nhận ra hình ảnh chụp màn hình vẫn không thay đổi sau hoạt động hoặc hiển thị trang không chính xác, nó sẽ được hướng dẫn để xem xét các hành động thay thế hoặc điều chỉnh các tham số của hoạt động hiện tại. Thứ hai, tác nhân có thể bỏ sót một số yếu tố của một hướng dẫn phức tạp. Một khi tác nhân đã thực hiện một loạt các hành động dựa trên kế hoạch ban đầu của nó, nó sẽ được yêu cầu xem xét lại chuỗi hành động, hình ảnh chụp màn hình mới nhất và hướng dẫn của người dùng để đánh giá xem nhiệm vụ đã được hoàn thành hay chưa. Nếu có sự không nhất quán, tác nhân được giao nhiệm vụ tự động tạo ra các hành động mới để hoàn thành hướng dẫn.

Mobile-Agent: Thử nghiệm và Kết quả

Để đánh giá khả năng của nó một cách toàn diện, khuôn khổ Mobile-Agent giới thiệu chuẩn mực Mobile-Eval bao gồm 10 ứng dụng di động phổ biến nhất, và thiết kế ba hướng dẫn cho mỗi ứng dụng. Hoạt động đầu tiên là trực tiếp, và chỉ bao gồm các hoạt động ứng dụng cơ bản, trong khi hoạt động thứ hai là phức tạp hơn hoạt động đầu tiên vì nó có một số yêu cầu bổ sung. Cuối cùng, hoạt động thứ ba là phức tạp nhất trong tất cả vì nó chứa hướng dẫn trừu tượng của người dùng mà người dùng không chỉ định rõ ứng dụng nào để sử dụng hoặc hoạt động nào để thực hiện.

Tiếp theo, để đánh giá hiệu suất từ các góc độ khác nhau, khuôn khổ Mobile-Agent thiết kế và thực hiện 4 chỉ số khác nhau.

  • Thành công hoặc Success: Nếu tác nhân di động hoàn thành hướng dẫn, nó được coi là thành công.
  • Điểm quá trình hoặc PS: Chỉ số Điểm quá trình đo lường độ chính xác của mỗi bước trong quá trình thực hiện hướng dẫn của người dùng, và nó được tính bằng cách chia số bước chính xác cho tổng số bước.
  • Hiệu suất tương đối hoặc RE: Chỉ số hiệu suất tương đối là một tỷ lệ hoặc so sánh giữa số bước cần thiết để con người thực hiện hướng dẫn thủ công và số bước cần thiết để tác nhân thực hiện hướng dẫn đó.
  • Tỷ lệ hoàn thành hoặc CR: Chỉ số tỷ lệ hoàn thành chia số bước được thực hiện thành công bởi khuôn khổ cho tổng số bước thực hiện bởi con người để hoàn thành hướng dẫn. Giá trị của CR là 1 khi tác nhân hoàn thành hướng dẫn thành công.

Kết quả được thể hiện trong hình sau.

Ban đầu, đối với ba nhiệm vụ đã cho, Mobile-Agent đạt được tỷ lệ hoàn thành là 91%, 82% và 82%, tương ứng. Mặc dù không tất cả các nhiệm vụ đều được thực hiện một cách hoàn hảo, tỷ lệ thành công cho mỗi loại nhiệm vụ đều vượt quá 90%. Hơn nữa, chỉ số PS cho thấy Mobile-Agent liên tục thể hiện khả năng cao trong việc thực hiện các hành động chính xác cho ba nhiệm vụ, với tỷ lệ thành công khoảng 80%. Ngoài ra, theo chỉ số RE, Mobile-Agent thể hiện hiệu suất 80% trong việc thực hiện các hoạt động ở mức so sánh được với tối ưu hóa của con người. Những kết quả này cùng nhau nhấn mạnh khả năng của Mobile-Agent như một trợ lý thiết bị di động.

Hình sau minh họa khả năng của Mobile-Agent trong việc nắm bắt các lệnh của người dùng và tự động hóa các hành động của nó. Ngay cả khi không có chi tiết hoạt động cụ thể trong hướng dẫn, Mobile-Agent đã giải thích một cách thành thạo nhu cầu của người dùng, chuyển chúng thành các nhiệm vụ có thể thực hiện được. Sau khi hiểu này, tác nhân đã thực hiện hướng dẫn thông qua một quá trình lập kế hoạch có hệ thống.

Lời kết

Trong bài viết này, chúng ta đã thảo luận về Mobile-Agents, một tác nhân thiết bị di động tự động đa phương thức đầu tiên tận dụng khả năng của các công cụ nhận thức hình ảnh để xác định và định vị chính xác các yếu tố hình ảnh và văn bản trong giao diện người dùng của ứng dụng di động. Với bối cảnh hình ảnh này, khuôn khổ Mobile-Agent tự động lên kế hoạch và phân tích nhiệm vụ phức tạp, điều hướng qua các ứng dụng di động qua các hoạt động từng bước. Khuôn khổ này khác với các giải pháp hiện có vì nó không dựa vào siêu dữ liệu hệ thống di động hoặc tệp XML của ứng dụng di động, cho phép khả năng thích ứng cao hơn trên các môi trường di động đa dạng theo cách tập trung vào hình ảnh. Chiến lược được sử dụng bởi khuôn khổ Mobile-Agent loại bỏ nhu cầu về các điều chỉnh cụ thể cho hệ thống, dẫn đến hiệu suất được cải thiện và giảm nhu cầu tính toán.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.