Góc nhìn Anderson

AI sử dụng hình ảnh trong suy luận Chuỗi suy nghĩ (CoT)

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Chúng ta thường suy nghĩ bằng hình ảnh — ít nhất là phần lớn chúng ta: ở con người, khả năng tưởng tượng bằng thị giác bị suy giảm đã được nghiên cứu chứng minh là có liên quan đến kết quả học tập thấp hơn. Về khả năng ghi nhớ — nhu cầu nhớ mọi thứ của chúng ta, chứ không phải nỗi lo của AI — sức mạnh ngữ nghĩa đáng kể của hình ảnh mạnh mẽ hoặc sống động đã được sử dụng suốt hàng thiên niên kỷ như một phương tiện hỗ trợ học tập:

“Ngôi đền Thời gian” của Emma Willard (1846), một hình ảnh trực quan giáo dục biến niên đại thành không gian vật lý, sắp xếp các thời kỳ và nhân vật lịch sử trong phối cảnh kiến trúc lùi dần. Willard thiết kế những hình ảnh như vậy để làm công cụ ghi nhớ trực quan, vì bà tin rằng các biểu diễn đồ họa có thể giúp học sinh hình thành một bức tranh tinh thần mạch lạc về lịch sử. Nguồn - https://publicdomainreview.org/essay/emma-willard-maps-of-time/

“Ngôi đền Thời gian” của Emma Willard (1846), một hình ảnh trực quan giáo dục biến niên đại thành không gian vật lý, sắp xếp các thời kỳ và nhân vật lịch sử trong phối cảnh kiến trúc lùi dần. Willard thiết kế những hình ảnh như vậy để làm công cụ ghi nhớ trực quan, vì bà tin rằng các biểu diễn đồ họa có thể giúp học sinh hình thành một bức tranh tinh thần mạch lạc về lịch sử. Nguồn

Tuy nhiên, lĩnh vực kỹ thuật ghi nhớ liên quan đến việc tiếp nhận dữ liệu hơn là xử lý hoặc diễn giải dữ liệu, nơi con người khác biệt đáng kể về những “phong cách” tư duy mà họ dựa vào.

Cá nhân tôi suy nghĩ bằng hình dạng và đã làm như vậy từ khi bắt đầu biết suy nghĩ — các thập kỷ, năm tháng, ý tưởng và con người đều được biểu diễn theo một cách nào đó bằng hình học tương đối và những khối thể tích động. Một số người chủ yếu suy nghĩ bằng con số; những người khác lại bằng mùi hoặc vị.

Đối với AI, phạm vi các phương pháp liên giác quan khả dĩ bị hạn chế hơn. Một Mô hình Ngôn ngữ Lớn (LLM) đương nhiên có thể suy nghĩ bằng văn bản, vì đây là kiểu mã hóa gốc của nó, nằm trên cấp độ embedding; đồng thời, các LLM đã được chứng minh là mã hóa con số dưới dạng khái niệm thay vì giá trị biến thuần túy, cho thấy khuynh hướng “suy nghĩ bằng con số”.

Nhưng có thể nói một LLM “suy nghĩ bằng hình dạng” hay “suy nghĩ bằng hình ảnh” giống như con người thường làm đến mức nào?

Việc một người nhận được các phản hồi khác nhau từ LLM cho cùng một câu hỏi được trình bày bằng những ngôn ngữ khác nhau cho thấy các mối quan hệ đó có thể rất cụ thể và mong manh, đồng thời bị mã hóa cứng cho văn bản cụ thể trong một miền ngôn ngữ — chẳng hạn “tiếng Tây Ban Nha” — thay vì hướng đến một miền cấp cao hơn vừa vượt ra ngoài vừa bao hàm ngôn ngữ*.

Vì vậy, một LLM đa phương thức — tức Mô hình Ngôn ngữ-Thị giác hay VLM — có thể tạo hình ảnh chỉ dành cho Chuỗi suy nghĩ nội bộ của chính nó (COT) về mặt logic có thể có lợi thế, hoặc ít nhất là một góc nhìn thay thế theo đúng nghĩa đen.

Các góc nhìn mới

Với ý tưởng đó, một nhóm hợp tác nghiên cứu gần đây từ Đức đã đề xuất một VLM tập trung vào hình ảnh có tên ReImaGin, khai thác việc tạo hình ảnh như một cơ chế suy luận linh hoạt.

Dù các công trình trước đây đã “gắn thêm” những thành phần dựa trên hình ảnh, các chức năng này không mang tính nội tại cũng không thiết yếu đối với quy trình cốt lõi. Ngược lại, hệ thống mới của các tác giả được thiết kế để tận dụng các khả năng rất mới của VLM nhằm thay thế và tiếp quản chức năng của công cụ chuyên biệt và phương pháp, chẳng hạn như cảm nhận chiều sâu.

Trong ví dụ bên dưới từ bài báo mới có tiêu đề Reasoning with Image Generation, AI phải diễn giải hai góc nhìn — các hình ngoài cùng bên trái — nhưng không góc nhìn nào chứa toàn bộ thông tin cần thiết để giải quyết nhiệm vụ. Do đó, mô hình có thể dùng thông tin sẵn có để diễn giải một bức tranh rộng và hoàn chỉnh hơn về cảnh vật — bản đồ có chú thích phụ “Generated Visualization”, hình thứ ba từ bên trái ở dưới.

Một ví dụ từ bài báo mới, trong đó ReImaGin tạo bản đồ nhìn từ trên xuống từ hai góc nhìn không đầy đủ, cung cấp cho mô hình một biểu diễn trực quan thống nhất để suy luận. Nguồn - https://arxiv.org/pdf/2609.16409

Một ví dụ từ bài báo mới, trong đó ReImaGin tạo bản đồ nhìn từ trên xuống từ hai góc nhìn không đầy đủ, cung cấp cho mô hình một biểu diễn trực quan thống nhất để suy luận. Nguồn

ReImaGin không bị ràng buộc vào một kiểu biến đổi trực quan cụ thể. Thay vào đó, nó có thể hoàn thiện các vùng còn thiếu của câu đố, loại bỏ vật che khuất để đếm, vẽ quỹ đạo nhằm dự đoán va chạm, kết hợp nhiều góc nhìn thành bản đồ không gian, chuyển đường đứt đoạn thành đường liền để lần theo, và tạo bản đồ chiều sâu cho suy luận chiều sâu.

Quan trọng hơn, hệ thống có thể tự điều chỉnh cách dùng bộ công cụ nội bộ này, phù hợp với những khả năng mới nổi gần đây của VLM trong việc tự động xử lý các thách thức cụ thể bằng công cụ thích hợp, như ước tính chiều sâu. Phần lớn chức năng được mô tả của ReImaGin được gọi thông qua công cụ generate_image, một hàm có thể can thiệp bằng hình ảnh khi cần mà không cần con người giám sát hay kích hoạt.

Các tác giả cho biết:

“Vì generate_image chấp nhận các chỉ dẫn ngôn ngữ tự nhiên tùy ý, tác nhân có thể thực hiện một phạm vi biến đổi rất lớn; câu hỏi là biến đổi nào thực sự hữu ích cho một nhiệm vụ nhất định.

“Thông lệ [tiêu chuẩn] là chỉ định phép biến đổi thông qua các ví dụ trong ngữ cảnh được tạo thủ công để minh họa chiến lược mong muốn — chẳng hạn tạo bản đồ chiều sâu cho suy luận chiều sâu. Cách này đòi hỏi công sức thủ công cho từng nhiệm vụ và hạn chế khả năng khái quát sang nhiệm vụ mới.”

“[Chúng tôi] đặt câu hỏi liệu những chiến lược như vậy có thể được khám phá tự động hay không. Vì chiến lược được truyền cho tác nhân thông qua prompt, việc khám phá chiến lược có thể quy về tối ưu hóa prompt: chúng tôi thiết lập một vòng lặp trong đó mô hình đề xuất tạo các prompt ứng viên, đánh giá chúng trên một tập phát triển nhỏ, rồi tinh chỉnh dựa trên những thành công và thất bại quan sát được.”

Khi được thử nghiệm trên ba VLM và sáu nhiệm vụ suy luận trực quan, ReImaGin nhìn chung vượt trội cả suy luận không hỗ trợ lẫn các công cụ thị giác chuyên biệt dù chỉ sử dụng một công cụ.

Phương pháp

ReImaGin hoạt động theo một vòng lặp: ở mỗi bước, VLM xem xét câu hỏi, các hình ảnh gốc và mọi thứ nó đã tạo ra, rồi quyết định hành động tiếp theo. Hành động này có thể bao gồm các thao tác hình ảnh thông thường như cắt hoặc chồng lớp, hay một lệnh gọi đến generate_image để tạo một hình ảnh mới chuyên biệt nhằm giúp vấn đề dễ suy luận hơn:

Minh họa từng bước cách ReImaGin suy luận qua các bài toán không gian và câu đố trực quan. Trong cả hai ví dụ, mô hình tạo một hình ảnh mới trong quá trình suy luận, rồi dùng hình ảnh đó làm đầu vào bổ sung cho các bước tiếp theo hướng đến câu trả lời.

Minh họa từng bước cách ReImaGin suy luận qua các bài toán không gian và câu đố trực quan. Trong cả hai ví dụ, mô hình tạo một hình ảnh mới trong quá trình suy luận, rồi dùng hình ảnh đó làm đầu vào bổ sung cho các bước tiếp theo hướng đến câu trả lời.

Hình ảnh được tạo sau đó được đưa trở lại VLM, trở thành một phần tài liệu có sẵn cho bước suy luận tiếp theo, và quy trình có thể lặp lại. Trong hình trên, ta có thể thấy những khía cạnh này được minh họa cho nhiệm vụ không gian: mô hình trước tiên kết hợp hai ảnh thành một góc nhìn duy nhất, rồi chuyển kết quả thành bản đồ nhìn từ trên xuống trước khi trả lời câu hỏi.

Đối với nhiệm vụ câu đố, nó tạo ra một phiên bản đã chỉnh sửa của câu đố để tách riêng vùng bị thiếu, rồi dùng phép trừ hình ảnh thông thường để xác định đáp án.

Bằng cách này, việc tạo hình ảnh trở thành một phần của chính quá trình suy luận chứ không phải sản phẩm cuối dành cho người dùng. Thật vậy, các hình ảnh trung gian này chỉ phục vụ quy trình COT của AI, không dành cho người dùng cuối trực tiếp xem.

Ở mỗi lượt, VLM tự chọn hành động tiếp theo dựa trên ngữ cảnh đã tích lũy. Hành động đó có thể là một bước suy luận khác, một thao tác hình ảnh thông thường, hoặc một chỉ dẫn bằng ngôn ngữ tự nhiên cho generate_image. Bất kỳ kết quả nào mà công cụ đã chọn trả về đều được thêm vào ngữ cảnh, cho phép mô hình xem xét kết quả và quyết định có biến đổi nó thêm lần nữa, dùng công cụ khác, hay tiến đến câu trả lời cuối cùng.

Giành quyền chủ động

Một vấn đề trọng tâm là quyết định loại hình ảnh nào thực sự giúp một nhiệm vụ cụ thể trở nên dễ hơn. ReImaGin đưa ra quyết định bằng cách thử nghiệm các chỉ dẫn khác nhau cho tác nhân, kiểm tra prompt ứng viên trên những ví dụ có đáp án đã biết, rồi dùng cả những lần thành công và thất bại để tạo prompt tốt hơn. Các lần lặp tiếp theo của vòng này cuối cùng tạo ra những chiến lược có hiệu suất tốt nhất.

Bản thân mô hình suy luận và bộ tạo hình ảnh không được huấn luyện lại trong quá trình này; chỉ các chỉ dẫn chi phối cách tác nhân sử dụng công cụ mới được tối ưu hóa. Vì vậy, các nhà nghiên cứu mô tả quy trình là “khám phá tự động” những chiến lược suy luận trực quan, mà không tự cung cấp các chiến lược chuyên biệt theo nhiệm vụ hay ví dụ suy luận.

Cấu hình và thử nghiệm

ReImaGin được đánh giá trên sáu nhiệm vụ suy luận trực quan: suy luận chiều sâu (Blink — xác định điểm nào trong hai điểm gần máy ảnh hơn); hoàn thiện câu đố (Mira — chọn mảnh đúng cho vùng hình ảnh bị thiếu); đếm với vật che khuất (CAPTURe — đếm các vật thể, bao gồm cả vật thể bị ẩn); dự đoán va chạm (Spatial457 — dự đoán vật thể mà mục tiêu đang chuyển động sẽ va vào); suy luận không gian (MMSI — xác định quan hệ giữa các vật thể qua những góc nhìn khác nhau); và lần theo đường đi — một chuẩn đánh giá mới yêu cầu mô hình đi theo các đường đứt đoạn nối số với chữ cái.

Từ bài báo 'MIRA, a Benchmark for Visual Chain-of-Thought', những ví dụ nổi bật về hình ảnh trực quan trong các quy trình chuỗi suy nghĩ. Nguồn - https://arxiv.org/pdf/2511.02779

Từ bài báo “MIRA, a Benchmark for Visual Chain-of-Thought”, những ví dụ nổi bật về hình ảnh trực quan trong các quy trình chuỗi suy nghĩ. Nguồn

Các nền tảng VLM được thử nghiệm gồm Gemini-3.1-Pro, GPT-5 và mô hình trọng số mở Qwen-3.5-27B. Việc tạo hình ảnh chủ yếu do Nano-Banana-Pro đảm nhiệm, đồng thời các mô hình trọng số mở FLUX.2 [dev] và Qwen-Image-Edit-2511 cũng được thử nghiệm. Gemini-3.1-Pro được dùng làm bộ chọn cho việc mở rộng tính toán tại thời điểm kiểm thử của quá trình tạo hình ảnh.

Trong hai baseline dùng để so sánh, VLM “vanilla” được các tác giả bài báo gọi là “No Tools” trả lời trực tiếp từ truy vấn và hình ảnh, không dùng công cụ hay thực thi mã. Trong khi đó, hệ thống Visual Sketchpad ra mắt năm 2024 trong trường hợp này cung cấp một bộ cố định các công cụ chuyên biệt về thị giác và thao tác hình ảnh, nhưng không có khả năng tạo hình ảnh mở.

Đối với nhiệm vụ không gian MMSI, cả hai baseline được cấp lượng tài nguyên tính toán tương tự ReImaGin bằng cách tạo 20 câu trả lời từ mỗi baseline và sử dụng câu trả lời xuất hiện thường xuyên nhất.

Hiệu suất được đo bằng độ chính xác trắc nghiệm cho tất cả các nhiệm vụ, ngoại trừ đếm với vật che khuất, vốn được đánh giá bằng sai số phần trăm tuyệt đối trung bình đối xứng khi so sánh số vật thể dự đoán và thực tế. Kết quả được lấy trung bình qua ba lần chạy, đồng thời sai số chuẩn cũng được báo cáo.

Kết quả thử nghiệm so sánh ReImaGin với No Tools và Visual Sketchpad trên ba VLM và sáu nhiệm vụ suy luận trực quan. Điểm cao hơn là tốt hơn, ngoại trừ Đếm với Vật che khuất, nơi sai số thấp hơn là tốt hơn. ReImaGin đạt kết quả tốt nhất trong phần lớn tổ hợp mô hình-nhiệm vụ.

Kết quả thử nghiệm so sánh ReImaGin với No Tools và Visual Sketchpad trên ba VLM và sáu nhiệm vụ suy luận trực quan. Điểm cao hơn là tốt hơn, ngoại trừ Đếm với Vật che khuất, nơi sai số thấp hơn là tốt hơn. ReImaGin đạt kết quả tốt nhất trong phần lớn tổ hợp mô hình-nhiệm vụ.

Cùng những ví dụ chiến lược do con người xác định được dùng cho cả ba mô hình. ReImaGin tạo ra kết quả tốt hơn cả hai baseline trong phần lớn nhiệm vụ, với mức cải thiện đặc biệt rõ rệt ở hoàn thiện câu đố, đếm với vật che khuất và lần theo đường đi.

Ví dụ với GPT-5, độ chính xác của câu đố tăng từ 29,5% khi dùng No Tools và 16,7% khi dùng Visual Sketchpad lên 44,9% với ReImaGin. Các phép thử loại bỏ thành phần xác nhận rằng bộ phận tạo hình ảnh là thiết yếu đối với hiệu suất của hệ thống.

Các bộ tạo hình ảnh trọng số mở cũng được thử nghiệm thay cho Nano-Banana-Pro: FLUX.2 [dev] và Qwen-Image-Edit-2511 cho kết quả tương đương ở một số nhiệm vụ đơn giản hơn, đặc biệt là inpainting, nhưng kém ổn định hơn ở những biến đổi phức tạp như ước tính chiều sâu và lần theo đường đi. Kết quả tương tự cũng thu được khi Qwen-3.5-27B được dùng làm VLM:

Kết quả thử nghiệm so sánh các bộ tạo hình ảnh khi dùng Qwen-3.5-27B làm VLM. Nano-Banana-Pro đạt kết quả tốt nhất ở năm trong sáu nhiệm vụ, trong khi FLUX.2 [dev] và Qwen-Image-Edit-2511 cải thiện kết quả so với No Tools trong một số nhiệm vụ.

Kết quả thử nghiệm so sánh các bộ tạo hình ảnh khi dùng Qwen-3.5-27B làm VLM. Nano-Banana-Pro đạt kết quả tốt nhất ở năm trong sáu nhiệm vụ, trong khi FLUX.2 [dev] và Qwen-Image-Edit-2511 cải thiện kết quả so với No Tools trong một số nhiệm vụ.

Các tác giả cũng tiến hành thử nghiệm định tính trên bốn nhiệm vụ:

Các ví dụ định tính trên bốn nhiệm vụ cho thấy ReImaGin được dùng như thế nào để tăng cường khả năng suy luận của Gemini-3.1-Pro. Trong mỗi trường hợp, các biểu diễn trực quan được tạo ra được đưa vào quá trình suy luận để giúp giải quyết nhiệm vụ.

Các ví dụ định tính trên bốn nhiệm vụ cho thấy ReImaGin được dùng như thế nào để tăng cường khả năng suy luận của Gemini-3.1-Pro. Trong mỗi trường hợp, các biểu diễn trực quan được tạo ra được đưa vào quá trình suy luận để giúp giải quyết nhiệm vụ.

ReImaGin không đáng tin cậy trong mọi trường hợp: đôi khi bộ tạo hình ảnh tạo ra một phép biến đổi thiếu chính xác, chẳng hạn sơ đồ mặt bằng có các vật thể ở sai vị trí; trong những trường hợp khác, một hình ảnh được tạo chính xác lại bị VLM đọc sai sau đó.

Trong cuộc kiểm tra thủ công đối với 120 hình ảnh được tạo, 75% đã thực hiện trung thực phép biến đổi được yêu cầu. Khi đạt được điều này, câu trả lời cuối cùng chính xác trong 87% trường hợp, so với 43% khi hình ảnh được tạo không chính xác.

Các tác giả kết luận:

“Kết quả của chúng tôi gợi ra hai kết luận rộng hơn. Thứ nhất, việc tạo hình ảnh có thể đóng vai trò như một cơ chế tưởng tượng thị giác tổng quát trong suy luận đa phương thức, làm giảm nhu cầu thiết kế một công cụ riêng cho mỗi phép biến đổi mới.

“Thứ hai, hiệu quả của phương pháp này không chỉ phụ thuộc vào các mô hình nền tảng mà còn vào chiến lược suy luận được dùng để quyết định cần trực quan hóa điều gì và cách sử dụng kết quả.

“Những cải thiện từ việc tự động khám phá chiến lược cho thấy các mô hình có thể khai thác hiểu biết của chúng về biến đổi trực quan để khám phá các chiến lược phù hợp mà không cần chiến lược chuyên biệt theo nhiệm vụ hay ví dụ suy luận do con người viết.”

Kết luận

Những quyết định tự sử dụng công cụ thuộc loại được nghiên cứu trong công trình này là một bước phát triển hấp dẫn, nhất là vì quá trình phát triển VLM dường như đang tự nhiên tiến hóa theo hướng này. Tôi tò mò liệu những VLM đa dụng như vậy cuối cùng có hoạt động tốt ngang các công cụ và khuôn khổ chuyên dụng như hệ sinh thái Segment hay không; và do đó, liệu những người chỉ làm các “nhiệm vụ phụ” này có thể rơi vào tình trạng dùng búa tạ để đập một quả hạch hay không.

Khá khó tin rằng VLM có thể phát triển được tính kỷ luật cần thiết để vượt qua và duy trì lợi thế trước các giải pháp chuyên dụng như tinh chỉnh cục bộ, nơi toàn bộ mô hình được dành cho một nhiệm vụ và trong quá trình đó thường trở nên vô dụng đối với mọi nhiệm vụ khác. Thời gian sẽ trả lời.

 

* Một định nghĩa có thể tranh luận cho miền hình ảnh, điều mà chúng ta học được từ rất lâu trước khi tiếp thu bất kỳ kỹ năng ngôn ngữ nào.

Được xuất bản lần đầu vào thứ Hai, ngày 28 tháng 9 năm 2026

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai