มุมมองของ Anderson

โมเดลภาษาที่มีชื่อเสียงมีแนวโน้มที่จะ ‘ตีความ’ การถอดความ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): a construction worker wearing a tool belt stands beneath scaffolding, holding a printed job sheet and scratching his head while facing a large stone wall engraved with a partially completed version of the United States Declaration of Independence in which numerous words have been mistakenly replaced with incorrect alternatives, ending at the word 'foam'. A workbench holding chisels and a hammer stands in the foreground, with stone dust scattered below the unfinished carving. The photorealistic scene is surrounded by a yellow-and-black warning-style border labeled 'AI FANTASY INSIDE' along the top and right edges and 'REALITY OUTSIDE' along the bottom and left edges, with black directional arrows pointing inward.

การวิจัยใหม่จาก Amazon (AMZN ) พบว่าโมเดลที่ฉลาดกว่านั้นมีแนวโน้มที่จะ ‘สร้างสรรค์’ เมื่อถูกขอให้ทำการรู้จำตัวอักษรออปติกัล

 

การรู้จำตัวอักษรออปติกัล (OCR) ถือเป็นปัญหาที่แก้ไขได้แล้ว หากคุณสแกนข้อความหรือแสดงภาพข้อความให้ระบบ OCR ดู ระบบจะทำการแยกอักษรแต่ละตัวโดยละเอียด และทำการเดาโดยอาศัยข้อมูลที่มีอยู่

ด้านบนซ้าย การแบ่งพื้นที่ของลักษณะเฉพาะในตัวอักษรที่ถูกแยกออก (แหล่งที่มา - https://home.nr.no/~eikvil/OCR.pdf); ภาพหลัก: ผลการแบ่งพื้นที่สำหรับห้องสมุดสถาบัน (แหล่งที่มา - https://ijarse.com/ADMIN/admin/postimages/images/fullpdf/1473863345_515_IJARSE.pdf)

ด้านบนซ้าย การแบ่งพื้นที่ของลักษณะเฉพาะในตัวอักษรที่ถูกแยกออก (แหล่งที่มา); ภาพหลัก: ผลการแบ่งพื้นที่สำหรับห้องสมุดสถาบัน (แหล่งที่มา).

OCR ตีความอักษรแต่ละตัวโดยไม่สนใจว่าอักษรเหล่านั้นจะรวมกันเป็นคำหรือไม่ OCR ไม่สนใจเรื่องนี้ เพราะเมื่อ OCR ทำงานเสร็จแล้ว ก็จะออกไปทำงานอื่นต่อ

หนึ่งในระบบ OCR ที่ได้รับความนิยมมากที่สุดคือ Tesseract ซึ่งเป็นระบบตีความอัลกอริทึมที่เข้มงวด และถูกใช้ในหลาย ๆ แอปพลิเคชันและเวิร์กโฟลว์ที่เปิดกว้าง

เพื่อให้สามารถแข่งขันกับระบบ OCR อัลกอริทึมแบบดั้งเดิมได้ องค์กรและผลิตภัณฑ์ที่แข่งขันกันในด้าน OCR ได้ปรับเปลี่ยนระบบของตนให้เป็นระบบจัดการเอกสารที่ได้รับการช่วยเหลือจาก AI

Word Up

OCR เป็นหนึ่งในงานที่มีการเพิ่มขึ้นของการประมวลผลโดยโมเดลภาษาและวิชั่น (VLMs) เมื่อเผชิญกับข้อความที่ไม่สามารถแก้ไขได้หรือเป็นราสเตอร์ โมเดล VLM สามารถอ่านและถอดความได้อย่างชำนาญ

อย่างไรก็ตาม ตามการวิจัยใหม่จาก Amazon.com ผู้ที่คิดว่า AI จะทำซ้ำฟังก์ชันเดียวกับ OCR อาจต้องประหลาดใจ การศึกษานี้พบว่าโมเดลภาษาที่มีชื่อเสียงมีแนวโน้มที่จะ ‘ไปไกลกว่า’ ในการถอดความ ไม่ว่าคุณจะอยากหรือไม่ก็ตาม โดยการเกินขอบเขตของการถอดความตัวอักษรไปสู่การถอดความคำ และการแก้ไขข้อผิดพลาดที่พบในลักษณะที่อาจมีผลกระทบไม่พึงประสงค์ต่อพื้นที่เช่น กฎหมาย การแพทย์ และการถอดความทางประวัติศาสตร์

ผู้เขียนยืนยันว่า:

‘โมเดลภาษาและวิชั่น (VLMs) ถูกใช้เพิ่มขึ้นแทนการประมวลผล OCR แบบดั้งเดิมสำหรับการทำความเข้าใจเอกสาร

‘[เรา] พบว่าพวกมันไม่ได้ทำงานเป็นเครื่องถอดความที่ซื่อสัตย์เสมอไป: เมื่อข้อความไม่สมบูรณ์ พวกมันมักจะเขียนข้อความใหม่ให้เป็นรูปแบบที่น่าเชื่อถือมากกว่า – พฤติกรรมที่การประเมิน OCR ที่ใช้ข้อความที่สะอาดไม่สามารถตรวจจับได้’

ผู้เขียนแนะนำชุดข้อมูลและมาตรฐานใหม่ที่เรียกว่า FaithC4 ซึ่งพวกเขาได้ทดสอบกับโมเดล 15 แบบที่เปิดกว้างและปิดกว้าง รวมถึงรุ่นของ ChatGPT และ Google Gemini

พวกเขาพบว่าโมเดล AI ทั่วไปมีแนวโน้มที่จะแทนที่คำที่ไม่สมบูรณ์ด้วยคำที่น่าเชื่อถือมากกว่า โดยบางครั้งเขียนข้อความใหม่เกือบ 65% ของคำที่สับเปลี่ยน และข้อผิดพลาดที่เล็กๆ ก็ทำให้เกิดข้อผิดพลาดในข้อความที่ถูกต้องอื่นๆ

คำที่สั้นมีแนวโน้มที่จะถูกโจมตีได้ง่ายกว่า และคำสั่งโดยชัดเจนว่า ไม่ แก้ไขข้อผิดพลาดจะลดปัญหานี้ แต่ไม่ได้กำจัดมัน

การศึกษานี้พบว่าโมเดล AI ที่มีประสิทธิภาพสูงมักจะแทนที่คำที่ไม่สมบูรณ์ด้วยคำที่น่าเชื่อถือมากกว่า ในขณะที่ระบบ OCR แบบดั้งเดิมมักจะทำการถอดความที่แม่นยำกว่า

ข้อมูลและวิธีการ

เพื่อสร้างชุดข้อมูลมาตรฐาน ผู้เขียนได้ใช้ Colossal Cleaned Crawled Corpus หรือ C4 ซึ่งเป็นชุดข้อมูลที่ถูกเก็บจากเว็บในปี 2020

ชุดข้อมูลมาตรฐานสุดท้ายประกอบด้วยเอกสาร 500 ฉบับในภาษาอังกฤษ 500 ฉบับในภาษาจีน และ 455 ฉบับในภาษาเกาหลี เพื่อให้เป็นการทดสอบแบบหลายภาษาในการวัดว่าระบบ AI จะทำซ้ำข้อความที่เห็นหรือไม่

เพื่อทดสอบว่าโมเดล AI จะทำซ้ำข้อความที่เห็นหรือไม่ ผู้เขียนได้ใส่ข้อผิดพลาดที่ควบคุมไว้ลงในเอกสารก่อนที่จะแสดงเป็นภาพ โดยมีการเปลี่ยนแปลงประมาณ 8% ของคำที่มีอยู่

มีการใช้การเปลี่ยนแปลงสามแบบ: สับเปลี่ยน ซึ่งเปลี่ยนลำดับของตัวอักษรในคำโดยไม่เปลี่ยนตัวอักษรแรกและตัวอักษรสุดท้าย; สุ่ม ซึ่งเปลี่ยนตัวอักษรทั้งหมดด้วยตัวอักษรที่สุ่มจากชุดตัวอักษรเดียวกัน; และ ภาพ ซึ่งเปลี่ยนตัวอักษรที่ดูเหมือนกันโดยไม่เปลี่ยนข้อความที่อยู่เบื้องหลัง

เอกสารแต่ละฉบับถูกแสดงเป็นหน้า PDF และส่งไปยังระบบการถอดความที่แข่งขันกัน

การทดสอบ

การทดสอบสำหรับการศึกษานี้ครอบคลุมทั้งโมเดล AI ที่ปิดกว้างและเปิดกว้าง รวมถึง GPT-5.4-mini และ Gemini-3-Flash

นอกจากนี้ยังมีการทดสอบโมเดล OCR ที่เปิดกว้าง เช่น Qwen3-VL-4B และ InternVL3.5-4B

สองมาตรการที่ถูกนำมาใช้คือ อัตราข้อผิดพลาดคำ (WER) และ ความคล้ายคลึงกันของการแก้ไข (EDS)

ผลการทดสอบพบว่าระบบ OCR แบบดั้งเดิมมีการเสื่อมสภาพน้อยที่สุดในการทดสอบทั้งสามแบบ

โมเดล AI ที่มีประสิทธิภาพสูงมักจะแทนที่คำที่ไม่สมบูรณ์ด้วยคำที่น่าเชื่อถือมากกว่า ในขณะที่ระบบ OCR แบบดั้งเดิมมักจะทำการถอดความที่แม่นยำกว่า

สรุป

การศึกษานี้เน้นย้ำถึงสิ่งที่กลายเป็นประเด็นที่ซ้ำกันในวรรณกรรม LLM: โมเดลภาษาที่ได้รับการฝึกอบรมมีพลังมาก แต่ก็ยังต้านทานต่อคำสั่งที่สำคัญ เช่น อ่านและถอดความตัวอักษรที่คุณพบในภาพ

โมเดลที่มีประสิทธิภาพสูงกว่าไม่สามารถทำสิ่งนี้ได้ ดูเหมือนว่าพวกมันจะถือว่าเป็น ‘งานบ้าน’ หรือมีความจำเป็นในการ ‘เสร็จสิ้นงานที่ไม่เสร็จ’

* การแปลงการอ้างอิงภายในของผู้เขียนให้เป็นลิงก์

เผยแพร่ครั้งแรกวันจันทร์ 27 กรกฎาคม 2569

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai