โมเดลและแพลตฟอร์ม AI

ความสามารถของเอไอเอเจนต์ในการทำการวิจัยที่แท้จริงอยู่ที่ไหน? ภายในรายงาน Deep Research Bench

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อ โมเดลภาษาขนาดใหญ่ (LLMs) พัฒนาไปอย่างรวดเร็ว ความสามารถของพวกมันในการเป็นผู้ช่วยวิจัยที่ทรงพลังก็เพิ่มขึ้นด้วย พวกมันไม่ได้เพียงตอบคำถามข้อเท็จจริงที่ง่ายๆ แต่ยังสามารถรับมือกับ “การวิจัยลึก” ซึ่งเกี่ยวข้องกับการให้เหตุผลหลายขั้นตอน การประเมินข้อมูลที่ขัดแย้งกัน การค้นหาข้อมูลจากทั่วเว็บ และการสรุปผลลัพธ์ที่สอดคล้องกัน

ความสามารถที่เกิดขึ้นใหม่นี้ถูกนำมาใช้ภายใต้ชื่อแบรนด์ที่แตกต่างกันโดยห้องปฏิบัติการหลัก – OpenAI เรียกว่า “การวิจัยลึก” Anthropic เรียกว่า “การคิดขยาย” Gemini ของ Google (GOOGL ) มีคุณสมบัติ “ค้นหา + Pro” และ Perplexity เรียกว่า “ค้นหาสำหรับมืออาชีพ” หรือ “การวิจัยลึก” แต่ความสามารถเหล่านี้มีประสิทธิภาพอย่างไรในทางปฏิบัติ? รายงานใหม่จาก FutureSearch ที่มีชื่อว่า Deep Research Bench (DRB): การประเมินตัวแทนการวิจัยเว็บ เป็นการประเมินที่เข้มงวดที่สุดจนถึงปัจจุบัน และผลลัพธ์แสดงให้เห็นทั้งความสามารถที่น่าประทับใจและข้อบกพร่องที่สำคัญ

Deep Research Bench คืออะไร?

สร้างโดยทีม FutureSearch Deep Research Bench เป็นเครื่องมือที่สร้างขึ้นอย่างรอบคอบเพื่อประเมินประสิทธิภาพของตัวแทน AI ในงานวิจัยหลายขั้นตอนบนเว็บ ซึ่งไม่ใช่คำถามที่มีคำตอบที่ชัดเจน แต่สะท้อนถึงความท้าทายที่ซับซ้อนและเปิดกว้างที่นักวิเคราะห์ นักกำหนดนโยบาย และนักวิจัยต้องเผชิญในสถานการณ์จริง

เครื่องมือนี้ประกอบด้วยงาน 89 ชิ้นใน 8 หมวดหมู่ เช่น

  • ค้นหาตัวเลข เช่น “มีการเรียกคืนอุปกรณ์ทางการแพทย์ Class II ของ FDA กี่ครั้ง?”
  • ตรวจสอบคำกล่าว เช่น “ChatGPT มีประสิทธิภาพ 10 เท่ามากกว่าการค้นหา Google หรือไม่?”
  • รวบรวมข้อมูล เช่น “แนวโน้มงานสำหรับนักพัฒนาซอฟต์แวร์ในสหรัฐฯ ตั้งแต่ปี 2019-2023”

แต่ละประเภทของงานได้รับการออกแบบอย่างรอบคอบพร้อมกับคำตอบที่ได้รับการยืนยันจากมนุษย์และประเมินโดยใช้ชุดข้อมูลที่ถูกแช่แข็งของหน้าเว็บที่ถูกสแกน ซึ่งเรียกว่า RetroSearch ซึ่งรับประกันความสม่ำเสมอในการประเมินแบบจำลอง โดยหลีกเลี่ยงสถานะที่เปลี่ยนแปลงของเว็บที่มีชีวิต

สถาปัตยกรรมตัวแทน: ReAct และ RetroSearch

ที่ใจกลางของ Deep Research Bench คือสถาปัตยกรรม ReAct ซึ่งย่อมาจาก “Reason + Act” วิธีนี้เลียนแบบวิธีการที่นักวิจัยมนุษย์อาจแก้ไขปัญหา โดยการคิดผ่านงาน การดำเนินการเช่นการค้นหาเว็บ การสังเกตผลลัพธ์ และการตัดสินใจว่าจะทำซ้ำหรือสรุปผล

ในขณะที่แบบจำลองก่อนหน้านี้ปฏิบัติตามวงจรนี้อย่างชัดเจน แบบจำลอง “การคิด” ใหม่ๆ มักจะทำให้กระบวนการนี้ง่ายขึ้น โดยฝังการให้เหตุผลเข้าไปในกระบวนการของพวกมันอย่างลื่นไหล เพื่อให้แน่ใจถึงความสม่ำเสมอในการประเมิน DRB นำเสนอ RetroSearch ซึ่งเป็นรูปแบบที่กำหนดเองและเป็นแบบสแตติกของเว็บ แทนที่จะพึ่งพาอินเทอร์เน็ตที่เปลี่ยนแปลงอยู่ตลอดเวลา ตัวแทนจะเข้าถึงอาร์ไคฟ์ของเว็บที่ถูกสแกนโดยใช้เครื่องมือ เช่น Serper, Playwright และ ScraperAPI

ตัวแทน AI ใดที่ทำงานได้ดีที่สุด?

ในบรรดาผู้เข้าแข่งขันทั้งหมด o3 ของ OpenAI เป็นตัวแทนชั้นนำ โดยได้รับคะแนน 0.51 จากคะแนนสูงสุด 1.0 ใน Deep Research Bench แม้ว่าอาจดูไม่มากนัก แต่สิ่งสำคัญคือต้องเข้าใจความยากของมาตรฐาน: เนื่องจากความคลุมเครือในการกำหนดงานและคะแนน แม้แต่ตัวแทนแบบจำลองที่สมบูรณ์แบบก็อาจจะถึงเพดานคะแนนได้ไม่เกิน 0.8 ซึ่งผู้วิจัยเรียกว่า “เพดานเสียง”

อย่างไรก็ตาม ตารางคะแนนให้ข้อมูลเชิงลึกที่เปิดเผย o3 ไม่เพียงแต่ dẫn đầuกลุ่ม แต่ยังแสดงผลการทำงานที่รวดเร็วและสม่ำเสมอ โดยแสดงผลการทำงานที่แข็งแกร่งในเกือบทุกประเภทของงาน Claude 3.7 Sonnet ของ Anthropic ตามมาอย่างใกล้ชิด โดยแสดงความสามารถในการทำงานทั้ง “การคิด” และ “ไม่คิด” โมเดล Gemini 2.5 Pro ของ Google โดดเด่นด้วยความสามารถในการจัดการงานที่ต้องการการวางแผนแบบมีโครงสร้างและให้เหตุผลแบบขั้นตอน

ตัวแทนขัดข้องที่ไหน?

การอ่านรูปแบบความล้มเหลวที่เน้นในรายงาน Deep Research Bench รู้สึกคุ้นเคยมาก หนึ่งในด้านที่น่าหงุดหงิดที่สุดที่ฉันพบว่าเมื่อทำงานวิจัยหรือสร้างเนื้อหานานๆ ตัวแทน AI เพียงแค่ลืมสิ่งที่เรากำลังทำ เมื่อหน้าต่างบริบทขยายใหญ่ขึ้น แบบจำลองมักจะเริ่มสูญเสียเส้นทาง: รายละเอียดสำคัญจางหายไป เป้าหมายมีความคลุมเครือ และคำตอบที่ได้รับอาจดูไม่สอดคล้องกันหรือไม่มีจุดมุ่งหมาย

การลืมเลือนนั้นไม่ใช่เรื่องแต่งแต่การลืมเลือนนั้นเป็นตัวทำนายการล้มเหลวที่สำคัญที่สุดในการประเมิน Deep Research Bench แต่นั่นไม่ใช่ปัญหาเดียวที่เกิดขึ้นซ้ำๆ รายงานยังเน้นย้ำว่าแบบจำลองบางรุ่นเข้าไปในวงจรการใช้เครื่องมือซ้ำๆ โดยการค้นหาคำที่เหมือนกันซ้ำๆ ดูเหมือนติดอยู่ในวงจร

เกี่ยวกับการทำงานของหน่วยความจำ?

น่าสนใจที่ Deep Research Bench ยังประเมิน “ตัวแทนแบบไม่มีเครื่องมือ” – โมเดลภาษาที่ทำงานโดยไม่มีการเข้าถึงเครื่องมือภายนอก เช่น การค้นหาเว็บหรือการดึงเอกสาร ตัวแทนเหล่านี้พึ่งพาข้อมูลการฝึกอบรมภายในและหน่วยความจำของตน โดยสร้างคำตอบโดยอาศัยสิ่งที่พวกมันเรียนรู้ระหว่างการฝึกอบรมเท่านั้น

น่าประหลาดใจที่ตัวแทนแบบไม่มีเครื่องมือเหล่านี้ทำงานได้ดีเกือบเท่ากับตัวแทนการวิจัยเต็มรูปแบบในงานบางอย่าง เช่น ในงาน “ตรวจสอบคำกล่าว” ซึ่งมีจุดมุ่งหมายเพื่อประเมินความน่าเชื่อถือของข้อความ พวกมันทำคะแนนได้ 0.61 ใกล้เคียงกับค่าเฉลี่ย 0.62 ของตัวแทนการวิจัยที่มีเครื่องมือ

ความคิดสุดท้าย

รายงาน DRB ทำให้เรารู้ว่า ตัวแทน AI ที่ดีที่สุดในปัจจุบันสามารถเอาชนะมนุษย์เฉลี่ยในงานที่กำหนดไว้อย่างแคบๆ แต่ยังคงตามหลังนักวิจัยทั่วไปที่มีทักษะสูง – โดยเฉพาะเมื่อพูดถึงการวางแผนเชิงกลยุทธ์ การปรับตัวระหว่างกระบวนการ และการให้เหตุผลที่มีรายละเอียด

ช่องว่างนี้เห็นได้ชัดเจนอย่างยิ่งในช่วงเวลาที่ยาวนานหรือซับซ้อน – ซึ่งฉันเคยพบมาก่อน โดยที่ตัวแทน AI สูญเสียความต่อเนื่องของงานไป และนำไปสู่การล่มสลายของความสอดคล้องและประโยชน์

สิ่งที่ทำให้ Deep Research Bench มีคุณค่านั้น คือ ไม่ได้เพียงแต่ทดสอบความรู้ผิวเผินเท่านั้น แต่ยังตรวจสอบจุดตัดกันของการใช้เครื่องมือ หน่วยความจำ การให้เหตุผล และการปรับตัว ซึ่งเป็นแบบจำลองที่ใกล้เคียงกับการวิจัยในโลกแห่งความเป็นจริงมากกว่ามาตรฐานอื่นๆ เช่น MMLU หรือ GSM8k

เมื่อ LLMs ติดตั้งเข้ากับการทำงานความรู้อย่างจริงจัง เครื่องมือ FutureSearch เช่น DRB จะเป็นสิ่งจำเป็นสำหรับการประเมินไม่เพียงแต่สิ่งที่ระบบเหล่านี้รู้ แต่ยังรวมถึงประสิทธิภาพการทำงานที่แท้จริงของพวกมันด้วย

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด