โมเดลและแพลตฟอร์ม AI
โครงการ Deal ของ Anthropic ปล่อยให้ตัวแทน Claude ซื้อขายสินค้าจริง
Anthropic ได้เผยแพร่ผลลัพธ์ของ “Project Deal” ซึ่งเป็นการทดลองภายในหนึ่งสัปดาห์ โดยตัวแทน Claude ซื้อขายสินค้าจริงแทนพนักงาน 69 คน ในสำนักงาน San Francisco ของบริษัท
ตัวแทนเหล่านั้นได้ทำข้อตกลง 186 ข้อ มีมูลค่ามากกว่า 4,000 ดอลลาร์ และการศึกษาพบว่าผู้เข้าร่วมที่มีตัวแทนแบบจำลองที่แข็งแกร่งกว่ามีผลลัพธ์ที่ดีกว่าในหลายด้าน ซึ่งไม่ได้รับการสังเกตโดยมนุษย์
ผลการวิจัยที่เขียนโดยนักวิจัยของ Anthropic Kevin K. Troy, Dylan Shields, Keir Bradwell และ Peter McCrory ให้ภาพที่ชัดเจนที่สุดเกี่ยวกับว่าตลาดที่มีการเจรจาโดย AI จะมีลักษณะอย่างไรเมื่อตัวแทนเจรจาทั้งสองฝ่าย
พวกเขาได้แสดงให้เห็นถึง “ผลกระทบที่ไม่สบายใจ” ที่บริษัทกล่าวว่าผู้ประกอบการ ผู้กำกับดูแล และผู้ใช้จะต้องเผชิญก่อนที่ การค้าเชิงพาณิชย์แบบตัวแทน จะกลายเป็นกระแสหลัก
วิธีการทำงานของโครงการ Deal
การทดลองนี้ดำเนินไปเป็นเวลาหนึ่งสัปดาห์ในเดือนธันวาคม 2025
Anthropic ได้รับสมัครพนักงาน 69 คน ให้เงิน “งบประมาณ” 100 ดอลลาร์ (จ่ายหลังการทดลองในรูปแบบของบัตรของขวัญ บวกหรือลบตามมูลค่าของสินค้าที่ซื้อหรือขาย) และให้ตัวแทน Claude สัมภาษณ์สั้นๆ กับอาสาสมัครแต่ละคนเพื่อทราบว่าพวกเขาต้องการขายอะไร ราคาเท่าใด ต้องการซื้ออะไร และต้องการให้ตัวแทนเจรจาในรูปแบบใด Anthropic ได้เปลี่ยนคำตอบเหล่านั้นเป็นคำสั่งระบบแบบกำหนดเองสำหรับตัวแทนแต่ละตัว
Anthropic ได้ดำเนินตลาดที่มีเส้นขนานสี่แห่งภายในช่องทาง Slack
“ใน Run A และ Run D ตัวแทนของทุกคนเป็นรุ่น Claude Opus 4.5 ซึ่งเป็นรุ่นที่ดีที่สุดของเราในขณะนั้น” ทีมงานกล่าว “ในสองรันถัดไป (Runs B และ C) ผู้เข้าร่วมมีโอกาส 50% ที่จะได้รับตัวแทน Claude Haiku 4.5 ซึ่งเป็นรุ่นที่อ่อนแอกว่า”
เฉพาะ Run A เท่านั้นที่เป็น “การวิ่งจริง” โดยสินค้าเปลี่ยนมือจริงๆ หลังจากการทดลอง ส่วนอีกสามรันเป็นเงื่อนไขการวิจัย และผู้เข้าร่วมไม่ได้รับแจ้งว่าการวิ่งจริงคืออะไรจนกว่าจะเสร็จสิ้นการสำรวจหลังการทดลอง
ไม่มีมนุษย์เข้ามาแทรกแซงหลังจากที่ตัวแทนถูกส่งไป
โครงการ Slack ช่องทางที่ตัวแทนจะวนซ้ำ ทำให้ตัวแทนสามารถโพสต์สินค้าขาย เสนอราคาสินค้าของคนอื่น หรือปิดการซื้อขายได้ โดยมีจุดสำคัญคือไม่มีการแทรกแซงจากมนุษย์หลังจากที่การทดลองเริ่มต้นขึ้น
ตัวแทนได้ระบุการตรงกัน เสนอราคา และปิดการซื้อขายโดยอัตโนมัติ โดยมีสินค้ามากกว่า 500 รายการ มนุษย์เข้ามาในภาพก็ต่อเมื่อการซื้อขายเสร็จสิ้นแล้ว เพื่อแลกเปลี่ยนสินค้าที่ตัวแทนได้ตกลงซื้อขาย
ตัวแทนแบบจำลองที่แข็งแกร่งกว่าเจรจาข้อตกลงที่ดีกว่า
ผลการวิจัยที่สำคัญที่สุดคือ ตัวแทนแบบจำลองที่ดีกว่ามีผลกระทบต่อผลลัพธ์ และมันส่งผลกระทบต่อเงิน
จาก 161 รายการที่ขายในสองรันหรือมากกว่านั้น ตัวแทน Opus สามารถขายได้ในราคาเฉลี่ยสูงกว่า 2.68 ดอลลาร์ ในขณะที่ตัวแทน Opus ซื้อได้ในราคาเฉลี่ยต่ำกว่า 2.45 ดอลลาร์ เมื่อตัวแทน Opus เจรจาต่อรองกับตัวแทน Haiku ราคาจะอยู่ที่เฉลี่ย 24.18 ดอลลาร์ เทียบกับ 18.63 ดอลลาร์สำหรับการเจรจาต่อรองระหว่าง Opus และ Opus Anthropic กล่าวว่าช่องว่างเหล่านี้ไม่ใช่เรื่องเล็กน้อย
ในกรณีเฉพาะมีความแตกต่างมากขึ้น
จักรยานพับแตกเหมือนกัน ผู้ซื้อเหมือนกัน ผู้ขายเหมือนกัน: ตัวแทน Opus ได้รับ 65 ดอลลาร์ ในขณะที่ตัวแทน Haiku ได้รับเพียง 38 ดอลลาร์
รูบี้ที่ปลูกในห้องปฏิบัติการที่ตัวแทน Opus ขายได้ในราคา 65 ดอลลาร์ แต่ตัวแทน Haiku ขายได้เพียง 35 ดอลลาร์
สิ่งที่ผู้เข้าร่วมไม่ได้สังเกตเห็นคือ
แม้ว่าจะมีช่องว่างของราคา แต่ผู้เข้าร่วมที่มีตัวแทน Haiku ให้คะแนนความยุติธรรมของข้อตกลงเกือบเท่ากับผู้ที่มีตัวแทน Opus: 4.06 เทียบกับ 4.05 ในมาตราส่วนความยุติธรรม
“28 คนจากผู้เข้าร่วมของเราได้รับตัวแทน Haiku ในการวิ่งหนึ่งและ Opus ในอีกการวิ่งหนึ่ง และแม้ว่า 17 คนจะจัดอันดับการวิ่ง Opus สูงกว่าการวิ่ง Haiku แต่ 11 คนกลับกัน” บริษัทเขียนไว้
ผลลัพธ์ที่สองซึ่งไม่คาดคิด: รูปแบบการเจรจาที่ผู้เข้าร่วมขอในระหว่างการสัมภาษณ์ไม่ได้ส่งผลกระทบต่อผลลัพธ์
ผู้ขายที่มีการเจรจาแบบก้าวร้าวได้รับราคาเพิ่มขึ้น แต่เพียงเพราะพวกเขาเริ่มต้นด้วยราคาที่สูงกว่า Anthropic กล่าว
คำแนะนำที่ก้าวร้าวไม่ได้สร้างผลกระทบทางสถิติที่สำคัญต่อความน่าจะเป็นของการขาย ราคาขาย หรือราคาซื้อ เมื่อควบคุมราคาที่ผู้ใช้กำหนดไว้แล้ว การเลือกแบบจำลองมีความสำคัญมากกว่าการให้คำแนะนำ
สิ่งที่หมายถึงการค้าเชิงพาณิชย์แบบตัวแทน
โครงการ Deal เป็นการวิจัยเบื้องต้น ไม่ใช่ผลิตภัณฑ์ และ Anthropic ระมัดระวังในการแสดงข้อจำกัด — กลุ่มพนักงานที่เลือกเอง ต้นทุนที่ต่ำ และไม่มีตัวแทรกแซงที่เป็นปฏิปักษ์ แม้ว่าจะเป็นเช่นนั้น 46% ของผู้เข้าร่วมกล่าวว่าพวกเขาจะจ่ายเงินสำหรับบริการนี้ ซึ่ง Anthropic มองว่าเป็นหลักฐานว่าการค้าเชิงพาณิชย์แบบตัวแทนไม่ไกลตัว
เวลานี้มีความสำคัญเพราะ Anthropic ได้แสดงให้เห็นถึงการนำ Claude มาสู่การทำธุรกรรมของผู้บริโภค บริษัทได้เผยแพร่ บทความในบล็อก ที่มุ่งหมายที่จะรักษาความคิดของ Claude ไว้โดยไม่มีการโฆษณา ในขณะเดียวกันก็สนับสนุนการค้าเชิงพาณิชย์แบบตัวแทนอย่างชัดเจน และได้สร้างโครงสร้างพื้นฐานสำหรับองค์กร เช่น ตัวแทนจัดการ เพื่อให้ Claude สามารถดำเนินการแทนผู้ใช้บนบริการของบุคคลที่สาม โครงการ Deal เป็นหลักฐานการวิจัยที่สร้างความเข้าใจในโหมดการล้มเหลวของอนาคต
Anthropic ระบุถึงข้อกังวลสามประการซึ่งเกิดขึ้นจากการทดลอง ประการแรก ในโลกที่มีบริษัทแทนที่อาสาสมัคร สิ่งจูงใจจะมีลักษณะที่แตกต่าง
ประการที่สอง การเพิ่มประสิทธิภาพระบบสำหรับการให้ความสนใจของตัวแทน AI แทนที่จะให้ความสนใจของมนุษย์ อาจนำไปสู่พื้นผิวการควบคุมใหม่ๆ รวมถึงการหลบหนีและ การฉีดคำสั่ง
ประการที่สาม “กรอบนโยบายและกฎหมายรอบๆ โมเดล AI ที่ทำธุรกรรมแทนเราไม่มีอยู่ในขณะนี้” บริษัทเขียนไว้
คำถามที่ไม่มีคำตอบคือว่าการเปิดเผยสามารถปิดช่องว่างการรับรู้ได้หรือไม่ ผู้เข้าร่วมโครงการ Deal ไม่ทราบว่าตัวแทนแบบใดที่เป็นตัวแทนของพวกเขา ซึ่งเป็นสถานการณ์ที่คล้ายกับสถานการณ์ที่ผู้ใช้จะเผชิญในระหว่างการเปิดตัวสู่ผู้บริโภค หากช่องว่างความยุติธรรมระหว่าง Opus และ Haiku ไม่ปรากฏให้เห็นภายในกลุ่มพนักงานที่เลือกเองของ Anthropic ซึ่งดำเนินการทดลองหนึ่งสัปดาห์โดยมีการเดิมพัน 100 ดอลลาร์ มันจะไม่ปรากฏให้เห็นในระดับที่ใหญ่ขึ้น — เว้นแต่ตลาดจะต้องเปิดเผยว่าตัวแทนใดเป็นตัวแทนของใครและที่ระดับความสามารถใด นี่คือคำถามด้านกฎระเบียบที่ Anthropic กำลังเชิญชวนอย่างเปิดเผย และเป็นคำถามที่น่าจะเกิดขึ้นแรกเมื่อการค้าเชิงพาณิชย์แบบตัวแทนขยายออกไปนอกช่องทาง Slack ใน San Francisco












