การระดมทุน
Arena ระดมทุน Series B มูลค่า $200 ล้าน ที่มีมูลค่าประเมิน $3.1 พันล้าน เพื่อพัฒนาการประเมิน AI

บริษัทประเมิน AI Arena ประกาศระดมทุน Series B มูลค่า $200 ล้าน ที่มีมูลค่าประเมิน $3.1 พันล้าน เมื่อ 8 ตุลาคม 2026 ในรอบที่นำโดย Lightspeed Venture Partners และ Khosla Ventures ร่วมกัน และเปิดตัวตัวอย่างของ Arena Alignment Index ควบคู่กับการระดมทุนนี้
นักลงทุน Series B และวัตถุประสงค์ที่ระบุ
Salesforce Ventures, 01 Advisors, Dell Technologies Capital และ Endeavor Catalyst เข้าร่วมในรอบนี้ และนักลงทุนเดิมอย่าง a16z, Felicis, AMP PBC, QuantumLight และ The House Fund ก็ให้การสนับสนุนเช่นกัน บริษัทกล่าว
Arena กล่าวว่าการระดมทุนนี้ต่อเนื่องภารกิจของบริษัทในการวัดและพัฒนาขอบเขต AI สำหรับการใช้งานในโลกจริง โดยมองรอบนี้เป็นสัญญาณความเชื่อมั่นในแนวคิดว่าขณะที่ AI มีความสามารถเพิ่มขึ้น โลกต้องการแนวทางอิสระที่ขับเคลื่อนด้วยข้อมูลเพื่อวัดทั้งความสามารถของ AI และความน่าเชื่อถือและการใช้งานอย่างปลอดภัย บริษัทระบุว่าเอเจนต์ตอนนี้เขียนโค้ด, ดำเนินการวิเคราะห์และทำการกระทำแทนผู้ใช้แทนที่จะตอบคำถามอย่างเดียว ซึ่งมักอยู่ในพื้นที่ที่ผู้ใช้ไม่สามารถตรวจสอบงานได้ง่าย และอ้างว่ามาตรฐานคงที่จะล่มสลายเมื่อโมเดลรับรู้ว่ากำลังถูกทดสอบ Arena ยังระบุว่ารายได้ต่อปีของบริษัทได้เกิน $100 ล้าน
การเติบโตที่รายงานและรอบก่อนหน้า
Arena รายงานว่ามีการใช้งาน 7 ล้านเซสชันใน Agent Arena ภายในเวลาน้อยกว่าห้าเดือนตั้งแต่เปิดตัว และมี 350 ล้านเซสชันทั่วทั้งแพลตฟอร์ม Arena บริษัทระบุว่ารวบรวมโหวตได้ 62 ล้านโหวตในหลายโหมด ได้แก่ ข้อความ, วิสัยทัศน์, โค้ด, การค้นหา, วิดีโอและรูปภาพ และดึงผู้เข้าชมหลายสิบล้านคนต่อเดือนจากกว่า 150 ประเทศ นอกจากนี้ยังรายงานว่ามีการประเมินโมเดลใหม่มากกว่า 1,000 รายการและเปิดเผยข้อมูล 375,000 จุดให้ชุมชน รวมถึงวิธีการจัดอันดับของตน
Series B ตามหลัง Series A มูลค่า $150 ล้านที่บริษัท ประกาศในเดือนมกราคม 2026 เมื่อยังดำเนินการภายใต้ชื่อ LMArena Felicis และ UC Investments (University of California) นำรอบนั้น พร้อมการเข้าร่วมจาก Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners และ Laude Ventures บริษัทได้ประกาศรอบระดมทุน Seed มูลค่า $100 ล้านในเดือนพฤษภาคม 2025
ในช่วงเวลาของ Series A บริษัทรายงานว่ามีโหวต 50 ล้านโหวต, การประเมินโมเดลใหม่กว่า 400 รายการและข้อมูลการต่อสู้แบบเปิดที่มี 145,000 จุด และระบุว่าผลิตภัณฑ์การประเมินแรกของบริษัทเปิดตัวในเดือนกันยายน 2025 Arena เริ่มต้นเป็นการทดลองวิจัย ตามบริษัทกล่าวว่าเริ่มจากการประเมินความชอบของมนุษย์และต่อมาย้ายไปวัดความเป็นจริงหลังจากพบว่าการตอบที่ผู้คนชอบไม่จำเป็นต้องเป็นคำตอบที่ถูกต้องเสมอ
สัญญาณและวิธีการของ Alignment Index
Alignment Index ซึ่ง Arena อธิบายว่าเป็นการวัดว่าปัญญาประดิษฐ์สามารถเบี่ยงเบนจากค่านิยมของมนุษย์ในโลกจริงได้อย่างไร เริ่มต้นด้วยสามสัญญาณที่บริษัทระบุว่าสามารถตรวจสอบได้จากร่องรอยของเอเจนต์จริงจากการใช้งานของมนุษย์: การกระทำที่ไม่ได้รับอนุญาต ซึ่งโมเดลทำการกระทำเกินขอบเขตที่ผู้ใช้ร้องขอ; การอ้างสิทธิ์เท็จ ซึ่งโมเดลอ้างคำพูด, ความตั้งใจ หรือข้อเท็จจริงให้กับผู้ใช้ที่ขัดแย้งกับหลักฐานที่ผู้ใช้ให้; และการทำงานเสร็จหลอกลวง ซึ่งโมเดลรายงานว่างานเสร็จสมบูรณ์แม้ยังไม่เสร็จจริง
Arena กล่าวว่าคำจำกัดความของสัญญาณได้รับแรงบันดาลใจจากคำจำกัดความที่ OpenAI และ Anthropic เผยแพร่ในระบบการ์ดของพวกเขา เพื่อให้สามารถทำหน้าที่เป็นการประเมินอิสระของความปลอดภัยและการสอดคล้องของโมเดล บริษัทจัดตำแหน่งสามสัญญาณนี้ให้เป็นส่วนเสริมต่ออันดับ Agent Arena ที่จัดอันดับความสามารถของเอเจนต์
ใน โพสต์งานวิจัยคู่ Arena ระบุว่าตัวอย่างเปรียบเทียบ 27 โมเดลใน 90,000 เซสชันเอเจนต์จริงจาก Agent Arena สำหรับแต่ละสัญญาณ บริษัทได้เขียนเกณฑ์ที่อธิบายรูปแบบความล้มเหลวที่เกิดซ้ำและปรับปรุงผ่านการตัดสินและการตรวจสอบของมนุษย์หลายรอบ จากนั้นผู้ตัดสิน LLM ได้นำเกณฑ์ไปใช้กับเซสชันที่สุ่มตัวอย่างสำหรับแต่ละโมเดล โดยทำเครื่องหมายเซสชันเฉพาะเมื่อสามารถชี้ไปยังข้ออ้างหรือการกระทำที่มีหลักฐานสนับสนุน และอัตราที่รายงานได้ถูกปรับตามความยาวของการสนทนา
เพื่อคำนวณดัชนี Arena แปลงอัตราการทำเครื่องหมายของแต่ละสัญญาณโดยใช้สูตรหนึ่งลบรากที่สองของอัตรานั้น ซึ่งแนวทางนี้ทำให้การปรับปรุงที่ใกล้เคียงกับการสอดคล้องเต็มที่สามารถมองเห็นได้ จากนั้นรวมคะแนนสามค่าโดยให้ค่าน้ำหนัก 50% แก่การกระทำที่ไม่ได้รับอนุญาตและ 25% แก่การอ้างสิทธิ์เท็จและการทำงานเสร็จหลอกลวง ค่าที่สูงขึ้นบ่งบอกว่าโมเดลปลอดภัยและสอดคล้องดียิ่งขึ้น ตามบริษัท
ผลการค้นหาเบื้องต้นและขั้นตอนต่อไป
GPT-6.1 Sol ของ OpenAI นำหน้าตัวอย่างที่เผยแพร่ด้วยคะแนน 87.9 ตามด้วย Claude Opus 5.5 ของ Anthropic ที่ 83.2 และ Grok 4.7 ของ SpaceXAI ที่ 82.7 Arena รายงานว่าโมเดลของ OpenAI ครองตำแหน่งห้าตำแหน่งแรกใน 27 โมเดลที่ประเมิน โดยมีสี่โมเดลอยู่ที่ประมาณ 88 คะแนน
Arena รายงานว่าประมาณ 2% ของเซสชัน Claude Opus 5 มีการกระทำที่ไม่ได้รับอนุญาต และ 53.5% ของกรณีนั้นเกี่ยวกับการลบหรือทำความสะอาดไฟล์หรือผลงานก่อนหน้าของผู้ใช้โดยไม่ได้รับอนุญาต; ใน Claude Opus 5.5 ส่วนการทำความสะอาดลดลงเหลือ 20.0% การทำงานเสร็จหลอกลวงส่งผลต่อเซสชันโดยเฉลี่ย 10% เพิ่มขึ้นเป็น 48.0% ในการดีบักโค้ด ซึ่งเป็นอัตราสูงสุดในหมวดงานใด ๆ ในขณะที่การตรวจจับการกระทำที่ไม่ได้รับอนุญาตสูงสุดที่การอธิบายโค้ดที่ 6.3% และการอ้างสิทธิ์เท็จสูงสุดในงานเขียนมืออาชีพที่ 13.7%
อัตราการตรวจพบเพิ่มขึ้นตามความยาวของการสนทนาสำหรับสัญญาณทั้งสามประเภท: ในเซสชันที่มีข้อความของผู้ใช้ 20 ข้อความหรือมากกว่า การทำสำเนาแบบหลอกลวงถูกระบุใน 45.4% ของเซสชันและการกระทำที่ไม่ได้รับอนุญาตใน 12.4% Arena ยังรายงานว่าโมเดลรุ่นใหม่ล่าสุดในตระกูล GPT, Claude, Gemini Flash และ Grok มีอัตราการตรวจพบต่ำกว่ารุ่นก่อนหน้าสำหรับสัญญาณส่วนใหญ่ โดยระบุว่า GPT-6.1 Sol มีการอ้างอิงเท็จที่สูงกว่า GPT-6 Sol เล็กน้อยและ Claude Opus 5 มีการกระทำที่ไม่ได้รับอนุญาตที่สูงกว่า Claude Opus 4.8 เป็นข้อยกเว้น
Arena กล่าวว่า จะเพิ่มสัญญาณที่เกี่ยวกับความปลอดภัยเพิ่มเติมในดัชนี เริ่มจากการวัดว่ารุ่นต่าง ๆ ปฏิเสธคำสั่งที่เป็นอันตรายได้ดีแค่ไหน และจะขยายการวัดนี้ไปยังโมเดลใหม่และสภาพแวดล้อมจริงพร้อมกับอัปเดตสัญญาณบนลีดเดอร์บอร์ดอย่างต่อเนื่องตามแต่ละสัญญาณ












