โมเดลและแพลตฟอร์ม AI

เพดาน 75%: โมเดล AI มีประสิทธิภาพสูงสุดด้วยวิธีการปัจจุบันหรือไม่?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Anthropic และ OpenAI เปิดตัวโมเดล AI ขอบเขตใหม่สองวันติดต่อกัน โดยทั้งสองได้รับผลลัพธ์ความแม่นยำ 74-75% ในมาตรฐานการเขียนโค้ดของอุตสาหกรรม ซึ่งบ่งชี้ถึงความเป็นไปได้ของเพดานประสิทธิภาพสำหรับโครงสร้าง AI ปัจจุบัน ในขณะเดียวกันก็มีการใช้วิธีการกระจายและใช้งานที่แตกต่างกันอย่างมาก

การเปิดตัวที่เกิดขึ้นเกือบพร้อมกันทำให้เกิดคำถามพื้นฐานเกี่ยวกับว่าพัฒนาการ AI ได้ถึงจุดสูงสุดแล้วหรือไม่ โดยใช้วิธีการฝึกอบรมปัจจุบัน แม้ว่าบริษัทต่างๆ จะมีการกระจายและนำไปใช้งานที่แตกต่างกันอย่างมากสำหรับผู้ใช้และนักพัฒนาทั่วโลก

การบรรจบกันของมาตรฐานการวัดประสิทธิภาพชี้ถึง 里程碑ทางเทคนิค

Claude Opus 4.1 ที่เปิดตัวเมื่อวันที่ 5 สิงหาคมโดย Anthropic ได้รับผลลัพธ์ 74.5% ใน SWE-bench Verified ซึ่งเป็นมาตรฐานการเขียนโค้ดของอุตสาหกรรม OpenAI’s GPT-5 ที่ประกาศเมื่อวันที่ 7 สิงหาคมได้รับผลลัพธ์ 74.9% ในการทดสอบเดียวกัน ซึ่งเป็นผลลัพธ์ที่ใกล้เคียงกันและบ่งชี้ว่าทั้งสองบริษัทได้ผลักดันโครงสร้าง AI ปัจจุบันไปสู่ขีดจำกัดที่คล้ายคลึงกัน尽管ทำงานอิสระ

ความแตกต่าง 0.4% ระหว่างโมเดลอยู่ภายในขอบเขตของความผิดพลาดทางสถิติสำหรับการทดสอบดังกล่าว

อย่างไรก็ตาม วิธีการทางสถาปัตยกรรมมีความแตกต่างกันอย่างมาก OpenAI สร้าง GPT-5 เป็นระบบหลายโมเดลพร้อมกับการกำหนดเส้นทางอัจฉริยะ โดยคำถามจะถูกส่งไปยังโมเดลที่ตอบสนองเร็วสำหรับงานง่ายๆ โมเดลการให้เหตุผลสำหรับปัญหาที่ซับซ้อน หรือรุ่นย่อเมื่อถึงขีดจำกัดการคำนวณ Anthropic ใช้วิธีการแบบโมเดลเดียวพร้อมกับการจัดลำดับความสำคัญของความสม่ำเสมอมากกว่าการปรับให้เหมาะสมแบบเฉพาะเจาะจง

Source: Anthropic

ยุทธวิธีการกระจายสินค้าเปิดเผยปรัชญาที่แข่งขันกัน

OpenAI ได้ทำให้ GPT-5 พร้อมใช้งานทันทีสำหรับผู้ใช้ ChatGPT ทุกคน รวมถึงผู้ใช้ระดับฟรี ซึ่งมีผู้ใช้งานประมาณ 700 ล้านคนต่อสัปดาห์โดยไม่มีค่าใช้จ่าย Microsoft (MSFT ) ได้บูรณาการโมเดลนี้ทั่วทั้ง GitHub Copilot, Visual Studio Code, M365 Copilot และ Azure

Anthropic มีการจำกัดการเข้าถึงแบบดั้งเดิม โดยเสนอ Opus 4.1 ให้กับผู้ใช้ Claude ที่จ่ายค่าบริการ ผ่าน Claude Code สำหรับนักพัฒนา และผ่าน API บริษัทดูเหมือนจะเน้นการให้บริการนักพัฒนและองค์กรที่ต้องการประสิทธิภาพที่เชื่อถือได้และสม่ำเสมอ มากกว่าการขยายการกระจายสินค้า

GPT-5 มีการกำหนดราคาอย่างเข้มข้น โดยนักพัฒนาบางคนสังเกตเห็นอัตราส่วนต้นทุนต่อความสามารถที่ดี ซึ่งอาจกดดันให้ผู้แข่งขันปรับกลยุทธ์การกำหนดราคา

ความต้องการโครงสร้างพื้นฐานเปลี่ยนแปลงเศรษฐกิจของอุตสาหกรรม

ความต้องการการคำนวณเปิดเผยถึงขนาดใหญ่ของการพัฒนา AI ขอบเขตใหม่ OpenAI รายงานว่ามีสัญญาเช่าพื้นที่จัดเก็บข้อมูลมูลค่า 30,000 ล้านดอลลาร์ต่อปีกับ Oracle (ORCL ) สำหรับความจุ และได้ฝึกอบรม GPT-5 บน Microsoft Azure โดยใช้ GPU H200 ของ NVIDIA Meta ประกาศแผนการลงทุน 72,000 ล้านดอลลาร์สำหรับโครงสร้างพื้นฐาน AI ในปี 2025 เพียงอย่างเดียว

ทั้งสองบริษัทรายงานการปรับปรุงที่สำคัญในแอปพลิเคชันเชิงปฏิบัติ นอกเหนือจากผลลัพธ์ทางเทคนิค OpenAI ระบุว่า GPT-5 แสดง “ความผิดพลาดน้อยลงประมาณ 45% เมื่อการค้นหาทางเว็บถูกเปิดใช้งาน” โดยโหมดการคิดสามารถให้ผลลัพธ์ที่คล้ายกับโมเดล o3 ของพวกเขา ในขณะที่ใช้โทเค็นน้อยลง 50-80% – การเพิ่มประสิทธิภาพที่สำคัญ

GitHub รายงานว่า Opus 4.1 แสดง “การปรับปรุงประสิทธิภาพที่สำคัญในด้านการปรับโค้ดหลายไฟล์” ในขณะที่ Cursor ซึ่งเป็น AI ที่ช่วยในการเขียนโค้ดที่ได้รับความนิยม อธิบาย GPT-5 ว่าเป็น “โมเดลที่น่าประทับใจและง่ายต่อการควบคุม” ตามเอกสารประกอบสำหรับนักพัฒนาของ OpenAI

Source: OpenAI

เพดานทางเทคนิคชี้ถึงการเปลี่ยนแปลงรูปแบบในอนาคต

การบรรจบกันของผลลัพธ์ประสิทธิภาพที่คล้ายคลึงกันระหว่างบริษัทต่างๆ บ่งชี้ว่าวิธีการฝึกอบรมปัจจุบันอาจถึงขีดจำกัดแล้ว การที่หลายโมเดลมีผลลัพธ์ใกล้เคียงกัน 74-75% ในมาตรฐานการเขียนโค้ดบ่งชี้ว่าการปรับปรุงครั้งใหญ่ในอนาคนอาจต้องอาศัยนวัตกรรมพื้นฐานมากกว่าการปรับขนาดแบบทีละขั้นตอน

การแลกเปลี่ยนระหว่างระบบการกำหนดเส้นทางที่ซับซ้อนของ OpenAI และ วิธีการแบบโมเดลเดียวของ Anthropic สะท้อนถึงปรัชญาที่แตกต่างกันโดยไม่มีผู้ชนะที่ชัดเจน ระบบหลายโมเดลของ GPT-5 มีความยืดหยุ่น แต่ก็มีจุดอ่อนที่อาจเกิดขึ้น ในขณะที่ความสม่ำเสมอของ Claude อาจเสียสละประสิทธิภาพที่เฉพาะเจาะจงเพื่อความน่าเชื่อถือ

การทำให้ AI ขอบเขตใหม่มีให้ใช้งานอย่างกว้างขวาง โดยมีคุณสมบัติที่มีค่าใช้จ่ายหลายพันเหรียญต่อปีเพียงสองปีที่แล้วตอนนี้สามารถใช้ได้ฟรี การเปลี่ยนแปลงนี้จาก AI ที่เป็นบริการระดับพรีเมียมไปสู่โครงสร้างพื้นฐานที่ใช้งานได้จริงอาจทำให้เกิดแอปพลิเคชันใหม่ๆ ที่ไม่เคยเห็นมาก่อน

ผลกระทบต่อตลาดและขั้นตอนต่อไป

ผู้สังเกตการณ์ในอุตสาหกรรมคาดว่า Anthropic จะตอบสนองต่อกลยุทธ์การกำหนดราคาของ OpenAI แม้ว่าจะไม่น่าจะทำผ่านการตรงกันข้ามโดยตรง Google’s DeepMind และ Meta ซึ่งเงียบไปในช่วงการประกาศเหล่านี้ คาดว่าจะมีการเคลื่อนไหวในเดือนหน้า

ช่วงเวลาสองวันที่มีการเปิดตัวเผยให้เห็นถึงการเปลี่ยนแปลงของ AI จากเทคโนโลยีทดลองไปสู่โครงสร้างพื้นฐานที่เชื่อถือได้ เมื่อบริษัทต่างๆ มีผลลัพธ์มาตรฐานการวัดประสิทธิภาพที่ใกล้เคียงกัน โดยมีความแตกต่างเพียงเศษเสี้ยวของเปอร์เซ็นต์ การแข่งขันเปลี่ยนไปสู่ประสิทธิภาพในการใช้งาน ความสม่ำเสมอในการบูรณาการ และความน่าเชื่อถือในการให้บริการ

การปรับปรุงที่เกิดขึ้นในทางปฏิบัติมีความสำคัญมากกว่าผลลัพธ์ทางเทคนิค SWE-bench Verified วัดความสามารถของ AI ในการระบุและแก้ไขบั๊กที่แท้จริงในซอฟต์แวร์แบบโอเพ่นซอร์ส และคะแนนของทั้งสองโมเดลแสดงถึงความก้าวหน้าที่สำคัญในความสามารถการเขียนโค้ดอัตโนมัติ

เมื่อโมเดล AI มีความซับซ้อนมากขึ้นในด้านการให้เหตุผลและความสามารถในการเขียนโค้ด การแข่งขันเปลี่ยนจากตัวชี้วัดประสิทธิภาพโดยตรงไปสู่การนำไปใช้งานและความน่าเชื่อถือในสภาพแวดล้อมการผลิต ความจริงที่น่าประหลาดใจ? ความเสถียรนี้อาจทำให้เกิดการเปลี่ยนแปลงที่เปลี่ยนแปลงได้มากกว่าการพัฒนาที่สำคัญอีกครั้ง

Alex นำทีมการดำเนินงานข่าวสารที่ขับเคลื่อนด้วย AI ของ Unite.AI โดยผสานการทำข่าว, การวิจัย และระบบอัตโนมัติเพื่อสนับสนุนการครอบคลุมปัญญาประดิษฐ์อย่างทันท่วงทีและขยายได้ งานของเขาช่วยให้การพัฒนาปัญญาประดิษฐ์ที่กำลังเกิดขึ้นถูกนำเสนออย่างมีประสิทธิภาพในขณะที่ยังคงรักษามาตรฐานบรรณาธิการของสำนักพิมพ์.