ผู้นำทางความคิด

การถกเถียงเรื่อง “Nerfing” ของ Claude ไม่ใช่เรื่องของ Claude แต่เป็นเรื่องของสิ่งที่เกิดขึ้นเมื่อการดำเนินงานของคุณขึ้นอยู่กับการตัดสินใจของคนอื่น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

เมื่อต้นปีนี้ Stella Laurenzo ผู้อำนวยการอาวุโสด้าน AI ของ AMD ได้ตีพิมพ์ข้อมูลทางเทคนิคจากเซสชั่น Claude Code เกือบ 7,000 เซสชั่น โดยมีเอกสารที่วิศวกรรู้สึกแต่ไม่สามารถอธิบายได้: ระหว่างเดือนมกราคมถึงมีนาคม ความลึกของการให้เหตุผลที่มองเห็นได้ลดลง 73% การเรียก API ต่อหน้าที่เพิ่มขึ้น 80 เท่า และโมเดลอ่านไฟล์น้อยลงมาก่อนที่จะแก้ไข เนื่องจากรายงานนี้แพร่กระจายอย่างรวดเร็ว การตีความก็แพร่กระจายไปเร็วขึ้น

Anthropic ไม่เห็นด้วยกับการตีความนี้ บริษัทระบุว่าการเปลี่ยนแปลงเหล่านี้สะท้อนถึงการตัดสินใจผลิตภัณฑ์ที่ตั้งใจไว้ รวมถึงกลไกการคิดแบบปรับเปลี่ยนใหม่และเปลี่ยนเป็นความพยายามปานกลางเป็นค่าเริ่มต้น นักวิเคราะห์อิสระบางคนก็ได้โต้แย้งบางส่วนของวิธีการนี้ การถกเถียงยังคงดำเนินอยู่ และผู้ที่มีเหตุผลไม่เห็นด้วยกับสิ่งที่เกิดขึ้นจริง

แต่สิ่งที่สำคัญคือหากคุณกำลังดำเนินธุรกิจบนระบบเหล่านี้ ไม่ว่าสิ่งนี้จะเป็นการเสื่อมสภาพหรือการปรับแต่งที่ตั้งใจไว้ไม่เปลี่ยนแปลงสิ่งที่ผู้ดำเนินธุรกิจระดับองค์กรประสบ พวกเขาคาดเดาไม่ได้ พวกเขาควบคุมไม่ได้ และบางคนรู้สึกมันในระหว่างการผลิตก่อนที่จะเข้าใจสิ่งที่เกิดขึ้น นี่คือเรื่องจริง และไม่เกี่ยวข้องกับ Anthropic โดยเฉพาะ

สิ่งนี้เป็นปัญหาการพึ่งพา ไม่ใช่ปัญหาของโมเดล

สิ่งที่เราอธิบายมีชื่อเรียก: ความอ่อนไหวของโมเดล มันเป็นสถานะที่การดำเนินงานที่สำคัญต่อภารกิจถูกผูกไว้กับพฤติกรรมของโมเดลเดียว ดังนั้นการเปลี่ยนแปลงใดๆ ที่ชั้นโมเดล ไม่ว่าจะเป็นการปรับแต่ง การเปลี่ยนค่าเริ่มต้น การเปลี่ยนแปลงการกำหนดเส้นทางเนื่องจากความจุ หรือการยกเลิกเงียบๆ จะส่งผลกระทบต่อธุรกิจโดยตรง โดยไม่มี缓冲และไม่มีการเตือน

สิ่งนี้ไม่ใช่ลักษณะใหม่ GPT-4 ผ่านกระบวนการนี้ในปี 2023 Claude 3.5 ผ่านกระบวนการนี้ในปี 2024 Claude Opus กำลังผ่านกระบวนการนี้อยู่ และจะเกิดขึ้นอีกครั้งกับโมเดลรุ่นต่อไป และรุ่นต่อไป ไม่ใช่เพราะผู้ขายดำเนินการด้วยความไม่ดี แต่เพราะการปรับให้เหมาะสมของโมเดลรุ่นใหม่สำหรับต้นทุน ความล่าช้า และขนาดในปริมาณทั่วโลกคือสิ่งที่ผู้ขายรุ่นใหม่ต้องทำ สิ่งจูงใจและแรงจูงใจขององค์กรที่ดำเนินการผลิตบนระบบเหล่านี้เกี่ยวข้องกัน แต่ไม่เหมือนกัน และจะไม่เหมือนกัน

เริ่ม Qurrent ในปี 2023 และมีความรู้ทางประวัติศาสตร์เพื่อรู้ว่าวงจรซอฟต์แวร์องค์กรจะดำเนินไปอย่างไร: บริษัทลงทุนใน AI การเดโมทำงาน การทดลองทำงาน จากนั้นจะเริ่มทำงานจริง และบางสิ่งที่เปลี่ยนแปลงที่ชั้นโมเดล และผู้ลูกค้าเป็นคนซึ่ง sở hữuปัญหา พวกเขาคือผู้ที่ดูแลการทำงาน รักษาความเสถียร และดูดซับข้อขัดข้อง สิ่งนี้ไม่เคยทำให้ฉันเข้าใจว่าเป็นรูปแบบที่ยั่งยืนสำหรับการดำเนินงานขององค์กร

เรื่องราวรุ่นองค์กรเป็นเรื่องการดำเนินงาน ไม่ใช่เรื่องเทคนิค

สำหรับนักพัฒนา สถานการณ์ปัจจุบันไม่สะดวก การใช้โทเค็นเพิ่มขึ้น การเข้ารหัสล้มเหลว การทดสอบไม่ผ่าน นี่เป็นปัญหา แต่เป็นปัญหาที่สามารถฟื้นตัวได้

สำหรับองค์กรที่ดำเนินธุรกิจการเงิน การทำงานตามกฎระเบียบ การรับและจ่ายเงิน และกระบวนการหลังบ้านที่ซับซ้อน อันตรายมีความแตกต่าง กระบวนการเหล่านี้ไม่สามารถดูดซับหนึ่งสัปดาห์ที่ไม่ดีได้ ข้อผิดพลาดสะสม ปริมาณสะสม ข้อตกลงในการให้บริการเป็นข้อผูกพันต่อลูกค้าจริง ไม่ใช่ความชอบส่วนบุคคล ของลูกค้า เมื่อโมเดลเริ่มทำงานไม่ดีในกระบวนการที่มีความเสี่ยงสูง อันตรายจะเกิดขึ้นไม่ว่าจะมีใครสังเกตเห็นหรือไม่

สิ่งที่ทำให้สิ่งนี้ยากขึ้นคือบริษัทส่วนใหญ่ที่พยายามที่จะนำ AI มาใช้โดยการสร้างตัวแทนภายในบนโมเดลเดียวตอนนี้發現ว่าพื้นฐานนั้นไม่สมบูรณ์ ตัวแทนแรกเป็นส่วนง่าย สิ่งที่ไม่ได้สร้างคือโครงสร้างพื้นฐานที่ล้อมรอบ: แฟร์มเวิร์กการประเมินที่ตรวจจับการเปลี่ยนแปลงพฤติกรรมก่อนที่จะส่งผลกระทบต่อลูกค้า โลจิกการทำงานซ้ำที่เปลี่ยนการทำงานอัตโนมัติเมื่อโมเดลเริ่มทำงานไม่ดี และการกำกับดูแลที่สามารถติดตามภูมิทัศน์ที่เปลี่ยนแปลงทุกๆ ไตรมาส ช่องว่างเหล่านี้ไม่คงอยู่ได้ และจะเติบโตเป็นหน้าที่ทางวิศวกรรมถาวรที่ไม่มีใครจัดสรรเงินให้ และมีคนงานที่ต้องทำหน้าที่ตามการตัดสินใจของซัพพลายเออร์ที่ไม่มีอิทธิพล

สิ่งที่ความทนทานดูเหมือนในระหว่างการผลิต

ที่ Qurrent เราได้สร้างกำลังคนดิจิทัลให้เป็นอิสระจากโมเดลตั้งแต่เริ่มต้น ไม่ใช่เพียงตำแหน่งทางการตลาด แต่เป็นข้อกำหนดทางสถาปัตยกรรม ทุกงานจะถูกส่งไปยังโมเดลที่ทำงานได้ดีที่สุดสำหรับงานนั้น โดยมีการประเมินอย่างต่อเนื่อง เมื่อมีโมเดลที่ดีกว่ามาถึง ลูกค้าจะได้รับมันโดยอัตโนมัติ เมื่อโมเดลปัจจุบันทำงานไม่ดีในกระบวนการเฉพาะ ชั้นการกำกับดูแลจะเปลี่ยนการทำงานนั้นภายในไม่กี่วินาที โดยไม่ต้องมีการแทรกแซงจากมนุษย์และไม่ต้องมีใครตื่นขึ้นมาเพื่อดูスレดที่ 2 น.

ด้านล่างนั้น การจำลองแบบอัตโนมัติจะทำงานต่อกระบวนการผลิตตลอด 24 ชั่วโมง โดยวัดว่าผลลัพธ์ตรงกับพฤติกรรมที่คาดหวังหรือไม่ การเปลี่ยนแปลงจะถูกตรวจจับได้ที่ชั้นโครงสร้างพื้นฐานก่อนที่ทีมการดำเนินงานจะรู้สึกมัน และก่อนที่ลูกค้าจะรู้สึกมัน และทุกการตัดสินใจที่ทำโดยคนงานดิจิทัลจะถูกบันทึกและสามารถตรวจสอบได้ เป็นกล่องแก้วที่สมบูรณ์ เพราะคุณไม่สามารถกำกับดูแลสิ่งที่คุณไม่เห็นได้

สิ่งเหล่านี้ไม่ใช่คุณสมบัติพรีเมียม มันเป็นค่าตอบแทนสำหรับการดำเนิน AI ในการผลิตระดับองค์กร บริษัทส่วนใหญ่กำลังเรียนรู้สิ่งนี้ในระหว่างการรายงานข่าว ซึ่งเป็นวิธีที่มีค่าใช้จ่ายในการค้นพบ

คำถามที่ควรถามในไตรมาสนี้

หากโมเดลที่การดำเนินงานของคุณพึ่งพามีหนึ่งสัปดาห์ที่ไม่ดีในไตรมาสหน้า กระบวนการทำงานของคุณจะรู้สึกมันอย่างไร? คุณจะรู้ได้อย่างไร? และคุณจะเปลี่ยนการทำงานรอบๆ มันได้เร็วแค่ไหน?

หากคำตอบของคำถามที่สองคือ “เราจะได้รับแจ้งจากลูกค้า” การดำเนินงานนั้นไม่พร้อมสำหรับการผลิต มันเป็นการนำร่องที่ทำงานในขนาดใหญ่ และความแตกต่างมีความสำคัญมากกว่าที่ผู้นำหลายคนรู้จักจนกว่ามันจะไม่สำคัญ

การถกเถียงในปัจจุบันในทางกลับกัน มีประโยชน์ ทุกๆ คนที่ดูการถกเถียงนี้ได้รับการ预览ของสิ่งที่ความอ่อนไหวของโมเดลดูเหมือนในระหว่างการทำงานจริง โดยไม่ต้องจ่ายเงินให้กับตนเอง การตอบสนองที่ถูกต้องไม่ใช่การเปลี่ยนโมเดล แต่เป็นการสร้างการดำเนินงานที่ไม่พึ่งพาโมเดลใดๆ

เทคโนโลยีจะยังคงเปลี่ยนแปลงไป นี่คือความแน่นอนเดียวในตลาดนี้ องค์กรที่จะออกมาจากทศวรรษนี้แข็งแกร่งที่สุดจะไม่ใช่ผู้ที่เลือกโมเดลที่ถูกต้อง พวกเขาจะเป็นผู้ที่การดำเนินงานไม่ต้องสนใจ

คอลิน วีล ซีอีโอและผู้ร่วมก่อตั้ง Qurrent เป็นนักธุรกิจที่มีประสบการณ์ในการทำงานกับ AI ตั้งแต่ทศวรรษ 1990 ก่อนหน้านี้คอลินได้ทำงานใน Mynd ซึ่งเป็นแพลตฟอร์มที่มีเทคโนโลยีสำหรับการลงทุนในบ้านเดี่ยว และ Waypoint Homes ซึ่งได้ระดมทุนมากกว่า 3.5 พันล้านดอลลาร์และจัดการบ้านมากกว่า 17,000 หลัง ก่อนที่จะเข้าจดทะเบียนใน NYSE ในปี 2014 คอลินได้รับการยอมรับในด้านนวัตกรรม AI และได้รับอนุปริญญาหลายอย่าง รวมถึงการได้รับการยอมรับจาก Goldman Sachs ในฐานะผู้ประกอบการนวัตกรรมที่ดีที่สุด 100 คน และได้รับการยอมรับจาก Ernst & Young ในฐานะผู้ประกอบการแห่งปี