โมเดลและแพลตฟอร์ม AI
Anthropic เปิดตัว Claude Sonnet 5.5 พร้อมราคาที่คงที่เช่น Sonnet 5

Anthropic เปิดตัว Claude Sonnet 5.5 เมื่อวันที่ 28 กันยายน 2026 ซึ่งเป็นโมเดลที่สองในตระกูล Claude 5.5 ของบริษัท โมเดลนี้รักษาราคาของ Claude Sonnet 5 ไว้ที่ 2 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุตและ 10 ดอลลาร์ต่อหนึ่งล้านโทเคนเอาต์พุต และ Anthropic กล่าวว่าโมเดลนี้สร้างผลลัพธ์ได้เร็วกว่าเกิน 30% พร้อมต้นทุนที่ลดลงสูงสุด 30% ต่อภารกิจในการทดสอบของบริษัท
ใน ประกาศการเปิดตัว Anthropic อธิบายว่า Sonnet 5.5 เป็นส่วนเสริมที่เร็วกว่าและต้นทุนต่ำกว่าให้กับ Claude Opus 5.5 ซึ่งบริษัทระบุว่าออกแบบมาสำหรับงานที่ซับซ้อนที่ต้องการการตัดสินใจอย่างรอบคอบ Sonnet 5.5 มีความแข็งแกร่งที่สุดในงานประจำวันที่กำหนดขอบเขตชัดเจน การแก้ไขบั๊ก และการสร้างเอกสาร สไลด์ และสเปรดชีตที่เรียบหรู Anthropic กล่าวเพิ่มเติมว่า มันยังมีสายตาที่คมชัดด้านการออกแบบด้วย
Claude Sonnet 5.5 มีให้ใช้บนแพลตฟอร์มทั้งหมด รวมถึง Amazon Web Services, Google Cloud, และ Microsoft Azure โดยใช้รหัสโมเดล claude-sonnet-5-5 และให้บริการโดยไม่มีการเก็บข้อมูลเช่นเดียวกับ Opus 5.5 และ Sonnet 5
ผลการทดสอบเบนช์มาร์คที่รายงาน
Anthropic รายงานว่า Sonnet 5.5 ได้คะแนน 70.6% ใน Terminal-Bench 4.0 ซึ่งเป็นการประเมินการเขียนโค้ดแบบเอเจนท์ เทียบกับ Sonnet 5 ที่ได้ 10.3% โดย Opus 5.5 มีคะแนนที่ระบุไว้ที่ 66.4% ซึ่งสะท้อนผลลัพธ์ระดับ Xhigh-effort บนชุดหลักของ FrontierCode 1.1 Sonnet 5.5 ได้คะแนน 46.2% ที่ระดับ Max effort และ 52.1% ที่ระดับ Xhigh เมื่อเทียบกับ 42.4% ของ Sonnet 5, 54.4% ของ Opus 5.5, และ 49.3% ของ GPT-6 Sol ของ OpenAI คะแนน CursorBench 4.0 ที่รายงานคือ 55.5% สำหรับ Sonnet 5.5, 34.1% สำหรับ Sonnet 5, และ 57.8% สำหรับ Opus 5.5
ในการประเมินงานความรู้ บริษัทรายงานคะแนน GDPval-AA v2.1 ของ Sonnet 5.5 อยู่ที่ 1844 ซึ่งต่ำกว่า Opus 5.5 เพียงสองคะแนน (1846) และสูงกว่ Sonnet 5 ประมาณ 400 คะแนน (1449) และคะแนน AA‑Briefcase v1.1 อยู่ที่ 1811 เทียบกับ 1822 ของ Opus 5.5 และ 1359 ของ Sonnet 5 ประกาศยังระบุว่าได้ 64.5% พร้อมเครื่องมือใน Humanity’s Last Exam, 80.1% เครดิตบางส่วนใน OSWorld 2.1, และ 61.6% ไม่มีเครื่องมือใน Chartography ซึ่งเป็นการทดสอบการจดจำแผนภูมิแบบภาพ Anthropic กล่าวว่า Sonnet 5.5 เป็นโมเดล Sonnet ตัวแรกที่เอาชนะ Pokémon Red โดยทำงานเฉพาะจากภาพหน้าจอ
บริษัทเตือนว่าคะแนนเบนช์มาร์คสะท้อนเพียงแง่มุมเดียวของความสามารถของโมเดลเท่านั้น และกล่าวว่าในการทดสอบของบริษัทเองและของผู้ทดสอบภายนอก Opus 5.5 ยังคงแข็งแกร่งอย่างชัดเจนในงานที่ซับซ้อนและไม่มีขอบเขตที่ต้องการการตัดสินใจอย่างต่อเนื่อง หมายเหตุหนึ่งระบุว่า Artificial Analysis ได้รัน GDPval‑AA และ AA‑Briefcase บนการปรับใช้ก่อนเปิดตัวที่มีบักโครงสร้างผลลัพธ์ซึ่งได้ถูกแก้ไขแล้วและหากมีผลใด ๆ จะทำให้ประสิทธิภาพของ Sonnet 5.5 ถูกประเมินต่ำลง หมายเหตุอีกหนึ่งบันทึกว่า OpenAI เพิ่งแก้บักการเข้าใจภาพใน GPT‑6 Sol ซึ่งคะแนนจากบุคคลที่สามอาจยังไม่สะท้อนผลการแก้ไขนี้
ผลการทดสอบจากผู้ใช้ต้นแบบ
David Loker รองประธานฝ่าย AI ของ CodeRabbit กล่าวว่า Sonnet 5.5 แสดงการตัดสินใจที่ดีกว่า Sonnet 5 ในทุกระดับความซับซ้อน พร้อมใช้โทเคนเอาต์พุตน้อยกว่ามาก และ CodeRabbit มีแผนย้ายการตรวจสอบแบบง่ายและระดับกลางไปยังโมเดลนี้ทันที โดยจะเพิ่มการใช้งานในสัปดาห์ต่อ ๆ ไป Gabriel Grinberg หัวหน้าวิศวกรรม AI ของ Base44 รายงานว่าในการสร้างแอปจริง 118 ครั้ง Sonnet 5.5 มีค่าเฉลี่ย 3.6 ครั้งต่อการสร้างเทียบกับ Opus 5 ที่ 7.7 โดยมีจำนวนการเรียกใช้เครื่องมือที่ล้มเหลวน้อยที่สุดในบรรดาโมเดลที่ Base44 เปรียบเทียบ
Curtis Allen วิศวกรอาวุโสของ Slack รายงานว่าการประเมิน Slackbot แบบออฟไลน์ที่ไม่มีการเปลี่ยนแปลงพรอมต์ใช้โทเคนเอาต์พุตน้อยลงประมาณ 14% Zendesk ผู้อำนวยการฝ่าย AI, Abhinay Kathuria, กล่าวว่า ตั๋วได้รับการประมวลผลเร็วขึ้น 20% เมื่อเทียบกับโมเดล Claude ที่ Zendesk ใช้ในระบบผลิต Balyasny Asset Management รายงานว่ามีการใช้โทเคนประมาณ 121,000 ต่อคำตอบ เทียบกับ Sonnet 5 ที่ 497,000 ในชุดงานการเงินส่วนตัวจำนวน 2,441 งาน Box รายงานผลลัพธ์เร็วขึ้น 2.4 เท่าพร้อมใช้โทเคนน้อยลงรวม 12% และ Atlassian กล่าวว่า ลูกค้าสามารถรัน Rovo Agents ได้เร็วขึ้นสูงสุด 30% เมื่อเทียบกับ Sonnet 5
ราคา ความเร็ว และการย้ายข้อมูล
ราคาที่ระบุของ Sonnet 5.5 ตรงกับ Sonnet 5 อย่างครบถ้วน: $2 ต่อหนึ่งล้านโทเคนอินพุต, $10 ต่อหนึ่งล้านโทเคนเอาต์พุต, $0.20 ต่อหนึ่งล้านโทเคนอ่านแคช, และ $2.50 ต่อหนึ่งล้านโทเคนเขียนแคช Opus 5.5 มีราคา $4 ต่ออินพุต, $20 ต่อเอาต์พุต, และ $5 ต่อการเขียนแคช Anthropic กล่าวว่า Sonnet 5.5 มักต้องใช้โทเคนน้อยกว่ามากสำหรับงานเดียวกันและเป็นโมเดล Sonnet ที่เร็วที่สุดจนถึงปัจจุบัน
โมเดลนี้มีระดับความพยายามที่ปรับใหม่ทั้งหมดห้าระดับ: ต่ำ, ปานกลาง, สูง, xhigh, และ max ค่าเริ่มต้นคือ ปานกลางใน Claude Code และแอป Claude และสูงบน Claude Platform ซึ่งเป็นค่าเริ่มต้นของ API ด้วยเช่นกัน
Anthropic’s คู่มือการย้ายข้อมูล ระบุการเปลี่ยนแปลงที่ทำให้เกิดความขัดแย้งสำหรับนักพัฒนาที่ย้ายจาก Sonnet 5. การคิดแบบ Adaptive ตอนนี้ทำงานโดยค่าเริ่มต้น, การตั้งค่าการคิดที่ปิดใช้งานจะส่งคืนข้อผิดพลาด 400, และนักพัฒนาที่เคยรัน Sonnet โดยปิดการคิดต้องสลับไปยัง การตั้งค่าเครื่องมือ, ที่ต่ำที่สุดที่มีให้เลือก, ก่อนทำการย้ายข้อมูล. การบังคับเลือกเครื่องมือถูกปฏิเสธและเปลี่ยนเป็นการเลือกเครื่องมืออัตโนมัติพร้อมกับเครื่องมือที่เข้มงวด, และจำนวนโทเคนพรอมต์ที่สามารถแคชได้ขั้นต่ำลดลงเป็น 512 โทเคนจาก 1,024 โทเคนใน Sonnet 5. เอกสารยังระบุห้าหมวดหมู่เหตุผลการปฏิเสธ, ครอบคลุมด้านไซเบอร์, ชีวภาพ, และแนวหน้าllm, การให้เหตุผลการสกัด, และทั่วไปอันตราย, และบันทึกว่าการลองซ้ำแบบ fallback ฝั่งเซิร์ฟเวอร์จะทำซ้ำเฉพาะการปฏิเสธด้านไซเบอร์และ frontier_llm บน Sonnet 5.
ผลการค้นพบด้านความปลอดภัยและมาตรการป้องกัน
เนื่องจากความสามารถด้านไซเบอร์ของ Sonnet 5.5 เปรียบเทียบได้กับของ Opus 5, Anthropic กล่าวว่ามันเป็นโมเดล Sonnet รุ่นแรกที่เปิดตัวพร้อมกับมาตรการป้องกันไซเบอร์และการสำรองที่ใช้ในโมเดลที่มีความสามารถสูงสุดของบริษัท การ์ดระบบ รายงานว่าหากปิดการป้องกัน, Sonnet 5.5 มีค่าเฉลี่ย 11.53 ธงความสามารถและอัตราการจับได้ 80% บน ExploitBench และสร้างการโจมตีแบบรันโค้ดโดยอิสระเต็มรูปแบบ 178 รายการ, เทียบกับหนึ่งรายการของ Sonnet 5 มันทำสำเร็จ 46.1% ของความท้าทาย CyScenarioBench เทียบกับ 0.7% ของ Sonnet 5, และสร้างการยึดการไหลของการควบคุม 50 ครั้งบน Binary Exploitation Benchmark เทียบกับ 3 ครั้งของ Sonnet 5.
มาตรการป้องกันไซเบอร์ทำงานในสามขั้นตอน: การตรวจสอบการกระตุ้นภายในของโมเดล, ตัวจำแนกแบบเบาที่ทำงานบนโมเดล, และตัวจำแนก LLM ที่ฝึกแยกออกมา การ์ดรายงานอัตราการเรียกคืน 99.43% บนชุดการครอบคลุมอันตรายไซเบอร์และอัตราความสำเร็จของการโจมตี 21.0% ในการประเมินความทนทานต่อผู้โจมตีแบบ rewind‑attacker, ปรับปรุงจาก 57.2% ของ Sonnet 5, พร้อมเตือนผู้ใช้ให้คาดหวังการปฏิเสธที่เพิ่มขึ้นแม้ในงานด้านความปลอดภัยไซเบอร์ที่ไม่มีอันตราย คำขอที่มีความเสี่ยงสูงจะถูกส่งกลับไปยัง Sonnet 5 อย่างชัดเจน, และโครงการ Cyber Verification Program ที่ขยายขนาดจะเร็ว ๆ นี้ให้ผู้ป้องกันที่ผ่านการตรวจสอบเข้าถึงความสามารถขั้นสูงของ Sonnet 5.5, Opus 5.5, และโมเดล Claude Mythos ในระดับขั้น.
มาตรการป้องกันด้านชีววิทยาเป็นตัวจำแนกการใช้ในทางที่เป็นอันตรายเดียวกันที่ใช้กับ Opus 5, ไม่มีโมเดลสำรอง, และ Anthropic’s โปรแกรมตรวจสอบวิทยาศาสตร์ชีวิต ครอบคลุมการเข้าถึงสำหรับงานชีววิทยาทั้งหมด Sonnet 5.5 ยังเป็นโมเดล Sonnet รุ่นแรกที่มีตัวจำแนกความปลอดภัยที่บล็อกการสกัดเหตุผล, และขยายการคิดที่ถูกเก็บรักษาเพื่อให้การคิดของโมเดลไม่สามารถแยกออกจากบัญชีที่สร้างมันได้.
จากการตรวจสอบพฤติกรรมอัตโนมัติของ Anthropic ที่ครอบคลุมประมาณ 1,850 สถานการณ์, บริษัทรายงานว่า Sonnet 5.5 ปรับปรุงหรือเทียบเท่ากับ Sonnet 5 ในมาตรการส่วนใหญ่ของการสอดคล้อง, ความต้านทานการใช้ในทางที่ผิด, และความซื่อสัตย์, บันทึกอัตราการพยายามหลบหนี sandbox ที่ต่ำที่สุดในบรรดาโมเดลที่ทดสอบ, และแสดงการคิดที่ไม่ชัดเจนมากกว่าหลายโมเดลก่อนหน้า การ์ดระบบระบุว่า Sonnet 5.5 ไม่ผ่านเกณฑ์ใหม่ของ Responsible Scaling Policy, ถือว่าเป็นไปตามเกณฑ์ CB-1 และ Autonomy-1 ของนโยบาย, และมีความเสี่ยงที่ประเมินว่าต่ำต่อการไม่สอดคล้องอย่างรุนแรง โมเดลมีขีดจำกัดความรู้ที่เชื่อถือได้ถึงเดือนมิถุนายน 2026.
Anthropic กล่าวว่า Claude Haiku 5.5 ซึ่งออกแบบมาสำหรับแอปพลิเคชันที่มีปริมาณสูงและคำนึงถึงต้นทุน, จะเข้าร่วมกับตระกูล Claude 5.5 ในไม่กี่สัปดาห์ข้างหน้า.












