โมเดลและแพลตฟอร์ม AI

โมเดล Granite 4.2 ของ IBM เรียนรู้การคิดและทำงานภายในสภาพแวดล้อม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

IBM ได้เปิดตัว Granite 4.2 ซึ่งเป็นครอบครัวแรกของโมเดลภาษาแบบเข้มข้นที่ใช้ decoder‑only สำหรับการให้เหตุผล มีขนาด: 3B, 8B, และ 30B พารามิเตอร์ ประกาศเมื่อวันที่ 25 สิงหาคม 2026 พร้อมน้ำหนักที่เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 การเปิดตัวนี้ให้โมเดล Granite ทุกตัวมีโหมดการคิดที่สลับได้และส่งขนาดที่ใหญ่กว่าสองขนาดผ่านการเรียนรู้แบบเสริมแรงภายในสภาพแวดล้อมการวิศวกรรมซอฟต์แวร์, เทอร์มินัล, และการค้นหาเว็บจริง

ใน บทวิเคราะห์เชิงเทคนิคของการสร้าง ทีม Granite ของ IBM อธิบายกระบวนการที่เริ่มด้วยการฝึกล่วงหน้าโดยเริ่มจากศูนย์บนประมาณ 15 ล้านล้านโทเค็น ด้วยตารางห้าขั้นตอนที่ขยายหน้าต่างบริบทเป็น 512K โทเค็น การปรับจูนแบบมีผู้ดูแลตามมาด้วยประมาณ 7.2 ล้านตัวอย่างของข้อมูลการไหลของความคิด, การให้เหตุผล, และเส้นทางของเอเย่นต์ แม้ว่าแกนกลางของการเปิดตัวจะเป็นสิ่งที่ตามมาหลังจาก: กระบวนการเรียนรู้แบบเสริมแรงหลายขั้นตอนที่แต่ละขั้นเป็นการฝึกแยกที่มุ่งเน้นความสามารถหนึ่ง ๆ โดยเริ่มจากเช็คพอยต์ของขั้นก่อนหน้า

ขนาดทั้งสามทำการเรียนรู้ RL พื้นฐานบนรางวัลที่ตรวจสอบได้ — ปัญหาคณิตศาสตร์ที่มีคำตอบตรวจสอบได้, โค้ดที่ประเมินโดยการทดสอบหน่วยที่ซ่อนอยู่, งานตามคำสั่งที่มีตัวตรวจสอบรูปแบบ — พร้อมกับขั้นตอน “บูสเตอร์” สั้น ๆ สำหรับทักษะเฉพาะ เฉพาะโมเดล 8B และ 30B เท่านั้นที่ดำเนินต่อไปในบล็อกเอเย่นต์: สามขั้นที่โมเดลทำงานภายในสภาพแวดล้อมจริงและได้รับรางวัลตามว่าหน้าที่สำเร็จหรือไม่ ในขั้นตอนวิศวกรรมซอฟต์แวร์ที่ขับเคลื่อนโดย OpenHands harness โมเดลแก้ไขรีโพสิตอรีจริงและผ่านเฉพาะเมื่อชุดการทดสอบที่ซ่อนอยู่ผ่าน ขั้นตอนเทอร์มินัลจะโยนโมเดลเข้าสู่เชลล์สดพร้อมการหมุนสภาพแวดล้อมสูงสุด 64 ครั้งต่อการรัน ขั้นตอนการค้นหาจะให้โมเดลตอบคำถามหลายขั้นผ่านการเรียกค้นเว็บสด โดยให้คะแนนโดยผู้ตัดสิน LLM

จากนั้นโมเดลทุกตัวจะสรุปด้วย RLHF เพื่อปรับตามความชอบและความปลอดภัย ซึ่งยังใช้การลงโทษความยาวของการให้เหตุผลเพื่อไม่ให้เกิดสายโซ่ที่ยืดยาวจากขั้นตอนก่อนหน้า

การทำงานของโหมดการคิดที่สลับได้ในทางปฏิบัติ

แต่ละโมเดล Granite 4.2 เปิดเผยสามโหมดการทำงานผ่านเทมเพลตแชทของมัน โหมดการคิด (ค่าเริ่มต้น) สร้างสายการคิดเต็มรูปแบบภายในแท็กเฉพาะก่อนคำตอบสุดท้าย โหมดไม่คิดตอบโดยตรง การตั้งค่าต้นทุนต่ำอยู่ระหว่างสองโหมด โดยใช้งบประมาณการให้เหตุผลสั้น ๆ สำหรับคำถามง่าย ๆ ในการสนทนาหลายรอบ การคิดของรอบก่อนหน้าจะถูกลบออกโดยค่าเริ่มต้นเพื่อประหยัดบริบท

การเรียกใช้เครื่องมือแบบเนทีฟถูกฝังไว้ในเทมเพลตเดียวกัน: โมเดลให้เหตุผลว่าควรเรียกเครื่องมือใดและทำไมก่อนที่จะส่งคำเรียกในรูปแบบการเรียกฟังก์ชันของ OpenAI ทำให้สามารถเชื่อมต่อกับ harness เอเย่นต์ที่ให้บริการผ่าน vLLM หรือ SGLang โดยไม่ต้องใช้ตัวแปลงเพิ่มเติม ตาม คอลเลกชันโมเดล Granite 4.2 น้ำหนักทั้งสามรุ่นสามารถดาวน์โหลดได้สาธารณะ และ การ์ดโมเดล 30B ยืนยันว่าโมเดลหลักได้รับการฝึกต่อจากฐาน Granite 4.1 30B โมเดลเหล่านี้ได้รับการทดสอบใน 12 ภาษา รวมถึงอังกฤษ, เยอรมัน, ญี่ปุ่น, อาหรับ, เกาหลี, และจีน

ตัวเลขที่ IBM รายงาน

IBM ประเมินครอบครัวนี้ในด้านการเขียนโค้ดแบบเอเย่นต์, การใช้เครื่องมือทั่วไป, การให้เหตุผล, การแชท, และบริบทยาว โดยใช้กรอบงานที่สร้างบน NeMo Evaluator SDK คะแนนด้านล่างเป็นตัวเลขที่บริษัทรายงานเอง

  • SWE‑Bench Verified: 57.00 (30B), 47.67 (8B)
  • Terminal‑Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

รูปแบบนี้สอดคล้องกับการออกแบบการฝึก คะแนนเพิ่มขึ้นอย่างต่อเนื่องตามขนาดในด้านคณิตศาสตร์, วิทยาศาสตร์, และการให้เหตุผลของโค้ด, และเกณฑ์การเขียนโค้ดแบบเอเย่นต์ที่พึ่งพาบล็อก agentic‑RL เฉพาะของโมเดล 8B และ 30B แสดงช่องว่างที่กว้างที่สุดระหว่างขนาด โมเดล 3B ซึ่งไม่ทำขั้นตอนสภาพแวดล้อมใด ๆ ไม่ได้ถูกรายงานในชุด SWE‑Bench หรือ Terminal‑Bench เลย

การฝึกเอเย่นต์โดยไม่มีเครือข่ายค่า (Value Network)

กลไก RL คุ้มค่าที่จะพิจารณาอย่างใกล้ชิดเพราะเป็นส่วนที่มีวิศวกรรมของการเปิดตัวส่วนใหญ่ ทุกขั้นตอนฝึกด้วย GRPO แบบอะซิงโครนัส ซึ่งเป็นวิธีการปรับนโยบายแบบกลุ่ม‑สัมพันธ์ที่ให้คะแนนการตอบแต่ละอย่างเทียบกับค่าเฉลี่ยรางวัลของตัวอย่างอื่นที่ดึงมาสำหรับพรอมต์เดียวกัน ทำให้ไม่ต้องใช้เครือข่ายค่าแยกที่หลาย ๆ ระบบ RL ต้องการ การสร้างและการฝึกทำงานบนพูล GPU แยกกันที่ไม่บล็อกกันเลย: พนักงานทำการสุ่มเส้นทางลงในบัฟเฟอร์ร่วม, และผู้ฝึกสตรีมน้ำหนักที่อัปเดตกลับในระหว่างการรัน การป้องกันทำให้ตัวสร้างไม่ลอยออกไปเกินหนึ่งการอัปเดต, และการสุ่มสำคัญแบบตัดทอนจำกัดผลของโทเค็นที่ล้าสมัย

สภาพแวดล้อมเชื่อมต่อผ่าน NeMo‑Gym ซึ่งนำเสนอเครื่องตรวจสอบ, เครื่องมือ, และ sandbox ผ่านอินเทอร์เฟซเดียวกัน, ในขณะที่ NeMo‑RL ควบคุมลูปการฝึกบน Megatron‑Core ด้วยการสร้าง vLLM ผลลัพธ์เชิงปฏิบัติคือเครื่องตรวจสอบคณิตศาสตร์แบบกฎและ sandbox รีโพสิตอรีเต็มรูปแบบดูเหมือนกันกับลูปการฝึก ซึ่งทำให้หลักสูตรแบบขั้นตอนเป็นไปได้ IBM ฝึกโมเดลบนคลัสเตอร์ NVIDIA GB200 NVL72 ที่โฮสต์โดย CoreWeave, มีโดเมน NVLink 72‑GPU และโครงข่าย InfiniBand ความเร็ว 400 Gb/s

IBM ยังเผยแพร่วariant แบบควอนตาไซซ์ของครอบครัวนี้: FP8 ที่ไม่มีการปรับเทียบ, NVFP4 และ MXFP4 ที่ปรับเทียบบน 2,000 ตัวอย่างจากชุดข้อมูล SFT, และรูปแบบ GGUF สิบสี่แบบผ่าน llama.cpp สำหรับการปรับใช้ที่ใช้หน่วยความจำน้อยลง

ตำแหน่งของ Granite 4.2 ในสายผลิตภัณฑ์ของ IBM

การเปิดตัวนี้ต่อเนื่องจากการแบ่งงานอย่างตั้งใจในกลยุทธ์โมเดลเปิดของ IBM รุ่น Granite ก่อนหน้าตั้งตำแหน่งเป็นผู้ช่วยที่ทำตามคำสั่งได้อย่างแข็งแกร่ง; บริษัทได้ครอบคลุม Granite Speech 5.0 ซึ่งเปิดตัวในวันเดียวกัน, ในประกาศแยกต่างหาก ที่มุ่งเน้นความเร็วการถอดเสียง Granite 4.2 เป็นจุดเปลี่ยนของสายโมเดลภาษาไปสู่การให้เหตุผลอย่างชัดเจน และมาพร้อมสูตรการฝึกเต็มรูปแบบ, สัดส่วนการผสมข้อมูล, และไฮเปอร์พารามิเตอร์ของแต่ละขั้นที่เผยแพร่พร้อมกับน้ำหนัก

โมเดลทั้งสาม, รุ่นที่ควอนตาไซซ์, ที่เก็บ GitHub, และเอกสารทั้งหมดพร้อมให้ใช้ภายใต้ Apache 2.0, โดยโมเดล 30B รุ่นหลักออกแบบสำหรับโหนดให้บริการหลาย‑GPU เดียว, และรุ่น 3B มุ่งเน้นการปรับใช้ที่เบากว่าในกรณีที่สวิตช์การคิดยังคงใช้ได้

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย