โมเดลและแพลตฟอร์ม AI
H Company ปล่อย Holo4 โมเดลแบบเปิดน้ำหนักสำหรับเอเจนต์ใช้คอมพิวเตอร์

H company ปล่อย Holo4 ซีรีส์ใหม่ของโมเดลเอเจนต์ใช้คอมพิวเตอร์เมื่อวันที่ 28 กันยายน 2026 ในขนาด 27B แบบหนาแน่นและ 35B-A3B Mixture of Experts พร้อมน้ำหนักแบบเปิดบน Hugging Face และพร้อมใช้งานผ่าน API บริษัทรายงานว่าโมเดล 27B ได้คะแนน 85.2% บนเบนช์มาร์ค OSWorld ที่ค่าใช้จ่าย $0.08 ต่อภารกิจ
รายการโมเดลและการพร้อมใช้งาน
ตามที่บริษัทระบุ Holo4 โต้ตอบกับซอฟต์แวร์ผ่านอินเทอร์เฟซที่มีอยู่ทั้งหมด: อินเทอร์เฟซกราฟิกผู้ใช้, โค้ด, MCP และ API มันคลิกและพิมพ์บนหน้าจอ, เขียนและรันโค้ดของตนเอง, และเรียกใช้เครื่องมือ MCP หรือ API โดยเลือกวิธีที่เหมาะกับงาน โมเดลเดียวกันทำงานบนเดสก์ท็อป, บนเว็บ, บน Android, ใน sandbox โค้ดและต่อกับ API ของธุรกิจ, และถูกเรียกใช้ในลักษณะเดียวกันในทุกกรณีโดยไม่ต้องเลือกโมเดลที่แตกต่างสำหรับแต่ละแพลตฟอร์ม
ขนาดทั้งสองพร้อมใช้งานบน H Models API และน้ำหนักถูกเผยแพร่บน Hugging Face ในรูปแบบ BF16, FP8, NVFP4 และ 4-bit GGUF นอกจากนี้ Holo4 บริษัทยังเปิดตัว Holotron4 Nano รุ่นอัปเดตของ Holotron 3
Holo4-27B บัตรโมเดล ระบุว่าโมเดลเป็น โมเดลวิชัน-ภาษา ขนาด 27B พารามิเตอร์ที่สร้างบนสถาปัตยกรรม Qwen3.8 แบบหนาแน่น, มีความยาวบริบทสูงสุด 262,144 โทเคนและสภาพแวดล้อมเป้าหมายครอบคลุมเว็บ, เดสก์ท็อปและโมบาย. บัตรระบุว่าน้ำหนักพร้อมใช้งานภายใต้ใบอนุญาต CC BY-NC 4.0 ที่ไม่ใช่เชิงพาณิชย์และอธิบายการใช้ร่วมกับระบบ hai-agents ของบริษัท ซึ่งส่งภาพหน้าจอและผลลัพธ์ของเครื่องมือไปยังโมเดลและดำเนินการคลิก, พิมพ์, โค้ดและการเรียกใช้เครื่องมือตามที่ร้องขอ
บริษัท โพสต์ข่าวสาร รายการ Holo4-35B-A3B ภายใต้ Apache 2.0 ที่ $0.30 ต่อหนึ่งล้านโทเคนอินพุต, $0.03 ต่อหนึ่งล้านโทเคนแคชและ $2.00 ต่อหนึ่งล้านโทเคนเอาต์พุต, พร้อมบริบท 262K. รายการ Holo4-27B เป็นรุ่นวิจัยเท่านั้นที่ $0.40 อินพุต, $0.04 แคชและ $3.00 เอาต์พุตต่อหนึ่งล้านโทเคน, พร้อมบริบท 262K ด้วย
เบนช์มาร์คที่รายงานและค่าใช้จ่ายต่อภารกิจ
ตารางเบนช์มาร์คของบริษัทรายงานว่า Holo4 27B ได้คะแนน 85.2% บน OSWorld พร้อมค่าใช้จ่าย $0.08 ต่อภารกิจและ Holo4 35B-A3B ได้ 80.8% ที่ $0.05, เทียบกับ 84.3% ที่ $0.22 สำหรับ Qwen3.8 27B ซึ่งเป็นฐานของโมเดล 27B. คะแนนแนวหน้าที่ระบุบน OSWorld คือ 86.0% สำหรับ Fable 5, 78.7% สำหรับ GPT-5.5 และ 86.1% สำหรับ Qwen3.8 Max
บน OSWorld 2.0 ซึ่งครอบคลุมกระบวนการทำงานคอมพิวเตอร์ระยะยาว บริษัทรายงานว่า Holo4 27B ได้คะแนน 61.7% และอัตราความสำเร็จ 41.5% ที่ $1.22 ต่อภารกิจ, และ Holo4 35B-A3B ได้ 30.9% ที่ $0.61. ตารางระบุ Opus 5.5 ที่ 81.8% และ $8.48 ต่อภารกิจ, GPT-6 Astra ที่ 73.5% และ $9.07, และ Qwen3.8 27B ที่ 48.0% และ $3.49. บริษัทกล่าวว่า Holo4 อยู่หลังโมเดลปิดที่แข็งแกร่งที่สุดเท่านั้นในกระบวนการทำงานระยะยาว, และทำเช่นนั้นด้วยจำนวนพารามิเตอร์ที่น้อยกว่ามากและต้นทุนที่ต่ำกว่ามาก
บน AutomationBench ซึ่งเป็นเบนช์มาร์คการทำงานอัตโนมัติทางธุรกิจ, คะแนนที่รายงานคือ 45.4% ที่ $0.05 ต่อภารกิจสำหรับ Holo4 27B และ 34.5% ที่ $0.02 สำหรับ 35B-A3B. บริษัทระบุว่า 480 จาก 600 งานในชุดสาธารณะ v1.0.6 อยู่ในส่วนที่ใช้เก็บข้อมูลการฝึก; ใน 120 งานที่ไม่ได้ใช้ฝึก, บริษัทรายงาน 49.3% สำหรับโมเดล 27B และ 31.7% สำหรับโมเดล MoE. บริษัทกล่าวว่าจะรายงานผลชุดส่วนตัวเมื่อ Holo4 ได้รับการประเมินบนชุดส่วนตัวอย่างเป็นทางการ
ตารางยังรายงานคะแนน 44.1% สำหรับโมเดล 27B และ 30.9% สำหรับ MoE บน ALE-CLI ซึ่งเป็นส่วนแยกของ Linux 105 งานจากเบนช์มาร์ค Agents’ Last Exam, และคะแนน AndroidWorld ที่ 85.1% และ 77.6%. ในงานประเมินภายในของ Agentic Task Factory ที่บริษัทระบุว่าไม่ได้ใช้ในการฝึก, โมเดล 27B ได้คะแนน 80.2% ในงานเว็บ, 89.4% ใน MCP และ 72.0% ในเดสก์ท็อป
บริษัทระบุว่าตัวเลขของ Holo4 มาจากระบบของบริษัทเอง, เป็นค่าเฉลี่ยจากการรันสองถึงสี่ครั้งพร้อมการรันเดียวบน OSWorld 2.0 และ ALE-CLI, ในขณะที่คะแนนเปรียบเทียบมาจากบัตรโมเดล, กระดานผู้นำอย่างเป็นทางการและแผนภูมิของผู้ให้บริการที่ใช้ระบบและระดับความพยายามที่แตกต่างกัน. บริษัทได้เปิดซอร์สโค้ดทุกเส้นทางที่อยู่เบื้องหลังคะแนนเบนช์มาร์คสาธารณะของตน, สามารถเล่นซ้ำผ่านตัวดูเฉพาะและดาวน์โหลดเป็นชุดข้อมูลบน Hugging Face
กระบวนการฝึก, Holotron4 Nano และขั้นตอนต่อไป
Holo4 ได้รับการฝึกผ่านการปรับแต่งละเอียดแบบกำกับและการเรียนรู้เสริมบนสภาพแวดล้อมและงานต่าง ๆ รวมถึงงานที่สร้างโดย Agentic Task Factory ของบริษัท, ซึ่งเป็นชุด pipeline ภายในที่สร้างสภาพแวดล้อมเชิงโต้ตอบและงานที่ตรวจสอบได้จากเอกสารเพียงอย่างเดียว, เช่น ภาพหน้าจอของเว็บไซต์จริงหรือซอฟต์แวร์โอเพ่นซอร์ส. บริษัทกล่าวว่าโรงงานนี้ได้สร้างงานประมาณ 10,000 งานจนถึงตอนนี้, ประมาณ 4,000 งานสำหรับแอปเว็บและประมาณ 3,000 งานสำหรับเซิร์ฟเวอร์ MCP และสภาพแวดล้อมเดสก์ท็อป, รวมถึงสภาพแวดล้อมไฮบริดที่เปิดเผยสถานะเดียวกันผ่าน GUI และ MCP
การปรับแต่งละเอียดแบบกำกับใช้โทเคน 127 พันล้านโทเคน, ประมาณสามในสี่เป็นเส้นทางเอเจนต์ที่สำเร็จและแบ่งตามเดสก์ท็อป (45%), เว็บ (14%), MCP และ API (12%) และโมบาย (3%), ส่วนที่เหลือครอบคลุมการให้เหตุผลแบบหลายโหมด, การยึดพื้นฐาน GUI และการใช้เครื่องมือแบบข้อความเท่านั้นรวมถึงการเขียนโค้ด. การเรียนรู้เสริมแบบออนไลน์แบบอะซิงโครนัสบนงานระยะยาวจากนั้นฝึกผู้เชี่ยวชาญ LoRA สองแบบ, หนึ่งสำหรับเดสก์ท็อปและเว็บและอีกหนึ่งสำหรับเทอร์มินัล, MCP และ API, ซึ่งถูกผสานกลับเข้าสู่โมเดลที่ปรับแต่งแล้วด้วยน้ำหนักเท่ากันและไม่มีการฝึกเพิ่มเติม
บริษัทได้สร้างโครงสร้างใหม่อีกครั้ง ซึ่งเป็นลูปที่ทำการดำเนินการของโมเดลและจัดการบริบทของมันตลอดหลายร้อยขั้นตอน โดยใช้ข้อมูลย้อนกลับจากประสิทธิภาพของเอเจนต์ใน OSWorld 2.0 ในกระบวนการนั้น เอเจนต์ได้ทำเครื่องหมายเหตุผลที่แต่ละงานล้มเหลวและวิศวกรได้ตรวจสอบการแก้ไขของพวกเขา; การเปลี่ยนแปลงที่ใหญ่ที่สุดคือหน่วยความจำที่เชื่อถือได้ซึ่งสามารถติดตามหลายร้อยขั้นตอนได้และเชลล์บนเครื่องเดสก์ท็อปเอง
ในฐานะสมาชิกของ NVIDIA Nemotron Coalition บริษัท H ได้นำสแต็กหลังการฝึกเดียวกันไปใช้กับ Nemotron 3 Nano Omni เพื่อผลิต Holotron4 Nano บริษัทรายงานการเพิ่มขึ้นเป็นจุดเปอร์เซ็นต์เต็มเหนือโมเดลฐานบนห้าเกณฑ์วัดผล: OSWorld จาก 21.0 ไปเป็น 76.3, OSWorld 2.0 จาก 0.2 ไปเป็น 7.9, AutomationBench จาก 19.4 ไปเป็น 35.6, PinchBench จาก 84.7 ไปเป็น 88.6 และ ALE Linux จาก 0.6 ไปเป็น 8.5 บริษัทกล่าวว่าการเพิ่มขึ้นเหล่านี้แสดงให้เห็นว่ากระบวนการของพวกเขาสามารถถ่ายโอนไปยังโมเดลพื้นฐานต่าง ๆ ได้และไม่ได้จำกัดขนาด
บริษัทกล่าวว่าจะปล่อยจุดตรวจสอบ DSpark drafter ที่ปรับแต่งให้เหมาะสมในหลายวันต่อจากการประกาศเพื่อเร่งความเร็วการสรุปผลต่อไป












