Mô hình và nền tảng AI

Các mô hình Granite 4.2 của IBM học cách suy nghĩ và hành động trong môi trường

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

IBM đã ra mắt Granite 4.2, dòng mô hình ngôn ngữ suy luận chỉ có bộ giải mã dày đặc đầu tiên của mình, với ba kích thước: 3B, 8B và 30B tham số. Được công bố vào ngày 25 tháng 8 năm 2026 với trọng số được phát hành theo giấy phép Apache 2.0, bản phát hành này cung cấp cho mọi mô hình Granite một chế độ suy nghĩ có thể chuyển đổi và đưa hai kích thước lớn hơn qua quá trình học tăng cường trong các môi trường thực tế về kỹ thuật phần mềm, terminal và tìm kiếm web.

Trong một hướng dẫn kỹ thuật về quá trình xây dựng, Nhóm Granite tại IBM mô tả một quy trình bắt đầu bằng việc tiền huấn luyện từ đầu trên khoảng 15 nghìn tỷ token, với lịch trình năm giai đoạn mở rộng cửa sổ ngữ cảnh lên 512K token. Sau đó là việc tinh chỉnh có giám sát trên khoảng 7,2 triệu mẫu dữ liệu chuỗi suy nghĩ, lập luận và quỹ đạo đại lý. Tuy nhiên, trọng tâm của bản phát hành là những gì tiếp theo: một quy trình học tăng cường đa giai đoạn, trong đó mỗi giai đoạn là một lần huấn luyện riêng biệt nhằm vào một khả năng, khởi động lại từ checkpoint của giai đoạn trước.

Cả ba kích thước đều thực hiện RL nền tảng dựa trên các phần thưởng có thể xác minh — các bài toán toán học có đáp án kiểm tra được, mã nguồn được chấm bởi các bài kiểm tra đơn vị ẩn, các nhiệm vụ tuân theo hướng dẫn với bộ kiểm tra định dạng — cùng với các giai đoạn “tăng tốc” ngắn cho các kỹ năng cụ thể. Chỉ các mô hình 8B và 30B mới tiếp tục vào khối đại lý: ba giai đoạn mà mô hình hoạt động trong môi trường thực và được thưởng dựa trên việc nhiệm vụ có thực sự được giải quyết hay không. Trong giai đoạn kỹ thuật phần mềm, được điều khiển bởi bộ công cụ OpenHands, mô hình chỉnh sửa các kho lưu trữ thực và chỉ vượt qua nếu bộ kiểm tra ẩn thành công. Giai đoạn terminal đưa mô hình vào một shell trực tiếp với tối đa 64 lượt môi trường cho mỗi rollout. Giai đoạn tìm kiếm khiến nó trả lời các câu hỏi đa bước thông qua các cuộc gọi tìm kiếm web trực tiếp, được chấm điểm bởi một trọng tài LLM.

Sau đó, mỗi mô hình kết thúc bằng RLHF để tối ưu sở thích và an toàn, đồng thời áp dụng hình phạt độ dài suy luận nhằm ngăn chặn các chuỗi dài dòng mà các giai đoạn trước có thể tạo ra.

Cách thức Chế độ Suy nghĩ có thể Chuyển đổi Hoạt động trong Thực tiễn

Mỗi mô hình Granite 4.2 cung cấp ba chế độ hoạt động thông qua mẫu chat của nó. Chế độ suy nghĩ, mặc định, tạo ra một chuỗi suy nghĩ đầy đủ trong các thẻ riêng biệt trước câu trả lời cuối cùng. Chế độ không suy nghĩ trả lời trực tiếp. Cài đặt ít nỗ lực nằm giữa hai chế độ, dành một ngân sách suy luận ngắn cho các câu hỏi dễ. Trong các cuộc trò chuyện đa lượt, suy nghĩ của các lượt trước sẽ bị loại bỏ mặc định để tiết kiệm ngữ cảnh.

Gọi công cụ nội địa được tích hợp trong cùng mẫu: mô hình suy luận về công cụ nào cần gọi và lý do trước khi phát ra lời gọi, theo định dạng gọi hàm của OpenAI, do đó nó có thể kết nối với các khung đại lý được cung cấp qua vLLM hoặc SGLang mà không cần bộ chuyển đổi thêm. Theo bộ sưu tập mô hình Granite 4.2, cả ba trọng số đều có thể tải xuống công khai, và thẻ mô hình 30B xác nhận rằng phiên bản flagship đã được huấn luyện tiếp từ nền tảng Granite 4.1 30B. Các mô hình đã được kiểm thử trên 12 ngôn ngữ, bao gồm tiếng Anh, tiếng Đức, tiếng Nhật, tiếng Ả Rập, tiếng Hàn và tiếng Trung.

Các Con Số IBM Báo Cáo

IBM đã đánh giá dòng sản phẩm này trên các tiêu chí mã hóa đại lý, sử dụng công cụ chung, suy luận, trò chuyện và ngữ cảnh dài, sử dụng một khung được xây dựng trên NeMo Evaluator SDK. Các điểm số dưới đây là số liệu do công ty tự báo cáo.

  • SWE-Bench Xác Thực: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 toán: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA khoa học: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER ngữ cảnh dài tại 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Mô hình này phù hợp với thiết kế đào tạo. Các điểm số tăng đều đặn theo kích thước trong các lĩnh vực toán học, khoa học và lập luận mã, và các chuẩn đoán mã hóa đại lý phụ thuộc vào khối RL đại lý độc quyền của các mô hình 8B và 30B cho thấy khoảng cách lớn nhất giữa các kích thước. Mô hình 3B, không chạy bất kỳ giai đoạn môi trường nào, hoàn toàn không được báo cáo trong các bộ SWE-Bench hoặc Terminal-Bench.

Đào tạo Đại lý mà Không Cần Mạng Giá Trị

Cơ chế RL đáng để xem xét kỹ hơn vì nó là nơi chứa phần lớn công việc kỹ thuật của bản phát hành. Mỗi giai đoạn được huấn luyện bằng GRPO bất đồng bộ, một phương pháp tối ưu chính sách tương đối nhóm, đánh giá mỗi phản hồi dựa trên phần thưởng trung bình của các mẫu khác được rút ra cho cùng một lời nhắc, loại bỏ nhu cầu về mạng giá trị riêng biệt mà nhiều quy trình RL yêu cầu. Quá trình sinh và huấn luyện chạy trên các cụm GPU riêng biệt, không bao giờ chặn lẫn nhau: các worker liên tục lấy mẫu quỹ đạo vào bộ đệm chung, và trainer truyền trọng số cập nhật trở lại giữa quá trình rollout. Một rào chắn ngăn các bộ sinh lệch quá một lần cập nhật, và việc lấy mẫu quan trọng cắt ngắn hạn chế ảnh hưởng của các token lỗi thời.

Các môi trường được kết nối qua NeMo-Gym, cung cấp các bộ kiểm tra, công cụ và sandbox qua một giao diện đồng nhất, trong khi NeMo-RL điều khiển vòng lặp huấn luyện trên Megatron-Core với sinh vLLM. Hệ quả thực tế là một công cụ kiểm tra toán học dựa trên quy tắc và một sandbox kho lưu trữ đầy đủ trông giống hệt vòng lặp huấn luyện, điều này làm cho chương trình giảng dạy theo giai đoạn khả thi. IBM đã huấn luyện các mô hình trên một cụm NVIDIA GB200 NVL72 do CoreWeave cung cấp, với miền NVLink 72 GPU và mạng InfiniBand tốc độ 400 Gb/s.

IBM cũng đã phát hành các biến thể lượng tử của dòng sản phẩm: FP8 không hiệu chuẩn, NVFP4 và MXFP4 được hiệu chuẩn trên 2.000 mẫu từ bộ dữ liệu SFT, và mười bốn định dạng GGUF thông qua llama.cpp để triển khai với bộ nhớ giảm.

Vị Trí của Granite 4.2 trong Dòng Sản Phẩm của IBM

Bản phát hành này tiếp tục sự phân công công việc có chủ đích trong chiến lược mô hình mở của IBM. Các thế hệ Granite trước đây được định vị như những trợ lý tuân thủ hướng dẫn mạnh mẽ; công ty đã giới thiệu Granite Speech 5.0, ra mắt cùng ngày, trong một thông báo riêng tập trung vào tốc độ chuyển đổi giọng nói. Granite 4.2 là giai đoạn của dòng mô hình ngôn ngữ dành cho suy luận rõ ràng, và nó đi kèm với công thức đào tạo đầy đủ, tỷ lệ hỗn hợp dữ liệu và siêu tham số từng giai đoạn được công bố cùng với trọng số.

Cả ba mô hình, các biến thể lượng tử, kho GitHub và tài liệu đều có sẵn theo giấy phép Apache 2.0, với phiên bản flagship 30B được thiết kế cho một nút phục vụ đa GPU duy nhất và phiên bản 3B hướng tới các triển khai nhẹ hơn, nơi chế độ suy nghĩ vẫn được áp dụng.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.