Model dan platform AI

Model Granite 4.2 IBM Belajar Berpikir dan Bertindak di Dalam Lingkungan

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

IBM telah merilis Granite 4.2, keluarga pertama model bahasa penalaran berbasis decoder‑only yang padat, dalam tiga ukuran: 3B, 8B, dan 30B parameter. Diumumkan pada 25 Agustus 2026 dengan bobot yang dipublikasikan di bawah lisensi Apache 2.0, rilis ini memberikan setiap model Granite mode berpikir yang dapat diaktifkan dan mengirimkan dua ukuran yang lebih besar melalui pembelajaran penguatan di dalam lingkungan rekayasa perangkat lunak, terminal, dan pencarian web yang nyata.

Dalam panduan teknis tentang pembangunan, Tim Granite di IBM menjelaskan sebuah pipeline yang dimulai dengan pra‑pelatihan dari nol pada kira‑kira 15 triliun token, dengan jadwal lima fase yang memperluas jendela konteks hingga 512K token. Penyempurnaan terawasi dilakukan pada sekitar 7,2 juta contoh data rantai‑pemikiran, penalaran, dan lintasan‑agen. Namun, inti rilis ini terletak pada apa yang terjadi setelah: pipeline pembelajaran penguatan multi‑tahap di mana setiap tahap merupakan pelatihan terpisah yang menargetkan satu kemampuan, dimulai dengan bobot dari checkpoint tahap sebelumnya.

Ketiga ukuran menjalankan RL dasar pada hadiah yang dapat diverifikasi — masalah matematika dengan jawaban yang dapat dicek, kode yang dinilai oleh tes unit tersembunyi, tugas mengikuti instruksi dengan pemeriksa format — serta tahap “booster” singkat untuk keterampilan khusus. Hanya model 8B dan 30B yang melanjutkan ke blok agen: tiga tahap di mana model beraksi di dalam lingkungan nyata dan diberi hadiah berdasarkan apakah tugas benar‑benar diselesaikan. Pada tahap rekayasa perangkat lunak, dipandu oleh harness OpenHands, model mengedit repositori nyata dan hanya lulus jika rangkaian tes tersembunyi berhasil. Tahap terminal menempatkannya dalam shell langsung dengan hingga 64 giliran lingkungan per rollout. Tahap pencarian membuatnya menjawab pertanyaan multi‑hop melalui panggilan pencarian web langsung, yang dinilai oleh juri LLM.

Setiap model kemudian selesai dengan RLHF untuk preferensi dan keamanan, yang juga menerapkan penalti panjang penalaran untuk mengurangi rantai bertele‑tele yang dapat dihasilkan pada tahap‑tahap sebelumnya.

Bagaimana Pemikiran yang Dapat Diaktifkan Tampak dalam Praktik

Setiap model Granite 4.2 menampilkan tiga mode operasi melalui templat obrolannya. Mode berpikir, yang menjadi default, menghasilkan rangkaian pemikiran lengkap di dalam tag khusus sebelum jawaban akhir. Mode non‑berpikir menjawab secara langsung. Pengaturan upaya rendah berada di antara keduanya, menghabiskan anggaran penalaran singkat untuk pertanyaan mudah. Pada percakapan ber‑banyak giliran, pemikiran dari giliran sebelumnya secara default dihapus untuk menghemat konteks.

Pemanggilan alat native dibangun ke dalam templat yang sama: model menilai alat mana yang harus dipanggil dan mengapa sebelum mengeluarkan panggilan, dalam format pemanggilan fungsi OpenAI, sehingga dapat terhubung ke harness agen yang dijalankan melalui vLLM atau SGLang tanpa adaptor tambahan. Menurut koleksi model Granite 4.2, ketiga bobot dapat diunduh secara publik, dan kartu model 30B mengonfirmasi bahwa flagship tersebut dilatih lanjutan dari basis Granite 4.1 30B. Model‑model tersebut diuji dalam 12 bahasa, termasuk Inggris, Jerman, Jepang, Arab, Korea, dan Cina.

Angka‑Angka yang Dilaporkan IBM

IBM mengevaluasi keluarga model ini dalam bidang pengkodean agen, penggunaan alat umum, penalaran, obrolan, dan konteks panjang, menggunakan kerangka kerja yang dibangun di atas NeMo Evaluator SDK. Skor di bawah ini merupakan angka yang dilaporkan oleh perusahaan sendiri.

  • SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Pola ini sesuai dengan desain pelatihan. Skor meningkat secara konsisten seiring ukuran pada matematika, sains, dan penalaran kode, dan benchmark pengkodean agen yang bergantung pada blok RL‑agen eksklusif model 8B dan 30B menunjukkan kesenjangan terbesar antar ukuran. Model 3B, yang tidak menjalankan tahap lingkungan apa pun, tidak dilaporkan pada suite SWE‑Bench atau Terminal‑Bench sama sekali.

Melatih Agen Tanpa Jaringan Nilai

Mekanisme RL patut diteliti lebih dalam karena di sinilah sebagian besar rekayasa rilis berada. Setiap tahap dilatih dengan GRPO asinkron, metode optimasi kebijakan relatif grup yang menilai setiap respons terhadap rata‑rata hadiah dari sampel lain yang diambil untuk prompt yang sama, menghilangkan kebutuhan jaringan nilai terpisah yang dibutuhkan banyak pipeline RL. Generasi dan pelatihan berjalan pada kumpulan GPU terpisah yang tidak pernah saling menghalangi: pekerja terus mengambil sampel lintasan ke dalam buffer bersama, dan pelatih mengalirkan bobot yang diperbarui kembali di tengah rollout. Penahan (guardrail) mencegah generator melenceng lebih dari satu pembaruan, dan pentingnya sampling terpotong membatasi efek token usang.

Lingkungan terhubung melalui NeMo‑Gym, yang menyajikan verifikator, alat, dan sandbox di balik antarmuka seragam, sementara NeMo‑RL menggerakkan loop pelatihan pada Megatron‑Core dengan generasi vLLM. Konsekuensi praktisnya adalah pemeriksa matematika berbasis aturan dan sandbox repositori penuh tampak identik bagi loop pelatihan, yang memungkinkan kurikulum ber‑tahap dapat dijalankan. IBM melatih model‑model tersebut pada klaster NVIDIA GB200 NVL72 yang dihosting oleh CoreWeave, dengan domain NVLink 72‑GPU dan fabric InfiniBand 400 Gb/s.

IBM juga merilis varian terkuantisasi dari keluarga tersebut: FP8 tanpa kalibrasi, NVFP4 dan MXFP4 yang dikalibrasi pada 2.000 sampel dari dataset SFT, serta empat belas format GGUF melalui llama.cpp untuk penyebaran dengan memori yang lebih rendah.

Di Mana Granite 4.2 Menempatkan Diri dalam Jalur IBM

Rilis ini melanjutkan pembagian kerja yang disengaja dalam strategi model terbuka IBM. Generasi Granite sebelumnya diposisikan sebagai asisten yang kuat dalam mengikuti instruksi; perusahaan juga meluncurkan Granite Speech 5.0 pada hari yang sama, dalam pengumuman terpisah yang berfokus pada kecepatan transkripsi. Granite 4.2 merupakan giliran lini model bahasa untuk penalaran eksplisit, dan hadir dengan resep pelatihan lengkap, proporsi campuran data, serta hiperparameter per‑tahap yang dipublikasikan bersama bobotnya.

Ketiga model, varian terkuantisasi, repositori GitHub, dan dokumentasi tersedia di bawah lisensi Apache 2.0, dengan model flagship 30B berukuran untuk satu node layanan multi‑GPU dan model 3B ditujukan untuk penyebaran yang lebih ringan di mana saklar berpikir masih berlaku.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.