Model dan platform AI
Kecerdasan Bergerigi: Mengapa AI Mengalahkan Masalah Olimpiade tapi Mengalami Kegagalan dalam Matematika Sekolah
Komunitas kecerdasan buatan merayakan tonggak penting pada tahun 2025 ketika baik Google DeepMind (GOOGL ) dan sistem OpenAI mencapai penampilan medali emas di Olimpiade Matematika Internasional. Model AI ini memecahkan masalah yang hanya dapat dipecahkan oleh sejumlah kecil matematikawan muda terbaik di dunia. Namun, sistem yang sama sering kali gagal ketika diminta untuk melakukan aritmatika dasar yang dapat dilakukan oleh siswa sekolah menengah dengan mudah. Paradoks yang mencolok ini mengungkapkan sesuatu yang mendasar tentang sifat kecerdasan buatan saat ini. Kami menyaksikan munculnya apa yang hanya dapat disebut kecerdasan bergerigi, di mana mesin menampilkan kemampuan super yang luar biasa dalam domain tertentu sementara gagal dalam tugas yang kita anggap elementer.
Kemenangan Olimpiade
Olimpiade Matematika Internasional adalah standar utama dalam kompetisi matematika pra-universitas. Setiap tahun, matematikawan muda terbaik dari seluruh dunia menghadapi enam masalah yang memerlukan wawasan mendalam, pemikiran kreatif, dan teknik pembuktian tingkat tinggi. Pada tahun 2025, sistem AI dari Google DeepMind dan OpenAI mencetak 35 dari 42 poin, cukup untuk mendapatkan medali emas. AlphaGeometry 2 DeepMind memecahkan masalah geometri kompleks dalam waktu 19 detik, sementara AlphaProof memecahkan masalah dalam teori bilangan dan aljabar yang mengalahkan sebagian besar peserta manusia.
Prestasi ini membangun pada kemajuan inkremental selama bertahun-tahun. Sistem ini menggunakan bahasa matematika formal seperti Lean untuk membangun pembuktian yang ketat. Mereka menggunakan teknik seperti pembelajaran kurikulum, di mana AI dilatih pada masalah dengan tingkat kesulitan yang meningkat. Pelatihan ini memungkinkan AI untuk memahami hubungan kompleks antara objek matematika, mengenali pola halus, dan membangun pembuktian yang elegan.
Perjuangan Elementer
Sistem AI yang sama yang mencapai emas dalam masalah Olimpiade sering kali gagal dalam tugas yang tampak sepele. Misalnya, jika Anda meminta mereka untuk mengalikan angka besar, mereka mungkin dengan percaya diri menghasilkan jawaban yang salah. Demikian pula, jika Anda mencoba melakukan operasi aritmatika dasar lainnya, kinerja mereka menjadi tidak dapat diprediksi. Masalah ini tidak terbatas pada perhitungan sederhana. Sistem ini sering kali berjuang dengan masalah kata yang memerlukan pelacakan kuantitas multiple, memahami konteks dunia nyata, atau menerapkan operasi matematika dasar secara berurutan.
Kelemahan ini pada dasarnya berasal dari cara kerja model AI ini. Model bahasa besar memprediksi apa teks yang harus datang berikutnya berdasarkan pola yang mereka lihat dalam data pelatihan. Ketika mereka menghadapi “2 + 2”, mereka mengenali pola ini dan memprediksi “4” dengan benar, bukan karena mereka memahami penambahan, tetapi karena urutan ini muncul tak terhitung kali dalam data pelatihan mereka. Ketika Anda mempresentasikan mereka dengan perhitungan yang tidak biasa yang jarang muncul dalam teks, kinerja mereka memburuk dengan cepat. Mereka pada dasarnya adalah mesin pencocokan pola yang unggul ketika pola jelas dan konsisten tetapi berjuang ketika dipaksa untuk menghitung masalah yang tidak terlihat.
Paradoks Arsitektur
Kontradiksi antara keberhasilan Olimpiade dan kegagalan aritmatika mengungkapkan masalah arsitektur yang lebih dalam. Sistem AI modern unggul dalam memecahkan masalah yang dapat diselesaikan melalui pengenalan pola, deduksi logis, dan pencarian sistematis melalui ruang solusi. Masalah Olimpiade, meskipun kesulitannya, sering memiliki struktur yang elegan yang dapat dieksploitasi AI. Sistem ini dapat menjelajahi strategi pembuktian yang berbeda, memverifikasi langkah logis, dan membangun kerangka matematika yang mapan. Mereka beroperasi dalam dunia simbol dan aturan di mana konsistensi dan logika mendominasi.
Di sisi lain, aritmatika dasar, secara paradoks, menimbulkan tantangan yang berbeda. Ini memerlukan manipulasi kuantitas yang tepat, bukan pencocokan pola. Ini menuntut pemahaman tentang besaran numerik dan hubungan yang tidak dapat diperkirakan. Ketika sistem AI mendekati aritmatika melalui pemodelan bahasa, mereka memperlakukan angka sebagai token yang diprediksi daripada kuantitas yang dihitung. Ketidakcocokan fundamental antara persyaratan tugas dan arsitektur model ini menciptakan kesenjangan kinerja yang kita amati.
Data Pelatihan dan Keterbatasannya
Kemampuan AI sangat bergantung pada kualitas dan sifat data pelatihan. Bukti matematika dan masalah lanjutan sering muncul dalam format yang terstruktur dengan baik secara online. Makalah akademis, buku teks, dan sumber daya pendidikan menyediakan contoh yang jelas tentang penalaran matematika. Internet berisi diskusi luas tentang konsep matematika, teknik pembuktian, dan strategi pemecahan masalah. Korpus kaya ini memungkinkan sistem AI untuk mempelajari pemikiran matematika lanjutan.
Namun, matematika elementer menghadapi masalah yang berbeda. Meskipun aritmatika dasar muncul secara online, jarang disertai dengan rantai penalaran yang rinci yang membantu AI memahami proses yang mendasarinya. Perhitungan sederhana dinyatakan sebagai fakta daripada dijelaskan sebagai prosedur. Data pelatihan berisi hasil komputasi tetapi tidak proses komputasi itu sendiri. Ini menciptakan kesenjangan pemahaman yang mendasar yang manifestasikan sebagai kinerja yang buruk pada tugas dasar.
Implikasi untuk Pengembangan AI
Pola kecerdasan yang tidak merata ini memiliki implikasi penting bagi cara kita merancang dan menggunakan sistem AI. Kita tidak dapat menganggap bahwa keberhasilan dalam tugas kompleks berarti kompetensi dalam tugas yang lebih sederhana. AI yang mampu membuktikan teorema matematika mungkin gagal dalam menghitung gaji. Sistem yang dapat menulis kode komputer mungkin berjuang dengan penghitungan dasar. Kenyataan ini menuntut pertimbangan yang cermat tentang kemampuan dan keterbatasan AI dalam aplikasi dunia nyata.
Fenomena ini juga mengungkapkan pentingnya pendekatan hibrida. Alih-alih mengharapkan satu model untuk menangani setiap tugas, kita mungkin memerlukan sistem khusus untuk jenis tugas yang berbeda. Misalnya, menggabungkan komputasi simbolik untuk aritmatika dengan model bahasa untuk penalaran dapat menciptakan solusi yang lebih dapat diandalkan. Masa depan AI mungkin terletak pada koordinasi sistem khusus yang beragam daripada mengejar kecerdasan umum monolitik.
Jalan Menuju Masa Depan
Mengenali kecerdasan bergerigi memberikan arah yang lebih jelas untuk membangun sistem AI yang lebih mampu. Peneliti sedang mengembangkan metode untuk mengintegrasikan alat komputasi ke dalam model bahasa, memungkinkan mereka untuk mendelegasikan aritmatika ke kalkulator. Strategi pelatihan baru fokus pada mengajarkan model kapan harus menggunakan alat eksternal daripada mencoba menginternalisasi setiap keterampilan. Pendekatan ini mencerminkan kecerdasan manusia, di mana kita mengandalkan kalkulator untuk komputasi dan menyimpan upaya mental kita untuk penalaran tingkat tinggi.
Paradoks kecerdasan bergerigi pada akhirnya mengajarkan kita kerendahan hati tentang kecerdasan buatan. Sistem ini tidak superior secara universal atau terbatas secara seragam. Sebaliknya, mereka menampilkan campuran kompleks kekuatan dan kelemahan yang harus kita sadari untuk menggunakan dan meningkatkan kemampuan AI secara efektif. Kesuksesan memerlukan tidak hanya memperluas apa yang dapat dilakukan AI tetapi juga mengatasi kesenjangan fundamentalnya. Mesin yang dapat membuktikan teorema tetapi gagal dalam penambahan dasar menunjukkan bahwa kecerdasan, baik buatan atau manusia, tetap merupakan fenomena yang multifaset yang tidak mudah didefinisikan.
Ringkasan
Keberhasilan AI dalam memecahkan masalah Olimpiade tetapi kegagalan dalam matematika sederhana menunjukkan bahwa kecerdasan tidak berkembang secara merata. Sistem ini dapat brilian dalam satu area dan lemah dalam area lain. Memahami pola yang tidak merata ini penting untuk cara kita merancang dan menggunakan AI. Alih-alih mengharapkan satu model untuk melakukan segalanya, kita mungkin perlu menggabungkan pendekatan yang berbeda yang memanfaatkan kekuatan setiap sistem. Kemajuan yang sebenarnya akan datang dari membangun AI yang bekerja secara andal dalam praktek, bukan dari menganggap bahwa itu akan baik dalam setiap tugas.












