Dasar-dasar AI

Unit Pengolahan Neural (NPU): Penggerak di Balik AI dan Komputasi Generasi Berikutnya

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Sebagaimana GPU pernah mengungguli CPU untuk pekerjaan AI, Unit Pengolahan Neural (NPU) siap untuk menantang GPU dengan memberikan kinerja yang lebih cepat dan efisien—terutama untuk AI generatif, di mana pemrosesan waktu nyata harus terjadi dengan kecepatan kilat dan biaya yang lebih rendah.

Pertanyaannya adalah bagaimana NPU bekerja, dan mengapa mereka mengungguli pendahulu GPU mereka untuk tugas AI modern, dan apa yang membuat mereka tak tergantikan untuk segala sesuatu dari infrastruktur data center yang kuat hingga perangkat konsumen sehari-hari? Apakah Anda merencanakan penerapan AI besar berikutnya atau hanya ingin tahu tentang teknologi terbaru, penting untuk memahami mengapa NPU bisa menjadi terobosan yang mendefinisikan kembali AI—dan generasi komputasi berikutnya.

Apa itu Unit Pengolahan Neural (NPU)?

Unit Pengolahan Neural (NPU) adalah mikroprosesor khusus yang dibangun dari awal untuk menangani persyaratan unik dari pekerjaan AI dan mesin pembelajaran modern. Sementara Unit Pemrosesan Pusat (CPU) dan Unit Pengolahan Grafis (GPU) secara historis menggerakkan tugas komputasi tradisional dan rendering grafis, mereka tidak dirancang untuk menangani intensitas komputasi dari jaringan saraf dalam. NPU mengisi kesenjangan ini dengan fokus khusus pada operasi paralel, seperti perkalian matriks dan matematika tensor—dasar dari model AI.

Aspek kunci yang membedakan NPU dari CPU dan GPU umum termasuk:

  • Aritmatika AI yang Dioptimalkan: NPU umumnya menggunakan tipe data presisi rendah (misalnya, matematika integer 8-bit, atau bahkan lebih rendah) untuk menyeimbangkan daya pengolahan dan efisiensi energi, sementara CPU dan GPU biasanya mengandalkan perhitungan titik mengambang presisi tinggi.
  • Arsitektur Paralel: NPU dapat membagi tugas AI menjadi ribuan (atau bahkan jutaan) komputasi kecil yang berjalan secara paralel, meningkatkan throughput secara dramatis.
  • Efisiensi Energi: Dengan menghilangkan instruksi yang tidak perlu dan mengoptimalkan khusus untuk tugas jaringan saraf, NPU dapat mencapai kinerja yang lebih tinggi pada daya yang lebih rendah dibandingkan dengan GPU atau CPU yang melakukan pekerjaan AI yang sama.

Juga dikenal sebagai penguat AI, NPU sering muncul sebagai perangkat keras terpisah yang dilampirkan ke papan induk server, atau sebagai bagian dari sistem pada chip (SoC) di smartphone, laptop, atau perangkat tepi.

Mengapa NPU Penting untuk AI Generatif

Ledakan AI generatif—yang mencakup model bahasa besar (LLM) seperti ChatGPT, alat generasi gambar seperti DALL·E, dan model sintesis video—membutuhkan platform komputasi yang dapat menangani sejumlah besar data, memprosesnya secara real-time, dan belajar dari data tersebut dengan efisien. Prosesor tradisional dapat kesulitan memenuhi persyaratan ini, menyebabkan konsumsi energi tinggi, latensi yang meningkat, dan bottleneck throughput.

Kelebihan NPU untuk AI Generatif

  1. Pemrosesan Waktu Nyata: Model AI generatif seperti transformer, model difusi, dan jaringan generatif antagonis (GAN) melibatkan operasi matriks dan tensor ekstensif. NPU unggul dalam mengalikan matriks dan menambahkan vektor secara paralel, membantu model generatif mencapai kinerja latency rendah.
  2. Skalabilitas: NPU dirancang untuk penskalaan paralel, membuatnya cocok untuk arsitektur besar yang digunakan dalam AI generatif. Menambahkan lebih banyak inti NPU atau NPU ke klaster pusat data dapat meningkatkan kinerja AI secara linier tanpa meningkatkan biaya energi secara signifikan.
  3. Efisiensi Energi: Seiring dengan kompleksitas model generatif yang tumbuh, sehingga konsumsi daya mereka juga meningkat. NPU membantu menjaga jejak energi tetap terkendali dengan fokus pada jenis matematika yang tepat yang diperlukan AI generatif, menghilangkan overhead dari komputasi lainnya.

Fitur Kunci NPU

  1. Pemrosesan Paralel: Dengan membagi tugas komputasi menjadi banyak tugas kecil, NPU dapat menangani operasi matriks ekstensif jauh lebih cepat daripada CPU, yang biasanya mengeksekusi instruksi dalam cara yang lebih linier atau serial. Paralelisme ini sangat penting untuk tugas pembelajaran dalam, di mana pelatihan dan inferensi melibatkan batch data besar.
  2. Aritmatika Presisi Rendah: Sebagian besar komputasi jaringan saraf tidak memerlukan presisi operasi titik mengambang 32-bit atau 64-bit. Tipe data presisi rendah, seperti integer 8-bit, secara signifikan mengurangi jumlah bit yang diproses per operasi, memungkinkan eksekusi yang lebih cepat dan lebih efisien energi sambil tetap mempertahankan akurasi model.
  3. Memori On-Chip Berkapasitas Tinggi: Kemampuan untuk menyimpan sejumlah besar data pelatihan atau inferensi dekat dengan prosesor sangat penting untuk tugas AI. Banyak NPU memiliki memori berkapasitas tinggi (HBM) atau sistem memori canggih yang dirancang khusus untuk jaringan saraf, mengurangi kebutuhan untuk berkomunikasi secara konstan dengan memori eksternal.
  4. Teknik Akselasi Perangkat Keras: Arsitektur NPU modern sering mengintegrasikan unit perangkat keras khusus seperti array sistolik atau inti tensor, memungkinkan mereka untuk melakukan perkalian matriks dan operasi AI lainnya dengan kecepatan yang sangat tinggi dan overhead minimal.

Bagaimana NPU Bekerja: Meniru Otak

NPU mengambil inspirasi dari jaringan saraf otak manusia. Seperti miliaran neuron dan sinaps yang memproses informasi secara paralel, NPU terdiri dari banyak elemen pemrosesan yang dapat menangani dataset besar secara bersamaan. Desain ini sangat efektif untuk tugas seperti:

  • Pengenalan dan Pemrosesan Gambar
  • Pemrosesan Bahasa Alami (NLP) dan Pengenalan Suara
  • Pengenalan Objek dan Navigasi Otonom
  • AI Generatif (misalnya, generasi gambar dan teks)

Bobot Sinaptik dan Pembelajaran

Sebuah konsep penting dalam komputasi jaringan saraf adalah bobot, yang mewakili “kekuatan” atau “pentingnya” setiap koneksi neuron dalam jaringan. NPU mengintegrasikan bobot ini langsung ke dalam perangkat keras, memungkinkan pembaruan yang lebih cepat dan lebih efisien energi saat model belajar.

Inti Berkapasitas Tinggi yang Disederhanakan

Sementara CPU secara tradisional menangani berbagai operasi yang beragam (mulai dari browsing web hingga perhitungan spreadsheet), NPU merampingkan desain untuk fokus pada beberapa operasi inti—seperti perkalian matriks, fungsi aktivasi, dan konvolusi—dieksekusi berulang kali secara paralel.

NPU vs. GPU vs. CPU

Setiap jenis prosesor memainkan peran unik dalam komputasi modern, meskipun ada beberapa tumpang tindih ketika menangani tugas AI. Berikut adalah ringkasan singkat:

Fitur CPU GPU NPU
Penggunaan Utama Tugas umum, logika, dan kontrol Rendering grafis, pemrosesan paralel untuk tugas HPC Pemrosesan paralel khusus untuk AI, ML, dan pembelajaran dalam
Jumlah Inti Sedikit (sering 2–16 pada chip konsumen) Ratusan hingga ribuan inti kecil Array paralel inti khusus
Presisi Presisi tinggi (32-bit atau 64-bit) Campuran presisi tinggi dan rendah (FP32, FP16, dll.) Fokus pada presisi rendah (8-bit atau lebih rendah)
Efisiensi Energi (AI) Moderat ketika diskalakan untuk AI besar Baik, tetapi dapat boros daya pada skala besar Sangat dioptimalkan, daya rendah per operasi
Jejak Fisik Terintegrasi ke papan utama atau SoC Sering kartu terpisah (GPU diskrit) atau SoC-basis Dapat berupa kartu terpisah atau terintegrasi ke SoC (smartphone, dll.)

Ringkasan: Sementara CPU tetap penting untuk kontrol sistem dan alur kerja tradisional, dan GPU menawarkan kekuatan pemrosesan paralel (terutama untuk tugas grafis berat), NPU dirancang khusus untuk akselasi AI dan sering beroperasi pada performa per-watt yang lebih tinggi untuk beban kerja pembelajaran mesin.

Aplikasi NPU di Dunia Nyata

Pusat Data dan AI Awan

Pusat data besar menyimpan NPU terpisah yang dapat dilampirkan langsung ke papan induk server. Ini mempercepat segala sesuatu dari mesin rekomendasi (seperti yang digunakan Netflix (NFLX ) dan Amazon (AMZN )) hingga AI generatif seperti generasi teks dan gambar waktu nyata.

Smartphone dan Elektronik Konsumen

Banyak smartphone premium, laptop, dan tablet saat ini mengintegrasikan NPU atau mesin AI langsung ke SoC. Mesin Neural Apple (AAPL ), Hexagon NPU Qualcomm (QCOM ), dan Mesin Pengolahan Neural Samsung adalah contoh solusi terintegrasi. Pendekatan ini memungkinkan:

  • Pemrosesan gambar dan video waktu nyata (misalnya, blur latar belakang pada panggilan video)
  • Asisten suara pada perangkat (dengan pengenalan suara)
  • Fitur kamera pintar seperti deteksi adegan, pengenalan wajah, dan stabilisasi gambar lanjutan

Perangkat Tepi dan IoT

NPU telah menjadi penting dalam komputasi tepi, di mana perangkat perlu memproses data secara lokal daripada mengirimkannya ke awan. Ini sangat berharga untuk aplikasi yang memerlukan latensi rendah, privasi data, atau umpan balik waktu nyata—pikirkan perangkat pintar rumah, sensor industri 4.0, drone, kendaraan otonom, dan lainnya.

Robotika

Dari robot gudang otomatis hingga asisten bedah robot, NPU dapat membuat keputusan dalam waktu singkat berdasarkan input sensor. Kemampuan mereka untuk menangani umpan video (pengenalan objek dan pengenalan pola) dan data sensor lainnya dengan cepat sangat transformatif untuk generasi berikutnya robot otonom dan semi-otonom.

NPU untuk Komputasi Tepi dan AI pada Perangkat

Mengapa Komputasi Tepi Penting

Ketika AI menyebar ke perangkat yang dapat dikenakan, sensor jarak jauh, dan perangkat Internet of Things (IoT) lainnya, kemampuan untuk memproses data dekat sumber (bukan di awan) dapat lebih kritis dari sebelumnya. AI tepi mengurangi biaya transfer data, memitigasi masalah latensi, dan menjaga informasi sensitif pada perangkat—memperbaiki keamanan dan privasi.

Peran NPU dalam AI Tepi

  1. Konsumsi Daya Rendah: Sering beroperasi pada baterai atau terbatas energi, perangkat tepi membutuhkan prosesor AI yang dapat berfungsi tanpa menghabiskan sumber daya. NPU, dioptimalkan untuk operasi matriks efisien, adalah pilihan yang tepat.
  2. Wawasan Waktu Nyata: Apakah mendeteksi anomali di pabrik atau mengalihkan drone di tengah penerbangan, keputusan inferensi split-second dapat membuat atau menghancurkan viabilitas aplikasi. NPU menawarkan kemampuan ini dengan overhead minimal.
  3. Aplikasi Smartphone: Dengan munculnya AI generatif pada perangkat, NPU di smartphone sudah memungkinkan fitur kamera canggih, terjemahan bahasa waktu nyata, dan asisten suara yang sadar konteks.

Masa Depan NPU dan AI

Ketika AI generatif terus meningkatkan kemampuan secara eksponensial, sehingga tuntutan akan komputasi berkinerja tinggi dan ultra-efisien juga akan meningkat. Sudah, produsen perangkat keras seperti Intel (INTC ), AMD, Nvidia (NVDA ), Apple, Qualcomm, dan Samsung berlomba untuk mengintegrasikan atau memperbarui arsitektur NPU mereka. Demikian pula, pusat data beralih ke model komputasi heterogen—di mana CPU, GPU, dan NPU co-exist—untuk menangani beban kerja yang semakin spesialisasi pada skala besar.

NPU untuk AI Generatif Generasi Berikutnya

  • Latensi yang Lebih Rendah: NPU masa depan bisa mencapai inferensi waktu nyata yang hampir instan, membuat asisten virtual pribadi dan generasi konten waktu nyata menjadi bagian tak terpisahkan dari kehidupan sehari-hari.
  • Penyesuaian Model pada Waktu Nyata: Ketika model menjadi lebih dinamis—menyesuaikan arsitektur dan bobot pada waktu nyata—NPU akan berkembang untuk menangani skenario pembelajaran kontinu dan online.
  • Di Luar Penglihatan dan Bahasa: AI generatif akan segera memperluas output multisensory yang kompleks, termasuk umpan balik haptik waktu nyata, generasi objek 3D, atau bahkan pengalaman audio-visual yang imersif.

Kolaborasi Multi-Prosesor

Komputasi heterogen melibatkan memanfaatkan prosesor yang tepat untuk pekerjaan yang tepat. CPU menangani tugas umum dan orkestrasi, GPU menangani operasi paralel besar (seperti grafis atau komputasi matriks besar), dan NPU menggerakkan tugas AI khusus—terutama inferensi jaringan saraf skala besar.

Dalam skenario masa depan ini, aplikasi menjadi lebih fleksibel dan kuat:

  • Seni generatif dapat berjalan secara lokal, dengan NPU Anda menangani tugas transfer gaya atau penskalaan waktu nyata.
  • Perangkat lunak perusahaan yang memerlukan pemrosesan bahasa alami berbasis AI dapat mendelegasikan koreksi tata bahasa dan pemahaman konteks ke NPU sementara CPU berkoordinasi dengan GPU untuk visualisasi data.
  • Simulasi kompleks dalam penelitian ilmiah dapat dibagi di antara CPU, GPU, dan NPU untuk menangani miliaran poin data dengan efisien.

Inovasi Perangkat Keras dan Perangkat Lunak yang Cepat

Karena kebutuhan akan penskalaan AI yang cepat, inovasi perangkat keras dan perangkat lunak dipercepat:

  • Set Instruksi Kustom: Banyak NPU dikembangkan dengan set instruksi khusus yang sejalan dengan algoritma AI yang berkembang.
  • Kerangka AI Terpadu: Kerangka AI (misalnya, TensorFlow, PyTorch, ONNX) terus mengoptimalkan untuk backend NPU, mempermudah alur kerja pengembang.
  • Konvergensi Tepi dan Awan: Beban kerja AI yang sama yang pernah dibatasi pada awan sekarang dapat dibagi di seluruh GPU awan dan NPU, atau langsung pada perangkat tepi.

Kesimpulan

Unit Pengolahan Neural (NPU) membawa era baru perangkat keras AI yang dirancang khusus, langsung menangani tantangan yang diajukan oleh pembelajaran dalam, AI generatif, dan pemrosesan data skala besar. Dengan fokus pada beban kerja paralel dan presisi rendah, NPU memberikan kinerja, efisiensi energi, dan skalabilitas yang belum pernah terjadi sebelumnya—manfaat yang sangat penting tidak hanya untuk AI awan canggih tetapi juga untuk perangkat konsumen sehari-hari dan aplikasi tepi yang muncul.

Pentingnya mereka dalam masa depan AI tidak dapat dilebih-lebihkan. Ketika permintaan akan AI generatif pada perangkat meningkat dan komputasi heterogen menjadi standar, NPU kemungkinan akan menjadi sama penting bagi sistem yang digerakkan AI seperti CPU telah menjadi untuk komputasi tradisional. Apakah memungkinkan terjemahan bahasa waktu nyata pada smartphone Anda atau mengatur model bahasa besar di pusat data, NPU siap untuk mengubah cara mesin belajar dan berinteraksi dengan dunia—menawarkan gambaran tentang masa depan yang semakin cerdas, personal, dan efisien energi.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.