Dasar-dasar AI
Unit Pengolahan Neural (NPU): Penggerak di Balik AI dan Komputasi Generasi Berikutnya
Sebagaimana GPU pernah mengungguli CPU untuk pekerjaan AI, Unit Pengolahan Neural (NPU) siap untuk menantang GPU dengan memberikan kinerja yang lebih cepat dan efisienâterutama untuk AI generatif, di mana pemrosesan waktu nyata harus terjadi dengan kecepatan kilat dan biaya yang lebih rendah.
Pertanyaannya adalah bagaimana NPU bekerja, dan mengapa mereka mengungguli pendahulu GPU mereka untuk tugas AI modern, dan apa yang membuat mereka tak tergantikan untuk segala sesuatu dari infrastruktur data center yang kuat hingga perangkat konsumen sehari-hari? Apakah Anda merencanakan penerapan AI besar berikutnya atau hanya ingin tahu tentang teknologi terbaru, penting untuk memahami mengapa NPU bisa menjadi terobosan yang mendefinisikan kembali AIâdan generasi komputasi berikutnya.
Apa itu Unit Pengolahan Neural (NPU)?
Unit Pengolahan Neural (NPU) adalah mikroprosesor khusus yang dibangun dari awal untuk menangani persyaratan unik dari pekerjaan AI dan mesin pembelajaran modern. Sementara Unit Pemrosesan Pusat (CPU) dan Unit Pengolahan Grafis (GPU) secara historis menggerakkan tugas komputasi tradisional dan rendering grafis, mereka tidak dirancang untuk menangani intensitas komputasi dari jaringan saraf dalam. NPU mengisi kesenjangan ini dengan fokus khusus pada operasi paralel, seperti perkalian matriks dan matematika tensorâdasar dari model AI.
Aspek kunci yang membedakan NPU dari CPU dan GPU umum termasuk:
- Aritmatika AI yang Dioptimalkan: NPU umumnya menggunakan tipe data presisi rendah (misalnya, matematika integer 8-bit, atau bahkan lebih rendah) untuk menyeimbangkan daya pengolahan dan efisiensi energi, sementara CPU dan GPU biasanya mengandalkan perhitungan titik mengambang presisi tinggi.
- Arsitektur Paralel: NPU dapat membagi tugas AI menjadi ribuan (atau bahkan jutaan) komputasi kecil yang berjalan secara paralel, meningkatkan throughput secara dramatis.
- Efisiensi Energi: Dengan menghilangkan instruksi yang tidak perlu dan mengoptimalkan khusus untuk tugas jaringan saraf, NPU dapat mencapai kinerja yang lebih tinggi pada daya yang lebih rendah dibandingkan dengan GPU atau CPU yang melakukan pekerjaan AI yang sama.
Juga dikenal sebagai penguat AI, NPU sering muncul sebagai perangkat keras terpisah yang dilampirkan ke papan induk server, atau sebagai bagian dari sistem pada chip (SoC) di smartphone, laptop, atau perangkat tepi.
Mengapa NPU Penting untuk AI Generatif
Ledakan AI generatifâyang mencakup model bahasa besar (LLM) seperti ChatGPT, alat generasi gambar seperti DALL·E, dan model sintesis videoâmembutuhkan platform komputasi yang dapat menangani sejumlah besar data, memprosesnya secara real-time, dan belajar dari data tersebut dengan efisien. Prosesor tradisional dapat kesulitan memenuhi persyaratan ini, menyebabkan konsumsi energi tinggi, latensi yang meningkat, dan bottleneck throughput.
Kelebihan NPU untuk AI Generatif
- Pemrosesan Waktu Nyata: Model AI generatif seperti transformer, model difusi, dan jaringan generatif antagonis (GAN) melibatkan operasi matriks dan tensor ekstensif. NPU unggul dalam mengalikan matriks dan menambahkan vektor secara paralel, membantu model generatif mencapai kinerja latency rendah.
- Skalabilitas: NPU dirancang untuk penskalaan paralel, membuatnya cocok untuk arsitektur besar yang digunakan dalam AI generatif. Menambahkan lebih banyak inti NPU atau NPU ke klaster pusat data dapat meningkatkan kinerja AI secara linier tanpa meningkatkan biaya energi secara signifikan.
- Efisiensi Energi: Seiring dengan kompleksitas model generatif yang tumbuh, sehingga konsumsi daya mereka juga meningkat. NPU membantu menjaga jejak energi tetap terkendali dengan fokus pada jenis matematika yang tepat yang diperlukan AI generatif, menghilangkan overhead dari komputasi lainnya.
Fitur Kunci NPU
- Pemrosesan Paralel: Dengan membagi tugas komputasi menjadi banyak tugas kecil, NPU dapat menangani operasi matriks ekstensif jauh lebih cepat daripada CPU, yang biasanya mengeksekusi instruksi dalam cara yang lebih linier atau serial. Paralelisme ini sangat penting untuk tugas pembelajaran dalam, di mana pelatihan dan inferensi melibatkan batch data besar.
- Aritmatika Presisi Rendah: Sebagian besar komputasi jaringan saraf tidak memerlukan presisi operasi titik mengambang 32-bit atau 64-bit. Tipe data presisi rendah, seperti integer 8-bit, secara signifikan mengurangi jumlah bit yang diproses per operasi, memungkinkan eksekusi yang lebih cepat dan lebih efisien energi sambil tetap mempertahankan akurasi model.
- Memori On-Chip Berkapasitas Tinggi: Kemampuan untuk menyimpan sejumlah besar data pelatihan atau inferensi dekat dengan prosesor sangat penting untuk tugas AI. Banyak NPU memiliki memori berkapasitas tinggi (HBM) atau sistem memori canggih yang dirancang khusus untuk jaringan saraf, mengurangi kebutuhan untuk berkomunikasi secara konstan dengan memori eksternal.
- Teknik Akselasi Perangkat Keras: Arsitektur NPU modern sering mengintegrasikan unit perangkat keras khusus seperti array sistolik atau inti tensor, memungkinkan mereka untuk melakukan perkalian matriks dan operasi AI lainnya dengan kecepatan yang sangat tinggi dan overhead minimal.
Bagaimana NPU Bekerja: Meniru Otak
NPU mengambil inspirasi dari jaringan saraf otak manusia. Seperti miliaran neuron dan sinaps yang memproses informasi secara paralel, NPU terdiri dari banyak elemen pemrosesan yang dapat menangani dataset besar secara bersamaan. Desain ini sangat efektif untuk tugas seperti:
- Pengenalan dan Pemrosesan Gambar
- Pemrosesan Bahasa Alami (NLP) dan Pengenalan Suara
- Pengenalan Objek dan Navigasi Otonom
- AI Generatif (misalnya, generasi gambar dan teks)
Bobot Sinaptik dan Pembelajaran
Sebuah konsep penting dalam komputasi jaringan saraf adalah bobot, yang mewakili âkekuatanâ atau âpentingnyaâ setiap koneksi neuron dalam jaringan. NPU mengintegrasikan bobot ini langsung ke dalam perangkat keras, memungkinkan pembaruan yang lebih cepat dan lebih efisien energi saat model belajar.
Inti Berkapasitas Tinggi yang Disederhanakan
Sementara CPU secara tradisional menangani berbagai operasi yang beragam (mulai dari browsing web hingga perhitungan spreadsheet), NPU merampingkan desain untuk fokus pada beberapa operasi intiâseperti perkalian matriks, fungsi aktivasi, dan konvolusiâdieksekusi berulang kali secara paralel.
NPU vs. GPU vs. CPU
Setiap jenis prosesor memainkan peran unik dalam komputasi modern, meskipun ada beberapa tumpang tindih ketika menangani tugas AI. Berikut adalah ringkasan singkat:
| Fitur | CPU | GPU | NPU |
|---|---|---|---|
| Penggunaan Utama | Tugas umum, logika, dan kontrol | Rendering grafis, pemrosesan paralel untuk tugas HPC | Pemrosesan paralel khusus untuk AI, ML, dan pembelajaran dalam |
| Jumlah Inti | Sedikit (sering 2â16 pada chip konsumen) | Ratusan hingga ribuan inti kecil | Array paralel inti khusus |
| Presisi | Presisi tinggi (32-bit atau 64-bit) | Campuran presisi tinggi dan rendah (FP32, FP16, dll.) | Fokus pada presisi rendah (8-bit atau lebih rendah) |
| Efisiensi Energi (AI) | Moderat ketika diskalakan untuk AI besar | Baik, tetapi dapat boros daya pada skala besar | Sangat dioptimalkan, daya rendah per operasi |
| Jejak Fisik | Terintegrasi ke papan utama atau SoC | Sering kartu terpisah (GPU diskrit) atau SoC-basis | Dapat berupa kartu terpisah atau terintegrasi ke SoC (smartphone, dll.) |
Ringkasan: Sementara CPU tetap penting untuk kontrol sistem dan alur kerja tradisional, dan GPU menawarkan kekuatan pemrosesan paralel (terutama untuk tugas grafis berat), NPU dirancang khusus untuk akselasi AI dan sering beroperasi pada performa per-watt yang lebih tinggi untuk beban kerja pembelajaran mesin.
Aplikasi NPU di Dunia Nyata
Pusat Data dan AI Awan
Pusat data besar menyimpan NPU terpisah yang dapat dilampirkan langsung ke papan induk server. Ini mempercepat segala sesuatu dari mesin rekomendasi (seperti yang digunakan Netflix (NFLX ) dan Amazon (AMZN )) hingga AI generatif seperti generasi teks dan gambar waktu nyata.
Smartphone dan Elektronik Konsumen
Banyak smartphone premium, laptop, dan tablet saat ini mengintegrasikan NPU atau mesin AI langsung ke SoC. Mesin Neural Apple (AAPL ), Hexagon NPU Qualcomm (QCOM ), dan Mesin Pengolahan Neural Samsung adalah contoh solusi terintegrasi. Pendekatan ini memungkinkan:
- Pemrosesan gambar dan video waktu nyata (misalnya, blur latar belakang pada panggilan video)
- Asisten suara pada perangkat (dengan pengenalan suara)
- Fitur kamera pintar seperti deteksi adegan, pengenalan wajah, dan stabilisasi gambar lanjutan
Perangkat Tepi dan IoT
NPU telah menjadi penting dalam komputasi tepi, di mana perangkat perlu memproses data secara lokal daripada mengirimkannya ke awan. Ini sangat berharga untuk aplikasi yang memerlukan latensi rendah, privasi data, atau umpan balik waktu nyataâpikirkan perangkat pintar rumah, sensor industri 4.0, drone, kendaraan otonom, dan lainnya.
Robotika
Dari robot gudang otomatis hingga asisten bedah robot, NPU dapat membuat keputusan dalam waktu singkat berdasarkan input sensor. Kemampuan mereka untuk menangani umpan video (pengenalan objek dan pengenalan pola) dan data sensor lainnya dengan cepat sangat transformatif untuk generasi berikutnya robot otonom dan semi-otonom.
NPU untuk Komputasi Tepi dan AI pada Perangkat
Mengapa Komputasi Tepi Penting
Ketika AI menyebar ke perangkat yang dapat dikenakan, sensor jarak jauh, dan perangkat Internet of Things (IoT) lainnya, kemampuan untuk memproses data dekat sumber (bukan di awan) dapat lebih kritis dari sebelumnya. AI tepi mengurangi biaya transfer data, memitigasi masalah latensi, dan menjaga informasi sensitif pada perangkatâmemperbaiki keamanan dan privasi.
Peran NPU dalam AI Tepi
- Konsumsi Daya Rendah: Sering beroperasi pada baterai atau terbatas energi, perangkat tepi membutuhkan prosesor AI yang dapat berfungsi tanpa menghabiskan sumber daya. NPU, dioptimalkan untuk operasi matriks efisien, adalah pilihan yang tepat.
- Wawasan Waktu Nyata: Apakah mendeteksi anomali di pabrik atau mengalihkan drone di tengah penerbangan, keputusan inferensi split-second dapat membuat atau menghancurkan viabilitas aplikasi. NPU menawarkan kemampuan ini dengan overhead minimal.
- Aplikasi Smartphone: Dengan munculnya AI generatif pada perangkat, NPU di smartphone sudah memungkinkan fitur kamera canggih, terjemahan bahasa waktu nyata, dan asisten suara yang sadar konteks.
Masa Depan NPU dan AI
Ketika AI generatif terus meningkatkan kemampuan secara eksponensial, sehingga tuntutan akan komputasi berkinerja tinggi dan ultra-efisien juga akan meningkat. Sudah, produsen perangkat keras seperti Intel (INTC ), AMD, Nvidia (NVDA ), Apple, Qualcomm, dan Samsung berlomba untuk mengintegrasikan atau memperbarui arsitektur NPU mereka. Demikian pula, pusat data beralih ke model komputasi heterogenâdi mana CPU, GPU, dan NPU co-existâuntuk menangani beban kerja yang semakin spesialisasi pada skala besar.
NPU untuk AI Generatif Generasi Berikutnya
- Latensi yang Lebih Rendah: NPU masa depan bisa mencapai inferensi waktu nyata yang hampir instan, membuat asisten virtual pribadi dan generasi konten waktu nyata menjadi bagian tak terpisahkan dari kehidupan sehari-hari.
- Penyesuaian Model pada Waktu Nyata: Ketika model menjadi lebih dinamisâmenyesuaikan arsitektur dan bobot pada waktu nyataâNPU akan berkembang untuk menangani skenario pembelajaran kontinu dan online.
- Di Luar Penglihatan dan Bahasa: AI generatif akan segera memperluas output multisensory yang kompleks, termasuk umpan balik haptik waktu nyata, generasi objek 3D, atau bahkan pengalaman audio-visual yang imersif.
Kolaborasi Multi-Prosesor
Komputasi heterogen melibatkan memanfaatkan prosesor yang tepat untuk pekerjaan yang tepat. CPU menangani tugas umum dan orkestrasi, GPU menangani operasi paralel besar (seperti grafis atau komputasi matriks besar), dan NPU menggerakkan tugas AI khususâterutama inferensi jaringan saraf skala besar.
Dalam skenario masa depan ini, aplikasi menjadi lebih fleksibel dan kuat:
- Seni generatif dapat berjalan secara lokal, dengan NPU Anda menangani tugas transfer gaya atau penskalaan waktu nyata.
- Perangkat lunak perusahaan yang memerlukan pemrosesan bahasa alami berbasis AI dapat mendelegasikan koreksi tata bahasa dan pemahaman konteks ke NPU sementara CPU berkoordinasi dengan GPU untuk visualisasi data.
- Simulasi kompleks dalam penelitian ilmiah dapat dibagi di antara CPU, GPU, dan NPU untuk menangani miliaran poin data dengan efisien.
Inovasi Perangkat Keras dan Perangkat Lunak yang Cepat
Karena kebutuhan akan penskalaan AI yang cepat, inovasi perangkat keras dan perangkat lunak dipercepat:
- Set Instruksi Kustom: Banyak NPU dikembangkan dengan set instruksi khusus yang sejalan dengan algoritma AI yang berkembang.
- Kerangka AI Terpadu: Kerangka AI (misalnya, TensorFlow, PyTorch, ONNX) terus mengoptimalkan untuk backend NPU, mempermudah alur kerja pengembang.
- Konvergensi Tepi dan Awan: Beban kerja AI yang sama yang pernah dibatasi pada awan sekarang dapat dibagi di seluruh GPU awan dan NPU, atau langsung pada perangkat tepi.
Kesimpulan
Unit Pengolahan Neural (NPU) membawa era baru perangkat keras AI yang dirancang khusus, langsung menangani tantangan yang diajukan oleh pembelajaran dalam, AI generatif, dan pemrosesan data skala besar. Dengan fokus pada beban kerja paralel dan presisi rendah, NPU memberikan kinerja, efisiensi energi, dan skalabilitas yang belum pernah terjadi sebelumnyaâmanfaat yang sangat penting tidak hanya untuk AI awan canggih tetapi juga untuk perangkat konsumen sehari-hari dan aplikasi tepi yang muncul.
Pentingnya mereka dalam masa depan AI tidak dapat dilebih-lebihkan. Ketika permintaan akan AI generatif pada perangkat meningkat dan komputasi heterogen menjadi standar, NPU kemungkinan akan menjadi sama penting bagi sistem yang digerakkan AI seperti CPU telah menjadi untuk komputasi tradisional. Apakah memungkinkan terjemahan bahasa waktu nyata pada smartphone Anda atau mengatur model bahasa besar di pusat data, NPU siap untuk mengubah cara mesin belajar dan berinteraksi dengan duniaâmenawarkan gambaran tentang masa depan yang semakin cerdas, personal, dan efisien energi.












