Kemitraan

Infineon Technologies dan d-Matrix Bermitra pada Infrastruktur AI Rendah Latensi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Infineon Technologies (IFX.SW ) telah mengumumkan kerja sama dengan d-Matrix yang berfokus pada meningkatkan kinerja dan efisiensi energi sistem inferensi AI yang digunakan di pusat data modern. Kemitraan ini berpusat pada platform Corsair AI inference accelerator d-Matrix dan modul daya OptiMOS dual-fase Infineon, yang dirancang untuk mendukung lingkungan komputasi padat untuk beban kerja AI interaktif.

Pengumuman ini menyoroti pergeseran yang tumbuh dalam industri perangkat keras AI. Sementara sebagian besar ledakan infrastruktur selama beberapa tahun terakhir berfokus pada pelatihan model AI yang semakin besar, industri ini sekarang dengan cepat berkembang ke inferensi — proses menjalankan model di aplikasi dunia nyata seperti chatbot, sistem AI agen, kopilot, pencarian, analitik keuangan, dan dukungan keputusan kesehatan. Beban kerja ini menempatkan persyaratan yang berbeda pada perangkat keras, terutama sekitar latensi, responsif, dan konsumsi daya.

Mengapa Inferensi AI Menjadi Medan Pertempuran Perangkat Keras Utama

Inferensi AI telah muncul sebagai salah satu segmen tercepat tumbuh di pasar infrastruktur AI karena sistem AI interaktif memerlukan respons dalam milidetik daripada detik. d-Matrix telah memposisikan Corsair khusus untuk beban kerja ini, menekankan latensi ultra-rendah dan inferensi hemat energi untuk model bahasa besar dan agen AI.

Menurut d-Matrix, Corsair dirancang di sekitar arsitektur komputasi memori digital yang dimaksudkan untuk mengurangi bottleneck memori yang sering memperlambat inferensi AI generatif. Perusahaan ini mengklaim bahwa platform ini dapat secara signifikan mengurangi latensi dan meningkatkan throughput dibandingkan dengan sistem inferensi berbasis GPU tradisional, terutama untuk aplikasi interaktif.

Kemitraan dengan Infineon menangani tantangan lain yang semakin kritis: pengiriman daya.

Karena server AI terus meningkat dalam kepadatan, pengiriman daya yang efisien ke akselerator telah menjadi faktor pembatas untuk penskalaan infrastruktur. Modul OptiMOS TDM2254xx Infineon dirancang untuk arsitektur pengiriman daya vertikal yang membantu mengurangi kerugian listrik sambil meningkatkan kepadatan daya di dalam sistem server kompak.

Pergeseran Menuju Sistem AI Waktu Nyata

Perusahaan ini membingkai kemitraan ini di sekitar munculnya “AI interaktif,” di mana sistem inferensi harus terus menghasilkan output dengan penundaan yang sangat rendah. Ini termasuk AI percakapan, agen AI, sistem penalaran waktu nyata, dan aplikasi yang memerlukan generasi token cepat dari model bahasa besar.

Pendiri dan CEO d-Matrix, Sid Sheth, mengatakan bahwa arsitektur di balik Corsair dibangun khusus untuk latensi token sub-2 milidetik, sebuah metrik yang telah menjadi semakin penting karena perusahaan memindahkan sistem AI dari eksperimen ke lingkungan yang menghadap pelanggan.

Industri AI yang lebih luas juga mulai mengakui bahwa infrastruktur inferensi mungkin berkembang secara berbeda dari infrastruktur pelatihan. Sementara klaster GPU mendominasi fase pertama ekspansi AI generatif, inferensi semakin menghargai arsitektur yang dioptimalkan sekitar bandwidth memori, latensi, jaringan, dan efisiensi energi daripada komputasi mentah saja.

Efisiensi Daya Menjadi Pusat Penskalaan AI

Salah satu kendala terbesar yang dihadapi oleh hyperscalers dan penyedia cloud AI adalah permintaan listrik. Beban kerja inferensi AI dapat berjalan terus selama jutaan permintaan per hari, membuat efisiensi operasional sangat penting untuk biaya penerapan.

Infineon telah secara agresif memperluas posisinya dalam infrastruktur AI melalui teknologi semikonduktor berbasis silikon, silikon karbida (SiC), dan galium nitrida (GaN). Perusahaan ini telah semakin fokus pada memasok lapisan pengiriman daya di bawah akselerator AI dan infrastruktur server.

Kemitraan dengan d-Matrix mencerminkan bagaimana perusahaan semikonduktor menjadi lebih terintegrasi dengan startup akselerator AI karena industri ini mencari alternatif untuk arsitektur GPU konvensional.

Infrastruktur AI Berkembang di Luar GPU Tradisional

Kemitraan ini juga tiba selama gelombang eksperimen yang lebih luas dalam perangkat keras AI. Sejumlah startup telah mengembangkan akselerator khusus yang berfokus pada inferensi, komputasi berbasis memori, atau jaringan AI.

d-Matrix telah membedakan dirinya melalui penekanannya pada teknologi komputasi dalam memori dan sistem inferensi rendah latensi yang dirancang untuk AI generatif. Perusahaan ini juga telah memperluas strategi infrastruktur di luar chip akselerator saja, baru-baru ini menekankan jaringan, infrastruktur komposabel, dan optimasi sistem penuh untuk klaster inferensi.

Karena aplikasi AI menjadi semakin agen dan interaktif, penyedia infrastruktur diharapkan untuk menempatkan penekanan yang lebih besar pada mengurangi latensi, mengurangi konsumsi energi, dan meningkatkan efisiensi sistem-level di seluruh tumpukan pusat data daripada hanya fokus pada kekuatan pemrosesan mentah.

Antoine adalah pemimpin visioner dan mitra pendiri Unite.AI, yang didorong oleh semangat tak tergoyahkan untuk membentuk dan memajukan masa depan AI dan robotika. Sebagai pengusaha yang telah mendirikan beberapa perusahaan, ia percaya bahwa AI akan mengubah masyarakat secara mendasar seperti listrik. Ia kerap berbicara dengan antusias tentang potensi teknologi disruptif dan kecerdasan buatan umum (AGI).

Sebagai futuris, ia berdedikasi untuk menelusuri bagaimana inovasi ini akan membentuk dunia kita. Ia juga merupakan pendiri Securities.io, platform yang berfokus pada investasi dalam teknologi mutakhir yang mendefinisikan ulang masa depan dan mengubah berbagai sektor secara menyeluruh.