Wawancara
Rob May, CEO dan Co-Founder NeuroMetric – Seri Wawancara

Rob May, CEO dan Co-Founder NeuroMetric, adalah seorang wirausaha dan investor berpengalaman dengan rekam jejak panjang yang meliputi komputasi awan, startup AI, dan modal ventura, saat ini memimpin Neurometric AI sambil juga menjabat sebagai Managing Director di HalfCourt Ventures, di mana ia telah mendukung lebih dari 100 perusahaan teknologi. Selain peran operasional dan investasinya, ia juga mendirikan Komunitas Inovator AI dan sebelumnya membangun dan keluar dari perusahaan seperti Backupify, mencerminkan pengalaman mendalam di berbagai siklus teknologi. Ia juga dikenal luas karena newsletter Investing in AI yang panjang, yang ia mulai tulis lebih dari satu dekade lalu untuk menganalisis tren AI yang muncul, strategi investasi, dan pergeseran pasar, dan yang sejak itu berkembang menjadi platform untuk wawasan yang lebih dalam tentang lanskap AI yang berkembang pesat.
NeuroMetric AI fokus pada memecahkan salah satu tantangan paling kritis dalam kecerdasan buatan saat ini: biaya dan efisiensi inferensi skala besar. Platform ini secara dinamis mengevaluasi beban kerja AI dan menerapkan strategi optimasi—seperti menggabungkan model yang lebih kecil dan khusus dengan teknik komputasi waktu uji canggih—untuk meningkatkan kinerja sambil secara dramatis mengurangi biaya, memungkinkan perusahaan untuk mencapai ROI yang lebih baik dari penerapan AI. Dengan mengatur beban kerja dan menyesuaikan penggunaan model dengan tugas tertentu, Neurometric bertujuan untuk membuat sistem AI secara signifikan lebih cepat dan lebih terjangkau, memposisikan diri di persimpangan infrastruktur AI, efisiensi, dan skalabilitas dunia nyata ketika organisasi beralih dari eksperimen ke produksi.
Anda telah mendirikan dan memimpin beberapa perusahaan AI, berinvestasi di lebih dari 100 startup melalui HalfCourt Ventures, dan sebelumnya membangun dan keluar dari Backupify. Bagaimana pengalaman itu telah membentuk perspektif Anda tentang di mana nilai yang tahan lama diciptakan dalam AI saat ini?
Saya pikir sebagian besar investor dan wirausaha mengejar moat jangka pendek – hal-hal yang tampak seperti celah yang jelas di pasar saat ini tetapi celah yang akan segera ditutup oleh perusahaan yang ada. AI akan membuat menjalankan bisnis runtuh menjadi serangkaian keputusan probabilistik. Perusahaan yang harus diinvestasikan atau dibangun adalah mereka yang memiliki perkiraan probabilitas terbaik. Terkadang itu akan datang dari integrasi vertikal dan terkadang dari skala horizontal – itu tergantung pada pasar.
Dalam newsletter Investing in AI Anda, Anda telah berargumen bahwa model menjadi semakin dapat dipertukarkan dan bahwa defensibilitas nyata bergeser ke lapisan sistem. Apa yang terlihat seperti “systems moat” yang sebenarnya dalam praktek?
Systems moat yang sebenarnya memiliki tiga sifat: itu berkompilasi dengan penggunaan, itu spesifik untuk pelanggan, dan itu tidak dapat direplikasi dengan menukar model yang lebih baik.
Defensibilitas hidup dalam apa yang saya sebut “Sistem Konteks” — arsitektur terintegrasi yang menghubungkan model dasar ke segala sesuatu yang membuat perusahaan unik: data, alur kerja, pengetahuan domain, sejarah keputusan. Sistem menangkap sinyal dari setiap interaksi — model mana yang sukses dalam tugas mana, di mana latency penting, pola perusahaan apa yang muncul — dan memberikan kembali ke dalam perbaikan diri.
Kunci wawasan adalah bahwa ini menciptakan roda penerbangan multiplicative, bukan additive. Anda tidak hanya mengumpulkan log pencarian keputusan masa lalu. Anda menghasilkan sinyal pelatihan yang menghasilkan model khusus yang memperbaiki pengaturan, yang menangkap data yang lebih berharga. Moat melebar dengan setiap inferensi.
Dalam praktek, systems moat terlihat seperti integrasi alur kerja yang dalam di mana biaya switching tidak tentang API — mereka tentang menulis logika bisnis ulang. Ini terlihat seperti konteks khusus yang tidak dapat direplikasi oleh pesaing karena itu dihasilkan melalui bulan penggunaan produksi di dalam perusahaan tertentu. Dan itu terlihat seperti loop spesialisasi terus-menerus di mana sistem menjadi jauh lebih baik untuk pelanggan itu dengan cara yang penyedia model generik tidak akan pernah.
Era model memberi kita kemampuan mentah. Era sistem adalah di mana kemampuan itu menjadi nilai dunia nyata.
Bagaimana perusahaan harus berpikir tentang membangun strategi multi-model, termasuk logika pengaturan, jalur eskalasi, dan evaluasi terus-menerus, bukan hanya mengandalkan model frontier tunggal?
Hal pertama yang perusahaan perlu internalisasi adalah bahwa “hanya gunakan model terbaik” adalah strategi yang kalah pada skala. Ini setara dengan menjalankan setiap kueri melalui insinyur senior Anda. Ini mahal, ini lambat, dan — berlawanan dengan intuisi — ini sering tidak menghasilkan hasil terbaik.
Ini berkaitan dengan apa yang saya sebut Jagged Frontier of Inference: kinerja model spesifik tugas dan tidak terduga. Model frontier kalah dari model yang lebih kecil dan khusus pada tugas tertentu sepanjang waktu. Kami telah melihat sistem komposit multi-model mencapai 72,7% akurasi pada tugas CRM di mana model frontier mencetak 58%. Permukaan kinerja tidak berkorelasi rapi dengan jumlah parameter. Jadi pertanyaan nyata bukanlah “model mana yang terbaik?” — itu “model mana yang terbaik untuk tugas spesifik ini?”
Itu reframing adalah dasar strategi multi-model yang sebenarnya. Berikut cara saya akan memberitahu perusahaan untuk memikirkannya dalam tiga lapisan.
Logika pengaturan dimulai dengan memetakan lanskap inferensi Anda. Katalog setiap titik dalam sistem di mana panggilan LLM dibuat, dan untuk setiap satu, dokumentasikan jenis tugas, kompleksitas input/output, persyaratan latency, ambang batas akurasi, dan volume panggilan. Itu memberi Anda peta panas. Anda akan segera menemukan bahwa sebagian besar volume Anda adalah pekerjaan yang sering, sempit — klasifikasi, ekstraksi entitas, pengaturan niat, generasi template — di mana model yang lebih kecil dan disesuaikan cocok atau mengalahkan model frontier dengan biaya yang jauh lebih rendah. Simpan panggilan frontier mahal Anda untuk tugas yang benar-benar memerlukan penalaran kompleks. Agen yang membuat 50 panggilan per tugas tidak memerlukan GPT-4 untuk semua 50.
Jalur eskalasi adalah tentang membangun fallback cerdas, bukan hanya failover. Sistem perlu mengenali kapan model yang lebih kecil mengembalikan hasil dengan kepercayaan rendah dan eskalasi ke model yang lebih mampu — atau ke kombinasi strategi model yang berbeda sepenuhnya. Ini adalah di mana strategi komputasi waktu uji masuk. Terkadang jawaban yang benar bukanlah model yang lebih besar — itu model yang sama dengan chain-of-thought, beam search, atau sampling best-of-N. Konfigurasi optimal berubah tidak hanya oleh model, tetapi oleh algoritma pemikiran yang Anda pasangkan dengannya.
Evaluasi terus-menerus adalah bagian yang paling sering perusahaan lewatkan sepenuhnya, dan itu adalah di mana defensibilitas nyata muncul. Pemilihan model bukanlah keputusan satu kali — itu adalah masalah optimasi terus-menerus. Model baru dirilis secara konstan, kasus penggunaan Anda berkembang, dan kinerja memburuk dengan cara yang gagal diam-diam. Anda tidak akan tahu bahwa bot layanan pelanggan Anda memberikan jawaban yang 40% lebih buruk karena Anda menggunakan model yang salah untuk jenis kueri itu — Anda hanya akan melihat churn tiga bulan kemudian. Anda memerlukan infrastruktur yang terus-menerus mengukur apa yang benar-benar bekerja di seluruh kombinasi model-tugas dan menyesuaikan pengaturan berdasarkan data kinerja nyata, bukan benchmark.
Alasan sebagian besar perusahaan belum membuat perubahan ini adalah bahwa tidak ada yang dipecat karena memilih model frontier — itu adalah “tidak ada yang dipecat karena membeli IBM” dari AI. Ekosistem vendor mendorong frontier karena itu adalah di mana margin ada. Dan infrastruktur orkestrasi yang diperlukan untuk benar-benar menjalankan arsitektur multi-model — logika pengaturan, mekanisme fallback, manajemen model, observabilitas — sederhana tidak ada di sebagian besar perusahaan. Mereka terjebak dalam optimum lokal di mana biaya switching dan ketidakpastian multi-model terasa lebih tinggi daripada pengeluaran berkelanjutan untuk inferensi frontier.
Apa kesalahan terbesar yang Anda lihat perusahaan buat ketika beralih dari pilot AI ke sistem produksi?
Mereka menganggap pilihan mereka dapat statis dan bertahan lama. Dalam kenyataan, setiap lapisan tumpukan teknologi untuk AI berubah dengan cepat. Perusahaan perlu membuat keputusan yang memberikan opsi dan fleksibilitas.
Dalam jenis alur kerja apa Anda telah melihat model yang lebih kecil dan spesifik mengungguli model frontier besar, dan mengapa itu penting secara strategis?
Kami telah melihatnya hampir di setiap tugas kerja sehari-hari – hal-hal seperti akuntansi dasar, ringkasan teks, ekstraksi entitas dari berbagai dokumen. Kami telah menjelajahi SLM untuk ratusan tugas kerja dan mereka hampir selalu menang jika masalahnya terstruktur dengan benar.
Anda telah menulis tentang biaya marginal menurun dari penerapan AI ke dalam kasus penggunaan baru. Bagaimana perubahan itu mempengaruhi ekonomi jangka panjang adopsi AI untuk perusahaan?
Narasi gelembung menganggap bahwa pendapatan AI memerlukan investasi R&D proporsional dalam model baru. Ini tidak. Model sudah dibangun. Infrastruktur ada. Setiap kasus penggunaan tambahan adalah prompt, koneksi data, mungkin sedikit penyesuaian halus — bukan lagi $100M pelatihan. Kurva biaya marginal melengkung ke bawah saat platform matang.
Ini adalah kebalikan dari kereta api atau telekom, di mana setiap mil trek baru mahal. Dalam AI, membangun mesin itu mahal. Menghubungkan hal-hal ke mesin itu murah, dan semakin murah — biaya inferensi telah turun sekitar 1.000x dalam dua tahun. Pertanyaan untuk perusahaan bukanlah apakah AI membayar. Ini adalah berapa banyak kasus penggunaan yang dapat Anda tumpuk di infrastruktur yang sama sebelum kurva pendapatan mengalahkan kurva biaya.
Apa sinyal yang harus tim teknis gunakan untuk menentukan kapan untuk beralih model, menyesuaikan halus, atau membangun model tugas kecil khusus?
Sinyalnya tidak sepenuhnya teknis. Mereka lebih didorong oleh kinerja atau ekonomi. Misalnya, beralih model atau menyesuaikan model atau membangun SLM khusus mungkin semua bekerja. Keputusan itu tergantung pada apakah Anda mengoptimalkan untuk latency atau biaya, seberapa sering tugas itu dijalankan, dan berapa lama waktu yang dibutuhkan untuk membangun dan mengirimkan setiap solusi.
Bagaimana Anda merancang pengaman, pemantauan, dan tata kelola sehingga benar-benar berskala dengan penggunaan daripada menjadi bottleneck?
Kesalahan yang dilakukan sebagian besar perusahaan adalah mengobati tata kelola sebagai titik pemeriksaan — lapisan tinjauan manual yang dipasang di atas alur kerja AI. Itu tidak berskala. Itu menjadi bottleneck seketika penggunaan meningkat.
Tata kelola harus tertanam dalam lapisan orkestrasi itu sendiri. Ketika infrastruktur pengaturan Anda sudah mengevaluasi setiap panggilan inferensi — model mana, tugas mana, tingkat kepercayaan apa — menambahkan pengaman adalah biaya marginal, bukan sistem baru. Lapisan yang sama yang memutuskan model mana yang menangani kueri dapat menegakkan kebijakan: filtering PII sebelum panggilan, validasi output setelah, jejak audit yang ditangkap secara otomatis, alokasi biaya oleh departemen.
Kunci wawasan adalah bahwa perusahaan tidak gagal di dalam sistem AI. Mereka gagal di antara mereka — dalam handoff, eskalasi, dan pengecualian. Tata kelola yang berskala terlihat seperti pesawat kontrol yang membuat setiap tindakan AI aman, dapat diaudit, dan dapat diulang sebagai hasil dari eksekusi, bukan hambatan untuk itu.
Anda telah membandingkan lanskap AI saat ini dengan transisi dari mainframe ke PC. Apa yang dimaksud dengan desentralisasi ini bagi startup yang membangun di lapisan sistem?
Kami berada di fase mainframe AI saat ini. Model frontier besar dan terpusat dari OpenAI, Anthropic, dan Google (GOOGL ) diperlukan untuk memfokuskan upaya dan menunjukkan apa yang bisa dilakukan AI. Fase itu berhasil. Kemampuan itu sudah dipahami. Tapi sama seperti komputasi tidak tetap terpusat, AI tidak akan tetap terpusat juga. Kami memasuki era PC — ekosistem terdesentralisasi di mana model yang lebih kecil dan khusus berjalan lebih dekat dengan pekerjaan.
Data pengeluaran sudah mencerminkan ini. Investasi AI perusahaan sekarang hampir sama antara infrastruktur dan aplikasi, dan bagian aplikasi tumbuh lebih cepat. Ekspansi itu lateral — di seluruh HR, hukum, pemasaran, operasi, keuangan — bukan vertikal ke model yang lebih besar.
Bagi startup yang membangun di lapisan sistem, ini adalah kesempatan generasi. Dalam dunia terpusat, penyedia model menangkap sebagian besar nilai. Dalam dunia terdesentralisasi, nilai bermigrasi ke perusahaan yang memecahkan orkestrasi, pengaturan, evaluasi, dan spesialisasi — tantangan operasional penerapan ekosistem model heterogen pada skala besar.
Proyeksi saya adalah bahwa sekitar 25% inferensi AI akan memerlukan model frontier. Perusahaan itu akan baik-baik saja — itu adalah beberapa triliun dalam TAM. Tapi 75% akan berjalan di model terbuka dan model tugas kecil khusus. Kami melatih model 4-miliar-parameter yang mengalahkan model frontier pada tugas CRM tertentu, dan itu sangat murah untuk dijalankan sehingga hampir gratis. Itu adalah masa depan — dan itu membutuhkan lapisan sistem yang sama sekali baru untuk mengelolanya.
Analogi itu berlaku sepanjang jalan: vendor mainframe melakukan dengan baik, tetapi penciptaan kekayaan yang sebenarnya terjadi di ekosistem PC. Hal yang sama akan terjadi di AI.
Menghadap ke depan lima tahun, apakah Anda percaya bahwa penyedia model frontier akan menangkap sebagian besar nilai, atau akan sebagian besar dampak ekonomi datang dari orkestrasi, optimasi, dan sistem terapan yang dibangun di sekitar mereka?
Saya pikir pasar inferensi AI akan menjadi salah satu pasar terbesar dalam sejarah dunia. Itu berarti laboratorium model frontier akan melakukan sangat baik dan masih akan ada kesempatan besar bagi perusahaan yang membangun di sekitar mereka. Ketika Anda memiliki pasar triliun dolar, memecahkan kasus tepi kecil di pasar itu dapat berubah menjadi perusahaan miliar dolar.
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi NeuroMetric AI, atau mereka dapat berlangganan newsletter Investing in AI.












