Interviews

Rob May, CEO und Mitgründer von NeuroMetric – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Rob May, CEO und Mitgründer von NeuroMetric, ist ein erfahrener Unternehmer und Investor mit einer langen Erfolgsbilanz in den Bereichen Cloud-Computing, KI-Startups und Venture-Capital. Er leitet derzeit Neurometric AI und ist gleichzeitig Managing Director bei HalfCourt Ventures, wo er über 100 Technologieunternehmen unterstützt hat. Neben seinen operativen und investierenden Rollen hat er die KI-Innovators-Community mitgegründet und zuvor Unternehmen wie Backupify gegründet und veräußert, was seine umfassende Erfahrung in mehreren Technologiezyklen unterstreicht. Er ist auch bekannt für seinen langjährigen Investing-in-AI-Newsletter, den er vor über einem Jahrzehnt begann, um aufkommende KI-Trends, Investitionsstrategien und Marktentwicklungen zu analysieren, und der sich seitdem zu einer Plattform für tiefere Einblicke in die sich schnell entwickelnde KI-Landschaft entwickelt hat.

NeuroMetric AI konzentriert sich darauf, eine der größten Herausforderungen in der künstlichen Intelligenz heute zu lösen: die Kosten und Effizienz von Inferenz im großen Maßstab. Die Plattform bewertet dynamisch KI-Workloads und wendet Optimierungsstrategien an, wie z. B. die Kombination kleinerer, spezialisierter Modelle mit fortschrittlichen Testzeit-Computing-Techniken, um die Leistung zu verbessern und die Kosten drastisch zu reduzieren, sodass Unternehmen eine bessere Rendite aus ihren KI-Einsätzen erzielen können. Durch die Orchestrierung von Workloads und die Anpassung der Modellnutzung an spezifische Aufgaben zielt Neurometric darauf ab, KI-Systeme erheblich schneller und erschwinglicher zu machen und positioniert sich damit an der Schnittstelle zwischen KI-Infrastruktur, Effizienz und realer Skalierbarkeit, wenn Unternehmen von Experimenten zur Produktion übergehen.

Sie haben mehrere KI-Unternehmen gegründet und geleitet, in über 100 Startups über HalfCourt Ventures investiert und zuvor Backupify gegründet und veräußert. Wie haben diese Erfahrungen Ihre Perspektive auf die Schaffung von nachhaltigem Wert in der KI heute geprägt?

Ich denke, dass die meisten Investoren und Unternehmer kurzfristige Vorteile verfolgen – Dinge, die wie offensichtliche Lücken im Markt aussehen, aber Lücken, die schnell von bestehenden Unternehmen geschlossen werden. Die KI wird das Geschäft in eine Reihe von probabilistischen Entscheidungen verwandeln. Die Unternehmen, in die man investieren oder die man aufbauen sollte, sind diejenigen, die die besten Gesamtschätzungen dieser Wahrscheinlichkeiten haben. Manchmal kommt das aus der vertikalen Integration und manchmal aus der horizontalen Skalierbarkeit – es hängt vom Markt ab.

In Ihrem Investing-in-AI-Newsletter haben Sie argumentiert, dass Modelle zunehmend austauschbar werden und dass die wahre Verteidigung auf die Systemebene wechselt. Wie sieht ein “System-Moat” in der Praxis aus?

Ein wahrer System-Moat hat drei Eigenschaften: Er verstärkt sich mit der Nutzung, er ist spezifisch für den Kunden und er kann nicht durch das Einsetzen eines besseren Modells repliziert werden.

Die Verteidigung lebt in dem, was ich ein “System des Kontexts” nenne – eine integrierte Architektur, die Grundmodelle mit allem verbindet, was ein Unternehmen einzigartig macht: seine Daten, seine Workflows, sein Domänenwissen, seine Entscheidungsgeschichte. Das System erfasst Signal von jeder Interaktion – welche Modelle welche Aufgaben erfolgreich ausführen, wo Latenz wichtig ist, welche Unternehmensspezifischen Muster entstehen – und füttert dies zurück in die Verbesserung des Systems.

Der Schlüsselgedanke ist, dass dies ein multiplikatives Schwungrad erzeugt, nicht ein additives. Sie sammeln nicht nur ein durchsuchbares Protokoll vergangener Entscheidungen. Sie erzeugen Trainings-Signal, das spezialisierte Modelle hervorbringt, die die Weiterleitung verbessern, was wertvolle Daten erfasst. Der Moat verbreitert sich mit jeder Inferenz.

In der Praxis sieht ein System-Moat wie eine tiefe Workflow-Integration aus, bei der die Wechselkosten nicht durch APIs bestimmt werden, sondern durch die Neuverfassung von Geschäftslogik. Er sieht wie ein proprietärer Kontext aus, den kein Wettbewerber replizieren kann, weil er durch Monate der Produktionsnutzung innerhalb eines bestimmten Unternehmens erzeugt wurde. Und er sieht wie ein kontinuierlicher Spezialisierungszyklus aus, bei dem das System für diesen Kunden auf bedeutende Weise besser wird, auf eine Weise, die ein generischer Modellanbieter nie wird.

Die Modell-Ära hat uns die rohe Fähigkeit gegeben. Die System-Ära ist der Bereich, in dem diese Fähigkeit zu realen Wert wird.

Wie sollten Unternehmen über die Entwicklung einer Multi-Modell-Strategie nachdenken, einschließlich Routing-Logik, Eskalationspfaden und kontinuierlicher Bewertung, anstatt sich auf ein einzelnes Frontier-Modell zu verlassen?

Das Erste, was Unternehmen internalisieren müssen, ist, dass “nur das beste Modell zu verwenden” eine verlierende Strategie im großen Maßstab ist. Es ist das Äquivalent dazu, jeden Query durch Ihren leistungsstärksten Ingenieur laufen zu lassen. Es ist teuer, es ist langsam und – paradoxerweise – produziert es oft nicht die besten Ergebnisse.

Dies führt zu dem, was ich die “gezackte Grenze der Inferenz” nenne: Die Modellleistung ist aufgabenspezifisch und unvorhersehbar. Frontier-Modelle verlieren gegenüber kleineren, spezialisierteren Modellen bei bestimmten Aufgaben ständig. Wir haben komposite Multi-Modell-Systeme gesehen, die auf CRM-Aufgaben 72,7 % Genauigkeit erreichen, während Frontier-Modelle 58 % erreichten. Die Leistungsfläche korreliert nicht sauber mit der Parameteranzahl. Die wahre Frage ist also nicht “welches Modell ist das beste?” – sondern “welches Modell ist am besten für diese spezifische Teilaufgabe?”

Diese Neufokussierung ist die Grundlage einer echten Multi-Modell-Strategie. Hier ist, wie ich Unternehmen dazu raten würde, darüber nachzudenken, in drei Schichten.

Routing-Logik beginnt mit der Kartierung Ihrer Inferenz-Landschaft. Katalogisieren Sie jeden Punkt in Ihrem System, an dem ein LLM-Aufruf erfolgt, und dokumentieren Sie für jeden die Aufgabentyp, die Komplexität von Eingabe und Ausgabe, die Latenzanforderungen, die Genauigkeitsschwelle und die Aufrufhäufigkeit. Das gibt Ihnen eine Heatmap. Sie werden schnell feststellen, dass die meisten Ihrer Volumina hochfrequente, schmal gefasste Arbeiten sind – Klassifizierung, Entitätsextraktion, Intent-Routing, Template-Generierung – bei denen ein fein abgestimmtes kleineres Modell das Frontier-Modell bei einem Bruchteil der Kosten erreicht oder übertrifft. Reservieren Sie Ihre teuren Frontier-Aufrufe für die Aufgaben, die tatsächlich komplexes Denken erfordern. Ein Agent, der 50 Aufrufe pro Aufgabe macht, benötigt nicht GPT-4 für alle 50.

Eskalationspfade sind darum, intelligente Fallbacks zu bauen, nicht nur Failover. Das System muss erkennen, wenn ein kleineres Modell niedrige Vertrauenswerte zurückgibt und auf ein leistungsfähigeres Modell eskalieren – oder auf eine andere Modell-Strategie-Kombination. Hier kommen Testzeit-Computing-Strategien ins Spiel. Manchmal ist die richtige Antwort nicht ein größeres Modell – es ist das gleiche Modell mit Chain-of-Thought, Beam-Search oder Best-of-N-Sampling. Die optimale Konfiguration ändert sich nicht nur von Modell zu Modell, sondern auch von der Denkstrategie, die Sie damit kombinieren.

Kontinuierliche Bewertung ist der Teil, den die meisten Unternehmen vollständig verpassen, und es ist der Bereich, in dem die wahre Verteidigung auftritt. Modellauswahl ist keine einmalige Entscheidung – es ist ein kontinuierliches Optimierungsproblem. Neue Modelle werden ständig veröffentlicht, Ihre Anwendungsfälle entwickeln sich weiter, und die Leistung verschlechtert sich auf Weise, die stillschweigend fehlschlägt. Sie werden nicht wissen, dass Ihr Kundenservice-Bot eine 40 % schlechtere Antwort gab, weil Sie das falsche Modell für diese Anfrageart verwendet haben – Sie werden nur den Absatz drei Monate später sehen. Sie benötigen eine Infrastruktur, die kontinuierlich misst, was tatsächlich funktioniert, und die Routing basierend auf realen Leistungsdaten anpasst, nicht auf Benchmarks.

Der Grund, warum die meisten Unternehmen diesen Schritt nicht gemacht haben, ist, dass niemand wegen der Auswahl des Frontier-Modells gefeuert wird – es ist das “niemand wird wegen IBM gefeuert” der KI. Der Anbieter-Ökosystem drängt auf Frontier, weil das die Margen sind. Und die Orchestrierungs-Infrastruktur, die tatsächlich erforderlich ist, um eine Multi-Modell-Architektur zu betreiben – Routing-Logik, Fallback-Mechanismen, Modell-Management, Beobachtbarkeit – existiert einfach nicht bei den meisten Unternehmen. Sie stecken in einem lokalen Optimum fest, in dem die Wechselkosten und die Unsicherheit von Multi-Modell höher erscheinen als die laufenden Überausgaben für Frontier-Inferenz.

Was sind die größten Fehler, die Unternehmen machen, wenn sie von KI-Piloten zu produktionsreifen Systemen übergehen?

Sie nehmen an, dass ihre Entscheidungen statisch und langfristig sein können. In Wirklichkeit ändert sich jede Ebene der Technologie-Stack für KI schnell. Unternehmen müssen Entscheidungen treffen, die Optionen und Flexibilität bieten.

In welchen Arten von Workflows haben Sie gesehen, dass kleinere, aufgabenspezifische Modelle große Frontier-Modelle übertrumpfen, und warum ist das strategisch wichtig?

Wir haben es in fast jedem gemeinsamen täglichen Arbeitsauftrag gesehen – Dinge wie grundlegende Buchhaltung, Textzusammenfassung, Entitätsextraktion aus verschiedenen Dokumenten. Wir haben SLMs für Hunderte von Arbeitsaufgaben untersucht und sie gewinnen fast immer, wenn das Problem richtig strukturiert ist.

Sie haben über die sinkenden Grenzkosten der KI-Einführung in neue Anwendungsfälle geschrieben. Wie ändert sich dadurch die langfristige Ökonomie der KI-Adoption für Unternehmen?

Die Blasen-Narrative geht davon aus, dass KI-Einnahmen proportionale R&D-Investitionen in neue Modelle erfordern. Das ist nicht der Fall. Die Modelle sind gebaut. Die Infrastruktur existiert. Jeder zusätzliche Anwendungsfall ist ein Prompt, eine Datenverbindung, vielleicht ein leichtes Feintuning – nicht ein weiterer 100-Millionen-Dollar-Trainingslauf. Die Grenzkostenkurve biegt nach unten ab, wenn die Plattform reift.

Dies ist das Gegenteil von Eisenbahnen oder Telekommunikation, wo jeder neue Meile teuer war. In der KI war der Bau des Motors teuer. Dinge mit dem Motor zu verbinden ist billig und wird billiger – Inferenzkosten sind in zwei Jahren etwa 1.000-mal gesunken. Die Frage für Unternehmen ist nicht, ob KI sich auszahlt. Es ist, wie viele Anwendungsfälle Sie auf der gleichen Infrastruktur stapeln können, bevor die Umsatzkurve die Kostenkurve überlagert.

Welche Signale sollten technische Teams verwenden, um zu bestimmen, wann sie Modelle wechseln, fein abstimmen oder spezielle kleine Aufgabenmodelle bauen sollten?

Die Signale sind nicht unbedingt technisch. Sie sind eher leistungs- oder wirtschaftlich getrieben. Zum Beispiel kann das Wechseln eines Modells, Feinabstimmen eines Modells oder Bauen eines benutzerdefinierten SLMs funktionieren. Die Entscheidung hängt davon ab, ob Sie die Latenz oder die Kosten optimieren, wie häufig die Aufgabe ausgeführt wird und wie lange es dauert, jede Lösung zu bauen und bereitzustellen.

Wie entwerfen Sie Schutzmechanismen, Überwachung und Governance so, dass sie tatsächlich mit der Nutzung skalieren, anstatt zu einem Engpass zu werden?

Der Fehler, den die meisten Unternehmen machen, ist, Governance als Prüfung zu behandeln – eine manuelle Überprüfungsschicht, die auf die KI-Workflows aufgesetzt wird. Das skaliert nicht. Es wird zum Engpass, sobald die Nutzung zunimmt.

Governance muss in die Orchestrierungsebene selbst eingebettet sein. Wenn Ihre Routing-Infrastruktur bereits jeden Inferenzaufruf bewertet – welches Modell, welche Aufgabe, welcher Vertrauenswert – ist das Hinzufügen von Schutzmechanismen ein marginaler Kostenfaktor, nicht ein neues System. Die gleiche Ebene, die entscheidet, welches Modell eine Anfrage bearbeitet, kann Richtlinien durchsetzen: PII-Filterung vor dem Aufruf, Ausgabevalidierung nach dem Aufruf, Audit- Trails, die automatisch erfasst werden, Kostenzuweisung nach Abteilung.

Der Schlüsselgedanke ist, dass Unternehmen nicht innerhalb der KI-Systeme scheitern. Sie scheitern zwischen ihnen – in den Übergaben, Eskalationen und Ausnahmen. Governance, die skaliert, sieht wie ein Steuerungsebene aus, die jeden KI-Vorgang sicher, überprüfbar und wiederholbar macht, als Nebenprodukt der Ausführung, nicht als Hindernis dafür.

Sie haben den heutigen KI-Landschaft mit dem Übergang von Großrechnern zu PCs verglichen. Was bedeutet diese Dezentralisierung für Startups, die in der Systemebene aufbauen?

Wir sind derzeit in der Großrechner-Phase der KI. Große, zentrale Frontier-Modelle von OpenAI, Anthropic und Google (GOOGL ) waren notwendig, um die Anstrengungen zu fokussieren und zu demonstrieren, was KI kann. Diese Phase hat funktioniert. Die Fähigkeiten sind gut verstanden. Aber genauso wie die Rechnertechnologie nicht zentralisiert blieb, wird die KI auch nicht zentralisiert bleiben. Wir betreten die PC-Ära – ein dezentrales Ökosystem, in dem kleinere, spezialisiertere Modelle näher an der Arbeit laufen.

Die Ausgaben-Daten spiegeln dies bereits wider. Die Unternehmens-KI-Investitionen sind jetzt fast gleichmäßig zwischen Infrastruktur und Anwendungen aufgeteilt, und der Anteil der Anwendungen wächst schneller. Die Expansion ist lateral – über HR, Recht, Marketing, Betrieb, Finanzen – und nicht vertikal in größere Modelle.

Für Startups, die in der Systemebene aufbauen, ist dies die Chance einer Generation. In einer zentralisierten Welt erfasst der Modellanbieter den meisten Wert. In einer dezentralen Welt migriert der Wert zu den Unternehmen, die Orchestrierung, Routing, Bewertung und Spezialisierung lösen – die operativen Herausforderungen bei der Bereitstellung einer heterogenen Modellekosystem auf großem Maßstab.

Meine Prognose ist, dass etwa 25 % der KI-Inferenz Frontier-Modelle erfordern werden. Diese Unternehmen werden gut sein – das ist ein paar Billionen Dollar Umsatzpotenzial. Aber 75 % werden auf Open-Source- und kleine spezifische Aufgabenmodelle laufen. Wir haben ein 4-Milliarden-Parameter-Modell trainiert, das Frontier-Modelle bei einer bestimmten CRM-Aufgabe übertraf, und es ist so billig, es zu betreiben, dass es fast kostenlos ist. Das ist die Zukunft – und sie benötigt eine völlig neue Systemebene, um sie zu verwalten.

Die Analogie gilt durchweg: Die Großrechner-Hersteller haben gut abgeschnitten, aber die wahre Reichtumsschaffung fand im PC-Ökosystem statt. Gleiches wird in der KI der Fall sein.

Ausgehend von den nächsten fünf Jahren, glauben Sie, dass die Frontier-Modell-Anbieter den größten Teil des Wertes abschöpfen werden oder ob der größte Teil des wirtschaftlichen Einflusses aus der Orchestrierung, Optimierung und den angewandten Systemen um sie herum kommen wird?

Ich denke, der KI-Inferenz-Markt wird einer der größten Märkte in der Geschichte der Welt sein. Das bedeutet, dass die Frontier-Modell-Labore unglaublich gut abschneiden werden und es dennoch massive Chancen für die Unternehmen geben wird, die um sie herum aufbauen. Wenn Sie Märkte im Wert von Billionen haben, kann die Lösung kleiner Randfälle in diesen Märkten zu billionenschweren Unternehmen werden.

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten NeuroMetric AI besuchen oder sich für den Investing-in-AI-Newsletter anmelden.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.