Interviews

Kismat Singh, Mitbegründer und CEO von MachGen AI – Interviewreihe

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Kismat Singh, Mitbegründer und CEO von MachGen AI, ist ein Führungskraft im Bereich KI‑Infrastruktur und Engineering mit mehr als zwei Jahrzehnten Erfahrung im Aufbau von Hochleistungs‑Computing‑ und Machine‑Learning‑Systemen. Vor der Mitbegründung von MachGen AI war Singh als Leiter der Technik für KI‑Frameworks bei Intel tätig und hatte zuvor leitende Ingenieurpositionen bei NVIDIA, AMD, HP und anderen Technologieunternehmen inne. Seine Arbeit umfasst Beiträge zu Deep‑Learning‑Bibliotheken und Compilern, Optimierungen von KI‑Frameworks sowie Verbesserungen der Resilienz beim hyperskaligen Training. Bei Intel war er eng in die PyTorch‑Initiativen des Unternehmens eingebunden und sprach öffentlich darüber, KI‑Frameworks auf verschiedenen Hardwareplattformen zugänglicher zu machen.

MachGen AI ist ein Unternehmen für KI‑Infrastruktur, das sich darauf konzentriert, generative Bild‑ und Videomodelle deutlich schneller und kostengünstiger auszuführen. Gegründet von Kismat Singh und Manoj Krishnan entwickelt das Unternehmen einen Hochleistungs‑Inference‑ und Feinabstimmungs‑Stack, der speziell für Diffusionsmodelle konzipiert ist, anstatt Infrastruktur zu adaptieren, die ursprünglich für große Sprachmodelle gebaut wurde. MachGen optimiert Bereiche wie die Berechnung von Attention, Caching, GPU‑Kernels, Speicherverwaltung, Parallelität, Scheduling und Bereitstellung, um die Generierungslatenz zu reduzieren und gleichzeitig die Modellqualität zu erhalten. Die Plattform stellt APIs für Text‑zu‑Bild, Bild‑zu‑Bild, Text‑zu‑Video, Bild‑zu‑Video und Referenz‑zu‑Video‑Generierung bereit, wobei die zugrunde liegende Technologie darauf abzielt, latenzarme Anwendungen wie interaktive Inhaltserstellung, Echtzeit‑Avatare, Gaming und personalisierte Werbung zu ermöglichen.

Sie haben mehr als zwei Jahrzehnte an Video, GPU‑Rechnen und KI‑Performance gearbeitet, darunter TensorRT bei NVIDIA, KI‑Software bei Intel, GPU‑Optimierung bei AMD und frühere Arbeiten zur Echtzeit‑Video‑Kodierung. Was haben Sie in diesen Jahren gesehen, das Sie letztlich davon überzeugt hat, große Technologieunternehmen zu verlassen und MachGen mitzugründen, und warum glaubten Sie, dass Diffusions‑Inference das Infrastrukturproblem ist, um das herum ein Unternehmen aufgebaut werden sollte?

Mein Mitgründer Manoj und ich spielten fast 10 Jahre lang Badminton im selben Fitnessstudio. Die meiste Zeit versuchten wir, den jeweils anderen einzustellen. Schließlich beschlossen wir, dass es einfacher sei, miteinander zu arbeiten, als einander weiter zu rekrutieren.

Der Grund, warum wir dieses Problem gewählt haben, ist, dass wir beide den Reifeprozess eines Inference‑Stacks von innen beobachtet haben. Ich half beim Aufbau des Inference‑Plattform‑Teams von NVIDIA und leitete anschließend die KI‑Software bei Intel. Manoj entwickelte die Infrastruktur für das Training großer Modelle hinter PyTorch bei Meta. Wir sahen, wie jahrelange Arbeit an Caching, Batching, Scheduling und Kernels frühe LLM‑Forschungssysteme in Produktionsinfrastrukturen verwandelte, die Billionen von Tokens bedienen.

Diffusion befindet sich ungefähr dort, wo die LLM‑Inference vor drei Jahren stand. Bild‑ und Videomodelle haben sich rasant weiterentwickelt, doch die Systeme, die sie bedienen, bleiben langsam, kostspielig und schwer skalierbar. Die meisten bestehenden Infrastrukturen wurden für LLMs konzipiert, wobei Diffusion erst später hinzugefügt wurde.

Drei Faktoren machten das Timing passend: Die Modelle wurden gut genug, um echte Produkte zu ermöglichen, das Problem erforderte exakt die Fähigkeiten, die wir im Laufe unserer Karrieren entwickelt haben, und die Wirkung ist groß genug, um ein generationenübergreifendes Unternehmen aufzubauen. Wenn ein Video, das früher mehrere Minuten benötigte, in Sekunden und zu einem Bruchteil der Kosten erzeugt werden kann, werden interaktive Generierung, personalisierte Werbung, Echtzeit‑Avatare und völlig neue kreative Produkte möglich.

MachGen argumentiert, dass viele der Techniken, die die Inferenz großer Sprachmodelle revolutionierten, nicht sauber auf Diffusionsmodelle übertragbar sind. Was ist grundlegend anders beim Bedienen von Bild‑ und Videomodellen, und wo liegen die größten Leistungsengpässe, die herkömmliche KI‑Infrastruktur häufig übersieht?

LLMs und Diffusionsmodelle besitzen grundlegend unterschiedliche Rechenmuster. LLMs sind autoregressiv, mit einer rechenintensiven Vorbefüllung, gefolgt von einer speichergebundenen Token‑für‑Token‑Dekodierung. Techniken wie KV‑Caching und die Aufspaltung von Vorbefüllung/Dekodierung wurden für diese Struktur konzipiert.

Diffusionsmodelle sind nicht‑autoregressiv und bleiben während des Denoising‑Prozesses durchgängig rechengebunden. Die Videoerzeugung beinhaltet zudem große Mengen an räumlichen und zeitlichen Daten, was unterschiedliche Anforderungen an Attention, Speicher, Kommunikation und Parallelität erzeugt.

Folglich lassen sich viele für LLMs entwickelte Optimierungen nicht sauber übertragen. Konventionelles KV‑Caching löst nicht dasselbe Problem, Standard‑Parallelismus kann erheblichen Kommunikations‑Overhead verursachen, und die verfügbaren Open‑Source‑Kernels sind deutlich weniger ausgereift. Scheduler, Speichermodell, Caching‑Strategie, Kernels und Parallelismus müssen alle speziell für Diffusion entwickelt werden. Deshalb haben wir MachGen mit Diffusion als erstklassigem Bestandteil gebaut.

MachGen berichtet von etwa 4–6‑fach geringerer Latenz bei einigen Bildmodellen und rund 6‑fachen Verbesserungen bei mehreren Videomodellen, während die originalen, nicht destillierten Modelle ausgeführt werden. Was sind die wichtigsten technischen Durchbrüche hinter diesen Gewinnen, und wie stellen Sie sicher, dass Leistungssteigerungen nicht zulasten der Ausgabequalität gehen?

Die Verbesserungen resultieren aus dem Zusammenspiel mehrerer Teile des Stacks. Aufmerksamkeit dominiert das Rechenbudget in vielen Videomodellen, daher konzentrieren wir uns auf niedrigpräzise Rezepte, spärliche Aufmerksamkeit und verwandte Techniken. Wir haben außerdem Caching‑Methoden entwickelt, die räumliche und zeitliche Redundanz ausnutzen, hochoptimierte Kernel für Diffusionsarchitekturen und Parallelisierungstechniken, die den Kommunikationsaufwand reduzieren.

Zusammen ermöglichen diese Verbesserungen MachGen, HiDream in einer Sekunde statt sechs Sekunden und Flux in 1,5 Sekunden statt 6,2 Sekunden zu liefern. Für Video läuft Wan 2.2 in 16,5 Sekunden gegenüber 98 Sekunden, während LTX 2.3 in 10,7 Sekunden gegenüber 67 Sekunden läuft. Die Inferenzkosten sind zudem bei Bildmodellen um das 2‑ bis 4‑fache niedriger und bei Videomodellen um das 2‑ bis 3‑fache.

Diese Ergebnisse verwenden die ursprünglichen, nicht destillierten Modelle. Wir verbessern, wie die Modelle laufen, ohne die Ausgabequalität zu opfern. Für die Produktion müssen Geschwindigkeit, Kosten und Qualität zusammen funktionieren.

Trusted TV ist ein interessantes Beispiel, weil die Reduzierung der Generierung von Minuten auf Sekunden mehr als nur die Infrastrukturrechnung verändert. Sobald die Videogenerierung schnell genug ist, um Tausende von Kampagnen und personalisierte kreative Varianten zu produzieren, welche neuen Geschäftsmodelle oder Produkterlebnisse werden dann möglich, die zuvor einfach nicht rentabel waren?

TrustedTV hilft Unternehmen, broadcast‑fertige Werbespots mit KI zu erstellen und sie auf vernetzten TV‑Plattformen wie Prime Video, Roku und DirecTV zu platzieren. Viele seiner Kunden sind kleine Unternehmen. Einen TV‑Spot traditionell zu produzieren bedeutete ein Film‑ und Schnittteam, mit Kosten ab mehreren Tausend Dollar, die typischerweise in die Zehntausende gingen. Trusted TV reduziert das auf null. Ein Kleinunternehmer kann mit einem Smartphone in etwa fünf Minuten einen kompletten Spot erstellen und ihn sehen, bevor er überhaupt etwas bezahlt. Auf der Plattform wurden bereits mehr als 10 000 Kampagnen erstellt.

Ian, CEO von Trusted TV, sah den Latenz‑Benchmark von MachGen bei Artificial Analysis und glaubte ihm nicht. Er meldete sich an, um es selbst zu testen. Sein erstes Rendering kam nach etwa 25 Sekunden zurück, ohne Qualitätsverlust, und bei den Parallelitätstests hielten die Verbesserungen auch bei Skalierung. Sie stellten ihren gesamten Produktionsworkflow in weniger als 48 Stunden auf MachGen um, und MachGen treibt jetzt die gesamte neue Videoerstellung an. In der neuesten Bereitstellung liegen wir bei etwa 10 bis 11 Sekunden für dieses Modell, und wir werden weiter daran arbeiten.

Der Effekt des Produkts ist, dass Werbetreibende nicht mehr ein oder zwei allgemeine Werbespots produzieren. Ihre Nutzer rotieren zwei bis drei neue Anzeigen pro Woche, testen Kreatives über verschiedene Zielgruppensegmente und iterieren, anstatt sich festzulegen. Als Nächstes folgt die Personalisierung nach Geografie und Zielgruppe in einem Ausmaß, das zuvor nur Unternehmen mit Multi‑Millionen‑Dollar‑Budgets vorbehalten war.

Eine Version, über die ich persönlich nachdenke: Heute sehe ich eine Sneaker‑Anzeige, die auf einer Straße in Manhattan gedreht wurde. Ich lebe im Bay Area, das bedeutet mir nichts. Was ich möchte, ist dieselbe Anzeige mit dem Mission Peak im Hintergrund. Das ist keine billigere Werbung; es ist eine andere Art von Werbung, und sie wird erst wirtschaftlich tragfähig, wenn die Generierung schnell und günstig genug ist, um Tausende von Varianten zu produzieren.

Für Unternehmen, die Bild‑ oder Videogenerierung direkt in Produkte einbetten, wie sollten sie über die Wirtschaftlichkeit der Inferenz nachdenken? Ab welcher Skalierung wird die Optimierung der GPU‑Auslastung strategisch wichtig, anstatt einfach einen API‑Anbieter pro Generierung zu bezahlen?

Der Wendepunkt tritt ein, wenn die Inferenz entweder das Kundenerlebnis oder die Margen des Unternehmens zu beeinflussen beginnt.

Eine allgemeine API kann sinnvoll sein, solange ein Team ein Produkt validiert. Sobald die Generierung zentral für dieses Produkt wird, müssen Teams über den angegebenen Preis pro Ausgabe hinausblicken. Latenz, Parallelität, Qualität, Zuverlässigkeit und GPU‑Auslastung werden dann Teil der Wirtschaftlichkeit.

Eine Generierung mag günstig erscheinen, aber sie schafft dennoch ein Geschäftsproblem, wenn Nutzer mehrere Minuten warten müssen und den Workflow abbrechen. Eine Architektur, die erfordert, dass die GPU‑Kapazität im gleichen Tempo wie die Nutzung wächst, wird ebenfalls zunehmenden Druck auf die Margen ausüben.

Es gibt keinen einzelnen Schwellenwert für das Anfragevolumen, weil der Rechenaufwand für einen kurzen 540 p‑Clip sehr unterschiedlich ist zu einem längeren 1080 p‑Video. Optimierung wird strategisch, wenn steigende Nutzung die Kosten nahezu im gleichen Tempo erhöht, Spitzenlasten Warteschlangen erzeugen oder Latenz das Produkterlebnis einschränkt.

MachGen arbeitet über mehrere Schichten hinweg, darunter benutzerdefinierte GPU‑Kernel, Caching, Präzisionsoptimierung, Scheduling und Parallelisierung. Da sich Modelle weiterhin rasant weiterentwickeln, welche Schicht des Inferenz‑Stacks bietet Ihrer Meinung nach das größte verbleibende Potenzial für dramatische Verbesserungen in Geschwindigkeit und Kosten?

Für die Videogenerierung stellt Aufmerksamkeit eine der größten verbleibenden Chancen dar, weil sie das Rechenbudget in vielen Modellen dominiert. Es gibt noch erheblichen Spielraum, niedrigpräzise Rezepte, spärliche Aufmerksamkeit und diffusionsspezifische Aufmerksamkeits‑Kernel zu verbessern.

Aufmerksamkeit ist nur ein Teil der Chance. Die größten Gesamteinsparungen werden durch die Kombination von Verbesserungen über den gesamten Stack hinweg erzielt. Caching ist ein Beispiel. Die KV‑Caching‑Techniken, die in LLMs verwendet werden, lassen sich nicht direkt übertragen, aber Diffusionsmodelle enthalten räumliche und zeitliche Redundanz, die mit dem richtigen Ansatz ausgenutzt werden kann.

Parallelität bietet eine weitere Chance. Das Hinzufügen von GPUs führt nicht automatisch zu einer proportionalen Beschleunigung, da der Kommunikationsaufwand den Nutzen ausgleichen kann. Wir entwickeln maßgeschneiderte Kernel, die die Kommunikation mit datenunabhängiger Berechnung überlappen und sie mit datenabhängiger Arbeit pipelinen.

Aufmerksamkeit, Caching, Kernel, Parallelität, Speicher und Scheduling beeinflussen einander. Wenn nur eine Ebene optimiert wird, entsteht irgendwann ein Engpass an einer anderen Stelle. Die größten Verbesserungen werden erzielt, wenn der gesamte Stack als ein komplettes System behandelt wird, das für das Rechenprofil von Diffusion ausgelegt ist.

Da neuere Videomodelle die Generierungszeiten immer näher an Echtzeit heranführen, wie nah sind wir an wirklich interaktiven generativen Videos, und welche technischen Hürden müssen noch überwunden werden, bevor Echtzeit‑Videogenerierung zum Alltag wird?

Wir erreichen bereits interaktive Geschwindigkeiten für bestimmte Anwendungen. MachGen erzeugt ein fünfsekündiges Vidu Q3 Turbo‑Video in 720p in etwa sechs Sekunden und in 540p in weniger als drei Sekunden. Das ist schnell genug für rasche kreative Iterationen und macht reaktionsfähige Avatare sowie interaktive Videos greifbar.

Ein Beispiel dafür, was ich unter interaktiv verstehe. Stellen Sie sich vor, Sie sehen eine Geschichte und können bereits erkennen, wohin das Ende führt, und Ihnen gefällt es nicht. Statt passiv zuzusehen, lenken Sie die Handlung um: Die beiden Charaktere sollten herausfinden, was der Dritte verbirgt, und ihn konfrontieren, anstatt das Geschehen einfach ablaufen zu lassen. Inhalte, die Sie steuern, statt zu erhalten. Das ermöglicht schnelle, günstige Generierung und verändert fast alles, was wir konsumieren.

Um das zu erreichen, sind in der Regel mehr als ein starkes Latenz‑Benchmark nötig. Das gesamte Erlebnis muss auch bei Produktionslast reaktionsfähig bleiben, dabei visuelle Qualität, Bild‑zu‑Bild‑Konsistenz und vorhersehbare Kosten wahren. Längere Videos, höhere Auflösungen und gleichzeitige Anfragen erhöhen die Belastung der Infrastruktur, und das System muss weiterhin Kapazität bereitstellen, Anfragen routen und bei Hardware‑Ausfällen erholen, ohne dass der Nutzer es bemerkt.

Es wird fallweise eintreffen. Kurze Clips, Avatare, Gaming und Kreativ‑Tools werden wahrscheinlich zuerst kommen, weil eine Generierung in Sekunden für sie bereits ausreicht. Wenn Modellqualität und Inferenzleistung gemeinsam besser werden, werden weitere Anwendungen diese Schwelle überschreiten.

Wenn KI‑Agenten zunehmend Bilder und Videos autonom erzeugen, anstatt darauf zu warten, dass ein Mensch einen Knopf drückt, wie verändert das die Anforderungen an die Infrastruktur? Erzeugen agentengesteuerte Workloads grundlegend andere Anforderungen hinsichtlich Latenz, Parallelität, Kosten und Zuverlässigkeit?

Ein Agent verwandelt eine einzelne Benutzeranfrage in Dutzende oder Hunderte von Generierungsjobs. Er erstellt mehrere Optionen, bewertet sie, überarbeitet die Eingabeaufforderung und wiederholt den Vorgang, ohne dass ein Mensch zwischen den Schritten eingreift.

Damit werden Latenz, Parallelität, Kosten und Zuverlässigkeit viel wichtiger. Wenn jede Generierung Minuten dauert, ist der Arbeitsablauf des Agenten zu langsam, um nützlich zu sein. Wenn jeder Versuch teuer ist, wird autonome Iteration wirtschaftlich unpraktisch. Das System muss zudem viele gleichzeitige Anfragen zuverlässig verarbeiten, da ein einzelner Ausfall die gesamte Arbeitskette unterbrechen kann.

Hier kommen Fähigkeiten wie GPU‑Provisionierung, automatisches Skalieren und Routing ins Spiel, die ebenso wichtig sind wie Optimierungen auf Modellebene. Die Nachfrage von Agenten ist weitaus burstiger als die von kreativen Anwendungen, bei denen ein Mensch einen Knopf drückt.

Die relevante Arbeitseinheit ist nicht mehr ein einzelnes Bild oder Video. Es ist der komplette Zyklus aus Generieren, Bewerten und Verfeinern von Inhalten. Die Infrastruktur muss diesen gesamten Zyklus schnell, erschwinglich und zuverlässig gestalten.

Es herrscht ein intensiver Wettbewerb zwischen GPU‑Anbietern, Inferenz‑Clouds, Modell‑Entwicklern und Optimierungsplattformen. Während die Hardware selbst schneller wird, warum benötigen Unternehmen weiterhin eine spezialisierte Inferenz‑Schicht wie MachGen, anstatt sich auf Verbesserungen von NVIDIA, AMD, Cloud‑Anbietern oder den Modell‑Entwicklern selbst zu verlassen?

Schnellere Hardware hebt die Obergrenze. Die Software bestimmt, wie viel von dieser Obergrenze tatsächlich erreicht wird.

Wir haben das bei LLMs erlebt. Neue Beschleuniger verbesserten die Rohleistung bei jeder Generation, und kontinuierliches Batching, KV‑Cache‑Management, spekulatives Decoding und spezialisierte Kernel waren weiterhin das, was die Branche zu produktionsreifer Durchsatz‑ und Wirtschaftlichkeit brachte. Keines davon kam von der Hardware.

Die kontinuierliche Optimierung des gesamten Produktionspfads für Bild‑ und Videogenerierung ist eine andere Aufgabe als das, was Hardware‑Hersteller, Cloud‑Anbieter und Modell‑Entwickler tun, und sie steht bei keinem von ihnen im Kernfokus.

Es gibt einige Ansätze für diese Aufgabe. Einer ist das Marktplatz‑Modell, bei dem Modelle aggregiert und Anfragen weitergeleitet werden. Wir halten das langfristig nicht für verteidigungsfähig, weil die Kontrolle über die Schicht, in der die Leistung liegt, fehlt. Wir haben uns entschieden, den Stack selbst zu bauen und nativ zu hosten, was der einzige Weg ist, die Latenz‑ und Kostenzahlen zu erreichen, die wir sehen.

Das bedeutet, die Aufmerksamkeit, das Caching, die Kernel, die Präzision, den Speicher und die Parallelität pro Modell und pro Beschleuniger zu optimieren sowie verwaltete APIs, dedizierte Cloud und selbstgehostete Bereitstellung zu unterstützen. Mit zunehmender Anzahl von Modellen und Hardware‑Optionen steigt auch die Komplexität. Unsere Aufgabe ist es, das zu übernehmen, damit unsere Kunden ihre Zeit für das aufwenden können, was ihre Produkte differenziert.

Sie haben Weltmodelle als Teil von MachGens langfristiger Vision beschrieben, wobei viele ihrer rechnerischen Eigenschaften Diffusions‑Workloads ähneln. Wie muss die Infrastruktur für weltweite Modelle im Produktionsmaßstab aussehen und welche Anwendungen werden möglich, wenn das Erzeugen und Simulieren visueller Umgebungen schließlich so preisgünstig und reaktionsschnell wird wie die Textgenerierung heute?

Eine Möglichkeit, unsere Plattform zu betrachten, ist, sie mit einem allgemeinen LLM zu vergleichen. Dasselbe Modell erstellt einen Rechtsvertrag und beantwortet eine Frage zu Restaurants. Für uns dient derselbe Stack Video‑Avatar‑Unternehmen, KI‑Werbung, Story‑ und Mikrodrama‑Generierung und schließlich Weltmodellen. Unterschiedliche Branchen, ein gemeinsamer Satz zugrunde liegender Leistungsprobleme.

Weltmodelle sind heute nicht unser Kerngeschäft, aber sie sind das, worauf wir hinarbeiten, und wir arbeiten aktiv daran. Weltmodelle im Produktionsmaßstab benötigen sehr hohen Durchsatz und sehr niedrige Latenz, weil sie kontinuierlich eine Umgebung erzeugen und aktualisieren, anstatt ein einzelnes Ergebnis zu produzieren. Sie benötigen zudem räumliche und zeitliche Konsistenz, die Fähigkeit, auf Aktionen zu reagieren, und häufig die Möglichkeit, mehrere mögliche Ergebnisse gleichzeitig zu simulieren. Das führt zu schwierigen Problemen in den Bereichen Speicher, Datenbewegung, Parallelität und Zuverlässigkeit. Ein Weltmodell, das einen Roboter oder ein Spiel steuert, kann nicht Minuten benötigen, um den nächsten Zustand zu erzeugen. Die Leistung entscheidet, ob diese Systeme überhaupt nutzbar sind.

Rechnerisch ähneln heutige Weltmodelle stark Diffusionsmodellen, sodass der Stack, den wir derzeit bauen, die natürliche Grundlage bildet. Es gibt noch keine ausgereifte, produktionsreife Serving‑Schicht für sie, vergleichbar mit dem, was für LLMs existiert. Wir beabsichtigen, diese aufzubauen.

Wenn Simulationen so reaktionsschnell und erschwinglich werden wie die Textgenerierung heute, können Roboter seltene Situationen proben, bevor sie ihnen begegnen, Spiele können Umgebungen erzeugen, die auf einzelne Spieler reagieren, und Designer können Dutzende von Möglichkeiten testen, bevor sie in der physischen Welt umgesetzt werden. Diffusion ist heute unser Kerngeschäft. Weltmodelle sind unser Nordstern.

Vielen Dank für das großartige Interview, Leser, die mehr erfahren möchten, sollten MachGen AI besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.