Interviews
Lior Hakim, Mitgründer und CTO von Hour One – Interview-Serie

Lior Hakim, Mitgründer und Chief Technical Officer von Hour One, einem Branchenführer im Bereich der Erstellung von virtuellen Menschen für professionelle Video-Kommunikation. Die lebendigen virtuellen Charaktere, die exklusiv nach realen Menschen modelliert sind, vermitteln menschliche Ausdrucksweise durch Text, wodurch Unternehmen ihre Botschaften mit unvergleichlicher Leichtigkeit und Skalierbarkeit erhöhen können.
Können Sie die Genesis-Geschichte hinter Hour One teilen?
Die Ursprünge von Hour One können auf meine Beteiligung im Krypto-Bereich zurückgeführt werden. Nach diesem Vorhaben begann ich, über die nächste große Sache nachzudenken, die die Massen-Cloud-Computing-Technologie nutzen kann, und da die maschinelle Lerntheorie in Empfehlungen und Predictive-Analytics an Popularität gewann, arbeitete ich an einigen ML-Infrastruktur-Bezogenen Projekten. Durch diese Arbeit wurde ich mit den frühen generativen Arbeiten vertraut und war insbesondere an GANs interessiert. Ich nutzte alle verfügbaren Rechenressourcen, um diese damals neuen Technologien zu testen. Als ich meine Ergebnisse einem Freund zeigte, der ein Unternehmen in diesem Bereich hatte, sagte er mir, ich müsste Oren treffen. Als ich fragte, warum, sagte er, dass wir vielleicht beide aufhören, seine Zeit zu verschwenden und stattdessen unsere Zeit verschwenden. Oren, mein Mitgründer und CEO von Hour One, war ein früher Investor in künstlicher Intelligenz zu dieser Zeit und obwohl wir an verschiedenen Orten standen, bewegten wir uns in die gleiche Richtung, und die Gründung von Hour One als Zuhause des virtuellen Menschen war ein unvermeidlicher Weg.
Welche maschinellen Lernalgorithmen werden verwendet und welche Rolle spielt die generative künstliche Intelligenz?
Im Bereich der Videoproduktion sind maschinelle Lernalgorithmen in jeder Phase von entscheidender Bedeutung. In der Skriptphase bieten Large Language Models (LLMs) wertvolle Unterstützung, indem sie Inhalte erstellen oder verfeinern, um packende Erzählungen zu gewährleisten. Wenn wir zu Audio übergehen, verwandeln Text-to-Speech-(TTS)-Algorithmen Text in organische, emotionale Stimmen. Wenn wir zur visuellen Darstellung übergehen, steht unser proprietäres Multimodales Grundmodell des virtuellen Menschen im Mittelpunkt. Dieses Modell, das durch Generative Adversarial Networks (GANs) und Variational Autoencoders (VAEs) verbessert wurde, ist in der Lage, kontextuelle Emotionen, Artikulation und eine ansprechende, authentische und überzeugende Darstellung zu vermitteln. Solche generativen Techniken verwandeln Text und Audio-Signale in lebendige visuelle Darstellungen von virtuellen Menschen, was zu hyperrealistischen Video-Ausgaben führt. Die Orchestrierung von LLMs, TTS, GANs, VAEs und unserem Multimodell macht die generative künstliche Intelligenz nicht nur zu einem Teil, sondern zum Rückgrat der modernen Videoproduktion.
Wie unterscheidet sich Hour One von anderen Video-Generatoren?
Bei Hour One liegt unsere Differenzierung von anderen Video-Generatoren nicht in einer Obsession mit dem Wettbewerb, sondern in einer tief verwurzelten Philosophie, die unsere Herangehensweise an Qualität, Produktdesign und Markenstrategie bestimmt. Unser Leitprinzip ist es, immer das menschliche Element in den Vordergrund zu stellen, um sicherzustellen, dass unsere Schöpfungen mit Authentizität und Emotionen resonieren. Wir sind stolz darauf, die beste Qualität in der Branche ohne Kompromisse zu liefern. Durch die Verwendung von fortschrittlicher 3D-Video-Rendering-Technologie bieten wir unseren Nutzern ein echtes kinematografisches Erlebnis. Darüber hinaus ist unsere Strategie einzigartig und überzeugt; wir beginnen mit einem polierten Produkt und iterieren dann schnell zur Perfektion. Dieser Ansatz stellt sicher, dass unsere Angebote immer einen Schritt voraus sind und neue Benchmarks in der Videogenerierung setzen.
Mit Ihrem umfangreichen Hintergrund in GPUs, können Sie uns einige Einblicke in Ihre Ansichten über die NVIDIA Next-Generation GH200 Grace Hopper Superchip Plattform (NVDA ) geben?
Die Grace-Hopper-Architektur ist wirklich ein Game-Changer. Wenn eine GPU effektiv aus dem RAM ihres Hosts arbeiten kann, ohne dass die Berechnung vollständig blockiert wird, schafft dies bisher unmögliche Model-/Beschleuniger-Verhältnisse bei der Ausbildung und ermöglicht als Ergebnis eine sehr gewünschte Flexibilität bei der Größe der Ausbildungsaufgaben. Wenn wir davon ausgehen, dass der gesamte Bestand an GH200 nicht vollständig von der LLM-Ausbildung aufgenommen wird, hoffen wir, es zu verwenden, um unsere Prototyping-Kosten für unsere multimodalen Architekturen in Zukunft erheblich zu reduzieren.
Gibt es andere Chips, die derzeit auf Ihrem Radar sind?
Unser Hauptziel ist es, den Nutzern Video-Inhalte zu bieten, die preiswettbewerbsfähig sind. Angesichts der Nachfrage nach großen Speicher-GPUs im Moment optimieren und testen wir ständig jede GPU-Cloud-Angebot auf den Top-Cloud-Service-Providern. Darüber hinaus streben wir danach, auf einigen unserer Arbeitslasten zumindest teilweise plattformunabhängig zu sein. Daher sind wir an TPUs und anderen ASICs interessiert und achten auch auf AMD. Letztendlich werden alle hardwaregeführten Optimierungsrouten, die zu einem besseren FLOPs/$-Verhältnis führen, erforscht.
Was ist Ihre Vision für zukünftige Fortschritte in der Videogenerierung?
In 24 Monaten werden wir nicht mehr in der Lage sein, einen generierten Menschen von einem aufgenommenen zu unterscheiden. Das wird viele Dinge verändern und wir sind hier an der Spitze dieser Fortschritte.
Derzeit sind die meisten generierten Videos für Computer und Mobilgeräte bestimmt, was muss sich ändern, bevor wir fotorealistische generierte Avatare und Welten für Augmented Reality und Virtual Reality haben?
Derzeit verfügen wir über die Fähigkeit, fotorealistische Avatare und Welten für Augmented Reality (AR) und Virtual Reality (VR) zu generieren. Das Haupt-Hindernis ist die Latenz. Während die Lieferung von hochwertigen, Echtzeit-Grafiken an Edge-Geräte wie AR- und VR-Headsets von entscheidender Bedeutung ist, hängt die Erreichung dieses Ziels nahtlos von mehreren Faktoren ab. Vor allem sind wir auf Fortschritte in der Chip-Herstellung angewiesen, um schnellere und effizientere Verarbeitung zu gewährleisten. Nebenbei ist die Optimierung des Stromverbrauchs von entscheidender Bedeutung, um eine längere Nutzung ohne Kompromisse am Erlebnis zu ermöglichen. Letztendlich erwarten wir Software-Durchbrüche, die die Lücke zwischen Generierung und Echtzeit-Rendering effizient überbrücken können. Wenn diese Elemente zusammenkommen, werden wir eine Zunahme der Nutzung von fotorealistischen Avataren und Umgebungen in AR- und VR-Plattformen sehen.
Was erwarten Sie als nächstes großes Durchbruch in künstlicher Intelligenz?
Wenn es um den nächsten bedeutenden Durchbruch in künstlicher Intelligenz geht, gibt es immer eine Atmosphäre der Aufregung und Erwartung. Während ich einige Fortschritte bereits erwähnt habe, kann ich sagen, dass wir derzeit an mehreren bahnbrechenden Innovationen bei Hour One arbeiten. Ich würde mich gerne auf Details einlassen, aber für den Moment ermutige ich jeden, unsere kommenden Veröffentlichungen im Auge zu behalten. Die Zukunft der künstlichen Intelligenz verspricht viel und wir sind begeistert, an der Spitze dieser Pionierbemühungen zu sein. Bleiben Sie dran!
Gibt es noch etwas, das Sie über Hour One teilen möchten?
Sie sollten auf jeden Fall unseren Discord-Kanal und unsere API überprüfen, neue Ergänzungen unseres Plattform-Angebots bei Hour One.












