Interviews

Jason Knight ist Mitbegründer und VP of ML bei OctoAI – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Jason Knight ist Mitbegründer und Vice President of Machine Learning bei OctoAI, die Plattform liefert einen kompletten Stack für App-Entwickler, um ihre AI-Anwendungen in der Cloud oder on-premises auszuführen, anzupassen und zu skalieren.

OctoAI wurde aus der University of Washington von den ursprünglichen Erfindern von Apache TVM, einem Open-Source-Stack für ML-Portabilität und -Leistung, gespinnt. TVM ermöglicht es, ML-Modelle effizient auf jedem Hardware-Backend auszuführen und ist schnell zu einem wichtigen Teil der Architektur von beliebten Consumer-Geräten wie Amazon Alexa geworden.

Können Sie die Inspiration hinter der Gründung von OctoAI und das Kernproblem, das Sie lösen wollten, teilen?

AI war traditionell ein komplexes Feld, das nur für diejenigen zugänglich war, die sich mit den Mathematik und der Hochleistungsrechnertechnologie auskannten, die erforderlich waren, um etwas damit zu machen. Aber AI entsperrt die ultimativen Computer-Schnittstellen, nämlich Text, Sprache und Bild, die durch Beispiele und Feedback programmiert werden, und bringt die volle Kraft der Rechnertechnologie jedem auf der Erde. Bevor AI, konnten nur Programmierer Computer dazu bringen, das zu tun, was sie wollten, indem sie arkane Programmiersprachen-Texte schrieben.

OctoAI wurde geschaffen, um unseren Weg zu dieser Realität zu beschleunigen, damit mehr Menschen AI nutzen und davon profitieren können. Und Menschen können wiederum AI nutzen, um noch mehr Vorteile zu schaffen, indem sie die Wissenschaften, die Medizin, die Kunst und mehr beschleunigen.

Wenn Sie auf Ihre Erfahrung bei Intel (INTC ) zurückblicken, wie haben Ihre vorherigen Rollen Sie auf die Mitgründung und Leitung der Entwicklung bei OctoAI vorbereitet?

Intel und die AI-Hardware- und Biotech-Startups davor gaben mir die Perspektive, zu sehen, wie schwer AI sogar für die fortschrittlichsten Technologie-Unternehmen ist, und doch, wie wertvoll es für diejenigen sein kann, die herausgefunden haben, wie man es nutzen kann. Und ich sah, dass die Lücke zwischen denen, die von AI profitieren, und denen, die es noch nicht tun, hauptsächlich eine Frage der Infrastruktur, der Rechenleistung und der besten Praktiken ist – und nicht Magie.

Was unterscheidet OctoStack von anderen AI-Deploy-Lösungen, die heute auf dem Markt verfügbar sind?

OctoStack ist der erste komplette Technologie-Stack, der speziell für die Ausführung von generativen AI-Modellen überall konzipiert ist. Es bietet eine Turnkey-Produktionsplattform, die hoch optimierte Inferenz, Modell-Anpassung und Asset-Verwaltung im Unternehmensmaßstab bietet.

OctoStack ermöglicht es Organisationen, AI-Autonomie zu erlangen, indem sie jedes Modell in ihrer bevorzugten Umgebung mit voller Kontrolle über Daten, Modelle und Hardware ausführen. Es bietet auch unübertroffene Leistung und Kosteneffizienz, mit Einsparungen von bis zu 12-mal im Vergleich zu anderen Lösungen wie GPT-4.

Können Sie die Vorteile der Ausführung von AI-Modellen in einer privaten Umgebung mit OctoStack erläutern?

Modelle sind heutzutage allgegenwärtig, aber die Zusammenstellung der richtigen Infrastruktur, um diese Modelle auszuführen und anzuwenden, ist der Punkt, an dem der Geschäftswert-Fliehkraft wirklich beginnt. Mit diesen Modellen auf Ihren sensitivsten Daten und dann in Erkenntnisse, bessere Prompt-Engineering, RAG-Pipelines und Feinabstimmung umzuwandeln, ist der Punkt, an dem Sie den meisten Wert aus generativer AI erhalten können. Aber es ist immer noch schwierig für alle außer den fortschrittlichsten Unternehmen, dies alleine zu tun, was OctoStack beschleunigen und die besten Praktiken an einem Ort für Ihre Praktiker zusammenbringen kann.

Die Ausführung von AI-Modellen in einer privaten Umgebung mit OctoStack bietet mehrere Vorteile, darunter verbesserte Sicherheit und Kontrolle über Daten und Modelle. Kunden können generative AI-Anwendungen innerhalb ihrer eigenen VPCs oder on-premises ausführen, sodass ihre Daten sicher und in ihrer bevorzugten Umgebung bleiben. Dieser Ansatz bietet Unternehmen auch die Flexibilität, jedes Modell, sei es Open-Source, benutzerdefiniert oder proprietär, auszuführen, während sie von Kosteneinsparungen und Leistungsverbesserungen profitieren.

Welche Herausforderungen haben Sie bei der Optimierung von OctoStack für die Unterstützung einer breiten Palette von Hardware erlebt, und wie wurden diese Herausforderungen überwunden?

Die Optimierung von OctoStack für die Unterstützung einer breiten Palette von Hardware erforderte die Gewährleistung von Kompatibilität und Leistung auf verschiedenen Geräten, wie NVIDIA (NVDA ) – und AMD-GPUs und AWS-Inferentia. OctoAI überwand diese Herausforderungen, indem es seine tiefen AI-System-Expertenwissen nutzte, das durch Jahre der Forschung und Entwicklung entwickelt wurde, um eine Plattform zu schaffen, die kontinuierlich aktualisiert und weitere Hardware-Typen, GenAI-Anwendungsfälle und beste Praktiken unterstützt. Dies ermöglicht es OctoAI, marktführende Leistung und Kosteneffizienz zu liefern.

Darüber hinaus beschleunigt die Bereitstellung der neuesten Fähigkeiten in generativer AI, wie Multi-Modalität, Funktionsaufruf, strikte JSON-Schema-Einhaltung, effiziente Feinabstimmung und mehr, in die Hände Ihrer internen Entwickler, Ihren AI-Startpunkt.

OctoAI hat eine reiche Geschichte der Nutzung von Apache TVM. Wie hat sich diese Framework auf die Fähigkeiten Ihrer Plattform ausgewirkt?

Wir haben Apache TVM erstellt, um es einfach für erfahrene Entwickler zu machen, effiziente AI-Bibliotheken für GPUs und Beschleuniger zu schreiben. Wir haben dies getan, weil es wichtig war, die beste Leistung aus GPU- und Beschleuniger-Hardware zu erzielen, was damals wie heute für AI-Inferenz wichtig ist.

Wir haben dasselbe Mindset und Know-how für den gesamten Gen-AI-Serving-Stack genutzt, um Automatisierung für eine breitere Gruppe von Entwicklern zu liefern.

Können Sie über bedeutende Leistungsverbesserungen sprechen, die OctoStack bietet, wie zum Beispiel die 10-fache Leistungssteigerung bei großen Deployments?

OctoStack bietet bedeutende Leistungsverbesserungen, darunter bis zu 12-malige Einsparungen im Vergleich zu anderen Modellen wie GPT-4, ohne Geschwindigkeit oder Qualität zu opfern. Es bietet auch 4-mal bessere GPU-Auslastung und eine 50-prozentige Reduzierung der Betriebskosten, sodass Unternehmen große Deployments effizient und kosteneffizient ausführen können.

Können Sie einige bemerkenswerte Anwendungsfälle teilen, in denen OctoStack die AI-Deploy für Ihre Kunden erheblich verbessert hat?

Ein bemerkenswerter Anwendungsfall ist Apate.ai, ein globaler Dienst, der Telefonbetrug mit generativer Konversations-AI bekämpft. Apate.ai nutzte OctoStack, um ihre Suite von Sprachmodellen effizient über mehrere geografische Regionen hinweg auszuführen und profitierte von OctoStacks Flexibilität, Skalierbarkeit und Sicherheit. Diese Deploy ermöglichte es Apate.ai, benutzerdefinierte Modelle zu liefern, die mehrere Sprachen und regionale Dialekte unterstützen, und ihre Leistungs- und Sicherheitsanforderungen zu erfüllen.

Darüber hinaus betreuen wir Hunderte von Feinabstimmungen für unseren Kunden OpenPipe. Wenn sie dedizierte Instanzen für jede dieser Feinabstimmungen starten würden, wären die Anwendungsfälle ihrer Kunden unpraktikabel, da sie ihre Anwendungsfälle weiterentwickeln und kontinuierlich ihre parameter-effizienten Feinabstimmungen für maximale Ausgabequalität zu kosteneffizienten Preisen neu trainieren.

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten OctoAI besuchen OctoAI.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.