Wywiady
Jason Knight jest współzałożycielem i wiceprezesem ds. ML w OctoAI – seria wywiadów

Jason Knight jest współzałożycielem i wiceprezesem ds. Machine Learning w OctoAI, platforma dostarcza kompletny stos dla budowniczych aplikacji do uruchamiania, dostosowywania i skalowania ich aplikacji AI w chmurze lub na miejscu.
OctoAI została wyodrębniona z Uniwersytetu Waszyngtonu przez oryginalnych twórców Apache TVM, otwartego stosu dla przenośności i wydajności ML. TVM umożliwia modelom ML działanie wydajnie na dowolnym tle sprzętowym i szybko stało się kluczową częścią architektury popularnych urządzeń konsumenckich, takich jak Amazon Alexa.
Czy możesz podzielić się inspiracją założenia OctoAI i podstawowym problemem, który chcieliście rozwiązać?
AI tradycyjnie była złożoną dziedziną dostępną tylko dla tych, którzy są komfortowi z matematyką i obliczeniami wysokiej wydajności wymaganymi do stworzenia czegoś z tym. Ale AI odblokowuje ostateczne interfejsy komputera, takie jak tekst, głos i obraz programowany przez przykłady i informacje zwrotne, i przynosi pełną moc komputera każdemu na Ziemi. Przed AI tylko programiści byli w stanie uzyskać komputery, które robią to, co chcieli, pisząc teksty języka programowania.
OctoAI została stworzona, aby przyspieszyć naszą drogę do tej rzeczywistości, aby więcej ludzi mogło korzystać z AI i korzystać z niej. I ludzie, z kolei, mogą korzystać z AI, aby stworzyć jeszcze więcej korzyści, przyspieszając nauki, medycynę, sztukę i więcej.
Odwzorowując swoje doświadczenie w Intel (INTC ), jak Twoje poprzednie role przygotowały Cię do współzałożenia i prowadzenia rozwoju w OctoAI?
Intel i AI sprzętowe oraz biotechnologiczne startupy przed nim dali mi perspektywę, aby zobaczyć, jak trudne jest AI nawet dla najbardziej zaawansowanych firm technologicznych, i jak bardzo wartościowe może być to dla tych, którzy nauczyli się, jak z niego korzystać. I widząc, że różnica między tymi, którzy korzystają z AI, a tymi, którzy jeszcze nie, jest głównie kwestią infrastruktury, obliczeń i najlepszych praktyk – a nie magii.
Co różni OctoStack od innych rozwiązań wdrożeniowych AI dostępnych na rynku dzisiaj?
OctoStack jest pierwszym kompletnym stosiem technologicznym zaprojektowanym specjalnie do obsługi modeli generatywnych AI wszędzie. Oferuje platformę produkcyjną, która zapewnia wysoko zoptymalizowaną inferencję, dostosowanie modelu i zarządzanie zasobami w skali przedsiębiorstw.
OctoStack pozwala organizacjom osiągnąć autonomię AI, uruchamiając dowolny model w ich preferowanym środowisku z pełną kontrolą nad danymi, modelami i sprzętem. Zapewnia również niezrównaną wydajność i efektywność kosztową, z oszczędnościami do 12-krotnymi w porównaniu z innymi rozwiązaniami, takimi jak GPT-4.
Czy możesz wyjaśnić zalety wdrożenia modeli AI w środowisku prywatnym przy użyciu OctoStack?
Modele są dzisiaj powszechne, ale zmontowanie odpowiedniej infrastruktury do uruchamiania tych modeli i stosowania ich z własnymi danymi jest tam, gdzie naprawdę zaczyna się obracać koło biznesu. Używanie tych modeli na najbardziej wrażliwych danych, a następnie przekształcanie ich w informacje, lepsze inżynierię promptów, potoki RAG i dostosowywanie jest tam, gdzie można uzyskać najwięcej wartości z AI generatywnej. Ale nadal jest to trudne dla wszystkich, poza najbardziej zaawansowanymi firmami, aby to zrobić samodzielnie, co jest tam, gdzie rozwiązanie typu OctoStack może przyspieszyć i połączyć najlepsze praktyki w jednym miejscu dla praktyków.
Wdrożenie modeli AI w środowisku prywatnym przy użyciu OctoStack oferuje kilka zalet, w tym zwiększoną bezpieczeństwo i kontrolę nad danymi i modelami. Klienci mogą uruchamiać aplikacje AI generatywne w ramach własnych VPC lub na miejscu, zapewniając, że ich dane pozostają bezpieczne i w wybranym środowisku. Podejście to zapewnia również firmom elastyczność uruchamiania dowolnego modelu, niezależnie od tego, czy jest to model open-source, niestandardowy czy własnościowy, przy jednoczesnym korzystaniu z redukcji kosztów i poprawy wydajności.
Jakie wyzwania spotkałeś przy optymalizowaniu OctoStack do obsługi szerokiego zakresu sprzętu, i jak zostały one pokonane?
Optymalizacja OctoStack do obsługi szerokiego zakresu sprzętu wymagała zapewnienia zgodności i wydajności na różnych urządzeniach, takich jak NVIDIA (NVDA ) i AMD GPU oraz AWS Inferentia. OctoAI pokonała te wyzwania, wykorzystując swoje głębokie doświadczenie w zakresie systemów AI, rozwinięte przez lata badań i rozwoju, aby stworzyć platformę, która ciągle aktualizuje i obsługuje dodatkowe typy sprzętu, przypadki użycia GenAI i najlepsze praktyki. Pozwala to OctoAI na dostarczanie wiodącej wydajności i efektywności kosztowej.
Ponadto, uzyskanie najnowszych możliwości w AI generatywnej, takich jak multi-modalność, wywoływanie funkcji, ścisłe przestrzeganie schematu JSON, efektywne hostowanie dostosowywania i więcej, do rąk Twoich wewnętrznych deweloperów, przyspieszy Twoje uruchomienie AI.
OctoAI ma bogatą historię wykorzystywania Apache TVM. Jak ten framework wpłynął na możliwości Twojej platformy?
Stworzyliśmy Apache TVM, aby ułatwić zaawansowanym deweloperom pisanie wydajnych bibliotek AI dla GPU i przyspieszaczy. Zrobiliśmy to, ponieważ uzyskanie najlepszej wydajności z sprzętu GPU i przyspieszacza było kluczowe dla inferencji AI wtedy, jak i teraz.
Następnie wykorzystaliśmy tę samą mentalność i ekspertyzę dla całego stosu Gen AI, aby dostarczyć automatyzację dla szerszego zakresu deweloperów.
Czy możesz omówić jakiekolwiek znaczące poprawy wydajności, jakie OctoStack oferuje, takie jak 10-krotna poprawa wydajności w dużych wdrożeniach?
OctoStack oferuje znaczące poprawy wydajności, w tym do 12-krotnych oszczędności w porównaniu z innymi modelami, takimi jak GPT-4, bez poświęcania prędkości czy jakości. Zapewnia również 4-krotnie lepsze wykorzystanie GPU i 50-procentową redukcję kosztów operacyjnych, umożliwiając organizacjom uruchamianie dużych wdrożeń wydajnie i efektywnie kosztowo.
Czy możesz podzielić się kilkoma godnymi uwagi przypadkami użycia, w których OctoStack znacząco poprawił wdrożenie AI dla Twoich klientów?
Jednym z godnych uwagi przypadków użycia jest Apate.ai, globalna usługa zwalczająca telefoniczne oszustwa przy użyciu generatywnej AI konwersacyjnej. Apate.ai wykorzystała OctoStack, aby wydajnie uruchomić swój zestaw modeli językowych w wielu geografiach, korzystając z elastyczności, skali i bezpieczeństwa OctoStack. To wdrożenie pozwoliło Apate.ai na dostarczanie niestandardowych modeli wspierających wiele języków i dialektów regionalnych, spełniając ich wymagania dotyczące wydajności i bezpieczeństwa.
Ponadto, obsługujemy setki dostosowań dla naszego klienta OpenPipe. Gdyby musieli oni uruchomić dedykowane instancje dla każdego z nich, przypadki użycia ich klientów byłyby niewykonalne, gdy rozwijają i ewoluują swoje przypadki użycia i ciągle ponownie trenują swoje dostosowania parametrów dla maksymalnej jakości wyjściowej przy efektywnych kosztowo cenach.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić OctoAI.












