Vordenker

Maßgeschneiderte LLMs für jedes Unternehmen? DeepSeek zeigt uns den Weg

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Es war einmal, als die Technologie-Ruf war “Mobiltelefone für jeden” – und tatsächlich haben mobile Kommunikationen die Geschäftswelt (und die Welt) revolutioniert. Heute ist der entsprechende Ruf, jedem Zugang zu KI-Anwendungen zu geben. Aber die wahre Macht der KI liegt darin, sie für die spezifischen Bedürfnisse von Unternehmen und Organisationen zu nutzen. Der Weg, den das chinesische Startup DeepSeek eingeschlagen hat, zeigt, wie KI tatsächlich von jedem genutzt werden kann, insbesondere von denen mit begrenzten Budgets, um ihre spezifischen Bedürfnisse zu erfüllen. Tatsächlich verspricht die Ankunft von kostengünstigerer KI, das tief verwurzelte Muster von KI-Lösungen, die oft für viele kleine Unternehmen und Organisationen aufgrund von Kostenanforderungen unsichtbar bleiben, zu ändern.

LLMs sind – oder waren – ein teures Unterfangen, das den Zugang zu großen Mengen an Daten, einer großen Anzahl leistungsstarker Computer zur Datenverarbeitung und Zeit und Ressourcen für die Ausbildung des Modells erfordert. Aber diese Regeln ändern sich. Mit einem Budget, das einem Minimalbetrag entspricht, entwickelte DeepSeek sein eigenes LLM und eine ChatGPT-ähnliche Anwendung für Anfragen – mit einem weit geringeren Investition als für ähnliche Systeme, die von amerikanischen und europäischen Unternehmen gebaut wurden. Der Ansatz von DeepSeek öffnet ein Fenster für die Entwicklung von LLMs für kleinere Organisationen, die nicht über Milliarden verfügen. Tatsächlich ist der Tag nicht mehr fern, an dem die meisten kleinen Organisationen ihre eigenen LLMs entwickeln können, um ihre spezifischen Zwecke zu erfüllen, was in der Regel eine effektivere Lösung als allgemeine LLMs wie ChatGPT bietet.

Während Debatten über die tatsächlichen Kosten von DeepSeek bestehen, ist es nicht einfach die Kosten, die es und ähnliche Modelle unterscheiden: Es ist die Tatsache, dass es weniger fortschrittliche Chips und einen fokussierteren Ansatz für die Ausbildung verwendet. Als chinesisches Unternehmen, das US-Exportbeschränkungen unterliegt, konnte DeepSeek nicht auf die fortschrittlichen Nvidia-Chips zugreifen, die normalerweise für die schwere Datenverarbeitung, die für die Entwicklung von LLMs erforderlich ist, verwendet werden, und musste daher weniger leistungsstarke Nvidia H-800-Chips (NVDA ) verwenden, die Daten nicht so schnell oder effizient verarbeiten können.

Um diesen Mangel an Leistung auszugleichen, nahm DeepSeek einen anderen, fokussierteren und direkteren Ansatz für die Entwicklung seines LLMs. Anstatt große Mengen an Daten auf ein Modell zu werfen und sich auf die Rechenleistung zu verlassen, um die Daten zu beschriften und anzuwenden, verengte DeepSeek die Ausbildung und nutzte eine kleine Menge an hochwertigen “Cold-Start”-Daten und wendete IRL (iterative Verstärkungslernung) an, wobei der Algorithmus Daten auf verschiedene Szenarien anwendet und daraus lernt. Dieser fokussierte Ansatz ermöglicht es dem Modell, schneller zu lernen, mit weniger Fehlern und weniger verschwendeter Rechenleistung.

Ähnlich wie Eltern, die einem Baby helfen, bestimmte Bewegungen auszuführen, um es erfolgreich zum ersten Mal zu rollen – anstatt das Baby alleine zu lassen oder es eine breitere Vielfalt an Bewegungen zu lehren, die theoretisch helfen könnten, sich zu rollen – zoomen die Datenwissenschaftler, die diese fokussierteren KI-Modelle trainieren, auf das ein, was für bestimmte Aufgaben und Ergebnisse am meisten benötigt wird. Solche Modelle sind wahrscheinlich nicht so breit anwendbar wie größere LLMs wie ChatGPT, aber sie können für spezifische Anwendungen verlässlich sein und diese mit Präzision und Effizienz ausführen. Selbst die Kritiker von DeepSeek geben zu, dass sein strömungsförmiger Ansatz für die Entwicklung die Effizienz erheblich erhöht hat, sodass es mit viel weniger mehr erreichen kann.

Dieser Ansatz besteht darin, der KI die besten Eingaben zu geben, damit sie ihre Meilensteine auf die cleverste und effizienteste Weise erreichen kann, und kann für jedes Unternehmen, das ein LLM für seine spezifischen Bedürfnisse und Aufgaben entwickeln möchte, wertvoll sein. Ein solcher Ansatz ist zunehmend wertvoll für kleine Unternehmen und Organisationen. Der erste Schritt besteht darin, mit den richtigen Daten zu beginnen. Zum Beispiel sollte ein Unternehmen, das KI nutzen möchte, um seine Vertriebs- und Marketingteams zu unterstützen, sein Modell auf einer sorgfältig ausgewählten Datenmenge trainieren, die sich auf Vertriebsgespräche, Strategien und Metriken konzentriert. Dies verhindert, dass das Modell Zeit und Rechenleistung auf irrelevante Informationen verschwendet. Darüber hinaus muss die Ausbildung in Stufen erfolgen, um sicherzustellen, dass das Modell jede Aufgabe oder jeden Begriff beherrscht, bevor es zum nächsten übergeht.

Dies hat auch Parallelen in der Erziehung eines Babys, wie ich selbst seit meiner Mutterschaft vor einigen Monaten gelernt habe. In beiden Szenarien vermeidet ein geführter, schrittweiser Ansatz den Verschleiß von Ressourcen und reduziert die Reibung. Schließlich führt ein solcher Ansatz bei beiden Baby-Menschen und KI-Modellen zu einer iterativen Verbesserung. Wenn das Baby wächst oder das Modell mehr lernt, verbessern sich seine Fähigkeiten. Dies bedeutet, dass Modelle verfeinert und verbessert werden können, um besser mit realen Situationen umzugehen.

Dieser Ansatz hält die Kosten niedrig, verhindert, dass KI-Projekte zu einem Ressourcen-Abfluss werden, und macht sie für kleinere Teams und Organisationen zugänglicher. Er führt auch zu einer besseren Leistung von KI-Modellen in kürzerer Zeit; und da die Modelle nicht mit überflüssigen Daten überlastet sind, können sie auch an neue Informationen und veränderte Geschäftsanforderungen angepasst werden – ein wichtiger Aspekt in wettbewerbsorientierten Märkten.

Die Ankunft von DeepSeek und der Welt der kostengünstigeren, effizienteren KI – obwohl sie ursprünglich Panik in der KI-Welt und an den Börsen ausgelöst hat – ist insgesamt eine positive Entwicklung für den KI-Sektor. Die größere Effizienz und geringeren Kosten der KI, zumindest für bestimmte fokussierte Anwendungen, werden letztendlich zu einer größeren Nutzung der KI im Allgemeinen führen, was das Wachstum für alle, von Entwicklern bis hin zu Chip-Herstellern und Endnutzern, antreibt. Tatsächlich veranschaulicht DeepSeek den Jevons-Paradoxon – wo eine größere Effizienz wahrscheinlich zu einer größeren Nutzung einer Ressource und nicht zu einer geringeren Nutzung führt. Da dieser Trend wahrscheinlich weiterhin anhält, werden kleine Unternehmen, die sich auf die Nutzung von KI konzentrieren, um ihre spezifischen Bedürfnisse zu erfüllen, auch besser für Wachstum und Erfolg gerüstet sein.

Stav Levi-Neumark ist der CEO und Mitgründer von Alta und Experte im Bereich Produktmanagement und Umsatzwachstum. Zuvor war sie einer der ersten Mitarbeiter bei Monday.com, wo sie half, "BigBrain" zu entwickeln, ein internes BI-Tool, das für den täglichen Betrieb des Unternehmens verwendet wird. Stav hat einen Bachelor-Abschluss in Informatik und Statistik von der Hebrew University of Jerusalem.