Grundlagen der KI
Diffusionsmodelle in KI – Alles, was Sie wissen mÞssen
Im KI-Ãkosystem bestimmen Diffusionsmodelle die Richtung und den Tempo des technologischen Fortschritts. Sie revolutionieren die Art und Weise, wie wir komplexe generative KI-Aufgaben angehen. Diese Modelle basieren auf der Mathematik von Gaussian-Prinzipien, Varianz, Differentialgleichungen und generativen Sequenzen. (Wir werden das technische Fachjargon unten erklÃĪren)
Moderner KI-zentrierter Produkte und LÃķsungen, die von Nvidia (NVDA ), Google (GOOGL ), Adobe (ADBE ) und OpenAI entwickelt wurden, haben Diffusionsmodelle in den Mittelpunkt des Interesses gerÞckt. DALL.E 2, Stable Diffusion und Midjourney sind prominente Beispiele fÞr Diffusionsmodelle, die derzeit im Internet die Runde machen. Benutzer geben einen einfachen Text-Prompt als Eingabe, und diese Modelle kÃķnnen ihn in realistische Bilder umwandeln, wie das unten gezeigte Bild zeigt.

Ein mit Midjourney v5 erzeugtes Bild mit dem Eingabe-Prompt: lebendige kalifornische Mohnblumen. Quelle: Midjourney
Lassen Sie uns die grundlegenden Arbeitsprinzipien von Diffusionsmodellen erkunden und wie sie die Richtungen und Normen der Welt, wie wir sie heute sehen, verÃĪndern.
Was sind Diffusionsmodelle?
Laut der ForschungsverÃķffentlichung âDenoising Diffusion Probabilistic Modelsâ werden Diffusionsmodelle definiert als:
âEin Diffusionsmodell oder probabilistisches Diffusionsmodell ist eine parametrisierte Markov-Kette, die mit variationaler Inferenz trainiert wird, um nach endlicher Zeit Daten zu erzeugen, die den Trainingsdaten entsprechenâ
Einfach ausgedrÞckt kÃķnnen Diffusionsmodelle Daten erzeugen, die denen ÃĪhneln, auf denen sie trainiert wurden. Wenn das Modell auf Bildern von Katzen trainiert wird, kann es ÃĪhnliche realistische Bilder von Katzen erzeugen.
Lassen Sie uns nun die technische Definition oben aufschlÞsseln. Diffusionsmodelle nehmen ihre Inspiration aus dem Arbeitsprinzip und der mathematischen Grundlage eines probabilistischen Modells, das ein System analysieren und vorhersagen kann, das sich mit der Zeit ÃĪndert, wie z.B. die Vorhersage der Aktienmarktrendite oder der Ausbreitung einer Pandemie.
Die Definition besagt, dass sie parametrisierte Markov-Ketten sind, die mit variationaler Inferenz trainiert werden. Markov-Ketten sind mathematische Modelle, die ein System definieren, das zwischen verschiedenen ZustÃĪnden wechselt. Der aktuelle Zustand des Systems kann nur die Wahrscheinlichkeit bestimmen, in einen bestimmten Zustand zu wechseln. Mit anderen Worten kann der aktuelle Zustand eines Systems die mÃķglichen ZustÃĪnde bestimmen, die ein System zu einem bestimmten Zeitpunkt annehmen kann.
Das Training des Modells mit variationaler Inferenz beinhaltet komplexe Berechnungen fÞr Wahrscheinlichkeitsverteilungen. Es zielt darauf ab, die genauen Parameter der Markov-Kette zu finden, die den beobachteten (bekannten oder tatsÃĪchlichen) Daten nach einer bestimmten Zeit entsprechen. Dieser Prozess minimiert den Wert der Modell-Verlustfunktion, der die Differenz zwischen den vorhergesagten (unbekannten) und beobachteten (bekannten) ZustÃĪnden ist.
Sobald das Modell trainiert ist, kann es Daten erzeugen, die den beobachteten Daten entsprechen. Diese Daten reprÃĪsentieren mÃķgliche Trajektoren oder ZustÃĪnde, die das System Þber die Zeit hinweg annehmen kann, und jeder Traektor hat eine unterschiedliche Wahrscheinlichkeit, einzutreten. Daher kann das Modell das zukÞnftige Verhalten des Systems vorhersagen, indem es eine Reihe von Daten erzeugt und ihre jeweiligen Wahrscheinlichkeiten (Wahrscheinlichkeit dieser Ereignisse) findet.
Wie interpretiert man Diffusionsmodelle in KI?
Diffusionsmodelle sind tiefere generative Modelle, die durch HinzufÞgen von Rauschen (Gaussian-Rauschen) zu den verfÞgbaren Trainingsdaten (auch bekannt als VorwÃĪrts-Diffusionsprozess) und dann Umkehren des Prozesses (bekannt als Ent-Rauschen oder Reverse-Diffusionsprozess) zur Wiederherstellung der Daten funktionieren. Das Modell lernt allmÃĪhlich, das Rauschen zu entfernen. Dieser gelernte Ent-Rauschungsprozess erzeugt neue, hochwertige Bilder aus zufÃĪlligen Samen (zufÃĪlligen, gerÃĪuschvollen Bildern), wie in der folgenden Abbildung gezeigt.

Umgekehrter Diffusionsprozess: Ein gerÃĪuschvolles Bild wird entgerauscht, um das ursprÞngliche Bild (oder seine Variationen) Þber ein trainiertes Diffusionsmodell wiederherzustellen. Quelle: Denoising Diffusion Probabilistic Models
3 Kategorien von Diffusionsmodellen
Es gibt drei grundlegende mathematische Rahmenbedingungen, die die Wissenschaft hinter Diffusionsmodellen untermauern. Alle drei arbeiten auf den gleichen Prinzipien des HinzufÞgens von Rauschen und dann Entfernens, um neue Daten zu erzeugen. Lassen Sie uns sie unten besprechen.

Ein Diffusionsmodell fÞgt Rauschen zu einem Bild hinzu und entfernt es. Quelle: Diffusionsmodelle in der Bildverarbeitung: Eine Ãbersicht
1. Denoising Diffusion Probabilistic Models (DDPMs)
Wie oben erklÃĪrt, sind DDPMs generative Modelle, die hauptsÃĪchlich zum Entfernen von Rauschen aus visuellen oder audiovisuellen Daten verwendet werden. Sie haben beeindruckende Ergebnisse bei verschiedenen Bild- und Audio-Ent-Rauschungsaufgaben gezeigt. Zum Beispiel verwendet die Filmindustrie moderne Bild- und Video-Verarbeitungstools, um die ProduktionsqualitÃĪt zu verbessern.
2. Rauschen-konditionierte Score-basierte generative Modelle (SGMs)
SGMs kÃķnnen neue Daten aus einer gegebenen Verteilung erzeugen. Sie funktionieren, indem sie eine SchÃĪtzungsfunktion fÞr die Log-Dichte der Zielverteilung lernen. Die Log-DichteschÃĪtzung geht von verfÞgbaren Datenpunkten aus, die Teil einer unbekannten Datenmenge (Testmenge) sind. Diese SchÃĪtzungsfunktion kann dann neue Datenpunkte aus der Verteilung erzeugen.
Zum Beispiel sind Deepfakes berÞchtigt fÞr die Erzeugung von gefÃĪlschten Videos und Audiodaten von berÞhmten PersÃķnlichkeiten. Aber sie werden hauptsÃĪchlich Generative Adversarial Networks (GANs) zugeschrieben. Allerdings haben SGMs ÃĪhnliche FÃĪhigkeiten gezeigt â manchmal sogar Þberlegen â bei der Erzeugung von hochwertigen Celebrity-Gesichtern. AuÃerdem kÃķnnen SGMs dazu beitragen, GesundheitsdatensÃĪtze zu erweitern, die aufgrund strenger Vorschriften und Branchenstandards nicht leicht in groÃen Mengen verfÞgbar sind.
3. Stochastische Differentialgleichungen (SDEs)
SDEs beschreiben Ãnderungen in zufÃĪlligen Prozessen im Laufe der Zeit. Sie werden weit verbreitet in der Physik und in FinanzmÃĪrkten verwendet, die von zufÃĪlligen Faktoren beeinflusst werden, die das Marktergebnis erheblich beeinflussen.
Zum Beispiel sind die Preise von Rohstoffen sehr dynamisch und werden von einer Vielzahl von zufÃĪlligen Faktoren beeinflusst. SDEs berechnen Finanzderivate wie Terminkontrakte (wie RohÃķlkontrakte). Sie kÃķnnen die Fluktuationen modellieren und die gÞnstigsten Preise genau berechnen, um ein GefÞhl der Sicherheit zu vermitteln.
Hauptanwendungen von Diffusionsmodellen in KI
Lassen Sie uns einige weit verbreitete Anwendungen von Diffusionsmodellen in KI betrachten.
Erzeugung von hochwertigen Videos
Die Erzeugung von hochwertigen Videos mit Deep Learning ist herausfordernd, da sie eine hohe KontinuitÃĪt von Video-Frames erfordert. Hier kommen Diffusionsmodelle ins Spiel, da sie eine Teilmenge von Video-Frames erzeugen kÃķnnen, um die fehlenden Frames zu fÞllen, was zu hochwertigen und flÞssigen Videos mit keiner Latenz fÞhrt.
Forscher haben die Flexible Diffusion Model und Residual Video Diffusion-Techniken entwickelt, um diesem Zweck zu dienen. Diese Modelle kÃķnnen auch realistische Videos erzeugen, indem sie nahtlos AI-erzeugte Frames zwischen die tatsÃĪchlichen Frames einfÞgen.
Diese Modelle kÃķnnen einfach die Bildfrequenz (Frames pro Sekunde) eines Videos mit niedriger Bildfrequenz erhÃķhen, indem sie Dummy-Frames hinzufÞgen, nachdem sie die Muster aus den verfÞgbaren Frames gelernt haben. Mit fast keiner Frame-Verlust kÃķnnen diese Frameworks auch tiefes Lernen-basierten Modellen helfen, AI-basierte Videos von Grund auf zu erzeugen, die wie natÞrliche Aufnahmen von hochwertigen Kameras aussehen.
Eine Vielzahl von bemerkenswerten AI-Video-Generatoren ist 2023 verfÞgbar, um die Video-Produktion und -Bearbeitung schnell und einfach zu machen.
Text-zu-Bild-Generierung
Text-zu-Bild-Modelle verwenden Eingabe-Prompts, um hochwertige Bilder zu erzeugen. Zum Beispiel kann die Eingabe âroter Apfel auf einem Tellerâ ein photorealistisches Bild eines Apfels auf einem Teller erzeugen. Blended Diffusion und unCLIP sind zwei prominente Beispiele fÞr solche Modelle, die hochwertige und genaue Bilder auf der Grundlage von Benutzereingaben erzeugen kÃķnnen.
AuÃerdem ist GLIDE von OpenAI ein weiteres bekanntes Tool, das 2021 verÃķffentlicht wurde und photorealistische Bilder mit Benutzereingaben erzeugt. SpÃĪter verÃķffentlichte OpenAI DALL.E-2, sein fortschrittlichstes Bild-Generierungsmodell bisher.
Ãhnlich hat Google ein Bild-Generierungsmodell namens Imagen entwickelt, das ein groÃes Sprachmodell verwendet, um ein tiefes textuelles VerstÃĪndnis der Eingabetexte zu entwickeln und dann photorealistische Bilder zu erzeugen.
Wir haben andere beliebte Bild-Generierungstools wie Midjourney und Stable Diffusion (DreamStudio) oben erwÃĪhnt. Schauen Sie sich ein mit Stable Diffusion erstelltes Bild an.

Ein mit Stable Diffusion 1.5 erstelltes Bild mit dem Prompt: âKollagen, hyperrealistisch, viele Variationen von PortrÃĪts eines sehr alten Thom Yorke, Gesichtsvariationen, SÃĪnger-Songwriter, (Seite) Profil, verschiedene Altersgruppen, Makro-Objektiv, liminale RÃĪume, von Lee Bermejo, Alphonse Mucha und Greg Rutkowski, Graubart, glatte Haut, Wangenknochenâ
Diffusionsmodelle in KI â Was kÃķnnen wir in der Zukunft erwarten?
Diffusionsmodelle haben vielversprechendes Potenzial als robuste Methode zur Erzeugung von hochwertigen Daten aus komplexen Bild- und Video-DatensÃĪtzen gezeigt. Durch die Verbesserung der menschlichen FÃĪhigkeit, Daten zu verwenden und zu manipulieren, kÃķnnen Diffusionsmodelle mÃķglicherweise die Welt, wie wir sie heute sehen, revolutionieren. Wir kÃķnnen erwarten, noch mehr Anwendungen von Diffusionsmodellen zu sehen, die Teil unseres tÃĪglichen Lebens werden.
Wie bereits erwÃĪhnt, sind Diffusionsmodelle nicht die einzige generative KI-Technik. Forscher verwenden auch Generative Adversarial Networks (GANs), Variational Autoencoder und flussbasierte tiefe generative Modelle, um KI-Inhalte zu erzeugen. Das VerstÃĪndnis der grundlegenden Eigenschaften, die Diffusionsmodelle von anderen generativen Modellen unterscheiden, kann dazu beitragen, effektivere LÃķsungen in den kommenden Tagen zu entwickeln.
Um mehr Þber KI-basierte Technologien zu erfahren, besuchen Sie Unite.ai. Schauen Sie sich unsere kuratierten Ressourcen zu generativer KI-Tools unten an.












