KI-Modelle und Plattformen
AudioSep: Trennen Sie alles, was Sie beschreiben

LASS oder Language-queried Audio Source Separation ist das neue Paradigma für CASA oder Computational Auditory Scene Analysis, das darauf abzielt, einen Zielton aus einer gegebenen Mischung von Audio mithilfe einer natürlichen Sprachabfrage zu trennen, die eine natürliche, aber skalierbare Schnittstelle für digitale Audioaufgaben und -anwendungen bietet. Obwohl die LASS-Modelle in den letzten Jahren erheblich fortgeschritten sind, um die gewünschte Leistung auf bestimmte Audioquellen wie Musikinstrumente zu erzielen, sind sie nicht in der Lage, den Zielton in der offenen Domäne zu trennen.
AudioSep ist ein grundlegendes Modell, das darauf abzielt, die aktuellen Einschränkungen der LASS-Modelle zu überwinden, indem es die Trennung von Zielton mithilfe von natürlichen Sprachabfragen ermöglicht. Die Entwickler des AudioSep-Modells haben das Modell umfassend auf einer Vielzahl von großen, multimodalen Datensätzen trainiert und die Leistung des Modells auf einer Vielzahl von Audioaufgaben, einschließlich der Trennung von Musikinstrumenten, der Trennung von Audioereignissen und der Verbesserung der Sprache, bewertet. Die anfängliche Leistung von AudioSep erfüllt die Benchmark-Anforderungen, da es beeindruckende Zero-Shot-Lernalgorithmen und starke Audio-Trennleistung zeigt.
In diesem Artikel werden wir uns mit der Funktionsweise des AudioSep-Modells auseinandersetzen, indem wir die Architektur des Modells, die für die Trainings- und Evaluierung verwendeten Datensätze und die wesentlichen Konzepte, die an der Funktionsweise des AudioSep-Modells beteiligt sind, untersuchen. Lassen Sie uns also mit einer grundlegenden Einführung in das CASA-Modell beginnen.
CASA, USS, QSS, LASS-Modelle: Die Grundlage für AudioSep
Das CASA- oder Computational Auditory Scene Analysis-Modell ist ein Modell, das von Entwicklern verwendet wird, um maschinelles Hören zu entwickeln, das komplexe Klangumgebungen auf eine Weise wahrnimmt, die der Art und Weise, wie Menschen Klang mit ihren auditiven Systemen wahrnehmen, ähnelt. Die Trennung von Klang, mit besonderem Fokus auf die Trennung von Zielton, ist ein grundlegender Forschungsbereich innerhalb des CASA-Modells, und es zielt darauf ab, das “Cocktail-Party-Problem” oder die Trennung von realen Audioaufnahmen von einzelnen Audioquellen oder -dateien zu lösen. Die Bedeutung der Klangtrennung kann hauptsächlich auf ihre weit verbreiteten Anwendungen zurückgeführt werden, einschließlich der Trennung von Musikquellen, der Trennung von Audioquellen, der Verbesserung der Sprache, der Identifizierung von Zielton und vielem mehr.
Die meisten Arbeiten zur Klangtrennung, die in der Vergangenheit durchgeführt wurden, konzentrieren sich hauptsächlich auf die Trennung von einer oder mehreren Audioquellen wie der Trennung von Musik oder der Trennung von Sprache. Ein neues Modell mit dem Namen USS oder Universal Sound Separation zielt darauf ab, willkürliche Klänge in realen Audioaufnahmen zu trennen. Es ist jedoch eine herausfordernde und restriktive Aufgabe, jeden Klang aus einer Audio-Mischung zu trennen, hauptsächlich aufgrund der Vielzahl von verschiedenen Klangquellen, die in der Welt existieren, was der Hauptgrund dafür ist, dass die USS-Methode für Echtzeitanwendungen nicht praktikabel ist.
Eine praktikable Alternative zur USS-Methode ist die QSS- oder Query-basierte Klangtrennung, die darauf abzielt, eine einzelne oder Ziel-Klangquelle aus der Audio-Mischung basierend auf einer bestimmten Abfrage zu trennen. Dank dieser Methode können Entwickler und Benutzer die gewünschten Audioquellen aus der Mischung basierend auf ihren Anforderungen extrahieren, was die QSS-Methode zu einer praktikableren Lösung für digitale Echtzeitanwendungen wie Multimedia-Inhaltsbearbeitung oder Audio-Bearbeitung macht.
Darüber hinaus haben Entwickler kürzlich eine Erweiterung des QSS-Modells vorgeschlagen, das LASS- oder Language-queried Audio Source Separation-Modell, das darauf abzielt, willkürliche Klangquellen aus einer Audio-Mischung mithilfe von natürlichen Sprachbeschreibungen zu trennen. Da das LASS-Modell es Benutzern ermöglicht, Ziel-Klangquellen mithilfe von natürlichen Sprachanweisungen zu extrahieren, kann es zu einem leistungsstarken Werkzeug mit weit verbreiteten Anwendungen in digitalen Audioanwendungen werden. Im Vergleich zu traditionellen audio- oder vision-basierten Methoden bietet die Verwendung von natürlichen Sprachanweisungen für die Klangtrennung einen größeren Vorteil, da sie Flexibilität bietet und die Erfassung von Abfrageinformationen einfacher und bequemer macht. Darüber hinaus bietet das LASS-Modell im Vergleich zu label-basierten Audio-Trennungsmodellen, die eine vordefinierte Menge von Anweisungen oder Abfragen verwenden, keine Einschränkung der Anzahl von Eingabeabfragen und kann problemlos auf offene Domänen verallgemeinert werden.
Ursprünglich basiert das LASS-Modell auf überwachtem Lernen, bei dem das Modell auf einer Menge von beschrifteten Audio-Text-Paaren trainiert wird. Das Hauptproblem bei diesem Ansatz ist jedoch die begrenzte Verfügbarkeit von annotierten und beschrifteten Audio-Text-Daten. Um die Abhängigkeit des LASS-Modells von annotierten Audio-Text-Daten zu reduzieren, werden die Modelle mithilfe des multimodalen Supervision-Lernansatzes trainiert. Das primäre Ziel hinter der Verwendung eines multimodalen Supervision-Ansatzes ist es, multimodale kontrastive Prämodellierungsmodelle wie das CLIP- oder Contrastive Language Image Pre-Training-Modell als Abfrage-Encoder für das Modell zu verwenden. Da das CLIP-Modell die Fähigkeit besitzt, Text-Embeddings mit anderen Modalitäten wie Audio oder Vision zu verbinden, ermöglicht es Entwicklern, LASS-Modelle mithilfe von datenreichen Modalitäten zu trainieren und es ermöglicht die Interferenz mit den textuellen Daten in einer Zero-Shot-Einstellung. Die aktuellen LASS-Modelle verwenden jedoch kleine Datensätze für die Trainings- und Anwendungen des LASS-Modells über hunderte von potenziellen Domänen hinweg, die noch zu erforschen sind.
Um die aktuellen Einschränkungen des LASS-Modells zu überwinden, haben Entwickler AudioSep vorgestellt, ein grundlegendes Modell, das darauf abzielt, Klang aus einer Audio-Mischung mithilfe von natürlichen Sprachbeschreibungen zu trennen. Der aktuelle Fokus von AudioSep liegt darin, ein vorge trainiertes Klangtrennmodell zu entwickeln, das bestehende große multimodale Datensätze nutzt, um die Verallgemeinerung von LASS-Modellen in offenen Anwendungen zu ermöglichen. Zusammengefasst ist das AudioSep-Modell: “Ein grundlegendes Modell für universelle Klangtrennung in offenen Domänen mithilfe von natürlichen Sprachabfragen oder -beschreibungen, trainiert auf großen Audio- und multimodalen Datensätzen”.
AudioSep: Schlüsselkomponenten und Architektur
Die Architektur des AudioSep-Modells umfasst zwei Schlüsselkomponenten: einen Text-Encoder und ein Trennmodell.
Der Text-Encoder
Das AudioSep-Modell verwendet einen Text-Encoder des CLIP- oder Contrastive Language Image Pre-Training-Modells oder des CLAP- oder Contrastive Language Audio Pre-Training-Modells, um Text-Embeddings innerhalb einer natürlichen Sprachabfrage zu extrahieren. Die Eingabe-Textabfrage besteht aus einer Folge von “N”-Token, die dann vom Text-Encoder verarbeitet werden, um die Text-Embeddings für die gegebene Eingabe-Sprachabfrage zu extrahieren. Der Text-Encoder verwendet einen Stapel von Transformer-Blöcken, um die Eingabe-Text-Token zu encodieren, und die Ausgabedarstellungen werden nach dem Durchlaufen der Transformer-Schichten aggregiert, was zur Entwicklung einer D-dimensionalen Vektor-Darstellung mit fester Länge führt, wobei D den Dimensionen des CLAP- oder CLIP-Modells entspricht, während der Text-Encoder während der Trainingsphase eingefroren ist.
Das CLIP-Modell ist auf einem großen Datensatz von Bild-Text-Paaren mithilfe von kontrastivem Lernen vorge trainiert, was der Hauptgrund dafür ist, dass sein Text-Encoder eine Abbildung von textuellen Beschreibungen auf den semantischen Raum lernt, der auch von den visuellen Darstellungen geteilt wird. Der Vorteil, den AudioSep durch die Verwendung des CLIP-Text-Encoders gewinnt, besteht darin, dass es nun in der Lage ist, das LASS-Modell von unbeschrifteten Audio-Visions-Daten mithilfe von visuellen Embeddings als Alternative zu trainieren, was das Training von LASS-Modellen ohne die Notwendigkeit von annotierten oder beschrifteten Audio-Text-Daten ermöglicht.
Das CLAP-Modell funktioniert ähnlich wie das CLIP-Modell und verwendet ein kontrastives Lernziel, indem es einen Text- und einen Audio-Encoder verwendet, um Audio und Sprache zu verbinden, was Text- und Audio-Beschreibungen in einem Audio-Text-Latentraum zusammenführt.
Trennmodell
Das AudioSep-Modell verwendet ein Frequency-Domain-ResUNet-Modell, das eine Mischung von Audio-Clips als Trenn-Rückgrat für das Modell verwendet. Das Modell funktioniert, indem es zunächst eine STFT oder eine Short-Time Fourier-Transformation auf das Signal anwendet, um ein komplexes Spektrogramm, ein Magnitude-Spektrogramm und die Phase von X zu extrahieren. Das Modell konstruiert dann ein Encoder-Decoder-Netzwerk, um das Magnitude-Spektrogramm zu verarbeiten.
Das ResUNet-Encoder-Decoder-Netzwerk besteht aus 6 Residual-Blöcken, 6 Decoder-Blöcken und 4 Bottleneck-Blöcken. Das Spektrogramm in jedem Encoder-Block verwendet 4 Residual-Konvolutionsblöcke, um sich in einen Bottleneck-Merkmal herunterzusample, während die Decoder-Blöcke 4 Residual-Deconvolutionsblöcke verwenden, um die Trennkomponenten durch Upsampling der Merkmale zu erhalten. Anschließend stellen die Encoder-Blöcke und ihre entsprechenden Decoder-Blöcke eine Skip-Verbindung her, die auf der gleichen Upsampling- oder Downsampling-Rate arbeitet. Der Residual-Block des Modells besteht aus 2 Leaky-ReLU-Aktivierungsschichten, 2 Batch-Normalisierungsschichten und 2 CNN-Schichten, und darüber hinaus führt das Modell eine zusätzliche Residual-Verbindung ein, die die Eingabe und Ausgabe jedes einzelnen Residual-Blocks verbindet. Das ResUNet-Modell nimmt das komplexe Spektrogramm X als Eingabe und produziert die Magnitude-Maske M als Ausgabe, wobei der Phasenrest auf Text-Embeddings bedingt ist, die die Größe der Skalierung und die Rotation des Winkels des Spektrogramms steuern. Das getrennte komplexe Spektrogramm kann dann durch Multiplikation der vorhergesagten Magnitude-Maske und des Phasenrests mit der STFT (Short-Time Fourier-Transformation) der Mischung extrahiert werden.

In seinem Modell verwendet AudioSep eine FiLm- oder Feature-wise Linearly modulierte Schicht, um das Trennmodell und den Text-Encoder nach der Bereitstellung der konvolutiven Blöcke im ResUNet zu verbinden.
Trainings- und Verlustfunktion
Während der Trainingsphase des AudioSep-Modells verwenden die Entwickler die Lautstärke-Verstärkungsmethode und trainieren das AudioSep-Modell von Ende zu Ende mithilfe einer L1-Verlustfunktion zwischen den Ground-Truth- und den vorhergesagten Wellenformen.
Datensätze und Benchmarks
Wie in den vorherigen Abschnitten erwähnt, ist AudioSep ein grundlegendes Modell, das darauf abzielt, die aktuelle Abhängigkeit von LASS-Modellen von annotierten Audio-Text-Paaren zu überwinden. Das AudioSep-Modell wird auf einer Vielzahl von Datensätzen trainiert, um es mit multimodalen Lernalgorithmen auszustatten, und hier ist eine detaillierte Beschreibung der Datensätze und Benchmarks, die von den Entwicklern verwendet werden, um das AudioSep-Modell zu trainieren.
AudioSet
AudioSet ist ein schwach beschrifteter großer Audio-Datensatz, der über 2 Millionen 10-Sekunden-Audio-Snippets enthält, die direkt aus YouTube extrahiert wurden. Jedes Audio-Snippet im AudioSet-Datensatz wird nach dem Vorhandensein oder Fehlen von Klangklassen kategorisiert, ohne spezifische Zeitdetails der Klangereignisse. Der AudioSet-Datensatz enthält über 500 verschiedene Klangklassen, einschließlich natürlicher Klänge, menschlicher Klänge, Fahrzeugklänge und vielem mehr.
VGGSound
Der VGGSound-Datensatz ist ein großer visueller Audio-Datensatz, der wie AudioSet direkt aus YouTube stammt und über 200.000 Video-Clips enthält, die jeweils 10 Sekunden lang sind. Der VGGSound-Datensatz wird in über 300 Klangklassen kategorisiert, einschließlich menschlicher Klänge, natürlicher Klänge, Vogelklänge und vielem mehr. Die Verwendung des VGGSound-Datensatzes stellt sicher, dass das Objekt, das den Zielklang erzeugt, auch in der entsprechenden visuellen Clip beschreibbar ist.
AudioCaps
AudioCaps ist der größte öffentlich verfügbare Audio-Beschreibung-Datensatz und enthält über 50.000 10-Sekunden-Audio-Clips, die aus dem AudioSet-Datensatz extrahiert wurden. Die Daten in AudioCaps sind in drei Kategorien unterteilt: Trainingsdaten, Testdaten und Validierungsdaten, und die Audio-Clips sind mit natürlichen Sprachbeschreibungen beschriftet, die mithilfe der Amazon (AMZN ) Mechanical Turk-Plattform erstellt wurden. Es ist erwähnenswert, dass jedes Audio-Clip im Trainingsdatensatz eine einzelne Beschreibung hat, während die Daten im Test- und Validierungsdatensatz jeweils 5 Ground-Truth-Beschreibungen haben.
ClothoV2
Der ClothoV2-Datensatz ist ein Audio-Beschreibung-Datensatz, der aus Clips besteht, die von der FreeSound-Plattform stammen, und wie AudioCaps wird jeder Audio-Clip mit natürlichen Sprachbeschreibungen beschriftet, die mithilfe der Amazon Mechanical Turk-Plattform erstellt wurden.
WavCaps
Wie AudioSet ist WavCaps ein schwach beschrifteter großer Audio-Datensatz, der über 400.000 Audio-Clips mit Beschreibungen enthält, und eine Gesamtlänge von etwa 7568 Stunden Trainingsdaten. Die Audio-Clips im WavCaps-Datensatz stammen aus einer Vielzahl von Audioquellen, einschließlich BBC Sound Effects, AudioSet, FreeSound, SoundBible und vielem mehr.

Trainingsdetails
Während der Trainingsphase des AudioSep-Modells wählen die Entwickler zwei Audio-Segmente aus zwei verschiedenen Audio-Clips aus dem Trainingsdatensatz aus und mischen sie zusammen, um eine Trainingsmischung zu erstellen, wobei die Länge jedes Audio-Segments etwa 5 Sekunden beträgt. Das Modell extrahiert dann das komplexe Spektrogramm aus dem Wellenformsignal mithilfe eines Hann-Fensters mit einer Größe von 1024 und einem Hop-Size von 320.
Das Modell verwendet dann den Text-Encoder des CLIP- oder CLAP-Modells, um die textuellen Embeddings mit Text-Überwachung als Standardkonfiguration für AudioSep zu extrahieren. Für das Trennmodell verwendet das AudioSep-Modell ein ResUNet-Modell, das 30 Schichten, 6 Encoder-Blöcke und 6 Decoder-Blöcke enthält, was der Architektur des universalen Klangtrennmodells entspricht. Darüber hinaus hat jeder Encoder-Block zwei konvolutive Schichten mit einer Kerngröße von 3×3, und die Anzahl der Ausgabe-Feature-Maps der Encoder-Blöcke beträgt 32, 64, 128, 256, 512 und 1024. Die Decoder-Blöcke teilen sich die Symmetrie mit den Encoder-Blöcken, und die Entwickler verwenden den Adam-Optimizer, um das AudioSep-Modell mit einer Batch-Größe von 96 zu trainieren.
Evaluierungsergebnisse
Auf gesehene Datensätze
Die folgende Abbildung vergleicht die Leistung des AudioSep-Modells auf gesehene Datensätze während der Trainingsphase, einschließlich der Trainingsdatensätze. Die folgende Abbildung zeigt die Benchmark-Evaluierungsergebnisse des AudioSep-Modells im Vergleich zu Basissystemen, einschließlich Sprachverbesserungsmodellen, LASS und CLIP. Das AudioSep-Modell mit CLIP-Text-Encoder wird als AudioSep-CLIP bezeichnet, während das AudioSep-Modell mit CLAP-Text-Encoder als AudioSep-CLAP bezeichnet wird.

Wie in der Abbildung zu sehen ist, zeigt das AudioSep-Modell eine gute Leistung, wenn es Audio-Beschreibungen oder Text-Beschriftungen als Eingabe-Abfragen verwendet, und die Ergebnisse zeigen eine überlegene Leistung des AudioSep-Modells im Vergleich zu vorherigen Benchmark-LASS- und audio-abgefragten Klangtrennmodellen.
Auf nicht gesehene Datensätze
Um die Leistung des AudioSep-Modells in einer Zero-Shot-Einstellung zu bewerten, haben die Entwickler die Leistung auf nicht gesehene Datensätze fortgesetzt, und das AudioSep-Modell zeigt eine beeindruckende Trennleistung in einer Zero-Shot-Einstellung, und die Ergebnisse sind in der folgenden Abbildung dargestellt.

Darüber hinaus zeigt die folgende Abbildung die Ergebnisse der Evaluierung des AudioSep-Modells gegenüber der Voicebank-Demand-Sprachverbesserung.

Die Evaluierung des AudioSep-Modells zeigt eine starke und gewünschte Leistung auf nicht gesehene Datensätze in einer Zero-Shot-Einstellung, und damit wird der Weg für die Durchführung von Klangoperationen auf neuen Datenverteilungen geebnet.
Visualisierung der Trennergebnisse
Die folgende Abbildung zeigt die Ergebnisse, die die Entwickler erhalten haben, als sie das AudioSep-CLAP-Modell verwendet haben, um die Spektrogramme von Ground-Truth-Ziel-Klangquellen, Audio-Mischungen und getrennten Audioquellen mithilfe von Textabfragen von verschiedenen Audio- oder Klangen zu visualisieren. Die Ergebnisse ermöglichen es den Entwicklern, zu beobachten, dass das Muster der getrennten Quelle des Spektrogramms dem Quellmuster der Ground-Truth nahe kommt, was die objektiven Ergebnisse, die während der Experimente erhalten wurden, weiter unterstützt.

Vergleich von Textabfragen
Die Entwickler haben die Leistung von AudioSep-CLAP und AudioSep-CLIP auf AudioCaps Mini bewertet und haben die AudioSet-Ereignisbeschriftungen, die AudioCaps-Beschreibungen und die neu annotierten natürlichen Sprachbeschreibungen verwendet, um die Auswirkungen verschiedener Abfragen zu untersuchen, und die folgende Abbildung zeigt ein Beispiel für AudioCaps Mini.

Zusammenfassung
AudioSep ist ein grundlegendes Modell, das entwickelt wurde, um ein offenes universelles Klangtrennmodell zu sein, das natürliche Sprachbeschreibungen für die Klangtrennung verwendet. Wie während der Evaluierung beobachtet, ist das AudioSep-Modell in der Lage, Zero-Shot- und unüberwachtes Lernen nahtlos durchzuführen, indem es Audio-Beschreibungen oder Text-Beschriftungen als Abfragen verwendet. Die Ergebnisse und die Evaluierungsleistung von AudioSep zeigen eine starke Leistung, die die aktuellen State-of-the-Art-Klangtrennmodelle wie LASS übertrifft, und es könnte ausreichend sein, um die aktuellen Einschränkungen von populären Klangtrennmodellen zu überwinden.












