KI-Modelle und Plattformen
Sapiens: Grundlage für menschliche Vision-Modelle
Der bemerkenswerte Erfolg von groß angelegten Vorbereitungen, gefolgt von einer feinen Anpassung für Sprachmodelle, hat diesen Ansatz als Standardpraxis etabliert. Ähnlich verhält es sich mit Computer-Vision-Methoden, die zunehmend umfangreiche Datenmengen für die Vorbereitung verwenden. Die Entstehung großer Datensätze wie LAION5B, Instagram-3,5B, JFT-300M, LVD142M, Visual Genome und YFCC100M ermöglicht die Erforschung eines Datenkorpus, das weit über den Umfang traditioneller Benchmarks hinausgeht. Hervorragende Arbeiten in diesem Bereich umfassen DINOv2, MAWS und AIM. DINOv2 erreicht Spitzenleistungen bei der Erzeugung von selbstüberwachten Merkmalen durch Skalierung der kontrastiven iBot-Methode auf dem LDV-142M-Datensatz. MAWS untersucht die Skalierung von maskierten Autoencodern (MAE) auf Billionen von Bildern. AIM erforscht die Skalierbarkeit von autoregressiver visueller Vorbereitung ähnlich wie BERT für Vision-Transformer. Im Gegensatz zu diesen Methoden, die hauptsächlich auf allgemeine Bildvorbereitung oder Zero-Shot-Bildklassifizierung ausgerichtet sind, verfolgt Sapiens einen eindeutig menschenzentrierten Ansatz: Sapiens-Modelle nutzen eine umfangreiche Sammlung von menschlichen Bildern für die Vorbereitung und feine Anpassung für eine Reihe von menschlichen Aufgaben.
Es wurden erhebliche Fortschritte in kontrollierten oder Studio-Umgebungen erzielt, doch bestehen Herausforderungen fort, wenn diese Methoden auf unkontrollierte Umgebungen ausgeweitet werden sollen. Um diese Herausforderungen zu bewältigen, ist es entscheidend, vielseitige Modelle zu entwickeln, die mehrere grundlegende Aufgaben wie Schlüsselpunkt-Schätzung, Körpersegmentierung, Tiefenschätzung und Oberflächen-Normalen-Vorhersage aus Bildern in natürlichen Umgebungen ausführen können. Sapiens zielt darauf ab, Modelle für diese wesentlichen menschlichen Vision-Aufgaben zu entwickeln, die sich auf wilde Umgebungen verallgemeinern lassen. Derzeit enthalten die größten öffentlich zugänglichen Sprachmodelle über 100 Milliarden Parameter, während die häufiger verwendeten Sprachmodelle etwa 7 Milliarden Parameter aufweisen. Im Gegensatz dazu wurden Vision-Transformer (ViT) trotz ähnlicher Architektur nicht in diesem Umfang erfolgreich skaliert. Während es bemerkenswerte Bemühungen in diese Richtung gibt, einschließlich der Entwicklung eines dichten ViT-4B, der auf Text und Bildern trainiert wurde, und der Formulierung von Techniken für das stabile Training eines ViT-22B, liegen die häufig verwendeten Vision-Backbones zwischen 300 Millionen und 600 Millionen Parametern und werden in der Regel bei einer Bildauflösung von etwa 224 Pixeln vorgebildet.
Sapiens präsentiert eine Familie von Modellen für vier grundlegende menschenzentrierte Vision-Aufgaben: 2D-Pose-Schätzung, Körpersegmentierung, Tiefenschätzung und Oberflächen-Normalen-Vorhersage. Sapiens-Modelle unterstützen native 1K-Hochauflösungsinferenz und sind extrem einfach anzupassen, indem sie einfach auf Modelle feinjustiert werden, die auf über 300 Millionen wilden menschlichen Bildern vorgebildet wurden. Sapiens beobachtet, dass, bei gleichem Rechenbudget, selbstüberwachte Vorbereitung auf einem kuratierten Datensatz von menschlichen Bildern die Leistung für eine Vielzahl von menschenzentrierten Aufgaben erheblich steigert. Die resultierenden Modelle zeigen bemerkenswerte Verallgemeinerung auf wilde Daten, selbst wenn gelabelte Daten knapp oder vollständig synthetisch sind. Die einfache Modellgestaltung bringt auch Skalierbarkeit – die Modellleistung über Aufgaben hinweg verbessert sich, wenn die Anzahl der Parameter von 0,3 auf 2 Milliarden skaliert. Sapiens übertrifft bestehende Baselines in verschiedenen menschenzentrierten Benchmarks konsequent und erzielt signifikante Verbesserungen gegenüber vorherigen Spitzenleistungen: 7,6 mAP auf Humans-5K (Pose), 17,1 mIoU auf Humans-2K (Teil-Segmentierung), 22,4% relative RMSE auf Hi4D (Tiefe) und 53,5% relative Winkelabweichung auf THuman2 (Normal).
Sapiens: Durchbruch in menschlichen Vision-Modellen
In den letzten Jahren gab es bemerkenswerte Fortschritte bei der Erzeugung photorealistischer Menschen in 2D und 3D. Der Erfolg dieser Methoden ist großteils der robusten Schätzung verschiedener Assets wie 2D-Schlüsselpunkte, feinkörniger Körpersegmentierung, Tiefe und Oberflächen-Normalen zu verdanken. Die robuste und genaue Schätzung dieser Assets bleibt jedoch ein aktives Forschungsgebiet, und komplizierte Systeme zur Leistungssteigerung für einzelne Aufgaben behindern oft eine breitere Anwendung. Darüber hinaus ist es bekanntermaßen schwierig, genaue Ground-Truth-Annotierungen in wilden Umgebungen zu erhalten. Sapiens zielt darauf ab, ein einheitliches Framework und Modelle bereitzustellen, um diese Assets in wilden Umgebungen zu schätzen und damit eine Vielzahl von menschenzentrierten Anwendungen für jeden zugänglich zu machen.
Sapiens argumentiert, dass solche menschenzentrierten Modelle drei Kriterien erfüllen sollten: Verallgemeinerung, breite Anwendbarkeit und hohe Treue. Verallgemeinerung stellt die Robustheit gegenüber unbekannten Bedingungen sicher, sodass das Modell konsistent in verschiedenen Umgebungen performen kann. Breite Anwendbarkeit zeigt die Vielseitigkeit des Modells, wodurch es für eine Vielzahl von Aufgaben mit minimalen Anpassungen geeignet ist. Hohe Treue bedeutet die Fähigkeit des Modells, präzise, hochauflösende Ausgaben zu erzeugen, die für treue menschliche Erzeugungsaufgaben unerlässlich sind. Dieses Papier beschreibt die Entwicklung von Modellen, die diese Attribute verkörpern, die kollektiv als Sapiens bezeichnet werden.
Basierend auf diesen Erkenntnissen nutzt Sapiens große Datensätze und skalierbare Modellarchitekturen, die für die Verallgemeinerung entscheidend sind. Für eine breitere Anwendbarkeit verwendet Sapiens den Vorbereitungs-und-Feinjustierungsansatz, der eine Anpassung an spezifische Aufgaben mit minimalen Anpassungen ermöglicht. Dieser Ansatz wirft eine kritische Frage auf: Welche Art von Daten ist für die Vorbereitung am effektivsten? Angesichts der Rechenbegrenzungen sollte der Schwerpunkt auf die Sammlung von so vielen menschlichen Bildern wie möglich gelegt werden oder ist es vorzuziehen, auf einem weniger kuratierten Satz zu trainieren, um die reale Weltvariabilität besser zu reflektieren? Bestehende Methoden übersehen oft die Verteilung der Vorbereitungsdaten im Kontext von Downstream-Aufgaben. Um den Einfluss der Verteilung der Vorbereitungsdaten auf menschenspezifische Aufgaben zu untersuchen, sammelt Sapiens den Humans-300M-Datensatz, der 300 Millionen vielfältige menschliche Bilder umfasst. Diese ungelabelten Bilder werden verwendet, um eine Familie von Vision-Transformern von Grund auf vorzubilden, wobei die Parameterzahlen von 300 Millionen bis 2 Milliarden reichen.
Unter den verschiedenen Selbstüberwachungsmethoden für das Lernen allgemeiner visueller Merkmale aus großen Datensätzen wählt Sapiens den maskierten-Autoencoder (MAE)-Ansatz aufgrund seiner Einfachheit und Effizienz bei der Vorbereitung. MAE, das ein Ein-Pass-Inferenzmodell im Vergleich zu kontrastiven oder Multi-Inferenzstrategien hat, ermöglicht die Verarbeitung einer größeren Menge an Bildern mit denselben Rechenressourcen. Für eine höhere Treue erhöht Sapiens im Gegensatz zu vorherigen Methoden die native Eingabeauflösung der Vorbereitung auf 1024 Pixel, was einer etwa vierfachen Erhöhung der FLOPs im Vergleich zum größten bestehenden Vision-Backbone entspricht. Jedes Modell wird auf 1,2 Billionen Token vorbereitet. Für die Feinjustierung auf menschenzentrierten Aufgaben verwendet Sapiens eine konsistente Encoder-Decoder-Architektur. Der Encoder wird mit den Gewichten aus der Vorbereitung initialisiert, während der Decoder, ein leichtes und aufgabenspezifisches Head, zufällig initialisiert wird. Beide Komponenten werden dann von Ende zu Ende feinjustiert. Sapiens konzentriert sich auf vier Schlüsselaufgaben: 2D-Pose-Schätzung, Körpersegmentierung, Tiefe und Normalen-Schätzung, wie in der folgenden Abbildung gezeigt.

Konsistent mit vorherigen Studien bestätigt Sapiens die entscheidende Auswirkung der Labelqualität auf die Leistung des Modells in wilden Umgebungen. Öffentliche Benchmarks enthalten oft verrauschte Labels, die inkonsistente Aufsichtssignale während der Feinjustierung des Modells liefern. Gleichzeitig ist es wichtig, feinkörnige und präzise Annotierungen zu verwenden, um eng mit Sapiens’ primärem Ziel der 3D-menschlichen Digitalisierung übereinzustimmen. Zu diesem Zweck schlägt Sapiens einen wesentlich dichteren Satz von 2D-ganzkörpigen Schlüsselpunkten für die Pose-Schätzung und eine detaillierte Klassen-Vokabular für die Körpersegmentierung vor, die den Umfang vorheriger Datensätze übertrifft. Insbesondere führt Sapiens eine umfassende Sammlung von 308 Schlüsselpunkten ein, die den Körper, Hände, Füße, Oberfläche und Gesicht umfassen. Darüber hinaus erweitert Sapiens das Segmentierungs-Klassen-Vokabular auf 28 Klassen, die Körperteile wie Haare, Zunge, Zähne, Ober- und Unterlippe und Torso umfassen. Um die Qualität und Konsistenz der Annotierungen sowie ein hohes Maß an Automatisierung zu gewährleisten, verwendet Sapiens eine Multi-View-Aufnahmeeinrichtung, um Pose- und Segmentierungs-Annotierungen zu sammeln. Sapiens verwendet auch menschenzentrierte synthetische Daten für die Tiefen- und Normalen-Schätzung, indem es 600 detaillierte Scans von RenderPeople nutzt, um hochauflösende Tiefen-Karten und Oberflächen-Normalen zu erzeugen. Sapiens zeigt, dass die Kombination von domänen-spezifischer groß angelegter Vorbereitung mit begrenzten, aber hochwertigen Annotierungen zu robuster Verallgemeinerung in wilden Umgebungen führt. Insgesamt zeigt Sapiens’ Methode eine effektive Strategie für die Entwicklung hochpräziser diskriminativer Modelle, die in der Lage sind, in realen Szenarien zu performen, ohne die Notwendigkeit, eine teure und vielfältige Sammlung von Annotierungen zu sammeln.

Sapiens: Methode und Architektur
Sapiens folgt dem maskierten-Autoencoder (MAE)-Ansatz für die Vorbereitung. Das Modell wird trainiert, um das ursprüngliche menschliche Bild anhand seiner partiellen Beobachtung zu rekonstruieren. Wie alle Autoencoder hat Sapiens’ Modell einen Encoder, der das sichtbare Bild auf eine latente Repräsentation kartiert, und einen Decoder, der das ursprüngliche Bild aus dieser latenten Repräsentation rekonstruiert. Der Vorbereitungsdatensatz besteht aus sowohl einzelnen als auch multiplen menschlichen Bildern, wobei jedes Bild auf eine feste Größe mit einem quadratischen Seitenverhältnis skaliert wird. Ähnlich wie bei ViT wird das Bild in regelmäßige, nicht überlappende Patches mit einer festen Patches-Größe unterteilt. Ein Teil dieser Patches wird zufällig ausgewählt und maskiert, während der Rest sichtbar bleibt. Das Verhältnis der maskierten Patches zu den sichtbaren, bekannt als Masken-Verhältnis, bleibt während des Trainings konstant.
Sapiens’ Modelle zeigen Verallgemeinerung über eine Vielzahl von Bildmerkmalen, einschließlich Skalierungen, Crops, Alter und Ethnie der Probanden sowie der Anzahl der Probanden. Jeder Patch-Token im Modell entspricht 0,02% der Bildfläche im Vergleich zu 0,4% bei Standard-ViTs, eine 16-fache Reduktion – dies ermöglicht feinkörnige Inter-Token-Argumentation für die Modelle. Selbst bei einem erhöhten Masken-Verhältnis von 95% erreicht Sapiens’ Modell eine plausible Rekonstruktion der menschlichen Anatomie in gehaltenen Proben. Die Rekonstruktion von Sapiens’ vorgetrainiertem Modell auf unbekannten menschlichen Bildern wird in der folgenden Abbildung gezeigt.

Darüber hinaus nutzt Sapiens einen großen proprietären Datensatz für die Vorbereitung, der etwa 1 Milliarde wilde Bilder umfasst, die sich ausschließlich auf menschliche Bilder konzentrieren. Die Vorverarbeitung umfasst das Entfernen von Bildern mit Wasserzeichen, Text, künstlerischen Darstellungen oder unnatürlichen Elementen. Sapiens verwendet dann einen off-the-shelf-Personen-Begrenzungs-Box-Detektor, um Bilder zu filtern, die solche mit einer Erkennungswahrscheinlichkeit von über 0,9 und Begrenzungs-Box-Dimensionen von über 300 Pixeln beibehält. Über 248 Millionen Bilder im Datensatz enthalten mehrere Probanden.
2D-Pose-Schätzung
Das Sapien-Framework feinjustiert den Encoder und Decoder in P über mehrere Skelette, einschließlich K = 17 [67], K = 133 [55] und einem neuen, hochdetaillierten Skelett mit K = 308, wie in der folgenden Abbildung gezeigt.

Im Vergleich zu bestehenden Formaten mit maximal 68 Gesichts-Schlüsselpunkten besteht Sapiens’ Annotierung aus 243 Gesichts-Schlüsselpunkten, einschließlich repräsentativer Punkte um die Augen, Lippen, Nase und Ohren. Diese Gestaltung ist darauf ausgerichtet, die nuancierten Details von Gesichtsausdrücken in der realen Welt sorgfältig zu erfassen. Mit diesen Schlüsselpunkten hat das Sapien-Framework 1 Million Bilder bei 4K-Auflösung aus einer Innen-Aufnahmeeinrichtung manuell annotiert. Ähnlich wie bei vorherigen Aufgaben wird die Ausgabekanäle des Decoders des Normal-Estimators N auf 3 gesetzt, entsprechend den xyz-Komponenten des Normalvektors an jedem Pixel. Die erzeugten synthetischen Daten werden auch als Aufsicht für die Oberflächen-Normalen-Schätzung verwendet.

Sapien: Experiment und Ergebnisse
Sapiens-2B wird mit 1024 A100-GPUs für 18 Tage mit PyTorch vorgetrainiert. Sapiens verwendet den AdamW-Optimizer für alle Experimente. Der Lernplan umfasst eine kurze lineare Aufwärmen, gefolgt von Cosine-Annealing für die Vorbereitung und linearem Abfall für die Feinjustierung. Alle Modelle werden von Grund auf bei einer Auflösung von 1024 × 1024 mit einer Patches-Größe von 16 vorgetrainiert. Für die Feinjustierung wird das Eingabe-Bild auf ein 4:3-Verhältnis skaliert, d. h. 1024 × 768. Sapiens wendet Standard-Augmentierungen wie Beschneiden, Skalieren, Spiegeln und photometrische Verzerrungen an. Ein zufälliger Hintergrund aus nicht-menschlichen COCO-Bildern wird für Segmentierungs-, Tiefen- und Normalen-Vorhersage-Aufgaben hinzugefügt. Wichtig ist, dass Sapiens unterschiedliche Lernraten verwendet, um die Verallgemeinerung zu bewahren, mit niedrigeren Lernraten für die Anfangsschichten und zunehmend höheren Raten für die nachfolgenden Schichten. Der schichtweise Lernraten-Abfall ist auf 0,85 mit einem Gewichts-Abfall von 0,1 für den Encoder gesetzt.
Die Designspezifikationen von Sapiens sind in der folgenden Tabelle detailliert. In Anlehnung an einen bestimmten Ansatz priorisiert Sapiens die Skalierung von Modellen durch Breite anstelle von Tiefe. Bemerkenswerterweise besteht das Sapiens-0,3B-Modell, obwohl es architektonisch ähnlich wie das traditionelle ViT-Large ist, aus zwanzigfach mehr FLOPs aufgrund seiner höheren Auflösung.

Sapiens wird für Gesichts-, Körper-, Füße- und Hand-Pose-Schätzung (K = 308) feinjustiert, indem es hochwertige Annotierungen verwendet. Für das Training verwendet Sapiens den Trainings-Set mit 1 Million Bildern, und für die Bewertung verwendet es den Test-Set, genannt Humans5K, mit 5.000 Bildern. Die Bewertung erfolgt nach einem Top-Down-Ansatz, bei dem Sapiens einen off-the-shelf-Detektor für Begrenzungs-Boxen verwendet und eine einzelne menschliche Pose-Schätzung durchführt. Tabelle 3 zeigt einen Vergleich von Sapiens-Modellen mit bestehenden Methoden für die ganze Körper-Pose-Schätzung. Alle Methoden werden auf 114 gemeinsamen Schlüsselpunkten zwischen Sapiens’ 308-Schlüsselpunkte-Vokabular und dem 133-Schlüsselpunkte-Vokabular von COCO-WholeBody bewertet. Sapiens-0,6B übertrifft die aktuelle Spitzenleistung, DWPose-l, um +2,8 AP. Im Gegensatz zu DWPose, das ein komplexes Student-Lehrer-Framework mit Feature-Distillation für die Aufgabe verwendet, verwendet Sapiens eine allgemeine Encoder-Decoder-Architektur mit großer menschenzentrierter Vorbereitung.
Interessanterweise zeigt Sapiens-Modelle auch bei gleicher Parameterzahl eine überlegene Leistung im Vergleich zu ihren Gegenstücken. Zum Beispiel übertrifft Sapiens-0,3B VitPose+-L um +5,6 AP, und Sapiens-0,6B übertrifft VitPose+-H um +7,9 AP. Innerhalb der Sapiens-Familie zeigen die Ergebnisse eine direkte Korrelation zwischen Modellgröße und Leistung. Sapiens-2B setzt einen neuen Spitzenwert mit 61,1 AP, was eine signifikante Verbesserung von +7,6 AP gegenüber dem vorherigen Spitzenwert darstellt. Trotz der Feinjustierung mit Annotierungen aus einer Innen-Aufnahmeeinrichtung zeigt Sapiens eine robuste Verallgemeinerung auf reale Szenarien, wie in der folgenden Abbildung gezeigt.

Sapiens wird für die Segmentierung mit einem Vokabular von 28 Klassen feinjustiert. Der Trainings-Set besteht aus 100.000 Bildern, während der Test-Set, Humans-2K, aus 2.000 Bildern besteht. Sapiens wird mit bestehenden Körpersegmentierungs-Methoden verglichen, die auf demselben Trainings-Set feinjustiert wurden, unter Verwendung der vorgeschlagenen vorgetrainierten Checkpoints als Initialisierung. Ähnlich wie bei der Pose-Schätzung zeigt Sapiens eine Verallgemeinerung bei der Segmentierung, wie in der folgenden Tabelle gezeigt.

Interessanterweise übertrifft das kleinste Modell, Sapiens-0,3B, bestehende Spitzenleistungen bei der Segmentierung wie Mask2Former und DeepLabV3+ um 12,6 mIoU aufgrund seiner höheren Auflösung und großen menschenzentrierten Vorbereitung. Darüber hinaus verbessert die Erhöhung der Modellgröße die Segmentierungsleistung weiter. Sapiens-2B erreicht die beste Leistung mit 81,2 mIoU und 89,4 mAcc auf dem Test-Set, wie in der folgenden Abbildung gezeigt.

Schlussfolgerung
Sapiens stellt einen bedeutenden Schritt zur Weiterentwicklung menschenzentrierter Vision-Modelle in den Bereich der Grundlagen-Modelle dar. Sapiens-Modelle zeigen starke Verallgemeinerungsfähigkeiten über eine Vielzahl von menschenzentrierten Aufgaben hinweg. Die Spitzenleistung wird den folgenden Faktoren zugeschrieben: (i) groß angelegte Vorbereitung auf einem kuratierten Datensatz, der speziell für das Verständnis von Menschen entwickelt wurde, (ii) skalierte hochauflösende und hochkapazitive Vision-Transformer-Backbones und (iii) hochwertige Annotierungen auf augmentierten Studio- und synthetischen Daten. Sapiens-Modelle haben das Potenzial, zu einem wichtigen Baustein für eine Vielzahl von Downstream-Aufgaben zu werden und bieten Zugang zu hochwertigen Vision-Backbones für einen wesentlich größeren Teil der Gemeinschaft.












