Angolo di Anderson
Falsare corpi ‘Migliori’ con l’IA

Una nuova ricerca dell’Accademia DAMO di Alibaba offre un flusso di lavoro basato sull’IA per automatizzare la rimodellazione di immagini di corpi – un raro sforzo in un settore della visione artificiale attualmente occupato da manipolazioni basate sul volto come deepfake e editing del volto basato su GAN.

Inserito nelle colonne “result”, le mappe di attenzione generate che definiscono le aree da modificare. Fonte: https://arxiv.org/pdf/2203.04670.pdf
L’architettura dei ricercatori utilizza la stima della posa scheletrica per affrontare la maggiore complessità che i sistemi di sintesi e modifica delle immagini incontrano nel concettualizzare e parametrizzare le immagini corporee esistenti, almeno a un livello di granularità che consenta effettivamente modifiche significative e selettive.

Le mappe scheletriche stimate aiutano a individuare e concentrare l’attenzione sulle aree del corpo più probabili da ritoccare, come la zona della parte superiore del braccio.
Il sistema consente infine all’utente di impostare parametri che possono modificare l’aspetto del peso, della massa muscolare o della distribuzione del peso in foto a figura intera o a mezza figura di persone, ed è in grado di generare trasformazioni arbitrarie su sezioni corporee vestite o nude.

Sinistra, l’immagine di ingresso; centro, una mappa termica delle aree di attenzione derivata; destra, l’immagine trasformata.
La motivazione del lavoro è lo sviluppo di flussi di lavoro automatizzati che possano sostituire le laboriose manipolazioni digitali eseguite da fotografi e artisti grafici in vari settori dei media, dalla moda alla produzione di riviste e materiale pubblicitario.
In generale, gli autori riconoscono che queste trasformazioni sono solitamente applicate con tecniche di “warp” in Photoshop e altri editor bitmap tradizionali, e sono quasi esclusivamente utilizzate su immagini di donne. Di conseguenza, il dataset personalizzato sviluppato per facilitare il nuovo processo è composto principalmente da foto di soggetti femminili:
‘Poiché il ritocco del corpo è principalmente desiderata dalle donne, la maggior parte della nostra collezione è costituita da foto femminili, considerando la diversità di età, razze (Africana:Asiatica:Caucasica = 0.33:0.35:0.32), pose e indumenti.’
Il paper è intitolato Structure-Aware Flow Generation for Human Body Reshaping e proviene da cinque autori associati all’accademia globale DAMO di Alibaba.
Sviluppo del dataset
Come di consueto nei sistemi di sintesi e modifica delle immagini, l’architettura del progetto ha richiesto un dataset di addestramento personalizzato. Gli autori hanno commissionato a tre fotografi di produrre manipolazioni standard in Photoshop di immagini appropriate tratte dal sito di fotografia stock Unsplash, ottenendo un dataset – intitolato BR-5K* – di 5.000 immagini ad alta qualità a risoluzione 2K.
I ricercatori sottolineano che l’obiettivo dell’addestramento su questo dataset non è produrre caratteristiche “idealizzate” e generalizzate relative a un indice di attrattività o aspetto desiderabile, ma piuttosto estrarre le mappature di caratteristiche centrali associate alle manipolazioni professionali delle immagini corporee.
Tuttavia, ammettono che le manipolazioni riflettono alla fine processi trasformativi che tracciano una progressione dal “reale” a una nozione predefinita di “ideale”:
‘Invitiamo tre artisti professionisti a ritoccare i corpi usando Photoshop in modo indipendente, con l’obiettivo di ottenere figure snelle che soddisfino l’estetica popolare, e selezioniamo la migliore come verità di riferimento.’
Poiché il framework non tratta affatto i volti, questi sono stati sfocati prima di essere inclusi nel dataset.
Architettura e concetti fondamentali
Il flusso di lavoro del sistema prevede l’inserimento di un ritratto ad alta risoluzione, il suo downsampling a una risoluzione inferiore compatibile con le risorse computazionali disponibili, e l’estrazione di una posa scheletrica stimata (seconda figura da sinistra nell’immagine sotto), nonché dei Part Affinity Fields (PAF), introdotti nel 2016 dal Robotics Institute della Carnegie Mellon University (vedi video incorporato direttamente sotto).
I Part Affinity Fields aiutano a definire l’orientamento degli arti e l’associazione generale con la struttura scheletrica più ampia, fornendo al nuovo progetto uno strumento aggiuntivo di attenzione/localizzazione.

Dal documento del 2016 sui Part Affinity Fields, i PAF predetti codificano l’orientamento degli arti come parte di un vettore 2D che include anche la posizione generale dell’arto. Fonte: https://arxiv.org/pdf/1611.08050.pdf
Nonostante la loro apparente irrilevanza per l’aspetto del peso, le mappe scheletriche sono utili per indirizzare i processi trasformativi finali verso le parti del corpo da modificare, come le braccia superiori, il retro e le cosce.
Dopo questo, i risultati vengono inviati a un Structure Affinity Self-Attention (SASA) nel collo di bottiglia centrale del processo (vedi immagine sotto).

Il SASA regola la coerenza del generatore di flusso che alimenta il processo; i risultati vengono poi passati al modulo di warping (secondo da destra nell’immagine sopra), che applica le trasformazioni apprese dall’addestramento sulle revisioni manuali incluse nel dataset.

Il modulo Structure Affinity Self-Attention (SASA) assegna attenzione alle parti corporee pertinenti, contribuendo a evitare trasformazioni superflue o irrilevanti.
L’immagine di output viene successivamente riportata alla risoluzione originale 2K, usando processi non dissimili dall’architettura deepfake standard del 2017 da cui sono stati derivati pacchetti popolari come DeepFaceLab; il processo di upsampling è comune anche nei framework di editing basati su GAN.
La rete di attenzione dello schema è modellata sulle Compositional De-Attention Networks (CODA), una collaborazione accademica USA/Singapore del 2019 con Amazon (AMZN ) AI e Microsoft.
Test
Il framework basato su flusso è stato testato contro metodi basati su flusso precedenti FAL e Animating Through Warping (ATW), nonché architetture di traduzione d’immagine Pix2PixHD e GFLA, con SSIM, PSNR e LPIPS come metriche di valutazione.

Risultati dei test iniziali (la direzione della freccia nelle intestazioni indica se valori più bassi o più alti sono migliori).
In base a queste metriche adottate, il sistema degli autori supera le architetture precedenti.

Risultati selezionati. Si prega di consultare il PDF originale collegato in questo articolo per confronti ad alta risoluzione.
Oltre alle metriche automatizzate, i ricercatori hanno condotto uno studio con utenti (colonna finale della tabella dei risultati mostrata in precedenza), in cui 40 partecipanti hanno visualizzato 30 domande selezionate casualmente da un pool di 100 domande relative alle immagini prodotte con i vari metodi. Il 70 % dei rispondenti ha preferito la nuova tecnica come più “visivamente attraente”.
Sfide
Il nuovo paper rappresenta una rara incursione nella manipolazione corporea basata sull’IA. Il settore della sintesi d’immagine è attualmente molto più interessato a generare corpi modificabili tramite metodi come Neural Radiance Fields (NeRF), o è fissato sull’esplorazione dello spazio latente dei GAN e sul potenziale degli autoencoder per la manipolazione facciale.
L’iniziativa degli autori è attualmente limitata a produrre cambiamenti nel peso percepito, e non hanno implementato alcuna tecnica di inpainting che possa ripristinare lo sfondo inevitabilmente rivelato quando si snellisce l’immagine di una persona.
Tuttavia, propongono che il matting del ritratto e la fusione dello sfondo tramite inferenza testurale potrebbero risolvere facilmente il problema di ripristinare le parti del mondo precedentemente nascoste nell’immagine dall’“imperfezione” umana.

Una soluzione proposta per ripristinare lo sfondo rivelato dalla riduzione del grasso guidata dall’IA.
* Sebbene il preprint faccia riferimento a materiale supplementare che fornisce maggiori dettagli sul dataset, nonché a ulteriori esempi del progetto, la posizione di questo materiale non è resa disponibile nel paper, e l’autore corrispondente non ha ancora risposto alla nostra richiesta di accesso.
Pubblicato per la prima volta il 10 marzo 2022.












