Η γωνία του Anderson
Διόρθωση Θολού Βίντεο Κλήσεων σε Πραγματικό Χρόνο Χρησιμοποιώντας Μόνο CPU

Μια νέα μέθοδος δημιουργεί ένα μοντέλο AI του προσώπου σας σε δευτερόλεπτα, για να διορθώσει θόλες βίντεο κλήσεων σε πραγματικό χρόνο – εκτελώντας εντελώς σε một βασικό laptop CPU, χωρίς την ανάγκη για ισχυρό υλικό ή επεξεργασία στο cloud.
Αν και οι χρήστες σε υποαπαιτούμενες χώρες επηρεάζονται περισσότερο από τις χαμηλής ποιότητας εικόνες βίντεο κλήσεων, είναι συχνά ένα “πρώτο κόσμο” πρόβλημα επίσης – για παράδειγμα, αν ένας από τους συμμετέχοντες σε μια συνομιλία χρησιμοποιεί μια υπερφορτωμένη θύρα Wi-Fi, ή κάποια άλλη διαδικασία ή άτομο στο σπίτι του συμμετέχοντα κυριαρχεί στο διαθέσιμο εύρος ζώνης· ή ακόμη και αν το άτομο επισκέπτεται μια χώρα με κακή συνδεσιμότητα.
Από τη στιγμή που το πρόβλημα είναι κοινό, μια ορισμένη ποσότητα προσοχής έχει αποδοθεί σε αυτό στην ερευνητική βιβλιογραφία, με προτεινόμενες λύσεις μέσω deblocking, denoising, super-resolution και διάφορων άλλων μεθόδων. Το VQFR system από το 2022 αποκαθιστά υποβαθμισμένες εικόνες προσώπου αντικαθιστώντας χαρακτηριστικά εικόνας χαμηλής ποιότητας με υψηλότερης ποιότητας αναπαραστάσεις που προέρχονται από ένα εκμαθημένο codebook· το GFP-GAN του 2021 αξιοποιεί γενετικές προτεραιότητες προσώπου για να βελτιώσει εικόνες χαμηλής ποιότητας· και το RTFVE: Realtime Face Video Enhancement χρησιμοποιεί υψηλής ποιότητας αναφορικές εικόνες για να thực hiện αποκατάσταση προσώπου:
Κάντε κλικ για αναπαραγωγή, ανάλογα με τις ανάγκες. Από το έργο RTFVE για την ενίσχυση του προσώπου το 2025, βελτίωση προσώπου με επιτάχυνση GPU. Πηγή
Από την οπτική του υποαπαιτούμενου χρήστη, οι περισσότερες από αυτές τις λύσεις δεν είναι βιώσιμες, поскольку εκχωρούν το έργο σε μια GPU που μπορεί να μην είναι διαθέσιμη στη ρύθμιση του χρήστη. Ωστόσο, η χρήση του (πολύ λιγότερο ικανού) CPU για εργασίες υπολογιστή είναι συνήθως μια διαδικασία εκτός σύνδεσης, που σημαίνει ότι θα πρέπει να περιμένετε μέχρι ο CPU να ολοκληρώσει την επεξεργασία πριν η έξοδος είναι διαθέσιμη.
Αυτό είναι απαράδεκτο για το σενάριο της βίντεο κλήσης, το οποίο είναι πλούσιο σε πόρους αλλά συχνά και φτωχό σε πόρους· οποιοδήποτε πραγματικά δημοκρατικό σύστημα βελτίωσης του προσώπου θα πρέπει να εκτελεστεί στο CPU με ελάχιστη ταχύτητα 24fps σε μια λογική ανάλυση· και αυτό είναι πολλά να ζητηθεί.
Αντιμετώπιση
Αυτή η απαιτητική περίπτωση αντιμετωπίζεται από μια νέα ερευνητική προσφορά από τις ΗΠΑ, η οποία είναι ικανή, όπως ισχυρίζονται οι συγγραφείς, να εκπαιδεύσει ένα μοντέλο σε λιγότερο από 100 δευτερόλεπτα από σπάνιες καρέ του προσώπου του θεατή, με το τελικό μοντέλο να εκτελείται ως μεσολαβικό στρώμα μεταξύ του χρήστη και της διάσκεψης, μέσω επίσημων API στρωμάτων σε εφαρμογές βίντεο-συνδιάσκεψης όπως το Zoom:
Κάντε κλικ για αναπαραγωγή, ανάλογα με τις ανάγκες. Από τη σελίδα του έργου για το FSFVE, δείγματα βελτιώσεων σε σενάρια βίντεο-κλήσεων, χρησιμοποιώντας ένα ελαφρύ (3,5 MB) μοντέλο που εκπαιδεύτηκε σε λιγότερο από δύο λεπτά. Πηγή
Το έγγραφο αναφέρει:
‘Το μοντέλο FSFVE μπορεί να εκπαιδευτεί είτε λίγο πριν από μια βίντεο-κλήση, είτε στην αρχή της κλήσης. Απαιτούνται μόνο quelques υψηλής ποιότητας εικόνες του υποκειμένου· π.χ. 5 έως 30 εικόνες, καθιστώντας το ένα few-shot εκμάθηση. Λίγο πριν από την κλήση, ή στην αρχή της κλήσης, μπορεί να ληφθεί μια μικρή ποσότητα υψηλής ποιότητας βίντεο του χρήστη· για παράδειγμα, 3 δευτερόλεπτα, παρέχοντας 3∗24=72 καρέ, υποθέτοντας μια ταχύτητα καρέ 24 καρέ/δευτερόλεπτο (FPS).
‘Αυτό το υψηλής ποιότητας βίντεο μπορεί να κωδικοποιηθεί γρήγορα σε ένα βίντεο χαμηλής ποιότητας με βάση τις ρυθμίσεις για την βίντεο-κλήση, και στη συνέχεια, με τα χαμηλής και υψηλής ποιότητας καρέ, το μοντέλο εκπαιδεύεται.’
Μια αξιοσημείωτη ιδιότητα του νέου συστήματος είναι η ευελιξία του σε σχέση με το ποιος “πληρώνει” για την επεξεργασία του μοντέλου· αν ο θεατής δεν μπορεί για κάποιο λόγο να παρέχει την ισχύ του CPU για την εκπαίδευση, αυτό μπορεί να εκχωρηθεί στον ανταποκριτή, μέσω της αποστολής một μικρού αριθμού υψηλής ποιότητας καρέ, με το μοντέλο να εκπαιδεύεται “απομακρυσμένα” στον πόρων-ένα χρήστη.
Εναλλακτικά, η εκπαίδευση μπορεί να εκχωρηθεί συστηματικά σε einen διακομιστή για εκπαίδευση. Οι συγγραφείς παρατηρούν:
‘Ο διακομιστής μπορεί να χρησιμοποιηθεί για περιπτώσεις όπου τα装置 αποστολής και λήψης είναι πολύ αργά για εκπαίδευση (ή ακόμη και αν όχι, για να ανακουφίσουν από这一 εργασία).
‘Σε κάθε περίπτωση, το μέγεθος του μοντέλου είναι σχετικά μικρό (περίπου 3,5 MB) καθώς και quelques υψηλής ποιότητας καρέ, και όταν η εκπαίδευση ολοκληρωθεί, το μοντέλο μπορεί να εκτελεστεί σε πραγματικό χρόνο σε einen τυπικό laptop CPU.’
Σε δοκιμές, με μοντέλα που εκπαιδεύτηκαν σε σχέση με βάσεις και προηγούμενα έργα (συμπεριλαμβανομένου του προαναφερθέντος RTFVE, το οποίο αποτελεί τη βάση του νέου έργου), το FSFVE υπερέβη συνεχώς το μη βελτιωμένο συμπιεσμένο βίντεο, ένα CPU-βελτιωμένο ResNet και το τροποποιημένο μοντέλο RTFVE-0, ενώ εξακολουθούσε να εκτελείται σε πραγματικό χρόνο σε einen CPU.
Το νέο έγγραφο έχει τον τίτλο FSFVE: Few Shot Compressed Face Video Enhancement, και συνοδεύεται από ένα demo και ένα GitHub repo.
Μέθοδος
Το FSFVE εκπαιδεύτηκε στο ανοικτό FaceForensics++ dataset*, το οποίο αποτελείται από 363 βίντεο 1080p ηθοποιών που μιλάνε, από τα οποία οι συγγραφείς εξήγαγαν την κατηγορία μιλώντας ενάντια σε einen τοίχο, ως την πιο κοντινή σε στυλ σε μια τυπική βίντεο-κλήση:
Κάντε κλικ για αναπαραγωγή, ανάλογα με τις ανάγκες. Παραδείγματα από το FaceForensics++ dataset. Πηγή
Αυτό το υποσύνολο έρχεται σε 27 βίντεο περίπου 972 καρέ το καθένα – κυρίως μπροστινές απόψεις, αλλά, αναγκαία, και quelques πλευρικές απόψεις.
Για να δημιουργηθούν βίντεο χαμηλής ποιότητας που προορίζονται για να模拟σουν προβλήματα σύνδεσης βίντεο-κλήσεων, οι συγγραφείς συμπίεσαν το dataset χρησιμοποιώντας τους κωδικοποιητές βίντεο H264 και H265. Οι επιπέδα συμπίεσης ορίστηκαν σε einen εύρος CRF που περιλαμβάνει 36, 40 και 44 (συνειδητοποιώντας ότι το μηδέν είναι απώλεια και το 51 είναι εξαιρετικά μπλοκ).
Κάθε καρέ περάστηκε από einen face detector BlazeFace, μετά από οποίο τα σημεία προσώπου χρησιμοποιήθηκαν για να ευθυγραμμίσει το πρόσωπο ευθυγραμμίζοντας τα μάτια και εφαρμόζοντας einen αφινικό μετασχηματισμό (ο οποίος περιστρέφει, κλιμακώνει και μετατοπίζει το πρόσωπο σε μια συνεχή θέση), ώστε τα μάτια να παραμείνουν σε ίδια θέση και σε ίδια θέση σε όλα τα καρέ.
Αυτό πραγματοποιήθηκε με τη βοήθεια της Face Recognition library:
Παράδειγμα εξαγωγής χαρακτηριστικών προσώπου από μια εικόνα με τη Face Recognition Python library. Πηγή
Επειδή το μοντέλο σχεδιάστηκε για να μάθει από μόνο quelques καρέ από μια seule βίντεο-κλήση, τα καρέ εκπαίδευσης χρειάζονταν για να πιάσουν όσο το δυνατόν περισσότερη ποικιλία προσώπου. Γιαυτό, χρησιμοποιήθηκε η k-means clustering αντί για απλότερες μεθόδους επιλογής (π.χ. τυχαία δειγματοληψία ή σταθερά διαστήματα).
Κάθε καρέ περάστηκε από τον face encoder RTFVE για να δημιουργηθεί μια αριθμητική αναπαράσταση, μετά από οποίο η k-means clustering ομαδοποίησε παρόμοια καρέ σε 30 ομάδες. Αυτή η διαδικασία ομαδοποίησης επαναλήφθηκε πέντε φορές για να ληφθεί η καλύτερη ομαδοποίηση, και το καρέ που ήταν πιο κοντά στο κέντρο κάθε ομάδας επιλέχθηκε για εκπαίδευση. Αυτή η διαδικασία παρήγαγε einen διαφορετικό σύνολο 30 εικόνων για κάθε βίντεο.
Εκπαίδευση και Δοκιμές
Τα μοντέλα εκπαιδεύτηκαν για 100 epochs, το οποίο είναι σχετικά χαμηλό, λαμβάνοντας υπόψη τον πολύ μικρό αριθμό εικόνων που συμμετείχαν. Ωστόσο, όπως παρατηρούν οι συγγραφείς, ένα υπερ-προσαρμοσμένο μοντέλο είναι στην πραγματικότητα επιθυμητό σε αυτή τη περίπτωση, ακόμη και αν δεν μπορεί να πιάσει όλες τις πιθανές eventualities, όπως ασυνήθιστες εκφράσεις, στάσεις ή απόκρυψη/απώλεια χαρακτηριστικών προσώπου. Οι προτεραιότητες, αντίθετα, είναι μια μέτρια ευελιξία στη γενίκευση, και ταχύτητα εκπαίδευσης.
Ο RAdam optimizer χρησιμοποιήθηκε με μια ταχύτητα εκμάθησης 10-4.
Για τις αρχικές δοκιμές, το σύστημα συγκρίθηκε με το αρχικό συμπιεσμένο βίντεο· ένα ελαφρύ ResNet που ρυθμίστηκε για πραγματική CPU inference· και το προαναφερθέν RTFVE – το μόνο άλλο πραγματικό CPU σύστημα βελτίωσης προσώπου.
Για να διασφαλιστεί μια δίκαιη σύγκριση, το RTFVE τροποποιήθηκε για να αφαιρεθεί η εξάρτησή του από υψηλής ποιότητας αναφορικές εικόνες κατά τη διάρκεια της inference, διατηρώντας παράλληλα μια παρόμοια ταχύτητα και αριθμό παραμέτρων, παράγοντας μια παραλλαγή που ονομάζεται RTFVE-0. Το ResNet και το RTFVE-0 εκπαιδεύτηκαν χρησιμοποιώντας τη L1 loss function. Για να διασφαλιστεί μια δίκαιη σύγκριση, όλα τα μοντέλα χρησιμοποιούσαν τον ίδιο RAdam optimizer και τις ίδιες ρυθμίσεις εκπαίδευσης, με ένα ξεχωριστό instance-ειδικό μοντέλο που εκπαιδεύτηκε από 30 καρέ, για κάθε βίντεο.
Για να επιταχύνουν την εκπαίδευση, εισαγωγής ένας προσαρμοσμένος συντελεστής focal loss (τονίζοντας τις πιο οπτικά σημαντικές λεπτομέρειες της εικόνας κατά τη διάρκεια της εκπαίδευσης) για να δώσει μεγαλύτερο βάρος στις χαμηλής συχνότητας DCT συνιστώσες (οι πληροφορίες της εικόνας μετά τη μετατροπή σε συχνότητα), οι οποίες έχουν τη μεγαλύτερη επιρροή στην αντίληψη της ποιότητας της εικόνας.
Ο συντελεστής βαρύτητας προήλθε από την JPEG luminance quantization matrix, khiến το μοντέλο να προτεραιοποιεί τις πιο οπτικά σημαντικές δομές της εικόνας κατά τη διάρκεια της εκπαίδευσης.
Ποσοτικές Δοκιμές
Και η τεχνική ακρίβεια ανακατασκευής (διαστρέβλωση) και η αντιληπτή οπτική ποιότητα μετρήθηκαν για τις δοκιμές. Η διαστρέβλωση μετρήθηκε από το Peak Signal-to-Noise Ratio (PSNR) και το Structural Similarity Index (SSIM)· και η αντίληψη ποιότητας από το Learned Perceptual Image Patch Similarity (LPIPS):
Επιδόσεις του FSFVE σε σχέση με το αρχικό συμπιεσμένο βίντεο, ένα CPU-βελτιωμένο ResNet και το τροποποιημένο RTFVE-0 σε H.264 και H.265 βίντεο σε τρία επίπεδα συμπίεσης, με υψηλότερα PSNR και SSIM που δείχνουν καλύτερη ποιότητα ανακατασκευής, και χαμηλότερα LPIPS που δείχνουν καλύτερη αντίληψη ποιότητας.
Το FSFVE υπερέβη συνεχώς το αρχικό συμπιεσμένο βίντεο, καθώς και τα ανταγωνιστικά CPU-βελτιωμένα μοντέλα, σε όλα τα επίπεδα συμπίεσης.
Με βίντεο H.264, το PSNR αυξήθηκε κατά 1,11 dB, 1,37 dB και 1,51 dB πάνω από το βασικό επίπεδο σε CRF τιμές 36, 40 και 44, με αντίστοιχες βελτιώσεις στο SSIM και χαμηλότερες LPIPS σε σχέση με τις δύο υψηλότερες ρυθμίσεις συμπίεσης (που δείχνουν καλύτερη αντίληψη ποιότητας).
Παρόμοιες κερδισμένες καταγράφηκαν με βίντεο H.265, υποδεικνύοντας ότι η προσέγγιση παραμένει αποτελεσματική και στα δύο κύρια codecs βίντεο. Όπως φαίνεται παρακάτω, η βελτίωση έγινε πιο εμφανής καθώς η συμπίεση αυξήθηκε, δείχνοντας ότι η μέθοδος εκτελείται ιδιαίτερα καλά υπό τις συνθήκες χαμηλού εύρους ζώνης που σχεδιάστηκε για να αντιμετωπίσει:
PSNR ως bitrate αυξάνεται για το αρχικό H.264 βίντεο και την ενισχυμένη έξοδο. Η διευρυμένη διαφορά σε χαμηλότερες bitrates δείχνει ότι το FSFVE παρέχει τις μεγαλύτερες κερδισμένες ποιότητας υπό τις πιο συμπιεσμένες, περιορισμένες συνθήκες εύρους ζώνης.
Το CPU-βελτιωμένο ResNet και το RTFVE-0 παρείχαν μόνο μετριοπαθείς βελτιώσεις σε σχέση με το συμπιεσμένο βασικό επίπεδο, ενώ το FSFVE υπερέβη και τα δύο περισσότερο από 1,1 dB, διατηρώντας παράλληλα την πραγματική απόδοση σε 30,24 FPS, παρά την παρουσία ενός ελαφρού ενός εκατομμυρίου παραμέτρων.
Όπως φαίνεται παρακάτω, η απόδοση βελτιώθηκε σταδιακά καθώς αυξανόταν ο αριθμός των καρέ εκπαίδευσης. Ακόμη και με μόνο πέντε εικόνες εκπαίδευσης, το FSFVE βελτίωσε το PSNR περισσότερο από 0,75 dB σε σχέση με το συμπιεσμένο βασικό επίπεδο, ενώ δέκα εικόνες εκπαίδευσης ήταν αρκετές για να υπερβούν την 1 dB βελτίωση – δείχνοντας ότι η προσέγγιση παρέμεινε αποτελεσματική με πολύ περιορισμένα δεδομένα εκπαίδευσης:

Επίδραση του μεγέθους του συνόλου εκπαίδευσης στο PSNR για μη είδη H.264 βίντεο καρέ σε CRF 44. Ακόμη και πέντε εικόνες εκπαίδευσης βελτίωσαν την ποιότητα σε σχέση με το συμπιεσμένο βασικό επίπεδο, με την απόδοση να αυξάνεται σταδιακά καθώς αυξανόταν ο αριθμός των καρέ.
Ποιοτικές Δοκιμές
Στα αποτελέσματα που ακολουθούν, για τη ποιοτική φάση των δοκιμών, βλέπουμε συμπιεσμένα H.264 βίντεο καρέ σε CRF 44 με την αντίστοιχη έξοδο FSFVE:

Σύγκριση συμπιεσμένων H.264 βίντεο καρέ σε CRF 44 με την αντίστοιχη έξοδο FSFVE. Τα βελτιωμένα αποτελέσματα, όπως αναφέρει το έγγραφο, μειώνουν τα αρτεφάκτα συμπίεσης, αποκαθιστάν την δομή του προσώπου και παράγουν ομαλότερη, πιο φυσική επιδερμίδα ενώ διατηρούν την ταυτότητα και την έκφραση του υποκειμένου. Παρακαλώ αναφερθείτε στο αρχικό PDF και τα πρωτότυπα βίντεο για καλύτερα παραδείγματα.
Οι συγγραφείς υποστηρίζουν ότι οι συμπιεσμένες εικόνες εμφανίζουν προεξέχοντα αρτεφάκτα γύρω από τα μάτια, τη μύτη και το στόμα, μαζί με μη φυσικά υφή δέρματος και διαστρεβλώσεις σε χαρακτηριστικά προσώπου, ενώ τα βελτιωμένα αποτελέσματα μειώνουν σημαντικά αυτά τα ελαττώματα:
‘Στο πρώτο παράδειγμα, τα μάτια εμφανίζονται ασαφή με το μαύρο του μακιγιάζ να αναμιγνύεται με το χρώμα των ματιών. Υπάρχουν σαφείς ενδείξεις aliasing με τα χείλη. Τα φρύδια λείπουν ορισμού και το δέρμα εμφανίζεται διαστρεβλωμένο. Στο δεύτερο παράδειγμα, το δέρμα είναι υψηλά υφασμένο με σπείρες αρτεφάκτων.
‘Υπάρχουν αρτεφάκτα μπλοκ κάτω από το στόμα που αλλάζουν το σχήμα του πηγουνιού. Υπάρχουν επίσης οριζόντιες γραμμές.
‘Το μοντέλο μας μπορεί να θεραπεύσει αυτά τα αρτεφάκτα, παράγοντας μια οπτικά ευχάριστη έξοδο με καθαρότερο δέρμα και αποκαθιστά κάποια από τα λεπτά χαρακτηριστικά που χάθηκαν στην συμπίεση.
‘Σημαντικά, η βελτιωμένη έξοδος παραμένει πιστή στην ταυτότητα στο βίντεο.’
Σύγκλιση
Φαίνεται ότι είναι αναπόφευκτο ότι οι συνεχείς προσπάθειες σε βιομηχανία και ακαδημία για την ενίσχυση της ποιότητας των δεδομένων βίντεο-κλήσεων χαμηλής σήματος θα συναντήσουν τελικά τις αντίθετες προσπάθειες για την ανίχνευση ψευδούς βίντεο-κλήσεων σε βίντεο-κλήσεις.
Καθώς, όπως αναφέρει το νέο έγγραφο, τα διαμεσολαβικά συστήματα όπως το FSFVE μπορούν να εφαρμοστούν νομίμως σε ρεύματα βίντεο-κλήσεων μέσω επίσημων API, είναι δυνατό ότι το μη επεξεργασμένο περιεχόμενο θα παραμείνει διαθέσιμο για χρήση από μέτρα ανίχνευσης ψευδούς βίντεο, καθώς αυτά εμφανίζονται – και γίνονται πιο σημαντικά.
* Αναφερόμενο στο νέο έγγραφο ως το σύνολο δεδομένων ‘DeepFakeDetector’, αν και δεν φαίνεται να είναι γνωστό με αυτό το όνομα, ακόμη και μέσα στο έγγραφο FaceForensics++ που οι συγγραφείς συνδέουν σε αυτή τη σχέση.
Πρώτη δημοσίευση την Τρίτη, 14 Ιουλίου 2026












