Η γωνία του Anderson

Η Πρόκληση της Υπότιτλου Βίντεο σε Περισσότερα από 1fps

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

Η ικανότητα των συστημάτων μηχανικής μάθησης να αναγνωρίζουν τα γεγονότα που συμβαίνουν μέσα σε ένα βίντεο είναι κρίσιμη για το μέλλον της AI-βασισμένης γεννήτριας βίντεο – όχι τουλάχιστον επειδή τα σύνολα δεδομένων βίντεο απαιτούν ακριβείς υπότιτλους για να παράγουν μοντέλα που συμμορφώνονται με ένα αίτημα χρήστη και δεν υπερβολικά hallucinate.

Ένα παράδειγμα σχήματος υποτίτλων από το έργο VidReCap της Google. Πηγή: https://sites.google.com/view/vidrecap

Ένα παράδειγμα σχήματος υποτίτλων από το έργο VidReCap της Google. Πηγή: https://sites.google.com/view/vidrecap

Η χειροκίνητη υπότιτλωση του μεγέθους των βίντεο που χρειάζονται για αποτελεσματικά σύνολα δεδομένων είναι μια απαράδεκτη προοπτική. Αν και είναι δυνατό να εκπαιδεύσετε συστήματα AI για να auto-υποτιτλούν βίντεο, πολλά ανθρώπινα παραδείγματα είναι ακόμη απαραίτητα ως βασική αλήθεια, για ποικιλία και κάλυψη.

Περισσότερο σημαντικά, σχεδόν όλα τα τρέχοντα μοντέλα υποτίτλων βίντεο που βασίζονται στην AI λειτουργούν σε 1fps, το οποίο δεν είναι ένας πυκνός enough ρυθμός για να διακρίνει τις παραλλαγές σε πολλές περιπτώσεις: απότομες αλλαγές μικρο-εκφράσεων για συστήματα αναγνώρισης συναισθήματος; ταχεία γεγονότα σε αθλήματα υψηλής ταχύτητας όπως το μπάσκετ; βίαιες κινήσεις; ταχεία κοψίματα σε δραματικές ταινίες, όπου συστήματα όπως το PySceneDetect μπορεί να αποτύχουν να τα αναγνωρίσουν (ή δεν χρησιμοποιούνται); και πολλές άλλες περιπτώσεις όπου το παράθυρο προσοχής σαφώς χρειάζεται να είναι πιο εντατικό.

Κάντε κλικ για αναπαραγωγή. Ταχεία αλλά ζωτικής σημασίας δράση σε αυτό που αλλιώς μπορεί να είναι ένα από τα πιο αργά αθλήματα στον κόσμο, καθώς ο Alex Higgins κερδίζει το παγκόσμιο πρωτάθλημα ενάντια στον Ray Reardon το 1982. Πηγή: https://www.youtube.com/watch?v=_1PuqKno_Ok

Κινηθείτε Γρήγορα και Σπάστε τη Λογική

Αυτός ο χαμηλός ρυθμός είναι ο τυπικός για διάφορους λόγους. Για ένα, η υπότιτλωση βίντεο είναι μια δραστηριότητα που απαιτεί πολλές πόρους, είτε το σύστημα μελετάει ένα συναπτό πλαίσιο κάθε φορά, είτε χρησιμοποιεί διάφορες μεθόδους για να συνάψει μια αλυσίδα πλαισίων σε μια ακολουθία υποτίτλων που μπορεί να ερμηνευτεί. Σε κάθε περίπτωση, το παράθυρο контекστού περιορίζεται αναπόφευκτα από τους περιορισμούς του υλικού.

Ένας άλλος λόγος για τον οποίο ο ρυθμός των 1fps είναι ο τρέχων τυπικός είναι ότι τα βίντεο δεν είναι γενικά γεμάτα ταχεία γεγονότα. είναι επομένως περιττό να δώσετε 300 πλαισίων ενός στατικού πίνακα σνούκερ την ίδια προσοχή με το δευτερόλεπτο στο οποίο ένας μαύρος πινάκας κερδίζει το πρωτάθλημα (βλέπε παραπάνω παράδειγμα).

Είναι δυνατό να χρησιμοποιηθούν ευρύτερες δευτερεύουσες ενδείξεις για την αναγνώριση κρίσιμων στιγμών σε ένα αθλητικό βίντεο, όπως η διατηρημένη αντίδραση του κοινού σε ένα ταχεία σλαμ-ντάουνκ σε ένα παιχνίδι μπάσκετ. Ωστόσο, τέτοιες ενδείξεις μπορεί να συμβούν για άλλους λόγους (όπως απροσδόκητες τραυματισμοί παικτών), και δεν μπορεί να βασιστεί. Αυτό είναι ένα παράδειγμα του πώς μια λανθασμένα υποτιτλοποιημένο σύνολο δεδομένων βίντεο μπορεί να οδηγήσει σε ένα γεννήτρια βίντεο που hallucinates ή παρεξηγεί τις οδηγίες, δηλ. επειδή το μοντέλο μπορεί να δείξει einen τραυματισμό παίκτη όταν ζητήθηκε να γεννήσει ένα σλαμ-ντάουνκ (επειδή η ‘δευτερεύουσα ενδειξη’ της διέγερσης του κοινού δεν ήταν αποκλειστική σε ένα συγκεκριμένο είδος γεγονότος).

Αυτό είναι σε πολλές ways ένα ‘προβληματικό’ πρόβλημα, και σε άλλες ways ένα διαδικαστικό πρόβλημα. Τα πλαίσια μέχρι τώρα έχουν λειτουργήσει με βάση την αρχή ότι σπάνια κλειδιά πλαισίων μπορούν να συλλάβουν αποτελεσματικά τις βασικές πληροφορίες, αλλά αυτό είναι πιο αποτελεσματικό στην καθιέρωση του είδους και άλλων πτυχών του θέματος του βίντεο,既然 η απόδειξη σε αυτή την περίπτωση διαρκεί σε πολλά πλαισιά.

F-16

Μια νέα εργασία από την Κίνα προσφέρει μια λύση, με τη μορφή του πρώτου πολυμορφικού μεγάλου μοντέλου γλώσσας (MLLM, ή απλά LLM) που μπορεί να αναλύσει βίντεο σε 16fps αντί του τυπικού 1fps, ενώ αποφεύγει τις μεγάλες παγίδες της αύξησης του ρυθμού ανάλυσης.

Σε δοκιμές, οι συγγραφείς ισχυρίζονται ότι το νέο σύστημα, με τίτλο F-16, υπερέχει των ιδιωτικών μοντέλων της状态-of-the-art όπως GPT-4o και Google’s Gemini-1.5 pro. Ενώ άλλα τρέχοντα μοντέλα ήταν σε θέση να ταιριάζουν ή να υπερβαίνουν τα αποτελέσματα του F-16 στις δοκιμές, τα ανταγωνιστικά μοντέλα ήταν πολύ μεγαλύτερα και πιο δυσκίνητα.

Αν και το F-16 εκπαιδεύτηκε σε κάποιο σοβαρό υλικό (όπως θα εξετάσουμε σύντομα), η συλλογή είναι συνήθως λιγότερο απαιτητική από την εκπαίδευση. Επομένως, μπορούμε να ελπίσουμε ότι ο κώδικας (υποσχόμενος για μια近-μέλλοντη έκδοση) θα είναι σε θέση να τρέξει σε μεσαία ή υψηλού επιπέδου οικιακά GPU.

Τι χρειάζεται για τη ζωτικότητα της σκηνής του χόμπι (και αυτό περιλαμβάνει τη专业 VFX σκηνή, την περισσότερη ώρα) είναι ένα μοντέλο υποτίτλων βίντεο αυτού του είδους που μπορεί να λειτουργήσει, vielleicht quantized, σε καταναλωτικά συστήματα, ώστε όλη η γεννήτρια βίντεο σκηνή δεν μεταναστεύει σε API-βασισμένα εμπορικά συστήματα, ή να αναγκάσει τους καταναλωτές να συνδέσουν τοπικά πλαίσια με εμπορικές online GPU υπηρεσίες.

Πέρα από την Κλιμάκωση

Οι συγγραφείς παρατηρούν ότι αυτού του είδους η προσέγγιση είναι μια πρακτική εναλλακτική λύση για την κλιμάκωση των συνόλων δεδομένων. Μπορείτε επίσης να συναγάγετε ότι αν θα ρίχνετε περισσότερα δεδομένα στο πρόβλημα, αυτή η προσέγγιση θα ήταν ακόμη προτιμότερη, επειδή το νέο σύστημα διακρίνει τα γεγονότα με πιο λεπτομερή τρόπο.

Λένε:

‘Η δειγματοληψία χαμηλού ρυθμού πλαισίου μπορεί να οδηγήσει σε κρίσιμη απώλεια οπτικών πληροφοριών, ιδιαίτερα σε βίντεο με ταχεία αλλαγές σκηνών, περίπλοκες λεπτομέρειες ή ταχεία κίνηση. Επιπλέον, αν τα κλειδιά πλαισίων χάνονται, αλλά το μοντέλο εκπαιδεύεται σε ετικέτες που βασίζονται σε πληροφορίες πλαισίου, μπορεί να δυσκολευτεί να ευθυγραμμίσει τις προβλέψεις του με το αναμενόμενο περιεχόμενο, потенτικά οδηγώντας σε hallucinations και μειωμένη απόδοση…

‘… F-16 επιτυγχάνει SOTA απόδοση σε γενική ερωταποκρίση βίντεο μεταξύ μοντέλων του ίδιου μεγέθους και δείχνει σαφή πλεονέκτημα στην κατανόηση βίντεο υψηλού ρυθμού πλαισίου, υπερβαίνοντας εμπορικά μοντέλα όπως GPT-4o. Αυτό το έργο ανοίγει νέες κατευθύνσεις για την προώθηση της κατανόησης βίντεο υψηλού ρυθμού πλαισίου σε έρευνα πολυμορφικών LLM.’

Το νέο έγγραφο έχει τίτλο Βελτίωση της κατανόησης βίντεο LLM με 16 Πλαίσια ανά Δευτερόλεπτο, και προέρχεται από οκτώ συγγραφείς από το Tsinghua University και το ByteDance.

Μέθοδος

Καθώς τα συνεχόμενα πλαισιά διαθέτουν συχνά περιττές πληροφορίες, το F-16 εφαρμόζει έναν ευρύ ρυθμού πλαισίου για να συμπιέσει και να κωδικοποιήσει τις κινήσεις-κλειδιά ενώ διατηρεί τις οπτικές σημασιολογίες. Κάθε πλαίσιο επεξεργάζεται πρώτα από έναν προ-εκπαιδευμένο κωδικοποιητή εικόνας, εξάγωντας αναπαραστάσεις χαρακτηριστικών πριν να περάσει σε έναν ευθυγραμμιστή που βασίζεται σε Gaussian Error Linear Units (GELUs).

Η αρχιτεκτονική του F-16 επεξεργάζεται βίντεο σε 16 FPS, захопizando περισσότερα πλαισιά από τα παραδοσιακά μοντέλα χαμηλού ρυθμού πλαισίου, και ο ευρύ ρυθμός πλαισίου ευθυγραμμιστή διατηρεί τις οπτικές σημασιολογίες ενώ κωδικοποιεί αποτελεσματικά τις δυναμικές κινήσεων χωρίς να προσθέτει επιπλέον οπτικά tokens. Πηγή: https://arxiv.org/pdf/2503.13956

Η αρχιτεκτονική του F-16 επεξεργάζεται βίντεο σε 16 FPS, захопizando περισσότερα πλαισιά από τα παραδοσιακά μοντέλα χαμηλού ρυθμού πλαισίου, και ο ευρύ ρυθμός πλαισίου ευθυγραμμιστή διατηρεί τις οπτικές σημασιολογίες ενώ κωδικοποιεί αποτελεσματικά τις δυναμικές κινήσεων χωρίς να προσθέτει επιπλέον οπτικά tokens. Πηγή: https://arxiv.org/pdf/2503.13956

Για να χειριστεί τον αυξημένο αριθμό πλαισίων αποτελεσματικά, το F-16 ομαδοποιεί τα πλαισιά σε μικρά παράθυρα επεξεργασίας, συνδυάζοντας οπτικές χαρακτηριστικές χρησιμοποιώντας einen τρι-επίπεδο Multi-Layer Perceptron (MLP), βοηθώντας να διατηρηθεί μόνο οι πιο σχετικές λεπτομέρειες κίνησης, και μειώνοντας την περιττή διπλοποίηση, ενώ διατηρεί την χρονική ροή των ενεργειών. Ένας χωρικός max-pooling στρώμα συμπιέζει περαιτέρω τον αριθμό των tokens, κρατώντας τους υπολογιστικούς κόστους εντός των ορίων.

Τα επεξεργασμένα βίντεο tokens затем μεταφέρονται στο Qwen2-7B LLM, το οποίο παράγει κειμενικές απαντήσεις με βάση τις εξαγμένες οπτικές χαρακτηριστικές και μια δεδομένη προτροπή χρήστη.

Μέσω της δομής της είσοδου βίντεο με αυτόν τον τρόπο, το F-16 ermöglicht, οι συγγραφείς ισχυρίζονται, πιο ακριβή αναγνώριση γεγονότων σε δυναμικές σκηνές, ενώ vẫn διατηρεί την αποτελεσματικότητα.

Η Σύντομη Έκδοση

Το F-16 επεκτείνει έναν προ-εκπαιδευμένο κωδικοποιητή εικόνας LLM, LLaVA-OneVision, για να επεξεργαστεί βίντεο μετατρέποντας την οπτική του είσοδο pipeline. Ενώ τα τυπικά μοντέλα εικόνας LLM χειρίζονται απομονωμένα πλαισιά, ο ευρύ ρυθμός πλαισίου ευθυγραμμιστή του F-16 μετατρέπει πολλά πλαισιά σε eine μορφή που το μοντέλο μπορεί να επεξεργαστεί πιο αποτελεσματικά. Αυτό αποφεύγει το σύστημα να καταπνιγεί με περιττές πληροφορίες ενώ διατηρεί τις κινήσεις-κλειδιά που είναι απαραίτητες για ακριβή κατανόηση βίντεο.

Για να διασφαλιστεί η συμβατότητα με την εικόνα-βασισμένη του βάση, το F-16 επαναχρησιμοποιεί προ-εκπαιδευμένα παράμετρα αναδιαμορφώνοντας τον ευθυγραμμιστή σε υπο-πίνακες. Αυτή η προσέγγιση επιτρέπει στο F-16 να ενσωματώσει γνώσεις από μοντέλα πλαισίου ενώ προσαρμόζεται στην είσοδο βίντεο.

Ο ευθυγραμμιστής πρώτα συμπιέζει τις ακολουθίες πλαισίων σε eine μορφή που είναι βελτιστοποιημένη για το LLM, διατηρώντας τις πιο ενημερωτικές χαρακτηριστικές ενώ απορρίπτει τις περιττές λεπτομέρειες. Η αρχιτεκτονική σχεδίαση ermöglicht στο σύστημα να επεξεργαστεί βίντεο υψηλού ρυθμού πλαισίου ενώ διατηρεί τους υπολογιστικούς κόστους υπό έλεγχο, το οποίο οι συγγραφείς θεωρούν ως απόδειξη ότι η κλιμάκωση δεν είναι ο μόνος (ή ο καλύτερος) τρόπος για την υποτίτλωση βίντεο.

Αλλάζοντας το Ρυθμό

Καθώς η επεξεργασία βίντεο σε 16 FPS βελτιώνει την κατανόηση κίνησης αλλά αυξάνει τους υπολογιστικούς κόστους, ιδιαίτερα κατά την συλλογή, το F-16 εισάγει μια μεταβλητή-ρυθμού πλαισίου αποκωδικοποίηση μέθοδο, επιτρέποντας στο σύστημα να điều chỉnh τον ρυθμό πλαισίου δυναμικά χωρίς επανα-εκπαίδευση.

Ο單-πλαίσιο και ο ευρύ ρυθμός πλαισίου ευθυγραμμιστές που διαθέτει το F-16.

Ο單-πλαίσιο και ο ευρύ ρυθμός πλαισίου ευθυγραμμιστές που διαθέτει το F-16.

Αυτή η ευελιξία ermöglicht στο μοντέλο να λειτουργεί αποτελεσματικά σε χαμηλότερους FPS όταν δεν απαιτείται υψηλή ακρίβεια, και μειώνει τους υπολογιστικούς κόστους.

Κατά τη διάρκεια της δοκιμής, όταν ένας χαμηλότερος ρυθμός πλαισίου επιλέγεται, το F-16 επαναχρησιμοποιεί προ-εκπαιδευμένα παράμετρα του ευθυγραμμιστή επαναλαμβάνοντας τα εισαγόμενα πλαισιά για να ταιριάζουν με τις αναμενόμενες διαστάσεις. Αυτό đảmوزει ότι το μοντέλο μπορεί ακόμη να επεξεργαστεί βίντεο αποτελεσματικά χωρίς να τροποποιήσει την αρχιτεκτονική του.

Αντίθετα με την απλή υπο-δειγματοληψία (δηλ. απλά αφαιρώντας πλαισιά), η οποία κινδυνεύει να χάσει κρίσιμες λεπτομέρειες κίνησης, αυτή η μέθοδος διατηρεί τις μαθημένες αναπαραστάσεις κίνησης του ευθυγραμμιστή, διατηρώντας την ακρίβεια ακόμη και σε μειωμένους ρυθμούς πλαισίου. Για την γενική κατανόηση βίντεο, μια ρύθμιση FPS μπορεί να αυξήσει την ταχύτητα συλλογής χωρίς σημαντική απώλεια απόδοσης, ενώ η ανάλυση κίνησης υψηλής ταχύτητας μπορεί ακόμη να επωφεληθεί από την πλήρη ικανότητα των 16 FPS.

Δεδομένα και Δοκιμές

Χτισμένο στο Qwen2-7B, το FP-16 επεκτείνει το LLaVA-OneVision χρησιμοποιώντας SigLIP ως κωδικοποιητή εικόνας. Με τα βίντεο πλαισιά δειγματοληπτικά σε 16 FPS, μέχρι 1.760 πλαισιά μπορούν να ληφθούν από κάθε βίντεο. Για μεγαλύτερα βίντεο, τα πλαισιά δειγματοληπτικά (δηλ. πιο σπάνια) δειγματοληπτικά.

Για την εκπαίδευση, το F-16 использовало τα ίδια γενικά σύνολα δεδομένων βίντεο όπως το LLaVA-Video, συμπεριλαμβανομένων LLaVA-Video-178K, NExT-QA, ActivityNet-QA, και PerceptionTest.

Το F-16 ήταν επίσης fine-εκπαιδευμένο στα σύνολα δεδομένων αθλημάτων υψηλής ταχύτητας FineGym, Diving48, και SoccerNet. Οι συγγραφείς επίσης curated μια συλλογή από 276 παιχνίδια NBA που παίχθηκαν μεταξύ 13 και 25 Νοεμβρίου 2024, εστιάζοντας στο αν ένα σούτ ήταν επιτυχημένο (μια εργασία που απαιτεί επεξεργασία υψηλού ρυθμού πλαισίου).

Το μοντέλο αξιολογήθηκε χρησιμοποιώντας το NSVA test set, με την απόδοση να μετράται από F1 score.

Τα μοντέλα γυμναστικής και καταδύσεων αξιολογήθηκαν με βάση την ακρίβεια αναγνώρισης γεγονότων, ενώ τα μοντέλα ποδοσφαίρου και μπάσκετ παρακολούθησαν τις πάσες και τα αποτελέσματα των σούτ.

Το μοντέλο εκπαιδεύτηκε για 1 epoch χρησιμοποιώντας 128 NVIDIA H100 GPUs (και με ένα τυπικό 80GB της VRAM ανά GPU, αυτό συνεπαγόταν τη χρήση 10,24 terabytes της GPU μνήμης. Ακόμη και σύμφωνα με τις πρόσφατες προδιαγραφές, αυτό είναι ο υψηλότερος εξοπλισμένος GPU cluster που έχω συναντήσει προσωπικά κατά τη διατήρηση της έρευνας υπολογιστή όρασης). Ένας ρυθμός μάθησης 2×10⁻⁵ χρησιμοποιήθηκε κατά την εκπαίδευση.

Επιπλέον, ένα LoRA fine-εκπαιδεύτηκε σε αθλητικά δεδομένα χρησιμοποιώντας LoRA adapters με 64 GPUs για 5 epochs. Εδώ, μόνο το LLM εκπαιδεύτηκε, αφήνοντας τον κωδικοποιητή εικόνας παγωμένο.

Αντιτιθέμενα πλαίσια που δοκιμάστηκαν στην αρχική γύρο για ‘γενική κατανόηση βίντεο’ ήταν GPT-4o; Gemini-1.5-Pro; Qwen2-VL-7B; VideoLLaMA2-7B; VideoChat2-HD-7B; LLaVA-OV-7B; MiniCPM-V2.6-8B; LLaVA-Video-7B; και NVILA-7B;

Τα μοντέλα αξιολογήθηκαν στο Video-MME; VideoVista; TemporalBench; MotionBench; Next-QA; MLVU; και LongVideoBench.

Σύγκριση των αποτελεσμάτων ερωταποκρίσεων βίντεο μεταξύ μοντέλων, δείχνοντας τους περιορισμούς FPS και την απόδοση σε πολλαπλά benchmarks. Το F-16 επιτυγχάνει SOTA μεταξύ των μοντέλων 7B στο Video-MME, NQA, TPB, και MB, ισοδυναμώντας με εμπορικά μοντέλα όπως GPT-4o και Gemini-1.5-Pro.

Σύγκριση των αποτελεσμάτων ερωταποκρίσεων βίντεο μεταξύ μοντέλων, δείχνοντας τους περιορισμούς FPS και την απόδοση σε πολλαπλά benchmarks. Το F-16 επιτυγχάνει SOTA μεταξύ των μοντέλων 7B στο Video-MME, NQA, TPB, και MB, ισοδυναμώντας με εμπορικά μοντέλα όπως GPT-4o και Gemini-1.5-Pro.

Από αυτά τα αποτελέσματα, οι συγγραφείς δηλώνουν:

‘Στα Video-MME Short, Medium, και NeXT-QA datasets—καθένα σχεδιασμένο για την κατανόηση βίντεο βραχείας διάρκειας—το μοντέλο μας υπερβαίνει το προηγούμενο SOTA μοντέλο 7B με 3.2%, 1.0%, και 0.9% σε ακρίβεια, υπογραμμίζοντας την ισχυρή του απόδοση σε βίντεο βραχείας διάρκειας.

‘Για τα benchmarks που αξιολογούν την κατανόηση βίντεο μακράς διάρκειας, όπως το Video-MME Long, LongVideoBench, και MLVU, η πρόκληση είναι μεγαλύτερη λόγω της σπανιότερης δειγματοληψίας πλαισίων, που προκαλεί τα πλαισιά μέσα στο παράθυρο επεξεργασίας να εμφανίζουν σημαντικές παραλλαγές.

‘Αυτό αυξάνει τη δυσκολία για τον ευθυγραμμιστή να κωδικοποιήσει αποτελεσματικά τις χρονικές αλλαγές μέσα στην περιορισμένη αναπαράσταση token. Ως αποτέλεσμα, το F-16 βιώνει μια μικρή πτώση της απόδοσης σε σύγκριση με το [LLaVA-Video-7B], το οποίο εκπαιδεύτηκε στο ίδιο σύνολο δεδομένων βίντεο.’

Η υψηλή ταχύτητα επεξεργασίας του F-16, οι συγγραφείς συνεχίζουν, οδήγησε επίσης σε μια βελτίωση 13,5% στο TemporalBench και μια βελτίωση 2,5% στο MotionBench, σε σύγκριση με τα υπάρχοντα μοντέλα 7B, και παρουσίασε παρόμοια απόδοση με εμπορικά μοντέλα όπως GPT-4o και Gemini-1.5-Pro.

Κατανόηση Βίντεο Αθλημάτων Υψηλής Ταχύτητας

Το F-16 δοκιμάστηκε στα FineGym, Diving48, SoccerNet, και NBA datasets για να αξιολογήσει την ικανότητά του να κατανοήσει ταχεία αθλητικά γεγονότα.

Χρησιμοποιώντας τα 10.000 χειροκίνητα αναγνωρισμένα NBA clips, η εκπαίδευση εστιάστηκε στην κίνηση της μπάλας και τις ενέργειες των παικτών, και αν τα μοντέλα μπορούσαν να καθορίσουν σωστά αν ένα σούτ ήταν επιτυχημένο, χρησιμοποιώντας το NSVA test set αξιολογημένο με F1 score.

Αποτελέσματα της ανάλυσης βίντεο αθλημάτων υψηλής ταχύτητας. Το F-16 με τον ευρύ ρυθμός πλαισίου ευθυγραμμιστή παρουσίασε καλύτερη απόδοση από τον αντίστοιχο χαμηλού ρυθμού πλαισίου σε όλα τα αθλητικά εργασίες. Τα GPT-4o και Gemini-1.5-Pro αξιολογήθηκαν επίσης στο NBA και SoccerNet QA, όπου δεν απαιτούνταν γνώσεις εκπαίδευσης στην περιοχή.

Αποτελέσματα της ανάλυσης βίντεο αθλημάτων υψηλής ταχύτητας. Το F-16 με τον ευρύ ρυθμός πλαισίου ευθυγραμμιστή παρουσίασε καλύτερη απόδοση από τον αντίστοιχο χαμηλού ρυθμού πλαισίου σε όλα τα αθλητικά εργασίες. Τα GPT-4o και Gemini-1.5-Pro αξιολογήθηκαν επίσης στο NBA και SoccerNet QA, όπου δεν απαιτούνταν γνώσεις εκπαίδευσης στην περιοχή.

Στο FineGym, το οποίο μετρά την αναγνώριση ενεργειών γυμναστικής, το F-16 παρουσίασε καλύτερη απόδοση 13,8% από το προηγούμενο SOTA μοντέλο 7B, δείχνοντας βελτιωμένη λεπτομερή κατανόηση κίνησης.

Το Diving48 απαιτούσε την αναγνώριση σύνθετων κινήσεων όπως η εκκίνηση, σόμερσαλτ, στροφή, και πτήση φάσεων, και το F-16 έδειξε υψηλότερη ακρίβεια στην αναγνώριση αυτών των μεταβάσεων.

Για το SoccerNet, το μοντέλο ανάλυσε 10-δευτερόλεπτα clips, αναγνωρίζοντας πάσες, και τα αποτελέσματα έδειξαν μια βελτίωση σε σχέση με τα υπάρχοντα μοντέλα 7B, υποδεικνύοντας ότι υψηλότεροι ρυθμοί πλαισίου συμβάλλουν στην παρακολούθηση μικρών και ταχείας κινήσεων.

Στο dataset του NBA, η ικανότητα του F-16 να καθορίσει τα αποτελέσματα των σούτ προσελάβεσε την ακρίβεια μεγαλύτερων εμπορικών μοντέλων όπως GPT-4o και Gemini-1.5-Pro, υποδεικνύοντας περαιτέρω ότι υψηλότεροι ρυθμοί πλαισίου βελτιώνουν την ικανότητά του να επεξεργαστεί δυναμική κίνηση.

Μεταβλητοί Ρυθμοί Πλαισίου

Το F-16 δοκιμάστηκε σε διαφορετικούς ρυθμούς πλαισίου για να μετρηθεί η προσαρμοστικότητά του. Αντί να επανα-εκπαιδευτεί, το F-16 χειρίστηκε χαμηλότερους ρυθμούς πλαισίου επαναλαμβάνοντας πλαισιά για να ταιριάζουν με τη δομή εισόδου του ευθυγραμμιστή. Αυτή η προσέγγιση διατήρησε περισσότερη απόδοση από το απλό αφαιρέσιμο πλαισίων (που κινδύνευε να προκαλέσει απώλεια ακρίβειας).

Τα αποτελέσματα δείχνουν ότι ενώ η μείωση του ρυθμού πλαισίου είχε κάποια επίδραση στην αναγνώριση κίνησης, το F-16 εξακολουθούσε να υπερβαίνει τα μοντέλα χαμηλού ρυθμού πλαισίου και διατήρησε ισχυρά αποτελέσματα ακόμη και κάτω από 16 FPS.

Αριστερά, η κατανάλωση χρόνου των διαφορετικών F-16 modules κατά τη συλλογή, μετρημένη σε 300 βίντεο από το Video-MME Long set με διαφορετικούς ρυθμούς πλαισίου και μήκη ακολουθιών. Δεξιά, μια σύγκριση μεταξύ της απόδοσης του Video-MME για μοντέλα που εκπαιδεύτηκαν και δοκιμάστηκαν σε διαφορετικούς ρυθμούς πλαισίου. Η στερεή γραμμή αντιπροσωπεύει μοντέλα που εκπαιδεύτηκαν και δοκιμάστηκαν στο ίδιο ρυθμό πλαισίου, ενώ η пункτιρική γραμμή δείχνει την απόδοση όταν ένα μοντέλο εκπαιδεύτηκε σε 16 FPS και δοκιμάστηκε σε χαμηλότερο ρυθμό πλαισίου.

Αριστερά, η κατανάλωση χρόνου των διαφορετικών F-16 modules κατά τη συλλογή, μετρημένη σε 300 βίντεο από το Video-MME Long set με διαφορετικούς ρυθμούς πλαισίου και μήκη ακολουθιών. Δεξιά, μια σύγκριση μεταξύ της απόδοσης του Video-MME για μοντέλα που εκπαιδεύτηκαν και δοκιμάστηκαν σε διαφορετικούς ρυθμούς πλαισίου. Η στερεή γραμμή αντιπροσωπεύει μοντέλα που εκπαιδεύτηκαν και δοκιμάστηκαν στο ίδιο ρυθμό πλαισίου, ενώ η пункτιρική γραμμή δείχνει την απόδοση όταν ένα μοντέλο εκπαιδεύτηκε σε 16 FPS και δοκιμάστηκε σε χαμηλότερο ρυθμό πλαισίου.

Η υψηλή ταχύτητα επεξεργασίας του F-16 αυξάνει τις υπολογιστικές απαιτήσεις, αν και ο ευθυγραμμιστής του βοηθά να διαχειριστεί αυτές τις δαπάνες συμπιέζοντας τις περιττές οπτικές tokens.

Το μοντέλο απαιτεί περισσότερα FLOPs ανά βίντεο από τα μοντέλα χαμηλού ρυθμού πλαισίου, αλλά επιτυγχάνει επίσης καλύτερη ακρίβεια ανά token, υποδεικνύοντας ότι οι στρατηγικές επιλογής πλαισίου και συμπίεσης token του βοήθησαν να αντισταθμίσουν την πρόσθετη υπολογιστική δαπάνη.

Σύγκλιση

Είναι δύσκολο να υπερβολήσει είτε την σημασία είτε τις προκλήσεις αυτής της συγκεκριμένης πτυχής της έρευνας – ιδιαίτερα φέτος, το οποίο είναι πιθανό να είναι το έτος прорыву για τη γεννήτρια βίντεο, ρίχνοντας τις ελλείψεις της καλλιέργειας συνόλων δεδομένων βίντεο και της ποιότητας των υποτιτλών σε οξύ焦点.

Πρέπει επίσης να τονιστεί ότι οι προκλήσεις που σχετίζονται με την απόκτηση ακριβών περιγραφών των εσωτερικών λεπτομερειών του βίντεο δεν μπορούν να λυθούν αποκλειστικά με το να ρίχνετε VRAM, χρόνο ή χώρο δίσκου στο πρόβλημα. Ο τρόπος με τον οποίο τα γεγονότα απομονώνονται/εξάγονται από αλλιώς μακρές και βαρετές πτυχές του βίντεο (όπως τα βίντεο γκολφ ή σνούκερ, για παράδειγμα) θα ωφεληθούν από μια ανασκόπηση των σημασιολογικών προσεγγίσεων και των μηχανισμών που κυριαρχούν στις λύσεις SOTA – επειδή κάποιες από αυτές τις περιορισμοί καθορίστηκαν σε πιο φτωχές πόρους φορές.

(παράλληλα, ακόμη και αν 16fps φαίνεται σαν ένας πολύ χαμηλός ρυθμός πλαισίου για το 2025, είναι ενδιαφέρον να σημειωθεί ότι αυτό είναι επίσης ο ρυθμός εκπαίδευσης των βίντεο clips που χρησιμοποιούνται στο πολύ δημοφιλές μοντέλο Wan 2.1 γεννήτριας βίντεο, και ο ρυθμός με τον οποίο λειτουργεί με τις λιγότερες προβλήματα. Ελπίζουμε ότι η ερευνητική σκηνή θα κρατήσει το μάτι της σε πιθανή ‘εντροπία προτύπων’ εδώ. μερικές φορές οι ξεπερασμένες περιορισμοί μπορούν να διατηρήσουν μελλοντικά πρότυπα)

 

Πρώτη δημοσίευση Τετάρτη, 19 Μαρτίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai