Η γωνία του Anderson

Ανασκέφτηκε την Εκπαίδευση του Video AI με Δεδομένα που Εστίαζαν στον Χρήστη

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Examples from the paper ' VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation'

Ο τύπος περιεχομένου που οι χρήστες μπορεί να θέλουν να δημιουργήσουν χρησιμοποιώντας ένα γεννητικό μοντέλο όπως το Flux ή το Hunyuan Video μπορεί να μην είναι πάντα εύκολα διαθέσιμο, ακόμη και αν το αίτημα περιεχομένου είναι相当 γενικό, και κάποιος μπορεί να υποθέσει ότι ο γεννήτορας θα μπορούσε να το χειριστεί.

Ένα παράδειγμα, που αναφέρεται σε μια νέα εργασία που θα εξετάσουμε σε αυτό το άρθρο, σημειώνει ότι το μοντέλο OpenAI Sora, που έχει πλέον ξεπεραστεί, έχει κάποια δυσκολία στην αναπαράσταση ενός ανατομικά σωστού πυροσβέστη, χρησιμοποιώντας την πρόκληση ‘Ένας πυροσβέστης λάμπει σε ένα φύλλο χόρτου σε μια ήρεμη καλοκαιρινή νύχτα’:

Το OpenAI's Sora έχει μια κάπως ατελή κατανόηση της ανατομίας του πυροσβέστη. Πηγή: https://arxiv.org/pdf/2503.01739

Το OpenAI’s Sora έχει μια κάπως ατελή κατανόηση της ανατομίας του πυροσβέστη. Πηγή: https://arxiv.org/pdf/2503.01739

Από τότε που σπάνια λαμβάνω υπόψη τις αξιολογήσεις της έρευνας, έκανα το ίδιο αίτημα στο Sora σήμερα και έλαβα ένα κάπως καλύτερο αποτέλεσμα. Ωστόσο, το Sora εξακολουθούσε να μην μπορεί να αναπαραστήσει σωστά τη λάμψη – αντί να φωτίζει την άκρη της ουράς του πυροσβέστη, όπου συμβαίνει η βιοφωταύγεια, το Sora τοποθέτησε τη λάμψη κοντά στα πόδια του εντόμου:

Η δική μου δοκιμή της πρόκλησης των ερευνητών στο Sora παράγει ένα αποτέλεσμα που δείχνει ότι το Sora δεν κατανοεί από πού προέρχεται το φως του πυροσβέστη.

Η δική μου δοκιμή της πρόκλησης των ερευνητών στο Sora παράγει ένα αποτέλεσμα που δείχνει ότι το Sora δεν κατανοεί από πού προέρχεται το φως του πυροσβέστη.

Συμβατικά, ο γεννήτορας διαχύσεως Adobe Firefly, εκπαιδευμένος στα δικά του copyright-ασφαλισμένα stock φωτογραφίες και βίντεο, κατάφερε μόνο ένα 1-σε-3 ποσοστό επιτυχίας σε αυτό το ζήτημα, όταν έκανα το ίδιο αίτημα στη λειτουργία γεννήτριας AI του Photoshop:

Μόνο το τελικό από τρία προτεινόμενα γεννήματα της πρόκλησης των ερευνητών παράγει μια λάμψη στο Adobe Firefly (Μάρτιος 2025), αν και τουλάχιστον η λάμψη βρίσκεται στη σωστή θέση της ανατομίας του εντόμου.

Μόνο το τελικό από τρία προτεινόμενα γεννήματα της πρόκλησης των ερευνητών παράγει μια λάμψη στο Adobe Firefly (Μάρτιος 2025), αν και τουλάχιστον η λάμψη βρίσκεται στη σωστή θέση της ανατομίας του εντόμου.

Αυτό το παράδειγμα αναφέρθηκε από τους ερευνητές της νέας εργασίας για να δείξει ότι η κατανομή, η έμφαση και η κάλυψη στα σετ εκπαίδευσης που χρησιμοποιούνται για να ενημερώσουν τα δημοφιλή μοντέλα βάσης μπορεί να μην ευθυγραμμίζονται με τις ανάγκες του χρήστη, ακόμη και αν ο χρήστης δεν ζητάει κάτι ιδιαίτερα απαιτητικό – ένα θέμα που ανακύπτει οι προκλήσεις που εμπλέκονται στη προσαρμογή των υπερκλιμακωμένων σετ δεδομένων στις πιο αποτελεσματικές και αποδοτικές τους εξόδους ως γεννητικά μοντέλα.

Οι συγγραφείς δηλώνουν:

‘[Sora] αποτυγχάνει να πιάσει την έννοια ενός πυροσβέστη ενώ παράγει με επιτυχία χόρτο και καλοκαιρινή [νύχτα]. Από την οπτική των δεδομένων, συναγάγουμε ότι αυτό οφείλεται κυρίως στο ότι [Sora] δεν έχει εκπαιδευτεί σε θέματα που σχετίζονται με πυροσβέστη, ενώ έχει εκπαιδευτεί σε χόρτο και νύχτα. Επιπλέον, αν [Sora] είχε δει το βίντεο που εμφανίζεται [πάνω], θα κατανοούσε τι πρέπει να μοιάζει ένας πυροσβέστης.’

Εισάγουν ένα νέο επιμελημένο σετ δεδομένων και προτείνουν ότι η μεθοδολογία τους θα μπορούσε να βελτιωθεί σε μελλοντική εργασία για να δημιουργήσει συλλογές δεδομένων που ευθυγραμμίζονται καλύτερα με τις προσδοκίες του χρήστη από πολλά υπάρχοντα μοντέλα.

Δεδομένα για τους Ανθρώπους

Η προτεινόμενη προσέγγιση των ερευνητών είναι μια μέθοδος επιμέλειας δεδομένων που βρίσκεται κάπου ανάμεσα στην προσαρμοσμένη δεδομένα για ένα μοντέλο τύπου LoRA (και αυτή η προσέγγιση είναι πολύ ιδιαίτερη για γενική χρήση) και τις ευρείες και σχετικά αδιάκριτες συλλογές υψηλού όγκου (όπως το σετ δεδομένων LAION που τροφοδοτεί τη Stable Diffusion) που δεν ευθυγραμμίζονται ειδικά με οποιαδήποτε τελική περίπτωση χρήσης.

Η νέα προσέγγιση, τόσο ως μεθοδολογία όσο και ως νέο σετ δεδομένων, ονομάζεται Users’ FOcus in text-to-video, ή VideoUFO. Το σετ δεδομένων VideoUFO αποτελείται από 1,9 εκατομμύρια βίντεο που καλύπτουν 1291 θέματα που επικεντρώνονται στον χρήστη. Τα θέματα αυτά αναπτύχθηκαν με γνώμονα μια υπάρχουσα βάση δεδομένων βίντεο και αναλύθηκαν με διάφορες γλώσσες και τεχνικές Επεξεργασίας Φυσικής Γλώσσας (NLP):

Δείγματα των αποσταγμένων θεμάτων που παρουσιάζονται στην νέα εργασία.

Δείγματα των αποσταγμένων θεμάτων που παρουσιάζονται στην νέα εργασία.

Το σετ δεδομένων VideoUFO διαθέτει ένα υψηλό όγκο νέων βίντεο από το YouTube – ‘νέο’ με την έννοια ότι τα βίντεο αυτά δεν υπάρχουν σε σετ δεδομένων που είναι τώρα δημοφιλή στη βιβλιογραφία και, κατά συνέπεια, σε πολλές υπο-συλλογές που έχουν δημιουργηθεί από αυτά (και πολλά από τα βίντεο είχαν ανεβεί μετά τη δημιουργία των παλαιότερων σετ δεδομένων που αναφέρονται στην εργασία).

Στην πραγματικότητα, οι συγγραφείς ισχυρίζονται ότι υπάρχει μόνο 0,29% επικάλυψη με υπάρχοντα σετ δεδομένων βίντεο – μια εντυπωσιακή απόδειξη της καινοτομίας.

Ένας λόγος για αυτό μπορεί να είναι ότι οι συγγραφείς θα δέχονταν μόνο βίντεο από το YouTube με άδεια Creative Commons που θα ήταν λιγότερο πιθανό να εμποδίσουν τους χρήστες αργότερα: είναι δυνατό ότι αυτή η κατηγορία βίντεο έχει υποτιμηθεί σε προηγούμενες σαρώσεις του YouTube και άλλων πλατφορμών υψηλού όγκου.

Δεύτερον, τα βίντεο ζητήθηκαν με βάση την προκαταρκτική εκτίμηση της ανάγκης του χρήστη (βλ. εικόνα παραπάνω), και όχι αδιάκριτα. Αυτοί οι δύο παράγοντες σε συνδυασμό θα μπορούσαν να οδηγήσουν σε μια τόσο καινοτόμο συλλογή. Επιπλέον, οι ερευνητές έλεγξαν τους κωδικούς ID του YouTube για τα συνεισφέρουσά βίντεο (δηλαδή, τα βίντεο που θα μπορούσαν να έχουν χωριστεί και να έχουν ξαναφανταστεί για τη συλλογή VideoUFO) έναντι εκείνων που εμφανίζονται σε υπάρχοντα σετ δεδομένων, δίνοντας credence στην αξίωση.

Αν και δεν είναι όλα στην νέα εργασία εξίσου πειστικά, είναι ένα ενδιαφέρον άρθρο που υπογραμμίζει το βαθμό στον οποίο εξακολουθούμε να είμαστε στο έλεος των ανισομερών κατανομών στα σετ δεδομένων, σε σχέση με τα εμπόδια που συχνά αντιμετωπίζουν οι ερευνητές στη διοργάνωση δεδομένων.

Η νέα εργασία έχει τον τίτλο VideoUFO: Ένα σετ δεδομένων εκατομμυρίων κλιμάκων για τη γεννήτρια κειμένου-βίντεο, και προέρχεται από δύο ερευνητές, από το Πανεπιστήμιο Τεχνολογίας της Σίδνεϋ στην Αυστραλία και το Πανεπιστήμιο Zhejiang στην Κίνα.

Επιλεγμένα δείγματα από το τελικό σετ δεδομένων.

Επιλεγμένα δείγματα από το τελικό σετ δεδομένων.

Ένας ‘Προσωπικός Αγοράς’ για Δεδομένα AI

Ο τύπος και τα θέματα που εμφανίζονται στο σύνολο των εικόνων και βίντεο του διαδικτύου δεν ανταποκρίνεται απαραίτητα σε αυτό που ο μέσος χρήστης μπορεί να ζητήσει από ένα γεννητικό σύστημα; ακόμη και όταν το περιεχόμενο και η ζήτηση κάνουν ταιριάζουν (όπως με το πορνό, το οποίο είναι πλουσιοπάροχο διαθέσιμο στο διαδίκτυο και εξαιρετικά ενδιαφέρον για πολλούς χρήστες γενικής IA), αυτό μπορεί να μην ευθυγραμμίζεται με τις προθέσεις και τα πρότυπα των dévelopers για ένα νέο γεννητικό σύστημα.

Εκτός από τον υψηλό όγκο μη ακαδημαϊκού υλικού που ανεβάζεται καθημερινά, μια ασύμμετρη ποσότητα διαθέσιμου υλικού στο διαδίκτυο είναι πιθανό να προέρχεται από διαφημιστές και εκείνους που προσπαθούν να χειραγωγήσουν τον SEO. Το εμπορικό συμφέρον αυτού του είδους κάνει την κατανομή του θέματος μακράν αμερόληπτη; χειρότερα, είναι δύσκολο να αναπτυχθούν συστήματα φιλτράρου AI που μπορούν να αντιμετωπίσουν το πρόβλημα,既然 τα αλγόριθμοι και τα μοντέλα που αναπτύσσονται από σημαντικά δεδομένα μπορεί να αντανακλούν τις τάσεις και τις προτεραιότητες των πηγαίων δεδομένων.

Επομένως, οι συγγραφείς της νέας εργασίας έχουν αντιμετωπίσει το πρόβλημα αναστρέφοντας την πρόταση, καθορίζοντας τι είναι πιθανό να θέλουν οι χρήστες και λαμβάνοντας βίντεο που ευθυγραμμίζονται με αυτές τις ανάγκες.

Στην επιφάνεια, αυτή η προσέγγιση φαίνεται τόσο πιθανή να προκαλέσει μια σεμαντική κούρσα προς τα κάτω όσο και να επιτύχει μια ισορροπημένη, τύπου Βικιπαίδειας, ουδετερότητα. Η διαμόρφωση της επιμέλειας δεδομένων γύρω από την ζήτηση του χρήστη κινδυνεύει να ενισχύσει τις προτιμήσεις του χαμηλότερου κοινού κοινού ενώ περιθωριοποιεί τους χρήστες νίχης,既然 τα majority ενδιαφέροντα θα φέρουν αναπόφευκτα μεγαλύτερο βάρος.

Ωστόσο, ας δούμε πώς η εργασία αντιμετωπίζει την πρόκληση.

Αποσταγμένος Έννοιες με Διακριτικότητα

Οι ερευνητές χρησιμοποίησαν το σετ δεδομένων VidProM του 2024 ως πηγή για την ανάλυση θεμάτων που θα ενημέρωναν αργότερα την διαδικασία web-scraping της εργασίας.

Αυτό το σετ δεδομένων επιλέχθηκε, όπως δηλώνουν οι συγγραφείς, επειδή είναι το μόνο δημόσια διαθέσιμο σετ δεδομένων 1m+ ‘γραμμένο από πραγματικούς χρήστες’ – και πρέπει να αναφερθεί ότι αυτό το σετ δεδομένων είχε επιμεληθεί από τους δύο συγγραφείς της νέας εργασίας.

Η εργασία εξηγεί*:

‘Πρώτα, ενσωματώνουμε όλα τα 1,67 εκατομμύρια προκλήσεις από VidProM σε 384-διαστάσεων διανύσματα χρησιμοποιώντας SentenceTransformers Στη συνέχεια, ομαδοποιούμε αυτά τα διανύσματα με K-means. Σημειώνουμε ότι εδώ προθέτουμε τον αριθμό των cluster σε μια σχετικά μεγάλη τιμή, δηλαδή 2.000, και συγχωνεύουμε παρόμοια cluster στο επόμενο βήμα.

‘Τέλος, για κάθε cluster, ζητάμε από το GPT-4o να συναγάγει ένα θέμα [ένα ή δύο λόγια].’

Οι συγγραφείς σημειώνουν ότι ορισμένες έννοιες είναι ξεχωριστές αλλά σαφώς γειτονικές, όπως εκκλησία και καθεδρικός. Μια κριτική πολύ λεπτομερής για περιπτώσεις αυτού του είδους θα οδηγούσε σε ενσωματώσεις εννοιών (για παράδειγμα) για κάθε τύπο φυλής σκύλου, αντί για τον όρο σκύλος; ενώ μια κριτική πολύ ευρεία θα μπορούσε να οδηγήσει σε μια υπερβολική ποσότητα υπο-εννοιών σε μια seule έννοια; επομένως, η εργασία σημειώνει την ισορροπία που απαιτείται για την αξιολόγηση τέτοιων περιπτώσεων.

Οι ενικές και πληθυντικές μορφές συγχωνεύθηκαν, και οι ρήματα αποκαταστάθηκαν στις βασικές (απαρεμφατικές) μορφές τους. Οι υπερβολικά ευρείες έννοιες – όπως ανίμαση, σκήνη, ταινία και κίνηση – αφαιρέθηκαν.

Έτσι, 1.291 θέματα αποκτήθηκαν (με τη πλήρη λίστα διαθέσιμη στο συμπληρωματικό τμήμα της πηγαίας εργασίας).

Επιλογή Web-Scraping

Στη συνέχεια, οι ερευνητές χρησιμοποίησαν το επίσημο API του YouTube για να αναζητήσουν βίντεο με βάση τα κριτήρια που αποστάγματα από το σετ δεδομένων του 2024, αναζητώντας να λάβουν 500 βίντεο για κάθε θέμα. Εκτός από την απαιτούμενη άδεια Creative Commons, κάθε βίντεο έπρεπε να έχει ανάλυση 720p ή υψηλότερη και να ήταν μικρότερο από τέσσερα λεπτά.

Με αυτόν τον τρόπο, 586.490 βίντεο σαρώθηκαν από το YouTube.

Οι συγγραφείς σύγκριναν τον κωδικό ID του YouTube των κατεβασμένων βίντεο με μια σειρά από δημοφιλή σετ δεδομένων: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; και WebVid-10M.

Βρήκαν ότι μόνο 1.675 ID (η προαναφερθείσα 0,29%) των clip VideoUFO εμφανίζονται σε αυτές τις παλαιότερες συλλογές, και πρέπει να αναγνωριστεί ότι ενώ η λίστα σύγκρισης δεν είναι εξαντλητική, περιλαμβάνει όλα τα μεγαλύτερα και πιο επιρροή σετ δεδομένων στη γεννήτρια βίντεο.

Διαχωρισμοί και Αξιολόγηση

Τα ληφθέντα βίντεο χωρίστηκαν αργότερα σε πολλά clip, σύμφωνα με τη μεθοδολογία που περιγράφεται στην εργασία Panda-70M που αναφέρθηκε παραπάνω. Οι όρια των πλαισίων εκτιμήθηκαν, οι συνθέσεις ραφήθηκαν και τα συνδεμένα βίντεο χωρίστηκαν σε einzel clips, με σύντομες και λεπτομερείς λεζάντες που παρέχονται.

Κάθε εγγραφή δεδομένων στο σετ δεδομένων VideoUFO διαθέτει ένα clip, ένα ID, χρόνους έναρξης και λήξης, και μια σύντομη και μια λεπτομερή λεζάντα.

Κάθε εγγραφή δεδομένων στο σετ δεδομένων VideoUFO διαθέτει ένα clip, ένα ID, χρόνους έναρξης και λήξης, και μια σύντομη και μια λεπτομερή λεζάντα.

Οι σύντομες λεζάντες χειρίστηκαν με τη μέθοδο Panda-70M, και οι λεπτομερείς λεζάντες βίντεο από Qwen2-VL-7B, σύμφωνα με τις οδηγίες που καθορίστηκαν από Open-Sora-Plan. Σε περιπτώσεις όπου τα clip δεν ενσωματώνουν επιτυχώς την προτεινόμενη έννοια, οι λεπτομερείς λεζάντες για κάθε τέτοιο clip παρέχθηκαν στο GPT-4o mini, για να διαπιστωθεί εάν ήταν πραγματικά μια κατάλληλη έννοια για το θέμα. Αν και οι συγγραφείς θα προτιμούσαν την αξιολόγηση μέσω GPT-4o, αυτό θα ήταν πολύ ακριβό για εκατομμύρια βίντεο clip.

Η αξιολόγηση της ποιότητας βίντεο χειρίστηκε με έξι μεθόδους από το VBench project.

Συγκρίσεις

Οι συγγραφείς επανέλαβαν τη διαδικασία εξαγωγής θεμάτων στα προαναφερθέντα προηγούμενα σετ δεδομένων. Για αυτό, ήταν απαραίτητο να συνδέσουν τις παραγώμενες κατηγορίες του VideoUFO με τις αναπόφευκτα διαφορετικές κατηγορίες στις άλλες συλλογές; πρέπει να αναγνωριστεί ότι τέτοιες διαδικασίες παρέχουν μόνο προσεγγιστικές ισοδύναμες κατηγορίες, και επομένως αυτό μπορεί να είναι πολύ υποκειμενική διαδικασία για να εξασφαλίσει εμπειρικές συγκρίσεις.

Ωστόσο, στην εικόνα παρακάτω βλέπουμε τα αποτελέσματα που έλαβαν οι ερευνητές με αυτή τη μέθοδο:

Σύγκριση των θεμελιωδών ιδιοτήτων που εξήχθησαν σε VideoUFO και τα προηγούμενα σετ δεδομένων.

Σύγκριση των θεμελιωδών ιδιοτήτων που εξήχθησαν σε VideoUFO και τα προηγούμενα σετ δεδομένων.

Οι ερευνητές αναγνωρίζουν ότι η ανάλυση τους βασίστηκε στις υπάρχουσες λεζάντες και περιγραφές που παρέχονται σε κάθε σετ δεδομένων. Παραδέχονται ότι η επανα-λεζάντηση των παλαιότερων σετ δεδομένων με την ίδια μέθοδο όπως το VideoUFO θα μπορούσε να προσφέρει μια πιο άμεση σύγκριση. Ωστόσο, δεδομένης της τεράστιας ποσότητας δεδομένων, η σύγκλησή τους ότι αυτή η προσέγγιση θα ήταν απαγορευτικά ακριβή φαίνεται δικαιολογημένη.

Γέννηση

Οι συγγραφείς ανέπτυξαν ένα βENCHMARK για να αξιολογήσουν την απόδοση των μοντέλων κειμένου-βίντεο σε έννοιες που επικεντρώνονται στον χρήστη, με τίτλο BenchUFO. Αυτό περιελάμβανε την επιλογή 791 ουσιαστικών από τα 1.291 αποσταγμένα θέματα χρηστών στο VideoUFO. Για κάθε επιλεγμένο θέμα, δέκα προκλήσεις κειμένου από VidProM επιλέχθηκαν τυχαία.

Κάθε πρόκληση πέρασε από ένα μοντέλο κειμένου-βίντεο, με την προαναφερθείσα Qwen2-VL-7B λεζάντα να αξιολογεί τα παραγόμενα αποτελέσματα. Με όλα τα παραγόμενα βίντεο να έχουν λεζάντες, το SentenceTransformers χρησιμοποιήθηκε για να υπολογίσει την ομοιότητα cosine για cả την εισαγόμενη πρόκληση και την εξαγόμενη (υποτιθέμενη) περιγραφή σε κάθε περίπτωση.

Σχήμα για τη διαδικασία BenchUFO.

Σχήμα για τη διαδικασία BenchUFO.

Τα αξιολογημένα γεννητικά μοντέλα ήταν: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; και Pyramidal.

Εκτός από το VideoUFO, MVDiT-VidGen και MVDit-OpenVid ήταν τα εναλλακτικά σετ δεδομένων εκπαίδευσης.

Τα αποτελέσματα λαμβάνουν υπόψη τα 10-50 χειρότερα και καλύτερα θέματα σε όλες τις αρχιτεκτονικές και σετ δεδομένων.

Αποτελέσματα για την απόδοση των δημόσιων μοντέλων T2V έναντι των μοντέλων που εκπαιδεύτηκαν από τους συγγραφείς, στο BenchUFO.

Αποτελέσματα για την απόδοση των δημόσιων μοντέλων T2V έναντι των μοντέλων που εκπαιδεύτηκαν από τους συγγραφείς, στο BenchUFO.

Εδώ οι συγγραφείς σχολιάζουν:

‘Τα τρέχοντα μοντέλα κειμένου-βίντεο δεν επιτύγχάνουν συνεπώς καλές επιδόσεις σε όλα τα θέματα που επικεντρώνονται στον χρήστη. Συγκεκριμένα, υπάρχει μια διαφορά βαθμολογίας που κυμαίνεται από 0,233 έως 0,314 μεταξύ των 10 κορυφαίων και των 10 χειρότερων θεμάτων. Αυτά τα μοντέλα μπορεί να μην κατανοούν αποτελεσματικά θέματα όπως “γίγας καλαμάρι”, “κυτταρική κυψέλη”, “Βαν Γκογκ” και “αρχαία αιγυπτιακή” λόγω ανεπαρκούς εκπαίδευσης σε τέτοια βίντεο.’

‘Τα τρέχοντα μοντέλα κειμένου-βίντεο δείχνουν ένα certo βαθμό συνεπής στην απόδοση τους στα καλύτερα θέματα. Ανακαλύψαμε ότι τα περισσότερα μοντέλα κειμένου-βίντεο excelling στην παραγωγή βίντεο σε θέματα που σχετίζονται με ζώα, όπως “γλάρος”, “πάντα”, “δελφίνι”, “καμήλα” και “κουκουβάγια”. Υποθέτουμε ότι αυτό οφείλεται εν μέρει σε μια προκατάληψη προς τα ζώα στα τρέχοντα σετ δεδομένων βίντεο.’

Συμπέρασμα

Το VideoUFO είναι μια εξαιρετική προσφορά, ακόμη και από την οπτική της καινοτόμου δεδομένων. Αν δεν υπήρχε λάθος στην αξιολόγηση και την εξάλειψη των κωδικών ID του YouTube, και αν το σετ δεδομένων περιέχει τόσο υλικό που είναι νέο στη σκηνή της έρευνας, είναι μια σπάνια και πιθανώς πολύτιμη πρόταση.

Το μειονέκτημα είναι ότι πρέπει να δώσουμε credence στη βασική μεθοδολογία; αν δεν πιστεύετε ότι η ζήτηση του χρήστη πρέπει να ενημερώνει τις формούλες web-scraping, θα αγοράζατε ένα σετ δεδομένων που έρχεται με τα δικά του σετ προβληματικών προκαταλήψεων.

Επιπλέον, η χρησιμότητα των αποσταγμένων θεμάτων εξαρτάται και από την αξιοπιστία της μεθόδου αποστάγματος που χρησιμοποιήθηκε (η οποία γενικά εμποδίζεται από τους περιορισμούς του προϋπολογισμού), και επίσης από τις μεθόδους διαμόρφωσης για το σετ δεδομένων του 2024 που παρέχει το υλικό πηγής.

Ωστόσο, το VideoUFO αξίζει περαιτέρω έρευνα – και είναι διαθέσιμο στο Hugging Face.

 

* Η αντικατάσταση των παραπομπών των συγγραφέων με υπερσύνδεσμους.

Δημοσιεύθηκε για πρώτη φορά την Τετάρτη, 5 Μαρτίου 2025

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai