Η γωνία του Anderson
Ένας Κωδικός Βίντεο για τη Γεννήθηκε από τον AI Footage

Καθώς η εποχή του all-you-can-eat AI έρχεται στο τέλος της, μια οικονομική νέα προσέγγιση για τη γεννήθηκε από τον AI βίντεο υπόσχεται αξιοσημείωτες εξοικονομήσεις σε tokens και χρόνο.
Ο πραγματικός κόστος της inference του AI φέρνει μια νέα νότα σοβαρότητας στο γρήγορο ρυθμό της τρέχουσας επανάστασης του AI, με αυξημένο ενδιαφέρον για τη ριζική μείωση του κόστους της μηχανικής μάθησης. Εκτός από το δυνατό να φέρει τον AI στο σπίτι, και την γενική άνοδο του ιδιωτικού AI, οι ρουτίνες της μηχανικής μάθησης που είναι πεινασμένες για VRAM και πόρους θα χρειαστούν επίσης βελτιστοποίηση.
Η γεννήθηκε από τον AI βίντεο είναι ίσως ο μεγαλύτερος δράστης σε αυτήν την περίπτωση. Αν έχετε ποτέ ανασυμπιέσει μια ταινία ή εξαγάγετε одну από ένα πρόγραμμα επεξεργασίας βίντεο, ήδη γνωρίζετε τον κόπο που αυτή η συγκεκριμένη (μη AI) εργασία έχει στις апаратικές σας πόρους – τρώγοντας RAM και κύκλους CPU, και συχνά μπλοκάροντας την μηχανή για οποιαδήποτε άλλη χρήση, εκτός αν ληφθούν μέτρα για να περιοριστεί η επίδραση του αλγορίθμου συμπίεσης στην υπολογιστή.
Γι’ αυτό, δεν χρειάζεται παρά να φανταστείτε το βαθμό στον οποίο η άνοδος του AI βίντεο επαναλαμβάνει αυτήν την “πείνα για δύναμη” διαδικασία σε κέντρα δεδομένων σε όλο τον κόσμο. Σε αυτήν την κλίμακα λειτουργίας, οι μικρότερες κερδισμένες γίνονται αμέσως σημαντικές στη συνθετική απογραφή.
Στο Πλαίσιο
Με αυτήν τη σκέψη, μια νέα ερευνητική προσφορά από τη Σανγκάη, σε συνεργασία με την JD.com (JD ), προτείνει einen βίντεο κωδικό που δεν στοχεύει στην διαδικασία της απόδοσης (τη διαδικασία της συμπίεσης μεγάλων, ακατέργαστων πλαισίων σε ένα μικρότερο μέγεθος αρχείου βίντεο), αλλά στη διαδικασία της γεννήθηκε από τον AI βίντεο自體.
Ένας κανονικός βίντεο κωδικός λειτουργεί δημιουργώντας ένα μικρότερο αριθμό πλήρων εικόνων, που ονομάζονται I-πλάνα, και στη συνέχεια αποθηκεύοντας αλλαγές μεταξύ πλαισίων.
Για παράδειγμα, αν ένας άνθρωπος κινείται ελαφρά σε ένα βίντεο, ο κωδικός καταγράφει μόνο τα μέρη του πλαισίου που καταγράφουν αυτήν την αλλαγή, αντί να ξαναγράφει ολόκληρη τη σκηνή. Αυτά είναι P-πλάνα, που προέρχονται από προηγούμενα πλάνα, και B-πλάνα, που μπορούν επίσης να προβλέψουν πληροφορίες σε μελλοντικά πλάνα:

Ανατομία ενός βίντεο κωδικού: η πρώτη σειρά δείχνει πλάνα με την πάροδο του χρόνου με ετικέτες I, P και B, με τα I-πλάνα να αποθηκεύονται πλήρως σε πλήρες χρώμα και τα P- και B-πλάνα να εμφανίζονται με εξασθένηση για να υποδείξουν ανακατασκευή. Οι βέλοι δείχνουν εάν τα πλάνα χρησιμοποιούν προηγούμενα πλάνα, μελλοντικά πλάνα ή και τα δύο. Τα κάτω πάνελ απεικονίζουν ένα πλήρως αποθηκευμένο πλάνο (I-πλάνο, αριστερά), ένα πλάνο που κατασκευάζεται από ένα προηγούμενο πλάνο (P-πλάνο, δεύτερο-αριστερά) και ένα πλάνο που κατασκευάζεται και από προηγούμενα και μελλοντικά πλάνα (B-πλάνο, δεξιά).
Αυτή η ανακατασκευή πληροφοριών από κοντινές πληροφορίες είναι ο λόγος για τον οποίο τα αρχεία βίντεο παραμένουν μικρά, με τα περισσότερα πλάνα να λειτουργούν όχι ως νέες εικόνες, αλλά ως οδηγίες που περιγράφουν πώς έχει αλλάξει το προηγούμενο πλάνο. Γι’ αυτό, τα I-πλάνα αποτελούν ‘πλήρεις’, χώρο-παράνομα, ακατέργαστες (ή ελαφρώς συμπιεσμένες) εικόνες, με τα πλάνα μεταξύ τους να αποτελούν μόνο τη διαφορά μεταξύ των I-πλάνων (και μεταξύ τους).
Όταν κάθε einzel πλάνο είναι μια πλήρης ακατέργαστη εικόνα, η ταινία έχει καμία συμπίεση. Η αποθήκευση μιας ταινίας με αυτόν τον τρόπο, ως ακατέργαστο βίντεο, θα απαιτούσε σχεδόν (ή περισσότερο από) ένα τεράμπαϊτ χώρου δίσκου. Αυτό είναι το πώς ο AI δημιουργεί ταινίες† – αφιερώνοντας ίσους πόρους και tokens σε κάθε πλάνο, όταν υπολογίζει πώς να διαμορφώσει το βίντεο.
Οικονομία Κλίμακας
Η νέα εργασία, με τίτλο AdaCodec: Ένας Προβλεπτικός Οπτικός Κωδικός για τα MLLMs Βίντεο, εξοδεύει πλήρεις οπτικούς tokens εξαιρετικά σε αναφορικά πλάνα (I-πλάνα), με όλα τα διαμεσολαβικά πλάνα να αποδίδονται ως ‘συμπυκνωμένα P-tokens’ – ένα παράδειγμα που έχει ληφθεί από την παραδοσιακή συμπίεση που χρησιμοποιείται από τους ιστορικούς ‘πραγματικούς κόσμους’ βίντεο κωδικούς.
Μετά από αυτήν την εσωτερική συμπίεση, το genAI βίντεο μπορεί να συμπιεστεί κανονικά, και, σε θεωρία, όλες οι εξοικονομήσεις είναι πλευρές εξυπηρετητή:

Επισκόπηση του AdaCodec. Αριστερά, τα βίντεο χωρίζονται σε προσαρμόσιμες ομάδες εικόνων, με πλήρη I-πλάνα να διατηρούνται για στιγμές που είναι δύσκολο να προβλεφθούν και μεσολαβικά P-πλάνα να αντιπροσωπεύονται χρησιμοποιώντας συμπυκνωμένη κίνηση και υπολειμματική πληροφορία. Δεξιά, το αποτέλεσμα του συστήματος αντιστοιχεί ή υπερβαίνει το Qwen3-VL-8B σε έντεκα διαγώνισματα, διατηρεί υψηλότερη ακρίβεια βίντεο σε μεγάλες διαγώνισματα σε προϋπολογισμούς token, και μειώνει την καθυστέρηση απόκρισης ενώ επεξεργάζεται σημαντικά λιγότερα βίντεο tokens. Πηγή
Οι εξοικονομήσεις, σύμφωνα με τις αναφερόμενες αποτελέσματα από τους διαγώνιστες για το AdaCodec, αξίζουν να καταδιωχθούν· το έγγραφο αναφέρει ότι το σύστημα υπερέβη το αμεταβλητό Qwen3-VL-8B μοντέλο σε κάθε σημαντικό διαγώνισμα, ενώ χρησιμοποιούσε την ίδια ποσότητα επεξεργασίας· και ακόμη αντιστοιχούσε ή υπερέβη την απόδοση του μοντέλου μετά την κοπή των βίντεο tokens κατά περίπου 86%.
Οι συγγραφείς αναφέρουν*:
‘Παίρνουμε έμπνευση από την προβλεπτική κωδικοποίηση, όπου ένα σύστημα μεταδίδει σφάλματα από μια πρόβλεψη αντί του raw σήματος. Αυτό το principio έχει βιολογική βάση: το οπτικό σύστημα θεωρείται ότι κωδικοποιεί σφάλματα πρόβλεψης, την ασυμφωνία μεταξύ αναμενόμενου και παρατηρούμενου εισόδου, αντί του εισόδου selbst.
‘Οι σύγχρονοι βίντεο κωδικοί χρησιμοποιούν την ίδια ιδέα της υπολειμματικής κωδικοποίησης στην μηχανική: τα αναφορικά πλάνα φέρουν πλήρη περιεχόμενο, ενώ τα προβλεπτικά πλάνα φέρουν κίνηση και υπολειμματικά σήματα σε σχέση με ένα αναφορικό.
‘Αυτά τα συστήματα έχουν διαφορετικά αντικείμενα, αλλά μοιράζονται την ίδια συνθήκη: όταν κοντινά δείγματα είναι περιττά, το κανάλι πρέπει να μεταφέρει τι η πρόβλεψη δεν μπορεί να εξηγήσει.
‘Τα τυπικά κωδικοί, ωστόσο, βελτιστοποιούν για bitstreams και ανθρώπινα ορατά ανακατασκευή, όχι για οπτικούς tokens που καταναλώνονται από ένα LLM. Επομένως, ξανασχεδιάζουμε αυτό το μηχανισμό ως μια διεπαφή MLLM για την κατανόηση βίντεο.’
Η νέα εργασία, γραμμένη από 11 ερευνητές από το Πανεπιστήμιο Σανγκάη Τζιάο Τονγκ, το Ινστιτούτο Καινοτομίας Σανγκάη και την JD.com, έρχεται με μια σχετική σελίδα έργου, με την κυκλοφορία του πηγαίου κώδικα να υποσχέται.
Μέθοδος
Όπως συζητήθηκε, αντί να αντιμετωπίζουν κάθε πλάνο ως μια完全 νέα εικόνα, το σύστημα ψάχνει για τι έχει αλλάξει μεταξύ ενός πλάνου και του επόμενου. Στο αριστερό, στην εικόνα παρακάτω, βλέπουμε μια μικρή περιοχή του τρέχοντος πλάνου που αντιστοιχεί στο πιο相似的 περιοχή σε ένα προηγούμενο πλάνο:

Σχήμα ανασκόπησης για το AdaCodec.
Η απόσταση μεταξύ των δύο θέσεων γίνεται ένα motion vector, ενώ οποιαδήποτε υπολειμματικές οπτικές διαφορές γίνονται μια υπολειμματική, με αυτές τις συμπυκνωμένες περιγραφές να αντικαθιστούν την ανάγκη να αποθηκεύσουμε μια πλήρη εικόνα.
Στο δεξί, βλέπουμε τις απαιτούμενες πληροφορίες που εισάγονται στο μοντέλο AI: σημαντικά αναφορικά πλάνα εξακολουθούν να επεξεργάζονται ως πλήρεις εικόνες, αλλά τα μεσολαβικά πλάνα αντιπροσωπεύονται από πολύ μικρότερα κίνηση και υπολειμματικά tokens – φαινομενικά επιτρέποντας στο μοντέλο να διατηρεί αρκετές πληροφορίες για να αναλύσει το βίντεο, ενώ επεξεργάζεται σημαντικά λιγότερα οπτικά δεδομένα.
Ένα ενδιαφέρον πρόκληση είναι να αποφασίσει ποια πλάνα αξίζουν να αποθηκευτούν πλήρως: οι παραδοσιακοί βίντεο κωδικοί τοποθετούν συνήθως αναφορικά πλάνα σε τακτά χρονικά διαστήματα, ανεξάρτητα από το αν είναι απαραίτητα ή όχι. Το AdaCodec, αντίθετα, προσπαθεί να αναγνωρίσει τις στιγμές που έχουν τη μεγαλύτερη σημασία.
Για παράδειγμα, σκεφτείτε μια σκηνή που απεικονίζει κυρίως μια στατική συζήτηση μεταξύ δύο ατόμων σε ένα διαμέρισμα – και ξαφνικά μια ομάδα SWAT εισβάλλει από το παράθυρο. Αμέσως οι κάμερες και οι επεξεργασίες θα αυξηθούν και θα απαιτήσουν πολύ περισσότερα δεδομένα από ό,τι θα παρείχε ένα κανονικό αναφορικό πλάνο.

Αυτή είναι η λογική πίσω από τις μεθόδους συμπίεσης (μεταβλητή bitrate) που αναλύουν το πηγή βίντεο για τέτοιες ‘βυσματικές’ περιόδους και κατανέμουν μεγαλύτερα δεδομένα όπου είναι απαραίτητα – με κανένα μικρό κόστος χρόνου και πόρων.
Στο AdaCodec, αν ένα πλάνο μπορεί να προβλεφθεί ακριβώς από κοντινά πλάνα, το σύστημα συνεχίζει να χρησιμοποιεί συμπυκνωμένα κίνηση και υπολειμματικά tokens; αν η σκηνή αλλάζει σημαντικά (π.χ. το παράδειγμα SWAT παραπάνω, ή κάτι λιγότερο δραματικό), ένα πλήρες αναφορικό πλάνο εισάγεται. Αυτό επιτρέπει περισσότερους από τους διαθέσιμους πόρους να ξοδευτούν σε σημαντικές οπτικές πληροφορίες αντί να διανέμονται ομοιόμορφα σε όλο το βίντεο.
Δεδομένα και Διαγώνιστες
Στους διαγώνιστες, οι ερευνητές χρησιμοποίησαν το προαναφερθέν Qwen3-VL-8B ως το βασικό μοντέλο και αξιολόγησαν το AdaCodec σε έντεκα διαγώνιστες που καλύπτουν τρεις περιοχές κατανόησης βίντεο: πρόσωπο-βίντεο απόδοση αξιολογήθηκε με MLVU, LongVideoBench, και LVBench; χρονική κατανόηση με TempCompass, MotionBench, και TOMATO; και γενική κατανόηση βίντεο με Video-MME, MVBench, NExT-QA, PerceptionTest, και EgoSchema.
Οι ανοιχτοί κωδικοί που δοκιμάστηκαν ήταν InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; και Molmo2-O-7B.
Τα GPT-5, Gemini, και Claude παραλλαγές εμφανίζονται στον πίνακα παρακάτω μόνο ως σύγκριση βάσεων. CoPE-VideoLM-7B και ReMoRa-7B είναι προηγούμενα μοντέλα βίντεο-γλώσσας που μειώνουν τη χρήση οπτικών tokens μέσω codec-εμπνευσμένης συμπίεσης, καθιστώντας τα τα πιο κοντινά άμεσα ανταγωνιστές του AdaCodec:

Κύρια αποτελέσματα σε έντεκα διαγώνιστες που καλύπτουν πρόσωπο-βίντεο απόδοση, χρονική κατανόηση και γενική κατανόηση βίντεο. Υψηλότερες βαθμολογίες δείχνουν καλύτερη απόδοση. LVB = LongVideoBench; V-MME = Video-MME. Bold και υπογραμμισμένες τιμές δείχνουν τις υψηλότερες και δεύτερες υψηλότερες βαθμολογίες μεταξύ των ανοιχτών κωδικών μοντέλων. Οι βαθμολογίες για τα κλειστά μοντέλα λήφθηκαν από τις επίσημες αναφορές όπου ήταν διαθέσιμες, με λείπουσες βαθμολογίες που προέρχονται από Molmo2 ή αξιολογήθηκαν από τους συγγραφείς.
Για να διασφαλιστεί μια δίκαιη σύγκριση, ο ίδιος αριθμός οπτικών tokens εκχωρήθηκε και στο AdaCodec και στο τυπικό Qwen3-VL-8B σύστημα, επιτρέποντας τα αποτελέσματα να αντανακλούν την αποτελεσματικότητα της προσέγγισης συμπίεσης, αντί για οποιαδήποτε διαφορές στις υπολογιστικές πόρους.
Στην πιο επιθετική ρύθμιση, το AdaCodec μείωσε τη χρήση οπτικών tokens κατά περίπου 86%, ενώ vẫn αντιστοιχούσε ή υπερέβαινε το βασικό σύστημα σε διαγώνιστες πρόσωπο-βίντεο, χρονικής κατανόησης και γενικής κατανόησης βίντεο.
Όταν οι αποθηκευμένοι tokens επαναχρησιμοποιήθηκαν για την επεξεργασία περισσότερων βίντεο πλάνων, η απόδοση βελτιώθηκε σε κάθε διαγώνιστα πρόσωπο-βίντεο και σε κάθε διαγώνιστα χρονικής κατανόησης, με κέρδη που έφτασαν +5.4 πόντους στο LongVideoBench και +4.3 πόντους στο TOMATO, ενώ παράγουν επίσης einige από τα ισχυρότερα ανοιχτά μοντέλα στη μελέτη.
Συμπέρασμα
Αν και τα έργα αυτού του είδους στοχεύουν συνήθως σε παρόχους μεγάλης κλίμακας, αυτό είναι το είδος της προσπάθειας που θα ενδιαφέρει τους χομπίστες και τις ΜΜΕ, ως μέρος μιας πιθανής νέας ‘δημόσιας ασκητικής’ γύρω από την τοπική, ρασιοναлизμένη ανάπτυξη του AI.
Στις κοινότητες όπως το r/stablediffusion, αυτό είναι πολύ παλιό νέο, поскольку κάθε μεγάλη ανοιχτή κυκλοφορία που φτάνει εκεί είναι τακτικά τορπιλισμένη σε μια υπερ-βελτιστοποιημένη (GGUF, quantized weights, κ.λπ.) έκδοση που μπορεί να τρέξει, με κάποια υπομονή, σε χαμηλότερες γραφικές κάρτες.
Αν η ‘εμφανισιακή σκηνή’ αυτής της τρίτης AI άνοδου πραγματικά τελειώνει, και με την υπόθεση ότι οι εταιρείες θα απομακρυνθούν από τα πραγματικά κόστη της inference, τότε πρωτοβουλίες όπως το AdaCodec μπορεί να αποτελούν μέρος μιας επερχόμενης ‘μεγάλης βελτιστοποίησης’.
† Αυτό δεν είναι το ίδιο με την απόδοση του βίντεο σε μια χρήσιμη μορφή/μέγεθος αρχείου· αντίθετα, ασχολείται με την εσωτερική γεννήθηκε και συλλογή πλάνων που λαμβάνει χώρα μέσα στο μοντέλο AI κατά την ώρα της inference.
* Η μετατροπή μου, εντός του λόγου, των ενσωματωμένων παραπομπών των συγγραφέων σε υπερσυνδέσμους.
Πρώτη δημοσίευση Πέμπτη, 4 Ιουνίου 2026












