Η γωνία του Anderson

Μια Προσωπική Μάθηση για τις Τάσεις της Λογοτεχνίας της Υπολογιστικής Όρασης το 2025

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

Οι αποκαλύψεις για την ηθική και η Gaussian Splatting είναι σε παρακμή, ενώ ο απίστευτος όγκος των υποβεβλημένων εργασιών αντιπροσωπεύει ένα νέο πρόβλημα για την τεχνητή νοημοσύνη να αντιμετωπίσει το 2026.

 

Γνώμη Έχω ακολουθήσει την έρευνα υπολογιστικής όρασης και σύνθεσης εικόνας σε arXiv και συναφείς πλατφόρμες για περίπου επτά χρόνια, σε διάφορες πλατφόρμες – αρκετό χρόνο για να διακρίνω επαναλαμβανόμενα μοτίβα και μετατοπίσεις στις τάσεις. Nhưng αυτές οι παρατηρήσεις είναι ανεκδοτικές. Ευχόμουν να είχα τον χρόνο να εκμεταλλευτώ τα τεράστια σώματα των συνεχώς αυξανόμενων δεδομένων που αντιπροσωπεύονται από τη ροή δημοσιεύσεων του Arxiv, τα οποία είναι σίγουρα πλούσια σε κρυφές ερμηνείες, χρησιμοποιώντας ανάλυση με τη βοήθεια της μηχανικής μάθησης. Όπως είναι τώρα, μπορώ μόνο να αναφέρω πιο άνετα τι ήρθε στην προσοχή μου από τότε που τελευταία φορά σκέφτηκα το ζήτημα.

Όγκος στο 11

Πολλές από τις τάσεις στις υποβολές ερευνητικών εργασιών που παρατήρησα το 2024 καθιερώθηκαν ως σταθερά το 2025· όχι το λιγότερο από αυτά είναι η ακαταμάχητη και συνεχής αύξηση του όγκου των εργασιών που σχετίζονται με την τεχνητή νοημοσύνη, οι οποίες τροφοδοτούνται από την τεχνητή νοημοσύνη, σε σημείο κρίσης:

Μηνιαίες υποβολές επιστημονικών εργασιών, Οκτώβριος 2023-Νοέμβριος 2025, με 3-μηνιαία ολιστική μέση τιμή.

Μηνιαίες υποβολές επιστημονικών εργασιών, Οκτώβριος 2023-Νοέμβριος 2025, με 3-μηνιαία ολιστική μέση τιμή.. Πηγή

Αυτός ο ρυθμός αύξησης χαρακτηρίστηκε ως εκθετική διπλασιασμός του όγκου των υποβολών εργασιών της τεχνητής νοημοσύνης, περίπου τρία χρόνια πριν, και έχει μόνο ενισχυθεί περισσότερο με την πρόσφατη έλευση της μανίας επενδύσεων στην τεχνητή νοημοσύνη, η οποία έχει αυξήσει τα στοιχήματα, καθώς και το ποσό των χρηματοδοτικών πόρων που διατίθενται για έρευνα που σχετίζεται με την τεχνητή νοημοσύνη.

Οι πλήρεις στατιστικές για το 2025 δεν είναι ακόμη διαθέσιμες, και οι συνολικές στατιστικές που εμφανίζονται παραπάνω αντιπροσωπεύουν τους γενικούς αριθμούς που αυξάνονται σε όλες τις κατηγορίες. Παρακάτω μπορούμε να δούμε ότι η επιστήμη των υπολογιστών συνεχίζει να κυριαρχεί σε μια κυρίαρχη τάση, σημαντικά πάνω από τους σταθερούς συνεργάτες της:

Αύξηση των υποβολών επιστημονικών εργασιών, 2022-2025.

Αύξηση των υποβολών επιστημονικών εργασιών, 2022-2025. Πηγή

Διαλογή του Χαλβά

Τον Οκτώβριο, την αρχή της εποχής των συνεδρίων, η οποία φέρνει πάντα μια πλημμύρα νέων ερευνών, ήρθε αντί για αυτό μια επίθεση DOS-επιπέδου όγκου υποβολών, δίνοντας πρόσθετη ώθηση και επείγουσα αναγκαιότητα στον ερευνητικό κλάδο της ανάλυσης τάσεων έρευνας: με άλλα λόγια, εργασίες και αποθήκες εμφανίζονται ολοένα και πιο συχνά που, με τον εαυτό τους, επιδιώκουν να διεισδύσουν στην επιδεινούμενη αναλογία σήματος προς θόρυβο στην ερευνητική σκηνή.

Η τελευταία ήρθε μόνο την περασμένη εβδομάδα, με τη μορφή NoveltyRank, μια εργασία και αποθήκη GitHub που επιδιώκει να βελτιώσει τα LLMs όπως Qwen3-4B-Instruct-2507 και SciBERT ώστε να μπορέσουν να thực hiện διπλή ταξινόμηση των υποβεβλημένων εργασιών (προβλέποντας ‘νεωτερικότητα’ από προηγούμενες υποβολές), ή αλλιώς να συγκρίνουν την τρέχουσα υποβολή για ‘νεωτερικότητα’:

Το σύστημα NoveltyRank συγκρίνει τον τίτλο και το περίγραμμα μιας υποβολής με παρόμοιες προηγούμενες εργασίες, συνοψίζει τις διαφορές χρησιμοποιώντας ένα LLM και τις μεταφέρει σε ένα επιδιωρημένο Qwen3-4B μοντέλο που αποφασίζει αν η εργασία θεωρείται 'εννοιολογικά νέα'.

Το σύστημα NoveltyRank συγκρίνει τον τίτλο και το περίγραμμα μιας υποβολής με παρόμοιες προηγούμενες εργασίες, συνοψίζει τις διαφορές χρησιμοποιώντας ένα LLM και τις μεταφέρει σε ένα επιδιωρημένο Qwen3-4B μοντέλο που αποφασίζει αν η εργασία θεωρείται ‘εννοιολογικά νέα’. Πηγή

Το πρόβλημα με τέτοιες ‘διαλογή’ προσεγγίσεις είναι η πρόκληση ορισμού σημαντικών μεταβλητών. Η προσέγγιση NoveltyRank χρησιμοποιεί την αποδοχή μιας εργασίας σε συνέδριο ως δείκτη νεωτερικότητας και – ίσως μάλιστα – χρησιμοποιεί την δημοσίευση στο Arxiv ως υποβάθμιση της ‘αρνητικής’ νεωτερικότητας.

Αυτή η υπόθεση βασίζεται σε δύο ψευδείς προϋποθέσεις: πρώτον, ότι όλες οι εργασίες που έχουν υποβληθεί σε συνέδριο είναι νεωτερικές ή έχουν σημασία, το οποίο είναι προφανώς δεν είναι η περίπτωση· και δεύτερον, ότι η νεωτερικότητα είναι απρόσκοπτα πολύτιμη. Όποιος έχει σπαταλήσει μισή ώρα σε κάποιες από τις ψευδείς, ακόμη και γελοίες εργασίες που υποβλήθηκαν – ίσως – μόνο για να διατηρήσουν ‘δημοσιεύστε-ή-πεθάνετε’ ποσοστά, θα γνωρίζει ότι η νεωτερικότητα είναι συχνά ελάχιστη και η επικαιρική εργασία συχνά σημαντική.

Η κατανόηση της αξίας μιας νέας εργασίας περιλαμβάνει ένα πεδίο όπου η τεχνητή νοημοσύνη είναι τώρα πολύ αδύναμη – μακροπρόθεσμη παράμετρος. Επειδή των συχνά δολίων τρόπων με τους οποίους γράφονται, οι εργασίες που φαίνονται να σπάζουν το έδαφος μπορούν πολύ συχνά να αποκαλυφθούν ως ελάσσονες προόδους σε υπάρχουσες εργασίες· ωστόσο, τα αυτοματοποιημένα συστήματα θα πρέπει να αναπτύξουν μια ‘ενστικτώδη’ γνώση για τέτοιες περιπτώσεις, χωρίς να σηκώνουν πολλαπλά ψευδή θετικά, και χωρίς να βασίζονται στην ειλικρίνεια των συγγραφέων.

Ηθική Πτώση

Όπως παρατήρησα πριν, πύλες όπως το Arxiv είναι αρκετά ανθεκτικές σε απραξία και οι αποθήκες δεδομένων που παρέχουν συχνά λείπουν λεπτομερειών.

Επομένως, ακόμη και αν είχα τους πόρους και τον χρόνο να κατεβάσω και να εξαγάγω χαρακτηριστικά από μια επαρκώς αντιπροσωπευτική διατομή επιστημονικών εργασιών, πολλές από τις πιο λεπτές τάσεις δεν θα είχαν στοχευθεί ή αναλυθεί.

Μια από αυτές είναι η παρουσία ή απουσία ηθικών δηλώσεων: για πολύ καιρό, μια υποχρεωτική ένταξη για τις βιολογικές επιστήμες που αφορούν πειράματα σε ζώα, το 2024 είδε το αποκορύφωμα της τάσης προς ηθική χαρακτηριστική μιας προτεινόμενης εργασίας, στο τέλος των υποβεβλημένων εργασιών στην κατηγορία Επιστήμη των Υπολογιστών.

Ανεκδοτικά, λέω ότι αυτή η πρακτική έχει πέσει από την άκρη καθ’ όλη τη διάρκεια του 2025. Η εκτίμησή μου είναι ότι οι φανατικές προσπάθειες απορρύθμισης της τρέχουσας κυβέρνησης των ΗΠΑ, σε σχέση με την ανάπτυξη της τεχνητής νοημοσύνης, έχει δώσει στην ερευνητική κοινότητα και στις Ηνωμένες Πολιτείες και στο εξωτερικό, μια ορισμένη αύξηση της άδειας και μια αίσθηση της σιωπηρής προστασίας από την νομική έκθεση.

Παρά την υποστήριξή για την αντι-μεγέθυνση της deepfake, η τρέχουσα κυβέρνηση των ΗΠΑ έχει αποτελεσματικά αποκαταστήσει πολύ από τη στάση του ‘αγριού δυτικού’ που χαρακτήρισε την περίοδο 2021-23 – ακόμη και αν ο контекст της καθαρής επιστημονικής έρευνας που την όρισε έχει εξελιχθεί σε θερμές, ακόμη και ιστορικές, επενδύσεις.

Γενετικές Βίντεο Εργασίες ως ‘AI Slop’

Με την εκκίνηση της σειράς Hunyuan Video και WAN γενετικών βίντεο τον περασμένο χειμώνα, η τεχνητή νοημοσύνη βίντεο έχει μεταμορφωθεί εντελώς το 2025. Παλιές εμπόδια όπως η δυσκολία δημιουργίας πλήρης-φυσικής αβατάρ ή η απόκτηση πειστικών προφίλ ενός ατόμου, απομακρύνθηκαν φαινομενικά μέσα σε μια νύχτα.

Οι πλούσιες κυκλοφορίες αυτού του είδους από την Κίνα έχουν, αμφισβητούμενα, ορίσει το ρυθμό για τις γενετικές βίντεο κυκλοφορίες φέτος, και είναι τουλάχιστον μια αντίρροπη πίεση στην τάση των δυτικών αρχιτεκτονικών της τεχνητής νοημοσύνης βίντεο να είναι πολύ πιο ελεγχόμενες, προ-εμπορικές και προκαθορισμένες.

Η απουσία ενός φράγματος σε αυτή τη δημοκρατικά ηγεμονική σκηνή έχει οδηγήσει εκατοντάδες, αν όχι χιλιάδες εταιρείες να επιδιώξουν να εκμεταλλευτούν την αναδυόμενη αγορά για inference, προσφέροντας χρήσιμες πύλες, με παίκτες τόσο διαφορετικούς όσο civit.ai και RunPod να κερδίζουν από διαδικασίες και τεχνολογίες που, σε πολλές περιπτώσεις, θα μπορούσαν να τρέχουν σε οικιακούς υπολογιστές.

Γενικά, αυτές οι πρωτοβουλίες είναι βραχυπρόθεσμες ληστείες που περιμένουν να ανατραπούν από μελλοντική συνένωση της αγοράς (αν και, σίγουρα, οι ιδρυτές τους δεν θα αντιτάχθηκαν να βρουν τυχαία μια κυρίαρχη μερίδα αγοράς, αν αυτό συνέβαινε).

Η ίδια banality και αναπαραγωγή έχει χτυπήσει τη γενετική βίντεο σειρά στις υποβολές του Arxiv το 2025. Όπως παρατήρησα την περασμένη εβδομάδα, η αναλογία σήματος προς θόρυβο για αυτή τη κατηγορία έχει φτάσει σε ένα νουμερικό αποκορύφωμα, καθώς οι ερευνητές ανταγωνίζονται δημόσια για τα τεράστια ποσά潜εντος χρηματοδότησης που έχουν απελευθερωθεί από τις σπαστικές προόδους φέτος.

Λέω ότι η πλειοψηφία των υποβολών αυτού του είδους είναι απλώς επικαιρικές προόδους, στην καλύτερη περίπτωση. Τα βασικά προβλήματα που παραμένουν στην γενετική τεχνητή νοημοσύνη δεν έχουν επιφανεί πολύ φέτος: η ανάγκη να διατηρήσει την ταυτότητα, LoRA-στυλ, καθ’ όλη τη διάρκεια μιας απεικόνισης χαρακτήρα· η ανάγκη για μεγαλύτερες χρονικές διαστήματα για εξόδους βίντεο, με συνολική συνεκτικότητα (δηλ. περιβαλλόντων και θεμάτων, κ.λπ., όχι μόνο ID) διατηρημένη· και για βελτιωμένη γενετική παραγωγή ήχου και χειρισμού εντός γενετικών βίντεο και αρχιτεκτονικών επεξεργασίας βίντεο· μεταξύ άλλων.

Πυρετός Πλέγματος

Παρατήρησα πέρυσι ότι η σκηνή βίωσε μια αξιοσημείωτη αύξηση των εργασιών που προωθούν συστήματα που εκμεταλλεύονται παραδοσιακή CGI (δηλ. πλέγμα-βασισμένες αναπαραστάσεις του είδους που χρονολογούνται από τη δεκαετία του ’70), ή ενσωματώνουν σε νευρωνικά πλαισιά. Έχω παρατηρήσει μια σημαντική μείωση της ώθησης προς πλέγμα-βασισμένες λύσεις, ιδιαίτερα στο δεύτερο μισό του έτους, το 2025.

Πολλές από τις CGI-ενσωματωμένες λύσεις σε εκείνη την προηγούμενη σειρά εργασιών, ιδιαίτερα αυτές που ασχολούνται με παραμετρικά ανθρώπινα ‘ελεγκτικά’ μοντέλα όπως 3D μορφοποιήσιμα μοντέλα, μπορεί να έχουν αντικατασταθεί από τις νέες ικανότητες των diffusion-βασισμένων γενετικών πλαισίων όπως Veo, Kling, Hunyuan και WAN, μεταξύ άλλων.

Ταυτόχρονα, οι εργασίες που ασχολούνται με Gaussian Splat προσεγγίσεις έχουν επίσης φανερά επηρεαστεί είτε από αναπτυξιακή στασιμότητα, είτε από την εκτόξευση από τα diffusion-βασισμένα γενετικά συστήματα του 2025· ή και τα δύο.

Ένα χρόνο πριν, σημείωσα ότι η αρχική ενθουσιασμός της GSplat, η οποία έκανε μια σημαντική εντύπωση στα τέλη του 2023, είχε υποχωρήσει σε στενότερες γραμμές έρευνας. Φέτος, βλέπω μια ροή εργασιών που στοχεύουν να αντιμετωπίσουν τις σημαντικές απαιτήσεις πόρων αυτής της προσεγγίσης, μεταξύ άλλων προβλημάτων.

Αν και θα χαρακτήριζα την Gaussian Splatting ως ‘τώρα σταματημένη’, πρέπει να θυμόμαστε ότι αυτή η τεχνολογία χρονολογείται από τις αρχές της δεκαετίας του ’90 και είναι φυσιολογικά επανερχόμενη.

Μια εξαίρεση σε αυτή τη γενική υποχώρηση από τις πλέγμα-βασισμένες προσεγγίσεις είναι μια φαινομενική αύξηση του ενδιαφέροντος για την ενσωμάτωση της τεχνητής νοημοσύνης σε πλαισιά που στοχεύουν στην τρισδιάστατη εκτύπωση.

Μείωση στις Υποβολές Ασφαλείας της Τεχνητής Νοημοσύνης

Η τελική μου παρατήρηση για το 2025 είναι ότι η κατηγορία ‘Ασφάλεια’ στις υποβολές της κατηγορίας Επιστήμη των Υπολογιστών στο Arxiv έχει δείξει μια αξιοσημείωτη μείωση της συχνότητας και της ποιότητας το 2025, και δεν είναι εύκολο να γυρίσει γιατί.

Το Κρυπτογραφία και Ασφάλεια αρχείο έχει πιθανώς πάντα ήταν ένα δεύτερο κατηγορίας μέρος για να δημοσιεύσετε εργασίες,既然 αυτή η σειρά έρευνας κυριαρχείται από ιδιωτική εταιρική ιδιοκτησία IP – λίγη από την οποία εμφανίζεται σε ακαδημαϊκούς περιοδικούς, και σχεδόν καμία από την οποία δεν εμφανίζεται σε ελεύθερες πλατφόρμες όπως το Arxiv.

Επιπλέον, οι υποβολές σε αυτή τη κατηγορία στο Arxiv έχουν einen-από-το-μέσο-αριθμό ‘gotchas’ – under-παιχνίδια, συχνά κρυμμένα σε απροσδόκητες θέσεις, που αναιρούν ή μειώνουν την φαινομενική αξία και νεωτερικότητα της εργασίας. Ένα παράδειγμα θα ήταν μια φαινομενικά αισθητή μεθοδολογία ασφαλείας που στην πραγματικότητα βασίζεται σε κάποιο ‘λευκό κουτί’ – δηλ. προνομιακή πρόσβαση σε δεδομένα ή διαδικασίες, όπως ένας επιτιθέμενος δεν θα μπορούσε πιθανώς να εξασφαλίσει.

Τι να Περιμένουμε το 2026

Αν και τα μέσα ενημέρωσης παίζουν συνεχώς στο Gen AI boom ως μια επανάληψη της dot.com bubble-αποτυχίας του πρώτου μέρους της δεκαετίας του 2000 (με μερική διαφωνία), αυτό στην πραγματικότητα φαίνεται να αντιπροσωπεύει ένα είδος ψευδούς ασφάλειας. Σε όρους υποδομής, επενδύσεων, πολιτισμού και έρευνας, δεν υπάρχει τέτοια στιγμή στην ιστορία της ανθρωπότητας.

Επομένως, είναι δύσκολο να δούμε ποια κατεύθυνση θα πάρει η ερευνητική σκηνή το 2026, εκτός από το ότι – όπως συνήθως – μια σειρά μακροπρόθεσμων προσπαθειών θα ολοκληρωθεί μεταξύ τώρα και Απριλίου, με ένα bestimmten ‘σφραγίδα’ των εμμονών και τάσεων του 2025 να διακρίνει αυτές.

Μια εξέλιξη που μπορεί να βοηθήσει την κρίση όγκου υποβολών στο Arxiv και σε άλλες πύλες είναι ένα απαγόρευση ή έλεγχος των εργασιών που παράγονται/βοηθούνται από την τεχνητή νοημοσύνη, όπως το Arxiv πρόσφατα applied για αναθεωρημένες εργασίες – ωστόσο, το βαθμό της εμπλοκής της τεχνητής νοημοσύνης σε οποιαδήποτε εργασία μπορεί να αποδειχθεί δύσκολο να ποσοτικοποιηθεί,既然 η τεχνητή νοημοσύνη έχει penetrated ερευνητική κουλτούρα (και peer review) πολύ όπως έχει επηρεάσει άλλους τομείς – ως μια σταγόνα ‘μελάνι’ που επηρεάζει το整ο (υπάρχον) γυάλινο νερό, παρά να αλλάζει ριζικά το μέσο.

 

Πρώτη δημοσίευση Δευτέρα, 22 Δεκεμβρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai