Kąt Andersona
Osobista analiza trendów w literaturze z zakresu komputerowego widzenia w 2025 roku

Oświadczenia etyczne i Gaussian Splatting są na odwrót, podczas gdy ogromna ilość zgłoszonych prac stanowi nowy problem do rozwiązania przez AI w 2026 roku.
Opinia Śledzę badania nad komputerowym widzeniem i syntezą obrazu na arXiv i innych platformach przez około siedem lat, na różnych kanałach – wystarczająco długo, aby rozpoznać powtarzające się wzorce i zmiany trendów. Ale te obserwacje są anegdotyczne. Szczera prawda jest taka, że żałuję, iż nie miałem czasu, aby wykorzystać ogromne korpusy stale rosnących danych reprezentowanych przez strumień publikacji Arxiv, który z pewnością kryje ukryte spostrzeżenia, używając analizy z użyciem uczenia maszynowego. Jak jest, mogę tylko relacjonować to, co przyciągnęło moją uwagę od czasu, gdy ostatnio rozważałem tę kwestię.
Objętość na 11
Wiele trendów w zgłoszeniach prac badawczych AI, które zaobserwowałem w 2024 roku, ugruntowało się jako stałe w 2025 roku; nie najmniej z nich jest nieustanny i ciągły wzrost objętości prac związanych z AI, samemu napędzanym przez AI, do punktu postrzeganego kryzysu:

Miesięczne zgłoszenia z dziedziny informatyki na platformie Arxiv, od października 2023 do listopada 2025, z nałożoną trzymiesięczną średnią ruchomą. Źródło
Tempo tego wzrostu zostało scharakteryzowane jako podwójne tempo wzrostu objętości zgłoszeń prac AI, kilka lat temu, i tylko się nasiliło, gdy niedawne pojawienie się mania inwestycyjnej w AI podniosło stawki, a także ilość dostępnych funduszy na badania związane z AI.
Pełne statystyki za 2025 rok nie są jeszcze dostępne, a przedstawione powyżej statystyki agregatowe reprezentują ogólne liczby rosnące we wszystkich kategoriach. Poniżej widać, że informatyka nadal dominuje w trendzie, znacznie powyżej swoich współtowarzyszy:

Wzrost zgłoszeń w dziedzinie informatyki w latach 2022-2025. Źródło
Sortowanie słomy
W październiku, na początku sezonu konferencji, który zawsze przynosi falę nowych badań, pojawiła się objętość zgłoszeń na poziomie ataku typu DOS, co nadało dodatkowy impuls i pilność dotychczas mało popularnemu kierunkowi badań, jakim jest analiza trendów badawczych; innymi słowy, pojawiają się prace i repozytoria, które same próbują przeciąć pogarszający się współczynnik sygnału do szumu w scenie badawczej.
Ostatnio pojawił się NoveltyRank, praca i repozytorium GitHub, które dostosowują LLM, takie jak Qwen3-4B-Instruct-2507 i SciBERT, aby mogły wykonywać klasyfikację binarną zgłoszonych prac (przewidując “nowość” na podstawie poprzednich zgłoszeń), lub porównywać nowość w parach (porównując bieżące zgłoszenia pod kątem “nowości”):

System NoveltyRank porównuje tytuł i abstrakt zgłoszenia z podobnymi poprzednimi pracami, podsumowuje różnice za pomocą LLM, a następnie przekazuje je do dostosowanego modelu Qwen3-4B, który decyduje, czy praca jest ‘pojęciowo nowa’. Źródło
Problem z takimi podejściami “przesiewania” polega na wyzwaniu definiowania istotnych zmiennych. Podejście NoveltyRank wykorzystuje przyjęcie pracy na konferencję jako wskaźnik nowości, a – być może dość lekceważąco – wykorzystuje publikację na Arxiv jako tło ujemnej nowości.
To zakłada dwa fałszywe założenia: po pierwsze, że wszystkie przyjęte na konferencję zgłoszenia są nowatorskie lub mają znaczenie, co jest ewidentnie nieprawdą; a po drugie, że nowość sama w sobie ma niekwestionowaną wartość. Każdy, kto stracił pół godziny na jakieś pozorne, a nawet absurdalne prace zgłoszone – być może – wyłącznie w celu utrzymania ‘publikuj lub zgiń’ kwot, wie, że nowość jest często trywialna, a prace inkrementalne często są istotne.
Zrozumienie wartości nowej pracy obejmuje obszar, w którym AI jest obecnie bardzo słaba – długoterminowy kontekst. Ponieważ często są one napisane w sposób nieuczciwy, prace, które wydają się przełomowe, mogą być ujawnione jako drobne postępy w oparciu o istniejącą pracę; jednakże systemy automatyczne muszą rozwinąć “intuicję” w takich przypadkach, bez flagowania wielu fałszywych pozytywów i bez polegania na uczciwości autorów zgłoszonych prac.
Etyczny skok
Jak zauważyłem wcześniej, portale takie jak Arxiv są dość odporne na laissez faire scrapping, a dostarczane przez nie zrzuty danych często brakuje szczegółowych danych.
Dlatego też, nawet gdybym miał zasoby i czas, aby pobrać i wyodrębnić cechy z odpowiednio reprezentatywnej sekcji prac z dziedziny informatyki, wiele z bardziej subtelnych trendów nie zostałoby ukierunkowanych ani przeanalizowanych.
Jednym z nich jest obecność lub brak załączników oświadczeń etycznych; długo obowiązkowym załącznikiem dla nauk biologicznych, które dotyczą eksperymentów na zwierzętach, rok 2024 był apogeum trendu w kierunku etycznego scharakteryzowania proponowanej pracy, na końcu zgłoszonych prac w kategorii informatyki.
Anegdotycznie stwierdzam, że ta praktyka spadła o kilka stopni w 2025 roku. Moja hipoteza jest taka, że gorące starania obecnego rządu USA w kierunku deregulacji rozwoju AI dały społeczności badawczej w Stanach Zjednoczonych i za granicą pewną zwiększoną licencję i poczucie implicitej ochrony przed odpowiedzialnością prawną.
Pomimo poparcia dla przeciwdziałania głębokim fałszerstwom, obecna administracja USA skutecznie przywróciła wiele ze stanu “dzikiego zachodu”, który charakteryzował lata 2021-2023 – chociaż kontekst czystych badań naukowych, które go definiowały, ewoluował w gorące, a nawet historyczne poziomy inwestycji.
Prace generatywne wideo jako ‘AI Slop’
Wraz z uruchomieniem serii Hunyuan Video i WAN generatywnych wideo w zeszłym roku, AI wideo zostało całkowicie przekształcone w 2025 roku. Stare bariery, takie jak trudność tworzenia pełnych awatarów lub uzyskania przekonywających widoków bocznych osoby, zostały odsunięte wyraźnie w ciągu jednej nocy.
Hojne wydania tego rodzaju z Chin, wraz z włączonymi wagami, ustanowiły tempo dla wydań generatywnych wideo w tym roku i są co najmniej przeciwwagą dla tendencji architektur AI wideo na Zachodzie do bycia bardziej cenzurowanymi, skomercjalizowanymi i przepisanymi.
Brak fosy w tej ironicznie demokratycznej scenie kierowanej przez Chiny doprowadził do setek, jeśli nie tysięcy firm, które starają się wykorzystać rozwijający się rynek inferencyjny, oferując przyjazne dla użytkownika portale, z graczami takimi jak civit.ai i RunPod, korzystających z procedur i technologii, które w wielu przypadkach mogłyby być uruchomione na komputerach domowych.
Ogólnie te inicjatywy są krótkoterminowymi chwytem za gotówkę, które oczekują, że zostaną przejęte przez konsolidację rynku (chociaż, bez wątpienia, ich założyciele nie będą protestować, jeśli przypadkowo natrafią na dominujący udział w rynku, jeśli to się zdarzy).
Ten sam rodzaj monotonii i powtarzalności dotknął gałąź generatywnych wideo w zgłoszeniach na Arxiv w 2025 roku. Jak zauważyłem w zeszłym tygodniu, współczynnik sygnału do szumu w tej kategorii osiągnął numbingowy szczyt, gdy badacze konkurują publicznie o ogromne kwoty potencjalnego finansowania, które zostały uwolnione przez przełomy w tym roku.
Mówiąc szczerze, ogromna większość zgłoszeń tego rodzaju to tylko drobne postępy, co najwyżej. Podstawowe problemy pozostające w generatywnej AI nie pojawiły się zbyt wiele w tym roku: potrzeba utrzymania tożsamości, w stylu LoRA, w trakcie przedstawiania postaci; potrzeba dłuższych czasów wykonywania danych wyjściowych, z utrzymaniem spójności (tj. środowisk i tematów itp., a nie tylko ID); oraz potrzeba poprawy generacji audio i manipulacji w ramach generatywnych wideo i architektur edycji wideo; wśród innych.
Gorączka siatki maleje
Zauważyłem w zeszłym roku, że scena doświadczała znacznego wzrostu prac promujących systemy, które wykorzystują tradycyjną grafikę komputerową (tj. reprezentacje siatkowe rodzaju, który sięga do lat 70-tych), lub włączają ją do ram neuronowych. Zauważyłem znaczne zmniejszenie impetu w kierunku rozwiązań opartych na siatce, szczególnie w drugiej połowie roku, w 2025 roku.
Wiele rozwiązań z wcześniejszej fali prac, szczególnie tych dotyczących parametrycznych postaci ludzkich, takich jak trójwymiarowe modele morficzne, mogło zostać zastąpionych przez nowe możliwości ram generatywnych opartych na dyfuzji, takich jak Veo, Kling, Hunyuan i WAN, wśród wielu innych.
Prace dotyczące Gaussian Splat również wydają się być dotknięte albo stagnacją rozwojową, albo zostały przyćmione przez systemy AI generatywnej z 2025 roku oparte na dyfuzji; albo obie te rzeczy.
Rok temu zauważyłem, że początkowe podekscytowanie GSplat, które zrobiło znaczące wrażenie pod koniec 2023 roku, przerodziło się w węższe linie badań. W tym roku widzę strumień prac skierowanych do rozwiązania znaczących wymagań zasobowych tego podejścia, wśród innych problemów.
Chociaż mogę scharakteryzować Gaussian Splatting jako “obecnie zatrzymany”, powinniśmy pamiętać, że ta technologia sięga do wczesnych lat 90-tych i jest rewanżystyczna z natury.
Jednym z wyjątków od tego ogólnego odwrotu od podejść opartych na siatce jest wyraźny wzrost zainteresowania włączaniem AI do ram przeznaczonych do drukowania 3D.
Zmniejszenie się zgłoszeń z dziedziny AI Security
Moja ostatnia obserwacja za 2025 rok jest taka, że kategoria “Security” w dziedzinie informatyki na Arxiv wykazała znaczny spadek częstotliwości i jakości w 2025 roku, i nie jest łatwo powiedzieć, dlaczego.
Kryptografia i bezpieczeństwo archiwum mogą być uważane za drugorzędne miejsce do publikowania prac, ponieważ ten kierunek badań jest niezwykle zdominowany przez własność intelektualną sektora prywatnego – niewiele z tego pojawia się w czasopismach akademickich, a prawie żadne z nich nie pojawia się na platformach otwartych, takich jak Arxiv.
Ponadto, zgłoszenia do tej kategorii na Arxiv mają wyższą niż przeciętna liczbę “gotchas” – niedopowiedzianych przyznania, często ukrytych w nieoczekiwanych miejscach, które negują lub zmniejszają widoczną wartość i nowość pracy. Przykładem może być metoda naruszenia bezpieczeństwa, która wydaje się sensacyjna, ale która tak naprawdę opiera się na jakimś “białym pudełku” – tj. uprzywilejowanym dostępie do danych lub procedur, takim jak nie mógłby uzyskać atakujący.
Czego można oczekiwać w 2026 roku
Chociaż media grają nieustannie na boomie AI jako powtórce debaklu boomu i upadku dot-com z początku lat 2000 (z niektórymi sprzeciwami), wydaje się to być rodzajem fałszywego bezpieczeństwa. W kwestii infrastruktury, inwestycji, kultury i badań, nie było takiego czasu w historii ludzkości.
Dlatego też trudno powiedzieć, w jakim kierunku scena badawcza będzie się rozwijać w 2026 roku, poza tym, że – jak zwykle – wiele długoterminowych wysiłków dojrzało między teraz a kwietniem, z pewnym “znakiem” obsesji i trendów z 2025 roku, które będą je charakteryzować.
Jednym z rozwojów, które mogą pomóc w kryzysie objętości zgłoszeń na Arxiv i innych portalach, jest zakaz lub kontrola prac generowanych lub wspomaganych przez AI, tak jak Arxiv wprowadził dla prac przeglądowych – jednakże stopień zaangażowania AI w którąkolwiek pracę może okazać się trudny do ilościowego określenia, ponieważ AI przeniknęło do kultury badawczej (i recenzji) podobnie jak do innych dziedzin – jak kropla “atramentu”, która wpływa na całą (istniejącą) szklankę wody, a nie zmieniając medium w sposób radykalny.
Pierwotnie opublikowane w poniedziałek, 22 grudnia 2025












