Andersonin kulma

Henkilökohtainen näkemys tietokoneen näkemisen kirjallisuuden trendeistä vuonna 2025

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

Eturistiriitaiset ilmoitukset ja Gaussian Splatting ovat hiipumassa, kun taas jättimäisen määrän lähettämiä papereita edustaa uudenlaista ongelmaa, jonka AI joutuu ratkaisemaan vuonna 2026.

 

Mielipide Olen seurannut tietokoneen näkemistä ja kuvansynteesitutkimusta arXiv:ssä ja muissa julkaisuissa noin seitsemän vuotta, eri kanavissa – tarpeeksi kauan, jotta voin erottaa toistuvat mallit ja trendien muutokset. Mutta nämä havainnot ovat anekdoottisia. Toivon, että minulla olisi aikaa hyödyntää laajaa, jatkuvasti kasvavaa tietojoukkoa, jota arXiv-julkaisuvirran edustaa, joka on varmasti täynnä piileviä oivalluksia, käyttäen koneoppimisen analyysiä. Koska asiat ovat nyt, voin vain raportoida epävirallisesti, mitä minulle on tullut huomattavaksi siitä lähtien, kun viimeksi tarkastelin asiaa.

Ääni 11:llä

Monet trendeistä, joita havainnoi AI-tutkimuspaperien lähetyksissä, vakiinnuttivat itsensä vuonna 2025; ei vähäisimpänä näistä on jatkuvasti kasvava tilavuus AI-aiheisia papereita, jota itse asiassa ruokkii AI, joten se on saavuttanut havaitun kriisin:

Kuukausittaiset tietojenkäsittelytieteelliset Arxiv-lähetykset, lokakuu 2023 - marraskuu 2025, kolmen kuukauden liukuvan keskiarvon kanssa. Lähde: https://arxiv.org/stats/monthly_submissions

Kuukausittaiset tietojenkäsittelytieteelliset Arxiv-lähetykset, lokakuu 2023 – marraskuu 2025, kolmen kuukauden liukuvan keskiarvon kanssa. Lähde

Tämä kasvunopeus luonnehdittiin eksponentiaaliseksi tuplaamiseksi AI-papereiden lähetyksissä joitakin vuosia sitten, ja se on vain vakiinnuttanut otteensa, kun viimeaikainen AI-pandeemia on nostanut panokset sekä lisännyt AI-aiheiseen tutkimukseen saatavilla olevaa rahoitusta.

Vuoden 2025 täydelliset tilastot eivät ole vielä saatavilla, ja yllä olevat yhteenvetotilastot edustavat yleisiä lukuja, jotka kasvavat kaikissa kategoriassa. Alla voidaan nähdä, että tietojenkäsittelytiede jatkaa vallitsevaa trendiä, joka on selvästi muita vakaampi:

2022-2025 tietojenkäsittelytieteellisten lähetysten kasvu. Lähde - https://info.arxiv.org/about/reports/submission_category_by_year.html

2022-2025 tietojenkäsittelytieteellisten lähetysten kasvu. Lähde

Oljen erottaminen

Lokakuussa, syksyn konferenssikauden alussa, joka aina tuo tulvan uutta tutkimusta, tuli sen sijaan DOS-hyökkäyksen tasoinen lähetysten määrä, mikä antoi aiempaa suuremman paineen ja kiireen tutkimustrendien analyysin tutkimussuuntaan; toisin sanoen, papereita ja repositorioita, jotka itsessään pyrkivät leikkaamaan huonontuvaa signaali-kohina-suhdetta tutkimuskohtauksessa.

Viimeisin esimerkki oli vasta viime viikolla, NoveltyRank-paperi ja GitHub-repositorio, joka hienosäätää LLM:ejä, kuten Qwen3-4B-Instruct-2507 ja SciBERT, jotta ne voivat suorittaa binäärisen luokittelun lähettämiä papereita (ennustaa “uudisuutta” aiemmista lähetyksistä) tai parittaisen uudisuuden vertailun (vertailla nykyisiä lähetyksiä “uudisuuden” suhteen):

NoveltyRank-järjestelmä vertaa lähetyksen otsikkoa ja abstraktia samankaltaisiin aiempiin papereihin, yhteenkuuluu eroja LLM:n avulla ja siirtää tämän hienosäädettyyn Qwen3-4B-malliin, joka päättää, onko työ “käsitteellisesti uusi”. Lähde

Tällaisen “siivilöinti”-lähestymistavan ongelma on haasteellinen mielekkäiden muuttujien määrittely. NoveltyRank-lähestymistapa käyttää paperin hyväksymistä konferenssiin uudisuuden indeksinä, ja – ehkä hieman hävittävästi – käyttää Arxiv-julkaisua taustana negatiivisen uudisuuden indeksinä.

Tämä olettaa kaksi väärää premissiä: ensinnäkin, että kaikki konferenssiin hyväksytyt lähetykset ovat uusia tai merkittäviä, mikä on ilmiselvästi ei ole tapahtumassa; ja toiseksi, että uudisuus itsessään on ehdotonta arvoa. Kuka tahansa, joka on haaskannut puoli tuntia joihinkin epäilyttäviin, jopa naurettaviin papereihin, jotka on lähettänyt – ehkä ainoastaan – ylläpitämään ‘julkaise- tai-katoa’-kiintiöt, tietää, että uudisuus on usein triviaalia, ja askelmainen työ on usein merkittävää.

Ymmärtääkseen uuden paperin arvon, on alue, jossa AI on tällä hetkellä hyvin heikko – pitkäaikainen konteksti. Koska ne kirjoitetaan usein epärehellisesti, paperit, jotka vaikuttavat murtavilta, voidaan usein paljastaa vähäisiksi edistysaskeliksi olemassaolevasta työstä; kuitenkin automaattiset järjestelmät on kehitettävä “vaisto” tällaisiin tapauksiin, ilman useiden virheellisten positiivisten liputusta, ja ilman luottamista lähettävien kirjoittajien rehellisyyteen.

Eturistiriitainen syöksy

Kuten olen aikaisemmin havainnut, portaalit kuten Arxiv ovat melko vastustuskykyisiä laissez faire -skrapingille, ja tietojoukot, jotka ne toimittavat, usein puuttuvat hienojakoisesta yksityiskohdasta.

Siksi, vaikka minulla olisi resursseja ja aikaa ladata ja poistaa ominaisuuksia edustavan tietojenkäsittelytieteellisen paperien otoksesta, monet häikäisevimmät trendit eivät olisi kohdistuneet tai analysoitu.

Toinen näistä on etiikanlauselmat läsnäolo tai puute; pitkään pakollinen sisällyttäminen biologisiin tieteisiin, jotka koskevat eläinkokeita, vuosi 2024 näki huipun trendiä kohti eettistä luonnehdintaa ehdotetulle työlle lähetyksen lopussa tietojenkäsittelytieteen kategoriassa.

Anekdoottisesti sanon, että tämä käytäntö on romahtanut vuoden 2025 aikana. Arvaukseni on, että nykyisen Yhdysvaltain hallituksen intohimoinen sääntelyn purku AI-kehitykseen on antanut tutkimusyhteisölle sekä Yhdysvalloissa että ulkomailla tietyn lisenssin ja suojan oikeudelliselta altistumiselta.

Vaikka se on tukeva vastaan deepfake-sääntelyä, nykyinen Yhdysvaltain hallinto on käytännössä palauttanut suuren osan “villistä lännestä” -asenteesta, joka oli luonteenomaista 2021-23 aikakaudelle – vaikka puhtaasti tieteellisen tutkimuksen konteksti, joka määritteli sen, on sittemmin kehittynyt historiallisiksi investoinneiksi.

Generatiiviset videopaperit “AI-sotkuna”

Hunyuan-videon ja WAN-generatiivisen videon julkaisemisen myötä viime talvella AI-videota on muutettu täysin vuonna 2025. Vanhat esteet, kuten täydellisten hahmojen luominen tai vakuuttavan profiilin saaminen henkilöstä, hävisivät ilmeisesti yötä hiljaa.

Runsaiden, painotiedostojen sisältävien julkaisujen Kiinasta ovat, väittäen, asettaneet vauhdin generatiivisille videojulkaisuille tänä vuonna, ja ne ovat vähintään vastapainoa länsimaisen AI-videorakenteiden taipumukseen olla paljon enemmän sensuroituja, kaupallistettuja ja määrättyjä.

Puolustuskuilun puute tässä ironisesti demokraattisessa, Kiinan johtamassa kohtauksessa on johtanut satoihin, ellei tuhansiin yrityksiin, jotka pyrkivät hyödyntämään syntynyttä markkinaa päätöksenteon kautta tarjoamalla käyttäjäystävällisiä portaalien kautta, joiden toimijat ovat niin moninaisia kuin civit.ai ja RunPod hyötyvät menettelyistä ja tekniikoista, jotka voidaan usein suorittaa kotitietokoneilla.

Yleensä nämä aloitteet ovat lyhytaikaisia rahastusyrityksiä, jotka odottavat olevan syrjäytetty lopullisen markkinoiden konsolidoinnin myötä (vaikka heidän perustajansa eivät vastustaisi tapahtumista sattumalta löytävänsä hallitsevan markkinaosuuden, jos sellainen tapahtuu).

Tämä sama arkisuus ja toisto on iskenyt generatiiviseen videopaperiin Arxivin lähetyksissä vuonna 2025. Kuten havainnoi viime viikolla, signaali-kohina-suhde tälle kategoriassa on saavuttanut turruttavan huipun, kun tutkijat kilpailevat julkisesti massiivisista potentiaalisista rahoituspotuksista, jotka tämän vuoden läpimurrot ovat ilman muuta vapauttaneet.

Sanon, että suurin osa näistä lähetyksistä on vain vähäisiä edistysaskelia, parhaimmillaan. Generatiivisen AI:n perussyyt, jotka ovat jääneet ratkaisematta, eivät ole paljastuneet paljon tänä vuonna: tarve säilyttää identiteetti, LoRA-tyylillä, koko hahmon esittämisessä; tarve pitempien suoritusaikojen tulosteille, joissa ylläpidetään yleistä johdonmukaisuutta (ts. ympäristöjen ja teemojen, jne., eikä vain ID); ja parannettu äänen generointi ja manipulointi generatiivisessa videossa ja videoeditoinnissa; muun muassa.

Verkkofrenesia laantuu

Havainnoi viime vuonna, että kohtaus koki merkittävän kasvun papereiden määrässä, jotka hyödyntävät perinteistä CGI:ää (ts. verkkopohjaisia edustuksia samanlaisia, jotka juontavat juurensa 1970-luvulle). Olen havainnut merkittävän vauhdin laskun verkkopohjaisiin ratkaisuihin, erityisesti vuoden 2025 jälkimmäisellä puoliskolla.

Monet CGI:ää sisältävistä ratkaisuista aiemmassa aallokossa papereita, erityisesti niistä, jotka käsittelevät parametrisevia ihmishahmoja, kuten 3D-muokattavia malleja, ovat voineet korvata uusien diffuusiopohjaisen generatiivisten kehysten, kuten Veon, Klingin, Hunyuanin ja WANin, muiden muassa, kyky.

Paperit, jotka käsittelevät Gaussian Splat -lähestymistapoja, ovat myös ilmeisesti vaikuttaneet joko kehitykselliseen turruttamiseen tai 2025 diffuusiopohjaisen gen AI -järjestelmien syrjäyttämiseen; tai molemmat.

Vuosi sitten huomasin, että Gaussian Splattingin alkuperäinen jännitys, joka teki huomionarvoisen vaikutuksen vuoden 2023 lopulla, oli hiipunut kapeampiin tutkimussuuntiin. Tänä vuonna näen paperien virran, joka on suunnattu osoittamaan tämän lähestymistavan merkittäviä resurssivaatimuksia, muun muassa ongelmia.

Vaikka kuvailisin Gaussian Splattingia “tällä hetkellä pysähtyneeksi”, meidän on muistettava, että tämä teknologia on peräisin 1990-luvun alusta, ja on luonteeltaan palautuvainen.

Yksi poikkeus tähän yleiseen vetäytymiseen verkkopohjaisista lähestymistavoista on ilmeinen kiinnostuksen kasvu AI:n sisällyttämisessä kehyksiin, jotka on tarkoitettu 3D-tulostamiseen.

Vähentyminen AI-turvalähetyksissä

Viimeinen havaintoni vuodelta 2025 on, että “Turvallisuus” -kategorian lähetykset tietojenkäsittelytieteen osiossa Arxivissa ovat todistaneet merkittävän laskun lähetyksien määrässä ja laadussa vuonna 2025, ja se ei ole helppo arvata, miksi.

Salakirjoitus- ja turvallisuusarkisto on aina ollut toissijainen paikka julkaista papereita, koska tämä tutkimussuunta on yllättäen hallinnollinen yksityinen omistus – vähän siitä, joka ilmestyy akateemisissa lehdissä, ja lähes yhtään, joka näkyy vapaissa alustoissa, kuten Arxivissa.

Lisäksi lähetykset tähän kategoriaan Arxivissa ovat keskimääräistä enemmän “gotchas” -admissioneja, jotka vähentävät tai mitätöivät paperin ilmeisen arvon ja uudisuuden. Yksi esimerkki olisi ilmeisesti sensaatiomainen turvallisuusloukkausmenetelmä, joka itse asiassa riippuu jostakin “valkoisen ruudun” -aspektista – ts. etuoikeutetusta pääsystä tietoihin tai menettelyihin, kuten hyökkääjä ei välttämättä voi turvata.

Mitä odottaa vuonna 2026

Vaikka media vibrat jatkuvasti Gen AI -buumista uudelleen Dot-com -buumin ja -romahduksen tapahtumana (jonka jotkut vastustavat), tämä edustaa itse asiassa lajia turvallisuutta. Infrastruktuurin, sijoitusten, kulttuurin ja tutkimuksen suhteen ei ole ollut vastaavaa aikaa ihmiskunnan historiassa.

On siis vaikea nähdä, mihin suuntaan tutkimuskohtaus kehittyy vuonna 2026, paitsi, että – kuten yleensä – useat pitkäaikaiset ponnistelut tulevat päätökseen nyt ja huhtikuun välillä, ja tietty “leima” vuoden 2025 omistautumista ja trendejä erottaa niitä.

Yksi kehitys, joka voi auttaa lähetyksen määrän kriisiä Arxivissa ja muissa portaalissa, on kielto tai tarkastus AI:lla luotujen / avustettujen papereiden lähetyksistä, kuten Arxiv vastikään toteutti arvostelupapereita varten – kuitenkin AI:n osallistumisen määrä kussakin paperissa voi osoittautua vaikeaksi määritettäväksi, koska AI on penetrated tutkimuskulttuuriin (ja vertaisarvio) samalla tavoin kuin se on tunkeutunut muihin alueisiin – kuin tippa “mustetta”, joka vaikuttaa koko olemassaolevaan lasiin vettä, eikä radikaalisti muuta välinettä.

 

Julkaistu ensimmäisen kerran maanantaina, 22. joulukuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai