Погляд Anderson

Особистий погляд на тенденції літератури з комп’ютерного зору у 2025 році

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

Етичні роз’яснення та Гауссове розсіювання знаходяться у спаді, тоді як сам об’єм поданих робіт представляє нову проблему для штучного інтелекту у 2026 році.

 

Опінія Я слідкував за дослідженнями комп’ютерного зору та синтезу зображень на arXiv та суміжних платформах протягом приблизно семи років, через різні джерела – досить довго, щоб розрізнити повторювані закономірності та зрушення у тенденціях. Але ці спостереження є анекдотичними. Я щиро бажаю, щоб у мене було час, щоб використати величезні корпори даних, які представлені потоком публікацій arXiv, які, безумовно, багаті на приховані знання, використовуючи аналіз на основі машинного навчання. Як це зараз стоїть, я можу тільки повідомити більш неформально те, що привернуло мою увагу відтоді, як я востаннє розглянув цю справу.

Об’єм на 11

Багато тенденцій у дослідженнях штучного інтелекту, які я спостерігав у 2024 році, встановилися як постійні у 2025 році; не останнє з них – це невпинна та тривала зростання об’ємів робіт, пов’язаних зі штучним інтелектом, яке самим собою підігріється штучним інтелектом, до точки сприйняття кризи:

Щомісячні публікації комп'ютерної науки на arXiv, жовтень 2023 – листопад 2025, з наложенням 3-місячного рухомого середнього значення. Джерело: https://arxiv.org/stats/monthly_submissions

Щомісячні публікації комп’ютерної науки на arXiv, жовтень 2023 – листопад 2025, з наложенням 3-місячного рухомого середнього значення. Джерело

Цей темп зростання характеризувався як експоненційне подвоювання об’ємів робіт про штучний інтелект, кілька років тому, і він тільки посилився з недавнім появою манією інвестицій у штучний інтелект, яка підняла ставки, а також кількість коштів, доступних для досліджень, пов’язаних зі штучним інтелектом.

Повні статистичні дані за 2025 рік ще не доступні, і агреговані статистичні дані, представлені вище, відображають загальні числа, що зростають у всіх категоріях. Нижче ми бачимо, що комп’ютерна наука продовжує бути домінуючою тенденцією, значно вище своїх стабільних партнерів:

Ріст публікацій комп'ютерної науки у 2022-2025 роках. Джерело - https://info.arxiv.org/about/reports/submission_category_by_year.html

Ріст публікацій комп’ютерної науки у 2022-2025 роках. Джерело

Відсівання плевели

У жовтні, на початку осінньої конференційної сезону, який завжди приносить потік нових досліджень, замість цього прийшов об’єм робіт на рівні атаки ДОС, що додало імпульсу та терміновості раніше мало представленому дослідницькому напрямку аналізу тенденцій досліджень; іншими словами, роботи та репозиторії все частіше з’являються, які самі по собі намагаються прорватися через погіршення співвідношення сигнал-шум у дослідницькій сфері.

Останнє відбулося лише на минулому тижні у вигляді NoveltyRank, роботи та репозиторію GitHub, який дофінує великі мови моделі, такі як Qwen3-4B-Instruct-2507 та SciBERT, щоб вони могли виконувати бінарну класифікацію поданих робіт (передбачаючи «новизну» з попередніх подань), або ж парну порівняльну новизну (порівнюючи поточні подання за «новизною»):

Система NoveltyRank порівнює назву та анотацію подання з подібними попередніми роботами, підсумовує відмінності за допомогою великої мови моделі, а потім передає це до дофінуєної моделі Qwen3-4B, яка визначає, чи є робота «концептуально новою». Джерело - https://arxiv.org/pdf/2512.14738

Система NoveltyRank порівнює назву та анотацію подання з подібними попередніми роботами, підсумовує відмінності за допомогою великої мови моделі, а потім передає це до дофінуєної моделі Qwen3-4B, яка визначає, чи є робота «концептуально новою». Джерело

Проблема з такими підходами «відсівання» полягає в виклику визначення значимих змінних. Підхід NoveltyRank використовує прийняття роботи до конференції як індекс новизни, а – можливо, досить зневажливо – використовує публікацію на arXiv як фоновий індекс негативної новизни.

Це припускає дві хибні передумови: по-перше, що всі прийняті до конференції роботи є новими або мають значення, що явно не так; і по-друге, що сама новизна є безумовно цінною. Хто-небудь, хто витратив півгодини на деякі з цих сумнівних, навіть абсурдних робіт, поданих – можливо – лише для підтримки ‘публікуй-або-помри’ квот, знає, що новизна часто тривіальна, а інкрементальна робота часто суттєва.

Поняття цінності нової роботи включає область, де штучний інтелект зараз дуже слабкий – довгостроковий контекст. Через часто нечесний спосіб, яким вони написані, роботи, які здаються революційними, можуть часто бути розкриті як незначні досягнення на основі існуючої роботи; однак автоматизовані системи повинні розвинути «інтуїцію» для таких випадків, без прапорування多численних хибних позитивів, і без залежності від чесності авторів, які подають роботи.

Етичний стрибок

Як я зазначав раніше, портали, такі як arXiv, досить стійкі до лезе-фер витягування даних, а дані, які вони постачають, часто бідні на деталі.

Отже, навіть якщо у мене були б ресурси та час, щоб завантажити та витягти особливості з достатньо репрезентативного перетину робіт комп’ютерної науки, багато з більш тонких тенденцій не були б націлені або проаналізовані.

Одним з них є присутність чи відсутність етичних заяв; довгий час обов’язковий додаток для біологічних наук, які торкаються експериментів на тваринах, 2024 рік побачив апогей тенденції до етичної характеристики запропонованої роботи, в кінці поданих робіт у категорії комп’ютерної науки.

Анекдотично я кажу, що ця практика впала з обрію протягом усього 2025 року. Моя гіпотеза полягає в тому, що запекла дерегуляція зусиль чинного уряду США щодо розвитку штучного інтелекту дала дослідницькій спільноті як у США, так і за кордоном певну збільшену ліцензію та відчуття імпліцитного захисту від юридичної відповідальності.

Відповідно до підтримки анти-деепфейкової регуляції, чинний уряд США фактично відновив більшу частину «дикого заходу» позиції, яка характеризувала період 2021-23 років – хоча контекст чистих наукових досліджень, який визначав його, з тих пір еволюціонував у запеклі, навіть історичні рівні інвестицій.

Генеративні відеороботи як ‘AI-сльоза’

З запуском Hunyuan Video та WAN серії генеративних відеоробіт над останньою зимою, штучний інтелект для відео був повністю перетворений у 2025 році. Старі перешкоди, такі як складність створення повністю фізичних аватарів, або отримання переконливих профільних виглядів людини, були зметені, здавалося б, за одну ніч.

Багаті вагові релізи цього типу з Китаю, ймовірно, встановили темп для генеративних відеорелізів цього року, і є принаймні контрактивним тиском на тенденцію західних архітектур штучного інтелекту для відео бути значно більш цензурованими, комерціалізованими та призначеними.

Відсутність ринку у цій іронічно демократичній сцені Китаю призвела до сотень, якщо не тисяч компаній, які намагаються використати ринок для висновків, пропонуючи користувальницькі портали, з гравцями, такими різними, як civit.ai та RunPod, які отримують прибуток від процедур і технологій, які в багатьох випадках можуть бути запущені на домашніх комп’ютерах.

Загалом, ці ініціативи є короткостроковими фінансовими захопленнями, які очікують бути витіснені майбутньою консолідацією ринку (хоча, безумовно, їхні засновники не будуть ображені, якщо випадково наткнуться на домінуючу частку ринку, якщо це трапиться).

Той самий банальність і повторення вдарили генеративний відеопотік у поданнях arXiv у 2025 році. Як я зазначав на минулому тижні, співвідношення сигнал-шум для цієї категорії досягло оніміння піку, оскільки дослідники публічно конкурують за величезні суми потенційних коштів, які були, безумовно, випущені цими проривами цього року.

Той факт, що більшість цих робіт є лише інкрементальними досягненнями, найкраще. Основні проблеми, які залишаються у генеративному штучному інтелекті, не продемонструвалися цього року: необхідність зберігання ідентичності, типу LoRA, протягом зображення персонажа; необхідність довшого часу виконання для виведення відео, з підтриманням загальної узгодженості (тобто, довкілля та теми тощо, а не тільки ідентифікатор); і для покращення генерації аудіо та маніпулювання у генеративному відео та відеоредакторських архітектурах; серед інших.

Лихоманка сітки спадає

Я спостерігав минулого року, що сцена переживає помітне збільшення робіт, які пропагують системи, які використовують традиційну комп’ютерну графіку (тобто сіткові представлення типу, які походять з 1970-х років), або включають їх до нейронних рамок. Я спостеріг значне зменшення імпульсу до сіткових рішень, особливо у другій половині року, протягом 2025 року.

Багато з цих робіт, особливо ті, які займаються параметричними людськими «контрольними» фігурами, такими як 3D-моделі, можливо, були замінені новими можливостями дифузійних генеративних рамок, таких як Veo, Kling, Hunyuan та WAN, серед інших.

У той же час роботи, які займаються Гауссовим розсіюванням, також, очевидно, були вплинуті або через розвиток застою або через те, що їх затінили дифузійні генеративні системи штучного інтелекту у 2025 році; або через обидва.

Рік тому я відзначив, що початковий ентузіазм Гауссового розсіювання, який зробив вражаючий враження наприкінці 2023 року, сповзнув у вузькі лінії досліджень. Цього року я бачу потік робіт, спрямованих на вирішення суттєвих вимог до ресурсів цього підходу, серед інших проблем.

Хоча я характеризую Гауссове розсіювання як «наразі зупинене», ми повинні пам’ятати, що ця технологія датується початку 1990-х років і є ревенантом за своєю суттю.

Одним з винятків із цього загального відступу від сіткових підходів є очевидне збільшення інтересу до включення штучного інтелекту до рамок, спрямованих на 3D-друк.

Зменшення кількості робіт з безпеки штучного інтелекту

Моє останнє спостереження за 2025 рік полягає в тому, що категорія «Безпека» у розділі комп’ютерної науки на arXiv показала помітне зниження частоти та якості у 2025 році, і не легко здогадатися, чому.

Архів криптографії та безпеки можна вважати другим за класом місцем для публікації робіт, оскільки цей напрямок досліджень несподівано домінує в приватному секторі пропріетарного інтелектуальної власності – мало з яких з’являється в академічних журналах, і майже жодного з них не з’являється у вільних платформах, таких як arXiv.

Крім того, подання до цієї категорії на arXiv мають вищу, ніж у середньому, кількість «підступів» – недооцінених визнань, часто прихованих в несподіваних місцях, які заперечують або зменшують очевидну цінність і новизну роботи. Одним з прикладів може бути чуттєва методика порушення безпеки, яка насправді залежить від деякого «білого ящика» аспекту – тобто привілейованого доступу до даних або процедур, яких нападник навряд чи зможе забезпечити.

Що очікувати у 2026 році

Хоча ЗМІ рифмують постійно про бум штучного інтелекту як повторення краху доткомів на початку 2000-х років (з деким), це насправді здається певним видом фальшивої безпеки. За рахунок інфраструктури, інвестицій, культури і досліджень, безумовно, не було такого часу в історії людства.

Отже, важко побачити, яким чином дослідницька сцена буде розвиватися у 2026 році, окрім того, що – як зазвичай – низка довгострокових зусиль завершиться між зараз і квітнем, з певним «відбитком» одержимостей і тенденцій 2025 року, які будуть відрізняти їх.

Одним з розвитків, який може допомогти кризі об’ємів робіт на arXiv та інших порталах, є заборона або контроль над роботами, створеними за допомогою штучного інтелекту, як це нещодавно зробив arXiv для оглядів робіт – однак ступінь участі штучного інтелекту у будь-якій роботі може виявитися важкою для кількісної оцінки, оскільки штучний інтелект проник у дослідницьку культуру (та перегляд) так само, як і в інші області – як крапля «чорнила», яка впливає на всю (існуючу) склянку води, а не радикально змінює середовище.

 

Перше опубліковано в понеділок, 22 грудня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai