Взгляд Anderson

Личный взгляд на тенденции литературы компьютерного зрения в 2025 году

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

Этические раскрытия и Гауссовское распыление на спаде, в то время как огромный объем представленных статей представляет собой новую проблему для ИИ в 2026 году.

 

Мнение Я следил за исследованиями компьютерного зрения и синтеза изображений на arXiv и связанных площадках примерно семь лет, через различные источники – достаточно долго, чтобы различать повторяющиеся закономерности и сдвиги в тенденциях. Но эти наблюдения являются анекдотическими. Я честно желаю, чтобы у меня было время, чтобы воспользоваться огромными корпорациями постоянно растущих данных, представленных потоком публикаций Arxiv, который, безусловно, богат скрытыми идеями, используя анализ машинного обучения. Поскольку это стоит, я могу только сообщить более неформально, что привлекло мое внимание с тех пор, как я последний раз рассматривал этот вопрос.

Объем на 11

Многие из тенденций в представлениях исследовательских статей ИИ, которые я наблюдал в 2024 году, утвердились как устойчивые в 2025 году; не в последнюю очередь – неуклонный и продолжающийся рост объема статей, связанных с ИИ, который сам по себе обусловлен ИИ, до точки воспринимаемого кризиса:

Ежемесячные представления компьютерной науки Arxiv, октябрь 2023 - ноябрь 2025, с наложенной трехмесячной скользящей средней.

Ежемесячные представления компьютерной науки Arxiv, октябрь 2023 – ноябрь 2025, с наложенной трехмесячной скользящей средней. Источник

Этот темп роста был охарактеризован как экспоненциальное удвоение объема представлений статей ИИ, несколько лет назад, и он только усилился с недавним появлением мании инвестиций в ИИ, которая повысила ставки, а также количество средств, доступных для исследований, связанных с ИИ.

Полные статистические данные за 2025 год еще не доступны, и представленные выше агрегированные статистические данные представляют собой общие цифры, увеличивающиеся во всех категориях. Ниже мы можем увидеть, что компьютерная наука продолжает доминировать в устойчивой тенденции, значительно выше своих стабильных партнеров:

Рост представлений компьютерной науки в 2022-2025 годах. Источник - https://info.arxiv.org/about/reports/submission_category_by_year.html

Рост представлений компьютерной науки в 2022-2025 годах. Источник

Сортировка мякины

В октябре, в начале осеннего сезона конференций, который всегда приносит поток новых исследований, вместо этого пришел объем представлений на уровне атаки DOS, придавая дополнительный импульс и срочность ранее недостаточно представленному исследовательскому направлению анализа тенденций исследований; другими словами, статьи и репозитории все чаще появляются, которые сами по себе стремятся прорезать все худшее соотношение сигнала и шума в научной сфере.

Последнее появилось только на прошлой неделе, в виде NoveltyRank, статьи и репозитория GitHub, который донастраивает модели LLM, такие как Qwen3-4B-Instruct-2507 и SciBERT, так что они могут выполнять бинарную классификацию представленных статей (предсказывая ‘новизну’ из предыдущих представлений), или же парную сравнение новизны (сравнивая текущие представления для ‘новизны’):

Система NoveltyRank сравнивает название и аннотацию представления с подобными предыдущими статьями, суммирует различия с помощью модели LLM и передает это донастроенной модели Qwen3-4B, которая решает, является ли работа 'понятийно новой'. Источник - https://arxiv.org/pdf/2512.14738

Система NoveltyRank сравнивает название и аннотацию представления с подобными предыдущими статьями, суммирует различия с помощью модели LLM и передает это донастроенной модели Qwen3-4B, которая решает, является ли работа ‘понятийно новой’. Источник

Проблема с такими ‘просеивающими’ подходами заключается в задаче определения значимых переменных. Подход NoveltyRank использует принятие статьи в конференцию в качестве индекса новизны и – возможно, довольно пренебрежительно – использует публикацию в Arxiv в качестве фонового индекса отрицательной новизны.

Это предполагает два ложных предпосылки: во-первых, что все принятые в конференцию представления являются новыми или значимыми, что явно не так; и во-вторых, что новизна сама по себе является безусловной ценностью. Любой, кто потратил полчаса на некоторые из спекулятивных, даже нелепых статей, представленных – возможно, – только для поддержания ‘публикуй-или-умри’ квот, знает, что новизна часто тривиальна, а инкрементальная работа часто значима.

Понимание ценности новой статьи включает область, где ИИ сейчас очень слаб – долгосрочный контекст. Из-за часто неискреннего способа, которым они написаны, статьи, которые кажутся прорывными, могут часто быть раскрыты как незначительные достижения в существующей работе; однако, автоматизированные системы должны развить ‘интуицию’ для таких случаев, без флагирования множества ложных положительных результатов и без полагания на честность представляющих авторов.

Этический прыжок

Как я наблюдал ранее, порталы, такие как Arxiv, довольно устойчивы к лэзэ-фэр скрейпингу, и данные, которые они поставляют, часто лишены детальной информации.

Следовательно, даже если бы у меня были ресурсы и время, чтобы скачать и извлечь функции из адекватно представительной выборки компьютерных научных статей, многие из более тонких тенденций не были бы нацелены или проанализированы.

Одним из них является наличие или отсутствие этических заявлений; давно обязательным включением для биологических наук, которые затрагивают эксперименты на животных, 2024 год увидел апогей тенденции к этической характеристике предложенной работы, в конце представленных статей в категории Компьютерная наука.

Анекдотически, я говорю, что эта практика упала с обрыва на протяжении всей 2025 года. Моя догадка заключается в том, что яростные усилия по дерегуляции текущего правительства США в отношении разработки ИИ дали исследовательскому сообществу как в США, так и за рубежом, определенное увеличение лицензии и чувство неявной защиты от юридической ответственности.

Несмотря на свою поддержку анти-деепфейковых правил, текущая администрация США фактически восстановила большую часть ‘дикого запада’ позиции, которая характеризовала 2021-23 год, – даже хотя контекст чистых научных исследований, который определил его, с тех пор эволюционировал в яростные, даже исторические уровни инвестиций.

Генеративные видео-статьи как ‘ИИ-сlop’

С запуском Hunyuan Video и WAN генеративных видеосерий прошлой зимой, ИИ-видео было полностью преобразовано в 2025 году. Старые препятствия, такие как трудность создания полнофигурных аватаров или получения убедительных профильных видов человека, были сметены, казалось, за одну ночь.

Щедрые выпуски с весами этого типа из Китая, спорно, задали темп для генеративных видеовыпусков в этом году и являются, по крайней мере, противодействующим давлением на тенденцию западных ИИ-видеоархитектур быть намного более цензурированными, предкоммерциализированными и предписанными.

Отсутствие рва в этой иронически демократической сцене, возглавляемой Китаем, привело к тому, что сотни, если не тысячи компаний, стремятся использовать развивающийся рынок для вывода, предлагая удобные порталы, с такими игроками, как civit.ai и RunPod, которые получают прибыль от процедур и технологий, которые, в многих случаях, могли бы быть запущены на домашних компьютерах.

В целом, эти инициативы являются краткосрочными финансовыми захватами, которые ожидают быть отмененными в результате будущей консолидации рынка (хотя, безусловно, их основатели не будут возражать, если они случайно наткнутся на доминирующую долю рынка, если это произойдет).

То же самое обыденное и повторяющееся явление произошло с генеративным видеопотоком в представлениях Arxiv в 2025 году. Как я наблюдал на прошлой неделе, соотношение сигнала и шума для этой категории достигло онемевающего пика, поскольку исследователи конкурируют публично за огромные суммы потенциального финансирования, которые прорывы этого года, безусловно, выпустили.

То есть, что большинство представлений этого типа являются лишь незначительными достижениями, в лучшем случае. Основные проблемы, остающиеся в генеративном ИИ, не проявились много в этом году: необходимость поддерживать идентичность, стилем LoRA, на протяжении всей характерной характеристики; необходимость более длительных времени вывода для выходных видео, с общей последовательностью (т.е. окружений и тем, и т.д., а не только ID) сохранена; и для улучшения генерации аудио и манипуляции в генеративном видео и видеоредакторских архитектурах; среди прочего.

Лихорадка сетки утихает

Я наблюдал в прошлом году, что сцена испытывает заметный рост представлений, которые используют традиционную компьютерную графику (т.е. сеточно-основанные представления того типа, который восходит к 1970-м годам), или включают их в нейронные рамки. Я наблюдал значительное уменьшение импульса к сеточно-основанным решениям, особенно во второй половине года, в 2025 году.

Многие из решений, которые включают компьютерную графику, в том раннем потоке статей, особенно те, которые занимаются параметрическими человеческими ‘контрольными’ фигурами, такими как 3D-модели, изменяемые морфологически, могут быть заменены новыми возможностями диффузионных генеративных рамок, таких как Veo, Kling, Hunyuan и WAN, среди многих других.

В то же время статьи, которые занимаются подходами Гауссовского распыления, также, казалось, были затронуты либо разработкой, либо затенением 2025 года диффузионными ген-ИИ-системами; или обоими.

Год назад я отметил, что первоначальный энтузиазм Гауссовского распыления, который произвел заметное впечатление в конце 2023 года, утих в более узкие линии исследований. В этом году я вижу поток статей, направленных на решение значительных требований к ресурсам этого подхода, среди прочих проблем.

Хотя я бы охарактеризовал Гауссовское распыление как ‘на данный момент остановленное’, мы должны помнить, что эта технология восходит к началу 1990-х годов и является revenant по своей природе.

Одним из исключений из этого общего отступления от сеточно-основанных подходов является, казалось, увеличение интереса к включению ИИ в рамки, направленные на 3D-печать.

Уменьшение представлений по безопасности ИИ

Мое последнее наблюдение за 2025 годом заключается в том, что категория ‘Безопасность’ представлений в разделе Компьютерная наука на Arxiv показала заметное снижение частоты и качества в 2025 году, и не легко угадать, почему.

Архив Криптографии и безопасности можно утверждать, что всегда был второсортным местом для публикации статей, поскольку эта ветвь исследований неудивительно доминируется частной собственностью IP – мало из которой появляется в академических журналах, и почти ни одна из которых не видна в бесплатных платформах, таких как Arxiv.

Кроме того, представления в эту категорию на Arxiv имеют выше среднего количества ‘подстав’ – недооцененные признания, часто скрытые в неожиданных местах, которые отрицают или уменьшают видимую ценность и новизну статьи. Одним из примеров может быть, казалось бы, сенсационный метод нарушения безопасности, который на самом деле полагается на какой-то ‘белый ящик’ аспект – т.е. привилегированный доступ к данным или процедурам, который атакующий вряд ли сможет обеспечить.

Что ожидать в 2026 году

Хотя СМИ риффуют постоянно о буме генеративного ИИ как повторении бума и краха доткомов начала нулевых (с некоторыми несогласиями), это на самом деле кажется представлением ложной безопасности. В плане инфраструктуры, инвестиций, культуры и исследований, безусловно, не было такого времени в истории человечества.

Следовательно, трудно предвидеть, в каком направлении научная сцена будет развиваться в 2026 году, кроме того, что – как обычно – ряд долгосрочных усилий завершится между сейчас и апрелем, с определенным ‘отпечатком’ одержимостей и тенденций 2025 года, которые будут отличать их.

Одним из событий, которое может помочь кризису объема представлений на Arxiv и других порталов, является запрет или проверка на ИИ-генерируемые/помощь представления, как Arxiv недавно ввел для обзорных статей – однако степень участия ИИ в любой статье может оказаться трудной для количественной оценки, поскольку ИИ проник в научную культурурецензирование) так же, как и в другие области – как капля ‘чернил’, которая влияет на всю (существующую) воду, а не радикально меняет среду.

 

Опубликовано впервые в понедельник, 22 декабря 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai