Ángulo de Anderson

Una perspectiva personal sobre las tendencias de la literatura de visión por computadora en 2025

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

Las divulgaciones éticas y el Gaussian Splatting están en declive, mientras que el volumen abrumador de artículos presentados representa un nuevo problema para que la IA lo aborde en 2026.

 

Opinión He seguido la investigación de visión por computadora y síntesis de imágenes en arXiv y otros lugares durante aproximadamente siete años, a través de varios canales – lo suficiente como para distinguir patrones recurrentes y cambios en las tendencias. Pero estas observaciones son anecdóticas. Honestamente, desearía tener el tiempo para explotar los vastos corpus de datos en constante crecimiento representados por la corriente de publicaciones de Arxiv, que seguramente están llenos de conocimientos ocultos, utilizando el análisis de aprendizaje automático. Como están las cosas, solo puedo informar más casualmente lo que llamó mi atención desde que consideré el asunto por última vez.

Volumen al máximo

Muchas de las tendencias en la presentación de artículos de investigación de IA que observé en 2024 se establecieron como características en 2025; no menos importante es el inexorable y continuo aumento en volumen de artículos relacionados con la IA, en sí mismo impulsado por la IA, hasta el punto de una crisis percibida:

Presentaciones mensuales de ciencias de la computación en Arxiv, octubre 2023-noviembre 2025, con promedio móvil de 3 meses superpuesto. Fuente: https://arxiv.org/stats/monthly_submissions

Presentaciones mensuales de ciencias de la computación en Arxiv, octubre 2023-noviembre 2025, con promedio móvil de 3 meses superpuesto. Fuente

Esta tasa de crecimiento se caracterizó como un dobleamiento exponencial en el volumen de presentaciones de artículos de IA, hace varios años, y solo ha tomado una participación más profunda con la reciente aparición de la manía de la inversión en IA ha aumentado las apuestas, así como la cantidad de financiamiento disponible para la investigación relacionada con la IA.

Las estadísticas completas para 2025 no están disponibles todavía, y las estadísticas agregadas que se muestran arriba representan los números generales que aumentan en todas las categorías. A continuación, podemos ver que las ciencias de la computación siguen una tendencia dominante, significativamente por encima de sus compañeros:

Aumento en las presentaciones de ciencias de la computación de 2022 a 2025. Fuente - https://info.arxiv.org/about/reports/submission_category_by_year.html

Aumento en las presentaciones de ciencias de la computación de 2022 a 2025. Fuente

Separar el trigo de la paja

En octubre, el comienzo de la temporada de conferencias de otoño, que siempre trae una inundación de nuevas investigaciones, trajo en su lugar un volumen de presentaciones a nivel de ataque de denegación de servicio, lo que dio un impulso adicional y una urgencia a la subestimada corriente de investigación de análisis de tendencias de investigación; en otras palabras, los artículos y repositorios están apareciendo cada vez más que, en sí mismos, buscan cortar a través de la relación señaligeno cada vez peor en la escena de la investigación.

El último llegó solo la semana pasada, en la forma de NoveltyRank, un artículo y repositorio de GitHub que ajusta LLM como Qwen3-4B-Instruct-2507 y SciBERT para que puedan realizar una clasificación binaria de artículos presentados (prediciendo ‘novedad’ a partir de presentaciones anteriores), o una comparación de novedad por pares (comparando las presentaciones actuales para ‘novedad’):

El sistema NoveltyRank compara el título y el resumen de una presentación con artículos pasados similares, resume las diferencias utilizando un LLM y las pasa a un modelo Qwen3-4B ajustado que decide si el trabajo cuenta como 'conceptualmente nuevo'. Fuente - https://arxiv.org/pdf/2512.14738

El sistema NoveltyRank compara el título y el resumen de una presentación con artículos pasados similares, resume las diferencias utilizando un LLM y las pasa a un modelo Qwen3-4B ajustado que decide si el trabajo cuenta como ‘conceptualmente nuevo’. Fuente

El problema con tales enfoques de ‘selección’ es el desafío de definir variables significativas. El enfoque NoveltyRank utiliza la aceptación de un artículo en una conferencia como un índice de novedad, y – quizás de manera un poco desdeñosa – utiliza la publicación en Arxiv como un índice de negativa novedad.

Esto supone dos premisas falsas: primero, que todas las presentaciones aceptadas en conferencias son novedosas, o de consecuencia, lo cual es manifiestamente falso; y segundo, que la novedad en sí misma es de valor incondicional. Cualquiera que haya desperdiciado media hora en algunos de los artículos especiosos, incluso ridículos, presentados – quizás – solo para mantener ‘cuotas de publicación o perecer’, sabrá que la novedad a menudo es trivial, y el trabajo incremental a menudo es significativo.

Entender el valor de un nuevo artículo implica un área donde la IA es actualmente muy débil – contexto a largo plazo. Debido a la forma a menudo deshonesta en que se escriben los artículos, los que parecen romper terreno pueden muy a menudo revelarse como avances menores sobre el trabajo existente; sin embargo, los sistemas automatizados tendrán que desarrollar una ‘intuición’ para tales casos, sin marcar múltiples falsos positivos, y sin confiar en la honestidad de los autores que presentan.

Caída ética

Como observé anteriormente, los portales como Arxiv son bastante resistentes a la extracción laissez faire, y los volcados de datos que suministran a menudo carecen de detalles granulares.

Por lo tanto, incluso si tuviera los recursos y el tiempo para descargar y extraer características de una sección transversal representativa de artículos de ciencias de la computación, muchas de las tendencias más sutiles no habrían sido objetivo o analizado.

Una de ellas es la presencia o ausencia de códidlos de declaraciones éticas; durante mucho tiempo una inclusión obligatoria para las ciencias biológicas que tocan la experimentación animal, 2024 vio el apogeo de la tendencia hacia la caracterización ética de un trabajo propuesto, al final de los artículos presentados en la categoría de Ciencias de la Computación.

Anecdóticamente, digo que esta práctica ha disminuido drásticamente a lo largo de 2025. Mi suposición es que los esfuerzos de desregulación fervientes del gobierno actual de EE. UU. en relación con el desarrollo de la IA, ha dado a la comunidad de investigación tanto en los Estados Unidos como en el extranjero, una cierta licencia y sentido de protección implícita contra la exposición legal.

A pesar de su apoyo a la regulación anti-deepfake, la administración actual de EE. UU. ha restaurado efectivamente gran parte de la postura de ‘salvaje oeste’ que caracterizó el período de 2021-23 – aunque el contexto de investigación científica pura que lo definió ha evolucionado desde entonces en niveles de inversión históricos.

Artículos de video generativo como ‘suciedad de IA’

Con el lanzamiento de la serie de video generativo Hunyuan y WAN el invierno pasado, el video de IA ha sido transformado por completo en 2025. Los antiguos obstáculos como la dificultad de crear avatares de físico completo, o de obtener vistas de perfil convincentes de una persona, fueron barridos aparentemente de la noche a la mañana.

Los lanzamientos de pesos incluidos de este tipo de China han, argumentablemente, establecido el ritmo para los lanzamientos de video generativo este año, y son al menos una presión contrarrestante sobre la tendencia de las arquitecturas de video de IA occidentales a ser mucho más censuradas, comercializadas y prescritas.

La ausencia de una trinchera en esta escena irónicamente liderada por la CCCP ha llevado a cientos, si no miles, de empresas que buscan explotar el mercado incipiente para la inferencia al ofrecer portales de usuario amigables, con jugadores tan diversos como civit.ai y RunPod que se benefician de procedimientos y tecnologías que, en muchos casos, podrían ejecutarse en computadoras domésticas.

En general, estas iniciativas son capturas de efectivo a corto plazo que esperan ser usurpadas por la consolidación del mercado eventual (aunque, sin duda, sus fundadores no se opondrían a tropezar accidentalmente con una participación de mercado dominante, si eso sucediera).

Esta misma mundanidad y replicación ha golpeado la corriente de video generativo en las presentaciones de Arxiv en 2025. Como observé la semana pasada, la relación señaligeno para esta categoría ha alcanzado un pico aturdidor, ya que los investigadores compiten públicamente por las masivas cantidades de financiamiento potencial que los avances de este año han liberado sin duda.

Dicho esto, la gran mayoría de las presentaciones de este tipo son meros avances incrementales, como máximo. Los problemas centrales que quedan en la IA generativa no han surgido mucho este año: la necesidad de mantener la identidad, al estilo de LoRA, a lo largo de una representación de personaje; la necesidad de tiempos de ejecución más largos para los videos de salida, con la consistencia general (es decir, de entornos y temas, etc., no solo ID) mantenida; y para una mejor generación y manipulación de audio dentro de las arquitecturas de video generativo y edición de video; entre otros.

La fiebre de la malla disminuye

Observé el año pasado que la escena estaba experimentando un aumento notable en los artículos que promueven sistemas que aprovechan la CGI tradicional (es decir, representaciones basadas en malla del tipo que se remonta a la década de 1970), o incorporarla en marcos neuronales. He observado una disminución significativa del impulso hacia las soluciones basadas en malla, particularmente en la segunda mitad del año, en 2025.

Muchos de los enfoques de CGI incorporados en la anterior ola de artículos, especialmente aquellos que tratan con figuras de control humanas paramétricas como modelos morfables 3D, pueden haber sido reemplazados por las nuevas capacidades de los marcos generativos de difusión como Veo, Kling, Hunyuan y WAN, entre muchos otros.

Al mismo tiempo, los artículos que tratan con enfoques de Gaussian Splat también han sido aparentemente afectados por la estagnación del desarrollo o por ser eclipsados por los sistemas de IA generativa de difusión de 2025; o ambos.

Hace un año, noté que la emoción inicial de GSplat, que hizo una impresión notable en finales de 2023, se había desvanecido en líneas de investigación más estrechas. Este año, veo una corriente de artículos dirigidos a abordar las demandas de recursos significativos de este enfoque, entre otros problemas.

Aunque caracterizaría el Gaussian Splatting como ‘actualmente estancado’, debemos recordar que esta tecnología se remonta a la década de 1990, y es revenant por naturaleza.

Una excepción a esta tendencia general de retroceso de los enfoques basados en malla es un aparente aumento del interés en la incorporación de la IA en los marcos destinados a la impresión 3D.

Disminución en las presentaciones de seguridad de IA

Mi última observación para 2025 es que la categoría de presentaciones de ‘Seguridad’ en la sección de Ciencias de la Computación en Arxiv ha mostrado una disminución notable en frecuencia y calidad en 2025, y no es fácil adivinar por qué.

El archivo de Criptografía y Seguridad ha sido arguablemente un lugar de segunda clase para publicar artículos, desde que esta rama de la investigación está dominada por la propiedad intelectual privada – poco de la cual sale a la luz en revistas académicas, y casi ninguna de la cual se ve en plataformas gratuitas como Arxiv.

Además, las presentaciones a esta categoría en Arxiv tienen un número mayor que el promedio de ‘gotchas’ – admisiones poco destacadas, a menudo enterradas en lugares inesperados, que niegan o disminuyen el valor y la novedad aparentes del artículo. Un ejemplo sería un método de infracción de seguridad aparentemente sensacional que en realidad depende de algún aspecto ‘de caja blanca’ – es decir, acceso privilegiado a datos o procedimientos, como un atacante no podría asegurar probablemente.

Qué esperar en 2026

Aunque los medios están hablando constantemente sobre el auge de la IA como una repetición del debacle de la burbuja de puntos com y la quiebra de principios de la década de 2000 (con algunas disidentes), esto en realidad parece representar una especie de falsa seguridad. En términos de infraestructura, inversión, cultura y investigación, no ha habido un momento como este en la historia de la humanidad.

Por lo tanto, es difícil ver hacia dónde se dirigirá la escena de la investigación en 2026, excepto que – como de costumbre – una serie de esfuerzos a largo plazo culminarán entre ahora y abril, con una especie de ‘sello’ de las obsesiones y tendencias de 2025 que los distingue.

Un desarrollo que puede ayudar a la crisis de volumen de presentaciones en Arxiv y otros portales es una prohibición o control de los artículos generados o ayudados por la IA, como Arxiv recientemente promulgó para los artículos de revisión – sin embargo, el alcance de la participación de la IA en cualquier artículo puede resultar difícil de cuantificar, ya que la IA ha penetrado la cultura de la investigación (y la revisión por pares) de la misma manera que ha penetrado en otros dominios – como una gota de ‘tinta’ que afecta el vaso de agua entero (existente), en lugar de cambiar radicalmente el medio.

 

Publicado por primera vez el lunes 22 de diciembre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai