Ángulo de Anderson

¿Logrará el AI prosperar fuera del foso?

mm
Añade Unite.AI a tus fuentes preferidas en Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Los costos y restricciones de Big AI, así como su influencia en los costos de hardware, están obligando a los usuarios a construir sus propios sistemas, justo cuando la regulación en aumento amenaza con cerrar esa “economía de sombra” de AI.

 

Opinión Entre las muchas “trampas” que aparecen en los artículos de investigación científica, una de las más frecuentes es que el problema que el artículo está abordando ya fue resuelto en otro lugar, y que la contribución de la nueva investigación es meramente incidental o incremental.

Esto puede ocurrir por varias razones: los investigadores esperaban un salto cuántico, pero obtuvieron un salto cuasi en su lugar; el problema ya había sido resuelto con soluciones más intensivas en recursos que la nueva oferta; o simplemente que los objetivos del proyecto fallaron por completo, pero la cultura de “publicar o perecer” de la investigación académica obligó al equipo a publicarlo de todos modos (a menudo enterrado entre la avalancha de un portal en su día de publicación más ajetreado).

En la literatura de aprendizaje automático, sin embargo, una razón relativamente nueva y sin disculpas está volviéndose más frecuente: que la característica o funcionalidad que se ofrece solo está disponible actualmente a través de portales cerrados y vinculados a API.

Estaba considerando un artículo de este tipo esta mañana – una colaboración entre universidades chinas y Amazon, que aborda el problema recurrente de falla en la eliminación de objetos en sistemas de edición de imágenes basados en difusión, que con frecuencia simplemente “re llenan” el espacio objetivo con un objeto similar en su lugar:

A la izquierda está la imagen original; a la derecha de esa, la máscara de segmentación roja que le indica al AI qué parte de la imagen eliminar; a continuación, 'Nuestro', muestra un enfoque de eliminación de objetos exitoso – y las dos imágenes restantes muestran sistemas similares que, en lugar de eliminar el autobús, simplemente insertan un autobús diferente en su lugar. Fuente - https://arxiv.org/pdf/2603.27599v1

A la izquierda está la imagen original; a la derecha de esa, la máscara de segmentación roja que le indica al AI qué parte de la imagen eliminar; a continuación, ‘Nuestro’, muestra un enfoque de eliminación de objetos exitoso – y las dos imágenes restantes muestran sistemas similares que, en lugar de eliminar el autobús, simplemente insertan un autobús diferente en su lugar. Fuente

En el ejemplo anterior, la imagen central muestra el nuevo enfoque eliminando con éxito el autobús y colocando un fondo plausible, en comparación con los dos métodos anteriores (las dos imágenes más a la izquierda), que cada uno elimina el autobús, pero luego colocan un diferente autobús en la imagen.

¡Gotcha!

Dejando de lado los porqués y los motivos de este desafío para otro momento (y es un tema interesante de investigación), luego me encontré con un clásico “gotcha” al leer el nuevo artículo: la concesión de los autores de que los sistemas propietarios costosos pueden realizar esta tarea de manera bastante confiable – algo que sé, por unos pocos años de uso de Adobe Firefly en Photoshop, entre otros sistemas cerrados:

‘[Los métodos basados en difusión] a menudo alucinan insertando objetos no deseados después de eliminar los objetivos, lo que lleva a resultados inconsistentes [en el contexto].

‘Por otro lado, los modelos multimodales recientes y cerrados, como ChatGPT y Nano Banana, aunque son más poderosos en la eliminación de objetos, involucran grandes cantidades de parámetros y una alta sobrecarga computacional, lo que obstaculiza su despliegue práctico en dispositivos de borde.

‘Por lo tanto, es bastante necesario desarrollar un modelo de eliminación de objetos dedicado que no solo permita un rendimiento de eliminación superior, sino que también disfrute de una latencia de inferencia baja y significativamente menos parámetros.’

Esta explicación, que se centra en los obstáculos técnicos, omite el hecho obvio de que las arquitecturas cerradas, como ChatGPT y Nano Banana, no están disponibles para instalación local. Aunque la capacidad de estos sistemas para producir material controvertido ha justificado su control en el último año, los portales de este tipo son propietarios principalmente debido a imperativos comerciales.

En esencia, el nuevo artículo implica que, aunque el problema objetivo está resuelto en sistemas comerciales, esto puede ser irrelevante para el resto de nosotros, que necesitamos aprender a resolverlo en el “mundo real” – es decir, en sistemas de código abierto, ya sea que puedan instalarse localmente o no.

Desarrollo Paralelo

Sin embargo, ¿por qué resolver un problema que todavía depende de un sistema pagado, no debido a restricciones propietarias, sino porque el cálculo de GPU requerido excede lo que cualquier configuración local puede sostener de manera realista? La mayoría de estos nuevos “artículos abiertos” y repositorios de código presentan configuraciones de entrenamiento/inferencia con demandas de recursos exorbitantes, como clusters de A100.

Bueno, eso depende de lo que creamos que todos estos centros de datos de AI pendientes y costosos van a cumplir cuando finalmente estén en línea. Los temores de los comunes y las esperanzas de las élites por igual imaginan sistemas propietarios de AI de nivel ChatGPT desplazando empleos, mientras aumentan constantemente los costos de suscripción y reducen los niveles de servicio, para satisfacer el capital de riesgo temprano que tuvo que esperar 3-5 años para operar.

Pero una tendencia creciente en la literatura parece estar apoyando un futuro alternativo, y el espíritu marginal de “hacerlo solo” de muchas comunidades en línea, como el subreddit r/stablediffusion, que actualmente tiene 920,000 usuarios, y que ha prohibido hace tiempo las publicaciones relacionadas con sistemas de generación de imágenes y video cerrados.

En este futuro alternativo, el nuevo suministro global de centros de datos de AI facilitará el cálculo crudo para sistemas configurados por el usuario y definidos por el usuario, en lugar de satisfacer las demandas de marcos monumentales y “cajas negras” como ChatGPT y Adobe Firefly.

Fricción de Superficie

Al mirar las complejas guías de GPU remotas minadas en Patreon en r/stablediffusion, todo parece imposible en este momento: los modelos están cambiando constantemente los objetivos con cada actualización; son difíciles de desplegar localmente, incluso en los marcos más fáciles y amigables; y, en general, la cantidad de fricción involucrada sugiere una búsqueda estrictamente para entusiastas y para esa cepa más aventurera de empresas que no están directamente involucradas en AI, pero que desean desarrollar y mantener sus propios sistemas locales, en lugar de alquilar tales capacidades.

Sin embargo, en los últimos treinta años, cada tecnología donde había una gran demanda de simplificación y comoditización abierta y democrática ha tendido a conseguirla, con las soluciones más difundidas que generalmente surgen de las tensiones entre sistemas comerciales y alternativas e iniciativas de código abierto.

Las búsquedas que una vez fueron enclaves especializados de “nerd”, como las conexiones a Internet, los marcos de gestión de contenido y los marcos de blogs, así como la seguridad de Internet, la fotografía y la gestión de medios, han evolucionado desde la complejidad confusa hacia la simplicidad y la utilidad.

Por lo tanto, el paisaje de AI posterior puede ser más variado y lleno de jugadores más pequeños y genuinamente competitivos de lo que los actuales líderes del mercado de AI de vanguardia podrían preferir.

Autorealización, Por Necesidad

Irónicamente, “Big AI” está contribuyendo mucho a un espíritu emergente de independencia entre los usuarios finales, al absorber todos los componentes de computadora – especialmente DRAM – que de otro modo habrían ido a “consumidores ordinarios”.

En consecuencia, muchos están imaginando un futuro donde los recursos de AI “globales” cerrados se acceden a través de clientes finos subpotenciados y están desarrollando un interés creciente en mantener su equipo existente.

El asalto de AI a las cadenas de suministro de tecnología también ha llevado a los proveedores de servicios de tecnología a aumentar sus precios en los últimos 3-6 meses, ya sea porque las empresas más pequeñas están siendo genuinamente aplastadas por la escasez de hardware, o simplemente porque AI.

Esto ha llevado a un crecimiento del interés en la autohospedaje y en las instalaciones locales – incluyendo la autohospedaje de redes de aprendizaje automático.

Me sumergí en esto mismo últimamente, cambiando a almacenamiento de LAN local para fotos y videos, así como copias de seguridad de archivos. Para lo primero, he estado utilizando el servidor de medios multiplataforma gratuito y de código abierto Immich, lo que me ha ayudado a alejarme de los aumentos de precios (y otros problemas) de los proveedores de almacenamiento en la nube como iCloud:

La plataforma gratuita Immich puede mantener tus medios en tu equipo y privados en tus propios canales. En este caso, también uso Immich en Docker para servir mi NVIDIA 3090 GPU a través de la LAN a donde se guardan las fotos y los videos, para que la GPU más potente pueda manejar cualquier procesamiento de imagen o video pesado.

La plataforma gratuita Immich puede mantener tus medios en tu equipo y privados en tus propios canales. En este caso, también uso Immich en Docker para servir mi NVIDIA 3090 GPU a través de la LAN a donde se guardan las fotos y los videos, para que la GPU más potente pueda manejar cualquier procesamiento de imagen o video pesado.

Si mi propia experiencia es algún indicador representativo, vibe-coding – actualmente maldito en muchas comunidades en línea que antes eran “puras” – está impulsando esta ola de independencia (incluso si puede amenazar los repositorios de código abierto en los que se apoya).

Por ejemplo, la red siempre ha sido mi punto débil en computación, por lo que la asistencia de AI fue esencial para que yo pudiera configurar un VPS seguro para respaldar un conjunto de nuevos servicios autohospedados.

De esta manera, “Big AI” está empoderando a “Small AI”; por lo tanto, quizás podamos considerar el actual auge de empresas de AI de hipercalado y de alto valor como un estado necesario pero solo transitorio antes de que surja una sociedad de AI más democrática y empoderada para el usuario, descartando a las corporaciones que buscan moats y rentas como cohetes gastados – al igual que el estallido de las punto com en el 2000 dejó infraestructura explotable que aceleraría profundamente la web mucho después de que las empresas que la pagaron hubieran colapsado.

La Era de la Cumplimiento

Bueno, eso probablemente no va a repetirse esta vez.

Incluso si estamos inclinados a formar algún tipo de franja ex moat sociedad marginal, la regulación alrededor de AI, combinada con la tendencia global actual hacia la verificación de edad, parece probable que anticipe y bloquee estos caminos de desarrollo.

El ancla para prevenir una “economía de sombra” de AI es la regulación. Ya, los repositorios centrales como GitHub y Hugging Face a menudo requieren inicio de sesión en línea antes de permitir a los usuarios clonar repositorios localmente, dependiendo de la configuración del repositorio.

Por lo tanto, ya existen mecanismos para hacer cumplir la supervisión de marcos de AI más ampliamente de lo que es la práctica actual; y la voluntad de aumentar dicha supervisión ahora se está consolidando a partir de iniciativas gubernamentales individuales en un impulso global.

Así, si las fuerzas del mercado y la ingenuidad del movimiento FOSS eliminan la fricción del despliegue casual de AI, los obstáculos parecen estar listos para regresar en la forma de requisitos de cumplimiento: demandas de cumplimiento que, aunque onerosas, son dignas para las empresas, pero quizás no para los individuos – similares a la fricción que se ha agregado a los sistemas de pago en línea para los consumidores desde la edad de oro de PayPal en la década de 2000.

Ya sea que Meta gastó $2 mil millones en lobbying para el control de edad a nivel de sistema operativo debido a su importante inversión en AI, o sus intereses en la recopilación de datos, el resultado de que las grandes tecnológicas apoyen el control de edad es que el AI “local” puede volverse tan regulado como una sustancia de clase A; y, al igual que la DMCA fue diseñada para criminalizar la intención en lugar de cualquier mecanismo específico de evasión de derechos de autor, las regulaciones internacionales de AI podrían, en tal escenario, hacer que todo uso no conforme de aprendizaje automático sea un acto ilegal, a muy poco costo (en términos de supervisión activa).

Esto podría haber parecido una interpretación demasiado distópica hace un año – pero eso fue antes de que California y systemd se pusieran detrás de la idea de verificación de edad a nivel de hardware, que actualmente muchos ven como un proxy para una prohibición de la anonimidad en línea al estilo del Partido Comunista Chino.

Conclusión

Así, mientras el trasfondo legal y legislativo se prepara, quizás, para cooptar a AI en un espacio altamente regulado, de modo que los usuarios casuales no puedan “preparar su propio” AI más de lo que pueden cultivar o fermentar sustancias reguladas sin permiso, el sector de investigación mantiene su postura más optimista – que AI se convertirá en una fuerza democratizada y beneficiosa en la sociedad en general, más allá de los seguidores del proveedor de código abierto más popular del día.

Mucho depende de la disposición de los escombros después de que la burbuja de AI estalle – al menos en la medida en que los proveedores se consoliden o el mercado se asiente en una balkanización a largo plazo – lo que probablemente requeriría un toque regulatorio más suave.

 

Publicado por primera vez el miércoles 1 de abril de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]