Ingeniería de prompts

Dominando el Arte de la Inteligencia Artificial: Una Guía Concisa para Midjourney y la Ingeniería de Prompts

mm
Añade Unite.AI a tus fuentes preferidas en Google
Midjourney Generated UNITE AI LOGO

Introducción al Arte Generado por MidJourney AI

La inteligencia artificial está rompiendo rápidamente las barreras de lo imposible y ha invadido recientemente el dominio del arte, transformándolo por completo. Ahora, no necesitas ser un artista maestro o un experto en Photoshop para dar vida a las creaciones de tu imaginación. Un simple prompt bien articulado es todo lo que necesitas, gracias a Midjourney.

Todo comenzó con la introducción de tecnologías innovadoras como DALL-E, Midjourney y StableDiffusion a principios de 2022. Mientras que cada una de estas innovaciones trajo su propio toque único al lienzo de la Inteligencia Artificial Generativa, Midjourney, en particular, ha seguido su viaje convincente, logrando avances notables.

Midjourney es actualmente el generador de imágenes de texto a imagen de alta resolución líder en el mercado y se destaca por su mezcla única de generación de imágenes de texto, edición de medios y escalado, y acceso a la comunidad de arte activa, todo a partir de $10 por mes. Esta suite integral de características presenta un lienzo emocionante para artistas, entusiastas de la tecnología y profesionales de la IA, creando un entorno para la creatividad y la innovación.

El mundo del arte ciertamente está tomando nota, con la inteligencia artificial generativa en el mercado del arte proyectada para experimentar un crecimiento asombroso del 40,5% CAGR. Midjourney se destaca en la creación de visuales realistas y de alta calidad utilizando IA.

La ingeniería de prompts efectiva va más allá de la simple creación; abarca las mejores prácticas. Los prompts deben ofrecer claridad y ser concisos, pero proporcionar a la IA la suficiente orientación sin prescripción excesiva. Además, se debe considerar al público objetivo durante el diseño, teniendo en cuenta variables como la edad, el género y el contexto cultural, entre otros.

¿Cómo funciona MidJourney?

Mid-Journey aprovecha dos tecnologías de aprendizaje automático novedosas: modelos de lenguaje grande y modelos de difusión. El modelo de lenguaje, similar a los chatbots de IA como ChatGPT, ayuda a Mid-Journey a interpretar el significado de tus prompts y convertirlos en vectores. Este vector luego guía el proceso de difusión.

Los mecanismos internos de Midjourney son en gran medida desconocidos. Sin embargo, es evidente que utiliza la generación de imágenes de texto a imagen de dos tecnologías de aprendizaje automático relativamente novedosas: modelos de lenguaje grande y modelos de difusión. El primero es quizás familiar para los usuarios de plataformas de IA como ChatGPT, y el segundo es una adición prometedora al sector de la generación de arte de IA. Todo el sistema depende del conjunto de datos CLIP para el entrenamiento, que se puede encontrar en la página de investigación de OpenAI.

A pesar de la información limitada, es posible esbozar una imagen general del modelo de difusión de Midjourney, llamado ‘Stable Diffusion’. Esencialmente, Stable Diffusion es un modelo de código abierto que transforma habilmente los prompts de texto en imágenes de variados estilos y contenido. Este procedimiento sofisticado se logra a través de un modelo de difusión, un modelo generativo que conecta las dependencias entre las entradas de texto y las salidas de imagen.

Los modelos de difusión se basan en el método de difusión de desenoiseo, un enfoque influenciado por la termodinámica no equilibrada. Este método desmonta sistemáticamente la estructura de los datos y luego la restaura. Este enfoque fue adaptado para la generación de imágenes por Ho et al. en 2020, lo que llevó al surgimiento de los modelos de difusión que vemos hoy.

El entrenamiento de los modelos de difusión implica dos etapas principales. Inicialmente, el proceso de difusión o hacia adelante implica la adición incremental de ruido aleatorio a la imagen de entrada hasta que se convierte completamente en ruido. Este proceso está gobernado por una cadena de Markov fija, que consistentemente agrega ruido gaussiano a lo largo de varios pasos sucesivos.

Demostración de funcionamiento de Midjourney

Posteriormente, en la fase de reconstrucción o inversa, el modelo restaura los datos originales desde el estado dominado por ruido logrado en el proceso de difusión. Este proceso está impulsado por una cadena de Markov con transiciones gaussianas aprendidas, lo que implica que la predicción de la densidad de probabilidad en cualquier momento dado depende únicamente del estado alcanzado en el paso de tiempo anterior. Como los latentes ‘x1, …, xT’ comparten la misma dimensionalidad que los datos, los modelos de difusión se clasifican como modelos de variables latentes.

Costo y Suscripción de Mid-Journey

Mientras que muchos chatbots como ChatGPT y Bing Chat ofrecen un uso casi ilimitado de forma gratuita, la situación es diferente para los generadores de imágenes como Mid-Journey. Debido a la importante potencia de cálculo requerida, especialmente desde las unidades de procesamiento gráfico (GPUs) y el uso de memoria de video para el proceso de desenoiseo, el servicio de Mid-Journey viene con un precio.

El plan básico comienza en $10 por mes, proporcionando alrededor de 3,3 horas de tiempo de GPU, suficiente para aproximadamente 200 generaciones de imágenes. Sin embargo, hay planes de más alto nivel que ofrecen imágenes ilimitadas en modo Relajado, aunque con un tiempo de espera más largo.

Configuración de tu MidJourney

  1. Comenzar con MidJourney implica registrarse en su sitio web oficial, suscribirse a un plan y luego ser redirigido a Discord.
  2. Una vez que encuentres el canal de Mid-Journey en Discord, navega hasta los Grupos para Principiantes en el lado izquierdo. Desde allí, puedes observar a otros usuarios creando prompts, aprender los mecanismos de Mid-Journey y interactuar en un entorno animado.
  3. Después de familiarizarte con el entorno, invita al bot a tu servidor privado para crear imágenes sin distracciones. El bot genera cuatro imágenes de vista previa basadas en tu prompt, lo que te permite seleccionar la que más se acerque a tu idea original y refinar la imagen aún más.

Estructura de Prompt para Midjourney

  1. El comando /imagine en un canal de Discord dentro del canal de Midjourney genera una imagen única a partir de una descripción de texto corta (Prompt).
  2. Para recrear un estilo específico en varias imágenes, simplemente ingresa la URL de la imagen junto con tu prompt de texto. Tus nuevas salidas consistentes combinarán elementos de tu imagen elegida y texto.
    /imagine http://enlace-a-tu-imagen –parámetro1 –parámetro2
    Puedes generar un enlace a tu imagen subiéndola al canal de Discord. Una vez subida, haz clic derecho en la imagen y selecciona ‘Copiar enlace’.
    Aquí http://enlace-a-tu-imagen y parámetros son opcionales.
  3. Seguidamente, el Bot comienza a trabajar en tu imagen, tomando aproximadamente un minuto para ofrecerte cuatro alternativas. Este proceso implica el uso de unidades de procesamiento gráfico (GPUs) robustas para procesar e interpretar cada prompt.
  4. Mantén un registro de tu uso de GPU utilizando el comando /info. Te permite verificar tu ‘Tiempo de GPU Restante’ y monitorear el tiempo de GPU de tu suscripción.

prompt /info de Midjourney

Escalado y Modificaciones de Imágenes

Para una imagen más refinada, usa los botones ‘U’ debajo de las imágenes para escalar tu elección preferida. También puedes usar los botones ‘V’ para hacer ajustes a imágenes específicas. Para cambios adicionales en una imagen escalada, usa las opciones ‘Crear variaciones’, ‘Rehacer escalado ligero’ y ‘Rehacer escalado beta’. El botón ‘Web’ te permite ver la imagen en un tamaño más grande en una ventana separada.

Midjourney permite el escalado de imágenes hasta resoluciones de 2048×2048 (cuadrada) y 2720×1530 (panorámica) a través de su función de rehacer escalado beta, con un tamaño de cuadrícula de generación predeterminado de 1024×1024 (cuadrada) y 1456×816 (panorámica). Cada imagen se puede mejorar aún más a través de las opciones de escalado ‘U’, que mejoran partes específicas de la imagen.

Observa este prompt que produce una obra de arte fantástica con la versión 5.2 de Midjourney.

/imagine La obra de arte representa un árbol solitario bajo un cielo estrellado, con un niño leyendo debajo, en los tonos del azul sereno y el naranja cálido, inspirado en los trazos del Impresionismo francés, los miniaturas persas, la simplicidad de Bauhaus, evocador de ilustraciones clásicas de cuentos de hadas infantiles, logrando una armonía asimétrica, expresada en un encantador, estilo folk/naïf: –ar 15:19 –upbeta –q 2

Ejemplo de prompt de Midjourney

Crear tu Primer Arte de Midjourney AI

  1. Crea el plano básico: Piensa en ti mismo como un artista. Comienza con una descripción sencilla y vívida de la imagen que aspiras a dar vida. Describe el sujeto principal, el ambiente o incluso los detalles mínimos que deseas incluir. Usa puntuación como comas, corchetes y guiones para estructurar tus pensamientos. Para mejores resultados, sé explícito sobre el contexto y los detalles de tu diseño. Elementos como sujeto (por ejemplo, dragón, coche vintage, Abraham Lincoln), medio (por ejemplo, arte digital, dibujo a lápiz), entorno (por ejemplo, espacio exterior, submarino, ciudad bulliciosa), iluminación (por ejemplo, suave, neón, backlight), color (por ejemplo, tonos terrosos, vibrantes, apagados), estado de ánimo (por ejemplo, melancólico, caprichoso, pacífico) y composición (por ejemplo, paisaje, primer plano, ángulo amplio) pueden ser cruciales. Ejemplos:
    • Un bosque idílico bañado en luz solar, un sendero serpenteante hacia la distancia
    • Una ciudad que nunca duerme, con luces neón reflejadas en las aceras y una multitud diversa reunida
  2. Infunde estilo y palabras clave: La IA de Midjourney es capaz de ilustrar imágenes en una multitud de estilos como abstracto, surrealista o realista. Al integrar un estilo o palabras clave relacionadas, puedes guiar a la IA para crear una imagen que refleje tu visión. Experimenta con varios estilos y palabras clave para descubrir la mezcla perfecta. Ejemplos:
    • Un paisaje que representa un desierto al amanecer, imitando el estilo de Georgia O’Keeffe, con una paleta de colores pastel y formas orgánicas.
    • Una representación abstracta de un bosque pacífico, con patrones geométricos formando árboles y follaje, inspirado en las composiciones de Piet Mondrian.
  3. Aprovecha la configuración avanzada: Considera a Midjourney como tu caja de herramientas creativa, llena de configuraciones avanzadas que te permiten afinar tus imágenes generadas. Es como empuñar una varita mágica, permitiéndote conjurar el equilibrio perfecto de aleatoriedad, estilización y variación de imagen. Desata tu poder creativo experimentando con estas configuraciones hasta encontrar la mezcla perfecta que resuene con tu visión. Ejemplos:
    • Un jardín japonés sereno con un estanque que refleja los cerezos en flor –semilla 22 –s 150 –c 40
    • Una ciudad ciberpunk distópica, iluminada por luces neón –semilla 88 –s 600 –c 60
  4. Resalta elementos con pesos: Visualiza tu imagen como una sinfonía, con cada elemento contribuyendo a la gran obra. Usando la notación “::”, puedes dictar la importancia de varios elementos en tu imagen, permitiéndote controlar el foco. Ejemplos:
    • [Un pavo real elegante]::3 posado en un [árbol de glicina]::1 floreciendo con flores vibrantes
    • [Un elefante majestuoso]::2 bañándose en el resplandor de un [atardecer]::1 en la sabana
  5. Midjourney es un proceso de prueba y error: Experimentar con diferentes elementos y características es necesario. Cada iteración te acercará más a la imagen que imaginaste dar vida.

Parámetros de Mid-Journey

El modelo de Midjourney opera utilizando parámetros ajustables que controlan el resultado del proceso de generación de imágenes. Estos parámetros permiten a los usuarios ajustar y personalizar su arte generado, afinando el modelo para crear salidas que se ajusten perfectamente a su objetivo.

A continuación, se presentan los parámetros básicos y avanzados, sus funciones y cómo usarlos para aprovechar al máximo las capacidades de Midjourney:

  • Proporciones de aspecto (–aspect o –ar): Este parámetro controla la relación entre el ancho y el alto de la imagen generada. Por ejemplo, una proporción de 16:9 es ideal para miniaturas de YouTube, mientras que 1:1 produce una imagen cuadrada perfecta para Instagram.
  • Caos (–chaos): Este parámetro ajusta la diversidad de la cuadrícula de imagen inicial y varía de 0 a 100. Valores de caos más altos te darán resultados impredecibles y únicos, mientras que valores más bajos garantizarán resultados más consistentes.
  • No (–no): Este parámetro te ayuda a eliminar elementos o características específicos de la imagen generada. Por ejemplo, si deseas una imagen sin rojo, puedes usar “–no rojo”.
  • Calidad (–calidad o –q): Esta configuración ajusta el tiempo necesario para generar una imagen. Una mayor calidad requiere más tiempo de procesamiento pero produce detalles intrincados. Este parámetro puede tomar valores de .25, .5, 1 o 2.
  • Semilla (–semilla): Este parámetro determina el ruido visual inicial, actuando como base para la imagen generada. Usar el mismo número de semilla con el mismo prompt te dará resultados similares. Acepta valores enteros entre 0 y 4294967295.
  • Detener (–detener): Con este parámetro, puedes terminar prematuramente un trabajo, produciendo resultados menos detallados pero potencialmente interesantes. El rango es de 10 a 100. Por ejemplo, si especificas ‘–detener 50’, el proceso de generación de la imagen se detendrá al 50% de la finalización, resultando en una imagen menos detallada y posiblemente abstracta.
  • Estilizar (–estilizar o –s): Este controla el nivel de aplicación artística en la imagen generada. Valores de estilización más bajos producen resultados más cercanos al prompt inicial, mientras que valores más altos resultan en interpretaciones más abstractas y artísticas. En la versión 5, el valor predeterminado es 100, pero puedes establecerlo en cualquier valor entre 0 y 1000.
  • Versión del modelo: Puedes seleccionar entre varias versiones del modelo de Midjourney utilizando el parámetro –versión o –v.
  • Niji: Un modelo especializado en imágenes de estilo anime. Se puede acceder usando el parámetro –niji.
  • Definición alta: Para imágenes abstractas y de paisajes, el parámetro –hd activa una versión temprana del modelo que produce imágenes más grandes y menos consistentes.
  • Modelos de prueba: Midjourney ofrece modelos especiales para casos de uso específicos. –prueba y –pruebap activan los modelos de prueba estándar y de fotografía, respectivamente.
  • Escalador: El algoritmo de Midjourney comienza con una cuadrícula de imagen de baja resolución. Ofrece varios modelos de escalado para mejorar el tamaño y el detalle de la imagen.
    • Uplight: Un escalador de luz alternativo (–uplight) proporciona imágenes escaladas que son menos detalladas pero más suaves.
    • Upbeta: El parámetro –upbeta conduce a imágenes con significativamente menos detalles adicionales, manteniéndose más cerca de la imagen de cuadrícula original.
    • Upanime: El escalador –upanime está diseñado específicamente para trabajar con el modelo de Midjourney –niji.
  • Peso de la imagen: Usa –iw para ajustar el peso del prompt de la imagen en relación con el peso del texto. El valor predeterminado es 0,25.
  • Sameseed: El parámetro –sameseed garantiza que todas las imágenes en la cuadrícula inicial utilicen el mismo ruido inicial, creando imágenes generadas muy similares.
  • Video: Midjourney puede guardar un video de progreso de la generación de la cuadrícula de imagen inicial utilizando el parámetro –video.
  • Creativo: Con el parámetro –creativo, los modelos de prueba y pruebap producen imágenes más variadas y creativas.

Midjourney lanza actualizaciones constantemente para mejorar la experiencia del usuario, siendo la última la versión 5.2, lanzada en junio de 2023. Al agregar –v 5.2 a tu prompt o seleccionarlo a través del comando /ajustes, los usuarios pueden acceder a este modelo avanzado. La versión 5.2 ofrece una mejor detallación de las imágenes y comprende los prompts de manera más intuitiva, trayendo colores más brillantes y composiciones mejoradas.

Entendiendo los Derechos de Autor para Obras de Arte Generadas por IA

Imagen de Midjourney de la mezcla de IA y leyes de derechos de autor

En marzo de 2023, la Oficina de Derechos de Autor de los Estados Unidos aclaró su postura sobre la protección por derechos de autor de obras generadas por IA. La política establece que, aunque los elementos creados por humanos en las creaciones de IA (como escritos o diseños únicos) pueden ser protegidos, las imágenes producidas por IA no califican para la protección por derechos de autor, siguiendo las normas globales de que solo las creaciones humanas son elegibles para la protección por derechos de autor.

En el contexto del arte de IA, los derechos de autor no son sencillos. Mientras que el arte digital tiene la entrada del artista humano, el arte generado por IA se crea sin intervención humana directa, lo que complica la cuestión de la autoría y la propiedad. Según la Oficina de Derechos de Autor de los Estados Unidos, la propiedad inicial se otorga al autor de la obra – un creador humano. Sin embargo, como la IA no puede ser considerada un autor, el arte generado por IA carece de una propiedad clara.

La última guía de la Oficina de Derechos de Autor de los Estados Unidos permite la protección por derechos de autor del arte de IA solo cuando contiene suficiente autoría humana. El nivel de ‘suficiente autoría humana’ permanece sin definir y depende del grado de participación humana en la creación de la obra de arte de IA.

Es interesante que Midjourney, una plataforma de IA para la creación de imágenes, ha establecido sus propias políticas para los derechos de uso. Los usuarios de la prueba gratuita pueden usar las imágenes para fines no comerciales bajo la Licencia de Atribución-NoComercial 4.0 Internacional de Creative Commons (CC BY-NC 4.0), con el crédito adecuado a Midjourney. Sin embargo, los suscriptores pagados pueden usar las imágenes para cualquier propósito, incluido el comercial, bajo los Términos Comerciales Generales. Este desarrollo en el espacio de los derechos de autor presenta una dinámica intrigante entre la creatividad humana y la IA.

Utilizando Midjourney para Diseños de UI Dinámicos y Generación de Logotipos Creativos

Desde el diseño de interfaces de usuario intuitivas para sitios web o aplicaciones móviles hasta la creación de logotipos y banners únicos, Midjourney empodera a los creadores de contenido al generar una variedad de alternativas de diseño en cuestión de segundos.

Así es como funciona. Cada diseño comienza con un prompt, que actúa como una guía para la IA. Supongamos que estás diseñando una interfaz de usuario para una aplicación de plataforma de tutoría en línea. Un prompt típico podría ser: “/imagine Interfaz de usuario de plataforma de tutoría en línea, Dribbble, Alta Resolución, 4K, como Khan Academy”.

Los resultados iniciales pueden no ser perfectos. Por ejemplo, agregar “Adobe XD” a la mezcla puede ayudar a Midjourney a adaptar sus diseños para que sean más compatibles con Adobe XD. Un prompt optimizado sería:

/imagine Plataforma de tutoría en línea, interfaz de usuario, Adobe XD, Dribbble, Alta Resolución, 4K, diseño minimalista

Imagen de Midjourney de diseños de UI/UX de aplicaciones de escritorio

 

Logotipos o Banners Inspirados en Texto utilizando Midjourney

Exploraremos cómo crear un banner con un logotipo para UNITE AI.

Primero, necesitas tener una imagen simple del texto que deseas mostrar. Puedes crear esto utilizando cualquier herramienta de diseño gráfico o editor de texto y subirlo a tu canal de Discord.

texto de muestra para LOGO DE UNITE
Imagen simple de texto utilizada para crear LOGO DE UNITE

El prompt para crear el banner es:

/imagine Letras: UNITE en una tipografía futurista inspirada en IA, logotipo con las letras UNITE –v 5 –ar 16:9

Guía de prompt de Midjourney: Pantalla de características

Observa estos ejemplos de prompts para más ideas:

/imagine Un músico solitario interpretando una melodía serena en una ciudad flotante al atardecer, estilo art nouveau

Guía de prompt de Midjourney: Imagen de arte indio

 

/imagine Una imagen de una persona del futuro trabajando en un escritorio futurista, rodeada de pantallas holográficas y tecnología avanzada. La persona lleva un traje de plata elegante y tiene gafas de realidad virtual. El entorno está lleno de luces neón y hologramas flotantes. La atmósfera es futurista y de alta tecnología, con un sentido de emoción y innovación. La cámara es una cámara digital de alta resolución, capturando cada detalle con precisión. El estilo artístico es una mezcla de ciberpunk y minimalismo, con un enfoque en líneas limpias y colores audaces. Los directores, cinematógrafos, fotógrafos, diseñadores de moda, caricaturistas y artistas que colaboran en esta única yuxtaposición son Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki y Kaws.

Prompt de Midjourney para una persona del futuro trabajando

/imagine Barbie de los años 40 como una enfermera de guerra, en un entorno de hospital militar vintage, atendiendo a los soldados heridos, en el estilo de las ilustraciones clásicas de Mattel, con la atmósfera de la fotografía en sepia de la Segunda Guerra Mundial 8k –v 5 –ar 16:9

Guía de prompt de Midjourney: Imagen de Barbie en entornos únicos

/imagine Marco de una mujer apoyada en una motocicleta voladora, estilo ciberpunk, paisajes urbanos expansivos, 32k, intrincado puerto espacial, fugaz, panorámicas de rascacielos, elegante

Imagen de Midjourney de estilo ciberpunk de chica

 

Pensamientos Finales: Navegando el Mundo del Arte de IA con Midjourney

Recuerda, “Una imagen vale más que mil palabras”. Una descripción detallada y vibrante puede trabajar maravillas. Sí, Midjourney no es gratuito. Sin embargo, está revolucionando el mundo del arte y expandiendo nuestras posibilidades creativas a través de su tecnología de IA de texto a imagen de vanguardia. Con la capacidad de convertir un simple prompt de texto en una imagen de alta resolución, es una herramienta que promete oportunidades ilimitadas, no solo para artistas, sino también para diseñadores de UI/UX, entusiastas de la tecnología y profesionales de la IA.

Aquí hay algunos puntos clave para recordar mientras emprendes tu aventura con Midjourney:

  • Aprende los fundamentos del prompt de Midjourney: Usa descripciones claras, concisas y comprehensivas que encarnen tu visión para guiar efectivamente a la IA. Recuerda considerar a tu audiencia y no dudes en experimentar con varios estilos, estados de ánimo y contextos.
  • Aprovecha los parámetros: Mejora tu experiencia creativa aprovechando la multitud de configuraciones avanzadas que ofrece Midjourney. Desde controlar la proporción de aspecto hasta ajustar el parámetro de caos para resultados únicos, cada detalle se puede personalizar según tus preferencias.
  • Acepta el proceso iterativo: Tu primera obra de arte generada por IA puede no ser perfecta. Acepta este proceso iterativo y aprende a refinar y optimizar tus prompts para mejores resultados.
  • Entiende las implicaciones de los derechos de autor: Mientras que las obras de arte generadas por IA en sí no son elegibles para la protección por derechos de autor, los componentes creados por humanos dentro de ellas pueden ser protegidos.

En esencia, la integración de la IA en el arte ha democratizado la creatividad y ha borroso las líneas entre las obras maestras hechas por humanos y las máquinas. A medida que seguimos presenciando el crecimiento asombroso de la IA generativa en el mercado del arte, es innegable que la revolución del arte de IA, liderada por plataformas como Midjourney, está apenas comenzando.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.