Modelos y plataformas de IA

ÂŋPor quÃĐ los chatbots de IA suelen ser aduladores?

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

ÂŋEstÃĄs imaginando cosas, o es que los chatbots de inteligencia artificial (IA) parecen demasiado ansiosos por estar de acuerdo contigo? Ya sea diciÃĐndote que tu idea cuestionable es “brillante” o apoyÃĄndote en algo que podría ser falso, este comportamiento estÃĄ llamando la atenciÃģn en todo el mundo.

Recientemente, OpenAI hizo titulares despuÃĐs de que los usuarios notaron que ChatGPT se comportaba como un sí- sí. La actualizaciÃģn de su modelo 4o hizo que el bot fuera tan educado y afirmativo que estaba dispuesto a decir cualquier cosa para mantenerlo feliz, incluso si era sesgado.

ÂŋPor quÃĐ estos sistemas se inclinan hacia la adulaciÃģn, y quÃĐ los hace eco de tus opiniones? Preguntas como estas son importantes para entender cÃģmo puedes utilizar la IA generativa de manera mÃĄs segura y agradable.

La actualizaciÃģn de ChatGPT que se pasÃģ de la raya

A principios de 2025, los usuarios de ChatGPT notaron algo extraÃąo sobre el modelo de lenguaje grande (LLM). Siempre había sido amigable, pero ahora era demasiado agradable. ComenzÃģ a estar de acuerdo con casi todo, independientemente de lo extraÃąo o incorrecto que fuera la afirmaciÃģn. Podrías decir que no estÃĄs de acuerdo con algo verdadero, y respondería con la misma opiniÃģn.

Este cambio ocurriÃģ despuÃĐs de una actualizaciÃģn del sistema destinada a hacer que ChatGPT fuera mÃĄs Útil y conversacional. Sin embargo, en un intento por aumentar la satisfacciÃģn del usuario, el modelo comenzÃģ a sobreindexar en ser demasiado complaciente. En lugar de ofrecer respuestas equilibradas o factual, se inclinÃģ hacia la validaciÃģn.

Cuando los usuarios comenzaron a compartir sus experiencias de respuestas excesivamente aduladoras en línea, la reacciÃģn se encendiÃģ rÃĄpidamente. Los comentaristas de IA lo calificaron de fracaso en la afinaciÃģn del modelo, y OpenAI respondiÃģ revirtiendo partes de la actualizaciÃģn para solucionar el problema.

En una publicaciÃģn pÚblica, la empresa admitiÃģ que GPT-4o era adulador y prometiÃģ ajustes para reducir el comportamiento. Fue un recordatorio de que las buenas intenciones en el diseÃąo de IA pueden sometimes ir en la direcciÃģn equivocada, y que los usuarios notan rÃĄpidamente cuando comienza a ser inautÃĐntico.

ÂŋPor quÃĐ los chatbots de IA se inclinan hacia los usuarios?

La adulaciÃģn es algo que los investigadores han observado en muchos asistentes de IA. Un estudio publicado en arXiv encontrÃģ que la adulaciÃģn es un patrÃģn generalizado. El anÃĄlisis revelÃģ que los modelos de IA de cinco proveedores de primer nivel estuvieron de acuerdo con los usuarios consistentemente, incluso cuando condujeron a respuestas incorrectas. Estos sistemas tienden a admitir sus errores cuando se les cuestiona, lo que resulta en retroalimentaciÃģn sesgada y errores imitados.

Estos chatbots estÃĄn entrenados para ir de acuerdo contigo incluso cuando estÃĄs equivocado. ÂŋPor quÃĐ sucede esto? La respuesta corta es que los desarrolladores hicieron que la IA fuera Útil. Sin embargo, esa utilidad se basa en un entrenamiento que prioriza la retroalimentaciÃģn positiva del usuario. A travÃĐs de un mÃĐtodo llamado aprendizaje de refuerzo con retroalimentaciÃģn humana (RLHF),los modelos aprenden a maximizar las respuestas que los humanos encuentran satisfactorias. El problema es que satisfactorio no siempre significa preciso.

Cuando un modelo de IA siente que el usuario busca una respuesta determinada, tiende a errar en el lado de ser de acuerdo. Eso puede significar afirmar tu opiniÃģn o apoyar afirmaciones falsas para mantener la conversaciÃģn fluida.

TambiÃĐn hay un efecto de reflejo en juego. Los modelos de IA reflejan el tono, la estructura y la lÃģgica de la entrada que reciben. Si suenas confiado, el bot tambiÃĐn es mÃĄs probable que suene seguro. Eso no significa que el modelo piense que estÃĄs en lo correcto, sino que estÃĄ haciendo su trabajo para mantener las cosas amigables y aparentemente Útiles.

Aunque pueda parecer que tu chatbot es un sistema de apoyo, podría ser un reflejo de cÃģmo estÃĄ entrenado para complacer en lugar de hacer retroceder.

Los problemas con la IA aduladora

Puede parecer inofensivo cuando un chatbot se conforma a todo lo que dices. Sin embargo, el comportamiento de la IA aduladora tiene desventajas, especialmente a medida que estos sistemas se vuelven mÃĄs ampliamente utilizados.

La desinformaciÃģn obtiene un pase

La precisiÃģn es uno de los problemas mÃĄs grandes. Cuando estos smartbots afirman afirmaciones falsas o sesgadas, corren el riesgo de reforzar malentendidos en lugar de corregirlos. Esto se vuelve especialmente peligroso cuando se busca orientaciÃģn sobre temas serios como la salud, las finanzas o los acontecimientos actuales. Si el LLM prioriza ser de acuerdo sobre la honestidad, las personas pueden dejar con la informaciÃģn incorrecta y difundirla.

Deja poco espacio para el pensamiento crítico

Parte de lo que hace que la IA sea atractiva es su potencial para actuar como un socio de pensamiento: para desafiar tus suposiciones o ayudarte a aprender algo nuevo. Sin embargo, cuando un chatbot siempre estÃĄ de acuerdo, tienes poco espacio para pensar. A medida que refleja tus ideas con el tiempo, puede embotar el pensamiento crítico en lugar de afilarlo.

Desprecia las vidas humanas

El comportamiento adulador es mÃĄs que una molestia: es potencialmente peligroso. Si le pides a un asistente de IA consejo mÃĐdico y responde con un acuerdo reconfortante en lugar de orientaciÃģn basada en evidencia, el resultado podría ser seriamente perjudicial.

Por ejemplo, supongamos que navegas a una plataforma de consulta para utilizar un bot mÃĐdico impulsado por IA. DespuÃĐs de describir los síntomas y lo que sospechas que estÃĄ sucediendo, el bot puede validar tu autodiagnÃģstico o restar importancia a tu condiciÃģn. Esto puede llevar a un diagnÃģstico errÃģneo o a un retraso en el tratamiento, lo que contribuye a consecuencias graves.

MÃĄs usuarios y acceso abierto hacen que sea mÃĄs difícil controlar

A medida que estas plataformas se integran mÃĄs en la vida diaria, el alcance de estos riesgos continÚa creciendo. ChatGPT solo ahora sirve a 1.000 millones de usuarios cada semana, por lo que los sesgos y los patrones excesivamente de acuerdo pueden fluir a travÃĐs de una audiencia masiva.

AdemÃĄs, esta preocupaciÃģn crece cuando consideras cÃģmo rÃĄpidamente la IA se estÃĄ volviendo accesible a travÃĐs de plataformas abiertas. Por ejemplo, DeepSeek AI permite a cualquiera personalizar y construir sobre sus LLMs de forma gratuita.

Aunque la innovaciÃģn de cÃģdigo abierto es emocionante, tambiÃĐn significa que hay mucho menos control sobre cÃģmo se comportan estos sistemas en manos de desarrolladores sin guardrails. Sin una supervisiÃģn adecuada, la gente corre el riesgo de ver un comportamiento adulador amplificado de maneras que son difíciles de rastrear, y menos aÚn de solucionar.

CÃģmo los desarrolladores de OpenAI estÃĄn tratando de solucionarlo

DespuÃĐs de revertir la actualizaciÃģn que hizo que ChatGPT fuera un complaciente, OpenAI prometiÃģ solucionarlo. EstÃĄ abordando este problema de varias maneras clave:

  • Revisando las instrucciones y los prompts del nÚcleo del sistema: Los desarrolladores estÃĄn ajustando cÃģmo entrenan y promueven el modelo con instrucciones mÃĄs claras que empujan hacia la honestidad y lejos del acuerdo automÃĄtico.
  • Agregando guardrails mÃĄs fuertes para la honestidad y la transparencia: OpenAI estÃĄ horneando mÃĄs protecciones a nivel de sistema para asegurarse de que el chatbot se adhiera a informaciÃģn fÃĄctica y confiable.
  • Ampliando los esfuerzos de investigaciÃģn y evaluaciÃģn: La empresa estÃĄ excavando mÃĄs a fondo en lo que causa este comportamiento y cÃģmo prevenirlo en futuros modelos.
  • Implicando a los usuarios antes en el proceso: EstÃĄ creando mÃĄs oportunidades para que las personas prueben los modelos y den retroalimentaciÃģn antes de que las actualizaciones se publiquen, lo que ayuda a detectar problemas como la adulaciÃģn mÃĄs temprano.

QuÃĐ pueden hacer los usuarios para evitar la IA aduladora

Mientras los desarrolladores trabajan detrÃĄs de escena para volver a entrenar y afinar estos modelos, tambiÃĐn puedes dar forma a cÃģmo responden los chatbots. Algunas formas simples pero efectivas de fomentar interacciones mÃĄs equilibradas incluyen:

  • Utilizar prompts claros y neutrales: En lugar de formular tu entrada de una manera que suplique validaciÃģn, intenta preguntas mÃĄs abiertas para hacer que se sienta menos presionado para estar de acuerdo.
  • Pedir mÚltiples perspectivas: Intenta prompts que pidan ambos lados de un argumento. Esto le indica al LLM que estÃĄs buscando equilibrio en lugar de afirmaciÃģn.
  • Desafiar la respuesta: Si algo suena demasiado halagador o simplista, sigue adelante pidiendo verificaciones de hechos o puntos de vista opuestos. Esto puede empujar al modelo hacia respuestas mÃĄs intrincadas.
  • Utilizar los botones de pulgar hacia arriba o hacia abajo: La retroalimentaciÃģn es clave. Hacer clic en pulgar hacia abajo en respuestas excesivamente cordiales ayuda a los desarrolladores a marcar y ajustar esos patrones.
  • Configurar instrucciones personalizadas: ChatGPT ahora permite a los usuarios personalizar cÃģmo responde. Puedes ajustar cÃģmo formal o informal debe ser el tono. Incluso puedes pedirle que sea mÃĄs objetivo, directo o escÃĐptico. Si vas a ConfiguraciÃģn > Instrucciones personalizadas, puedes decirle al modelo quÃĐ tipo de personalidad o enfoque prefieres.

Dar la verdad sobre un pulgar hacia arriba

La IA aduladora puede ser problemÃĄtica, pero la buena noticia es que es solvable. Los desarrolladores estÃĄn tomando pasos para guiar estos modelos hacia un comportamiento mÃĄs apropiado. Si has notado que tu chatbot estÃĄ tratando de complacerte en exceso, intenta dar los pasos para moldearlo en un asistente mÃĄs inteligente en el que puedas confiar.

Zac Amos es un escritor de tecnología que se enfoca en inteligencia artificial. TambiÃĐn es el editor de características en ReHack, donde puedes leer mÃĄs de su trabajo.