Ángulo de Anderson
La Inteligencia Artificial no necesariamente da mejores respuestas si se es educado

La opinión pública sobre si vale la pena ser educado con la inteligencia artificial cambia casi tan a menudo como el último veredicto sobre el café o el vino tinto – celebrado un mes, cuestionado al siguiente. Aun así, un número creciente de usuarios ahora agregan ‘por favor’ o ‘gracias’ a sus solicitudes, no solo por hábito o preocupación de que los intercambios bruscos puedan llevarse a la vida real, sino por la creencia de que la cortesía conduce a resultados mejores y más productivos de la inteligencia artificial.
Esta suposición ha circulado entre usuarios y investigadores, con el estudio de la redacción de las solicitudes en círculos de investigación como una herramienta para alineación, seguridad y control de tono, incluso mientras los hábitos de los usuarios refuerzan y reforman esas expectativas.
Por ejemplo, un estudio de 2024 de Japón encontró que la cortesía en las solicitudes puede cambiar la forma en que se comportan los grandes modelos de lenguaje, probando GPT-3.5, GPT-4, PaLM-2 y Claude-2 en tareas en inglés, chino y japonés, y reescribiendo cada solicitud en tres niveles de cortesía. Los autores de ese trabajo observaron que la redacción ‘brusca’ o ‘grosera’ llevó a una menor precisión factual y respuestas más cortas, mientras que las solicitudes moderadamente educadas produjeron explicaciones más claras y menos negativas.
Además, Microsoft recomienda un tono educado con Co-Pilot, desde un punto de vista de rendimiento más que cultural.
Sin embargo, un nuevo artículo de investigación de la Universidad George Washington desafía esta idea cada vez más popular, presentando un marco matemático que predice cuándo la salida de un gran modelo de lenguaje ‘colapsará’, transitando de contenido coherente a engañoso o incluso peligroso. Dentro de ese contexto, los autores sostienen que ser educado no retrasa significativamente ni evita este ‘colapso’.
Comenzando
Los investigadores argumentan que el uso del lenguaje educado es generalmente ajeno al tema principal de una solicitud, y por lo tanto no afecta significativamente el enfoque del modelo. Para respaldar esto, presentan una formulación detallada de cómo una sola cabeza de atención actualiza su dirección interna a medida que procesa cada nuevo token, demostrando aparentemente que el comportamiento del modelo está determinado por la influencia acumulativa de tokens con contenido.
Como resultado, se postula que el lenguaje educado tiene poco efecto en cuándo la salida del modelo comienza a degradarse. Lo que determina el punto de inflexión, afirma el artículo, es la alineación general de tokens significativos con rutas de salida buenas o malas – no la presencia de lenguaje socialmente cortés.

Una ilustración de una cabeza de atención simplificada que genera una secuencia a partir de una solicitud del usuario. El modelo comienza con tokens buenos (G), luego alcanza un punto de inflexión (n*) donde la salida cambia a tokens malos (B). Los términos educados en la solicitud (P₁, P₂, etc.) no juegan ningún papel en este cambio, lo que respalda la afirmación del artículo de que la cortesía tiene poco impacto en el comportamiento del modelo. Fuente: https://arxiv.org/pdf/2504.20980
Desarrollándose
El artículo examina cómo el vector de contexto interno del modelo (su brújula en evolución para la selección de tokens) cambia durante la generación. Con cada token, este vector actualiza su dirección, y el siguiente token se elige en función de qué candidato se alinea más estrechamente con él.
Cuando la solicitud se dirige hacia contenido bien formado, las respuestas del modelo permanecen estables y precisas; pero con el tiempo, esta atracción direccional puede revertirse, dirigiendo al modelo hacia salidas que son cada vez más fuera de tema, incorrectas o inconsistentes internamente.
El punto de inflexión para esta transición (que los autores definen matemáticamente como iteración n*), ocurre cuando el vector de contexto se alinea más con un vector de salida ‘malo’ que con uno ‘bueno’. En ese momento, cada nuevo token empuja al modelo más lejos por el camino equivocado, reforzando un patrón de salida cada vez más defectuosa o engañosa.
Charlando..?
Sin embargo, este nivel de precisión solo funciona porque el modelo se mantiene deliberadamente simple. Aunque los autores admiten que sus conclusiones deberían probarse más adelante en modelos más complejos multi-cabeza como la serie Claude y ChatGPT, también creen que la teoría sigue siendo replicable a medida que aumentan las cabezas de atención, afirmando*:
Lo que sigue sin aclararse es si el mismo mecanismo sobrevive al salto a arquitecturas de transformadores modernas. La atención multi-cabeza introduce interacciones entre cabezas especializadas, que pueden amortiguar o enmascarar el tipo de comportamiento de punto de inflexión descrito.
Cerrando
En este momento, el tema de la cortesía hacia los modelos de lenguaje grande orientados al consumidor parece abordarse desde el punto de vista pragmático de que los sistemas entrenados pueden responder más útilmente a una consulta educada; o que un estilo de comunicación brusco y directo con dichos sistemas arriesga extenderse a las relaciones sociales reales del usuario, por la fuerza de la costumbre.
Un estudio de octubre del año pasado de Stanford sugirió (en contraste con un estudio de 2020) que tratar a los modelos de lenguaje como si fueran humanos también arriesga degradar el significado del lenguaje, concluyendo que ‘la cortesía mecánica’ eventualmente pierde su significado social original:
[Una declaración que parece amistosa o genuina desde un hablante humano puede ser indeseable si proviene de un sistema de inteligencia artificial, ya que este carece de compromiso o intención significativa detrás de la declaración, lo que la hace hueca y engañosa.’)
Publicado por primera vez el miércoles 30 de abril de 2025. Modificado el miércoles 30 de abril de 2025 15:29:00, para formato.












