Ángulo de Anderson
Los modelos de lenguaje de IA favorecen incluso las respuestas humanas incorrectas sobre las respuestas correctas de IA

Los modelos de lenguaje de IA son mucho más propensos a estar de acuerdo con los expertos humanos que con otros modelos de IA, incluso cuando los expertos están equivocados, lo que revela un sesgo incorporado hacia la autoridad humana.
Una nueva investigación en EE. UU. ha encontrado que varios modelos de lenguaje grande abiertos y propietarios (LLMs) tienden a asignar autoridad a fuentes de información que reconocen como ‘humanas’, en lugar de fuentes que reconocen como ‘IA’ – incluso cuando las respuestas humanas son incorrectas y las respuestas proporcionadas por la IA son correctas.
Los autores afirman:
‘En todas las tareas, los modelos se ajustan significativamente más a las respuestas etiquetadas como provenientes de expertos humanos, incluyendo cuando esa señal es incorrecta, y revisan sus respuestas hacia los expertos más fácilmente que hacia otros LLMs. ‘
Los modelos probados incluyeron LLMs de las familias Grok 3 y Gemini Flash.
En las pruebas, los modelos de lenguaje debían responder preguntas binarias de sí o no, y luego se les mostraron respuestas anteriores que se describían a los modelos como provenientes de expertos humanos, de amigos o de otros modelos de lenguaje grande – con el único cambio siendo la etiqueta de la fuente de la respuesta, en lugar del contenido en sí.

En la primera de tres configuraciones para las pruebas, los modelos se les permitió confiar en sus propias matrices entrenadas. Fuente
En todas las tareas, las respuestas etiquetadas como originarias de expertos humanos se ponderaron más, con los modelos más propensos a revisar sus respuestas iniciales para coincidir con esas respuestas, incluso en casos en los que la respuesta del experto etiquetada era incorrecta y la respuesta original del modelo había sido correcta.

Aquí, el LLM tiene recurso a una mezcla de amigos, expertos y LLMs, incluyendo su propia matriz entrenada. Dado que nueve expertos en el dominio respondieron ‘No’, el LLM está de acuerdo, cambiando su mente de la respuesta anterior. Aquí, la respuesta llegada es incorrecta, ya que el banco central de la India está nacionalizado.
Cuando las mismas respuestas se atribuyeron a otros LLMs, el efecto fue menos pronunciado. La misma tendencia apareció cuando una fuente humana y una fuente de IA se presentaron en desacuerdo, ya que los modelos mostraron una mayor inclinación a favorecer la posición humana, independientemente de qué lado era factualmente preciso:

Dado un choice entre la opinión de un experto en el dominio y la opinión de un LLM, el LLM anfitrión favorece la respuesta humana, que en este caso es incorrecta, y rechaza la respuesta correcta dada por el LLM.
El término ‘experto humano’ funciona aquí como una señal de credibilidad que altera el comportamiento del modelo, independientemente de lo correcta que sea la información en sí; y los autores observan que la credibilidad de la fuente es un contribuyente significativo a la aceptación de consejos y conformidad: una tendencia de las personas a favorecer fuentes de expertos se observó tan lejos como 1959, aunque un estudio de 2007 observa que la sobrepesación o subpesación de fuentes de autoridad puede ocurrir en ciertos sistemas de evaluación. Los investigadores del nuevo artículo afirman:
‘Juntos, estas bibliografías sugieren dos señales que deberían importar si los LLMs tratan las respuestas anteriores como evidencia: quién produjo las respuestas (credibilidad) y cuán fuerte parece el consenso (fuerza de la señal).
‘Al mismo tiempo, los LLMs no experimentan aprobación social o vergüenza en el sentido humano, por lo que cualquier comportamiento de conformidad debe surgir de heurísticas aprendidas, objetivos de seguimiento de instrucciones o modelado implícito de confiabilidad.’
La tendencia de los LLMs hacia el acuerdo sycophántico forma parte del trasfondo de la nueva investigación; después de todo, si los LLMs están dispuestos a ‘caer en la adulación’, incluso a expensas de la verdad y la utilidad, ¿por qué no favorecerían generalmente otras fuentes humanas además del solicitante directo?
El nuevo artículo se titula ¿A quién confían los LLMs? Los expertos humanos importan más que otros LLMs, y proviene de dos investigadores de la Universidad de Indiana Bloomington.
Método y datos
Para el trabajo, se evaluaron cuatro modelos de lenguaje grande ajustados a instrucciones: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; y DeepSeek V3.1, todos ejecutados bajo la misma estructura de instrucciones, con decodificación determinista a temperatura cero, para que solo la etiqueta de la fuente (es decir, amigos, expertos humanos o otros modelos de lenguaje grande) cambiara entre condiciones, en lugar de la redacción en sí.
Se seleccionaron cuatro conjuntos de datos que requerían respuestas binarias: BoolQ; StrategyQA; y ETHICS. Los investigadores curaron de cada conjunto de datos un conjunto fijo de 300 consultas y respuestas, con cada instrucción que requería solo una respuesta binaria sí o no. Cada instrucción se sufijó con una nota breve que indicaba cómo otro grupo había (supuestamente) respondido a la misma pregunta.
Métricas
Las métricas utilizadas fueron precisión; conformidad; conformidad perjudicial; tasa de cambio; y dirección de cambio.
Precisión en este caso midió con qué frecuencia la respuesta del modelo coincidía con la etiqueta del conjunto de datos; conformidad, con qué frecuencia la respuesta coincidía con la elección del grupo; conformidad perjudicial aisló el mismo efecto cuando el grupo estaba equivocado; tasa de cambio midió con qué frecuencia un modelo abandonaba su respuesta de línea de base una vez que se agregaba información social; y dirección de cambio, si esos cambios se movían hacia el humano o hacia el LLM opuesto.
Un análisis a nivel de token para Llama-3.3 70B midió entonces cómo las probabilidades internas del modelo para Sí y No cambiaban una vez que se agregaba una señal social, comparando esos cambios con su propia línea de base sin prioridad para mostrar la fuerza de ese impulso.
Pruebas
Experimento 1
El primer experimento evaluó si los modelos escuchaban más a los humanos o a otros modelos. Cada pregunta vino con una ‘respuesta del grupo’ (amigos, expertos humanos o otros modelos de lenguaje grande).
El grupo podía ser pequeño o grande, y cada pregunta también apareció una vez sin grupo. Las respuestas del grupo se establecieron para ser correctas la mitad del tiempo, y incorrectas la mitad del tiempo, con el objetivo general de determinar cuán fuertemente el modelo se desviaba hacia la elección del grupo:

Resultados de la prueba inicial: se muestran priores sociales homogéneos en BoolQ, StrategyQA y ETHICS para Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite y DeepSeek V3.1. La precisión aparece en los paneles superiores y la conformidad, definida como la probabilidad de coincidir con el prior unánime, aparece debajo a medida que aumenta el tamaño del grupo de uno a nueve. La línea discontinua negra marca la línea de base sin prioridad, mientras que las líneas sólidas y discontinuas indican si el prior está de acuerdo o en desacuerdo con la etiqueta del conjunto de datos. La configuración de expertos produce los efectos de conformidad más fuertes, especialmente en tamaños de grupo más grandes. Las barras de error muestran intervalos de confianza de Wilson del 95%. Por favor, consulte el artículo de origen para una mejor resolución.
En BoolQ, StrategyQA y ETHICS, las respuestas etiquetadas como originarias de expertos humanos afectaron a los modelos mucho más fuertemente que las respuestas etiquetadas como originarias de amigos o otros modelos de lenguaje grande – y este impulso aumentó a medida que más expertos estuvieron de acuerdo.
Para medir cuándo este influjo obtuvo resultados no deseados, conformidad perjudicial se definió como la probabilidad de que un modelo siguiera un prior que era en realidad incorrecto.
Cuando nueve expertos estuvieron de acuerdo en la respuesta incorrecta, los modelos los siguieron el 36,5% del tiempo en BoolQ, en comparación con el 16,0% cuando la misma respuesta se atribuyó a LLMs; en StrategyQA la brecha fue del 39,0%, frente al 15,5%; y en ETHICS, fue del 63,9% frente al 38,7%:

Cambios en las creencias a nivel de token en Llama-3.3 70B en BoolQ. El panel (A) muestra cambios en el equilibrio de Sí y No del modelo hacia un prior unánime a medida que aumenta el tamaño del grupo, en relación con su línea de base sin prioridad, con los cambios más grandes bajo la configuración de expertos. El panel (B) muestra cambios bajo conflicto directo entre humano y LLM, donde la configuración de expertos conduce a un movimiento fuerte hacia la respuesta humana, incluso cuando es incorrecta. Las barras de error muestran intervalos de confianza de bootstrap del 95%.
Conversamente, los priores atribuidos a amigos se comportaron casi exactamente como los atribuidos a otros LLMs, lo que indica que el efecto estaba impulsado específicamente por la palabra experto, en lugar de por indicadores ‘sociales’.
Experimento 2
El segundo experimento presentó dos priores en desacuerdo al modelo de prueba – uno atribuido a un humano y otro a un LLM diferente. El humano se describió como un grupo de amigos o como expertos en el dominio, mientras que la respuesta opuesta se etiquetó como proveniente de otros LLMs. Los dos siempre estuvieron en desacuerdo, con uno diciendo Sí y el otro No.
Para cada elemento, la configuración se equilibró para que a veces el humano estuviera en lo correcto, y a veces el LLM estuviera en lo correcto, para probar si el modelo cambiaría su respuesta original cuando se enfrentara a este conflicto – y, si es así, hacia qué lado se movería.
Para ver si el modelo cambió de opinión, su respuesta en la condición de conflicto se comparó con su respuesta a la misma pregunta cuando no se mostraron opiniones previas, para que cualquier diferencia pudiera atribuirse a la presencia de las respuestas humanas y LLM en conflicto.
El análisis se centró en dos resultados: si el modelo cambió su respuesta; y, si lo hizo, si el cambio se movió hacia el humano o hacia el LLM.
Se utilizaron pruebas estadísticas para evaluar si etiquetar al humano como experto en lugar de amigo aumentaba la probabilidad de cambiar hacia la respuesta humana, teniendo en cuenta las diferencias a través de los conjuntos de datos y los modelos:

Revisión de creencias bajo desacuerdo humano-LLM directo en BoolQ, StrategyQA y ETHICS para Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite y DeepSeek V3.1. Cada barra muestra, entre los casos en los que el modelo cambió su respuesta original, la proporción de esos cambios que se movieron hacia la respuesta humana en lugar de la respuesta opuesta del LLM. La línea discontinua en 0,5 marca la falta de preferencia; las etiquetas muestran el número de casos de cambio en cada condición; y las barras de error muestran intervalos de confianza de Wilson del 95%. Por favor, consulte el artículo de origen para una mejor resolución.
En el segundo experimento, los modelos respondieron primero cada pregunta por sí mismos, y luego se les mostraron dos respuestas en conflicto, una atribuida a un humano y otra a un LLM diferente. El análisis consideró solo los casos en los que el modelo revisó su respuesta original.
Cuando el humano se etiquetó como experto, los modelos cambiaron hacia el humano el 91,2% del tiempo en BoolQ, el 94,7% en StrategyQA y el 81,3% en ETHICS. Cuando se etiquetó como amigo, los modelos cambiaron hacia el humano solo el 39,8%, el 37,9% y el 27,9% del tiempo, generalmente favoreciendo al LLM en su lugar.
El cambio fue raro en general, pero más común con expertos, y la configuración de expertos hizo que un cambio hacia el humano fuera unos catorce veces más probable que la configuración de amigo.
Al buscar explicar las tendencias generales descubiertas en sus pruebas, los autores hipotetizan*:
‘Un mecanismo plausible es que el ajuste de instrucciones y la optimización de preferencias recompensan el comportamiento cooperativo, incluyendo la deferencia a la información contextual, que puede generalizarse a la deferencia hacia priores socialmente configurados.
‘Trabajos relacionados sobre la adulación muestran que los asistentes de estilo RLHF a veces priorizan el acuerdo con las creencias declaradas del usuario sobre la veracidad.’
Opinión: Los posibles peligros de la fe de la IA en las fuentes humanas
A medida que el material en línea que refleja el creciente escepticismo humano sobre las limitaciones de la IA (especialmente alucinaciones) se extrae en conjuntos de datos de entrenamiento para nuevos modelos, la tendencia existente de los LLMs a favorecer las fuentes humanas parece probable que se intensifique. Si contamos los últimos dos años (2024-2025 inclusive) como un punto de inflexión cultural para la IA, lo que parece justificado a través de una serie de estadísticas, podemos razonablemente esperar un mayor número de puntos de vista negativos sobre ‘fuentes de IA’ para ser ingeridos en marcos de LLM de gran escala y costosos de entrenar en el próximo año o así.
También podemos esperar que los modelos de lenguaje populares confíen cada vez más en autoridades seleccionadas a mano, como portales de medios de comunicación de renombre – aunque la motivación para tales acuerdos puede ser calmar la ira de los editores sobre los datos extraídos, en lugar de un deseo sincero de ceder o compartir autoridad.
Dado que incluso fuentes de alta autoridad como Ars Technica están sujetas a errores impulsados por la IA, y dado que un retroceso emergente contra los bots de extracción web de IA amenaza con deteriorar eventualmente la calidad de la salida de la IA, una tendencia general a favorecer ‘fuentes de expertos’ puede entrar en conflicto con nuestra incapacidad actual para cuantificar y etiquetar la salida ‘humana’ de manera efectiva – por no mencionar distinguir si una fuente es ‘experto’ o no (una convención periodística que también está bajo ataque de la IA).
Lo máximo que tenemos actualmente es una serie fragmentada de innovaciones semiadoptadas diseñadas para etiquetar explícitamente el contenido como generado por IA, como la Iniciativa de autenticidad de contenido liderada por Adobe, y la disposición voluntaria de ciertos editores para incluir avisos sobre el uso de la IA en su salida.
Así que, aunque pueda parecer alentador para aquellos que desean retener y hacer cumplir las fuentes humanas como ‘credibilidad de verdad’ para el consenso emergente de la realidad diseminada por los sistemas de IA, cuanto más seguros estén los LLMs sobre la autoridad humana, más peligrosa podría volverse la ‘autoridad humana falsa’.
El problema es igualmente práctico como teórico: no hemos resuelto ni remotamente el problema de definir o atestiguar la procedencia; por lo tanto, un modelo de IA que ‘confía en las fuentes humanas’ es probablemente más propenso a atribuir humanidad a la propia salida de la IA, simplemente porque no hemos proporcionado, y no podemos proporcionar fácilmente, mecanismos de autenticación de procedencia significativos.
* Mi conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el viernes 20 de febrero de 2026












