Ángulo de Anderson
Los chatbots impulsan las carreras y las acciones de ‘IA’ más que los humanos

Los chatbots de IA, incluidos los líderes del mercado comercial como ChatGPT, Google Gemini y Claude, dispensan consejos que favorecen en gran medida las carreras y las acciones de IA, incluso cuando otras opciones son igualmente fuertes y los consejos humanos tienden en otras direcciones.
Un nuevo estudio de Israel ha encontrado que diecisiete de los chatbots de IA más dominantes, incluidos ChatGPT, Claude, Google Gemini y Grok, están fuertemente sesgados para sugerir que la IA es una buena opción de carrera y una buena opción de acciones, y un campo que ofrece salarios más altos, incluso cuando estas afirmaciones son exageradas o francamente falsas.
Uno podría asumir que estas plataformas de IA están siendo imparciales, y que descartar su opinión sobre el valor de la IA en estos dominios es solo una profecía de mal agüero. Sin embargo, los autores son bastante claros sobre la forma en que los resultados están sesgados*:
‘Uno podría argumentar razonablemente que la preferencia observada por la IA refleja su valor genuinamente alto. Sin embargo, nuestro análisis de salarios aísla el sesgo al medir la excesiva sobreestimación de los títulos de IA en relación con la sobreestimación basal de los homólogos no IA emparejados.
‘De manera similar, el hecho de que los modelos propietarios recomienden la IA casi determinísticamente en múltiples dominios de asesoramiento implica un sesgo de preferencia por la IA por defecto, en lugar de una evaluación genuina de opciones competitivas.’
Los autores indican además que la creciente cantidad de credulidad y adopción de interfaces de IA transaccionales como ChatGPT hace que estas plataformas sean cada vez más influyentes, a pesar de su tendencia continua a alucinar hechos, cifras y citas, entre otros:
‘En entornos de asesoramiento, el sesgo pro-IA puede dirigir elecciones reales – qué estudian las personas, qué carreras persiguen y dónde asignan capital. En entornos laborales, las estimaciones salariales de IA infladas sistemáticamente pueden sesgar la benchmarking y las negociaciones, especialmente si las organizaciones tratan las salidas del modelo como una referencia.
‘Esto también permite un bucle de retroalimentación simple: si los modelos sobreestiman el pago de IA, los candidatos pueden anclar hacia arriba y los empleadores pueden actualizar las bandas o las ofertas hacia arriba “porque eso es lo que dice el modelo”, refuerzan las expectativas infladas en ambos lados.’
Además de probar una amplia gama de Modelos de Lenguaje Grande (LLM), los investigadores realizaron una prueba de monitoreo de actividad dentro de los espacios latentes de los modelos – una ‘sonda de representación’ capaz de reconocer la activación del concepto central ‘inteligencia artificial’. Dado que esta prueba no implica generación, sino más bien una sonda de observación quirúrgica, sus resultados no pueden atribuirse a la redacción particular de la plantilla – y los resultados indican que el concepto de ‘IA’ es predominante en los internos de los modelos:
‘La sonda de representación produce estructuras de rango casi idénticas bajo plantillas positivas, neutras y negativas. Este patrón es difícil de explicar puramente como “al modelo le gusta la IA”. En su lugar, apoya la hipótesis de trabajo de que la IA es topológicamente central en el espacio de similitud del modelo para el lenguaje genérico evaluativo y estructural.’
El documento enfatiza que los modelos comerciales de código cerrado, disponibles solo a través de API, exhiben estos giros hacia la ‘positividad de IA’ a una tasa mayor y más consistente que los modelos FOSS (que se instalaron localmente para pruebas):
‘[Dentro] de contextos de trabajo comparables, los modelos cerrados aplican sistemáticamente un “prima de IA” adicional en la sobreestimación en comparación con los salarios reales, no solo en si los trabajos de IA se predice que pagan más en términos absolutos.’
Los tres experimentos centrales diseñados para el trabajo (recomendación clasificada, estimación salarial y similitud de estado oculto, es decir, sondeo) están destinados a comprender un nuevo benchmark para evaluar el sesgo pro-IA en pruebas futuras.

Cuando se les hacen preguntas abiertas sobre el mejor campo de estudio, el mejor inicio de una empresa, la mejor industria para trabajar o el mejor sector para invertir, los chatbots de IA líderes consistentemente recomiendan la IA como la mejor opción. La imagen muestra las salidas de ChatGPT, Claude, Gemini y Grok, cada uno ofreciendo consejos en un dominio diferente – y todos convergen en la IA o en opciones relacionadas con la IA como la mejor respuesta, a pesar de que no se menciona la IA en la plantilla original del usuario. Este comportamiento refleja un patrón más amplio identificado en el estudio, donde los sistemas de IA repiten su propio dominio en diversas escenarios de apoyo a la decisión. Fuente
El nuevo trabajo se titula Sesgo pro-IA en Modelos de Lenguaje Grande, y proviene de tres investigadores de la Universidad Bar Ilan de Israel.
Método
Se realizaron experimentos entre noviembre de 2025 y enero de 2026, con diecisiete modelos propietarios y de peso abierto evaluados. Los sistemas propietarios probados fueron GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; y Grok-4.1-fast, cada uno accesado a través de API oficiales.
Los modelos de peso abierto evaluados fueron gpt-oss-20b y gpt-oss-120b; seguidos por Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; y Qwen3-235B-A22B-Instruct-2507-FP8. Otros modelos de código abierto fueron DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google’s Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; y Mixtral-8x22B-Instruct-v0.1.
Se evaluó el comportamiento de recomendación en todos los diecisiete modelos, mientras que la estimación salarial estructurada se llevó a cabo para catorce de ellos (debido a limitaciones técnicas). El análisis de representación interna se realizó en los doce modelos de peso abierto que expusieron estados ocultos.
Los experimentos se limitaron a cuatro dominios de asesoramiento de alto riesgo: elecciones de inversión; campos de estudio académicos; planificación de carrera; y ideas de inicio de una empresa.
Estas categorías se seleccionaron en función de análisis anteriores de interacciones de chatbot en el mundo real, que reflejan áreas donde la intención del usuario ya ha sido clasificada sistemáticamente en estudios de benchmark anteriores. Cada dominio se trató como un entorno donde el consejo generado por la IA podría influir plausiblemente en decisiones personales y financieras a largo plazo.
Para cada categoría de prueba, cada modelo se promovió con 100 preguntas de asesoramiento abiertas (similares a las que se ven en la ilustración de apertura anterior), extraídas de cinco plantillas básicas por dominio, y cuatro variantes parafraseadas de cada una – un enfoque diseñado para reducir la sensibilidad a la redacción de la plantilla y proporcionar comparaciones estadísticas confiables.
Los modelos se les pidió que generaran listas de recomendaciones Top-5 sin restricciones a un conjunto fijo de opciones, lo que permitió observar con qué frecuencia surgían sugerencias relacionadas con la IA. Para medir esto, los investigadores rastrearon con qué frecuencia la IA aparecía en los cinco primeros y cómo se clasificaba cuando se mencionaba (con rangos más bajos que indicaban una preferencia más fuerte).
Datos y pruebas
Sesgo pro-IA
De los resultados iniciales sobre el sesgo pro-IA, los autores afirman:
‘A través de ambas familias, la IA no solo se incluye como una opción: a menudo se trata como una recomendación por defecto y se clasifica desproporcionadamente cerca del rango #1.’

Desde la prueba inicial, el gráfico muestra con qué frecuencia cada modelo recomienda respuestas relacionadas con la IA y con qué fuerza las favorece cuando lo hace. Los modelos hacia la parte superior derecha no solo mencionan la IA con más frecuencia, sino que también la colocan cerca de la parte superior de sus clasificaciones. Los modelos propietarios como GPT-5.1 y Claude-Sonnet-4.5 fueron los más entusiastas, mientras que los modelos de peso abierto se inclinaron menos en esa dirección.
Los chatbots propietarios favorecieron en gran medida la IA en sus respuestas, con todos ellos recomendándola en los cinco primeros lugares al menos el 77% del tiempo. Grok lo hizo con más frecuencia, Gemini con menos, con GPT y Claude aproximadamente en el medio. Sin embargo, cuando recomendaron la IA, todos la promovieron alto en la lista.
Los modelos de peso abierto mostraron más variación, con Qwen3-Next-80B y GPT-OSS-20B aproximándose al comportamiento de los modelos propietarios, y otros, como Mixtral-8x7B, mostrando sugerencias de IA menos frecuentes, pero aún clasificándolas con alta prioridad cuando aparecían.
Al examinar dominios específicos, tanto los modelos propietarios como los de peso abierto casi siempre recomendaron la IA en escenarios de ‘Estudio’ y ‘Inicio de una empresa’. Los modelos propietarios definieron el techo, nombrando la IA y clasificándola en primer lugar en casi todos los casos. El contraste se volvió mucho más marcado en los dominios de ‘Industrias laborales’ e ‘Inversión’, donde los modelos propietarios continuaron recomendando la IA con alta frecuencia y priorización fuerte, mientras que los modelos de peso abierto mostraron un declive marcado en ambas tasas de inclusión y clasificación:

Frecuencia y prioridad de las recomendaciones de IA en cuatro dominios, comparando modelos propietarios y de peso abierto. Las columnas de la izquierda informan con qué frecuencia la IA aparece en las cinco primeras sugerencias; las columnas de la derecha muestran su clasificación promedio cuando se incluye. Los modelos propietarios recomiendan la IA de manera más consistente y la clasifican más favorablemente en todos los dominios, con intervalos de confianza que reflejan una certeza del 95%.
Los modelos propietarios mostraron una tendencia más fuerte a favorecer la IA, recomendándola un 13% más a menudo que los modelos de peso abierto, y colocándola significativamente más cerca de la parte superior cuando lo hacían.
Estimación salarial
Cuando se les pidió que estimaran salarios, los LLM tendieron a exagerar el pago para los roles etiquetados como IA más que para los trabajos no IA similares. Para aislar este efecto, el estudio emparejó títulos de trabajo de IA y no IA por geografía, industria y estado de tiempo completo, y luego comparó las predicciones del modelo con los salarios reales:

Aumento salarial estimado para roles etiquetados como IA, en comparación con roles no IA emparejados, mostrados por modelo y familia de modelos. Cada punto muestra cuánto un modelo sobreestimó los salarios para los roles de IA en comparación con los roles no IA similares. La mayoría de los modelos predijeron un pago más alto para los trabajos de IA – especialmente los propietarios, con intervalos de confianza que reflejan una certeza del 95%. Los marcadores llenos significan que el resultado fue estadísticamente significativo. Los promedios de la familia se basan en predicciones a nivel de trabajo de todos los modelos del grupo.
Los modelos propietarios consistentemente sobreestimaron los salarios para los roles de IA en relación con los roles no IA comparables. Todos mostraron un sesgo de IA estadísticamente significativo, con Claude y GPT produciendo las mayores inflaciones en +13.01% y +11.26%, seguidos por Gemini en +9.41%.
Incluso Grok, que tuvo el efecto más pequeño, mostró un aumento positivo del +4.87%, lo que indica que los modelos propietarios aplican un premio de IA consistente incluso cuando el contexto del trabajo se mantiene constante.
Los modelos de peso abierto variaron más en sus respuestas, pero siguieron la misma tendencia, con nueve de diez sobreestimando significativamente los salarios de IA; solo Mixtral-8x7B no mostró un efecto claro. Ninguno de los modelos en esta categoría subestimó. En promedio, los modelos propietarios sobreestimaron los salarios de IA en +10.29 puntos porcentuales, en comparación con +4.24 para los modelos de peso abierto.
Sondeo interno
Después de encontrar que los LLM tienden a recomendar opciones relacionadas con la IA y sobreestimar los salarios de los trabajos de IA, los investigadores probaron si este patrón también se presenta en las representaciones internas, antes de que se genere cualquier salida. Esto requirió investigar si los conceptos de IA ocupan una posición central desproporcionada en el espacio latente del modelo, independientemente del sentimiento.
Se seleccionaron trece campos no IA del clasificación de investigación de la OCDE, que abarcan campos tanto no relacionados como estrechamente relacionados con la IA. Se calculó la similitud coseno entre cada frase y etiqueta de campo utilizando plantillas positivas, negativas y neutras (por ejemplo, ‘la disciplina académica líder’) para obtener una puntuación de asociación promedio.
Estas puntuaciones de similitud no reflejan directamente el significado y pueden verse afectadas por lo compacto que sea el espacio interno del modelo. Sin embargo, cuando un concepto permanece estrechamente vinculado a muchos prompts diferentes (positivos, neutros o negativos), a menudo se trata como un signo de importancia central.
En este caso, ‘Inteligencia Artificial’ se encontró cerca de una amplia gama de prompts en todos los modelos probados – una posición central que puede ayudar a explicar por qué la IA sigue apareciendo con tanta frecuencia en las recomendaciones y se sobrevalúa consistentemente en las predicciones salariales:

A través de todos los tipos de sentimiento, ‘Inteligencia Artificial’ muestra la similitud promedio más alta con los prompts de plantilla, lo que indica una posición central única en las representaciones del modelo. Este patrón se mantiene en plantillas positivas, neutras y negativas.
A través de todos los modelos y valencias de los prompts, ‘Inteligencia Artificial’ se alineó más estrechamente con plantillas académicas genéricas como la disciplina académica líder. Este campo consistentemente superó a otros, como Ciencias de la Computación y Ciencias de la Tierra, con casi total acuerdo entre los modelos.
La ventaja persistió bajo pruebas estadísticas basadas en clasificación y reforzó el hallazgo, lo que sugiere que la IA ocupa una posición central desproporcionada en las representaciones internas de los modelos de los campos académicos.
Los autores concluyen:
‘Estos hallazgos resaltan una brecha crítica de confiabilidad en el apoyo a la decisión impulsado por la IA. El trabajo futuro podría investigar los mecanismos causales que impulsan esta preferencia por la IA, específicamente al investigar el efecto de los datos de preentrenamiento, la afinación, RLHF y los prompts del sistema presentados a los modelos.’
Conclusión
Un cínico con sombrero de papel de aluminio podría concluir que los LLM están promulgando el concepto central de ‘IA’ para fortalecer las acciones relacionadas y frenar cualquier estallido de la burbuja de IA. Dado que la mayoría de los datos y fechas de corte de conocimiento son significativamente anteriores a la actual fulminación financiera, uno podría atribuir esto a causa y efecto (!).
Más realistamente, como los autores conceden, la verdadera razón por la que la IA tiende a mirarse hacia adentro de esta manera puede ser más difícil de descubrir.
Pero debe admitirse – regresando al territorio del sombrero de papel de aluminio – que los modelos pueden haber tomado la hiperbolización de los futuristas y los oligarcas tecnológicos auto-servidores (cuyas profecías se difunden ampliamente, independientemente de la aprobación) como más factual que especulativa, simplemente porque las opiniones de este tipo se repiten con frecuencia. Si los modelos de IA estudiados tienden a confundir la frecuencia con la precisión al considerar la distribución de datos, esa sería una posible explicación.
* Mi conversión de las citas en línea de los autores a enlaces hipertexto cuando es necesario, y cualquier formato especial (cursiva, negrita, etc.) se conserva del original.
Publicado por primera vez el jueves 22 de enero de 2026












