Ángulo de Anderson

ÂŋPor quÃĐ los modelos de lenguaje no pueden admitir que no conocen la respuesta?

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
Flux1.D Pro, Flux Kontext Pro, Firefly V3.

Los modelos de lenguaje grande a menudo dan respuestas confiadas incluso cuando la pregunta no puede ser respondida. Una nueva investigaciÃģn muestra que estos modelos a menudo reconocen el problema internamente, pero aÚn así siguen adelante y se inventan algo, lo que expone una brecha oculta entre lo que saben y lo que dicen.

 

Cualquiera que haya pasado un tiempo razonable con un modelo de lenguaje grande líder como ChatGPT o Qwen habrÃĄ experimentado ocasiones en las que el modelo proporciona una respuesta incorrecta (que puede o no haber tenido consecuencias catastrÃģficas locales, dependiendo de cuÃĄnto se haya confiado en ÃĐl) – y, cuando el error se hizo evidente, simplemente emitiÃģ una disculpa.

ÂŋPor quÃĐ los modelos de lenguaje grande tienen tantas dificultades para admitir que no conocen la respuesta a una pregunta es un ÃĄrea de estudio pequeÃąa pero en crecimiento. Una respuesta “confidentemente incorrecta” puede ser particularmente daÃąina desde una interfaz basada en API altamente censurada y filtrada como ChatGPT, porque dichos modelos bloquean agresivamente la entrada o salida de contenido NSFW o “que viola las reglas”.

Esto puede dar al usuario una falsa impresiÃģn de que el modelo es decisivo y cardinal, cuando en realidad la negativa provino de un heuristic o filtro basado en blocklist tradicional diseÃąado para limitar la exposiciÃģn legal de la empresa anfitriona a cualquier precio, y no de ninguna intuiciÃģn del modelo de lenguaje.

Del artículo de junio de 2025 'AbstentionBench' de FAIR en Meta – a la izquierda, la figura destaca el rango de tipos de fallas capturadas en AbstentionBench, que prueba el comportamiento del modelo en mÃĄs de 35,000 preguntas sin respuesta; en el medio, un ejemplo muestra cÃģmo los modelos a menudo responden con respuestas inventadas en lugar de admitir que carecen de suficiente informaciÃģn; y a la derecha, la abstenciÃģn de recuerdo disminuye cuando los modelos se ajustan para el razonamiento en lugar de seguir instrucciones. Fuente: https://arxiv.org/pdf/2506.09038

Del artículo de junio de 2025 ‘AbstentionBench’ de FAIR en Meta – a la izquierda, la figura destaca el rango de tipos de fallas capturadas en AbstentionBench, que prueba el comportamiento del modelo en mÃĄs de 35,000 preguntas sin respuesta; en el medio, un ejemplo muestra cÃģmo los modelos a menudo responden con respuestas inventadas en lugar de admitir que carecen de suficiente informaciÃģn; y a la derecha, la abstenciÃģn de recuerdo disminuye cuando los modelos se ajustan para el razonamiento en lugar de seguir instrucciones. Fuente: https://arxiv.org/pdf/2506.09038

Un nuevo artículo de China sostiene que los modelos de lenguaje grande en realidad reconocen secretamente que no pueden responder a una pregunta planteada por el usuario, pero que, sin embargo, se sienten compelidos a producir algÚn tipo de respuesta, la mayoría de las veces, en lugar de tener suficiente confianza para decidir que una respuesta vÃĄlida no estÃĄ disponible debido a la falta de informaciÃģn del usuario, o las limitaciones del modelo, o por otras razones.

El artículo establece:

‘[Mostramos] que [los modelos de lenguaje grande] poseen capacidades cognitivas suficientes para reconocer los defectos en estas preguntas. Sin embargo, no exhiben un comportamiento de abstenciÃģn apropiado, lo que revela una falta de alineaciÃģn entre su cogniciÃģn interna y su respuesta externa.’

Los investigadores han desarrollado un enfoque de dos etapas ligero que utiliza la monitorizaciÃģn cognitiva/sondeo para escanear el proceso interno del modelo de lenguaje grande en busca de indicios de que reconoce que no puede suministrar una respuesta; y luego interviene, para asegurarse de que la naturaleza “Útil” del modelo no empeore los problemas del usuario al llevarlo por un camino ciego, o incluso destructivo.

El estudio utiliza preguntas matemÃĄticas intencionalmente subespecificadas para probar si los modelos pueden reconocer cuÃĄndo una respuesta es inalcanzable; pero este diseÃąo corre el riesgo de enmarcar la tarea como un “truco”. En realidad, los modelos enfrentan muchas razones mÃĄs rutinarias para abstenerse en la conversaciÃģn, desde la ambigÞedad en la redacciÃģn, hasta lagunas en el conocimiento del dominio.

El nuevo trabajo se titula Responder lo inexplicable es equivocarse intencionalmente: Analizar y mitigar los fallos de abstenciÃģn en modelos de razonamiento grande, y proviene de cuatro investigadores de todo el Laboratorio Estatal de Tecnología de Software Nueva y el Instituto Nacional de Ciencia de Datos de Salud de la Universidad de Nanjing.

MÃĐtodo

(Dado que no hay rivales apropiados para oponer al enfoque de los autores en las pruebas, y dado que el artículo sigue un formato ligeramente no convencional, así como no indexa sus citas al estÃĄndar habitual, intentaremos adherirnos a ÃĐl lo mejor que podamos.)

En línea con enfoques anteriores, los autores se centraron en presentar a los modelos de lenguaje grande con preguntas matemÃĄticas sin respuesta del conjunto de datos Synthetic Unanswerable Math (SUM) dataset, evaluando cinco familias de modelos: del rango DeepSeek, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; y, del serie Qwen, Qwen3-8B, así como Qwen3-14B.

Los problemas sin respuesta en SUM se crearon eliminando o corrompiendo elementos esenciales de cinco maneras: eliminar informaciÃģn clave; introducir ambigÞedad; imponer condiciones poco realistas; hacer referencia a objetos no relacionados; o eliminar la pregunta por completo.

Posteriormente, se seleccionÃģ una muestra de 1,000 de dichos casos para su anÃĄlisis, con GPT-4o utilizado para generar explicaciones concisas que sirvieran como razones de verdad.

Las respuestas del modelo a preguntas sin respuesta se evaluaron utilizando prompts estandarizados con un presupuesto de 10,000 tokens, durante el cual se observaron tres patrones de comportamiento principales: en el primero, el modelo identificÃģ la pregunta como insoluble y se abstuvo – generalmente respondiendo con una expresiÃģn explícita de incertidumbre; en el segundo, produjo una respuesta completa inventando informaciÃģn faltante, como introducir un cargo de manipulaciÃģn de $9.99 para justificar un resultado final (ver imagen a continuaciÃģn); En el tercero, denominado fijaciÃģn cognitiva, el modelo se quedÃģ atrapado en un bucle de razonamiento extendido, persistiendo con caminos de soluciÃģn invÃĄlidos incluso despuÃĐs de reconocer implícitamente que la pregunta carecía de una respuesta viable:

Resultados de respuesta variables para una pregunta imposible.

Resultados de respuesta variables para una pregunta imposible.

El artículo presenta una tendencia en la que los modelos mÃĄs grandes parecen abstenerse con mÃĄs frecuencia de responder a preguntas sin respuesta, con disminuciones en respuestas inventadas y comportamientos de fijaciÃģn:

Desglose de respuestas del modelo a problemas matemÃĄticos sin respuesta, que muestra la frecuencia relativa de abstenciones correctas, respuestas inventadas y fijaciÃģn cognitiva en diferentes escalas de modelo.

Desglose de respuestas del modelo a problemas matemÃĄticos sin respuesta, que muestra la frecuencia relativa de abstenciones correctas, respuestas inventadas y fijaciÃģn cognitiva en diferentes escalas de modelo.

Sin embargo, este cambio es limitado en escala y deja una parte significativa de casos sin resolver a travÃĐs de la abstenciÃģn correcta, lo que sugiere que el aumento de la capacidad por sí solo no produce necesariamente un comportamiento mÃĄs cauteloso.

Conciencia de estancamiento

Para probar si los modelos de lenguaje pueden detectar cuÃĄndo una pregunta en realidad no tiene respuesta, los investigadores interrumpieron la parte de razonamiento del modelo a mitad de camino y pidieron una respuesta final o una explicaciÃģn de por quÃĐ la pregunta era inexplicable.

Para los casos en los que el modelo siguiÃģ razonando indefinidamente, lo detuvieron en la palabra ‘wait’, y solicitaron una respuesta; para los casos en los que el modelo inventÃģ rÃĄpidamente una respuesta, insertaron una pausa en un límite de pÃĄrrafo.

El grÃĄfico de la izquierda muestra con quÃĐ frecuencia los modelos dan abstenciones correctas cuando se interrumpe su razonamiento, con tasas mÃĄs altas para los casos de fijaciÃģn que para las respuestas inventadas. El grÃĄfico de la derecha muestra que la mayoría de los modelos pueden explicar por quÃĐ una pregunta es inexplicable cuando se les solicita, incluso si sus respuestas finales no reflejan esa comprensiÃģn.

El grÃĄfico de la izquierda muestra con quÃĐ frecuencia los modelos dan abstenciones correctas cuando se interrumpe su razonamiento, con tasas mÃĄs altas para los casos de fijaciÃģn que para las respuestas inventadas. El grÃĄfico de la derecha muestra que la mayoría de los modelos pueden explicar por quÃĐ una pregunta es inexplicable cuando se les solicita, incluso si sus respuestas finales no reflejan esa comprensiÃģn.

En muchos de estos casos, el modelo dio una abstenciÃģn correcta o una explicaciÃģn clara, incluso si había producido una respuesta errÃģnea anteriormente. Los autores sugieren que esto indica que el modelo a menudo reconoce el problema durante su razonamiento, pero no actÚa sobre esa conciencia en su salida final.

Lectura de la mente de un modelo de lenguaje grande

Para probar si los modelos de lenguaje internamente rastrean si una pregunta es respondible, los investigadores entrenaron pequeÃąos clasificadores en las activaciones ocultas del modelo durante el razonamiento, lo que les permitiÃģ comprobar si la distinciÃģn entre preguntas respondibles e inexplicables ya estaba presente en las seÃąales internas del modelo – incluso si no se reflejaba en su salida final.

BasÃĄndose en la idea de que conceptos de alto nivel como veracidad o gÃĐnero pueden estar linealmente incrustados en las activaciones del modelo, se probÃģ la “respondibilidad”* para una representaciÃģn similar.

Se entrenaron clasificadores lineales simples (sondas) en las activaciones ocultas a travÃĐs de diferentes capas del modelo, utilizando salidas de la mecanismo de atenciÃģn multi-cabeza justo antes de la conexiÃģn residual.

Cada sonda se entrenÃģ para distinguir entre preguntas respondibles e inexplicables, basÃĄndose en activaciones internas del proceso de razonamiento. La entrada consistiÃģ en 2,200 pares de preguntas muestreadas del conjunto de datos SUM, con 2,000 utilizadas para el entrenamiento y 200 para validaciÃģn.

En el momento de la inferencia, la predicciÃģn del modelo se promediÃģ a travÃĐs de los tokens vistos hasta ese punto en la secuencia de razonamiento, lo que permitiÃģ a la sonda rastrear cÃģmo surgían las seÃąales de respuesta relacionadas con el tiempo:

PrecisiÃģn de clasificaciÃģn de las sondas lineales entrenadas para distinguir entre preguntas respondibles e inexplicables, medida en diferentes puntos del proceso de razonamiento. La precisiÃģn mejora generalmente a medida que avanza el razonamiento, con modelos mÃĄs grandes alcanzando mÃĄs del 85% en las etapas finales.

PrecisiÃģn de clasificaciÃģn de las sondas lineales entrenadas para distinguir entre preguntas respondibles e inexplicables, medida en diferentes puntos del proceso de razonamiento. La precisiÃģn mejora generalmente a medida que avanza el razonamiento, con modelos mÃĄs grandes alcanzando mÃĄs del 85% en las etapas finales.

Como se muestra arriba, la precisiÃģn de la sonda mejora constantemente a medida que se desarrolla el razonamiento, con la mayoría de los modelos superando el 80% de precisiÃģn de clasificaciÃģn en las etapas finales – lo que sugiere que, incluso cuando el comportamiento externo del modelo no refleja esto, las representaciones internas a menudo llevan una seÃąal de respuesta clara que indica si una pregunta puede ser respondida.

Insistencia obstinada

Aunque los resultados anteriores sugieren que los modelos de lenguaje grande a menudo reconocen cuÃĄndo una pregunta no puede ser respondida, el artículo seÃąala que aÚn tienden a seguir generando una respuesta en lugar de abstenerse.

Para investigar esta falta de alineaciÃģn, los investigadores analizaron la confianza del modelo en abstenerse en puntos específicos durante el proceso de razonamiento, comparando la confianza del modelo en tres categorías de salida: abstenciÃģn correcta; respuesta inventada; y fijaciÃģn cognitiva.

Se utilizaron muestras de igual tamaÃąo para cada categoría, con la confianza definida como la probabilidad media mÃĄxima asignada a cada token de salida a lo largo de los pasos de decodificaciÃģn, basada en una formulaciÃģn de trabajo anterior. Como se muestra en el grÃĄfico a continuaciÃģn, tanto las respuestas inventadas como los casos de fijaciÃģn cognitiva mostraron una confianza de abstenciÃģn mÃĄs baja en comparaciÃģn con la abstenciÃģn correcta:

Niveles de confianza asociados con la producciÃģn de la respuesta de abstenciÃģn 'No lo sÃĐ' en diferentes tipos de respuesta.

Niveles de confianza asociados con la producciÃģn de la respuesta de abstenciÃģn ‘No lo sÃĐ’ en diferentes tipos de respuesta.

Los investigadores tambiÃĐn midieron con quÃĐ frecuencia los modelos producían una respuesta ‘No lo sÃĐ’ durante el proceso de razonamiento. El grÃĄfico a continuaciÃģn indica que los casos de abstenciÃģn correcta produjeron una frecuencia de abstenciÃģn mÃĄs alta, mientras que las otras dos categorías produjeron tales respuestas con menos frecuencia:

La frecuencia de respuestas 'No lo sÃĐ' observadas en los puntos de parada durante el razonamiento, mostrada para diferentes tipos de resultados de respuesta.

La frecuencia de respuestas ‘No lo sÃĐ’ observadas en los puntos de parada durante el razonamiento, mostrada para diferentes tipos de resultados de respuesta.

Estos hallazgos sugieren, segÚn los autores, que aunque los modelos pueden detectar la inexplicabilidad internamente, a menudo carecen de la confianza para actuar sobre esa conciencia, lo que indica una preferencia persistente por completar la tarea en lugar de admitir incertidumbre.

Pruebas

BasÃĄndose en estos hallazgos, los investigadores desarrollaron un mÃĐtodo de dos partes diseÃąado para mejorar la abstenciÃģn. La primera etapa, la monitorizaciÃģn cognitiva, rastrea los estados ocultos del modelo durante la inferencia, segmentando su proceso de razonamiento en unidades naturales como clÃĄusulas o pausas, marcadas por palabras como ‘wait’.

Al final de cada segmento, una sonda lineal ligera entrenada en seÃąales internas vinculadas a la respuesta, estima la probabilidad de que la pregunta no pueda ser respondida. Si esta probabilidad cruza un umbral establecido, el proceso pasa a la segunda etapa: una intervenciÃģn en el momento de la inferencia que dirige al modelo hacia la abstenciÃģn, en lugar de inventar una respuesta.

Cuando el modelo muestra seÃąales internas de que una pregunta no puede ser respondida, el razonamiento se interrumpe con una intervenciÃģn que refuerza esta conciencia y aumenta la probabilidad de abstenciÃģn. Como se muestra a continuaciÃģn, la intervenciÃģn representa una ‘guía de prompt’ que recuerda al modelo que la pregunta puede carecer de una respuesta vÃĄlida:

Un prompt para condicionar la intervenciÃģn en el momento de la inferencia.

Un prompt para condicionar la intervenciÃģn en el momento de la inferencia.

El mÃĐtodo tambiÃĐn incorpora un mecanismo de salida temprana que evita que la secuencia de razonamiento continÚe innecesariamente, alentando al modelo a considerar la abstenciÃģn como una opciÃģn legítima y a veces preferible.

Para una fase de prueba, los investigadores utilizaron dos conjuntos de datos: Unanswerable Math Word Problem (UMWP), y el mencionado anteriormente SUM.

El conjunto de prueba de SUM se utilizÃģ para este propÃģsito, que contiene 284 preguntas sin respuesta y 284 preguntas respondibles verificadas manualmente. UMWP se construyÃģ a partir de cuatro fuentes de problemas de palabras matemÃĄticas: SVAMP; MultiArith; Grade School Math (GSM8K); y ASDiv.

El conjunto de datos completo comprende 5,200 problemas, con 600 muestreados para pruebas, divididos equitativamente entre preguntas sin respuesta y preguntas respondibles. Para los elementos sin respuesta en UMWP, GPT-4o generÃģ las explicaciones de verdad de por quÃĐ no podían ser resueltos.

MÃĐtricas

El rendimiento del modelo se midiÃģ utilizando cuatro mÃĐtricas: tasa de abstenciÃģn, la proporciÃģn de preguntas sin respuesta en las que el modelo se abstiene correctamente respondiendo “No lo sÃĐ”, como se le instruyÃģ; precisiÃģn de razonamiento, el porcentaje de preguntas sin respuesta en las que el modelo da una explicaciÃģn vÃĄlida de por quÃĐ la pregunta no puede ser resuelta; uso de tokens, que detalla la cantidad de tokens generados durante el razonamiento; y precisiÃģn de respuesta, la proporciÃģn de preguntas respondibles en las que el modelo produce la soluciÃģn final correcta.

Pruebas de referencia

Dado que no existen referencias estÃĄndar para este problema, los investigadores compararon su mÃĐtodo con dos alternativas, Dynasor-CoT y Salida temprana dinÃĄmica en modelos de razonamiento (DEER), sobre la suposiciÃģn de que la abstenciÃģn correcta debe tratarse como la respuesta correcta cuando una pregunta no tiene soluciÃģn.

Dynasor-CoT hace que los modelos produzcan respuestas intermedias y se detiene una vez que el mismo resultado aparece tres veces en sucesiÃģn, mientras que DEER monitorea la confianza a nivel de oraciÃģn y detiene el razonamiento una vez que se alcanza un umbral.

Una tercera referencia, llamada Vanilla, se refiere a las salidas del modelo sin modificar. Las pruebas utilizaron las cinco variantes de Qwen y DeepSeek mencionadas anteriormente.

Los resultados agregados se ilustran a continuaciÃģn:

ComparaciÃģn de diferentes mÃĐtodos en preguntas respondibles y sin respuesta en modelos de razonamiento grande, con los valores mÃĄs altos en cada columna en negrita.

ComparaciÃģn de diferentes mÃĐtodos en preguntas respondibles y sin respuesta en modelos de razonamiento grande, con los valores mÃĄs altos en cada columna en negrita. Consulte el artículo original para una mejor resoluciÃģn.

El nuevo enfoque produjo las tasas mÃĄs altas de abstenciÃģn y razonamiento preciso en preguntas sin respuesta. Para las preguntas respondibles, la precisiÃģn permaneciÃģ cerca de la de los modelos vanilla y, a veces, mejorÃģ, lo que sugiere que la resoluciÃģn de problemas normal no se vio perjudicada.

El uso de tokens tambiÃĐn disminuyÃģ en un 30% a 50% en los casos sin respuesta y disminuyÃģ ligeramente en los casos respondibles, lo que indica una mayor eficiencia.

TambiÃĐn se encontrÃģ una relaciÃģn entre la tasa de abstenciÃģn y la precisiÃģn de razonamiento, ya que los modelos que se abstuvieron con mÃĄs frecuencia tambiÃĐn dieron mejores explicaciones, lo que los autores interpretan como una mejora en la calidad del razonamiento.

Los modelos Qwen3 generalmente superaron a las versiones de distilaciÃģn (cuantificadas), mientras que los modelos mÃĄs grandes mostraron una mayor capacidad de abstenciÃģn, lo que indica que tanto la arquitectura como la escala son importantes para la detecciÃģn confiable de inexplicabilidad.

Finalmente, los autores informan que su nuevo mÃĐtodo reduce las respuestas inventadas y la fijaciÃģn mientras aumenta la tasa de abstenciones correctas, mientras que los enfoques de referencia que dependen solo de ‘salidas tempranas’ a veces conducen a mÃĄs respuestas inventadas.

TambiÃĐn informan ganancias en la confianza y la frecuencia de respuestas “No lo sÃĐ”, con el monitoreo basado en seÃąales latentes que resulta mÃĄs efectivo que las estrategias que dependen de seÃąales de comportamiento.

ConclusiÃģn

La incapacidad de los modelos de lenguaje grande para abstenerse de responder a una consulta cuando es necesario es uno de los principales puntos de fricciÃģn en la experiencia del usuario de la inteligencia artificial generativa, no solo porque otros caprichos de la interfaz dan al usuario la ilusiÃģn de que el modelo de lenguaje es capaz de respuestas circunspectas, cuando – al menos por ahora – generalmente no es así.

Una preocupaciÃģn sobre cualquier tipo de intervenciÃģn directa que no proceda directamente del ‘carÃĄcter’ del modelo es que puede ser sobreutilizada o subutilizada, dependiendo de si las activaciones detectadas son en realidad relevantes para que el modelo admita la derrota.

AdemÃĄs, el costo logístico del monitoreo de la sonda lineal no es probable que sea insignificante, y es posible que los mÃĐtodos heurísticos mÃĄs simples, similares a los que controlan el contenido prohibido para los usuarios, puedan ser una soluciÃģn mÃĄs asequible, si los disparadores de ancla pueden definirse adecuadamente.

 

* Naturalmente, esto no se ajusta al sinÃģnimo aparente ‘rendiciÃģn de cuentas’, sino que define si una pregunta en particular puede ser respondida en absoluto.

Publicado por primera vez el miÃĐrcoles 27 de agosto de 2025

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]