Ãngulo de Anderson
ÂŋPor quÃĐ los modelos de lenguaje no pueden admitir que no conocen la respuesta?

Los modelos de lenguaje grande a menudo dan respuestas confiadas incluso cuando la pregunta no puede ser respondida. Una nueva investigaciÃģn muestra que estos modelos a menudo reconocen el problema internamente, pero aÚn asà siguen adelante y se inventan algo, lo que expone una brecha oculta entre lo que saben y lo que dicen.
Â
Cualquiera que haya pasado un tiempo razonable con un modelo de lenguaje grande lÃder como ChatGPT o Qwen habrÃĄ experimentado ocasiones en las que el modelo proporciona una respuesta incorrecta (que puede o no haber tenido consecuencias catastrÃģficas locales, dependiendo de cuÃĄnto se haya confiado en ÃĐl) â y, cuando el error se hizo evidente, simplemente emitiÃģ una disculpa.
ÂŋPor quÃĐ los modelos de lenguaje grande tienen tantas dificultades para admitir que no conocen la respuesta a una pregunta es un ÃĄrea de estudio pequeÃąa pero en crecimiento. Una respuesta âconfidentemente incorrectaâ puede ser particularmente daÃąina desde una interfaz basada en API altamente censurada y filtrada como ChatGPT, porque dichos modelos bloquean agresivamente la entrada o salida de contenido NSFW o âque viola las reglasâ.
Esto puede dar al usuario una falsa impresiÃģn de que el modelo es decisivo y cardinal, cuando en realidad la negativa provino de un heuristic o filtro basado en blocklist tradicional diseÃąado para limitar la exposiciÃģn legal de la empresa anfitriona a cualquier precio, y no de ninguna intuiciÃģn del modelo de lenguaje.

Del artÃculo de junio de 2025 âAbstentionBenchâ de FAIR en Meta â a la izquierda, la figura destaca el rango de tipos de fallas capturadas en AbstentionBench, que prueba el comportamiento del modelo en mÃĄs de 35,000 preguntas sin respuesta; en el medio, un ejemplo muestra cÃģmo los modelos a menudo responden con respuestas inventadas en lugar de admitir que carecen de suficiente informaciÃģn; y a la derecha, la abstenciÃģn de recuerdo disminuye cuando los modelos se ajustan para el razonamiento en lugar de seguir instrucciones. Fuente: https://arxiv.org/pdf/2506.09038
Un nuevo artÃculo de China sostiene que los modelos de lenguaje grande en realidad reconocen secretamente que no pueden responder a una pregunta planteada por el usuario, pero que, sin embargo, se sienten compelidos a producir algÚn tipo de respuesta, la mayorÃa de las veces, en lugar de tener suficiente confianza para decidir que una respuesta vÃĄlida no estÃĄ disponible debido a la falta de informaciÃģn del usuario, o las limitaciones del modelo, o por otras razones.
El artÃculo establece:
â[Mostramos] que [los modelos de lenguaje grande] poseen capacidades cognitivas suficientes para reconocer los defectos en estas preguntas. Sin embargo, no exhiben un comportamiento de abstenciÃģn apropiado, lo que revela una falta de alineaciÃģn entre su cogniciÃģn interna y su respuesta externa.â
Los investigadores han desarrollado un enfoque de dos etapas ligero que utiliza la monitorizaciÃģn cognitiva/sondeo para escanear el proceso interno del modelo de lenguaje grande en busca de indicios de que reconoce que no puede suministrar una respuesta; y luego interviene, para asegurarse de que la naturaleza âÚtilâ del modelo no empeore los problemas del usuario al llevarlo por un camino ciego, o incluso destructivo.
El estudio utiliza preguntas matemÃĄticas intencionalmente subespecificadas para probar si los modelos pueden reconocer cuÃĄndo una respuesta es inalcanzable; pero este diseÃąo corre el riesgo de enmarcar la tarea como un âtrucoâ. En realidad, los modelos enfrentan muchas razones mÃĄs rutinarias para abstenerse en la conversaciÃģn, desde la ambigÞedad en la redacciÃģn, hasta lagunas en el conocimiento del dominio.
El nuevo trabajo se titula Responder lo inexplicable es equivocarse intencionalmente: Analizar y mitigar los fallos de abstenciÃģn en modelos de razonamiento grande, y proviene de cuatro investigadores de todo el Laboratorio Estatal de TecnologÃa de Software Nueva y el Instituto Nacional de Ciencia de Datos de Salud de la Universidad de Nanjing.
MÃĐtodo
(Dado que no hay rivales apropiados para oponer al enfoque de los autores en las pruebas, y dado que el artÃculo sigue un formato ligeramente no convencional, asà como no indexa sus citas al estÃĄndar habitual, intentaremos adherirnos a ÃĐl lo mejor que podamos.)
En lÃnea con enfoques anteriores, los autores se centraron en presentar a los modelos de lenguaje grande con preguntas matemÃĄticas sin respuesta del conjunto de datos Synthetic Unanswerable Math (SUM) dataset, evaluando cinco familias de modelos: del rango DeepSeek, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; y, del serie Qwen, Qwen3-8B, asà como Qwen3-14B.
Los problemas sin respuesta en SUM se crearon eliminando o corrompiendo elementos esenciales de cinco maneras: eliminar informaciÃģn clave; introducir ambigÞedad; imponer condiciones poco realistas; hacer referencia a objetos no relacionados; o eliminar la pregunta por completo.
Posteriormente, se seleccionÃģ una muestra de 1,000 de dichos casos para su anÃĄlisis, con GPT-4o utilizado para generar explicaciones concisas que sirvieran como razones de verdad.
Las respuestas del modelo a preguntas sin respuesta se evaluaron utilizando prompts estandarizados con un presupuesto de 10,000 tokens, durante el cual se observaron tres patrones de comportamiento principales: en el primero, el modelo identificÃģ la pregunta como insoluble y se abstuvo â generalmente respondiendo con una expresiÃģn explÃcita de incertidumbre; en el segundo, produjo una respuesta completa inventando informaciÃģn faltante, como introducir un cargo de manipulaciÃģn de $9.99 para justificar un resultado final (ver imagen a continuaciÃģn); En el tercero, denominado fijaciÃģn cognitiva, el modelo se quedÃģ atrapado en un bucle de razonamiento extendido, persistiendo con caminos de soluciÃģn invÃĄlidos incluso despuÃĐs de reconocer implÃcitamente que la pregunta carecÃa de una respuesta viable:

Resultados de respuesta variables para una pregunta imposible.
El artÃculo presenta una tendencia en la que los modelos mÃĄs grandes parecen abstenerse con mÃĄs frecuencia de responder a preguntas sin respuesta, con disminuciones en respuestas inventadas y comportamientos de fijaciÃģn:

Desglose de respuestas del modelo a problemas matemÃĄticos sin respuesta, que muestra la frecuencia relativa de abstenciones correctas, respuestas inventadas y fijaciÃģn cognitiva en diferentes escalas de modelo.
Sin embargo, este cambio es limitado en escala y deja una parte significativa de casos sin resolver a travÃĐs de la abstenciÃģn correcta, lo que sugiere que el aumento de la capacidad por sà solo no produce necesariamente un comportamiento mÃĄs cauteloso.
Conciencia de estancamiento
Para probar si los modelos de lenguaje pueden detectar cuÃĄndo una pregunta en realidad no tiene respuesta, los investigadores interrumpieron la parte de razonamiento del modelo a mitad de camino y pidieron una respuesta final o una explicaciÃģn de por quÃĐ la pregunta era inexplicable.
Para los casos en los que el modelo siguiÃģ razonando indefinidamente, lo detuvieron en la palabra âwaitâ, y solicitaron una respuesta; para los casos en los que el modelo inventÃģ rÃĄpidamente una respuesta, insertaron una pausa en un lÃmite de pÃĄrrafo.

El grÃĄfico de la izquierda muestra con quÃĐ frecuencia los modelos dan abstenciones correctas cuando se interrumpe su razonamiento, con tasas mÃĄs altas para los casos de fijaciÃģn que para las respuestas inventadas. El grÃĄfico de la derecha muestra que la mayorÃa de los modelos pueden explicar por quÃĐ una pregunta es inexplicable cuando se les solicita, incluso si sus respuestas finales no reflejan esa comprensiÃģn.
En muchos de estos casos, el modelo dio una abstenciÃģn correcta o una explicaciÃģn clara, incluso si habÃa producido una respuesta errÃģnea anteriormente. Los autores sugieren que esto indica que el modelo a menudo reconoce el problema durante su razonamiento, pero no actÚa sobre esa conciencia en su salida final.
Lectura de la mente de un modelo de lenguaje grande
Para probar si los modelos de lenguaje internamente rastrean si una pregunta es respondible, los investigadores entrenaron pequeÃąos clasificadores en las activaciones ocultas del modelo durante el razonamiento, lo que les permitiÃģ comprobar si la distinciÃģn entre preguntas respondibles e inexplicables ya estaba presente en las seÃąales internas del modelo â incluso si no se reflejaba en su salida final.
BasÃĄndose en la idea de que conceptos de alto nivel como veracidad o gÃĐnero pueden estar linealmente incrustados en las activaciones del modelo, se probÃģ la ârespondibilidadâ* para una representaciÃģn similar.
Se entrenaron clasificadores lineales simples (sondas) en las activaciones ocultas a travÃĐs de diferentes capas del modelo, utilizando salidas de la mecanismo de atenciÃģn multi-cabeza justo antes de la conexiÃģn residual.
Cada sonda se entrenÃģ para distinguir entre preguntas respondibles e inexplicables, basÃĄndose en activaciones internas del proceso de razonamiento. La entrada consistiÃģ en 2,200 pares de preguntas muestreadas del conjunto de datos SUM, con 2,000 utilizadas para el entrenamiento y 200 para validaciÃģn.
En el momento de la inferencia, la predicciÃģn del modelo se promediÃģ a travÃĐs de los tokens vistos hasta ese punto en la secuencia de razonamiento, lo que permitiÃģ a la sonda rastrear cÃģmo surgÃan las seÃąales de respuesta relacionadas con el tiempo:

PrecisiÃģn de clasificaciÃģn de las sondas lineales entrenadas para distinguir entre preguntas respondibles e inexplicables, medida en diferentes puntos del proceso de razonamiento. La precisiÃģn mejora generalmente a medida que avanza el razonamiento, con modelos mÃĄs grandes alcanzando mÃĄs del 85% en las etapas finales.
Como se muestra arriba, la precisiÃģn de la sonda mejora constantemente a medida que se desarrolla el razonamiento, con la mayorÃa de los modelos superando el 80% de precisiÃģn de clasificaciÃģn en las etapas finales â lo que sugiere que, incluso cuando el comportamiento externo del modelo no refleja esto, las representaciones internas a menudo llevan una seÃąal de respuesta clara que indica si una pregunta puede ser respondida.
Insistencia obstinada
Aunque los resultados anteriores sugieren que los modelos de lenguaje grande a menudo reconocen cuÃĄndo una pregunta no puede ser respondida, el artÃculo seÃąala que aÚn tienden a seguir generando una respuesta en lugar de abstenerse.
Para investigar esta falta de alineaciÃģn, los investigadores analizaron la confianza del modelo en abstenerse en puntos especÃficos durante el proceso de razonamiento, comparando la confianza del modelo en tres categorÃas de salida: abstenciÃģn correcta; respuesta inventada; y fijaciÃģn cognitiva.
Se utilizaron muestras de igual tamaÃąo para cada categorÃa, con la confianza definida como la probabilidad media mÃĄxima asignada a cada token de salida a lo largo de los pasos de decodificaciÃģn, basada en una formulaciÃģn de trabajo anterior. Como se muestra en el grÃĄfico a continuaciÃģn, tanto las respuestas inventadas como los casos de fijaciÃģn cognitiva mostraron una confianza de abstenciÃģn mÃĄs baja en comparaciÃģn con la abstenciÃģn correcta:

Niveles de confianza asociados con la producciÃģn de la respuesta de abstenciÃģn âNo lo sÃĐâ en diferentes tipos de respuesta.
Los investigadores tambiÃĐn midieron con quÃĐ frecuencia los modelos producÃan una respuesta âNo lo sÃĐâ durante el proceso de razonamiento. El grÃĄfico a continuaciÃģn indica que los casos de abstenciÃģn correcta produjeron una frecuencia de abstenciÃģn mÃĄs alta, mientras que las otras dos categorÃas produjeron tales respuestas con menos frecuencia:

La frecuencia de respuestas âNo lo sÃĐâ observadas en los puntos de parada durante el razonamiento, mostrada para diferentes tipos de resultados de respuesta.
Estos hallazgos sugieren, segÚn los autores, que aunque los modelos pueden detectar la inexplicabilidad internamente, a menudo carecen de la confianza para actuar sobre esa conciencia, lo que indica una preferencia persistente por completar la tarea en lugar de admitir incertidumbre.
Pruebas
BasÃĄndose en estos hallazgos, los investigadores desarrollaron un mÃĐtodo de dos partes diseÃąado para mejorar la abstenciÃģn. La primera etapa, la monitorizaciÃģn cognitiva, rastrea los estados ocultos del modelo durante la inferencia, segmentando su proceso de razonamiento en unidades naturales como clÃĄusulas o pausas, marcadas por palabras como âwaitâ.
Al final de cada segmento, una sonda lineal ligera entrenada en seÃąales internas vinculadas a la respuesta, estima la probabilidad de que la pregunta no pueda ser respondida. Si esta probabilidad cruza un umbral establecido, el proceso pasa a la segunda etapa: una intervenciÃģn en el momento de la inferencia que dirige al modelo hacia la abstenciÃģn, en lugar de inventar una respuesta.
Cuando el modelo muestra seÃąales internas de que una pregunta no puede ser respondida, el razonamiento se interrumpe con una intervenciÃģn que refuerza esta conciencia y aumenta la probabilidad de abstenciÃģn. Como se muestra a continuaciÃģn, la intervenciÃģn representa una âguÃa de promptâ que recuerda al modelo que la pregunta puede carecer de una respuesta vÃĄlida:

Un prompt para condicionar la intervenciÃģn en el momento de la inferencia.
El mÃĐtodo tambiÃĐn incorpora un mecanismo de salida temprana que evita que la secuencia de razonamiento continÚe innecesariamente, alentando al modelo a considerar la abstenciÃģn como una opciÃģn legÃtima y a veces preferible.
Para una fase de prueba, los investigadores utilizaron dos conjuntos de datos: Unanswerable Math Word Problem (UMWP), y el mencionado anteriormente SUM.
El conjunto de prueba de SUM se utilizÃģ para este propÃģsito, que contiene 284 preguntas sin respuesta y 284 preguntas respondibles verificadas manualmente. UMWP se construyÃģ a partir de cuatro fuentes de problemas de palabras matemÃĄticas: SVAMP; MultiArith; Grade School Math (GSM8K); y ASDiv.
El conjunto de datos completo comprende 5,200 problemas, con 600 muestreados para pruebas, divididos equitativamente entre preguntas sin respuesta y preguntas respondibles. Para los elementos sin respuesta en UMWP, GPT-4o generÃģ las explicaciones de verdad de por quÃĐ no podÃan ser resueltos.
MÃĐtricas
El rendimiento del modelo se midiÃģ utilizando cuatro mÃĐtricas: tasa de abstenciÃģn, la proporciÃģn de preguntas sin respuesta en las que el modelo se abstiene correctamente respondiendo âNo lo sÃĐâ, como se le instruyÃģ; precisiÃģn de razonamiento, el porcentaje de preguntas sin respuesta en las que el modelo da una explicaciÃģn vÃĄlida de por quÃĐ la pregunta no puede ser resuelta; uso de tokens, que detalla la cantidad de tokens generados durante el razonamiento; y precisiÃģn de respuesta, la proporciÃģn de preguntas respondibles en las que el modelo produce la soluciÃģn final correcta.
Pruebas de referencia
Dado que no existen referencias estÃĄndar para este problema, los investigadores compararon su mÃĐtodo con dos alternativas, Dynasor-CoT y Salida temprana dinÃĄmica en modelos de razonamiento (DEER), sobre la suposiciÃģn de que la abstenciÃģn correcta debe tratarse como la respuesta correcta cuando una pregunta no tiene soluciÃģn.
Dynasor-CoT hace que los modelos produzcan respuestas intermedias y se detiene una vez que el mismo resultado aparece tres veces en sucesiÃģn, mientras que DEER monitorea la confianza a nivel de oraciÃģn y detiene el razonamiento una vez que se alcanza un umbral.
Una tercera referencia, llamada Vanilla, se refiere a las salidas del modelo sin modificar. Las pruebas utilizaron las cinco variantes de Qwen y DeepSeek mencionadas anteriormente.
Los resultados agregados se ilustran a continuaciÃģn:

ComparaciÃģn de diferentes mÃĐtodos en preguntas respondibles y sin respuesta en modelos de razonamiento grande, con los valores mÃĄs altos en cada columna en negrita. Consulte el artÃculo original para una mejor resoluciÃģn.
El nuevo enfoque produjo las tasas mÃĄs altas de abstenciÃģn y razonamiento preciso en preguntas sin respuesta. Para las preguntas respondibles, la precisiÃģn permaneciÃģ cerca de la de los modelos vanilla y, a veces, mejorÃģ, lo que sugiere que la resoluciÃģn de problemas normal no se vio perjudicada.
El uso de tokens tambiÃĐn disminuyÃģ en un 30% a 50% en los casos sin respuesta y disminuyÃģ ligeramente en los casos respondibles, lo que indica una mayor eficiencia.
TambiÃĐn se encontrÃģ una relaciÃģn entre la tasa de abstenciÃģn y la precisiÃģn de razonamiento, ya que los modelos que se abstuvieron con mÃĄs frecuencia tambiÃĐn dieron mejores explicaciones, lo que los autores interpretan como una mejora en la calidad del razonamiento.
Los modelos Qwen3 generalmente superaron a las versiones de distilaciÃģn (cuantificadas), mientras que los modelos mÃĄs grandes mostraron una mayor capacidad de abstenciÃģn, lo que indica que tanto la arquitectura como la escala son importantes para la detecciÃģn confiable de inexplicabilidad.
Finalmente, los autores informan que su nuevo mÃĐtodo reduce las respuestas inventadas y la fijaciÃģn mientras aumenta la tasa de abstenciones correctas, mientras que los enfoques de referencia que dependen solo de âsalidas tempranasâ a veces conducen a mÃĄs respuestas inventadas.
TambiÃĐn informan ganancias en la confianza y la frecuencia de respuestas âNo lo sÃĐâ, con el monitoreo basado en seÃąales latentes que resulta mÃĄs efectivo que las estrategias que dependen de seÃąales de comportamiento.
ConclusiÃģn
La incapacidad de los modelos de lenguaje grande para abstenerse de responder a una consulta cuando es necesario es uno de los principales puntos de fricciÃģn en la experiencia del usuario de la inteligencia artificial generativa, no solo porque otros caprichos de la interfaz dan al usuario la ilusiÃģn de que el modelo de lenguaje es capaz de respuestas circunspectas, cuando â al menos por ahora â generalmente no es asÃ.
Una preocupaciÃģn sobre cualquier tipo de intervenciÃģn directa que no proceda directamente del âcarÃĄcterâ del modelo es que puede ser sobreutilizada o subutilizada, dependiendo de si las activaciones detectadas son en realidad relevantes para que el modelo admita la derrota.
AdemÃĄs, el costo logÃstico del monitoreo de la sonda lineal no es probable que sea insignificante, y es posible que los mÃĐtodos heurÃsticos mÃĄs simples, similares a los que controlan el contenido prohibido para los usuarios, puedan ser una soluciÃģn mÃĄs asequible, si los disparadores de ancla pueden definirse adecuadamente.
Â
* Naturalmente, esto no se ajusta al sinÃģnimo aparente ârendiciÃģn de cuentasâ, sino que define si una pregunta en particular puede ser respondida en absoluto.
Publicado por primera vez el miÃĐrcoles 27 de agosto de 2025












