Ángulo de Anderson

Dar a los Modelos de Lenguaje una ‘Perilla de Verdad’

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Verdadero o charlatán: elige uno. Un nuevo método de entrenamiento permite a los usuarios decir a los chatbots de IA exactamente cuán ‘fácticos’ deben ser, convirtiendo la precisión en una perilla que se puede subir o bajar.

 

Una nueva colaboración de investigación entre EE. UU. y China ofrece algo que casi todos los usuarios de chatbots de IA apreciarían: un ‘botón’ virtual que le dice al bot si debe ser ‘locuaz’ o ‘veraz’

El sistema fue creado mediante el ajuste fino de un modelo Mistral-7B en datos sintéticos, para que el esquema de una ‘escala de verdad’ pudiera ser impreso en el modelo. Después de esta revisión, el modelo Mistral puede controlar la cantidad de hechos en una respuesta; cuanto mayor sea el valor de ‘verdad’ dado por el usuario, menos (pero más seguros) será la respuesta.

En ajustes más bajos, la respuesta del chatbot se convierte en lo que los autores del artículo llaman ‘informativa’, es decir, dará una respuesta más larga y contendrá más hechos; pero algunos de los hechos pueden ser alucinados.

Los datos sintéticos en los que se entrenó el sistema utilizaron Wikipedia como referencia para un dominio de prueba: hechos biográficos reales sobre personas. Ya sea que se considere que Wikipedia debe ser una fuente autorizada o no, el valor del trabajo radica en diseñar cualquier tipo de sistema que pueda limitar la tendencia natural de los LLM a dar respuestas, incluso cuando no tienen respuestas que dar.

Un ejemplo del proyecto FactScore que alimentó la curación del conjunto de datos para el artículo que estamos revisando aquí, utilizando Wikipedia como autoridad de referencia para detalles biográficos. Fuente - https://aclanthology.org/2023.emnlp-main.741.pdf

Un ejemplo del proyecto FactScore que alimentó la curación del conjunto de datos para el artículo que estamos revisando aquí, utilizando Wikipedia como autoridad de referencia para detalles biográficos. Fuente

Los autores observan que los contextos de alta confianza, como los dominios médicos y legales, requieren salidas fácticas conservadoras y confiables, mientras que muchos otros tipos de usuarios requieren un tipo de salida más flexible y creativo, interpretativo (es decir, escritura discursiva y análisis académico, entre otros).

Observan*:

‘[Los actuales] LLM ofrecen ningún mecanismo incorporado para controlar este compromiso.

‘Mientras que los usuarios pueden intentar guiar el comportamiento del modelo con instrucciones como “sea más factual”, encontramos que los modelos de vanguardia no ajustan de manera fiable sus salidas en respuesta a dichas instrucciones en esta tarea.

‘En FactScore, encontramos que los modelos fuera de la caja a menudo no satisfacen incluso objetivos moderados a estrictos. Esta brecha motiva una alternativa controlable que permite a los usuarios solicitar un nivel de factualidad específico y que el modelo ajuste sus respuestas en consecuencia.’

Los Hechos

Para entender el artículo y las soluciones que ofrece, es necesario revisar la propia definición de ‘informatividad’. Los autores afirman que la cuantificación de una respuesta informativa equivale a ‘la cantidad de contenido respaldado en la salida, medido como el número de declaraciones atómicas validadas, normalizado por la longitud de la salida’.

En otra parte del artículo se afirma de manera más simple que la informatividad es ‘el número total de hechos atómicos en la salida, ya sean correctos o no’.

Además, los investigadores observan que la tendencia de los LLM a oscilar entre la precisión fáctica y las conjeturas subjetivas es un rasgo muy humano, y uno documentado por diversos estudios científicos*:

‘[El conocimiento de los LLM] es desigualmente confiable: algunas declaraciones están fuertemente respaldadas, mientras que otras son especulativas, desactualizadas o inciertas. La generación requiere decidir cuánto decir y cuán cautelosamente decirlo, creando una tensión entre la precisión fáctica y la informatividad.

‘Los humanos toman decisiones análogas: comienzan con hechos de alta confiabilidad y agregan detalles de menor certeza sólo cuando se les pide.’

Aunque los experimentos se realizaron solo en el modelo Mistral de tamaño medio, los principios aplicados deberían funcionar a diferentes escalas y plataformas, ya que implican una nueva cuantificación de datos, como una adición al esquema interno de un LLM; y una enmienda de este tipo no es específica de la arquitectura.

El nuevo artículo se titula Verdad a pedido: controlando el compromiso entre factualidad e informatividad en la generación de texto, y proviene de siete investigadores de la Universidad de Columbia, la Universidad de Nueva York y la Universidad de Nueva York en Shanghai.

Método y Datos

El nuevo enfoque presentado en el artículo se denomina Generación controlada por factualidad (FCG), e introduce un dial virtual que permite a los usuarios especificar cuán precisa quiere que sea la respuesta de un chatbot. ‘En esencia,’ el artículo afirma, ‘FCG mejora el modelo con un “botón” controlable para la factualidad’.

El modelo toma tanto la pregunta del usuario como el nivel de factualidad deseado, y luego genera una respuesta que incluye solo la información que considera lo suficientemente confiable, mientras intenta ser lo más detallada posible dentro de esa restricción de confianza.

Utilizando el sistema FactScore (arriba vinculado), la salida segmentada de consultas de muestra se evalúa para la precisión, una calidad definida como adhesión a la factualidad:

Tubería de datos de entrenamiento para FCG: un modelo de lenguaje genera una respuesta inicial, la divide en hechos atómicos, los clasifica por confianza y descarta los menos confiables hasta que se alcanza el nivel de verdad deseado. Fuente - https://arxiv.org/pdf/2602.00848

Tubería de datos de entrenamiento para FCG: un modelo de lenguaje genera una respuesta inicial, la divide en hechos atómicos, los clasifica por confianza y descarta los menos confiables hasta que se alcanza el nivel de verdad deseado. Fuente

Como no existía un conjunto de datos que coincidiera con los requisitos de FCG, los autores crearon uno sintético haciendo que el modelo de lenguaje GPT-4 generara primero una respuesta sin restricciones, y luego eliminara los ‘hechos de menor confianza’, hasta que la respuesta cumpliera con un nivel de precisión determinado.

El trabajo previo sugirió que entrenar solo con datos de verdad podría hacer que los modelos sean menos fácticos, al desanimarlos a ofrecer cualquier detalle adicional. Por lo tanto, los ejemplos de entrenamiento de FCG se editaron mínimamente, preservando la propia redacción y ritmo del modelo, mientras se reducía solo lo suficiente para cumplir con el objetivo de confianza requerido.

Al aplicar este proceso de edición en una variedad de niveles de confianza objetivo, desde el 10% hasta un umbral estricto del 100%, se creó un conjunto de datos sintético en el que cada pregunta se emparejó con múltiples respuestas filtradas.

En cada versión, solo se conservaron los hechos que el modelo juzgó lo suficientemente confiables para cumplir con el nivel de factualidad solicitado; estos ejemplos se utilizaron como datos de entrenamiento para el ajuste fino supervisado.

El conjunto de datos final consistió en 3,302 triples (pregunta, control, respuesta) para el entrenamiento, y 396 para validación, construidos a partir de 500 entidades divididas en 450 para el entrenamiento y 50 para el desarrollo. Se utilizaron 183 entidades distintas para las pruebas.

Entrenamiento y Pruebas

Los autores ajustaron finamente el modelo Mistral-7B-Instruct-v0.2 LLM a diferentes tasas de aprendizaje (3e-6, 1e-5, 3e-5) para llegar a la tasa óptima (no especificada) LR, durante 30 épocas, con un tamaño de lote de 256 (n.b. no se especifica el hardware de entrenamiento).

FCG se probó contra dos líneas base. La primera fue Sin control de factualidad (NFC), donde el modelo se promovió simplemente con una solicitud como Di una biografía de X, sin mencionar la precisión o la confianza. Esta versión refleja el comportamiento predeterminado de un LLM, sin ningún mecanismo para filtrar o restringir.

El segundo método, llamado Inferencia controlada por factualidad (FCI), utilizó las mismas instrucciones de nivel de confianza sin ajuste fino. Por ejemplo, el modelo podría haber sido promovido con ‘Salida de información que consideres 90% confiable’. En este caso, la instrucción se asemejaba a las utilizadas en el entrenamiento, pero el modelo no había tenido una exposición previa a tales restricciones:

Comparación de los tres enfoques probados: la línea base sin control; una versión que utiliza instrucciones de factualidad sin entrenamiento; y el modelo ajustado que aprendió a seguir la configuración de precisión a través de la exposición a datos filtrados.

Comparación de los tres enfoques probados: la línea base sin control; una versión que utiliza instrucciones de factualidad sin entrenamiento; y el modelo ajustado que aprendió a seguir la configuración de precisión a través de la exposición a datos filtrados.

Inicialmente se realizó una prueba para adhesión a la factualidad:

Rendimiento en tres niveles de confianza objetivo. Solo el modelo ajustado fue capaz de producir salidas completamente fácticas, y superó a ambas líneas base en todos los aspectos, particularmente en los umbrales más altos.

Rendimiento en tres niveles de confianza objetivo. Solo el modelo ajustado fue capaz de producir salidas completamente fácticas, y superó a ambas líneas base en todos los aspectos, particularmente en los umbrales más altos.

Cuando se probó contra umbrales de factualidad del 80%, 90% y 100%, solo el modelo ajustado fue capaz de cumplir consistentemente con los objetivos. Sorprendentemente, simplemente agregar instrucciones de confianza, sin entrenar al modelo para que siga esas instrucciones, no ayudó. En algunos casos, empeoró las cosas; por ejemplo, solo el 3,8% de las salidas del modelo con instrucciones cumplieron con el umbral del 90%, en comparación con el 5,5% de la versión sin instrucción:

Esto sugiere, afirman los autores, que el modelo base Mistral-7B no pudo interpretar instrucciones como ‘sea 90% confiable’ de manera útil, y que la instrucción adicional podría haber interrumpido su salida habitual.

Por el contrario, el modelo ajustado respondió de manera fiable a las señales de control, produciendo el 18,7% de salidas compatibles al 80%, el 12,6% al 90% y el 23,6% al 100%; y demostró ser el único método capaz de generar salidas completamente fácticas:

‘Estas mejoras indican que la capacidad de controlar la factualidad indeed puede ser inculcada a través del entrenamiento supervisado. El modelo FCG ha aprendido a ajustar su contenido y solo incluir hechos en los que tiene suficiente confianza, mientras que el modelo fuera de la caja no podía utilizar de manera efectiva la señal de control por sí solo.’

En una prueba separada diseñada para confirmar que el modelo había aprendido a interpretar la señal de control, los investigadores comprobaron si la factualidad promedio de las respuestas aumentaba a medida que se solicitaban ajustes de verdad más altos.

No surgió tal patrón antes del entrenamiento, pero después, los resultados revelaron una tendencia ascendente constante, con ajustes de confianza más altos que producían respuestas más precisas:

A medida que aumentaba el ajuste de verdad objetivo, el modelo ajustado produjo salidas cada vez más fácticas en respuesta, mientras que los modelos base demostraron ningún cambio consistente en el mismo rango.

A medida que aumentaba el ajuste de verdad objetivo, el modelo ajustado produjo salidas cada vez más fácticas en respuesta, mientras que los modelos base demostraron ningún cambio consistente en el mismo rango.

El compromiso entre verdad y ‘riqueza’ también se examinó. Las salidas se calificaron no solo por precisión, sino también por cuánta información verificada se conservó bajo requisitos de factualidad cada vez más estrictos. Como se muestra en el gráfico a continuación, el modelo FCG se encontró que superó a ambas líneas base y al modelo no restringido en la mayoría de los niveles:

Un gráfico que representa el compromiso entre factualidad e informatividad en los tres métodos. El modelo ajustado se encontró que ofreció un mejor equilibrio entre verdad y detalle que cualquiera de las líneas base. En niveles de precisión comparables, se conservó más contenido fáctico, y en la configuración más alta, permaneció como el único método capaz de producir respuestas completamente verificadas que no estaban vacías.

Un gráfico que representa el compromiso entre factualidad e informatividad en los tres métodos. El modelo ajustado se encontró que ofreció un mejor equilibrio entre verdad y detalle que cualquiera de las líneas base. En niveles de precisión comparables, se conservó más contenido fáctico, y en la configuración más alta, permaneció como el único método capaz de producir respuestas completamente verificadas que no estaban vacías.

En un umbral de precisión del 90%, se conservaron más hechos en FCG que en cualquier otro método, y en todo el rango de configuraciones de confianza, ninguna línea base produjo resultados consistentemente mejores.

La diferencia fue más notable en la configuración más estricta, donde FCG continuó produciendo una informatividad no cero, mientras que la línea base con instrucciones solas se vio obligada a eliminar todo. En esos casos, incluso una sola afirmación de baja confianza hizo que toda la respuesta se descartara.

Por el contrario, el modelo ajustado pudo remodelar su salida para conservar solo los hechos que consideraba completamente confiables, evitando el colapso en el silencio que afectó a los demás.

La factualidad se limitó directamente por la configuración de control, mientras que la informatividad se optimizó permitiendo que el modelo incluyera la mayor cantidad de contenido confiable posible. En configuraciones más altas, solo se conservaron las afirmaciones verificables; en las más bajas, se permitieron detalles más especulativos, aumentando la longitud pero reduciendo la precisión.

Los autores concluyen:

‘[Cuando] una restricción de alta factualidad está en su lugar, el modelo prioriza las declaraciones verificables fácticamente mientras aún incluye tanta información relevante como sea posible. Por el contrario, el modelo tiene la libertad de incorporar una gama más amplia de detalles, incluidos algunos que son menos verificables o más especulativos, lo que resulta en una mayor informatividad (más hechos mencionados) a costa de alguna precisión.

‘Este comportamiento se alinea con nuestro diseño de los datos de entrenamiento: porque siempre eliminamos los hechos menos necesarios, el modelo aprendió “si debes ser x% fáctico, descarta los detalles menos seguros pero conserva todo lo demás.” ‘

El artículo termina con la esperanza de que la nueva metodología se intente con modelos de mayor escala y se aplique a tareas más complejas, entre otras posibles extensiones del trabajo.

Conclusión

La solución ofrecida aquí aborda uno de los errores más graves y frecuentemente observados de incluso la última generación de Modelos de Lenguaje Grande – su tendencia a favorecer la locuacidad sobre la precisión, aparentemente solo para ‘mantener la conversación’, y para presentar confiadamente información desactualizada o completamente alucinada como fáctica.

Para los usuarios de ChatGPT, cualquier respuesta confiada que no esté precedida por la breve aparición de un widget ‘buscando en la web’ provendrá de los límites de la fecha de corte de conocimiento del modelo, o podría ser alucinación tanto como hecho.

Sin embargo, las búsquedas en la web aumentan la latencia y los costos de ejecución del host de LLM, y, como cualquier usuario sabe, se ejecutan selectivamente; o a petición del usuario; o como una ‘configuración especial’ que puede incurrir en cargos de token adicionales.

No obstante, este tipo de economía interna puede tener un efecto crítico en las consultas de LLM en ciertos dominios, o para ciertos tipos de consulta. Cualquier método que pueda imponer un esquema relacionado con la precisión de la salida es una investigación bienvenida.

 

* Mi conversión de las citas en línea de los autores a enlaces.

Número de versión completo no dado.

Publicado por primera vez el viernes 6 de febrero de 2026. Enmendado en los siguientes cinco minutos por una repetición de palabras

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai