Ángulo de Anderson

Dar a los Modelos de Lenguaje una ‘Perilla de Verdad’

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Verdadero o charlatÃĄn: elige uno. Un nuevo mÃĐtodo de entrenamiento permite a los usuarios decir a los chatbots de IA exactamente cuÃĄn ‘fÃĄcticos’ deben ser, convirtiendo la precisiÃģn en una perilla que se puede subir o bajar.

 

Una nueva colaboraciÃģn de investigaciÃģn entre EE. UU. y China ofrece algo que casi todos los usuarios de chatbots de IA apreciarían: un ‘botÃģn’ virtual que le dice al bot si debe ser ‘locuaz’ o ‘veraz’

El sistema fue creado mediante el ajuste fino de un modelo Mistral-7B en datos sintÃĐticos, para que el esquema de una ‘escala de verdad’ pudiera ser impreso en el modelo. DespuÃĐs de esta revisiÃģn, el modelo Mistral puede controlar la cantidad de hechos en una respuesta; cuanto mayor sea el valor de ‘verdad’ dado por el usuario, menos (pero mÃĄs seguros) serÃĄ la respuesta.

En ajustes mÃĄs bajos, la respuesta del chatbot se convierte en lo que los autores del artículo llaman ‘informativa’, es decir, darÃĄ una respuesta mÃĄs larga y contendrÃĄ mÃĄs hechos; pero algunos de los hechos pueden ser alucinados.

Los datos sintÃĐticos en los que se entrenÃģ el sistema utilizaron Wikipedia como referencia para un dominio de prueba: hechos biogrÃĄficos reales sobre personas. Ya sea que se considere que Wikipedia debe ser una fuente autorizada o no, el valor del trabajo radica en diseÃąar cualquier tipo de sistema que pueda limitar la tendencia natural de los LLM a dar respuestas, incluso cuando no tienen respuestas que dar.

Un ejemplo del proyecto FactScore que alimentÃģ la curaciÃģn del conjunto de datos para el artículo que estamos revisando aquí, utilizando Wikipedia como autoridad de referencia para detalles biogrÃĄficos. Fuente - https://aclanthology.org/2023.emnlp-main.741.pdf

Un ejemplo del proyecto FactScore que alimentÃģ la curaciÃģn del conjunto de datos para el artículo que estamos revisando aquí, utilizando Wikipedia como autoridad de referencia para detalles biogrÃĄficos. Fuente

Los autores observan que los contextos de alta confianza, como los dominios mÃĐdicos y legales, requieren salidas fÃĄcticas conservadoras y confiables, mientras que muchos otros tipos de usuarios requieren un tipo de salida mÃĄs flexible y creativo, interpretativo (es decir, escritura discursiva y anÃĄlisis acadÃĐmico, entre otros).

Observan*:

‘[Los actuales] LLM ofrecen ningÚn mecanismo incorporado para controlar este compromiso.

‘Mientras que los usuarios pueden intentar guiar el comportamiento del modelo con instrucciones como “sea mÃĄs factual”, encontramos que los modelos de vanguardia no ajustan de manera fiable sus salidas en respuesta a dichas instrucciones en esta tarea.

‘En FactScore, encontramos que los modelos fuera de la caja a menudo no satisfacen incluso objetivos moderados a estrictos. Esta brecha motiva una alternativa controlable que permite a los usuarios solicitar un nivel de factualidad específico y que el modelo ajuste sus respuestas en consecuencia.’

Los Hechos

Para entender el artículo y las soluciones que ofrece, es necesario revisar la propia definiciÃģn de ‘informatividad’. Los autores afirman que la cuantificaciÃģn de una respuesta informativa equivale a ‘la cantidad de contenido respaldado en la salida, medido como el nÚmero de declaraciones atÃģmicas validadas, normalizado por la longitud de la salida’.

En otra parte del artículo se afirma de manera mÃĄs simple que la informatividad es ‘el nÚmero total de hechos atÃģmicos en la salida, ya sean correctos o no’.

AdemÃĄs, los investigadores observan que la tendencia de los LLM a oscilar entre la precisiÃģn fÃĄctica y las conjeturas subjetivas es un rasgo muy humano, y uno documentado por diversos estudios científicos*:

‘[El conocimiento de los LLM] es desigualmente confiable: algunas declaraciones estÃĄn fuertemente respaldadas, mientras que otras son especulativas, desactualizadas o inciertas. La generaciÃģn requiere decidir cuÃĄnto decir y cuÃĄn cautelosamente decirlo, creando una tensiÃģn entre la precisiÃģn fÃĄctica y la informatividad.

‘Los humanos toman decisiones anÃĄlogas: comienzan con hechos de alta confiabilidad y agregan detalles de menor certeza sÃģlo cuando se les pide.’

Aunque los experimentos se realizaron solo en el modelo Mistral de tamaÃąo medio, los principios aplicados deberían funcionar a diferentes escalas y plataformas, ya que implican una nueva cuantificaciÃģn de datos, como una adiciÃģn al esquema interno de un LLM; y una enmienda de este tipo no es específica de la arquitectura.

El nuevo artículo se titula Verdad a pedido: controlando el compromiso entre factualidad e informatividad en la generaciÃģn de texto, y proviene de siete investigadores de la Universidad de Columbia, la Universidad de Nueva York y la Universidad de Nueva York en Shanghai.

MÃĐtodo y Datos

El nuevo enfoque presentado en el artículo se denomina GeneraciÃģn controlada por factualidad (FCG), e introduce un dial virtual que permite a los usuarios especificar cuÃĄn precisa quiere que sea la respuesta de un chatbot. ‘En esencia,’ el artículo afirma, ‘FCG mejora el modelo con un “botÃģn” controlable para la factualidad’.

El modelo toma tanto la pregunta del usuario como el nivel de factualidad deseado, y luego genera una respuesta que incluye solo la informaciÃģn que considera lo suficientemente confiable, mientras intenta ser lo mÃĄs detallada posible dentro de esa restricciÃģn de confianza.

Utilizando el sistema FactScore (arriba vinculado), la salida segmentada de consultas de muestra se evalÚa para la precisiÃģn, una calidad definida como adhesiÃģn a la factualidad:

Tubería de datos de entrenamiento para FCG: un modelo de lenguaje genera una respuesta inicial, la divide en hechos atÃģmicos, los clasifica por confianza y descarta los menos confiables hasta que se alcanza el nivel de verdad deseado. Fuente - https://arxiv.org/pdf/2602.00848

Tubería de datos de entrenamiento para FCG: un modelo de lenguaje genera una respuesta inicial, la divide en hechos atÃģmicos, los clasifica por confianza y descarta los menos confiables hasta que se alcanza el nivel de verdad deseado. Fuente

Como no existía un conjunto de datos que coincidiera con los requisitos de FCG, los autores crearon uno sintÃĐtico haciendo que el modelo de lenguaje GPT-4† generara primero una respuesta sin restricciones, y luego eliminara los ‘hechos de menor confianza’, hasta que la respuesta cumpliera con un nivel de precisiÃģn determinado.

El trabajo previo sugiriÃģ que entrenar solo con datos de verdad podría hacer que los modelos sean menos fÃĄcticos, al desanimarlos a ofrecer cualquier detalle adicional. Por lo tanto, los ejemplos de entrenamiento de FCG se editaron mínimamente, preservando la propia redacciÃģn y ritmo del modelo, mientras se reducía solo lo suficiente para cumplir con el objetivo de confianza requerido.

Al aplicar este proceso de ediciÃģn en una variedad de niveles de confianza objetivo, desde el 10% hasta un umbral estricto del 100%, se creÃģ un conjunto de datos sintÃĐtico en el que cada pregunta se emparejÃģ con mÚltiples respuestas filtradas.

En cada versiÃģn, solo se conservaron los hechos que el modelo juzgÃģ lo suficientemente confiables para cumplir con el nivel de factualidad solicitado; estos ejemplos se utilizaron como datos de entrenamiento para el ajuste fino supervisado.

El conjunto de datos final consistiÃģ en 3,302 triples (pregunta, control, respuesta) para el entrenamiento, y 396 para validaciÃģn, construidos a partir de 500 entidades divididas en 450 para el entrenamiento y 50 para el desarrollo. Se utilizaron 183 entidades distintas para las pruebas.

Entrenamiento y Pruebas

Los autores ajustaron finamente el modelo Mistral-7B-Instruct-v0.2 LLM a diferentes tasas de aprendizaje (3e-6, 1e-5, 3e-5) para llegar a la tasa Ãģptima (no especificada) LR, durante 30 ÃĐpocas, con un tamaÃąo de lote de 256 (n.b. no se especifica el hardware de entrenamiento).

FCG se probÃģ contra dos líneas base. La primera fue Sin control de factualidad (NFC), donde el modelo se promoviÃģ simplemente con una solicitud como Di una biografía de X, sin mencionar la precisiÃģn o la confianza. Esta versiÃģn refleja el comportamiento predeterminado de un LLM, sin ningÚn mecanismo para filtrar o restringir.

El segundo mÃĐtodo, llamado Inferencia controlada por factualidad (FCI), utilizÃģ las mismas instrucciones de nivel de confianza sin ajuste fino. Por ejemplo, el modelo podría haber sido promovido con ‘Salida de informaciÃģn que consideres 90% confiable’. En este caso, la instrucciÃģn se asemejaba a las utilizadas en el entrenamiento, pero el modelo no había tenido una exposiciÃģn previa a tales restricciones:

ComparaciÃģn de los tres enfoques probados: la línea base sin control; una versiÃģn que utiliza instrucciones de factualidad sin entrenamiento; y el modelo ajustado que aprendiÃģ a seguir la configuraciÃģn de precisiÃģn a travÃĐs de la exposiciÃģn a datos filtrados.

ComparaciÃģn de los tres enfoques probados: la línea base sin control; una versiÃģn que utiliza instrucciones de factualidad sin entrenamiento; y el modelo ajustado que aprendiÃģ a seguir la configuraciÃģn de precisiÃģn a travÃĐs de la exposiciÃģn a datos filtrados.

Inicialmente se realizÃģ una prueba para adhesiÃģn a la factualidad:

Rendimiento en tres niveles de confianza objetivo. Solo el modelo ajustado fue capaz de producir salidas completamente fÃĄcticas, y superÃģ a ambas líneas base en todos los aspectos, particularmente en los umbrales mÃĄs altos.

Rendimiento en tres niveles de confianza objetivo. Solo el modelo ajustado fue capaz de producir salidas completamente fÃĄcticas, y superÃģ a ambas líneas base en todos los aspectos, particularmente en los umbrales mÃĄs altos.

Cuando se probÃģ contra umbrales de factualidad del 80%, 90% y 100%, solo el modelo ajustado fue capaz de cumplir consistentemente con los objetivos. Sorprendentemente, simplemente agregar instrucciones de confianza, sin entrenar al modelo para que siga esas instrucciones, no ayudÃģ. En algunos casos, empeorÃģ las cosas; por ejemplo, solo el 3,8% de las salidas del modelo con instrucciones cumplieron con el umbral del 90%, en comparaciÃģn con el 5,5% de la versiÃģn sin instrucciÃģn:

Esto sugiere, afirman los autores, que el modelo base Mistral-7B no pudo interpretar instrucciones como ‘sea 90% confiable’ de manera Útil, y que la instrucciÃģn adicional podría haber interrumpido su salida habitual.

Por el contrario, el modelo ajustado respondiÃģ de manera fiable a las seÃąales de control, produciendo el 18,7% de salidas compatibles al 80%, el 12,6% al 90% y el 23,6% al 100%; y demostrÃģ ser el Único mÃĐtodo capaz de generar salidas completamente fÃĄcticas:

‘Estas mejoras indican que la capacidad de controlar la factualidad indeed puede ser inculcada a travÃĐs del entrenamiento supervisado. El modelo FCG ha aprendido a ajustar su contenido y solo incluir hechos en los que tiene suficiente confianza, mientras que el modelo fuera de la caja no podía utilizar de manera efectiva la seÃąal de control por sí solo.’

En una prueba separada diseÃąada para confirmar que el modelo había aprendido a interpretar la seÃąal de control, los investigadores comprobaron si la factualidad promedio de las respuestas aumentaba a medida que se solicitaban ajustes de verdad mÃĄs altos.

No surgiÃģ tal patrÃģn antes del entrenamiento, pero despuÃĐs, los resultados revelaron una tendencia ascendente constante, con ajustes de confianza mÃĄs altos que producían respuestas mÃĄs precisas:

A medida que aumentaba el ajuste de verdad objetivo, el modelo ajustado produjo salidas cada vez mÃĄs fÃĄcticas en respuesta, mientras que los modelos base demostraron ningÚn cambio consistente en el mismo rango.

A medida que aumentaba el ajuste de verdad objetivo, el modelo ajustado produjo salidas cada vez mÃĄs fÃĄcticas en respuesta, mientras que los modelos base demostraron ningÚn cambio consistente en el mismo rango.

El compromiso entre verdad y ‘riqueza’ tambiÃĐn se examinÃģ. Las salidas se calificaron no solo por precisiÃģn, sino tambiÃĐn por cuÃĄnta informaciÃģn verificada se conservÃģ bajo requisitos de factualidad cada vez mÃĄs estrictos. Como se muestra en el grÃĄfico a continuaciÃģn, el modelo FCG se encontrÃģ que superÃģ a ambas líneas base y al modelo no restringido en la mayoría de los niveles:

Un grÃĄfico que representa el compromiso entre factualidad e informatividad en los tres mÃĐtodos. El modelo ajustado se encontrÃģ que ofreciÃģ un mejor equilibrio entre verdad y detalle que cualquiera de las líneas base. En niveles de precisiÃģn comparables, se conservÃģ mÃĄs contenido fÃĄctico, y en la configuraciÃģn mÃĄs alta, permaneciÃģ como el Único mÃĐtodo capaz de producir respuestas completamente verificadas que no estaban vacías.

Un grÃĄfico que representa el compromiso entre factualidad e informatividad en los tres mÃĐtodos. El modelo ajustado se encontrÃģ que ofreciÃģ un mejor equilibrio entre verdad y detalle que cualquiera de las líneas base. En niveles de precisiÃģn comparables, se conservÃģ mÃĄs contenido fÃĄctico, y en la configuraciÃģn mÃĄs alta, permaneciÃģ como el Único mÃĐtodo capaz de producir respuestas completamente verificadas que no estaban vacías.

En un umbral de precisiÃģn del 90%, se conservaron mÃĄs hechos en FCG que en cualquier otro mÃĐtodo, y en todo el rango de configuraciones de confianza, ninguna línea base produjo resultados consistentemente mejores.

La diferencia fue mÃĄs notable en la configuraciÃģn mÃĄs estricta, donde FCG continuÃģ produciendo una informatividad no cero, mientras que la línea base con instrucciones solas se vio obligada a eliminar todo. En esos casos, incluso una sola afirmaciÃģn de baja confianza hizo que toda la respuesta se descartara.

Por el contrario, el modelo ajustado pudo remodelar su salida para conservar solo los hechos que consideraba completamente confiables, evitando el colapso en el silencio que afectÃģ a los demÃĄs.

La factualidad se limitÃģ directamente por la configuraciÃģn de control, mientras que la informatividad se optimizÃģ permitiendo que el modelo incluyera la mayor cantidad de contenido confiable posible. En configuraciones mÃĄs altas, solo se conservaron las afirmaciones verificables; en las mÃĄs bajas, se permitieron detalles mÃĄs especulativos, aumentando la longitud pero reduciendo la precisiÃģn.

Los autores concluyen:

‘[Cuando] una restricciÃģn de alta factualidad estÃĄ en su lugar, el modelo prioriza las declaraciones verificables fÃĄcticamente mientras aÚn incluye tanta informaciÃģn relevante como sea posible. Por el contrario, el modelo tiene la libertad de incorporar una gama mÃĄs amplia de detalles, incluidos algunos que son menos verificables o mÃĄs especulativos, lo que resulta en una mayor informatividad (mÃĄs hechos mencionados) a costa de alguna precisiÃģn.

‘Este comportamiento se alinea con nuestro diseÃąo de los datos de entrenamiento: porque siempre eliminamos los hechos menos necesarios, el modelo aprendiÃģ “si debes ser x% fÃĄctico, descarta los detalles menos seguros pero conserva todo lo demÃĄs.” ‘

El artículo termina con la esperanza de que la nueva metodología se intente con modelos de mayor escala y se aplique a tareas mÃĄs complejas, entre otras posibles extensiones del trabajo.

ConclusiÃģn

La soluciÃģn ofrecida aquí aborda uno de los errores mÃĄs graves y frecuentemente observados de incluso la Última generaciÃģn de Modelos de Lenguaje Grande – su tendencia a favorecer la locuacidad sobre la precisiÃģn, aparentemente solo para ‘mantener la conversaciÃģn’, y para presentar confiadamente informaciÃģn desactualizada o completamente alucinada como fÃĄctica.

Para los usuarios de ChatGPT, cualquier respuesta confiada que no estÃĐ precedida por la breve apariciÃģn de un widget ‘buscando en la web’ provendrÃĄ de los límites de la fecha de corte de conocimiento del modelo, o podría ser alucinaciÃģn tanto como hecho.

Sin embargo, las bÚsquedas en la web aumentan la latencia y los costos de ejecuciÃģn del host de LLM, y, como cualquier usuario sabe, se ejecutan selectivamente; o a peticiÃģn del usuario; o como una ‘configuraciÃģn especial’ que puede incurrir en cargos de token adicionales.

No obstante, este tipo de economía interna puede tener un efecto crítico en las consultas de LLM en ciertos dominios, o para ciertos tipos de consulta. Cualquier mÃĐtodo que pueda imponer un esquema relacionado con la precisiÃģn de la salida es una investigaciÃģn bienvenida.

 

* Mi conversiÃģn de las citas en línea de los autores a enlaces.

† NÚmero de versiÃģn completo no dado.

Publicado por primera vez el viernes 6 de febrero de 2026. Enmendado en los siguientes cinco minutos por una repeticiÃģn de palabras

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]