Ãngulo de Anderson
Dar a los Modelos de Lenguaje una ‘Perilla de Verdad’

Verdadero o charlatÃĄn: elige uno. Un nuevo mÃĐtodo de entrenamiento permite a los usuarios decir a los chatbots de IA exactamente cuÃĄn âfÃĄcticosâ deben ser, convirtiendo la precisiÃģn en una perilla que se puede subir o bajar.
Â
Una nueva colaboraciÃģn de investigaciÃģn entre EE. UU. y China ofrece algo que casi todos los usuarios de chatbots de IA apreciarÃan: un âbotÃģnâ virtual que le dice al bot si debe ser âlocuazâ o âverazâ
El sistema fue creado mediante el ajuste fino de un modelo Mistral-7B en datos sintÃĐticos, para que el esquema de una âescala de verdadâ pudiera ser impreso en el modelo. DespuÃĐs de esta revisiÃģn, el modelo Mistral puede controlar la cantidad de hechos en una respuesta; cuanto mayor sea el valor de âverdadâ dado por el usuario, menos (pero mÃĄs seguros) serÃĄ la respuesta.
En ajustes mÃĄs bajos, la respuesta del chatbot se convierte en lo que los autores del artÃculo llaman âinformativaâ, es decir, darÃĄ una respuesta mÃĄs larga y contendrÃĄ mÃĄs hechos; pero algunos de los hechos pueden ser alucinados.
Los datos sintÃĐticos en los que se entrenÃģ el sistema utilizaron Wikipedia como referencia para un dominio de prueba: hechos biogrÃĄficos reales sobre personas. Ya sea que se considere que Wikipedia debe ser una fuente autorizada o no, el valor del trabajo radica en diseÃąar cualquier tipo de sistema que pueda limitar la tendencia natural de los LLM a dar respuestas, incluso cuando no tienen respuestas que dar.

Un ejemplo del proyecto FactScore que alimentÃģ la curaciÃģn del conjunto de datos para el artÃculo que estamos revisando aquÃ, utilizando Wikipedia como autoridad de referencia para detalles biogrÃĄficos. Fuente
Los autores observan que los contextos de alta confianza, como los dominios mÃĐdicos y legales, requieren salidas fÃĄcticas conservadoras y confiables, mientras que muchos otros tipos de usuarios requieren un tipo de salida mÃĄs flexible y creativo, interpretativo (es decir, escritura discursiva y anÃĄlisis acadÃĐmico, entre otros).
Observan*:
â[Los actuales] LLM ofrecen ningÚn mecanismo incorporado para controlar este compromiso.
âMientras que los usuarios pueden intentar guiar el comportamiento del modelo con instrucciones como âsea mÃĄs factualâ, encontramos que los modelos de vanguardia no ajustan de manera fiable sus salidas en respuesta a dichas instrucciones en esta tarea.
âEn FactScore, encontramos que los modelos fuera de la caja a menudo no satisfacen incluso objetivos moderados a estrictos. Esta brecha motiva una alternativa controlable que permite a los usuarios solicitar un nivel de factualidad especÃfico y que el modelo ajuste sus respuestas en consecuencia.â
Los Hechos
Para entender el artÃculo y las soluciones que ofrece, es necesario revisar la propia definiciÃģn de âinformatividadâ. Los autores afirman que la cuantificaciÃģn de una respuesta informativa equivale a âla cantidad de contenido respaldado en la salida, medido como el nÚmero de declaraciones atÃģmicas validadas, normalizado por la longitud de la salidaâ.
En otra parte del artÃculo se afirma de manera mÃĄs simple que la informatividad es âel nÚmero total de hechos atÃģmicos en la salida, ya sean correctos o noâ.
AdemÃĄs, los investigadores observan que la tendencia de los LLM a oscilar entre la precisiÃģn fÃĄctica y las conjeturas subjetivas es un rasgo muy humano, y uno documentado por diversos estudios cientÃficos*:
â[El conocimiento de los LLM] es desigualmente confiable: algunas declaraciones estÃĄn fuertemente respaldadas, mientras que otras son especulativas, desactualizadas o inciertas. La generaciÃģn requiere decidir cuÃĄnto decir y cuÃĄn cautelosamente decirlo, creando una tensiÃģn entre la precisiÃģn fÃĄctica y la informatividad.
âLos humanos toman decisiones anÃĄlogas: comienzan con hechos de alta confiabilidad y agregan detalles de menor certeza sÃģlo cuando se les pide.â
Aunque los experimentos se realizaron solo en el modelo Mistral de tamaÃąo medio, los principios aplicados deberÃan funcionar a diferentes escalas y plataformas, ya que implican una nueva cuantificaciÃģn de datos, como una adiciÃģn al esquema interno de un LLM; y una enmienda de este tipo no es especÃfica de la arquitectura.
El nuevo artÃculo se titula Verdad a pedido: controlando el compromiso entre factualidad e informatividad en la generaciÃģn de texto, y proviene de siete investigadores de la Universidad de Columbia, la Universidad de Nueva York y la Universidad de Nueva York en Shanghai.
MÃĐtodo y Datos
El nuevo enfoque presentado en el artÃculo se denomina GeneraciÃģn controlada por factualidad (FCG), e introduce un dial virtual que permite a los usuarios especificar cuÃĄn precisa quiere que sea la respuesta de un chatbot. âEn esencia,â el artÃculo afirma, âFCG mejora el modelo con un âbotÃģnâ controlable para la factualidadâ.
El modelo toma tanto la pregunta del usuario como el nivel de factualidad deseado, y luego genera una respuesta que incluye solo la informaciÃģn que considera lo suficientemente confiable, mientras intenta ser lo mÃĄs detallada posible dentro de esa restricciÃģn de confianza.
Utilizando el sistema FactScore (arriba vinculado), la salida segmentada de consultas de muestra se evalÚa para la precisiÃģn, una calidad definida como adhesiÃģn a la factualidad:

TuberÃa de datos de entrenamiento para FCG: un modelo de lenguaje genera una respuesta inicial, la divide en hechos atÃģmicos, los clasifica por confianza y descarta los menos confiables hasta que se alcanza el nivel de verdad deseado. Fuente
Como no existÃa un conjunto de datos que coincidiera con los requisitos de FCG, los autores crearon uno sintÃĐtico haciendo que el modelo de lenguaje GPT-4â generara primero una respuesta sin restricciones, y luego eliminara los âhechos de menor confianzaâ, hasta que la respuesta cumpliera con un nivel de precisiÃģn determinado.
El trabajo previo sugiriÃģ que entrenar solo con datos de verdad podrÃa hacer que los modelos sean menos fÃĄcticos, al desanimarlos a ofrecer cualquier detalle adicional. Por lo tanto, los ejemplos de entrenamiento de FCG se editaron mÃnimamente, preservando la propia redacciÃģn y ritmo del modelo, mientras se reducÃa solo lo suficiente para cumplir con el objetivo de confianza requerido.
Al aplicar este proceso de ediciÃģn en una variedad de niveles de confianza objetivo, desde el 10% hasta un umbral estricto del 100%, se creÃģ un conjunto de datos sintÃĐtico en el que cada pregunta se emparejÃģ con mÚltiples respuestas filtradas.
En cada versiÃģn, solo se conservaron los hechos que el modelo juzgÃģ lo suficientemente confiables para cumplir con el nivel de factualidad solicitado; estos ejemplos se utilizaron como datos de entrenamiento para el ajuste fino supervisado.
El conjunto de datos final consistiÃģ en 3,302 triples (pregunta, control, respuesta) para el entrenamiento, y 396 para validaciÃģn, construidos a partir de 500 entidades divididas en 450 para el entrenamiento y 50 para el desarrollo. Se utilizaron 183 entidades distintas para las pruebas.
Entrenamiento y Pruebas
Los autores ajustaron finamente el modelo Mistral-7B-Instruct-v0.2 LLM a diferentes tasas de aprendizaje (3e-6, 1e-5, 3e-5) para llegar a la tasa Ãģptima (no especificada) LR, durante 30 ÃĐpocas, con un tamaÃąo de lote de 256 (n.b. no se especifica el hardware de entrenamiento).
FCG se probÃģ contra dos lÃneas base. La primera fue Sin control de factualidad (NFC), donde el modelo se promoviÃģ simplemente con una solicitud como Di una biografÃa de X, sin mencionar la precisiÃģn o la confianza. Esta versiÃģn refleja el comportamiento predeterminado de un LLM, sin ningÚn mecanismo para filtrar o restringir.
El segundo mÃĐtodo, llamado Inferencia controlada por factualidad (FCI), utilizÃģ las mismas instrucciones de nivel de confianza sin ajuste fino. Por ejemplo, el modelo podrÃa haber sido promovido con âSalida de informaciÃģn que consideres 90% confiableâ. En este caso, la instrucciÃģn se asemejaba a las utilizadas en el entrenamiento, pero el modelo no habÃa tenido una exposiciÃģn previa a tales restricciones:

ComparaciÃģn de los tres enfoques probados: la lÃnea base sin control; una versiÃģn que utiliza instrucciones de factualidad sin entrenamiento; y el modelo ajustado que aprendiÃģ a seguir la configuraciÃģn de precisiÃģn a travÃĐs de la exposiciÃģn a datos filtrados.
Inicialmente se realizÃģ una prueba para adhesiÃģn a la factualidad:

Rendimiento en tres niveles de confianza objetivo. Solo el modelo ajustado fue capaz de producir salidas completamente fÃĄcticas, y superÃģ a ambas lÃneas base en todos los aspectos, particularmente en los umbrales mÃĄs altos.
Cuando se probÃģ contra umbrales de factualidad del 80%, 90% y 100%, solo el modelo ajustado fue capaz de cumplir consistentemente con los objetivos. Sorprendentemente, simplemente agregar instrucciones de confianza, sin entrenar al modelo para que siga esas instrucciones, no ayudÃģ. En algunos casos, empeorÃģ las cosas; por ejemplo, solo el 3,8% de las salidas del modelo con instrucciones cumplieron con el umbral del 90%, en comparaciÃģn con el 5,5% de la versiÃģn sin instrucciÃģn:
Esto sugiere, afirman los autores, que el modelo base Mistral-7B no pudo interpretar instrucciones como âsea 90% confiableâ de manera Útil, y que la instrucciÃģn adicional podrÃa haber interrumpido su salida habitual.
Por el contrario, el modelo ajustado respondiÃģ de manera fiable a las seÃąales de control, produciendo el 18,7% de salidas compatibles al 80%, el 12,6% al 90% y el 23,6% al 100%; y demostrÃģ ser el Único mÃĐtodo capaz de generar salidas completamente fÃĄcticas:
âEstas mejoras indican que la capacidad de controlar la factualidad indeed puede ser inculcada a travÃĐs del entrenamiento supervisado. El modelo FCG ha aprendido a ajustar su contenido y solo incluir hechos en los que tiene suficiente confianza, mientras que el modelo fuera de la caja no podÃa utilizar de manera efectiva la seÃąal de control por sà solo.â
En una prueba separada diseÃąada para confirmar que el modelo habÃa aprendido a interpretar la seÃąal de control, los investigadores comprobaron si la factualidad promedio de las respuestas aumentaba a medida que se solicitaban ajustes de verdad mÃĄs altos.
No surgiÃģ tal patrÃģn antes del entrenamiento, pero despuÃĐs, los resultados revelaron una tendencia ascendente constante, con ajustes de confianza mÃĄs altos que producÃan respuestas mÃĄs precisas:

A medida que aumentaba el ajuste de verdad objetivo, el modelo ajustado produjo salidas cada vez mÃĄs fÃĄcticas en respuesta, mientras que los modelos base demostraron ningÚn cambio consistente en el mismo rango.
El compromiso entre verdad y âriquezaâ tambiÃĐn se examinÃģ. Las salidas se calificaron no solo por precisiÃģn, sino tambiÃĐn por cuÃĄnta informaciÃģn verificada se conservÃģ bajo requisitos de factualidad cada vez mÃĄs estrictos. Como se muestra en el grÃĄfico a continuaciÃģn, el modelo FCG se encontrÃģ que superÃģ a ambas lÃneas base y al modelo no restringido en la mayorÃa de los niveles:

Un grÃĄfico que representa el compromiso entre factualidad e informatividad en los tres mÃĐtodos. El modelo ajustado se encontrÃģ que ofreciÃģ un mejor equilibrio entre verdad y detalle que cualquiera de las lÃneas base. En niveles de precisiÃģn comparables, se conservÃģ mÃĄs contenido fÃĄctico, y en la configuraciÃģn mÃĄs alta, permaneciÃģ como el Único mÃĐtodo capaz de producir respuestas completamente verificadas que no estaban vacÃas.
En un umbral de precisiÃģn del 90%, se conservaron mÃĄs hechos en FCG que en cualquier otro mÃĐtodo, y en todo el rango de configuraciones de confianza, ninguna lÃnea base produjo resultados consistentemente mejores.
La diferencia fue mÃĄs notable en la configuraciÃģn mÃĄs estricta, donde FCG continuÃģ produciendo una informatividad no cero, mientras que la lÃnea base con instrucciones solas se vio obligada a eliminar todo. En esos casos, incluso una sola afirmaciÃģn de baja confianza hizo que toda la respuesta se descartara.
Por el contrario, el modelo ajustado pudo remodelar su salida para conservar solo los hechos que consideraba completamente confiables, evitando el colapso en el silencio que afectÃģ a los demÃĄs.
La factualidad se limitÃģ directamente por la configuraciÃģn de control, mientras que la informatividad se optimizÃģ permitiendo que el modelo incluyera la mayor cantidad de contenido confiable posible. En configuraciones mÃĄs altas, solo se conservaron las afirmaciones verificables; en las mÃĄs bajas, se permitieron detalles mÃĄs especulativos, aumentando la longitud pero reduciendo la precisiÃģn.
Los autores concluyen:
â[Cuando] una restricciÃģn de alta factualidad estÃĄ en su lugar, el modelo prioriza las declaraciones verificables fÃĄcticamente mientras aÚn incluye tanta informaciÃģn relevante como sea posible. Por el contrario, el modelo tiene la libertad de incorporar una gama mÃĄs amplia de detalles, incluidos algunos que son menos verificables o mÃĄs especulativos, lo que resulta en una mayor informatividad (mÃĄs hechos mencionados) a costa de alguna precisiÃģn.
âEste comportamiento se alinea con nuestro diseÃąo de los datos de entrenamiento: porque siempre eliminamos los hechos menos necesarios, el modelo aprendiÃģ âsi debes ser x% fÃĄctico, descarta los detalles menos seguros pero conserva todo lo demÃĄs.â â
El artÃculo termina con la esperanza de que la nueva metodologÃa se intente con modelos de mayor escala y se aplique a tareas mÃĄs complejas, entre otras posibles extensiones del trabajo.
ConclusiÃģn
La soluciÃģn ofrecida aquà aborda uno de los errores mÃĄs graves y frecuentemente observados de incluso la Última generaciÃģn de Modelos de Lenguaje Grande â su tendencia a favorecer la locuacidad sobre la precisiÃģn, aparentemente solo para âmantener la conversaciÃģnâ, y para presentar confiadamente informaciÃģn desactualizada o completamente alucinada como fÃĄctica.
Para los usuarios de ChatGPT, cualquier respuesta confiada que no estÃĐ precedida por la breve apariciÃģn de un widget âbuscando en la webâ provendrÃĄ de los lÃmites de la fecha de corte de conocimiento del modelo, o podrÃa ser alucinaciÃģn tanto como hecho.
Sin embargo, las bÚsquedas en la web aumentan la latencia y los costos de ejecuciÃģn del host de LLM, y, como cualquier usuario sabe, se ejecutan selectivamente; o a peticiÃģn del usuario; o como una âconfiguraciÃģn especialâ que puede incurrir en cargos de token adicionales.
No obstante, este tipo de economÃa interna puede tener un efecto crÃtico en las consultas de LLM en ciertos dominios, o para ciertos tipos de consulta. Cualquier mÃĐtodo que pueda imponer un esquema relacionado con la precisiÃģn de la salida es una investigaciÃģn bienvenida.
Â
* Mi conversiÃģn de las citas en lÃnea de los autores a enlaces.
â NÚmero de versiÃģn completo no dado.
Publicado por primera vez el viernes 6 de febrero de 2026. Enmendado en los siguientes cinco minutos por una repeticiÃģn de palabras












