Ángulo de Anderson
Los Modelos de Lenguaje Personalizados son Fáciles de Crear y Más Difíciles de Detectar

Las copias de código abierto de ChatGPT pueden ser ajustadas a escala y con experiencia limitada o nula, lo que facilita la creación de modelos de lenguaje “privados” que evaden la detección. La mayoría de las herramientas no pueden rastrear el origen de estos modelos ni determinar para qué han sido entrenados, lo que permite a los estudiantes y otros usuarios generar texto de IA sin ser detectados; sin embargo, un nuevo método afirma que puede identificar estas variantes ocultas detectando “rasgos familiares” compartidos en las salidas de los modelos.
Según un nuevo estudio de Canadá, los modelos de chat de IA personalizados, similares a ChatGPT, son capaces de producir contenido de redes sociales que se asemeja mucho a la escritura humana, y que puede engañar a los algoritmos de detección de estado del arte y a los humanos por igual.
El documento establece:
‘Un atacante realista probablemente ajustará un modelo para su estilo y caso de uso específicos, ya que es barato y fácil de hacer. Con un esfuerzo mínimo, tiempo y dinero, produjimos generadores ajustados que son capaces de generar tweets de redes sociales mucho más realistas, basados en características lingüísticas y precisión de detección, y verificados a través de anotaciones humanas.’
Los autores enfatizan que los modelos personalizados de este tipo no se limitan a contenido de redes sociales de corta forma:
‘Aunque motivados por la difusión de contenido de IA en redes sociales, y los riesgos asociados de astroturfing y campañas de influencia, enfatizamos que los principales hallazgos se extienden a todos los dominios de texto.
‘De hecho, ajustar modelos para la generación de contenido específico de estilo es un método generalmente aplicable, y uno que probablemente ya está en uso por muchos usuarios de IA generativa – lo que cuestiona si los métodos existentes para detectar AIGT son tan efectivos en el mundo real como en el laboratorio de investigación.’
Como observa el documento, el método utilizado para crear estos modelos de lenguaje personalizados es el ajuste fino, donde los usuarios curan una cantidad limitada de sus propios datos de destino y los alimentan en una creciente cantidad de herramientas de entrenamiento en línea fáciles de usar y baratas.
Por ejemplo, el popular repositorio Hugging Face ofrece ajuste fino de modelo de lenguaje grande (LLM) a través de una interfaz simplificada, utilizando su sistema AutoTrain Advanced, que puede ejecutarse por unos pocos dólares a través de una GPU en línea o de forma gratuita, de forma local, si el usuario tiene hardware adecuado:

Various price structures across the range of GPUs available for the Hugging Face AutoTrain system. Source: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true
Otras herramientas y plataformas simplificadas incluyen Axolotl, Unsloth, y la más capaz pero exigente TorchTune.
Un ejemplo de caso de uso sería un estudiante que está cansado de escribir sus propios ensayos, pero teme ser atrapado por las herramientas de detección de IA en línea, que puede utilizar sus propios ensayos históricos reales como datos de entrenamiento para ajustar un modelo popular de código abierto como la serie Mistral.
Aunque ajustar un modelo tiende a sesgar su rendimiento hacia los datos de entrenamiento adicionales y degradar el rendimiento general, los modelos “personalizados” se pueden utilizar para “des-IA” la salida cada vez más distintiva de sistemas como ChatGPT, de una manera que refleje el estilo histórico del usuario (y, para aumentar la autenticidad, sus limitaciones).
Sin embargo, también se puede utilizar un modelo ajustado exclusivamente que se haya entrenado en una tarea o conjunto de tareas específicas, como un LLM ajustado en el curso de una materia universitaria específica. Un modelo tan específico tendría una visión miope, pero mucho más profunda, de ese dominio que un LLM de propósito general como ChatGPT, y probablemente costaría menos de $10-20 para entrenar.
El Iceberg de LLM
Es difícil decir cuál es el alcance de esta práctica. Anecdóticamente, en diversas plataformas de redes sociales, he encontrado muchos ejemplos de ajuste fino de LLM con orientación comercial – ciertamente muchos más de los que había hace un año; en un caso, una empresa ajustó un modelo de lenguaje en sus propias piezas de liderazgo de pensamiento publicadas, que luego pudo convertir una llamada de Zoom desordenada con un nuevo cliente en una publicación de B2B pulida casi en un solo paso, a demanda.
Un modelo de ese tipo requiere datos emparejados (ejemplos antes y después, a escala), mientras que crear un “brillo” personalizado de las características de un escritor específico es una tarea más fácil, similar a la transferencia de estilo.
Aunque esta es una búsqueda clandestina (a pesar de numerosos titulares y estudios académicos sobre el tema), donde no hay cifras disponibles, el mismo sentido común que llevó la ley TAKE IT DOWN a ser aprobada este año se aplica aquí: la actividad objetivo es posible y asequible, y hay una comprensión común de que los posibles usuarios están muy motivados.
Sólo queda suficiente fricción en los sistemas de ajuste en línea más “simplificados” para que la práctica de entrenar y utilizar modelos ajustados de manera “desaprensiva” siga siendo un caso de uso relativamente nicho – aunque ciertamente no está más allá de la inventiva tradicional de los estudiantes.
PhantomHunter
Esto nos lleva al documento principal de interés aquí – un nuevo enfoque de China que reúne una amplia variedad de técnicas en un solo marco – llamado PhantomHunter – que afirma identificar la salida de modelos de lenguaje ajustados, que de otro modo pasarían como trabajo original humano.
El sistema está diseñado para funcionar incluso cuando el modelo ajustado específico nunca se ha encontrado antes, en lugar de eso, se basa en residuos оставados por el modelo base original – que los autores caracterizan como “rasgos familiares” que sobreviven al proceso de ajuste.
En las pruebas, el documento – titulado PhantomHunter: Detecting Unseen Privately-Tuned LLM-Generated Text via Family-Aware Learning – informa una fuerte precisión de detección, con el sistema superando la evaluación zero-shot GPT-4-mini† al rastrear una muestra de texto hasta su familia de modelos.
Esto sugiere que cuanto más se ajusta un modelo, más revela sobre su ascendencia, contrariando la suposición de que el ajuste privado siempre oculta el origen de un modelo; en cambio, el proceso de ajuste puede dejar una huella detectable que, si se lee correctamente, delata – al menos, pendientes de los avances adicionales que parecen llegar cada semana ahora.
El documento establece*:
‘La detección de texto generado por máquina generalmente distingue entre texto generado por LLM y texto escrito por humanos a través de la clasificación binaria. Los métodos existentes aprenden características textuales comunes compartidas entre LLM utilizando el aprendizaje de representación o diseñan métricas distinguibles entre textos humanos y LLM basados en señales internas de LLM (por ejemplo, probabilidades de token).
‘Para ambas categorías, sus pruebas se llevaron a cabo principalmente en datos de LLM públicamente disponibles, asumiendo que los usuarios generan texto utilizando servicios públicos, listos para usar.
‘Afirmamos que esta situación está cambiando debido al reciente desarrollo de la comunidad de LLM de código abierto. Con la ayuda de plataformas como HuggingFace y técnicas de entrenamiento de LLM eficientes como la adaptación de bajo rango (LoRA), construir LLM ajustados con conjuntos de datos privados personalizados se ha vuelto mucho más fácil que antes.
‘Por ejemplo, han habido más de 60k modelos derivados de Llama en HuggingFace. Después del ajuste privado en un corpus desconocido, las características aprendidas de los modelos base podrían cambiar y los detectores de LLMGT fallarían, lo que plantea un nuevo riesgo de que los usuarios maliciosos puedan generar textos dañinos de forma privada sin ser detectados por los detectores de LLMGT.
‘Un nuevo desafío surge: ¿Cómo detectar texto generado por LLM ajustados privadamente?‘
Método y Entrenamiento
El sistema PhantomHunter utiliza una estrategia de aprendizaje consciente de la familia, que combina tres componentes: un extractor de características, que captura probabilidades de salida de modelos base conocidos; un codificador contrastivo entrenado para distinguir entre familias; y (como se detalla a continuación) un clasificador de mezcla de expertos que asigna etiquetas de familia a nuevas muestras de texto:

Schema for the system. PhantomHunter processes a text sample by first extracting probability features from multiple base models, which are then encoded using CNN and transformer layers. It estimates the model family to compute gating weights, which guide a mixture-of-experts module in predicting whether the text is LLM-generated. A contrastive loss is applied during training to refine the separation between model families. Source: https://arxiv.org/pdf/2506.15683
PhantomHunter funciona pasando un trozo de texto a través de varios modelos base conocidos y registrando cuán probable es que cada uno piense que la próxima palabra es, en cada paso. Estos patrones se alimentan entonces en una red neuronal que aprende las características distinguibles de cada familia de modelos.
Durante el entrenamiento, el sistema compara textos de la misma familia y aprende a agruparlos juntos, mientras distingue entre aquellos de diferentes familias, lo que ayuda a identificar conexiones ocultas entre modelos ajustados y sus modelos base.
MOE
Para decidir si un trozo de texto fue escrito por un humano o por IA, PhantomHunter utiliza un sistema de mezcla de expertos, en el que cada “experto” se ajusta para detectar texto de una familia de modelos específica.
Una vez que el sistema adivina de qué familia proviene el texto con más probabilidad, utiliza esa suposición para decidir cuánto peso dar a la opinión de cada experto. Estas opiniones ponderadas se combinan entonces para tomar la decisión final: IA o humano.
El entrenamiento del sistema implica múltiples objetivos: aprender a reconocer familias de modelos; aprender a distinguir entre texto de IA y humano; y aprender a separar diferentes familias utilizando el aprendizaje contrastivo – objetivos que se equilibran durante el entrenamiento a través de parámetros ajustables.
Al centrarse en patrones compartidos a lo largo de cada familia, en lugar de rarezas de modelos individuales, PhantomHunter debería ser capaz de detectar incluso modelos ajustados que nunca ha visto antes.
Datos y Pruebas
Para desarrollar datos para las pruebas, los autores se centraron en los dos escenarios académicos más comunes: escritura y respuesta a preguntas. Para la escritura, recopilaron 69,297 resúmenes del archivo académico Arxiv, divididos en dominios principales. Para la respuesta a preguntas, se curaron 2,062 pares del conjunto de datos HC3 en tres temas: ELI5; finanzas; y medicina:

List of the data sources and numbers thereof, in data curated for the study.
En total, se entrenaron doce modelos para la prueba. Los tres modelos base fueron LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; y Gemma 7B-it), de los cuales se crearon nueve variantes ajustadas, cada una adaptada para imitar un dominio o estilo de autor diferente, utilizando datos específicos del dominio:

Statistics of the evaluation dataset, where ‘FT Domain’ refers to the domain used during fine-tuning and ‘base’ indicates no fine-tuning.
En total, por lo tanto, tres modelos base se ajustaron utilizando técnicas de ajuste completo y LoRA en tres dominios distintos en cada uno de dos escenarios de uso: escritura de resúmenes académicos y respuesta a preguntas. Para reflejar los desafíos de detección del mundo real, los modelos ajustados en datos de ciencias de la computación se excluyeron de las pruebas de escritura, mientras que los ajustados en datos de finanzas se excluyeron de las evaluaciones de respuesta a preguntas.
Los marcos rivales seleccionados fueron RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; y DeTeCtive.
PhantomHunter se entrenó utilizando dos tipos de capas de redes neuronales: tres capas convolucionales con max-pooling para capturar patrones de texto locales, y dos capas de transformador con cuatro cabezas de atención cada una para modelar relaciones de largo alcance.
Para el aprendizaje contrastivo, que alienta al sistema a distinguir entre diferentes familias de modelos, el parámetro temperatura se estableció en 0,07.
El objetivo de entrenamiento combinó tres términos de pérdida: L1 (para la clasificación de familias) y L2 (para la detección binaria), cada uno ponderado en 1,0, y L3 (para el aprendizaje contrastivo), ponderado en 0,5.
El modelo se optimizó utilizando Adam con una tasa de aprendizaje de 2e-5 y un tamaño de lote de 32. El entrenamiento se llevó a cabo durante diez épocas completas, con el punto de control mejor performing seleccionado utilizando un conjunto de validación. Todos los experimentos se llevaron a cabo en un servidor con cuatro GPU NVIDIA A100.
Las métricas utilizadas fueron puntuación F1 para cada subconjunto de prueba, junto con tasa de verdaderos positivos, para comparar con detectores comerciales.

F1 scores for detecting text from unseen fine-tuned language models. The top two results in each category are in bold/ underlined. ‘BFE’ refers to base probability feature extraction, ‘CL’ to contrastive learning, and ‘MoE’ to the mixture-of-experts module.
Los resultados de la prueba inicial, visualizados en la tabla anterior, muestran que PhantomHunter superó a todos los sistemas de referencia, manteniendo puntuaciones F1 por encima del 90% para texto generado tanto por humanos como por máquinas, incluso cuando se evaluó en salidas de modelos ajustados excluidos del entrenamiento.
Los autores comentan:
‘Con el ajuste completo, PhantomHunter mejora la puntuación MacF1 en un 3,65% y un 2,96% en ambos conjuntos de datos, respectivamente; y con el ajuste LoRA, las mejoras son del 2,01% y del 6,09% respectivamente.
‘El resultado demuestra la poderosa capacidad de detección de PhantomHunter para textos generados por LLM ajustados no vistos.’
Se realizaron estudios de ablation para evaluar el papel de cada componente principal en PhantomHunter. Cuando se eliminaron elementos individuales, como el extractor de características, el codificador contrastivo o el clasificador de mezcla de expertos, se observó una caída consistente en la precisión, lo que indica que la arquitectura se basa en la coordinación de todas las partes.
Los autores también examinaron si PhantomHunter podría generalizarse más allá de su distribución de entrenamiento, y determinaron que incluso cuando se aplicó a salidas de modelos base que estaban completamente ausentes durante el entrenamiento, siguió superando a los métodos rivales – lo que sugiere que las firmas de familia siguen siendo detectables a través de variantes ajustadas.
Conclusión
Un argumento a favor de los modelos de lenguaje generativos entrenados por el usuario es que al menos estos ajustes y LoRAs pequeños conservan el sabor y las excentricidades individuales de un autor, en un clima en el que el lenguaje genérico inspirado en SEO de los chatbots de IA amenaza con genéricizar cualquier lenguaje donde la IA se convierte en un contribuyente importante o dominante.
Con la desvalorización del ensayo universitario, y con los estudiantes que ahora transmiten en vivo sesiones de escritura masivas para demostrar que no utilizaron IA en sus presentaciones, más profesores fuera de Europa (donde los exámenes orales están normalizados) están considerando exámenes cara a cara como una alternativa a los textos presentados. Más recientemente, se ha propuesto un regreso al trabajo escrito a mano.
Argumentablemente, ambas soluciones son superiores a lo que amenaza con ser una carrera armamentística de LLM basada en IA; aunque vienen con el costo de esfuerzo y atención humanos, que la cultura tecnológica está tratando actualmente de automatizar. † Por favor, consulte la sección final después de los resultados principales, en el documento de investigación, para obtener más detalles sobre esto. * Mi conversión de las citas en línea de los autores a hipervínculos. Énfasis del texto de los autores, no mío. Publicado por primera vez el jueves 19 de junio de 2025.












