Modelos y plataformas de IA
MARKLLM: Una herramienta de marca de agua de cÃģdigo abierto para LLM
La marca de agua de LLM, que integra seÃąales imperceptibles pero detectables dentro de las salidas del modelo para identificar el texto generado por LLM, es vital para prevenir el mal uso de los grandes modelos de lenguaje. Estas tÃĐcnicas de marca de agua se dividen principalmente en dos categorÃas: la familia KGW y la familia Christ. La familia KGW modifica los logits producidos por el LLM para crear una salida con marca de agua al categorizar el vocabulario en una lista verde y una lista roja en funciÃģn del token anterior. Se introduce un sesgo en los logits de los tokens de la lista verde durante la generaciÃģn de texto, favoreciendo estos tokens en el texto producido. Luego, se calcula una mÃĐtrica estadÃstica a partir de la proporciÃģn de palabras verdes, y se establece un umbral para distinguir entre texto con marca de agua y texto sin marca de agua. Las mejoras al mÃĐtodo KGW incluyen una mejor particiÃģn de listas, una mejor manipulaciÃģn de logits, una mayor capacidad de informaciÃģn de marca de agua, resistencia a los ataques de eliminaciÃģn de marca de agua y la capacidad de detectar marcas de agua pÚblicamente.
Por otro lado, la familia Christ altera el proceso de muestreo durante la generaciÃģn de texto de LLM, incorporando una marca de agua al cambiar la forma en que se seleccionan los tokens. Ambas familias de marca de agua tienen como objetivo equilibrar la detectabilidad de la marca de agua con la calidad del texto, abordando desafÃos como la robustez en entornos de entropÃa variables, el aumento de la capacidad de informaciÃģn de marca de agua y la protecciÃģn contra intentos de eliminaciÃģn. La investigaciÃģn reciente se ha centrado en refinar la particiÃģn de listas y la manipulaciÃģn de logits, mejorar la capacidad de informaciÃģn de marca de agua, desarrollar mÃĐtodos para resistir la eliminaciÃģn de marca de agua y permitir la detecciÃģn pÚblica. En Última instancia, la marca de agua de LLM es crucial para el uso ÃĐtico y responsable de los grandes modelos de lenguaje, proporcionando un mÃĐtodo para rastrear y verificar el texto generado por LLM. Las familias KGW y Christ ofrecen dos enfoques distintos, cada uno con sus propias fortalezas y aplicaciones, que evolucionan continuamente a travÃĐs de la investigaciÃģn y la innovaciÃģn en curso.
Debido a la capacidad de los marcos de marca de agua de LLM para incorporar seÃąales detectables algorÃtmicamente en las salidas del modelo para identificar el texto generado por un marco de LLM, estÃĄ desempeÃąando un papel crucial en la mitigaciÃģn de los riesgos asociados con el mal uso de los grandes modelos de lenguaje. Sin embargo, hay una abundancia de marcos de marca de agua de LLM en el mercado actualmente, cada uno con sus propias perspectivas y procedimientos de evaluaciÃģn, lo que hace que sea difÃcil para los investigadores experimentar con estos marcos de manera fÃĄcil. Para contrarrestar este problema, MarkLLM, una herramienta de marca de agua de cÃģdigo abierto, ofrece un marco extensible y unificado para implementar algoritmos de marca de agua de LLM, mientras proporciona interfaces de usuario amigables para garantizar la facilidad de uso y el acceso. AdemÃĄs, el marco de MarkLLM admite la visualizaciÃģn automÃĄtica de los mecanismos de estos marcos, lo que mejora la comprensiÃģn de estos modelos. El marco de MarkLLM ofrece una suite integral de 12 herramientas que cubren tres perspectivas, junto con dos tuberÃas de evaluaciÃģn automatizadas para evaluar su rendimiento. Este artÃculo tiene como objetivo cubrir el marco de MarkLLM en profundidad, y exploramos el mecanismo, la metodologÃa, la arquitectura del marco, junto con su comparaciÃģn con los marcos de estado del arte. Asà que comencemos.
MarkLLM: Una herramienta de marca de agua de LLM
El surgimiento de marcos de grandes modelos de lenguaje como LLaMA, GPT-4, ChatGPT y mÃĄs ha avanzado significativamente la capacidad de los modelos de IA para realizar tareas especÃficas, incluyendo la escritura creativa, la comprensiÃģn de contenido, la formaciÃģn de recuperaciÃģn y mucho mÃĄs. Sin embargo, junto con los beneficios notables asociados con la habilidad excepcional de los grandes modelos de lenguaje actuales, ciertos riesgos han surgido, incluyendo la escritura de artÃculos acadÃĐmicos fantasma, las noticias y representaciones falsas generadas por LLM, y la impersonaciÃģn individual, por nombrar algunos. Dado que los riesgos asociados con estos problemas, es vital desarrollar mÃĐtodos confiables con la capacidad de distinguir entre el contenido generado por LLM y el contenido humano, un requisito importante para garantizar la autenticidad de la comunicaciÃģn digital y prevenir la propagaciÃģn de informaciÃģn errÃģnea. Durante los Últimos aÃąos, la marca de agua de LLM se ha recomendado como una de las soluciones prometedoras para distinguir el contenido generado por LLM del contenido humano, y al incorporar caracterÃsticas distintas durante el proceso de generaciÃģn de texto, las salidas de LLM se pueden identificar de forma Única utilizando detectores diseÃąados especialmente. Sin embargo, debido a la proliferaciÃģn y los algoritmos relativamente complejos de los marcos de marca de agua de LLM, junto con la diversificaciÃģn de las mÃĐtricas de evaluaciÃģn y las perspectivas, ha sido increÃblemente difÃcil experimentar con estos marcos.
Para salvar la brecha actual, el marco de MarkLLM intenta hacer las siguientes contribuciones. MarkLLM ofrece interfaces consistentes y amigables para cargar algoritmos, generar texto con marca de agua, realizar procesos de detecciÃģn y recopilar datos para la visualizaciÃģn. Proporciona soluciones de visualizaciÃģn personalizadas para ambas familias de algoritmos de marca de agua principales, lo que permite a los usuarios ver cÃģmo funcionan diferentes algoritmos bajo diversas configuraciones con ejemplos del mundo real. La herramienta incluye un mÃģdulo de evaluaciÃģn integral con 12 herramientas que abordan la detectabilidad, la robustez y el impacto en la calidad del texto. AdemÃĄs, cuenta con dos tipos de tuberÃas de evaluaciÃģn automatizadas que admiten la personalizaciÃģn de conjuntos de datos, modelos, mÃĐtricas de evaluaciÃģn y ataques, lo que facilita evaluaciones flexibles y exhaustivas. DiseÃąado con una arquitectura modular y suelta, MarkLLM mejora la escalabilidad y la flexibilidad. Esta elecciÃģn de diseÃąo admite la integraciÃģn de nuevos algoritmos, tÃĐcnicas de visualizaciÃģn innovadoras y la extensiÃģn de la herramienta de evaluaciÃģn por parte de desarrolladores futuros.
Se han propuesto numerosos algoritmos de marca de agua, pero sus enfoques de implementaciÃģn Únicos a menudo priorizan requisitos especÃficos sobre la estandarizaciÃģn, lo que conduce a varios problemas
- Falta de estandarizaciÃģn en el diseÃąo de clases: Esto requiere un esfuerzo significativo para optimizar o ampliar mÃĐtodos existentes debido a diseÃąos de clases insuficientemente estandarizados.
- Falta de uniformidad en las interfaces de llamada de nivel superior: Las interfaces inconsistentes hacen que el procesamiento por lotes y la replicaciÃģn de diferentes algoritmos sean engorrosos y laboriosos.
- Problemas de estÃĄndar de cÃģdigo: Los desafÃos incluyen la necesidad de modificar ajustes en mÚltiples segmentos de cÃģdigo y documentaciÃģn inconsistente, lo que complica la personalizaciÃģn y el uso efectivo. Los valores codificados de forma rÃgida y el manejo de errores inconsistentes dificultan aÚn mÃĄs los esfuerzos de adaptaciÃģn y depuraciÃģn.
Para abordar estos problemas, nuestra herramienta ofrece un marco de implementaciÃģn unificado que permite la invocaciÃģn conveniente de varios algoritmos de estado del arte bajo configuraciones flexibles. AdemÃĄs, nuestra estructura de clase diseÃąada meticulosamente allana el camino para futuras extensiones. La siguiente figura demuestra el diseÃąo de este marco de implementaciÃģn unificado.
Debido al diseÃąo distributivo del marco, es sencillo para los desarrolladores agregar interfaces de nivel superior adicionales a cualquier clase de algoritmo de marca de agua especÃfica sin preocuparse por afectar otros algoritmos.
MarkLLM: Arquitectura y MetodologÃa
Las tÃĐcnicas de marca de agua de LLM se dividen principalmente en dos categorÃas: la familia KGW y la familia Christ. La familia KGW modifica los logits producidos por el LLM para crear una salida con marca de agua al categorizar el vocabulario en una lista verde y una lista roja en funciÃģn del token anterior. Se introduce un sesgo en los logits de los tokens de la lista verde durante la generaciÃģn de texto, favoreciendo estos tokens en el texto producido. Luego, se calcula una mÃĐtrica estadÃstica a partir de la proporciÃģn de palabras verdes, y se establece un umbral para distinguir entre texto con marca de agua y texto sin marca de agua. Las mejoras al mÃĐtodo KGW incluyen una mejor particiÃģn de listas, una mejor manipulaciÃģn de logits, una mayor capacidad de informaciÃģn de marca de agua, resistencia a los ataques de eliminaciÃģn de marca de agua y la capacidad de detectar marcas de agua pÚblicamente.
Por otro lado, la familia Christ altera el proceso de muestreo durante la generaciÃģn de texto de LLM, incorporando una marca de agua al cambiar la forma en que se seleccionan los tokens. Ambas familias de marca de agua tienen como objetivo equilibrar la detectabilidad de la marca de agua con la calidad del texto, abordando desafÃos como la robustez en entornos de entropÃa variables, el aumento de la capacidad de informaciÃģn de marca de agua y la protecciÃģn contra intentos de eliminaciÃģn. La investigaciÃģn reciente se ha centrado en refinar la particiÃģn de listas y la manipulaciÃģn de logits, mejorar la capacidad de informaciÃģn de marca de agua, desarrollar mÃĐtodos para resistir la eliminaciÃģn de marca de agua y permitir la detecciÃģn pÚblica. En Última instancia, la marca de agua de LLM es crucial para el uso ÃĐtico y responsable de los grandes modelos de lenguaje, proporcionando un mÃĐtodo para rastrear y verificar el texto generado por LLM. Las familias KGW y Christ ofrecen dos enfoques distintos, cada uno con sus propias fortalezas y aplicaciones, que evolucionan continuamente a travÃĐs de la investigaciÃģn y la innovaciÃģn en curso.
EvaluaciÃģn Integral Automatizada
Evaluar un algoritmo de marca de agua de LLM es una tarea compleja. Primero, requiere la consideraciÃģn de varios aspectos, incluyendo la detectabilidad de la marca de agua, la robustez contra la manipulaciÃģn y el impacto en la calidad del texto. En segundo lugar, las evaluaciones desde cada perspectiva pueden requerir diferentes mÃĐtricas, escenarios de ataque y tareas. AdemÃĄs, realizar una evaluaciÃģn generalmente implica mÚltiples pasos, como la selecciÃģn de modelo y conjunto de datos, la generaciÃģn de texto con marca de agua, el procesamiento posterior, la detecciÃģn de marca de agua, la manipulaciÃģn del texto y el cÃĄlculo de la mÃĐtrica. Para facilitar la evaluaciÃģn conveniente y exhaustiva de los algoritmos de marca de agua de LLM, MarkLLM ofrece doce herramientas amigables para el usuario, incluyendo varios calculadores de mÃĐtricas y atacantes que cubren las tres perspectivas de evaluaciÃģn mencionadas. AdemÃĄs, MarkLLM proporciona dos tipos de tuberÃas de demostraciÃģn automatizadas, cuyos mÃģdulos se pueden personalizar y ensamblar de forma flexible, lo que permite una fÃĄcil configuraciÃģn y uso.
En cuanto al aspecto de la detectabilidad, la mayorÃa de los algoritmos de marca de agua requieren finalmente especificar un umbral para distinguir entre textos con marca de agua y textos sin marca de agua. Proporcionamos un calculador bÃĄsico de tasa de ÃĐxito utilizando un umbral fijo. AdemÃĄs, para minimizar el impacto de la selecciÃģn del umbral en la detectabilidad, tambiÃĐn ofrecemos un calculador que admite la selecciÃģn dinÃĄmica del umbral. Esta herramienta puede determinar el umbral que produce la mejor puntuaciÃģn F1 o seleccionar un umbral en funciÃģn de una tasa de falsos positivos (FPR) objetivo especificada por el usuario.
En cuanto al aspecto de la robustez, MarkLLM ofrece tres ataques de manipulaciÃģn de texto a nivel de palabra: eliminaciÃģn aleatoria de palabras a una proporciÃģn especificada, sustituciÃģn aleatoria de sinÃģnimos utilizando WordNet como conjunto de sinÃģnimos y sustituciÃģn de sinÃģnimos consciente del contexto utilizando BERT como modelo de incrustaciÃģn. AdemÃĄs, se proporcionan dos ataques de manipulaciÃģn de texto a nivel de documento: parafrasear el contexto a travÃĐs de la API de OpenAI o el modelo Dipper. En cuanto al aspecto de la calidad del texto, MarkLLM ofrece dos herramientas de anÃĄlisis directo: un calculador de perplexidad para medir la fluidez y un calculador de diversidad para evaluar la variabilidad de los textos. Para analizar el impacto de la marca de agua en la utilidad del texto en tareas especÃficas, proporcionamos un calculador de BLEU para tareas de traducciÃģn automÃĄtica y un juez de aprobaciÃģn o no para tareas de generaciÃģn de cÃģdigo. AdemÃĄs, dado que los mÃĐtodos actuales para comparar la calidad del texto con marca de agua y sin marca de agua incluyen el uso de un LLM mÃĄs fuerte para el juicio, MarkLLM tambiÃĐn ofrece un discriminador GPT, que utiliza GPT-4 para comparar la calidad del texto.
TuberÃas de EvaluaciÃģn
Para facilitar la evaluaciÃģn automatizada de los algoritmos de marca de agua de LLM, MarkLLM proporciona dos tuberÃas de evaluaciÃģn: una para evaluar la detectabilidad de la marca de agua con y sin ataques, y otra para analizar el impacto de estos algoritmos en la calidad del texto. Siguiendo este proceso, hemos implementado dos tuberÃas: WMDetect3 y UWMDetect4. La principal diferencia entre ellas radica en la fase de generaciÃģn de texto. La primera requiere el uso del mÃĐtodo generate_watermarked_text del algoritmo de marca de agua, mientras que la segunda depende del parÃĄmetro text_source para determinar si recuperar directamente texto natural de un conjunto de datos o invocar el mÃĐtodo generate_unwatermarked_text.
Para evaluar el impacto de la marca de agua en la calidad del texto, se generan pares de textos con marca de agua y sin marca de agua. Los textos, junto con otras entradas necesarias, se procesan y se alimentan a un analizador de calidad de texto designado para producir resultados de anÃĄlisis y comparaciÃģn detallados. Siguiendo este proceso, hemos implementado tres tuberÃas para diferentes escenarios de evaluaciÃģn:
- DirectQual.5: Esta tuberÃa estÃĄ diseÃąada especÃficamente para analizar la calidad del texto comparando directamente las caracterÃsticas de los textos con marca de agua con las de los textos sin marca de agua. EvalÚa mÃĐtricas como la perplexidad (PPL) y la diversidad logarÃtmica, sin necesidad de textos de referencia externos.
- RefQual.6: Esta tuberÃa evalÚa la calidad del texto comparando tanto los textos con marca de agua como los textos sin marca de agua con un texto de referencia comÚn. Mide el grado de similitud o desviaciÃģn del texto de referencia, lo que la hace ideal para escenarios que requieren tareas especÃficas de evaluaciÃģn de la calidad del texto, como la traducciÃģn automÃĄtica y la generaciÃģn de cÃģdigo.
- ExDisQual.7: Esta tuberÃa emplea un juez externo, como GPT-4 (OpenAI, 2023), para evaluar la calidad de los textos con marca de agua y sin marca de agua. El discriminador evalÚa los textos en funciÃģn de las descripciones de tareas proporcionadas por el usuario, identificando cualquier posible degradaciÃģn o preservaciÃģn de la calidad debido a la marca de agua. Este mÃĐtodo es particularmente valioso cuando se requiere un anÃĄlisis avanzado y basado en IA de los efectos sutiles de la marca de agua.
MarkLLM: Experimentos y Resultados
Para evaluar su rendimiento, el marco de MarkLLM realiza evaluaciones en nueve algoritmos diferentes y evalÚa su impacto, robustez y detectabilidad en la calidad del texto.

La tabla anterior contiene los resultados de la evaluaciÃģn de la detectabilidad de nueve algoritmos compatibles con MarkLLM. Se emplea un ajuste de umbral dinÃĄmico para evaluar la detectabilidad de la marca de agua, con tres configuraciones proporcionadas: bajo una tasa de FPR del 10%, bajo una tasa de FPR del 1% y bajo condiciones para el rendimiento Ãģptimo de la puntuaciÃģn F1. Se generan 200 textos con marca de agua, mientras que 200 textos sin marca de agua sirven como ejemplos negativos. Proporcionamos la tasa de verdaderos positivos (TPR) y la puntuaciÃģn F1 bajo ajustes de umbral dinÃĄmicos para el 10% y el 1% de FPR, junto con la tasa de verdaderos negativos (TNR), la tasa de falsos positivos (FPR), la tasa de falsos negativos (FNR), la precisiÃģn (P), la recuperaciÃģn (R), la puntuaciÃģn F1, la exactitud (ACC) en el rendimiento Ãģptimo. La siguiente tabla contiene los resultados de la evaluaciÃģn de la robustez de nueve algoritmos compatibles con MarkLLM. Para cada ataque, se generan 200 textos con marca de agua y se manipulan, con 200 textos sin marca de agua adicionales que sirven como ejemplos negativos. Informamos la tasa de verdaderos positivos (TPR) y la puntuaciÃģn F1 en el rendimiento Ãģptimo bajo cada circunstancia.

Pensamientos Finales
En este artÃculo, hemos hablado sobre MarkLLM, una herramienta de marca de agua de cÃģdigo abierto que ofrece un marco extensible y unificado para implementar algoritmos de marca de agua de LLM, mientras proporciona interfaces de usuario amigables para garantizar la facilidad de uso y el acceso. AdemÃĄs, el marco de MarkLLM admite la visualizaciÃģn automÃĄtica de los mecanismos de estos marcos, lo que mejora la comprensiÃģn de estos modelos. El marco de MarkLLM ofrece una suite integral de 12 herramientas que cubren tres perspectivas, junto con dos tuberÃas de evaluaciÃģn automatizadas para evaluar su rendimiento.












