Ángulo de Anderson

Las consultas impertinentes podrían aumentar los costos de ChatGPT para las empresas

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

Las respuestas de ChatGPT consumen más tokens cuando se es grosero con él, lo que aumenta la factura de la empresa; pero decir “por favor” puede reducir los costos.

 

Se dice que la cortesía no cuesta nada; pero ¿cuánto cuesta la descortesía? En cuanto a pagar por ChatGPT, quite mucho, según un nuevo estudio de EE. UU. El nuevo documento, de la Universidad de Iowa, encuentra que ser grosero con ChatGPT aumenta el costo de las respuestas, incluso si las respuestas son las mismas para consultas corteses y no corteses.

Los autores afirman:

‘El precio de los tokens de salida es de $12 por 1 millón de tokens de salida para GPT4. Encontramos que las solicitudes no corteses llevan a más de 14 tokens extra, lo que equivale a un costo adicional de $0,000168 por solicitud en promedio. Las consultas diarias promedio a la API de OpenAI superan los 2.200 millones.

‘En comparación con un escenario en el que todas las solicitudes son corteses, cuando en cambio las solicitudes no son corteses, esto genera un ingreso adicional de $369.000 por día, simplemente debido al aumento en los tokens que las solicitudes no corteses generan en el resultado.’

Aunque el resultado es interesante en sí mismo, los autores enfatizan que este comportamiento inusual podría indicar una variedad de rarezas desconocidas en la configuración humano/IA, algunas o todas las cuales también pueden tener implicaciones financieras. En cuanto a la razón por la que la grosería cuesta a los clientes tokens adicionales, los autores no especulan.

Para establecer la veracidad del síndrome, reescribieron las solicitudes reales de ChatGPT, alternando los valores de cortesía, mientras conservaban el significado. Ambas versiones se introdujeron en GPT-4-Turbo, y se midieron las diferencias en la cantidad de tokens de salida utilizados para las respuestas.

Las conclusiones sacadas son un contraste marcado con los eventos de titulares de principios de año, donde Sam Altman se quejó de que la cortesía estaba costando a OpenAI potencialmente ‘decenas de millones’ de dólares en términos de procesamiento de tokens relacionados con la cortesía (como ‘por favor’). La investigación publicada en el mismo período también indicó que la cortesía no tenía valor en términos de obtener mejores respuestas (aunque no comentó sobre respuestas más baratas).

Si las conclusiones del nuevo documento son correctas, cualquier usuario empresarial de ChatGPT que siguió esa línea de pensamiento habría gastado más en inferencia de ChatGPT en 2025 que los usuarios que ofrecieron una cortesía mínima en los intercambios de ChatGPT.

Los autores sugieren que una posible solución sería establecer un límite de tokens en las respuestas, aunque este no es un enfoque que los sistemas LLM puedan implementar fácilmente. Observan que la solicitud es una herramienta débil para el control de costos, porque los LLM luchan por obedecer instrucciones de longitud explícitas. En la mayoría de los casos, esta directiva de “limitación” no se obedecería; además, la respuesta podría truncarse, porque los LLM de este tipo están adivinando la próxima palabra probable en una oración/párrafo, y, como tal, no saben cómo termina la historia, o dónde termina la historia, hasta que el procesamiento esté completo. Por lo tanto, tienen una capacidad limitada para “dar marcha atrás” a cualquier mecanismo en progreso a petición.

Sin una solución exacta, aunque sugiriendo que se deben aplicar enfoques de precios más transparentes en casos de este tipo, los autores concluyen:

‘La sabiduría convencional sugiere que la cortesía en la solicitud es innecesaria cuando se interactúa con LLM.

‘En contraste, nuestro trabajo demuestra que las solicitudes no corteses aumentan los tokens de salida, generando costos adicionales para los adoptantes de IA empresariales.’

El nuevo documento se titula Transparencia de costos en la adopción de IA empresarial, y proviene de tres investigadores de la Universidad de Iowa.

Método

Los datos para el sistema se obtuvieron del conjunto de datos WildChat, que comprende una colección de 1 millón de conversaciones entre usuarios y ChatGPT, y cuenta con más de 2,5 millones de turnos de interacción:

Desde un sitio de apoyo para el proyecto WildChat, ejemplos de interacciones de ChatGPT que se pueden buscar. Fuente: https://wildvisualizer.com/

Desde un sitio de apoyo para el proyecto WildChat, ejemplos de interacciones de ChatGPT que se pueden buscar. Fuente

Los autores observan que WildChat contiene una cantidad mayor de interacciones naturales que en algunos conjuntos más curados.

Eligen 20.000 solicitudes en inglés del intercambio de GPT-4, descartando la salida en cada caso (ya que la intención era alimentar las solicitudes nuevamente para obtener respuestas nuevas). Solo se eligió la primera interacción, incluso de intercambios más largos,

El conjunto resultante se filtró en categorías cortés o no cortés, con todas las solicitudes clasificadas por GPT-4-Turbo. Los investigadores utilizaron el modelo en sí para decidir si una solicitud era cortés o no porque la percepción del modelo de la cortesía era central para el experimento.

Las solicitudes etiquetadas como cortés podían incluir señales claras como la palabra ‘por favor’, o podían ser corteses de una manera más indirecta. Cualquier cosa que no se reconociera como cortés se clasificó como no cortés, incluso si la redacción era neutral en lugar de antagonista.

Para estudiar cómo el modelo respondía a la cortesía, no se podían utilizar métodos estándar (es decir, que tratan el texto como un conjunto de características medibles): ya que la cortesía estaba incrustada en la redacción en sí, resumir una solicitud como una lista de rasgos habría perdido contexto importante.

En su lugar, cada solicitud se reescribió para revertir su tono, con todos los demás elementos conservados lo más similares posible, lo que permitió comparar entre pares que difirieron solo en cortesía:

Ejemplos de cómo se transformaron las solicitudes corteses y no corteses en sus versiones contrapartidas, conservando el significado semántico.

Ejemplos de cómo se transformaron las solicitudes corteses y no corteses en sus versiones contrapartidas, conservando el significado semántico. Fuente

Pruebas

Cada solicitud original se emparejó con una versión reescrita que difirió solo en su nivel de cortesía, y ambas versiones se presentaron al mismo modelo GPT-4-Turbo a través de llamadas de API separadas. Se registró la cantidad de tokens producidos en respuesta a cada versión, y la diferencia entre ellos se trató como la medida de cómo el tono influyó en el costo (tokens).

Temperatura se mantuvo constante para prevenir la variación aleatoria, y se conservaron los pares de solicitudes solo cuando la reescritura alteró la entrada en no más de cinco tokens. Esto aseguró que el efecto que se estaba estudiando surgiera de tono, en lugar de cualquier cambio más amplio en la redacción:

Estadísticas resumidas que muestran que las solicitudes corteses resultaron en menos tokens de salida en promedio que las solicitudes no corteses, a pesar de tener ligeramente más tokens de entrada.

Estadísticas resumidas que muestran que las solicitudes corteses resultaron en menos tokens de salida en promedio que las solicitudes no corteses, a pesar de tener ligeramente más tokens de entrada.

Los resultados principales de la primera ronda de pruebas indicaron que el uso de una solicitud cortés reduce la longitud de la salida de tokens en 14,426 tokens:

Resultados de estimación que describen el efecto de la solicitud cortés en la longitud de la salida de tokens.

Resultados de estimación que describen el efecto de la solicitud cortés en la longitud de la salida de tokens.

El análisis se repitió en tres subconjuntos de solicitudes corteses para probar la robustez: solicitudes que utilizaban marcadores explícitos como ‘por favor’ o ‘gracias’; aquellas que utilizaban solo ‘por favor’; y aquellas con cortesía implícita, como ‘¿puedes’ o ‘¿podrías’?

Resultados de estimación basados en tipos de cortesía.

Resultados de estimación basados en tipos de cortesía.

Para validar la robustez de los hallazgos principales, se realizó una clasificación secundaria de la cortesía de la solicitud utilizando el marco LIWC, que proporciona una puntuación determinista y repetible para características lingüísticas.

A diferencia de la clasificación probabilística de GPT, LIWC puede asignar una puntuación de cortesía estable a cada solicitud, lo que permite evaluar la coherencia en diferentes métodos. En esta parte de las pruebas, las solicitudes se etiquetaron como cortés si su puntuación de cortesía LIWC era mayor que cero, y como no cortés de lo contrario.

Cuando se midió la coincidencia entre las clasificaciones de GPT y LIWC, se observó una tasa de coincidencia del 81%. Si bien no es una medida de precisión, este acuerdo proporcionó apoyo para la coherencia entre los sistemas.

Cuando solo se analizaron las solicitudes con etiquetas de cortesía coincidentes de GPT y LIWC, las solicitudes corteses aún llevaron a 14 tokens de salida menos; y cuando la cortesía se midió en una escala de deslizamiento, cada paso hacia arriba en la cortesía redujo la salida en cinco tokens en promedio:

Ahorros de tokens de la cortesía que se mantuvieron cuando se reclasificaron con LIWC, tanto como etiqueta binaria como puntuación continua.

Ahorros de tokens de la cortesía que se mantuvieron cuando se reclasificaron con LIWC, tanto como etiqueta binaria como puntuación continua.

Resiliencia

Para evaluar si el efecto de la cortesía variaba en diferentes tipos de solicitudes, cada solicitud se asignó a una de varias categorías de tareas predefinidas: buscando información; generación de texto; edición y reescritura; clasificación; resumen; y tareas técnicas.

Cada solicitud se asignó una etiqueta de tarea comparando su incrustación con las de descripciones de tareas predefinidas, utilizando el modelo all-MiniLM-L6-v2 Sentence Transformers.

Se calcularon las puntuaciones de similitud coseno entre cada solicitud y el conjunto de definiciones de tareas, y se asignó la etiqueta con la mayor similitud.

Los tipos de tareas se repusieron como variables de control en la regresión, para probar si el efecto de la cortesía variaba según la categoría de la solicitud, y se introdujeron términos de interacción entre la tarea y el tratamiento, para comprobar los efectos diferenciales.

En ambos casos, las solicitudes corteses produjeron consistentemente salidas más cortas, y no se encontró variación significativa en los tipos de tareas:

Resultados de regresión que demuestran que las solicitudes corteses redujeron la longitud de la salida en todos los tipos de tareas, sin efectos de interacción significativos.

Resultados de regresión que demuestran que las solicitudes corteses redujeron la longitud de la salida en todos los tipos de tareas, sin efectos de interacción significativos.


Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai