Ángulo de Anderson

Las consultas impertinentes podrían aumentar los costos de ChatGPT para las empresas

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

el costo de las respuestas, incluso si las respuestas son las mismas para consultas corteses y no corteses. Los autores afirman: ‘El precio de los tokens

 

Las respuestas de ChatGPT consumen más tokens cuando se es grosero con él, lo que aumenta la factura de la empresa; pero decir “por favor” puede reducir los costos. Se dice que la cortesía no cuesta nada; pero ¿cuánto cuesta la descortesía? En cuanto a pagar por ChatGPT, quite mucho, según un nuevo estudio de EE. UU. El nuevo documento, de la Universidad de Iowa, encuentra que ser grosero con ChatGPT aumenta

de salida es de $12 por 1 millón de tokens de salida para GPT4. Encontramos que las solicitudes no corteses llevan a más de 14 tokens extra, lo que equivale a un costo adicional de $0,000168 por solicitud en promedio. Las consultas diarias promedio a la API de OpenAI superan los 2.200 millones. Aunque el resultado es

tokens que las solicitudes no corteses generan en el resultado.’ Para establecer la veracidad del síndrome, reescribieron las solicitudes reales de ChatGPT, alternando los valores de cortesía, mientras conservaban el significado. Ambas versiones se introdujeron en GPT-4-Turbo , y se midieron las diferencias en la

interesante en sí mismo, los autores enfatizan que este comportamiento inusual podría indicar una variedad de rarezas desconocidas en la configuración humano/IA, algunas o todas las cuales también pueden tener implicaciones financieras. En cuanto a la razón por la que la grosería cuesta a los clientes tokens adicionales, los autores no especulan. ‘En comparación con un escenario en el que todas las solicitudes son corteses, cuando en cambio las solicitudes no son corteses, esto genera un ingreso adicional de $369.000 por día, simplemente debido al aumento en los cantidad de tokensde salida utilizados para las respuestas. Las conclusiones sacadas son un contraste marcado con los eventos de titulares de principios de año, donde Sam Altman se quejó de que la cortesía estaba costando a OpenAI potencialmente ‘decenas de millones’ de dólares en términos de procesamiento de tokens relacionados con la cortesía (como ). La investigación ‘por publicadafavor’ en el mismo período también indicó que la cortesía no tenía valor en términos de obtener mejores respuestas (aunque no comentó sobre ). respuestas más baratas Si las exacta, conclusiones del nuevo documento son correctas, cualquier usuario empresarial de ChatGPT que siguió esa línea de pensamiento habría gastado más en inferencia de ChatGPT en 2025 que los usuarios que ofrecieron una cortesía mínima en los intercambios de ChatGPT. Los autores sugieren que una posible solución sería establecer un límite de tokens en las respuestas, aunque este no es un enfoque que los sistemas LLM puedan implementar fácilmente. Observan que la solicitud es una herramienta débil para el control de costos, porque los LLM Sin una solución aunque sugiriendo que se deben aplicar enfoquesde precios más transparentes en casos de este tipo, los autores concluyen: luchan por obedecer instrucciones de longitud explícitas . En la mayoría de los casos, esta directiva de “limitación” no se obedecería; además, la respuesta podría truncarse, porque los LLM de este tipo están adivinando la próxima palabra cortesía probable en una oración/párrafo, y, como tal, no saben cómo termina la historia, o termina la historia, hasta que el procesamiento esté completo. Por lo tanto, tienen una capacidad limitada para “dar marcha atrás” a cualquier mecanismo en progreso a petición. dónde ‘La sabiduría convencional sugiere que la

en la solicitud es innecesaria cuando se interactúa con LLM. El ‘En contraste, nuestro

demuestra que las solicitudes no corteses aumentan los tokens de salida, generando costos adicionales para los adoptantes de IA empresariales.’ nuevo

trabajo documento se titula , y costos en la adopción de IA empresarialproviene de tres investigadores de la Universidad de Iowa. Transparencia de

Método

Los datos para el sistema se obtuvieron del conjunto de datos WildChat , que comprende una colección de 1 millón de conversaciones entre usuarios y ChatGPT, y cuenta con más de

Desde un sitio de apoyo para el proyecto WildChat, ejemplos de interacciones de ChatGPT que se pueden buscar. Fuente: https://wildvisualizer.com/ 2,5 millones de turnos de interacción: Desde un sitio de apoyo para el proyecto WildChat,

ejemplos de interacciones de ChatGPT que se pueden buscar. Fuente Los autores observan que WildChat contiene una cantidad mayor de interacciones naturales que en algunos conjuntos más curados. Eligen 20.000 solicitudes en inglés del intercambio de GPT-4, descartando la salida en cada caso (ya que la intención era alimentar las solicitudes nuevamente para obtener respuestas nuevas). Solo se eligió la primera interacción, incluso de intercambios más largos, El conjunto resultante se filtró en categorías cortés o incluir señales , con todas las solicitudes clasificadas por GPT-4-Turbo. Los investigadores utilizaron el modelo en sí para decidir si una solicitud era cortés o no porque la percepción del modelo de la cortesía era central para el experimento. no cortés Las solicitudes etiquetadas como podían podían claras como la palabra cortés ‘por favor’ , o sercorteses de una manera más indirecta. Cualquier cosa que no se reconociera como se incluso clasificó como cortés , solo ensi la redacción era neutral en lugar de antagonista. no cortés Para estudiar cómo el modelo respondía a la cortesía, no se podían utilizar métodos estándar (es decir, que tratan el texto como un conjunto de características medibles): ya que la cortesía estaba incrustada en la redacción en sí, resumir una solicitud como una lista de rasgos habría perdido contexto importante. En su lugar, cada solicitud se reescribió para revertir su tono, con todos los demás elementos conservados lo más similares posible, lo que permitió comparar entre pares que difirieron

Ejemplos de cómo se transformaron las solicitudes corteses y no corteses en sus versiones contrapartidas, conservando el significado semántico. cortesía: Ejemplos de cómo se transformaron las solicitudes corteses y no corteses en sus versiones contrapartidas, conservando el significado semántico. Fuente

Pruebas

Cada solicitud original se emparejó con una versión reescrita que difirió solo en su nivel de cortesía, y ambas versiones se presentaron al mismo modelo GPT-4-Turbo a través de llamadas de API separadas. Se registró la cantidad de tokens producidos en respuesta a cada versión, y la diferencia entre ellos se trató como la medida de cómo el tono influyó en el costo (tokens). Temperatura se mantuvo constante para prevenir la

variación aleatoria, y se conservaron los pares de solicitudes solo cuando la reescritura alteró la entrada en no más de cinco tokens. Esto aseguró que el efecto que se estaba estudiando surgiera de , en lugar de cualquier cambio más muestran queamplio en la redacción: tono Estadísticas resumidas que

Estadísticas resumidas que muestran que las solicitudes corteses resultaron en menos tokens de salida en promedio que las solicitudes no corteses, a pesar de tener ligeramente más tokens de entrada. las solicitudes corteses resultaron en menos tokens de salida en promedio que las solicitudes no corteses, a pesar de tener ligeramente más tokens de entrada. Los resultados

principales de la primera ronda de pruebas indicaron que el uso de una solicitud cortés reduce la longitud de la salida de tokens en 14,426 tokens: Resultados

Resultados de estimación que describen el efecto de la solicitud cortés en la longitud de la salida de tokens. de estimación que describen el efecto de la solicitud cortés en la longitud de la salida de tokens.

El análisis se repitió en tres subconjuntos de solicitudes corteses para probar la robustez: solicitudes que utilizaban marcadores explícitos como o ‘por ; aquellas favor’ ‘gracias’ ; yque utilizaban solo favor’aquellas con ‘por o , como cortesía implícita ? ‘¿podrías’ Resultados ‘¿puedes’ estimación basadosde

Resultados de estimación basados en tipos de cortesía. en tipos de cortesía. Para validar la robustez

de los hallazgos principales, se realizó una clasificación secundaria de la cortesía de la solicitud utilizando el marco LIWC , que proporciona una puntuación deterministay repetible para características lingüísticas. A diferencia de la clasificación probabilística de GPT, LIWC puede asignar una puntuación de cortesía estable a cada solicitud, lo que permite evaluar la coherencia en diferentes métodos. En esta parte de las pruebas, las solicitudes se etiquetaron como si su puntuación de cortesía LIWC era midió mayor que cero, y como cortés de lo contrario. no cortés Cuando se , este la coincidencia entre las clasificaciones de GPT y LIWC, se observó una tasa de coincidencia del 81%. Si bien no es una medida de precisión acuerdo proporcionóapoyo para la coherencia entre los sistemas. Cuando solo se analizaron las solicitudes con etiquetas de cortesía coincidentes de GPT y LIWC, las solicitudes corteses aún llevaron a 14 tokens de salida menos; y cuando la cortesía se midió en una escala de deslizamiento, cada paso hacia arriba en la cortesía redujo la salida en cinco tokens en promedio:

Ahorros de tokens de la cortesía que se mantuvieron cuando se reclasificaron con LIWC, tanto como etiqueta binaria como puntuación continua. Ahorros de tokens de la cortesía que se mantuvieron cuando se reclasificaron con LIWC, tanto como etiqueta binaria como puntuación continua.

Resiliencia

Para evaluar si el efecto de la cortesía variaba en diferentes tipos de solicitudes, cada solicitud se asignó a una de varias categorías de tareas predefinidas: ; buscando generación deinformación ; edición ytexto reescritura ; ; clasificación; resumen .y técnicastareas Sentence Transformers .Cada solicitud se asignó una etiqueta de tarea comparando su incrustación con las de descripciones de tareas predefinidas, utilizando el modelo all-MiniLM-L6-v2 Se calcularon las puntuaciones de similitud coseno entre

cada solicitud y el conjunto de definiciones de tareas, y se asignó la etiqueta con la mayor similitud. Los tipos de tareas se repusieron como variables de control en la regresión, para probar si el efecto de la cortesía variaba según la categoría de la solicitud, y se introdujeron términos de interacción entre la tarea y el tratamiento, para comprobar los efectos diferenciales. En ambos casos, las solicitudes corteses produjeron consistentemente salidas más cortas, y no se encontró variación significativa en los tipos de tareas: Resultados de regresión que demuestran que las

Resultados de regresión que demuestran que las solicitudes corteses redujeron la longitud de la salida en todos los tipos de tareas, sin efectos de interacción significativos. solicitudes corteses redujeron la longitud de la salida en todos los tipos de tareas, sin efectos de interacción significativos. Para probar

si las respuestas más cortas de las solicitudes corteses reflejaban una reducción en la calidad, se compararon las salidas de las solicitudes originales y contrapartidas para la similitud semántica. Utilizando el modelo all-MiniLM-L6-v2, cada respuesta se incrustó en un espacio vectorial semántico , y se calculó lasimilitud coseno entre cada par, lo que produjo una similitud promedio de 0,78, lo que indica una fuerte alineación en el significado, y sugiere que el contenido se mantuvo consistente incluso cuando el tono cambió.

Palabras de parada

Para comprender qué tipo de contenido se reduce en salidas más cortas, se examinaron las palabras más comúnmente eliminadas. Estas se encontraron que eran palabras de parada comunes como , ‘tener’ ,, ‘más’ ‘dónde’y es, reduccionesdecir, términos que sirven para roles gramaticales en lugar de semánticos. ‘en’ Para confirmar que la reducción de tokens no estaba impulsada por la pérdida de contenido significativo, se eliminaron las palabras de parada, y se analizaron las frases de hasta cuatro palabras para la desaparición sistemática; sin embargo, no se encontraron patrones consistentes o semánticamente importantes, lo que sugiere que las de la redacción cortés Así, todavía parecía que se gastaban más tokens en respuestas a consultas groseras que en consultas corteses, como una especie de “impuesto” a la brusquedad. no estaban eliminando contenido significativo o útil.

Estudio humano

Para probar si la calidad de la salida se veía afectada por el tono de la solicitud, también se realizó una evaluación humana, utilizando una muestra aleatoria de de veinte pares una de las solicitudes y veinte pares de solicitudes corteses . no corteses Después de excluir las solicitudes sobre temas sensibles o técnicos, las respuestas se calificaron por 401 participantes en una escala de siete puntos. Cada participante solo vio una respuesta, extraída de condiciones: cuatro y noo cortés , original cortés o Las. contrapartida No se encontraron diferencias significativas en la calidad percibida en ninguna de estas condiciones. salidas corteses y no corteses recibieron puntuaciones casi idénticas, al igual que las versiones originales y contrapartidas . Los autores afirman que estos resultados indican que la reducción en la longitud de la salida de tokens no se debió a una pérdida de calidad, sino a la reescritura, o a cambios estructurales que sin embargo conservaron el significado. La diferencia de costo observada en la solicitud empresarial es, por lo tanto, poco probable que refleje cambios en la utilidad o la claridad, y el “impuesto” todavía está en funcionamiento.

Conclusión

Aunque el nuevo trabajo se centra en el uso empresarial de ChatGPT, los usuarios de nivel inferior también se ven afectados por este síndrome, ya que incluso los dos niveles de entrada tienen límites de uso; y, presumiblemente, tratar a ChatGPT de manera brusca hará que el usuario promedio se acerque rápidamente al agotamiento de la asignación diaria de tokens. El nuevo estudio se centra en una pregunta abierta y muy estudiada en las interacciones humanas/IA; pero los autores enfatizan que los problemas que rodean la cortesía deben tomarse como indicadores de un posible pozo más profundo de rarezas lingüísticas, aún no descubiertas, que pueden tener un impacto en los cargos por inferencia. Publicado por primera vez

 

el miércoles 19 de noviembre de 2025

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai