Η γωνία του Anderson

Οι απρεπείς ερωτήσεις μπορούν να αυξήσουν το κόστος του ChatGPT για τις επιχειρήσεις

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

Οι απαντήσεις του ChatGPT καίνε περισσότερους tokens όταν είστε αγενείς μαζί του, αυξάνοντας το επιχειρηματικό σας λογαριασμό· αλλά η χρήση του “παρακαλώ” μπορεί να μειώσει τα έξοδα.

 

Λέγεται ότι η ευγένεια δεν κοστίζει τίποτα· αλλά τι κοστίζει η αγένεια; Όσον αφορά την πληρωμή για το ChatGPT, khá πολλά, σύμφωνα με μια νέα μελέτη από τις Ηνωμένες Πολιτείες. Το νέο έγγραφο, από το Πανεπιστήμιο της Αϊόβα, βρίσκει ότι η αγένεια προς το ChatGPT αυξάνει το κόστος των απαντήσεων – ακόμη και αν οι απαντήσεις είναι οι ίδιες για ευγενείς και αγένεις ερωτήσεις.

Οι συγγραφείς δηλώνουν:

‘Η τιμή των output tokens είναι 12 δολάρια ανά 1 εκατομμύριο output tokens για το GPT4. Βρήκαμε ότι οι αγένεις ερωτήσεις οδηγούν σε περισσότερους από 14 επιπλέον tokens, που ισοδυναμούν με 0,000168 δολάρια επιπλέον κόστος ανά ερώτηση κατά μέσο όρο. Οι μέσες ημερήσιες ερωτήσεις στο API του OpenAI υπερβαίνουν τα 2,2 δισεκατομμύρια.

‘Σε σύγκριση με ένα σενάριο στο οποίο όλες οι ερωτήσεις είναι ευγενείς, όταν αντίθετα οι ερωτήσεις είναι αγένεις, αυτό παράγει επιπλέον 369.000 δολάρια έσοδα ανά ημέρα, απλώς λόγω της αύξησης των tokens που παράγουν οι αγένεις ερωτήσεις στο αποτέλεσμα.’

Αν και το αποτέλεσμα είναι ενδιαφέρον από μόνο του, οι συγγραφείς τονίζουν ότι αυτή η ασυνήθιστη συμπεριφορά θα μπορούσε να υποδηλώσει μια ποικιλία από άγνωστες ιδιοτροπίες στη διαμόρφωση ανθρώπου/ΑΙ, κάποιες από τις οποίες μπορεί να έχουν επίσης οικονομικές επιπτώσεις. Όσον αφορά το λόγο για τον οποίο η αγένεια κοστίζει στους πελάτες επιπλέον tokens, οι συγγραφείς δεν κάνουν εικασίες.

Για να καθορίσουν την εγκυρότητα του συνδρόμου, έγραψαν ξανά πραγματικές ερωτήσεις του ChatGPT, εναλλάσσοντας τις τιμές ευγένειας, διατηρώντας παράλληλα το νόημα. Και οι δύο εκδοχές υποβεβληθήκαν στο μοντέλο GPT-4-Turbo μέσω ξεχωριστών κλήσεων API, και μετρήθηκαν οι διαφορές στο αριθμό των output tokens που χρησιμοποιήθηκαν για τις απαντήσεις.

Τα συμπεράσματα που εξάγονται είναι μια σαφής αντίθεση με τα γεγονότα των επικεφαλίδων νωρίτερα αυτό το έτος, όπου ο Sam Altman καθόρισε ότι η ευγένεια κόστιζε την OpenAI πιθανώς ‘δεκάδες εκατομμύρια’ δολάρια σε όρους επεξεργασίας tokens που σχετίζονται με την ευγένεια (όπως ‘παρακαλώ’). Έρευνα δημοσιευμένη την ίδια περίοδο επίσης έδειξε ότι η ευγένεια ήταν απώλεια σε όρους απόκτησης καλύτερων απαντήσεων (αν και δεν σχολίασε για φθηνότερες απαντήσεις).

Εάν τα συμπεράσματα της νέας μελέτης είναι σωστά, τότε οποιοιδήποτε επιχειρηματικοί χρήστες του ChatGPT που ακολούθησαν αυτή τη σκέψη θα έχουν δαπανήσει περισσότερα για την εύνοια του ChatGPT το 2025 από τους χρήστες που προσφέρουν ελάχιστη πολιτικότητα στις συναλλαγές του ChatGPT.

Οι συγγραφείς προτείνουν ότι ένα πιθανό αντίδοτο θα ήταν να οριστεί ένα όριο tokens στις απαντήσεις, αν και αυτό δεν είναι μια προσέγγιση που τα συστήματα LLM μπορούν εύκολα να εφαρμόσουν. Παρατηρούν ότι η ερώτηση είναι ένα αδύναμο εργαλείο για τον έλεγχο του κόστους, επειδή τα LLM δυσκολεύονται να υπακούσουν σε ρητές οδηγίες μήκους. Στις περισσότερες περιπτώσεις, αυτή η “περιοριστική” οδηγία δεν θα τηρούνταν· επιπλέον, η απάντηση μπορεί να είναι αποκομμένη, επειδή τα LLM αυτού του είδους είναι βασικά υποθέτοντας το επόμενο πιθανό λέξη σε μια πρόταση/παράγραφο, και, ως εκ τούτου, δεν γνωρίζουν πώς τελειώνει η ιστορία – ή πού τελειώνει η ιστορία – μέχρι να ολοκληρωθεί η επεξεργασία. Έχουν,因此, περιορισμένη ικανότητα να “τερματίζουν” οποιαδήποτε μηχανισμό σε εξέλιξη με αίτηση.

Χωρίς μια ακριβή λύση – αν και προτείνοντας ότι πιο διαφανείς προσεγγίσεις τιμολόγησης θα πρέπει να επιβληθούν σε τέτοιες περιπτώσεις – οι συγγραφείς καταλήγουν στο συμπέρασμα:

‘Η συνήθης σοφία υποδηλώνει ότι η ευγένεια της ερώτησης είναι άχρηστη όταν αλληλεπιδράτε με LLM.

‘Αντίθετα, η δουλειά μας δείχνει ότι οι αγένεις ερωτήσεις αυξάνουν τα output tokens, παράγοντας επιπλέον κόστη για τους επιχειρηματικούς υιοθετητές της AI.’

Το νέο έγγραφο έχει τον τίτλο Διαφάνεια Κόστους της Επιχειρηματικής Υιοθέτησης της AI, και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο της Αϊόβα.

Μέθοδος

Τα δεδομένα για το σύστημα προέρχονται από το WildChat dataset, που αποτελείται από μια συλλογή 1 εκατομμυρίου συνομιλιών χρήστη-ChatGPT, και διαθέτει περισσότερες από 2,5 εκατομμύρια στροφές αλληλεπίδρασης:

Από μια υποστηρικτική ιστοσελίδα για το έργο WildChat, αναζητήσιμα παραδείγματα αλληλεπιδράσεων ChatGPT. Πηγή: https://wildvisualizer.com/

Από μια υποστηρικτική ιστοσελίδα για το έργο WildChat, αναζητήσιμα παραδείγματα αλληλεπιδράσεων ChatGPT. Πηγή

Οι συγγραφείς σημειώνουν ότι το WildChat περιέχει μεγαλύτερο ποσοστό φυσικών αλληλεπιδράσεων από ορισμένα πιο καλά επιμελημένα σύνολα.

Εξέλεξαν 20.000 αγγλικές ερωτήσεις από την συλλογή των ανταλλαγών GPT-4, απορρίπτοντας την έξοδο σε κάθε περίπτωση (καθώς η πρόθεση ήταν να τις ξαναπァρουν για νέες απαντήσεις). Μόνο η πρώτη αλληλεπίδραση επιλέχθηκε, ακόμη και από μακρύτερες ανταλλαγές,

Το αποτέλεσμα σύνολο φιλτράθηκε σε ευγενείς ή αγένεις κατηγορίες, με όλες τις ερωτήσεις ταξινομημένες από το GPT-4-Turbo. Οι ερευνητές χρησιμοποίησαν το μοντέλο για να αποφασίσουν εάν μια ερώτηση ήταν ευγενής ή όχι, επειδή η δική του αντίληψη της ευγένειας ήταν κεντρική στη δοκιμή.

Οι ερωτήσεις που επισημάνθηκαν ως ευγενείς θα μπορούσαν να περιλαμβάνουν σαφείς ενδείξεις όπως η λέξη ‘παρακαλώ’, ή θα μπορούσαν να είναι ευγενείς με πιο έμμεσο τρόπο. Οτιδήποτε δεν αναγνωρίστηκε ως ευγενές ταξινομήθηκε ως αγένεια, ακόμη και αν η λέξη ήταν ουδέτερη παρά ανταγωνιστική.

Για να μελετήσουν πώς το μοντέλο ανταποκρίνεται στην ευγένεια, δεν μπορούσαν να χρησιμοποιηθούν τυποποιημένες μεθόδους (δηλ. που αντιμετωπίζουν το κείμενο ως ένα σύνολο μετρήσιμων χαρακτηριστικών): επειδή η ευγένεια ήταν ενσωματωμένη στη λέξη, η περίληψη μιας ερώτησης ως λίστας ιδιοτήτων θα είχε χάσει σημαντικό контέκστ.

Αντίθετα, κάθε ερώτηση ξαναγράφηκε για να αντιστρέψει τον τόνο της, με όλα τα άλλα στοιχεία να διατηρούνται όσο το δυνατόν πιο παρόμοια, επιτρέποντας τη σύγκριση μεταξύ ζευγαριών που διέφεραν μόνο στην ευγένεια:

Παραδείγματα του πώς οι ευγενείς και αγένεις ερωτήσεις μετατράπηκαν σε αντίστροφες εκδοχές τους, διατηρώντας παράλληλα το σημασιολογικό νόημα.

Παραδείγματα του πώς οι ευγενείς και αγένεις ερωτήσεις μετατράπηκαν σε αντίστροφες εκδοχές τους, διατηρώντας παράλληλα το σημασιολογικό νόημα. Πηγή

Δοκιμές

Κάθε αρχική ερώτηση ζευγαρώθηκε με μια ξαναγραμμένη εκδοχή που διέφερε μόνο στο επίπεδο ευγένειας, και και οι δύο εκδοχές υποβεβληθήκαν στο ίδιο μοντέλο GPT-4-Turbo μέσω ξεχωριστών κλήσεων API. Ο αριθμός των tokens που παράχθηκαν ως απάντηση σε κάθε εκδοχή καταγράφηκε, και η διαφορά μεταξύ τους θεωρήθηκε ως το μέτρο του πώς ο τόνος επηρέασε (το κόστος των tokens).

Θερμοκρασία κρατήθηκε σταθερή για να αποτραπεί η τυχαία μεταβολή, και τα ζευγάρια ερωτήσεων διατηρήθηκαν μόνο όταν η ξαναγραφημένη εκδοχή άλλαξε την είσοδο με το πολύ πέντε tokens. Αυτό εξασφάλισε ότι η επίδραση που μελετήθηκε προήλθε από τόνο, και όχι από οποιαδήποτε ευρύτερη αλλαγή στη φράση:

Σύνοψη στατιστικών που δείχνουν ότι οι ευγενείς ερωτήσεις οδήγησαν σε λιγότερους output tokens κατά μέσο όρο, από τις αγένεις ερωτήσεις, παρά το γεγονός ότι είχαν ελαφρώς περισσότερους input tokens.

Σύνοψη στατιστικών που δείχνουν ότι οι ευγενείς ερωτήσεις οδήγησαν σε λιγότερους output tokens κατά μέσο όρο, από τις αγένεις ερωτήσεις, παρά το γεγονός ότι είχαν ελαφρώς περισσότερους input tokens.

Κύρια αποτελέσματα για την πρώτη σειρά δοκιμών έδειξαν ότι η χρήση μιας ευγενικής ερώτησης μειώνει το μήκος της έξοδου των tokens κατά 14,426 tokens:

Αποτελέσματα εκτίμησης που περιγράφουν την επίδραση της ευγενικής μορφοποίησης της ερώτησης στο μήκος της γεννημένης έξοδου (tokens).

Αποτελέσματα εκτίμησης που περιγράφουν την επίδραση της ευγενικής μορφοποίησης της ερώτησης στο μήκος της γεννημένης έξοδου (tokens).

Η ανάλυση επαναλήφθηκε σε τρεις υποσύνολα ευγενών ερωτήσεων για να δοκιμαστεί η αντοχή: ερωτήσεις που χρησιμοποιούσαν ρητές ενδείξεις όπως ‘παρακαλώ’ ή ‘ευχαριστώ’; αυτές που χρησιμοποιούσαν μόνο ‘παρακαλώ’; και αυτές με σύνθετη ευγένεια, όπως ‘μπορείτε’ ή ‘μπορείτε’:

Αποτελέσματα εκτίμησης με βάση τους τύπους ευγένειας.

Αποτελέσματα εκτίμησης με βάση τους τύπους ευγένειας.

Για να επικυρώσουν την αντοχή των κύριων ευρημάτων, μια δευτερεύουσα ταξινόμηση της ευγένειας της ερώτησης πραγματοποιήθηκε χρησιμοποιώντας το πλαίσιο LIWC, το οποίο παρέχει μια детерμινιστική και επαναλαμβανόμενη βαθμολογία για γλωσσικά χαρακτηριστικά.

Αντίθετα με την πιθανοτική ταξινόμηση του GPT, το LIWC μπορεί να ανατεθεί μια σταθερή βαθμολογία ευγένειας σε κάθε ερώτηση, επιτρέποντας τη συνεχή αξιολόγηση σε διάφορες μεθόδους. Σε这一 μέρος των δοκιμών, οι ερωτήσεις που επισημάνθηκαν ως ευγενείς εάν η βαθμολογία LIWC ευγένειας ήταν μεγαλύτερη από το μηδέν, και ως αγένεις άλλως.

Όταν μετρήθηκε η συμφωνία μεταξύ των ταξινομήσεων LIWC και GPT, μια συμφωνία 81% παρατηρήθηκε. Αν και δεν ήταν μέτρο ακρίβειας, αυτή η συμφωνία παρείχε υποστήριξη για τη συνεχή συμφωνία μεταξύ συστημάτων.

Όταν αναλύθηκαν μόνο οι ερωτήσεις με ταιριαστές ετικέτες GPT και LIWC, οι ευγενείς ερωτήσεις οδήγησαν ακόμη σε 14 λιγότερους output tokens; και όταν η ευγένεια μετρήθηκε σε μια κλίμακα, κάθε βήμα προς ταάνω στην ευγένεια μειώνει την έξοδο κατά μέσο όρο五 tokens:

Εκτίμηση των αποταμιεύσεων tokens από την ευγένεια που διατηρήθηκε όταν επαναταξινομήθηκε με LIWC, τόσο ως δυαδική ετικέτα όσο και ως συνεχής βαθμολογία.

Εκτίμηση των αποταμιεύσεων tokens από την ευγένεια που διατηρήθηκε όταν επαναταξινομήθηκε με LIWC, τόσο ως δυαδική ετικέτα όσο και ως συνεχής βαθμολογία.

Αντοχή

Για να αξιολογήσουν εάν η επίδραση της ευγένειας ποικίλλει σε διαφορετικά είδη ερωτήσεων, κάθε ερώτηση ανατέθηκε σε μια από τις προκαθορισμένες κατηγορίες εργασιών: αναζήτηση πληροφοριών; γεννήτρια κειμένου; επεξεργασία και ανασυγγραφή; ταξινόμηση; περίληψη; και τεχνικές εργασίες.

Κάθε ερώτηση ανατέθηκε σε μια ετικέτα εργασίας συγκρίνοντας την ενσωμάτωση της με αυτές των προκαθορισμένων περιγραφών εργασιών, χρησιμοποιώντας το all-MiniLM-L6-v2 μοντέλο Sentence Transformers.

Συμμετρική ομοιότητα υπολογίστηκε μεταξύ κάθε ερώτησης και του συνόλου των περιγραφών εργασιών, και η ετικέτα με την υψηλότερη ομοιότητα ανατέθηκε.

Οι τύποι εργασιών επαναχρησιμοποιήθηκαν ως μεταβλητές ελέγχου στη παλινδρόμηση, για να δοκιμαστεί εάν η επίδραση της ευγένειας ποικίλλει με την κατηγορία ερώτησης, και όροι αλληλεπίδρασης μεταξύ εργασίας και θεραπείας εισήχθησαν, για να ελεγχθούν για διαφορετικές επιδράσεις.

Σε cả τις περιπτώσεις, οι ευγενείς ερωτήσεις παρήγαγαν συνεχώς μικρότερες εξόδους, και δεν βρέθηκε καμία σημαντική διαφορά σε όλους τους τύπους εργασιών:

Αποτελέσματα παλινδρόμησης που δείχνουν ότι οι ευγενείς ερωτήσεις μειώνουν το μήκος της έξοδου σε όλους τους τύπους εργασιών, χωρίς σημαντικές επιδράσεις αλληλεπίδρασης.

Αποτελέσματα παλινδρόμησης που δείχνουν ότι οι ευγενείς ερωτήσεις μειώνουν το μήκος της έξοδου σε όλους τους τύπους εργασιών, χωρίς σημαντικές επιδράσεις αλληλεπίδρασης.


Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai