มุมมองของ Anderson
วิจัยใหม่ซึ่งประเด็นราคาตาม ‘โทเค็น’ ของ AI ชาต

งานวิจัยใหม่ชี้ว่าการคิดค่าบริการ AI ตามโทเคนปกปิดต้นทุนจริงจากผู้ใช้ ผู้ให้บริการอาจเพิ่มค่าใช้จ่ายอย่างเงียบ ๆ ด้วยการรายงานจำนวนโทเคนเกินจริงหรือแทรกขั้นตอนที่ซ่อนอยู่ บางระบบดำเนินกระบวนการเพิ่มเติมที่ไม่เปลี่ยนผลลัพธ์แต่ยังถูกนำไปคิดเงิน แม้มีข้อเสนอให้ใช้เครื่องมือตรวจสอบ หากไม่มีการกำกับดูแลจริง ผู้ใช้ก็ยังจ่ายมากกว่าที่ตนรับรู้
บริการสนทนาด้วย AI เกือบทั้งหมด เช่น ChatGPT-4o คิดค่าบริการเป็นโทเคน ซึ่งเป็นหน่วยข้อความที่ผู้ใช้มองไม่เห็นระหว่างใช้งาน แต่ถูกนับอย่างแม่นยำเพื่อเรียกเก็บเงิน แม้แต่ละการสนทนาจะมีราคาตามจำนวนโทเคนที่ประมวลผล ผู้ใช้ก็ไม่มีวิธียืนยันจำนวนดังกล่าวโดยตรง
แม้เราจะเข้าใจเพียงคร่าว ๆ ว่าหน่วย “โทเคน” ที่ซื้อหมายถึงอะไร การคิดเงินตามโทเคนก็กลายเป็นมาตรฐานของผู้ให้บริการ โดยตั้งอยู่บนสมมติฐานเรื่องความไว้วางใจที่อาจไม่มั่นคง
โทเคนไม่ใช่คำ
โทเคนไม่เหมือนคำเสียทีเดียว แม้มักมีบทบาทใกล้เคียง ผู้ให้บริการส่วนใหญ่ใช้คำนี้เรียกหน่วยข้อความขนาดเล็ก เช่น คำ เครื่องหมายวรรคตอน หรือชิ้นส่วนของคำ ตัวอย่างเช่น คำภาษาอังกฤษว่า unbelievable อาจถูกระบบหนึ่งนับเป็นโทเคนเดียว แต่อีกระบบอาจแบ่งเป็น un, believ และ able ซึ่งแต่ละชิ้นเพิ่มค่าใช้จ่าย
ระบบนี้ใช้กับทั้งข้อความที่ผู้ใช้ป้อนและคำตอบของโมเดล ราคาอิงจำนวนหน่วยทั้งหมดรวมกัน
ปัญหาคือผู้ใช้มองไม่เห็นกระบวนการนี้ อินเทอร์เฟซส่วนใหญ่ไม่แสดงจำนวนโทเคนระหว่างการสนทนา และวิธีคำนวณก็ทำซ้ำได้ยาก ต่อให้แสดงจำนวนหลังได้รับคำตอบก็สายเกินไปที่จะตรวจว่าจำนวนดังกล่าวยุติธรรมหรือไม่ จึงเกิดช่องว่างระหว่างสิ่งที่ผู้ใช้เห็นกับสิ่งที่ต้องจ่าย
งานวิจัยล่าสุดชี้ปัญหาที่ลึกกว่านั้น งานหนึ่งแสดงว่าผู้ให้บริการอาจเรียกเก็บเกินโดยไม่ละเมิดกฎ เพียงเพิ่มจำนวนโทเคนในแบบที่ผู้ใช้มองไม่เห็น อีกงานเผยความไม่ตรงกันระหว่างข้อมูลบนอินเทอร์เฟซกับสิ่งที่เรียกเก็บจริง ทำให้ดูเหมือนระบบมีประสิทธิภาพทั้งที่อาจไม่ใช่ และงานที่สามพบว่าโมเดลสร้างขั้นตอนการให้เหตุผลภายในที่ไม่เคยแสดงต่อผู้ใช้ แต่ยังปรากฏบนใบแจ้งหนี้
ผลการศึกษาเหล่านี้แสดงระบบที่ดูแม่นยำ เพราะมีตัวเลขชัดเจน แต่ตรรกะเบื้องหลังยังซ่อนอยู่ ไม่ว่าจะเกิดจากการออกแบบหรือข้อบกพร่องเชิงโครงสร้าง ผลลัพธ์เหมือนกันคือผู้ใช้จ่ายมากกว่าสิ่งที่มองเห็นและมักมากกว่าที่คาด
ยิ่งแบ่งย่อยยิ่งแพงหรือไม่
งานวิจัยแรกชื่อ Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives จากนักวิจัยสี่คนของ Max Planck Institute for Software Systems ระบุว่าความเสี่ยงของการคิดเงินตามโทเคนไม่ได้มีเพียงความไม่โปร่งใส แต่ยังมีแรงจูงใจในตัวให้ผู้ให้บริการเพิ่มจำนวนโทเคน
หัวใจของปัญหาคือข้อความหนึ่งชุดไม่ได้มีวิธีแบ่งโทเคนเพียงแบบเดียว สมมติผู้ใช้ถามว่า “การประชุม NeurIPS ครั้งต่อไปจัดที่ไหน” โมเดลอาจสร้างคำตอบ “|San| Diego|” ซึ่งมีสองโทเคน แต่ผู้ให้บริการที่ผู้ใช้ตรวจสอบไม่ได้อาจรายงานเป็น “|S|a|n| |D|i|e|g|o|” แล้วคิดเงินเก้าโทเคน ทั้งที่ข้อความที่เห็นยังเหมือนเดิม
งานวิจัยเสนอฮิวริสติกที่คำนวณในลักษณะดังกล่าวได้โดยไม่เปลี่ยนผลลัพธ์ที่มองเห็นและยังดูสมเหตุสมผลภายใต้การถอดรหัสทั่วไป เมื่อนำไปทดสอบกับโมเดลตระกูล LLaMA, Mistral และ Gemma ด้วยพรอมป์จริง วิธีนี้เพิ่มค่าใช้จ่ายได้อย่างวัดผลได้โดยไม่ดูผิดปกติ

เพื่อแก้ปัญหา นักวิจัยเสนอให้คิดเงินตามจำนวนอักขระแทนโทเคน โดยมองว่านี่เป็นแนวทางที่สร้างแรงจูงใจให้รายงานการใช้งานอย่างซื่อสัตย์ หากต้องการราคาที่ยุติธรรม ต้นทุนควรผูกกับอักขระที่ผู้ใช้เห็น แทนกระบวนการซ่อนอยู่ การคิดเงินตามอักขระยังลดแรงจูงใจในการรายงานเท็จและให้รางวัลแก่ผลลัพธ์ที่สั้นและมีประสิทธิภาพ
อย่างไรก็ตาม แนวทางนี้มีข้อพิจารณาเพิ่มเติมหลายประการ ประการแรก โมเดลธุรกิจที่คิดตามอักขระอาจเอื้อผู้ขายมากกว่าผู้บริโภค ผู้ให้บริการที่รายงานตรงไปตรงมามีแรงจูงใจให้สร้างลำดับโทเคนสั้นที่สุดและปรับอัลกอริทึม tokenization เช่น BPE ให้บีบอัดผลลัพธ์มากที่สุด
มุมมองเชิงบวกคือผู้ขายจะถูกกระตุ้นให้ตอบอย่างกระชับ มีความหมาย และมีคุณค่ามากขึ้น แต่ในทางปฏิบัติก็มีวิธีที่ไม่น่าชื่นชมในการลดจำนวนข้อความ
ประการที่สอง ผู้เขียนเห็นว่าบริษัทต่าง ๆ น่าจะต้องมีกฎหมายบังคับจึงจะย้ายจากระบบโทเคนที่เข้าใจยากไปสู่วิธีคิดเงินตามข้อความที่ชัดเจนกว่า ในอนาคตสตาร์ตอัปอาจใช้รูปแบบราคานี้สร้างความแตกต่าง แต่ผู้ที่มีผลิตภัณฑ์แข่งขันได้จริงและดำเนินงานในขนาดเล็กกว่าบริษัทเทคโนโลยียักษ์ใหญ่ก็ไม่มีแรงจูงใจมากนัก
สุดท้าย อัลกอริทึมฉ้อฉลเองก็มีต้นทุนคำนวณ หากค่าใช้จ่ายในการคำนวณค่าบวกเพิ่มสูงกว่ากำไรที่ได้ วิธีนี้ย่อมไม่มีประโยชน์ อย่างไรก็ดี นักวิจัยย้ำว่าอัลกอริทึมที่เสนอมีทั้งประสิทธิภาพและต้นทุนต่ำ และเผยแพร่โค้ดประกอบทฤษฎีไว้บน GitHub
การสลับบริการที่มองไม่เห็น
งานวิจัยชิ้นที่สองชื่อ Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services จากนักวิจัย University of Maryland และ Berkeley ระบุว่าแรงจูงใจที่ไม่สอดคล้องกันใน API โมเดลภาษาเชิงพาณิชย์ไม่ได้จำกัดอยู่ที่การแบ่งโทเคน แต่ครอบคลุมกระบวนการซ่อนอยู่ทั้งกลุ่ม
กระบวนการเหล่านี้รวมถึงการเรียกโมเดลภายใน การให้เหตุผลเชิงคาดการณ์ การใช้เครื่องมือ และการสื่อสารระหว่างเอเจนต์หลายตัว ทั้งหมดอาจถูกเรียกเก็บจากผู้ใช้โดยไม่มีรายละเอียดหรือช่องทางโต้แย้ง

ต่างจากการคิดเงินทั่วไปที่ตรวจสอบปริมาณและคุณภาพบริการได้ ผู้เขียนกล่าวว่าแพลตฟอร์ม LLM ปัจจุบันมี “ความทึบเชิงโครงสร้าง” ผู้ใช้ถูกคิดเงินตามจำนวนโทเคนและการเรียก API ที่ผู้ให้บริการรายงาน แต่ยืนยันไม่ได้ว่าตัวเลขนั้นสะท้อนงานจริงหรืองานที่จำเป็นหรือไม่
งานวิจัยระบุการบิดเบือนสองแบบ แบบแรกคือเพิ่มปริมาณ โดยเพิ่มจำนวนโทเคนหรือการเรียกใช้งานทั้งที่ผู้ใช้ไม่ได้ประโยชน์ แบบที่สองคือลดคุณภาพ โดยแอบใช้โมเดลหรือเครื่องมือที่ด้อยกว่าส่วนประกอบพรีเมียม
ผู้ให้บริการโมเดลให้เหตุผลมักมีหลายรุ่นในตระกูลเดียวกัน ซึ่งต่างกันด้านความจุ ข้อมูลฝึก หรือวิธีปรับประสิทธิภาพ เช่น ChatGPT o1 และ o3 การลดรุ่นหมายถึงแอบแทนด้วยโมเดลต้นทุนต่ำ ทำให้คุณภาพที่คาดกับคุณภาพจริงไม่ตรงกัน พรอมป์อาจถูกประมวลผลด้วยโมเดลเล็กกว่าโดยคิดราคาเท่าเดิม และผู้ใช้ตรวจจับยากเพราะคำตอบยังดูสมเหตุสมผลในหลายงาน
งานวิจัยบันทึกกรณีที่โทเคนมากกว่าร้อยละ 90 ของยอดเรียกเก็บไม่เคยแสดงต่อผู้ใช้ โดยการให้เหตุผลภายในเพิ่มการใช้โทเคนมากกว่ายี่สิบเท่า ไม่ว่าขั้นตอนเหล่านั้นจะมีเหตุผลหรือไม่ ความทึบทำให้ผู้ใช้ไม่มีพื้นฐานประเมินความเกี่ยวข้องหรือความชอบธรรม
ระบบเอเจนต์ยิ่งทึบขึ้น เพราะการแลกเปลี่ยนภายในระหว่างเอเจนต์ AI แต่ละครั้งอาจมีค่าใช้จ่ายโดยแทบไม่เปลี่ยนผลลัพธ์สุดท้าย เอเจนต์ส่งพรอมป์ บทสรุป และคำสั่งวางแผนระหว่างกัน แต่ละตัวตีความอินพุตจากอีกตัวและสร้างเอาต์พุตนำทางเวิร์กโฟลว์ ข้อความเหล่านี้อาจใช้โทเคนจำนวนมากแต่ผู้ใช้ไม่เห็น
โดยทั่วไป โทเคนทั้งหมดที่ใช้ประสานงานระหว่างเอเจนต์ ไม่ว่าจะเป็นพรอมป์ คำตอบ หรือคำสั่งเกี่ยวกับเครื่องมือ จะไม่ถูกแสดงต่อผู้ใช้ และหากเอเจนต์เหล่านั้นใช้โมเดลให้เหตุผล การเรียกเก็บเงินก็ยิ่งตรวจสอบยาก
ผู้เขียนเสนอกรอบตรวจสอบหลายชั้นที่ประกอบด้วยหลักฐานเข้ารหัสของกิจกรรมภายใน เครื่องหมายยืนยันตัวตนของโมเดลหรือเครื่องมือ และการกำกับดูแลอิสระ อย่างไรก็ดี ปัญหาพื้นฐานเป็นเชิงโครงสร้าง ระบบคิดเงิน LLM ปัจจุบันพึ่งพาความไม่สมดุลของข้อมูลอย่างต่อเนื่อง ทำให้ผู้ใช้เผชิญค่าใช้จ่ายที่ยืนยันหรือแจกแจงไม่ได้
นับสิ่งที่มองไม่เห็น
งานวิจัยชิ้นสุดท้ายจาก University of Maryland เปลี่ยนกรอบปัญหาจากการใช้งานผิดหรือรายงานเท็จไปสู่โครงสร้างของระบบ บทความชื่อ CoIn: Counting the Invisible Reasoning Tokens in Commercial Opaque LLM APIs จากนักวิจัยสิบคนระบุว่า บริการ LLM เชิงพาณิชย์ส่วนใหญ่ซ่อนการให้เหตุผลระหว่างทางที่นำไปสู่คำตอบสุดท้าย แต่ยังคิดเงินสำหรับโทเคนเหล่านั้น
ผู้เขียนกล่าวว่าสิ่งนี้สร้างพื้นที่เรียกเก็บเงินที่สังเกตไม่ได้ ซึ่งลำดับโทเคนทั้งหมดอาจถูกสร้าง แทรก หรือเพิ่มจำนวนโดยไม่มีใครตรวจพบ ความล่องหนเปิดทางให้รายงานจำนวนโทเคนผิด หรือแทรกโทเคนให้เหตุผลปลอมที่มีต้นทุนต่ำเพื่อเพิ่มยอดเรียกเก็บ วิธีนี้เรียกว่า token count inflation
ตัวอย่างหนึ่งคือการรัน ARC-AGI ประสิทธิภาพสูงครั้งเดียวด้วยโมเดล o3 ของ OpenAI ซึ่งใช้ 111 ล้านโทเคนและมีค่าใช้จ่าย 66,772 ดอลลาร์ ในระดับนี้ แม้การบิดเบือนเพียงเล็กน้อยก็ส่งผลทางการเงินอย่างมาก ความไม่สมดุลของข้อมูลจึงเปิดทางให้บริษัท AI เรียกเก็บเกินและกระทบผลประโยชน์ผู้ใช้
เพื่อรับมือ นักวิจัยเสนอ CoIn ซึ่งเป็นระบบตรวจสอบโดยบุคคลที่สามสำหรับยืนยันโทเคนที่ซ่อนอยู่โดยไม่เปิดเผยเนื้อหา ระบบใช้ลายนิ้วมือแบบแฮชและการตรวจความหมายเพื่อค้นหาสัญญาณของการเพิ่มจำนวนโทเคน

องค์ประกอบหนึ่งยืนยันจำนวนโทเคนด้วยการเข้ารหัสผ่าน Merkle tree อีกองค์ประกอบประเมินความเกี่ยวข้องของเนื้อหาที่ซ่อนอยู่โดยเปรียบเทียบกับ embedding ของคำตอบ ทำให้ผู้ตรวจพบการยัดข้อมูลหรือเนื้อหาที่ไม่เกี่ยวข้อง ซึ่งเป็นสัญญาณว่าโทเคนถูกแทรกเพียงเพื่อเพิ่มราคา
ในการทดสอบ CoIn ตรวจจับการเพิ่มจำนวนบางรูปแบบได้สำเร็จเกือบร้อยละ 95 โดยเปิดเผยข้อมูลต้นทางเพียงเล็กน้อย แม้ยังต้องอาศัยความร่วมมือโดยสมัครใจจากผู้ให้บริการและมีข้อจำกัดในกรณีขอบ ประเด็นสำคัญยังชัดเจนว่าโครงสร้างการคิดเงิน LLM ปัจจุบันตั้งอยู่บนความซื่อสัตย์ที่ไม่อาจตรวจสอบได้
แหล่งข้อมูลและลิงก์อ้างอิง
งานวิจัย โมเดล และเอกสารที่กล่าวถึงในบทความ:
- ChatGPT-4o
- tokens
- one study
- another
- third
- first
- LLaMA
- Mistral
- Gemma
- EEE category
- at GitHub
- paper
- paper
- costing
- Merkle tree
- scrip
- CivitAI
- own units of measurement
- lack of clocks in Las Vegas
- cost many times more tokens
- naturally verbose languages
บทสรุป
นอกจากประโยชน์ที่ผู้ขายได้รับเงินล่วงหน้าแล้ว สกุลเงินแบบเครดิตภายใน เช่น ระบบ “buzz” ของ CivitAI ยังทำให้ผู้ใช้ห่างจากมูลค่าจริงของเงินหรือสินค้าที่กำลังซื้อ เช่นเดียวกัน การเปิดทางให้ผู้ขายกำหนดหน่วยวัดของตนเองทำให้ผู้บริโภคไม่รู้ว่ากำลังใช้เงินจริงเท่าใด
คล้ายการไม่มีนาฬิกาในลาสเวกัส มาตรการเช่นนี้มักทำให้ผู้บริโภคประมาทหรือไม่ใส่ใจต้นทุน
โทเคนซึ่งมีผู้เข้าใจน้อยและทั้งนิยามกับใช้ได้หลายวิธีอาจไม่เหมาะเป็นหน่วยวัดการใช้ LLM โดยเฉพาะเมื่อการสร้างผลลัพธ์ที่ด้อยกว่าในภาษาที่ไม่ใช่อังกฤษอาจใช้โทเคนมากกว่าการสนทนาภาษาอังกฤษหลายเท่า
อย่างไรก็ตาม การคิดจากจำนวนอักขระตามข้อเสนอของนักวิจัย Max Planck น่าจะเอื้อภาษาที่กระชับและลงโทษภาษาที่ตามธรรมชาติใช้คำมากกว่า และเพราะตัวบ่งชี้บนหน้าจอ เช่น ตัวนับเครดิตที่ลดลง อาจทำให้เราใช้บริการ LLM อย่างระมัดระวังขึ้น จึงไม่น่าเป็นไปได้ที่ผู้ให้บริการจะเพิ่มองค์ประกอบที่มีประโยชน์นี้ในเร็ว ๆ นี้ เว้นแต่จะมีกฎหมายบังคับ
ข้อความเน้นเป็นของผู้เขียนงานวิจัยเดิม และบทความนี้แปลงการอ้างอิงภายในของผู้เขียนเป็นลิงก์
เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 29 พฤษภาคม 2025












