มุมมองของ Anderson
นำเสนอรายการกลิ่นให้กับการพัฒนา AI

ชุดข้อมูล AI ใหม่สอนให้เครื่องจักร “ดมกลิ่น” ด้วยการเชื่อมข้อมูลกลิ่นกับภาพ ทำให้โมเดลจับคู่กลิ่นกับวัตถุ ฉาก และวัสดุได้
การดมกลิ่นเป็นประสาทสัมผัสที่ถูกละเลยในงานวิจัย AI ส่วนหนึ่งอาจเป็นเพราะอุปกรณ์สร้างกลิ่นมีประวัติที่ไม่ราบรื่น นอกจากความพยายามทำภาพยนตร์พร้อมกลิ่นที่ดำเนินมานานกว่าศตวรรษแล้ว กรณีใช้งานก็ดูเฉพาะทางกว่าข้อมูลภาพ เสียง และวิดีโอมาก
อย่างไรก็ตาม การทำให้ความสามารถของสุนัขตรวจระเบิด ศพ โรค และสารต่างๆ เป็นระบบอัตโนมัติและใช้ได้ในวงกว้าง จะเป็นประโยชน์อย่างมากต่อบริการเทศบาลและความมั่นคง ความต้องการสุนัขเหล่านี้สูงกว่าจำนวนที่มีมาก ขณะที่การฝึกและดูแลมีค่าใช้จ่ายสูงและไม่ได้คุ้มค่าเสมอไป
งานก่อนหน้านี้ส่วนใหญ่อยู่ในห้องทดลอง ใช้ชุดตัวอย่างที่คัดสรรและคุณลักษณะที่ออกแบบด้วยมือ จึงเหมาะกับวิธีเฉพาะขนาดเล็กมากกว่าระบบระดับอุตสาหกรรม
นำหน้าด้วยจมูก
ความร่วมมือใหม่ระหว่างภาควิชาการและอุตสาหกรรมในสหรัฐฯ เข้ามาเปลี่ยนบรรยากาศนี้ นักวิจัยใช้เวลาหลายเดือนทำบัญชีกลิ่นหลากหลายทั้งในและนอกอาคารทั่วนครนิวยอร์ก และเป็นครั้งแรกที่เก็บภาพซึ่งเชื่อมโยงกับกลิ่นที่บันทึกไว้

เซ็นเซอร์ตรงกลางคือ “จมูก” ของอุปกรณ์ โมเดลที่ฝึกด้วยกลิ่นเท่านั้นสามารถเดาว่ากำลังดมหินแกรนิต พลาสติก หรือหนัง และยังระบุห้องได้โดยไม่เห็นพิกเซลแม้แต่จุดเดียว ที่มา
งานนี้นำไปสู่กรอบ Contrastive Olfaction-Image Pretraining หรือ COIP ซึ่งดัดแปลงจาก CLIP ที่เชื่อมข้อความกับภาพ แต่ COIP เชื่อมกลิ่นกับภาพ

ด้านบนเก็บวิดีโอและข้อมูลเซ็นเซอร์กลิ่นแบบซิงโครไนซ์ในสภาพแวดล้อมจริง ด้านล่างเรียนรู้พื้นที่ตัวแทนร่วม ค้นหาภาพจากกลิ่น จำแนกฉาก วัตถุ และวัสดุ และแยกกลิ่นที่คล้ายกัน เช่น หญ้าสองชนิด โดยไม่ใช้ภาพ ที่มา
ชุดข้อมูล New York Smells มีคู่กลิ่นและภาพ 7,000 คู่จากวัตถุ 3,500 ชิ้น ในการทดลอง ข้อมูลใหม่นี้ทำได้ดีกว่าคุณลักษณะที่สร้างด้วยมือซึ่งใช้ในชุดข้อมูลรุ่นก่อนที่มีอยู่เพียงไม่กี่ชุด
ผู้เขียนหวังว่านี่จะเป็นก้าวแรกสู่ระบบตรวจกลิ่นที่ทำงานในโลกจริงคล้ายสุนัขดมกลิ่น มนุษย์ใช้กลิ่นประเมินอาหาร ตรวจอันตราย และค้นหาสิ่งที่มองไม่เห็นอยู่เสมอ ขณะที่สุนัข หมี และหนูมีประสาทรับกลิ่นเหนือมนุษย์ แสดงว่าความสามารถของมนุษย์ไม่ใช่ขีดจำกัดของเครื่องจักร
บทความวิจัยชื่อ New York Smells: A Large Multimodal Dataset for Olfaction จัดทำโดยนักวิจัยเก้าคนจาก Columbia University, Cornell University และ Osmo Labs แม้ผู้เขียนระบุว่าจะเผยแพร่ข้อมูลและโค้ด แต่ไฟล์ข้อมูลขนาด 27GB เปิดให้ดาวน์โหลดแล้วที่เว็บไซต์โครงการ
วิธีการ
นักวิจัยใช้จมูกอิเล็กทรอนิกส์ Cyranose 320 และติด iPhone ไว้เหนือช่องรับด้านหน้า เพื่อถ่ายภาพสิ่งที่อุปกรณ์กำลังดม

กล้อง iPhone ติดบน Cyranose 320 เพื่อเก็บวิดีโอและกลิ่นเป็นคู่ ช่องรับหันเข้าหาวัตถุ ส่วนช่องระบายและช่องล้างควบคุมอากาศ กล้อง RGB-D เก็บข้อมูลความลึก และเซ็นเซอร์ในตัวบันทึกสารอินทรีย์ระเหย อุณหภูมิ และความชื้น
Cyranose ทำงานที่ 2Hz และบันทึกข้อมูลกลิ่น 32 มิติ ส่วนความเข้มข้นของสารอินทรีย์ระเหยวัดด้วย MiniPID2 PPM WR อุปกรณ์พกพาจะส่งข้อมูลไปยังสถานีเคลื่อนที่ที่มีกำลังประมวลผลสูงกว่า
เพื่อให้กลิ่นเป้าหมายมีบริบท นักวิจัยบันทึก “กลิ่นพื้นฐาน” ก่อน แล้วจึงเล็งช่องรับหลักไปที่วัตถุโดยตรง ตัวอย่างอากาศแวดล้อมถูกดูดจากช่องด้านข้างที่ห่างจากแหล่งกลิ่นหลักเพื่อป้องกันการปนเปื้อน
แต่ละวัตถุถูกเก็บตัวอย่างสองครั้ง ครั้งละสิบวินาทีจากคนละตำแหน่ง แล้วรวมกับค่าพื้นฐานแวดล้อม 14 เฟรมเป็นเมทริกซ์ 28×32 ที่แทนการวัดกลิ่นทั้งหมด

ตัวอย่างสัญญาณและภาพดอกไม้ สัญญาณทั้งหมดเป็นเมทริกซ์ 28×32 รวมค่าพื้นฐานแวดล้อม 14 เฟรมกับตัวอย่างสิบวินาทีสองชุดจากมุมต่างกัน
ข้อมูลและการทดสอบ
ใช้โมเดลภาพและภาษาเพื่อติดป้ายวัตถุและวัสดุที่ iPhone ถ่ายโดยอัตโนมัติ โดยให้ GPT-4o ทำงานนี้ ส่วนหมวดหมู่ฉากติดป้ายด้วยมนุษย์

ตัวอย่างส่วนเล็กจากภาพขนาดใหญ่ในบทความ ซึ่งแสดงแหล่งกลิ่นและสถานที่หลากหลายที่โครงการบันทึกไว้
ข้อมูลแบ่งเป็นชุดฝึกและตรวจสอบ โดยตัวอย่างสองชุดจากวัตถุเดียวกันอยู่ในส่วนเดียวกันเพื่อป้องกันข้อมูลรั่ว ชุดสุดท้ายมีคู่กลิ่น-ภาพ 7,000 คู่จากวัตถุที่ไม่ได้ติดป้าย 3,500 ชิ้น วิดีโอ 70 ชั่วโมง และข้อมูลกลิ่นดิบ 196,000 ช่วงเวลา ทั้งในระยะพื้นฐานและตัวอย่าง
เก็บข้อมูล 60 ครั้งตลอดสองเดือนในสวน อาคารมหาวิทยาลัย สำนักงาน ถนน ห้องสมุด อพาร์ตเมนต์ และโรงอาหาร โดยทำหลายครั้งในแต่ละสถานที่ สภาพแวดล้อม 41% อยู่กลางแจ้งและ 59% อยู่ในอาคาร
ผู้เขียนฝึกโมเดลแบบเปรียบต่างให้เชื่อมคู่ภาพและกลิ่นที่เกิดพร้อมกัน COIP ใช้ฟังก์ชันการสูญเสียที่ดัดแปลงจาก CLIP เพื่อจัดตัวแทนภาพและกลิ่นให้อยู่ในพื้นที่ร่วม จึงรองรับการค้นภาพจากกลิ่น การรู้จำฉากและวัตถุ การจำแนกวัสดุ และการแยกกลิ่นอย่างละเอียด
การฝึกใช้ข้อมูลกลิ่นสองชนิด ได้แก่ สัญญาณเซ็นเซอร์ดิบทั้งหมด และสรุปแบบสร้างด้วยมือที่เรียกว่า smellprint ซึ่งเป็นคุณลักษณะที่นิยมในงานวิจัยกลิ่น โดยย่อการตอบสนองของเซ็นเซอร์แต่ละตัวเป็นตัวเลขเดียวจากค่าความต้านทานสูงสุดระหว่างเก็บตัวอย่างเทียบกับค่าเฉลี่ยพื้นฐาน
ข้อมูลดิบเป็นอนุกรมเวลาจากเซ็นเซอร์เคมี 32 ตัวใน Cyranose บันทึกการเปลี่ยนแปลงความต้านทานไฟฟ้าเมื่อสัมผัสกลิ่น สัญญาณที่ยังไม่ประมวลผลถูกป้อนเข้าเครือข่ายประสาทโดยตรงเพื่อเรียนรู้ตั้งแต่ต้นจนจบ ด้วยแกนแบบคอนโวลูชันหรือทรานส์ฟอร์เมอร์ แล้วเปรียบเทียบกับ smellprint ภายใต้การเรียนรู้แบบเปรียบต่าง
การค้นคืนข้ามสื่อ
นักวิจัยฝังตัวอย่างกลิ่นและภาพคู่กันไว้ในพื้นที่ตัวแทนร่วม แล้วทดสอบว่าสามารถดึงภาพที่ถูกต้องจากกลิ่นเพียงอย่างเดียวหรือไม่ ภาพถูกจัดอันดับตามระยะห่างจากกลิ่นที่ใช้ค้นหา และวัดด้วยอันดับเฉลี่ย อันดับมัธยฐาน และ recall หลายระดับ

ความแม่นยำของการค้นคืนข้ามสื่อ เปรียบเทียบตัวเข้ารหัสที่ฝึกบนสัญญาณดิบกับแบบที่ใช้ smellprint
การฝึกแบบเปรียบต่างด้วย smellprint ทำได้ดีกว่าการสุ่มในทุกตัวชี้วัด แต่การฝึกตัวเข้ารหัสกลิ่นด้วยสัญญาณดิบดีขึ้นอย่างมากไม่ว่าสถาปัตยกรรมใด ผลนี้แสดงว่าข้อมูลดิบมีรายละเอียดมากกว่าและสร้างความเชื่อมโยงระหว่างภาพกับกลิ่นได้แข็งแรงกว่า

แต่ละแถวเริ่มด้วยกลิ่นค้นหา ตามด้วยภาพอันดับสูงสุด ภาพที่ถูกต้องมีกรอบสีเขียว กลิ่นหนังสือ พืช และวัสดุก่อสร้างดึงโมเดลไปยังฉากที่เกี่ยวข้องทั้งทางภาพและความหมาย
ผลลัพธ์แสดงกลุ่มเชิงความหมายอย่างชัดเจน กลิ่นหนังสือค้นพบภาพหนังสืออื่น และกลิ่นใบไม้ค้นพบภาพพืช แสดงว่าตัวแทนที่เรียนรู้จับโครงสร้างข้ามสื่อที่มีความหมายได้
การรู้จำฉาก วัตถุ และวัสดุ
ประเมินความสามารถในการรู้จำโดยไม่ใช้ภาพ ด้วยการฝึกให้ระบุฉาก วัตถุ และวัสดุจากกลิ่นเท่านั้น ใช้ linear probe หรือตัวจำแนกอย่างง่ายบนตัวแทนที่ตรึงไว้ เพื่อดูว่าการฝังกลิ่นเก็บข้อมูลไว้มากเพียงใด
ป้ายกำกับได้มาจากภาพคู่ในชุดฝึกโดย GPT-4o แต่ขั้นตอนจำแนกใช้สัญญาณกลิ่นเท่านั้น ทดสอบทั้งตัวเข้ารหัสน้ำหนักสุ่ม แบบฝึกจากศูนย์ และแบบฝึกเปรียบต่างให้กลิ่นกับภาพอยู่ในพื้นที่เดียวกัน พร้อมเปรียบเทียบข้อมูลดิบกับ smellprint

ข้อมูลดิบทำได้ดีกว่า smellprint เครือข่าย CNN ที่ฝึกจากศูนย์ให้ผลสูงสุด รวมถึงความแม่นยำฉาก 99.5% การฝึกแบบกำกับตนเองช่วยบางกรณี แต่โดยทั่วไปแพ้การฝึกแบบมีผู้สอน และน้ำหนักสุ่มแสดงว่าความจุโมเดลเพียงอย่างเดียวไม่พอ
ข้อมูลกลิ่นดิบให้ความแม่นยำสูงกว่ามาก โดยเฉพาะโมเดลที่มีการกำกับข้ามสื่อ ผู้เขียนสรุปว่าการเรียนรู้เชิงลึกจากสัญญาณดิบดีกว่าคุณลักษณะที่ออกแบบด้วยมืออย่างชัดเจน
การแยกความแตกต่างอย่างละเอียด
เพื่อดูว่าโมเดลเรียนรู้ความต่างเล็กน้อยของกลิ่นได้หรือไม่ นักวิจัยสร้างเกณฑ์จากหญ้าสองสายพันธุ์ที่ขึ้นร่วมกันในสนามมหาวิทยาลัย เก็บตัวอย่างสลับกันหกช่วง ช่วงละ 30 นาที ได้ 256 ตัวอย่าง แล้วฝึกตัวจำแนกเชิงเส้นบนคุณลักษณะจากการเรียนรู้กลิ่น-ภาพแบบเปรียบต่าง และทดสอบกับตัวอย่างที่กันไว้ 42 ชุด

เปรียบเทียบ smellprint กับข้อมูลดิบภายใต้น้ำหนักสุ่ม การฝึกจากศูนย์ และการเรียนรู้แบบกำกับตนเอง ผลสูงสุด 92.9% มาจากสัญญาณดิบและการเรียนรู้แบบกำกับตนเอง แสดงว่าความต่างละเอียดจับได้ดีที่สุดจากข้อมูลดิบที่มีภาพช่วยกำกับ
การฝึกบนสัญญาณดิบให้ความแม่นยำสูงสุดและชนะทุกแบบที่ใช้ smellprint ผลนี้ชี้ว่าการเรียนรู้กลิ่นร่วมกับภาพรักษารายละเอียดไว้มากกว่า และการกำกับด้วยภาพช่วยใช้ข้อมูลดังกล่าวได้
บทสรุป
แม้การสังเคราะห์กลิ่นอาจยังเป็นปัญหาที่ยังแก้ไม่ได้อีกระยะหนึ่ง แต่ระบบวิเคราะห์กลิ่นในโลกจริงที่มีประสิทธิภาพและราคาเข้าถึงได้มีศักยภาพสูง ไม่เพียงสำหรับตำรวจ ความมั่นคง และการแพทย์ แต่ยังรวมถึงคุณภาพชีวิตและการเฝ้าระวังเมือง
ปัจจุบันอุปกรณ์ยังเฉพาะทางและมักมีราคาแพง ความก้าวหน้าที่แท้จริงของ “AI ด้านกลิ่น” จึงอาจต้องอาศัยเซ็นเซอร์ราคาประหยัดที่มีวิสัยทัศน์แบบ Raspberry Pi
* ผู้เขียนบทความนี้แปลงการอ้างอิงในต้นฉบับของนักวิจัยเป็นลิงก์
** ภาพเพิ่มเติม รวมถึงรูปที่ 8 มีในบทความต้นฉบับและเหมาะจะดูในบริบทนั้น
เผยแพร่ครั้งแรกวันศุกร์ที่ 28 พฤศจิกายน 2025












