มุมมองของ Anderson

สร้างภาพถ่ายดาวเทียมจากแผนที่เวกเตอร์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยในสหราชอาณาจักรได้พัฒนาระบบสังเคราะห์ภาพโดยใช้ AI ที่สามารถแปลงแผนที่เวกเตอร์เป็นภาพถ่ายดาวเทียมได้

สถาปัตยกรรมประสาทเทียมเรียกว่า การสร้างภาพดาวเทียมแบบไม่มีรอยต่อ (SSS) และเสนอว่าสามารถสร้างสภาพแวดล้อมเสมือนจริงและโซลูชันการนำทางที่มีความละเอียดมากกว่าภาพถ่ายดาวเทียม และสามารถอัปเดตได้เร็วขึ้น (เนื่องจากระบบแผนที่สามารถอัปเดตได้แบบเรียลไทม์) และสามารถสร้างมุมมองแบบวงโคจรได้ในพื้นที่ที่มีการจำกัดความละเอียดของเซ็นเซอร์ดาวเทียมหรือไม่มีภาพถ่ายดาวเทียม

ข้อมูลเวกเตอร์ที่ไม่มีข้อจำกัดสามารถแปลเป็นภาพขนาดใหญ่กว่าที่มักพบในภาพถ่ายดาวเทียมจริง และสามารถสะท้อนการอัปเดตในแผนที่ได้เร็ว

ข้อมูลเวกเตอร์ที่ไม่มีข้อจำกัดสามารถแปลเป็นภาพขนาดใหญ่กว่าที่มักพบในภาพถ่ายดาวเทียมจริง และสามารถสะท้อนการอัปเดตในแผนที่ได้เร็ว Source: https://arxiv.org/pdf/2111.03384.pdf

เพื่อแสดงพลังของระบบ นักวิจัยได้สร้างสภาพแวดล้อมแบบโต้ตอบที่คล้ายกับ Google Earth ซึ่งผู้ใช้สามารถซูมและดูภาพถ่ายดาวเทียมที่สร้างขึ้นที่ขนาดและรายละเอียดต่างๆ ได้ โดยไทล์จะอัปเดตแบบเรียลไทม์เช่นเดียวกับระบบโต้ตอบแบบดั้งเดิมสำหรับภาพถ่ายดาวเทียม

ซูมเข้าไปในสภาพแวดล้อมที่สร้างขึ้นจากแผนที่

ซูมเข้าไปในสภาพแวดล้อมที่สร้างขึ้นจากแผนที่ Source: https://www.youtube.com/watch?v=PqFySVpkZzg

นอกจากนี้ เนื่องจากระบบสามารถสร้างภาพถ่ายดาวเทียมจากแผนที่เวกเตอร์ได้ จึงสามารถใช้สร้างโลกในอดีต โลกในอนาคต หรือโลกสมมติได้ และสามารถนำไปใช้ในซิมูเลเตอร์เที่ยวบินและสภาพแวดล้อมเสมือนจริงได้ นักวิจัยคาดว่าจะสามารถสังเคราะห์สภาพแวดล้อมเสมือนจริง 3 มิติจากข้อมูลแผนที่โดยใช้ทรานส์ฟอร์เมอร์

ในระยะสั้น ผู้เขียนเชื่อว่าเฟรมเวิร์กของพวกเขาสามารถใช้ในการใช้งานจริงหลายอย่าง เช่น การวางแผนเมืองแบบโต้ตอบและแบบจำลองกระบวนการ โดยคาดการณ์ว่าผู้มีส่วนได้ส่วนเสียสามารถแก้ไขแผนที่แบบโต้ตอบและดูภาพถ่ายมุมปักษ์โลกของพื้นที่ที่คาดการณ์ไว้ภายในไม่กี่วินาที

เอกสารวิจัยใหม่ นี้ มาจากนักวิจัยสองคนจากมหาวิทยาลัยลีดส์ และมีชื่อเรื่องว่า การสร้างภาพดาวเทียมแบบไม่มีรอยต่อ

สถาปัตยกรรม SSS สร้างลอนดอนขึ้นมาใหม่ โดยมีมุมมองของโครงสร้างเวกเตอร์ที่ใช้ในการสร้าง

สถาปัตยกรรม SSS สร้างลอนดอนขึ้นมาใหม่ โดยมีมุมมองของโครงสร้างเวกเตอร์ที่ใช้ในการสร้าง

สถาปัตยกรรมและข้อมูลการฝึกอบรมแหล่งที่มา

ระบบใหม่นี้ใช้สถาปัตยกรรมสังเคราะห์ภาพ Pix2Pix ของ UCL Berkeley ในปี 2017 และสถาปัตยกรรม SPADE ของ NVIDIA เฟรมเวิร์กประกอบด้วยเครือข่ายประสาทเทียมสองตัวที่เป็นนวัตกรรมใหม่ – map2sat ซึ่งทำการแปลงจากเวกเตอร์เป็นภาพพิกเซล และ seam2cont ซึ่งไม่เพียงแต่คำนวณวิธีการเชื่อมไทล์ 256×256 พิกเซลเข้าด้วยกันแบบไม่มีรอยต่อ แต่ยังให้สภาพแวดล้อมการสำรวจแบบโต้ตอบอีกด้วย

สถาปัตยกรรมของ SSS

สถาปัตยกรรมของ SSS

ระบบเรียนรู้ที่จะสังเคราะห์มุมมองดาวเทียมโดยการฝึกอบรมจากมุมมองเวกเตอร์และภาพถ่ายดาวเทียมจริง โดยสร้างความเข้าใจทั่วไปเกี่ยวกับวิธีการตีความเวกเตอร์เป็นภาพถ่าย

ภาพเวกเตอร์ที่ใช้ในฐานข้อมูลถูกเรนเดอร์จากไฟล์ GeoPackage (.geo) ซึ่งมีฉลากคลาสสูงสุด 13 ชนิด เช่น เส้นทาง สภาพแวดล้อมธรรมชาติ อาคาร และ ถนน ซึ่งใช้ในการตัดสินใจเกี่ยวกับประเภทของภาพถ่ายที่จะใส่เข้าไปในมุมมองดาวเทียม

ภาพ.geo ที่เรนเดอร์แล้วยังคงรักษาข้อมูลเมตาดาต้าระบบพิกัดอ้างอิงท้องถิ่น ซึ่งใช้ในการตีความภาพเหล่านั้นในบริบทของโครงสร้างแผนที่ที่กว้างขึ้น และเพื่อให้ผู้ใช้สามารถสำรวจแผนที่ที่สร้างขึ้นได้แบบโต้ตอบ

ไทล์ที่ไม่มีรอยต่อภายใต้ข้อจำกัดที่เข้มงวด

การสร้างสภาพแวดล้อมแผนที่ที่สามารถสำรวจได้เป็นความท้าทาย เนื่องจากข้อจำกัดของฮาร์ดแวร์ในโครงการนี้ ทำให้ไทล์ถูกจำกัดไว้ที่ขนาด 256 x 256 พิกเซล ดังนั้นจึงจำเป็นต้องมีการแสดงหรือการประกอบที่คำนึงถึง “ภาพใหญ่” มากกว่าการมุ่งเน้นไปที่ไทล์เดียว ซึ่งจะทำให้เกิดการเชื่อมต่อที่ไม่สมจริงเมื่อไทล์ถูกนำมารวมกัน โดยมีถนนเปลี่ยนสีและผลลัพธ์การแสดงภาพที่ไม่สมจริงอื่นๆ

ดังนั้น SSS จึงใช้ลำดับชั้นของเครือข่ายเจเนอเรเตอร์ในการสร้างความแปรผันของเนื้อหาที่หลายขนาด และระบบสามารถประเมินไทล์ที่ขนาดกลางใดๆ ที่ผู้ใช้อาจต้องการได้

ส่วน seam2cont ของสถาปัตยกรรมใช้สองชั้นที่ทับซ้อนกันและเป็นอิสระจากชั้น map2sat และคำนวณขอบเขตที่เหมาะสมในบริบทของภาพที่กว้างขึ้นที่จะแสดง

โมดูล Seam2Cont ใช้ภาพหนึ่งที่มีไทล์ที่มีรอยต่อและอีกหนึ่งภาพที่ไม่มีรอยต่อจากเครือข่าย map2sat เพื่อคำนวณขอบเขตที่ไม่มีรอยต่อระหว่างไทล์ 256x256 พิกเซลที่สร้างขึ้น

โมดูล Seam2Cont ใช้ภาพหนึ่งที่มีไทล์ที่มีรอยต่อและอีกหนึ่งภาพที่ไม่มีรอยต่อจากเครือข่าย map2sat เพื่อคำนวณขอบเขตที่ไม่มีรอยต่อระหว่างไทล์ 256×256 พิกเซลที่สร้างขึ้น

เครือข่าย map2sat เป็นการปรับเปลี่ยนรูปแบบของเครือข่าย SPADE ที่สมบูรณ์แบบ ซึ่งฝึกอบรมที่ 256×256 พิกเซลเท่านั้น ผู้เขียนระบุว่านี่เป็นการนำไปใช้แบบเบาและคล่องตัว ซึ่งนำไปสู่น้ำหนักเพียง 31.5mb เทียบกับ 436.9mb ในเครือข่าย SPADE ที่สมบูรณ์แบบ

ใช้ภาพถ่ายดาวเทียมจริง 3000 ภาพในการฝึกอบรมเครือข่ายย่อยสองเครือข่ายเป็นเวลา 70 โครกของการฝึกอบรม ทั้งหมดมีข้อมูลเชิงสำเนียงเท่ากัน (เช่น ความเข้าใจแนวคิดระดับต่ำเกี่ยวกับวัตถุที่แสดง เช่น ‘ถนน’) และข้อมูลเมตาดาต้าตำแหน่งที่อิงจากภูมิศาสตร์

วัสดุเพิ่มเติมมีอยู่ในหน้าโครงการ และมีวิดีโอที่มาพร้อมกัน (ฝังไว้ด้านล่าง)

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai