AI 모델 및 플랫폼
연구자들, 딥러닝으로 랜드마크 사진을 4D로 변환

콘奈尔 대학교의 연구자들은 세계 랜드마크 사진을 4D로 변환하는 새로운 방법을 개발했습니다. 팀은 로마의 트레비 분수와 같은 주요 랜드마크의 공개된 관광 사진을 사용했으며, 결과는 3D 이미지로 조작할 수 있고 시간이 지남에 따라 외관의 변화를 보여줍니다.
새로 개발된 방법은 태그가 없는 수만 장의 사진을 입력하고 합성하며, 컴퓨터 비전 분야에서 큰 발전입니다.
이 연구는 “크라우드플레노틱 함수 샘플링”으로 제목이 붙여졌으며, 8월 23일부터 28일까지 개최된 가상 유럽 컴퓨터 비전 회의에서 발표되었습니다.
노아 스네블리은 콘奈尔 테크의 컴퓨터 과학 부교수이자 논문의 선임 저자입니다. 다른 기여자는 콘奈尔 박사 과정 학생인 정치 리, 논문의 첫 저자,以及 컴퓨터 과학 조교수인 에이브 데이비스, 그리고 콘奈尔 테크 박사 과정 학생인 원치 시안입니다.
스네블리는 “새로운 장면 모델링 방법으로, 헤드를 움직여 분수대를 다양한 관점에서 볼 수 있을 뿐만 아니라 시간을 변경하는 컨트롤도 제공합니다”라고 말했습니다.
“당신이真的去了 트레비 분수에假期를 보냈다면, 그 모습은 당신이 언제 갔는지에 따라 달라집니다. 밤에는 바닥에서 홍수등으로照明되며, 오후에는 햇빛으로照明되며, 흐린 날에는 달라집니다. 우리는 이러한 비정리된 사진 컬렉션에서 시간과 날씨에 따른 전체 외관 범위를 학습하여 장면을 탐색하고同時에 이동할 수 있습니다”라고 그는 계속했습니다.
전통적인 컴퓨터 비전의 한계
전통적인 컴퓨터 비전은 다양한 텍스처를 재현해야 하므로 장소를 정확하게 표현하기 어렵습니다.
스네블리는 “실제 세계는 너무 다양하여 다양한 재료가 있으며, 반짝이는 물건, 물, 얇은 구조물이 있습니다”라고 말했습니다.
또한 전통적인 컴퓨터 비전은 일관성 없는 데이터로 어려움을 겪습니다. 플레노픽 함수는 어떤 장면이 공간과 시간의 모든 관점에서 어떻게 보이는지 나타내는 것입니다. 그러나 이를 재현하려면 수백개의 웹캠이 장면에서 필요하며, 낮과 밤ตลอด에 녹화되어야 합니다. 이것은 가능하지만, 이러한 방법이 필요한 장면의 수를 고려할 때 매우 자원 집중적인 작업입니다.
다른 사진에서 학습
이러한 문제를 해결하기 위해 연구팀은 새로운 방법을 개발했습니다.
스네블리는 “정확한 관점에서 4시부터 촬영된 사진이 데이터 세트에 없을 수 있습니다. 그래서 우리는 9시부터 한 위치에서 촬영된 사진과 다른 위치에서 4시 3분에 촬영된 사진에서 학습해야 합니다”라고 말했습니다. “그리고 우리는 이러한 사진이 언제 촬영되었는지 모릅니다. 그러나 딥러닝을 사용하면 어떤 시간과 장소에서 장면이 어떻게 보였을지 추론할 수 있습니다.”
연구자들은 4차원에서 외관을 보간하기 위해 새로운 장면 표현 방법인 딥 멀티플레인 이미지를 도입했습니다.
스네블리는 “우리는 2D 애니메이션에서 3D 효과를 만드는 데 사용된 아이디어와 같은 아이디어를 사용하여 실제 장면에서 3D 효과를 만들기 위해 이 딥 멀티레이어 이미지를 생성했습니다. 이것은 매우 오래된 클래식 기법에서 비롯된 것입니다”라고 말했습니다.
연구는 훈련된 모델이 다양한 사이트에서 공개된 5만 장의 이미지로 장면을 생성할 수 있음을 보여주었습니다. 팀은 이것이 컴퓨터 비전 연구 및 가상 관광 등 많은 분야에서 의미가 있을 수 있다고 믿습니다.
스네블리는 “당신은 정말 그곳에 있는 것 같은 느낌을 받을 수 있습니다”라고 말했습니다. “-surprisingly 잘 작동합니다.”
이 프로젝트는 전 구글 최고경영자이자 재단가인 에릭 슈미트, 그리고 웬트 슈미트의 지원을 받았습니다.
(GOOGL )https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title












