Anderson의 관점

AI를 사용하여 필름 그레인을 시뮬레이션하는 방법

mm
Unite.AI를 Google의 선호 소스에 추가
Varying grain levels in 'Jaws' (1976) – source: https://ipolcore.ipol.im/demo/clientApp/demo.html?id=192 and https://www.britannica.com/topic/Jaws-film-by-Spielberg

미국을 그레인으로 만들자: 새로운 AI 도구는 오래된 영상을 필름 그레인으로부터 분리할 수 있으며, 비디오를 원래 크기의 일부로 압축한 다음 그레인을 다시 적용하여 시청자가 이를 알아차리지 못하게 할 수 있다. 이는 기존 비디오 표준과 함께 작동하며, 비트율을 최대 90%까지 절감하면서 빈티지 룩을 유지한다.

 

많은 사람들이 영화나 오래된 TV 쇼를 시청할 때, 필름 그레인의 ‘작동’은 안심할 수 있다. 우리가 의식적으로 인식하지 않더라도, 그레인은 우리가 시청하는 것이 화학물질로 만들어졌으며, 코드가 아니라, 물리적 세계와 경험을 연결시키는 것을 알려준다. 이것은 스톡 선택, 노출, 실험실 과정, 그리고 잊혀진 시대와 관련이 있다.

<img class="size-full wp-image-219345" src="https://www.unite.ai/wp-content/uploads/2025/06/grain-styles-in-hollywood.jpg" alt="할리우드의 그레인 접근 방식은 문화와 생산 방법의 변화를 따라 바뀌었다. 1960년대에는 카메라 스톡과 사진 기술의 발전이 그 десяти年的 고유한 시각적 정체성을 기여했다. 나중에 디지털에서 작업하는 감독들은 의도적으로 그레인을 다시 도입하기 시작했다. 1980년대 중반에 감독 제임스 캐머런은 에일리언(1986, 위의 이미지에서 오른쪽 아래)에 특히 粗한 코닥 스톡을 선택했을 가능성이 있다. 이는 대기를 강화하는 데 도움이 될 뿐만 아니라 실제 VFX 미니어처 작업에서 와이어를 숨기는 데에도 도움이 될 것이다. 출처: https://archive.is/3ZSjN (내가 가장 최근에 작성한 이 주제에 대한 기사) 출처: https://archive.is/3ZSjN (내가 가장 최근에 작성한 이 주제에 대한 기사)

아날로그 텍스처는 미디어를 제작하는 데 실제 돈이 들었던 시대에서 나온 것으로, 접근이 제한적이었으며, 적어도 느슨하게는 가장 능력 있는 사람이나 결심한 사람만이 통과할 수 있는 약간의 감각이 있었다. 이것은 실제성과 신뢰성의 약어로 작용했으며, 높은 해상도 캡처 기술이 이를 제거했을 때, 노스탈지어로 변했다.

크리스토퍼 놀란은 절대 디지털로 전환하지 않았다. 대부분의 산업이 디지털을 속도와 유연성으로 인해 받아들이는 동안, 유명한 감독은 셀룰로이드를 고수했다. 그는 이것을 규율과 미학으로서 사용했다.

Denis Villeneuve는 디지털 파이프라인 안에서 작업하지만, 여전히 자신의 영상을 사진화학적 과정으로 파싱한다. 듄 영화의 경우, 디지털로 촬영되었지만, 필름 스톡에 인쇄된 다음 다시 디지털로 스캔되었다. 이는 대기와 효과를 위해 이루어졌다.

인공 그레인

필름과 TV의 품질을 아는 사람들은 높은 해상도에서 그레인을 보는 것을 연관시킨다. 여기서 비트레이트(각 프레임에 푸시되는 데이터의 양)는 इतन큼 높아서 가장 작은 세부 사항, 즉 할라이드 그레인까지도 보존된다.

그러나 스트리밍 네트워크가 실제로 이러한 비트레이트를 제공한다면, 네트워크 용량에 심각한 부담을 줄 것이며, 버퍼링과 스투터링이 발생할 가능성이 있다. 따라서 넷플릭스와 같은 플랫폼은 AV1 버전의 콘텐츠를 최적화하고 AV1 코덱의 기능을 사용하여 영화나 에피소드에 그레인을 추가한다. 이는 지능적으로 그리고 적절한 방식으로 이루어지며, 이를 통해 30%의 대역폭을 절약할 수 있다.

AV1은 인공 필름 그레인을 통합하도록 설계되었습니다. 출처: https://waveletbeam.com/index.php/av1-film-grain-synthesis

AV1은 인공 필름 그레인을 통합하도록 설계되었습니다. 출처: https://waveletbeam.com/index.php/av1-film-grain-synthesis

‘그레인 페티시’는 비닐의 부흥과 같은 아타비스틱한 추세와 유사한 디지털의 상대적으로 드문 등가물이다. 스트리머가 최적화된 비디오를 실제로 비싼 ‘원시 비디오’로 만들기 위해 사용하는지, 또는 구식 4:3 쇼가 스트리밍 제공업체가 와이드스크린 화면 비율로 자르면 발생하는 인식 품질 저하를 방지하기 위해 사용하는지, 또는 일반적으로 레트로 ‘놀란 에스테틱’에 복종하는지 difficile로 말할 수 있다.

그레인 실로

문제는 그레인이 또한 노이즈라는 것이다. 디지털 시스템은 노이즈를 싫어하며, 스트리밍 코덱과 같은 AV1은 대역폭을 절약하기 위해 노이즈를 제거한다. 마찬가지로, Topaz Gigapixel 시리즈와 같은 AI 업스케일러는 그레인을 수정할 오류로 간주한다.

확산 기반 이미지 합성의 분야에서, 그레인은 매우 생성하기 어렵다. 왜냐하면 그것은 극단적인 세부 사항을 나타내기 때문이다. 따라서 이는 보통 매우 큰 모델에서만 나타날 것이다. 전체 잠재적 확산 모델(LDM) 아키텍처는 노이즈(예: 그레인)를 명확한 이미지로 분해하기 위해 설계되었기 때문이다.

그레인을 생성하는 것은 기계 학습을 사용하여 어려울 수 있다. 그리고 만약 누군가 그렇게 할 수 있다면, 렌더링을 최적화된 비디오로 바로 다시 넣으면 비디오 파일의 크기가 다시 증가할 것이다.

이후의 논리적인 고려로 인해, 최신 비디오 코덱과 같은 VVC(VERSATILE VIDEO CODING)은 그레인을 일종의 ‘사이드카’ 서비스로 제공한다.

VVC는 깨끗한 비디오를 압축하고 그레인을 버린다. 그레인 패턴을 무작위로 유지하려고 노력하는 대신, 그것은 그레인을 별도로 분석하고, 비디오 재생 시 유사한 그레인을 재생성하는 데 사용되는 작은 매개변수 세트(예: 진폭, 주파수 및 블렌딩 모드)를 인코딩한다.

이 매개변수는 FGC-SEI(Film Grain Characteristics Supplemental Enhancement Information) 스트림에 저장되며, 주요 비트 스트림과 함께 전송된다. 디코딩 후, 합성 모듈은 원래와 유사한 인공 그레인을 다시 적용하기 위해 이러한 지침을 사용한다.

이것은 높은 비트레이트, 그레인 풍부한 에뮬레이션의 ‘외관’을 보존하는 동시에 실제 비트레이트를 낮게 유지한다. 인코더는 예측할 수 없는 노이즈를 유지하기 위해 자원을 소비할 필요가 없기 때문이다.

또한, 이 인공 ‘그레인’ 콘텐츠는 해당 비디오에 특정하다. 즉, 제네릭 그레인 필터를 플랫폼에서 자동으로 적용하거나 Photoshop 또는 After Effects와 같은 플랫폼에서 무작위로 적용하는 것은 ‘적합한’ 그레인이 아닌 노이즈의 무작위 오버레이를 생성할 것이다.

왼쪽: 원본 이미지. 중앙: Photoshop Camera Raw Grain을 모든 채널에 균일하게 적용. 오른쪽: 동일한 Grain 필터를 각 채널에 개별적으로 순차적으로 적용. 출처 이미지(CCO): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (내 이전 기사에서)

왼쪽: 원본 이미지. 중앙: Photoshop Camera Raw Grain을 모든 채널에 균일하게 적용. 오른쪽: 동일한 Grain 필터를 각 채널에 개별적으로 순차적으로 적용. 출처 이미지(CCO): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (내 이전 기사에서)

Photoshop의 ‘그레인’ 필터는 균일한 무작위 노이즈를 추가한다. 그러나 실제 필름 그레인은 다양한 크기의 할라이드 결정을 통해 발생한다. 필터를 각 채널에 개별적으로 적용하면(위의 이미지 참조) 더 많은 혼란을 일으키지 않고 현실성을 만들지 않는다. 실제 필름 그레인은 노출 순간에 계층화된 에뮬레이션에 빛이 어떻게 영향을 미치는지 반영한다. 이를 시뮬레이션하려면 각 이미지 영역이 할라이드 레이어를 어떻게 활성화했는지 추정해야 한다. 단순히 RGB 레이어에 효과를 분할하는 것이 아니다.

FGA-NN

이 의심스러운 추구에 들어온 새로운 연구 논문은 프랑스에서 나왔으며, 그레인을 분석하고 재생성하는 방법으로 양적으로 그리고 질적으로 우수한 방법을 제공한다.

그라운드 트루스 그레인과 다양한 분석 및 합성 방법의 결과 비교. 출처: https://arxiv.org/pdf/2506.14350

그라운드 트루스 그레인과 다양한 분석 및 합성 방법의 결과 비교. 출처: https://arxiv.org/pdf/2506.14350

새로운 시스템, FGA-NN은, 기존의 가우시안 기반 그레인 합성을 위한 표준 VVC 호환 방법, Versatile Film Grain Synthesis(VFGS)를 사용한다. 그러나 시스템이 변경하는 것은 분석이다. 신경망을 사용하여 합성 매개변수를 더 정확하게 추정한다.

따라서 최종 그레인은 여전히 표준 가우시안 모델을 사용하여 합성된다. 그러나 네트워크는 규칙 기반 생성기에 더 나은 메타데이터를 제공하여 최첨단 모델을 얻는다.

새로운 논문은 FGA-NN: Film Grain Analysis Neural Network라고 제목이 붙여져 있다. 세 명의 연구자들에 의해 InterDigital R&D, Cesson-Sévigné에서 나왔다. 이 논문은 길지 않지만, 새로운 방법이 제공하는 몇 가지 주요 측면을 살펴보겠다.

방법

요약하면, FGA-NN 시스템은 그레인이 있는 비디오를 입력으로 받아서 그레인의 컴팩트한 설명을 추출하고, 표준화된 FGC-SEI 형식의 매개변수를 출력한다. 이러한 매개변수는 비디오와 함께 전송되어 디코더가 VFGS를 사용하여 그레인을 재구성할 수 있다.

FGA-NN을 사용하여 비디오 배포에서 필름 그레인을 분석하고 다시 적용하는 스키마 및 VFGS를 사용하여 합성

FGA-NN을 사용하여 비디오 배포에서 필름 그레인을 분석하고 다시 적용하는 스키마 및 VFGS를 사용하여 합성

네트워크를 훈련시키기 위해, 저자들은 그레인이 있는 비디오와 해당 FGC-SEI 메타데이터의 쌍이 필요했다. 대부분의 그레인이 있는 푸터에는 이러한 메타데이터가 없기 때문에, 연구자들은 FGC-SEI 매개변수를 생성하고 합성 그레인을 깨끗한 비디오에 적용하여 훈련 예제를 만들었다.

FGA-NN을 위한 훈련 데이터는 BVI-DVC 및 DIV2K 데이터셋의 깨끗한 푸터에 합성 그레인을 적용하여 생성되었다. 무작위로 생성된 FGC-SEI 매개변수는 VFGS 합성 도구와 함께 사용되어 각 그레인이 있는 비디오가 알려진 메타데이터와 쌍을 이룰 수 있었다.

주파수 기반 모델은 현재 비디오 표준에서 지원되며, 매개변수 범위는 루마와 크로마 채널에서 시각적 일관성을 유지하기 위해 제한되었다.

훈련 데이터는 BVI-DVC 및 DIV2K 데이터셋의 깨끗한 푸터에 합성 그레인을 적용하여 생성되었다. 무작위로 생성된 FGC-SEI 매개변수는 VFGS 합성 도구와 함께 사용되어 각 그레인이 있는 비디오가 알려진 메타데이터와 쌍을 이룰 수 있었다.

BVI-DVC 및 DIV2K 데이터셋의 깨끗한 푸터에 합성 그레인을 적용하여 생성된 무작위로 생성된 FGC-SEI 매개변수 범위 개요

BVI-DVC 및 DIV2K 데이터셋의 깨끗한 푸터에 합성 그레인을 적용하여 생성된 무작위로 생성된 FGC-SEI 매개변수 범위 개요

주파수 필터링 모델은 현재 코덱 구현에서 지원되는 유일한 합성 방법이며, VVC 테스트 모델(VTM)과 같은 것을 사용했다. 매개변수 범위는 루마와 크로마 채널에서 시각적 일관성을 유지하기 위해 제한되었다.

네트워크 효과

FGA-NN에는 루마와 크로마를 위한 두 개의 조정된 모델이 있으며, 각각은 실제 필름 그레인을 재현하는 데 필요한 특정 매개변수를 예측하도록 설계되었다.

입력 이미지의 각 세트에 대해, 시스템은 강도 간격 집합, 각 간격에 연결된 스케일링 인자, 수평 및 수직 절단 주파수 및 로그2스케일이라는 전체 스케일링 조정을 예측한다. 이를 처리하기 위해, 모델은 공유 특징 추출기를 사용하여 그레인이 있는 입력을 처리하고, 각 예측 작업에 책임이 있는 4개의 별도 출력 분支로 피드한다.

FGA-NN의 루마 버전 아키텍처. 공유 백본이 그레인이 있는 입력 프레임에서 특징을 추출하고, 간격 경계, 스케일링 인자, 절단 주파수 및 전역 로그2스케일을 위한 4개의 출력 분支로 피드한다.

FGA-NN의 루마 버전 아키텍처. 공유 백본이 그레인이 있는 입력 프레임에서 특징을 추출하고, 간격 경계, 스케일링 인자, 절단 주파수 및 전역 로그2스케일을 위한 4개의 출력 분支로 피드한다.

간격 경계는 회귀를 통해 예측되고, 스케일링 인자, 절단 주파수 및 전역 스케일 설정은 분류 문제로 처리된다.

아키텍처는 각 작업의 복잡성을 반영하여 조정되며, 더 세부적인 예측을 위한 더 큰 내부 레이어가 사용된다. 특히, 크로마 모델은 루마 구조를 반영하지만, 색상 데이터의 다른 특성을 반영하기 위해 조정된다.

훈련 및 테스트

FGA-NN은 네 개의 목적 함수를 사용하여 훈련되었으며, 각 함수는 네트워크의 예측 작업 중 하나와 일치했다. 분류 출력에 대해, 예측 레이블과 실제 레이블 간의 간격을 줄이기 위해 범주형 교차 엔트로피 손실을 사용했다.

간격 경계는 0에서 1까지의 범위로 정규화되었으며, 큰 오류를 더 많이 처벌하는 지수적으로 스케일링된 L1 손실(expL1)과 단조성 패널티의 조합으로 최적화되었다. 단조성 패널티는 하향식 경사를 방지했다. 모든 네 개의 손실은 결합되었으며, 절단 및 스케일링 인자에 높은 가중치를 할당하고, 간격 경계와 로그2스케일에 1과 0.1의 가중치를 할당했다.

훈련은 Adam 옵티마이저를 사용하여 수행되었으며, 학습률은 5e-4, 10,000 반복, 배치 크기는 64로 설정되었다.

비교 가능한 유일한 도구는 FGA-CONVENT였다. 이는 또한 FGC-SEI 형식의 값을 생성하며, 그레인 처리에 사용된다. 두 시스템은 UHD 시퀸스에서 테스트되었으며, 실제 필름 그레인이 포함된 푸터를 사용하여 테스트되었다.

각 방법을 사용하여 생성된 동일한 크롭된 프레임. 로그2스케일 게인이 축 레이블에 표시된다.

각 방법을 사용하여 생성된 동일한 크롭된 프레임. 로그2스케일 게인이 축 레이블에 표시된다.

이미지에서, VFGS를 사용하여 각 방법의 매개변수를 사용하여 생성된 동일한 크롭된 프레임을 볼 수 있다. 각 방법의 루마 예측은 수동으로 설정된 그라운드 트루스 값과 비교하여 플로팅된다.

저자들은 다음과 같이 말한다:

‘FGA-NN은 실제 필름 그레인 패턴 및 진폭의 전반적인 경향을 정확하게 캡처하여, 그라운드 트루스와 유사한 시각적 인상을 가진 합성 이미지를 생성한다. ‘

‘반면에, FGA-CONVENT는 더 낮은 스케일링 인자를 예측하며, 이는 그 디자인의 결과로 더 낮은 로그2스케일 인자로 보상되며, 참조와 비교하여 더 거친 필름 그레인 패턴을 생성하여 뚜렷하지만 시각적으로 일관된 외관을 생성한다.’

그들은 직접 그라운드 트루스 그레인 매개변수와의 비교가 신뢰할 수 없다고 주장한다. 스케일링과 로그2스케일은 서로 보상할 수 있으며, 작은 오류는 시각적으로 큰 영향을 미치지 않는다.

신뢰 테스트

필름 그레인 충실도는 네 가지 워크플로우에서 벤치마크되었다: FGA-NN + VFGS; FGA-CONVENT + VFGS; Style-FG; 및 3R-INN. 테스트는 FGC-SEI 및 FilmGrainStyle740k 데이터셋을 사용하여 수행되었으며, 출력은 학습된 감각적 유사성 지표(LPIPS); JSD-NSS; 및 Kullback-Leibler(KL) 발산을 사용하여 그라운드 트루스와 비교되었다.

FilmGrainStyle740k 데이터셋의 벤치마크 결과. Style-FG와 3R-INN이 최고의 결과를 얻었으며, 이는 이 데이터셋에서 훈련되었기 때문이다. FGA-NN은 근소하게 뒤처졌다. FGA-CONVENT는 다중 프레임 분석 및 균일한 영역에 의존하기 때문에 이 경우에는 성능이 저조했다.

FilmGrainStyle740k 데이터셋의 벤치마크 결과. Style-FG와 3R-INN이 최고의 결과를 얻었으며, 이는 이 데이터셋에서 훈련되었기 때문이다. FGA-NN은 근소하게 뒤처졌다. FGA-CONVENT는 다중 프레임 분석 및 균일한 영역에 의존하기 때문에 이 경우에는 성능이 저조했다.

저자들은 다음과 같이 말한다:

‘FilmGrainStyle740k 테스트 세트에서, Style-FG와 3R-INN이 최고의 결과를 얻었으며, 이는 이 데이터셋에서 훈련되었기 때문이다. FGA-NN은 근소하게 뒤처졌다. FGA-CONVENT의 성능은 저조했다. 이는 다중 프레임 분석 및 균일한 영역에 의존하기 때문이다. 이 경우에는 이러한 조건이 충족되지 않았다.’

‘이 경우에는 작은 텍스처가 풍부한 입력이 사용되었기 때문에, FGA-CONVENT는 어려움을 겪었다. 이는 일반적인 필름 그레인 분석 사용 사례에서 기대할 수 있는 것과 다르다.’

‘이로 인해 FGA-CONVENT를 작은 이미지에 적용하는 것은 불가능했다.’

마지막으로, 저자들은 학습 기반 방법(예: 3R-INN 및 Style-FG)이 커레이션된 데이터셋에서 강한 시각적 결과를 생성하는 반면, 높은 계산 비용으로 인해 최종 사용자 장치에 배포하는 것이 적합하지 않다고 주장한다.

다양한 분석 및 합성 워크플로우를 사용하여 향상된 저 비트레이트 프레임 비교

다양한 분석 및 합성 워크플로우를 사용하여 향상된 저 비트레이트 프레임 비교

반면에, 새로운 논문에서 제안된 접근 방식은 경량의 FGA-NN 분석 모듈과 하드웨어 효율적인 VFGS 합성 방법을 결합한다. 저자들은 이것을 압축된 비디오에 필름 그레인을 다시 도입하는 더 실용적이고 배포 가능한 솔루션으로 설명한다.

그들은 또한 FGA-NN의 이점이 상당할 수 있다고 주장한다:

‘중간에서 낮은 비트레이트로 UHD 비디오를 인코딩할 때, 필름 그레인 분석 및 합성 워크플로우를 사용하면, 높은 비트레이트 인코딩에 비해 최대 90%의 비트레이트 절감을 달성할 수 있다.’

결론

필름 그레인에 대한 집착은 포스트 아날로그 시대의 가장 이상하고 가장 호기심을 자극하는 관념 중 하나이며, 필름 그레인이 이제는 본질적으로 진실성과 인증성의 상징이 된 것은 흥미롭다. 필름 그레인을 재현하는 최신 방법을 포함하여, 현재의 상태에서 최고의 그레인 재현 방법은 실제 필름 그레인의 효과를 완전히 캡처할 수 없다.

필름 그레인은 실제 필름 그레인의 효과를 완전히 캡처할 수 없다. 이는 실제 필름 그레인이 실제로 필름 그레인과 같은 효과를 낼 수 없기 때문이다.

첫 번째로 게시됨: 2025년 6월 18일 수요일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]