AI 모델 및 플랫폼
Vidu, 차세대 플래그십 AI 비디오 모델 Q4 프리뷰를 출시

ShengShu Technology는 2026년 10월 7일에 Vidu Q4 프리뷰를 출시했으며, 이는 표현력이 풍부한 오디오와 비디오를 위한 차세대 플래그십 모델의 첫 공개 프리뷰입니다. 출시 가격은 초당 $0.014부터 시작되며, 프리뷰는 Vidu의 웹 제품 및 API 플랫폼을 통해 이용할 수 있습니다.
이 모델은 최대 15개의 이미지 레퍼런스와 최대 3개의 오디오 레퍼런스를 지원하며, 출력은 2K 또는 4K 해상도와 10비트 색 깊이를 제공합니다. 회사는 이번 프리뷰가 독립 크리에이터, 소규모 스튜디오 및 내러티브와 상업 작업을 모두 아우르는 제작 팀을 대상으로 한다고 밝혔습니다.
캐릭터 퍼포먼스, 카메라 워크 및 시각 효과
ShengShu Technology는 Q4 프리뷰가 얼굴 표정, 감정, 신체 움직임 및 음성을 보다 잘 조정하도록 설계되어 미묘한 표정, 보다 명확한 감정 전달 및 자연스러운 움직임을 제공한다고 밝혔습니다. 최대 세 개의 레퍼런스 오디오 클립을 사용하면 캐릭터의 목소리를 일관되게 유지하고 감정적으로 일치하도록 할 수 있으며, 최대 15개의 레퍼런스 이미지는 단일 크리에이티브 설정 내에서 캐릭터, 의상, 소품, 제품 및 환경을 정확히 지정할 수 있습니다. 회사는 이러한 제어 기능이 장면 전반에 걸쳐 시각 및 음성 선택을 결합하고, 내러티브 프로젝트에 무대 연출과 퍼포먼스에 대한 보다 의도적인 제어를 제공하도록 설계되었다고 말했습니다.
발표에서는 카메라 움직임, 컷 및 화면상의 액션 간의 더 긴밀한 조정을 설명합니다. 전투나 추격전과 같은 빠른 시퀀스에서는 카메라가 액션을 보다 일관되게 따라가도록 설계되었으며, 폭발, 불꽃놀이 및 파티클과 같은 효과가 주변 환경에 보다 자연스럽게 녹아듭니다. 2K 및 4K 모드는 향상된 조명과 전반적인 미학과 함께 제공되며, 넓은 해상도 범위는 초기 단계의 크리에이티브 테스트와 최종 고해상도 출력 모두에 활용됩니다.
\”고급 비디오 모델은 신중하게 선택된 데모를 넘어 스스로 입증해야 합니다. 효율성의 모든 향상은 궁극적으로 크리에이터에게 한 번 더 촬영하거나 한 번 더 버전을 만들 자유를 제공해야 합니다,\” 라고 ShengShu Technology의 공동 창업자이자 CEO인 Yihang Luo가 출시 발표에서 말했습니다.
가격 및 의도된 사용
출력 옵션은 540p, 720p, 1080p, 2K 및 4K를 포함합니다. ShengShu Technology는 출력 사양과 청구 조건이 유사할 경우 Q4 프리뷰가 동일한 예산으로 최대 5배의 출력을 제공한다고 밝혔습니다. 회사는 가격을 반복 작업의 현실에 맞추었습니다: 제작 준비가 된 샷을 얻으려면 일반적으로 한 번 이상의 시도가 필요하며, 이는 캐릭터 표정 조정, 대체 카메라 각도 평가 또는 다양한 오프닝 실험을 의미합니다. 의도된 사용 사례로는 광고 팀이 창의적 콘셉트와 오프닝 시퀀스를 평가하는 것, 전자상거래 팀이 다양한 제품 및 대상 고객을 위한 변형을 만드는 것, 그리고 영화 제작자가 퍼포먼스, 스토리보드 및 템포를 테스트하여 제작을 진행하기 전에 검증하는 것이 포함됩니다.
발표에 따르면 최종 가격, 지원 해상도, 기능 가용성 및 사용 조건은 플랜 및 지역에 따라 달라질 수 있으며, 전체 가격 세부 정보와 프로모션 조건은 Vidu 웹사이트에 공개됩니다.
제품 모드 및 API 사양
Vidu의 공식 제품 페이지에는 Q4용 Image-to-Video와 Reference-to-Video 모드가 나열되어 있습니다. Image-to-Video는 텍스트 프롬프트를 통해 단일 업로드 이미지를 애니메이션화하고, Reference-to-Video는 1~15개의 이미지 레퍼런스와 0~3개의 오디오 레퍼런스를 결합하여 주제와 목소리를 일관되게 유지합니다. 제품 페이지에서 Reference-to-Video는 1~16초의 길이로, Image-to-Video는 3~16초의 길이로 표시되며, 페이지 하이라이트에는 최대 4K 해상도와 최대 16초 비디오 길이가 포함됩니다. 출력은 업로드된 자료의 원본 종횡비를 유지하고, 페이지는 AI 시리즈, 광고, 소셜 콘텐츠 및 영화 제작을 모델이 설계된 시나리오로 명시합니다.
개발자를 위해 이미지-비디오 문서는 모델을 viduq4-preview라는 이름으로 나열합니다. POST https://api.vidu.com/ent/v2/img2video. 엔드포인트는 png, jpeg, jpg 또는 webp 형식의 최대 50MB 크기의 단일 시작 프레임 이미지를 입력으로 받고, 최대 20,000자 길이의 프롬프트, 기본값 5초인 3~16초 길이, 기본값 720p인 540p에서 4K까지의 해상도를 지원합니다. 오디오 매개변수는 기본값이 true이며, 대화와 효과음을 포함할 수 있는 사운드가 포함된 비디오를 생성합니다. 문서에 따르면 모델은 오디오-비디오 동기화와 자동 카메라 전환을 지원합니다.
레퍼런스-비디오 문서는 나열합니다 POST https://api.vidu.com/ent/v2/reference2video, 이는 1~15개의 이미지와 3~12초 길이의 mp3 오디오 레퍼런스 0~3개를 받아들이며, 종횡비 옵션은 1:1, 9:16, 16:9, 3:4 및 4:3이며 기본값은 16:9입니다. 프롬프트에 레퍼런스 대상에 대한 태그를 삽입할 수 있고, 문서에 따르면 모델은 레퍼런스 사운드가 포함된 비디오 생성, 지능형 카메라 전환, 여러 카메라 위치 간 일관성 및 오디오와 비디오를 동시에 출력하는 것을 지원합니다. 반환된 생성 URL은 24시간 동안 유효합니다.
Vidu는 전체 Q4 모델 이전에 Q4 프리뷰를 출시하여 크리에이터가 실제 프로젝트에 적용할 수 있도록 하며, ShengShu Technology는 성능, 창의적 제어 및 일상적인 제작 요구에 대한 의견이 최종 릴리스를 형성할 것이라고 밝혔습니다.












