Взгляд Anderson

HunyuanCustom представляет собой видео-глубокие фейки на основе одного изображения, с аудио и синхронизацией губ

mm
Добавьте Unite.AI в избранные источники в Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Эта статья обсуждает новый выпуск многомодального модели видео Hunyuan под названием ‘HunyuanCustom’. Широта охвата новой статьи, в сочетании с несколькими проблемами в многих примерах видео на странице проекта*, ограничивает нас более общим освещением, чем обычно, и ограниченным воспроизведением огромного количества видеоматериала, сопровождающего этот выпуск (поскольку многие из этих видео требуют значительной редактирования и обработки для улучшения читаемости макета).

Пожалуйста, обратите внимание, что статья относится к системе генерации на основе API Kling как к ‘Keling’. Для ясности я буду называть ‘Kling’ на протяжении всей статьи.

 

Tencent находится в процессе выпуска новой версии своей модели Hunyuan Video, озаглавленной HunyuanCustom. Новый выпуск, по-видимому, способен сделать модели Hunyuan LoRA излишними, позволяя пользователю создавать видео-глубокие фейки через одно изображение:

Нажмите, чтобы воспроизвести. Промпт: ‘Человек слушает музыку и готовит лапшу в кухне’. Новый метод сравнивается с методами как закрытого, так и открытого исходного кода, включая Kling, который является значительным соперником в этой области. Источник: https://hunyuancustom.github.io/ (предупреждение: CPU/память-интенсивный сайт!)

В левом столбце видео выше мы видим исходное изображение, предоставленное HunyuanCustom, за которым следует интерпретация подсказки в втором столбце, рядом с ним. Остальные столбцы показывают результаты различных проприетарных и FOSS-систем: Kling; Vidu; Pika; Hailuo; и Wan-based SkyReels-A2.

В видео ниже мы видим рендеры трех сценариев, важных для этого выпуска: соответственно, человек + объект; одиночная имитация персонажа; и виртуальная примерка (человек + одежда):

Нажмите, чтобы воспроизвести. Три примера, отредактированные из материалов на сайте поддержки Hunyuan Video.

Мы можем заметить несколько вещей из этих примеров, в основном связанных с тем, что система полагается на одно исходное изображение, вместо нескольких изображений одного и того же предмета.

В первом клипе человек по сути все еще смотрит в камеру. Он наклоняет голову вниз и в сторону не более чем на 20-25 градусов поворота, но при наклоне более этого система должна была бы начать угадывать, как он выглядит в профиль. Это трудно, вероятно, невозможно точно определить из одного фронтального изображения.

Во втором примере мы видим, что маленькая девочка улыбается в сгенерированном видео, как и на одном статическом исходном изображении. Снова, с этим одним изображением в качестве справочного материала, HunyuanCustom должен был бы сделать относительно неинформированное предположение о том, как выглядит ее ‘расслабленное лицо’. Кроме того, ее лицо не отклоняется от камеры более чем на 20-25 градусов поворота.

В последнем примере мы видим, что поскольку исходный материал – женщина и одежда, которую она примеряет – не являются полными изображениями, рендер обрезал сцену, чтобы она соответствовала – что на самом деле является довольно хорошим решением проблемы с данными!

Основная идея заключается в том, что хотя новая система может обрабатывать несколько изображений (например, человек + закуски или человек + одежда), она, по-видимому, не позволяет использовать несколько углов или альтернативные виды одного персонажа, так что разнообразные выражения или необычные углы могли бы быть учтены. В этой степени система может поэтому испытывать трудности в замене растущего экосистемы моделей LoRA, которые появились вокруг HunyuanVideo с момента его выпуска в прошлом декабре, поскольку эти модели могут помочь HunyuanVideo производить последовательные персонажи с любого угла и с любым выражением лица, представленным в обучающем наборе данных (20-60 изображений является типичным).

Проводимые для звука

Для аудио HunyuanCustom использует систему LatentSync (известную тем, что она трудна для хоббиистов в настройке и получении хороших результатов) для получения движений губ, соответствующих аудио и тексту, который пользователь предоставляет:

Оснащен аудио. Нажмите, чтобы воспроизвести. Различные примеры синхронизации губ из дополнительного сайта HunyuanCustom, отредактированные вместе.

На момент написания этой статьи нет примеров на английском языке, но они, кажется, довольно хороши – тем более, если метод их создания легко устанавливается и доступен.

Редактирование существующего видео

Новая система предлагает, по-видимому, очень впечатляющие результаты для видео-видео (V2V или Vid2Vid) редактирования, при котором сегмент существующего (реального) видео маскируется и интеллектуально заменяется предметом, заданным в одном справочном изображении. Ниже приведен пример из дополнительных материалов сайта:

Нажмите, чтобы воспроизвести. Только центральный объект нацелен, но то, что остается вокруг него, также изменяется в проходе vid2vid HunyuanCustom.

Как мы видим, и как это стандартно в сценарии vid2vid, весь видео изменяется в некоторой степени процессом, хотя наиболее изменен в целевой области, т.е. плюшевом игрушке. Предположительно, могут быть разработаны конвейеры для создания таких преобразований под подходом мусорной маски, который оставляет большинство содержимого видео идентичным исходному. Это то, что делает Adobe Firefly под капотом, и делает это довольно хорошо – но это малоизученный процесс в FOSS-генеративной сцене.

То, что большинство альтернативных примеров, предоставленных, делают лучше работу по нацеливанию этих интеграций, мы можем увидеть в собранной компиляции ниже:

Нажмите, чтобы воспроизвести. Различные примеры интеръекции контента с использованием vid2vid в HunyuanCustom, демонстрирующие заметное уважение к нецелевому материалу.

Новый старт?

Эта инициатива является развитием проекта Hunyuan Video, а не жестким поворотом от того развития потока. Улучшения проекта вводятся как дискретные архитектурные вставки, а не обширные структурные изменения, направленные на то, чтобы позволить модели сохранять идентичность верности по кадрам без опоры на специфичную для субъекта тонкую настройку, как в подходах LoRA или текстовой инверсии.

Чтобы быть ясным, поэтому, HunyuanCustom не обучается с нуля, а представляет собой тонкую настройку основной модели HunyuanVideo декабря 2024 года.

Те, кто разработал модели LoRA HunyuanVideo, могут задаться вопросом, будут ли они работать с этой новой версией, или им придется заново изобретать колесо LoRA снова, если они хотят большей настройки возможностей, чем те, которые встроены в этот новый выпуск.

В общем, сильно донастроенный выпуск гипермасштабной модели изменяет веса модели достаточно, чтобы модели LoRA, сделанные для предыдущей модели, не работали должным образом или вообще не работали с новой моделью.

Иногда, однако, популярность донастройки может бросить вызов ее истокам: один пример донастройки, ставшей эффективным форком, с посвященной экосистемой и последователями, является Pony Diffusion настройка Stable Diffusion XL (SDXL). Pony в настоящее время имеет 592 000+ загрузок на постоянно меняющемся домене CivitAI, с огромным количеством моделей LoRA, которые использовали Pony (а не SDXL) в качестве базовой модели и которые требуют Pony во время вывода.

Выпуск

Страница проекта новой статьи (которая озаглавлена HunyuanCustom: Мультимодальная архитектура для настраиваемой генерации видео) содержит ссылки на сайт GitHub, который, на момент написания, только что стал функциональным, и, по-видимому, содержит все код и необходимые веса для локальной реализации, вместе с предложенным графиком (где единственной важной вещью, которая еще предстоит, является интеграция ComfyUI).

На момент написания этого текста присутствие проекта на Hugging Face все еще является 404. Однако существует версия на основе API, где можно, по-видимому, продемонстрировать систему, если вы можете предоставить код сканирования WeChat.

Я редко видел такое элегантное и обширное использование такого широкого спектра проектов в одном собрании, как это видно в HunyuanCustom – и, по-видимому, некоторые из лицензий все равно потребуют полного выпуска.

Два модели объявлены на странице GitHub: версия 720px1280px, требующая 8)ГБ пиковой памяти GPU, и версия 512px896px, требующая 60ГБ пиковой памяти GPU.

Репозиторий заявляет ‘Минимальная память GPU, необходимая для 720px1280px129f, составляет 24ГБ, но очень медленно… Мы рекомендуем использовать GPU с 80ГБ памяти для лучшего качества генерации’ – и заявляет, что система была протестирована только на Linux.

Предыдущая модель Hunyuan Video, с момента официального выпуска, была квантована до размеров, при которых она может работать на менее 24ГБ VRAM, и, по-видимому, новая модель также будет адаптирована в более потребительские формы сообществом, и она быстро будет адаптирована для использования на системах Windows.

Из-за ограничений по времени и огромного количества информации, сопровождающей этот выпуск, мы можем только взглянуть на этот выпуск в целом, а не глубоко.

Взгляд на статью

Конвейер данных для HunyuanCustom, по-видимому, соответствующий GDPR-рамки, включает в себя как синтезированные, так и открытые наборы видеоданных, включая OpenHumanVid, с восемью основными категориями, представленными: люди, животные, растения, ландшафты, транспортные средства, объекты, архитектура и аниме.

Из статьи, обзор различных вкладывающих пакетов в конвейере построения данных HunyuanCustom. Источник: https://arxiv.org/pdf/2505.04512

Из статьи, обзор различных вкладывающих пакетов в конвейере построения данных HunyuanCustom. Источник: https://arxiv.org/pdf/2505.04512

Первоначальная фильтрация начинается с PySceneDetect, который разделяет видео на отдельные клипы. TextBPN-Plus-Plus затем используется для удаления видео, содержащих чрезмерный текст на экране, субтитры, водяные знаки или логотипы.

Для решения проблем с неоднородностью разрешения и продолжительности клипы стандартизируются до пяти секунд длины и изменяются в размере до 512 или 720 пикселей на короткой стороне. Аэстетическая фильтрация обрабатывается с помощью Koala-36M, с пользовательским порогом 0,06, примененным для пользовательского набора данных, отобранного исследователями новой статьи.

Процесс извлечения субъекта объединяет Qwen7B большую языковую модель (LLM), YOLO11X-рамку распознавания объектов и популярную InsightFace-архитектуру, для выявления и проверки человеческих идентичностей.

Для нечеловеческих субъектов QwenVL и Grounded SAM 2 используются для извлечения соответствующих ограничивающих рамок, которые отбрасываются, если они слишком малы.

Примеры семантической сегментации с Grounded SAM 2, используемой в проекте Hunyuan Control. Источник: https://github.com/IDEA-Research/Grounded-SAM-2

Примеры семантической сегментации с Grounded SAM 2, используемой в проекте Hunyuan Control. Источник: https://github.com/IDEA-Research/Grounded-SAM-2

Многосубъектное извлечение использует Florence2 для аннотации ограничивающих рамок и Grounded SAM 2 для сегментации, за которой следует кластеризация и временная сегментация кадров обучения.

Обработанные клипы дополнительно улучшаются посредством аннотации, используя проприетарную структурированную систему маркировки, разработанную командой Hunyuan, и которая предоставляет слоистые метаданные, такие как описания и подсказки камеры.

Маскирование-стратегии, включая преобразование в ограничивающие рамки, применялись во время обучения для уменьшения переобучения и обеспечения того, чтобы модель адаптировалась к разнообразным формам объектов.

Аудиоданные синхронизировались с помощью вышеупомянутой LatentSync, и клипы отбрасывались, если баллы синхронизации падали ниже минимального порога.

Слепой оценщик качества изображения HyperIQA использовался для исключения видео, оценка которых ниже 40 (по шкале HyperIQA). Действительные аудиодорожки затем обрабатывались с помощью Whisper, чтобы извлечь функции для последующих задач.

Авторы включают LLaVA-модель языкового ассистента во время фазы аннотации и подчеркивают центральную позицию, которую эта рамка занимает в HunyuanCustom. LLaVA используется для генерации подписей изображений и помощи в выравнивании визуального контента с текстовыми подсказками, поддерживая построение связного сигнала обучения по модальностям:

Рамка HunyuanCustom поддерживает генерацию видео, последовательную для идентичности, обусловленную текстом, изображением, аудио и видео-входами.

Рамка HunyuanCustom поддерживает генерацию видео, последовательную для идентичности, обусловленную текстом, изображением, аудио и видео-входами.

Благодаря возможностям выравнивания видения и языка LLaVA, конвейер получает дополнительный слой семантической последовательности между визуальными элементами и их текстовыми описаниями – особенно ценный в многосубъектных или сложных сценариях.

Пользовательское видео

Для генерации видео на основе справочного изображения и подсказки были созданы два модуля, центрированные вокруг LLaVA, сначала адаптируя структуру входных данных HunyuanVideo так, чтобы она могла принимать изображение вместе с текстом.

Это включало форматирование подсказки таким образом, чтобы она внедряла изображение直接 или помечала его коротким описанием идентичности. Токен-сепаратор использовался для предотвращения того, чтобы внедрение изображения подавляло содержимое подсказки.

Поскольку визуальный кодировщик LLaVA склонен сжимать или отбрасывать тонкие пространственные детали во время выравнивания изображения и текстовых функций (особенно при переводе одного справочного изображения в общее семантическое вложение), был включен модуль улучшения идентичности. Поскольку почти все видео-латентные модели имеют некоторые трудности с поддержанием идентичности без LoRA, даже в клипе длиной пять секунд, производительность этого модуля при общественном тестировании может оказаться значительной.

В любом случае, справочное изображение затем изменяется в размере и кодируется с помощью причинно-следственной 3D-VAE из исходной модели HunyuanVideo, и его латент вставляется в видео-латент по временной оси, с пространственным смещением, примененным для предотвращения того, чтобы изображение воспроизводилось напрямую в выходе, сохраняя при этом руководство генерации.

Модель обучалась с помощью Flow Matching, с образцами шума, взятыми из логит-нормального распределения – и сеть была обучена на восстановлении правильного видео из этих шумных латент. LLaVA и видео-генератор были донастроены вместе, чтобы изображение и подсказка могли руководить выходом более плавно и сохранять идентичность субъекта.

Для многосубъектных подсказок каждая пара изображения и текста внедрялась отдельно и присваивалась отдельное временное положение, позволяя идентичностям различаться и поддерживая генерацию сцен, включающих несколько взаимодействующих субъектов.

Звук и видение

HunyuanCustom обусловливает генерацию аудио/речи с помощью как пользовательского аудио, так и текстовой подсказки, позволяя персонажам говорить в сценах, отражающих описанную обстановку.

Для поддержки этого вводится модуль Identity-disentangled AudioNet, который вводит аудио-функции без нарушения идентичности-сигналов, внедренных из справочного изображения и подсказки. Эти функции выравниваются с сжатой временной шкалой видео, разделены на сегменты кадров, и вводятся с помощью пространственного кросс-аттенционного механизма, который сохраняет каждый кадр изолированным, сохраняя последовательность субъекта и избегая временного вмешательства.

Второй временный модуль ввода обеспечивает более тонкий контроль над таймингом и движением, работая в тандеме с AudioNet, отображая аудио-функции на конкретные области латентной последовательности и используя Многослойный Перцептрон (MLP) для преобразования их в токен-чувствительные смещения движения. Это позволяет жестам и движению лица следовать ритму и акценту входного аудио с большей точностью.

HunyuanCustom позволяет субъектам в существующих видео редактироваться напрямую, заменяя или вставляя людей или объекты в сцену без необходимости перестраивать весь клип с нуля. Это делает его полезным для задач, которые включают изменение внешнего вида или движения в целевой форме.

Нажмите, чтобы воспроизвести. Дополнительный пример из дополнительного сайта.

Чтобы облегчить эффективную замену субъекта в существующих видео, новая система избегает ресурсо-интенсивного подхода недавних методов, таких как популярный в настоящее время VACE, или тех, которые объединяют целые видео-последовательности вместе, предпочитая вместо этого сжатие справочного видео с помощью предварительно обученной причинно-следственной 3D-VAE – выравнивая его с внутренними видео-латентами конвейера генерации, и затем добавляя их вместе. Это сохраняет процесс относительно легким, сохраняя при этом возможность руководства выхода внешним видео-контентом.

Маленькая нейронная сеть обрабатывает выравнивание между чистым входным видео и шумными латентами, используемыми в генерации. Система тестирует два способа ввода этой информации: объединение двух наборов функций перед их сжатием снова; и добавление функций кадр за кадром. Второй метод работает лучше, обнаружили авторы, и избегает потери качества, сохраняя при этом вычислительную нагрузку неизменной.

Данные и тесты

В тестах использовались следующие метрики: модуль последовательности идентичности в ArcFace, который извлекает вложения лица из исходного изображения и каждого кадра сгенерированного видео, и затем рассчитывает среднее косинусное сходство между ними; сходство субъекта, через отправку сегментов YOLO11x в Dino 2 для сравнения; CLIP-B, выравнивание текст-видео, которое измеряет сходство между подсказкой и сгенерированным видео; CLIP-B снова, чтобы рассчитать сходство между каждым кадром и как его соседними кадрами, так и первым кадром, а также временную последовательность; и динамический градус, как определено в VBench.

Как указано ранее, базовые закрытые источники-соперники были Hailuo; Vidu 2.0; Kling (1.6); и Pika. Соперничающие FOSS-рамки были VACE и SkyReels-A2.

Оценка производительности модели, сравнивающая HunyuanCustom с ведущими методами настройки видео по различным метрикам.

Оценка производительности модели, сравнивающая HunyuanCustom с ведущими методами настройки видео по различным метрикам.

Из этих результатов авторы заявляют:

‘Наша [HunyuanCustom] достигает лучшей последовательности идентичности и последовательности субъекта. Она также достигает сопоставимых результатов в выполнении подсказки и временной последовательности. [Hailuo] имеет лучший балл CLIP, поскольку она может хорошо следовать текстовым инструкциям, жертвуя при этом последовательностью нечеловеческих субъектов (худший DINO-Sim). В плане динамического градуса [Vidu] и [VACE] показывают плохие результаты, что может быть связано с небольшим размером модели.’

Хотя сайт проекта насыщен сравнительными видео (макет которых, кажется, был разработан для эстетики сайта, а не для легкого сравнения), он в настоящее время не содержит видео-эквивалента статических результатов, сжатых вместе в PDF, в отношении начальных качественных тестов. Хотя я включил его здесь, я призываю читателя внимательно изучить видео на сайте проекта, поскольку они дают лучшее представление о результатах:

Из статьи, сравнение настраиваемого видео, ориентированного на объект. Хотя читателю следует (как всегда) обратиться к исходному PDF за лучшим разрешением, видео на сайте проекта могут быть более просвещающим ресурсом в этом случае.

Из статьи, сравнение настраиваемого видео, ориентированного на объект. Хотя читателю следует (как всегда) обратиться к исходному PDF за лучшим разрешением, видео на сайте проекта могут быть более просвещающим ресурсом в этом случае.

Авторы комментируют здесь:

‘Можно увидеть, что [Vidu], [Skyreels A2] и наш метод достигают относительно хороших результатов в выполнении подсказки и последовательности субъекта, но качество нашего видео лучше, чем у Vidu и Skyreels, благодаря хорошей производительности генерации видео нашей базовой модели, т.е. [Hunyuanvideo-13B].

‘Среди коммерческих продуктов, хотя [Kling] имеет хорошее качество видео, первый кадр видео имеет проблему копирования, и иногда субъект движется слишком быстро и [размыт], что приводит к плохому просмотру.’

Авторы дальше комментируют, что Pika показывает плохие результаты в плане временной последовательности, вводя артефакты субтитров (эффекты от плохой куратории данных, когда текстовые элементы в видеоклипах были допущены к загрязнению основных концепций).

Hailuo сохраняет идентичность лица, утверждают они, но не сохраняет полную последовательность тела. Среди открытых методов VACE, утверждают исследователи, не может сохранить последовательность идентичности, тогда как они утверждают, что HunyuanCustom производит видео с сильной сохранением идентичности, сохраняя при этом качество и разнообразие.

Далее были проведены тесты для многосубъектной настройки видео, против тех же соперников. Как и в предыдущем примере, плоские результаты PDF не являются эквивалентом видео, доступных на сайте проекта, но уникальны среди представленных результатов:

Сравнения, использующие многосубъектную настройку видео. Пожалуйста, обратитесь к PDF за лучшей детальностью и разрешением.

Сравнения, использующие многосубъектную настройку видео. Пожалуйста, обратитесь к PDF за лучшей детальностью и разрешением.

Статья гласит:

‘[Pika] может сгенерировать указанные субъекты, но демонстрирует нестабильность в кадрах видео, с экземплярами, когда человек исчезает в одном сценарии, и женщина не может открыть дверь, как указано в подсказке. [Vidu] и [VACE] частично захватывают человеческую идентичность, но теряют значительные детали нечеловеческих объектов, указывая на ограничение в представлении нечеловеческих субъектов.

‘[SkyReels A2] испытывает сильную нестабильность кадров, с заметными изменениями в чипсах и многочисленными артефактами в правом сценарии.

‘Напротив, наш HunyuanCustom эффективно захватывает как человеческую, так и нечеловеческую идентичность субъектов, генерирует видео, которые соответствуют заданным подсказкам, и сохраняет высокое качество видео и стабильность.’

Дополнительный эксперимент был ‘виртуальная реклама человека’, где рамки были заданы для интеграции продукта с человеком:

Из качественного раунда тестирования, примеры нейронной 'продуктовой установки'. Пожалуйста, обратитесь к PDF за лучшей детальностью и разрешением.

Из качественного раунда тестирования, примеры нейронной ‘продуктовой установки’. Пожалуйста, обратитесь к PDF за лучшей детальностью и разрешением.

Для этого раунда авторы заявляют:

‘Результаты демонстрируют, что HunyuanCustom эффективно сохраняет идентичность человека, сохраняя при этом детали целевого продукта, включая текст на нем.

‘Кроме того, взаимодействие между человеком и продуктом кажется естественным, и видео соответствует заданной подсказке, подчеркивая значительный потенциал HunyuanCustom в генерации рекламных видео.’

Одна область, где видео-результаты были бы очень полезны, был качественный раунд для аудио-обусловленной настройки субъекта, где персонаж говорит соответствующее аудио из текстово-описанной сцены и позы.

Частичные результаты, данные для аудио-раунда – хотя видео-результаты были бы предпочтительны в этом случае. Только верхняя половина PDF-фигуры воспроизведена здесь, поскольку она велика и трудна для размещения в этой статье. Пожалуйста, обратитесь к исходному PDF за лучшей детальностью и разрешением.

Частичные результаты, данные для аудио-раунда – хотя видео-результаты были бы предпочтительны в этом случае. Только верхняя половина PDF-фигуры воспроизведена здесь, поскольку она велика и трудна для размещения в этой статье. Пожалуйста, обратитесь к исходному PDF за лучшей детальностью и разрешением.

Авторы утверждают:

‘Предыдущие аудио-обусловленные методы human-анимации вводят изображение человека и аудио, где поза, одежда и окружение человека остаются последовательными с заданным изображением и не могут генерировать видео в других позах и окружении, что может ограничить их применение.

‘…[Наш] HunyuanCustom позволяет аудио-обусловленную настройку человека, где персонаж говорит соответствующее аудио в текстово-описанной сцене и позе, позволяя более гибкую и контролируемую аудио-обусловленную human-анимацию.’

Дополнительные тесты (пожалуйста, обратитесь к PDF за всеми деталями) включали раунд, противопоставляющий новую систему VACE и Kling 1.6 для замены субъекта в видео-видео:

Тестирование замены субъекта в видео-видео режиме. Пожалуйста, обратитесь к исходному PDF за лучшей детальностью и разрешением.

Тестирование замены субъекта в видео-видео режиме. Пожалуйста, обратитесь к исходному PDF за лучшей детальностью и разрешением.

Из этих, последних тестов, представленных в новой статье, исследователи считают:

‘VACE страдает от артефактов границы из-за строгого соблюдения входных масок, что приводит к неестественным формам субъекта и нарушению непрерывности движения. [Kling], с другой стороны, демонстрирует эффект копирования, где субъекты накладываются непосредственно на видео, что приводит к плохой интеграции с фоном.

‘Напротив, HunyuanCustom эффективно избегает артефактов границы, достигает бесшовной интеграции с фоном видео и сохраняет сильную сохранение идентичности – демонстрируя свою превосходную производительность в задачах редактирования видео.’

Вывод

Это fascинirующий выпуск, не в последнюю очередь потому, что он решает проблему, о которой недовольная хобби-сцена жалуется все чаще – отсутствие синхронизации губ, так что повышенная реалистичность, возможная в системах, таких как Hunyuan Video и Wan 2.1, могла бы получить новый измерение аутентичности.

Хотя макет почти всех сравнительных видео-примеров на сайте проекта делает довольно трудным сравнение возможностей HunyuanCustom с предыдущими соперниками, следует отметить, что очень немногие проекты в области синтеза видео имеют смелость противопоставить себя тестам против Kling, коммерческого видео-диффузионного API, который всегда находится на или gần вершине таблицы лидеров; Tencent, по-видимому, сделал прогресс против этого инкумбента довольно впечатляющим образом.

 

* Проблема заключается в том, что некоторые из видео слишком широки, коротки и высокого разрешения, поэтому они не воспроизводятся в стандартных видео-плеерах, таких как VLC или Windows Media Player, отображая черные экраны.

Опубликовано в первый раз в четверг, 8 мая 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai