Перейти к содержанию

RealGenX / benchmark protocol

Бенчмарк AI-видео, который можно повторить

Сравниваем не лучший ролик из десяти, а production-процесс целиком: одинаковые задания, все попытки, ошибки, пригодные секунды и фактический расход кредитов.

Публичного рейтинга пока нет: он появится только после воспроизводимого прогона. Протокол фиксируется заранее, чтобы правила нельзя было менять под понравившийся результат.

Что измеряется

Стабильность объекта

Форма, лицо, товар, логотип и ключевые детали сохраняются между кадрами.

Следование заданию

Модель выполняет ограничения промпта без противоречащих объектов и действий.

Контроль движения

Движение камеры, направление действия и темп сцены остаются предсказуемыми.

Текст и бренд

Надписи, упаковка и брендовые элементы сохраняются там, где должны быть неизменными.

Failure / retry rate

Считаются все неудачные запуски, а не только выбранный лучший результат.

Пригодные секунды

Измеряется доля клипа, которую реально можно оставить в финальном монтаже.

Фиксированный набор тестов

Один benchmark-run прогоняет каждую модель по одному и тому же набору задач. Исходники и формулировки задания замораживаются до начала сравнения.

ТестВходЗадание
Product lockОдин товар на чистом фонеМедленный push-in камеры; упаковка, логотип и геометрия товара не меняются.
Camera motionСцена с выраженной глубинойПлавный orbit вокруг объекта без телепортаций, скачков масштаба и смены геометрии.
Human motionОдин человек в полный ростНесколько шагов и простой жест; лицо, руки, одежда и направление движения остаются стабильными.
Prompt constraintsСцена с 2–3 фиксированными объектамиИзменить только указанное действие; не добавлять новые предметы, текст или персонажей.
Short-form adФото товара + рекламное заданиеПолучить монтажно пригодный вертикальный фрагмент с читаемым главным объектом и контролируемым движением.

Протокол запуска

  1. Зафиксировать исходники, prompts, aspect ratio, длительность и разрешение до первого запуска.
  2. Для каждой модели записать провайдера, точный model ID/версию, дату и все доступные параметры.
  3. Выполнить минимум 5 независимых запусков каждого теста на каждой модели. Не перегенерировать выборочно только плохие варианты.
  4. Сохранить каждый output и метаданные запуска, включая неудачные результаты и потраченные кредиты.
  5. Оценивать outputs только по заранее определенной рубрике. Failure считается отдельно и не исчезает из среднего.
  6. При изменении версии модели создавать новый benchmark-run; результаты разных версий не склеивать.

Таблица метрик

МетрикаЕдиницаКак считается
Object stability0–5Средняя экспертная оценка по всем запускам
Prompt adherence0–5Средняя оценка выполнения обязательных ограничений
Motion control0–5Средняя оценка камеры и движения объектов
Brand/text integrity0–5Средняя оценка сохранности текста и бренда
Failure rate%Полностью непригодные запуски / все запуски
Retry rate%Дополнительные запуски до первого приемлемого результата
Usable seconds%Пригодная длительность / сгенерированная длительность
Credits per usable secondcredits/sВсе потраченные кредиты / суммарные пригодные секунды

Главная production-метрика — не абстрактный quality score, а credits per usable second. Она штрафует модель одновременно за дорогие генерации, высокий failure rate и ролики, из которых в монтаж проходит только небольшой фрагмент.

Что публикуется вместе с результатом

Каждая строка будущего рейтинга должна вести к карточке benchmark-run: дата, model ID, provider, входные материалы, prompt, параметры, количество попыток, все outputs, оценки по каждой попытке, суммарные кредиты и пригодные секунды. Без этого результат считается невоспроизводимым и в рейтинг не попадает.

Как читать будущий рейтинг

Не будет одной «лучшей модели вообще». Для товарной рекламы важнее сохранность объекта и бренда, для cinematic-сцен — движение, а для массового production — retry rate и цена пригодной секунды. Поэтому сравнение должно показывать отдельные метрики, а не скрывать все за одним магическим числом.

Проверить на реальных материалах

Посмотрите публичные медиа-примеры, оцените расход в калькуляторе кредитов или перейдите к image-to-video workflow.

Бенчмарк AI-видео: воспроизводимое сравнение моделей — RealGenX