ДАРА
Разделы документации

ДокументацияРуководства

Модели

Задачи анализа, облачные и локальные модели, вариант «Не выполнять», что уходит внешнему поставщику, ориентиры скорости и лимиты.

Анализ разбит на четыре задачи. Для каждой задачи проект выбирает модель: облачную или локальную, которая работает на сервере ДАРА. Выбор — в кабинете, в настройках проекта на вкладке «Модели». Действующий список моделей — на главной странице.

Задачи

Задача Шаг Результат Можно не выполнять
Речь speech транскрипт с таймкодами, субтитры да
Кадры и изображения vision что в кадре, текст в кадре, флаги безопасности да
Сводка summary описание, темы, теги, сущности, возрастная отметка, модерация да
Векторы embedding смысл объекта для ленты, похожих и поиска нет

Что именно возвращает каждая задача — в разделе Результаты анализа.

Облачные и локальные модели

  • Облачная модель работает у внешнего поставщика — в v1 это OpenAI. Качество выше, скорость ограничена сетью и лимитами поставщика, а не сервером. Облачные модели, доступные вашему аккаунту, открывает ДАРА при подключении.
  • Локальная модель работает на сервере ДАРА: данные не покидают сервер. Качество ниже облачного, особенно у сводки и описаний кадров, скорость зависит от загрузки сервера. Локальные модели доступны всем, если помещаются в память сервера: если модель тяжелее предела текущего сервера, в кабинете она отмечена как недоступная.

Некоторые модели работают только с одним языком. Локальная модель речи GigaAM-v3 распознаёт только русскую речь: её можно выбрать, если язык контента в настройках обработки — ru, и она не попадает в пресеты и модели по умолчанию. Пока в проекте выбрана GigaAM-v3, язык контента на другой не сменить — сначала выберите другую модель речи.

Пресеты «Всё в облаке» и «Всё локально» заполняют форму моделями одного вида — перед сохранением их можно поправить.

Модели разных видов сочетаются. Например, речь распознаётся локально, а сводка строится облачной моделью. Тогда транскрипт уходит облачной сводке — кабинет предупреждает об этом при сохранении.

Что уходит наружу

Облачной модели передаётся только то, что нужно её задаче:

Задача Что получает облачный поставщик
Речь звуковая дорожка фрагментами по 1–2 минуты и подсказки для распознавания из настроек проекта
Кадры уникальные кадры видео и изображения — дубли не отправляются
Сводка заголовок, описание и текст объекта, свойства, транскрипт, описания и текст кадров
Векторы заголовки, сводки и фрагменты текста объектов, поисковые запросы

Ключи API, идентификаторы ваших пользователей, события, заказы и профили в модели не передаются. Локальные модели ничего наружу не отправляют. Если материалы проекта нельзя передавать третьим лицам, выберите для него локальные модели.

«Не выполнять»

Для речи, кадров и сводки можно выбрать «Не выполнять». Шаг получает skipped с причиной «не выполнять», модели этой задачи не вызываются, а зависимые шаги обходятся без её результата:

  • без речи и кадров сводка строится по тексту объекта;
  • без сводки вектор строится по заголовку, описанию и тексту — но у объекта не будет тегов, возрастной отметки и модерации;
  • видео при этом всё равно проходит подготовку: ДАРА читает длительность и наличие звука.

Векторы нужны выдаче, поэтому модель векторов выбирается всегда.

Ориентиры скорости

Время зависит от длины медиа, числа уникальных кадров и очереди. Порядок величин:

Задача Облачная модель Локальная модель
Речь минуты на час аудио десятки минут на час аудио
Кадры секунды на пакет кадров доли секунды на уникальный кадр, без описаний
Сводка секунды или минута на объект минуты на объект, около часа на двухчасовое видео
Векторы доли секунды доли секунды

Локальные модели выполняются по одному заданию за раз, поэтому большой каталог в проекте «Всё локально» обрабатывается дольше. Точный ориентир скорости каждой модели указан рядом с ней в настройках проекта.

Новые объекты обрабатываются раньше переобработки и переиндексации. Быстрый вектор по заголовку и описанию считается сразу после приёма объекта, поэтому объект попадает в похожие ещё до конца анализа.

Смена модели

  • Речь, кадры, сводка. После сохранения ДАРА перепланирует объекты проекта. Задания, которые ещё не начались, — в очереди или в ожидании, например лимита, — переходят на новую модель, а при «Не выполнять» отменяются. Если речь или кадры включили вместо «Не выполнять», существующие объекты получают недостающий анализ, и их сводка и векторы пересчитываются с его учётом. Задание, которое уже выполняется, завершает прежняя модель, а готовые результаты остаются как есть: чтобы пересчитать их новой моделью, запустите POST /items/{id}/reprocess или кнопку «Переобработать» в карточке объекта.
  • Векторы. Смена модели векторов запускает переиндексацию проекта: векторы всех объектов пересчитываются новой моделью. Пока она идёт, выдача и поиск работают на прежних векторах, по завершении проект переключается сам.

Если облачную модель выключили или она больше не доступна аккаунту, задания с ней ждут, пока в проекте не выберут другую модель, — после выбора они перезапускаются на новой.

Объём и лимиты

Каждая модель учитывает объём: секунды речи, число кадров, токены сводки и векторов. Объёмы за текущий и прошлый месяц видны в кабинете, в разделе «Расход и лимиты».

Месячные лимиты действуют на облачные модели. Когда объём месяца по метрике достигает лимита, облачные задания этой задачи ждут 1-го числа следующего месяца или повышения лимита, а выдача, готовые результаты и локальные модели продолжают работать. Кабинет предупреждает, когда использовано 80 % лимита.