ДокументацияРуководства
Модели
Задачи анализа, облачные и локальные модели, вариант «Не выполнять», что уходит внешнему поставщику, ориентиры скорости и лимиты.
Анализ разбит на четыре задачи. Для каждой задачи проект выбирает модель: облачную или локальную, которая работает на сервере ДАРА. Выбор — в кабинете, в настройках проекта на вкладке «Модели». Действующий список моделей — на главной странице.
Задачи
| Задача | Шаг | Результат | Можно не выполнять |
|---|---|---|---|
| Речь | speech |
транскрипт с таймкодами, субтитры | да |
| Кадры и изображения | vision |
что в кадре, текст в кадре, флаги безопасности | да |
| Сводка | summary |
описание, темы, теги, сущности, возрастная отметка, модерация | да |
| Векторы | embedding |
смысл объекта для ленты, похожих и поиска | нет |
Что именно возвращает каждая задача — в разделе Результаты анализа.
Облачные и локальные модели
- Облачная модель работает у внешнего поставщика — в v1 это OpenAI. Качество выше, скорость ограничена сетью и лимитами поставщика, а не сервером. Облачные модели, доступные вашему аккаунту, открывает ДАРА при подключении.
- Локальная модель работает на сервере ДАРА: данные не покидают сервер. Качество ниже облачного, особенно у сводки и описаний кадров, скорость зависит от загрузки сервера. Локальные модели доступны всем, если помещаются в память сервера: если модель тяжелее предела текущего сервера, в кабинете она отмечена как недоступная.
Некоторые модели работают только с одним языком. Локальная модель речи GigaAM-v3 распознаёт только русскую речь: её можно выбрать, если язык контента в настройках обработки — ru, и она не попадает в пресеты и модели по умолчанию. Пока в проекте выбрана GigaAM-v3, язык контента на другой не сменить — сначала выберите другую модель речи.
Пресеты «Всё в облаке» и «Всё локально» заполняют форму моделями одного вида — перед сохранением их можно поправить.
Модели разных видов сочетаются. Например, речь распознаётся локально, а сводка строится облачной моделью. Тогда транскрипт уходит облачной сводке — кабинет предупреждает об этом при сохранении.
Что уходит наружу
Облачной модели передаётся только то, что нужно её задаче:
| Задача | Что получает облачный поставщик |
|---|---|
| Речь | звуковая дорожка фрагментами по 1–2 минуты и подсказки для распознавания из настроек проекта |
| Кадры | уникальные кадры видео и изображения — дубли не отправляются |
| Сводка | заголовок, описание и текст объекта, свойства, транскрипт, описания и текст кадров |
| Векторы | заголовки, сводки и фрагменты текста объектов, поисковые запросы |
Ключи API, идентификаторы ваших пользователей, события, заказы и профили в модели не передаются. Локальные модели ничего наружу не отправляют. Если материалы проекта нельзя передавать третьим лицам, выберите для него локальные модели.
«Не выполнять»
Для речи, кадров и сводки можно выбрать «Не выполнять». Шаг получает skipped с причиной «не выполнять», модели этой задачи не вызываются, а зависимые шаги обходятся без её результата:
- без речи и кадров сводка строится по тексту объекта;
- без сводки вектор строится по заголовку, описанию и тексту — но у объекта не будет тегов, возрастной отметки и модерации;
- видео при этом всё равно проходит подготовку: ДАРА читает длительность и наличие звука.
Векторы нужны выдаче, поэтому модель векторов выбирается всегда.
Ориентиры скорости
Время зависит от длины медиа, числа уникальных кадров и очереди. Порядок величин:
| Задача | Облачная модель | Локальная модель |
|---|---|---|
| Речь | минуты на час аудио | десятки минут на час аудио |
| Кадры | секунды на пакет кадров | доли секунды на уникальный кадр, без описаний |
| Сводка | секунды или минута на объект | минуты на объект, около часа на двухчасовое видео |
| Векторы | доли секунды | доли секунды |
Локальные модели выполняются по одному заданию за раз, поэтому большой каталог в проекте «Всё локально» обрабатывается дольше. Точный ориентир скорости каждой модели указан рядом с ней в настройках проекта.
Новые объекты обрабатываются раньше переобработки и переиндексации. Быстрый вектор по заголовку и описанию считается сразу после приёма объекта, поэтому объект попадает в похожие ещё до конца анализа.
Смена модели
- Речь, кадры, сводка. После сохранения ДАРА перепланирует объекты проекта. Задания, которые ещё не начались, — в очереди или в ожидании, например лимита, — переходят на новую модель, а при «Не выполнять» отменяются. Если речь или кадры включили вместо «Не выполнять», существующие объекты получают недостающий анализ, и их сводка и векторы пересчитываются с его учётом. Задание, которое уже выполняется, завершает прежняя модель, а готовые результаты остаются как есть: чтобы пересчитать их новой моделью, запустите
POST /items/{id}/reprocessили кнопку «Переобработать» в карточке объекта. - Векторы. Смена модели векторов запускает переиндексацию проекта: векторы всех объектов пересчитываются новой моделью. Пока она идёт, выдача и поиск работают на прежних векторах, по завершении проект переключается сам.
Если облачную модель выключили или она больше не доступна аккаунту, задания с ней ждут, пока в проекте не выберут другую модель, — после выбора они перезапускаются на новой.
Объём и лимиты
Каждая модель учитывает объём: секунды речи, число кадров, токены сводки и векторов. Объёмы за текущий и прошлый месяц видны в кабинете, в разделе «Расход и лимиты».
Месячные лимиты действуют на облачные модели. Когда объём месяца по метрике достигает лимита, облачные задания этой задачи ждут 1-го числа следующего месяца или повышения лимита, а выдача, готовые результаты и локальные модели продолжают работать. Кабинет предупреждает, когда использовано 80 % лимита.