Кнопка «включить субтитры» есть почти везде, и почти везде они местами врут. Иногда безобидно — перепутанное окончание. Иногда так, что смысл переворачивается: «не подписывайте» превращается в «подписывайте». Разберём, как машина слышит речь, где она предсказуемо ошибается и что делать, если субтитры нужны не для галочки, а чтобы их реально читали.

Как машина превращает речь в текст

Распознавание речи работает не так, как кажется. Система не ищет в звуке отдельные слова — она превращает аудио в последовательность коротких фрагментов, оценивает, какие звуки в них наиболее вероятны, и собирает из них наиболее правдоподобную цепочку слов. На этом же этапе подключается языковая модель: она подсказывает, что после «банковская» скорее идёт «карта», чем «карма».

Отсюда главное свойство автоматических субтитров: они всегда выдают что-то правдоподобное. Система не умеет сказать «я не разобрала» — она подставит слово, которое лучше всего подходит по звучанию и контексту. Поэтому ошибки выглядят не как пропуски, а как уверенно написанная неправда.

Пунктуацию и заглавные буквы дописывает отдельный этап, уже поверх текста. Он же расставляет границы предложений — и именно он чаще всего ошибается в длинных монологах без пауз.

Где распознавание ошибается предсказуемо

  • Имена, названия, термины. Того, чего не было в обучающих данных, система не знает и подменяет похожим по звучанию. Названия компаний, ники, специальные термины страдают первыми.
  • Наложение голосов. Когда двое говорят одновременно, распознавание либо теряет одну реплику, либо смешивает обе в кашу.
  • Числа и единицы. «Пятнадцать тысяч» может стать «15 000», «15000» или «пятнадцатью тысячами» — и в одном ролике по-разному.
  • Омофоны. «Компания» и «кампания», «в течение» и «в течении» звучат одинаково. Выбор делает языковая модель, и она ошибается ровно там, где контекст слабый.
  • Отрицания. Самая опасная категория: короткое «не» легко теряется в быстрой речи, а смысл фразы меняется на противоположный.
  • Акцент, темп, шум. Фоновая музыка и эхо в комнате роняют точность сильнее, чем непривычное произношение.

Практический вывод: вычитывать нужно не весь текст подряд, а в первую очередь имена, числа и отрицания. Это двадцать процентов усилий, которые закрывают большую часть смысловых ошибок.

Что отличает хорошие субтитры от плохих

Дословная расшифровка — это ещё не субтитры. У читаемых субтитров есть параметры, которые сложились в индустрии и работают независимо от платформы.

  • Длина строки — примерно до 42 символов. Более длинная строка не помещается на экране телефона и рвётся в непредсказуемом месте.
  • Не больше двух строк одновременно. Три строки закрывают кадр и заставляют выбирать между картинкой и текстом.
  • Скорость чтения — около 15–17 символов в секунду. Если реплика длиннее, её сокращают, а не ускоряют показ.
  • Разрыв по смыслу. Строку делят между смысловыми группами, а не по середине словосочетания: «красная / машина» читается хуже, чем «красная машина /».
  • Тайминг с запасом. Субтитр появляется чуть раньше реплики и держится минимум секунду, даже если фраза короткая.

Проверить длину строки удобно счётчиком символов — там же видно, укладывается ли реплика в лимит, если в ней есть эмодзи или длинные термины.

Почему машинный перевод субтитров хуже машинного распознавания

Автоматический перевод накладывается поверх автоматического текста, и ошибки перемножаются: неверно распознанное имя переводится ещё и неверно. Но есть проблема глубже.

Перевод субтитров — это не перевод, а сжатие. Русская фраза обычно длиннее английской на 10–20 процентов, и дословный перевод перестаёт помещаться в те же секунды. Профессиональный переводчик жертвует деталями, чтобы зритель успевал читать. Машина этого не делает — она переводит всё, и строка выходит за пределы экрана или мелькает быстрее, чем её можно прочесть.

Плюс культурные реалии, идиомы и шутки, которые в дословном переводе просто исчезают. Поэтому автоперевод годится, чтобы понять смысл ролика для себя, и не годится, чтобы публиковать его как готовые субтитры.

Рабочий процесс, если субтитры нужны для публикации

  1. Черновик — машиной. Экономит основную часть времени: ручная расшифровка часового ролика занимает несколько часов.
  2. Вычитка по приоритетам. Сначала имена, числа, отрицания и термины, затем всё остальное.
  3. Разбивка на реплики. Длинные фразы делятся по смыслу, соблюдается лимит строки.
  4. Проверка таймингов. Прогон ролика целиком — единственный способ увидеть, что субтитр опаздывает или исчезает слишком быстро.
  5. Экспорт в нужный формат. И отдельный файл, а не вшитый в видео текст: вшитые субтитры нельзя выключить, перевести и найти поиском.

SRT и VTT: в чём разница

Два формата, которые встречаются чаще всего. Оба — обычные текстовые файлы, которые можно открыть блокнотом.

  • SRT — самый совместимый. Номер реплики, время начала и конца, текст. Время пишется через запятую: 00:01:23,400. Оформления почти нет, и это его сила: его принимают все.
  • VTT — веб-формат. Начинается со строки WEBVTT, время пишется через точку: 00:01:23.400. Умеет позиционирование на экране и стили, используется в HTML5-видео.

Если не уверены, что выбрать, — берите SRT: конвертировать его в VTT можно за секунду, а обратная совместимость выше.

Зачем субтитры, кроме доступности

Доступность — главная причина, и её достаточно: без субтитров ролик недоступен людям с нарушениями слуха. Но есть и практические доводы.

Большая часть просмотров в лентах соцсетей идёт без звука — в транспорте, на работе, рядом со спящим ребёнком. Ролик без субтитров такой зритель просто пролистывает.

Второе: текст субтитров индексируется. Расшифровка превращает видео в страницу, которую можно найти поиском по фразе из ролика, — и это работает как на площадке, так и в обычной выдаче, если вы публикуете расшифровку рядом с видео.

Короткий чек-лист

  • Прогнали через автоматическое распознавание — считайте это черновиком, а не результатом.
  • Проверили имена, числа и отрицания.
  • Строки не длиннее примерно 42 символов, не больше двух одновременно.
  • Прогнали ролик целиком и посмотрели на тайминги.
  • Выгрузили отдельным файлом SRT, а не вшили текст в картинку.