Кнопка «включить субтитры» есть почти везде, и почти везде они местами врут. Иногда безобидно — перепутанное окончание. Иногда так, что смысл переворачивается: «не подписывайте» превращается в «подписывайте». Разберём, как машина слышит речь, где она предсказуемо ошибается и что делать, если субтитры нужны не для галочки, а чтобы их реально читали.
Как машина превращает речь в текст
Распознавание речи работает не так, как кажется. Система не ищет в звуке отдельные слова — она превращает аудио в последовательность коротких фрагментов, оценивает, какие звуки в них наиболее вероятны, и собирает из них наиболее правдоподобную цепочку слов. На этом же этапе подключается языковая модель: она подсказывает, что после «банковская» скорее идёт «карта», чем «карма».
Отсюда главное свойство автоматических субтитров: они всегда выдают что-то правдоподобное. Система не умеет сказать «я не разобрала» — она подставит слово, которое лучше всего подходит по звучанию и контексту. Поэтому ошибки выглядят не как пропуски, а как уверенно написанная неправда.
Пунктуацию и заглавные буквы дописывает отдельный этап, уже поверх текста. Он же расставляет границы предложений — и именно он чаще всего ошибается в длинных монологах без пауз.
Где распознавание ошибается предсказуемо
- Имена, названия, термины. Того, чего не было в обучающих данных, система не знает и подменяет похожим по звучанию. Названия компаний, ники, специальные термины страдают первыми.
- Наложение голосов. Когда двое говорят одновременно, распознавание либо теряет одну реплику, либо смешивает обе в кашу.
- Числа и единицы. «Пятнадцать тысяч» может стать «15 000», «15000» или «пятнадцатью тысячами» — и в одном ролике по-разному.
- Омофоны. «Компания» и «кампания», «в течение» и «в течении» звучат одинаково. Выбор делает языковая модель, и она ошибается ровно там, где контекст слабый.
- Отрицания. Самая опасная категория: короткое «не» легко теряется в быстрой речи, а смысл фразы меняется на противоположный.
- Акцент, темп, шум. Фоновая музыка и эхо в комнате роняют точность сильнее, чем непривычное произношение.
Практический вывод: вычитывать нужно не весь текст подряд, а в первую очередь имена, числа и отрицания. Это двадцать процентов усилий, которые закрывают большую часть смысловых ошибок.
Что отличает хорошие субтитры от плохих
Дословная расшифровка — это ещё не субтитры. У читаемых субтитров есть параметры, которые сложились в индустрии и работают независимо от платформы.
- Длина строки — примерно до 42 символов. Более длинная строка не помещается на экране телефона и рвётся в непредсказуемом месте.
- Не больше двух строк одновременно. Три строки закрывают кадр и заставляют выбирать между картинкой и текстом.
- Скорость чтения — около 15–17 символов в секунду. Если реплика длиннее, её сокращают, а не ускоряют показ.
- Разрыв по смыслу. Строку делят между смысловыми группами, а не по середине словосочетания: «красная / машина» читается хуже, чем «красная машина /».
- Тайминг с запасом. Субтитр появляется чуть раньше реплики и держится минимум секунду, даже если фраза короткая.
Проверить длину строки удобно счётчиком символов — там же видно, укладывается ли реплика в лимит, если в ней есть эмодзи или длинные термины.
Почему машинный перевод субтитров хуже машинного распознавания
Автоматический перевод накладывается поверх автоматического текста, и ошибки перемножаются: неверно распознанное имя переводится ещё и неверно. Но есть проблема глубже.
Перевод субтитров — это не перевод, а сжатие. Русская фраза обычно длиннее английской на 10–20 процентов, и дословный перевод перестаёт помещаться в те же секунды. Профессиональный переводчик жертвует деталями, чтобы зритель успевал читать. Машина этого не делает — она переводит всё, и строка выходит за пределы экрана или мелькает быстрее, чем её можно прочесть.
Плюс культурные реалии, идиомы и шутки, которые в дословном переводе просто исчезают. Поэтому автоперевод годится, чтобы понять смысл ролика для себя, и не годится, чтобы публиковать его как готовые субтитры.
Рабочий процесс, если субтитры нужны для публикации
- Черновик — машиной. Экономит основную часть времени: ручная расшифровка часового ролика занимает несколько часов.
- Вычитка по приоритетам. Сначала имена, числа, отрицания и термины, затем всё остальное.
- Разбивка на реплики. Длинные фразы делятся по смыслу, соблюдается лимит строки.
- Проверка таймингов. Прогон ролика целиком — единственный способ увидеть, что субтитр опаздывает или исчезает слишком быстро.
- Экспорт в нужный формат. И отдельный файл, а не вшитый в видео текст: вшитые субтитры нельзя выключить, перевести и найти поиском.
SRT и VTT: в чём разница
Два формата, которые встречаются чаще всего. Оба — обычные текстовые файлы, которые можно открыть блокнотом.
- SRT — самый совместимый. Номер реплики, время начала и конца, текст. Время пишется через запятую:
00:01:23,400. Оформления почти нет, и это его сила: его принимают все. - VTT — веб-формат. Начинается со строки
WEBVTT, время пишется через точку:00:01:23.400. Умеет позиционирование на экране и стили, используется в HTML5-видео.
Если не уверены, что выбрать, — берите SRT: конвертировать его в VTT можно за секунду, а обратная совместимость выше.
Зачем субтитры, кроме доступности
Доступность — главная причина, и её достаточно: без субтитров ролик недоступен людям с нарушениями слуха. Но есть и практические доводы.
Большая часть просмотров в лентах соцсетей идёт без звука — в транспорте, на работе, рядом со спящим ребёнком. Ролик без субтитров такой зритель просто пролистывает.
Второе: текст субтитров индексируется. Расшифровка превращает видео в страницу, которую можно найти поиском по фразе из ролика, — и это работает как на площадке, так и в обычной выдаче, если вы публикуете расшифровку рядом с видео.
Короткий чек-лист
- Прогнали через автоматическое распознавание — считайте это черновиком, а не результатом.
- Проверили имена, числа и отрицания.
- Строки не длиннее примерно 42 символов, не больше двух одновременно.
- Прогнали ролик целиком и посмотрели на тайминги.
- Выгрузили отдельным файлом SRT, а не вшили текст в картинку.