Представьте два результата одной встречи. В первом неверно записана фамилия, во втором потеряно «не» перед словом «согласовали». На глаз оба текста почти безупречны, но использовать их без сверки нельзя. Чтобы выбрать распознавание для работы, нужно заранее определить, какие ошибки вы считаете и какой результат готовы принять.
Это руководство по собственному тесту, а не рейтинг сервисов. Все числовые примеры ниже учебные: мы составили тексты для объяснения расчёта и не выдаём их за результаты обработки аудио.
Редакция AI Заметок ·
Какие записи включить в сравнение
Выбирайте материал под будущую работу. Для личных заметок нужны ваши обычные монологи; для интервью — вопросы и ответы; для совещаний — несколько голосов и перебивания. Чистое чтение подготовленного текста полезно для отдельной пробы, но не заменяет спонтанный разговор. Если выборка состоит только из удобных фрагментов, итог относится только к ним.
Начать можно с нескольких коротких отрывков, которые вы сможете полностью проверить. Это удобный объём пилота, а не научно установленный минимум. Возьмите и обычный, и трудный материал. Отметьте язык, длительность, число говорящих, микрофон, фоновый шум и наличие терминов. Сохраните точные границы каждого отрывка: сравниваться должен один и тот же звук.
До загрузки проверьте, что можете передавать эти записи выбранным сервисам. При необходимости подготовьте отдельный материал без чужих личных сведений, сохранив похожие условия записи. Не улучшайте звук только для одного участника сравнения. Если проверяете шумоподавление, оформите это отдельным тестом двух версий исходника — порядок описан в статье о шуме и качестве расшифровки.
Для каждого запуска запишите дату, сервис, доступную версию модели, режим и настройки. Если версия не раскрывается, так и укажите. Словарь имён, подсказки и автоматическая литературная правка могут менять результат. Для сравнения распознавания нужен максимально близкий к речи текст; конспект или пересказ сравнивать с дословным эталоном по WER бессмысленно.
Как сделать эталон, которому можно доверять
Эталон — ручная расшифровка выбранного звука. Сначала прослушайте фрагмент и запишите слова, затем повторно сверяйте спорные места. По возможности пусть другой человек независимо проверит имена, числа и неясные реплики. Хорошо оформленный автоматический текст нельзя принять за эталон только потому, что его легче читать.
До подсчёта договоритесь о правилах записи. Будете ли сохранять повторы и слова-паразиты? Как записывать числа: «двадцать пять» или «25»? Считать ли «ё» и «е» одинаковыми? Где отделять слова с дефисом? Для учебного расчёта ниже мы используем нижний регистр, убираем пунктуацию и записываем числа словами. При этом сохраняем произнесённые слова, включая отрицания.
Одинаковую нормализацию применяют к эталону и каждому результату. Иначе программа может посчитать различием запись «25» и «двадцать пять», хотя число передано верно. Сохраните и исходные тексты: нормализованная копия нужна для метрики, а оригинал — для проверки пунктуации, оформления и смысла.
Неразборчивый звук не нужно превращать в уверенное слово. Для простого теста выделите такие интервалы и исключите их из подсчёта у всех сервисов одинаково, сохранив список исключений. В соответствующих текстах удаляйте именно эти интервалы, а не все неудобные расхождения. Если границы нельзя сопоставить надёжно, используйте отдельные разборчивые фрагменты. Итоговая метрика тогда описывает только проверяемую часть записи; рядом укажите объём исключённого аудио.
WER: что именно считается ошибкой
WER, или word error rate, — отношение числа замен, пропусков и добавлений слов к числу слов в эталоне. Для сравнения последовательности выравнивают с минимальным общим числом таких операций. Определение и ограничения метрики разбирают Morris, Maier и Green (2004). Чем меньше WER при одинаковых правилах и материале, тем меньше словесных исправлений требуется.
WER = (S + D + I) / N × 100%
S — замены слов
D — пропущенные слова
I — добавленные слова
N — число слов в эталоне
Учебный пример. Эталон: «марина отправит новый договор завтра утром» — шесть слов. Условный результат: «ирина отправит договор завтра утром точно».
| Эталон | Результат | Операция |
|---|---|---|
| марина | ирина | Замена, S = 1 |
| отправит | отправит | Совпадение |
| новый | — | Пропуск, D = 1 |
| договор завтра утром | договор завтра утром | Три совпадения |
| — | точно | Добавление, I = 1 |
Получается (1 + 1 + 1) / 6 × 100% = 50%. Это характеристика двух учебных строк, а не оценка какой-либо модели. Подсчёт по позициям без выравнивания дал бы лишние ошибки: после пропуска слова «новый» остальные слова сдвинулись, хотя распознаны верно.
На большом тексте выравнивание удобно выполнять инструментом вроде JiWER: он показывает совпадения и типы ошибок. Перед расчётом всё равно задайте свои правила нормализации и проверьте несколько выравниваний вручную. Название библиотеки не делает подготовленный эталон правильным.
WER может превышать 100%, если добавленных слов очень много. Поэтому формулировка «точность равна 100% минус WER» без пояснения вводит в заблуждение. Лучше прямо писать «доля словесных ошибок по WER» и рядом указывать объём эталона.
Свой файл вместо рекламного примера
Проверьте расшифровку в AI Заметках
Загрузите выбранную запись, дождитесь текста и скопируйте результат для сравнения с эталоном. Расчёт WER выполняется отдельно: приложение не выставляет оценку собственной точности.
Начните бесплатно
30 минут распознавания в месяц без привязки карты. Текстовые заметки и поиск доступны бесплатно. Если аккаунту предоставлен пробный расширенный доступ, его срок смотрите в профиле; после окончания остаётся бесплатный режим.
Попробовать бесплатноДля регулярных записей
490 ₽ в месяц, оплата российской картой. Распознавание без лимита слов; ограничения отдельного файла сохраняются. В подписку входит Glas для диктовки на Mac и Windows. Условия подписки.
Почему одинаковый WER не означает одинаковую пользу
Метрика даёт каждой словесной ошибке одинаковый вес. Для рабочего решения последствия различаются. Потерянное вводное слово может почти не влиять на смысл, а потерянное «не» меняет поручение на противоположное. Это причина дополнять WER проверкой содержания.
В исследовании Ben Jannet и соавторов (2015) на данных ETAPE оценивали, насколько ошибки распознавания мешают последующему выделению именованных сущностей. Предложенная авторами метрика ATENE лучше коррелировала с результатами этой задачи, чем WER. Работа посвящена определённому набору данных и обработке сущностей; она не устанавливает универсальный рейтинг русскоязычных сервисов.
Практическое следствие для собственного теста: выпишите из эталона важные имена, суммы, даты, термины и отрицания до просмотра результатов. Проверяйте каждое вхождение в контексте. Например, правильное имя рядом с чужим поручением всё равно даёт неправильное рабочее содержание. Для нескольких говорящих отдельно отмечайте ошибки авторства: обычный WER текста без меток говорящих их не учитывает.
В журнале можно написать: «из восьми проверенных вхождений фамилий два переданы неверно» и привести интервалы. Этот авторский учёт не заменяет стандартизированную метрику и не складывается с WER в один процент. Его задача — показать, где результат требует особенно внимательной сверки. Добавленные имена и суммы фиксируйте отдельно, даже если соответствующих слов нет в эталоне.
Как измерить время редактора
Сохраните нетронутый результат распознавания, прежде чем его исправлять. Для всех вариантов задайте один критерий готовности: например, текст полностью сверен с аудио, важные слова проверены, спорные места помечены. Если один результат доводить до публикации, а другой только бегло просматривать, время несопоставимо.
Отдельно засеките ожидание сервиса и активную работу человека: прослушивание, исправление, оформление. Паузы на другие дела не включайте в ручную правку. Сравнивать удобно минуты работы на минуту исходного аудио, но рядом оставляйте абсолютные значения и длительность файла.
Есть тонкость: к третьей версии одного текста редактор уже помнит запись. Чтобы уменьшить этот перекос, меняйте порядок сервисов между фрагментами или распределите результаты между несколькими редакторами. Полностью убрать влияние опыта маленький личный тест не сможет. Зафиксируйте порядок, чтобы не объяснять всё различие во времени качеством модели.
Удобство интерфейса тоже влияет на затраты. Переход к звуку, копирование, сохранение правки и перенос в рабочий документ стоит проверить отдельно. Более широкий выбор по лимитам, приватности и стоимости разобран в руководстве по выбору сервиса транскрибации.
Как сравнить результаты нескольких записей
Показывайте результат для каждого фрагмента и для набора целиком. Общий WER считают как сумму всех ошибок, делённую на сумму слов эталонов. Простое среднее процентов отвечает на другой вопрос: оно даёт короткой и длинной записи одинаковый вес.
Ещё один учебный расчёт: в первом эталоне 10 слов и 2 ошибки, во втором — 100 слов и 10 ошибок. Среднее двух процентов равно 15%, а общий WER — 12 / 110 × 100% ≈ 10,9%. Для сопоставления набора укажите общий показатель; отдельные строки сохранят видимость трудного короткого фрагмента.
Если один вариант выигрывает на монологах, а другой — на разговорах, ориентируйтесь на свой рабочий материал. Небольшое отличие на паре записей ещё не доказывает устойчивого превосходства. Добавьте новые типичные фрагменты, не меняя правила под уже увиденный результат. Если настраивали словарь или подсказки по первой выборке, окончательную проверку проведите на других записях.
Для решения заранее определите обязательные условия. Например, вы готовы исправлять оформление, но не готовы регулярно восстанавливать пропущенные реплики. Не сворачивайте такие требования в средний балл, который скроет неприемлемый недостаток.
Открытая таблица для собственного теста
Скачайте шаблон сравнения в Markdown. В нём есть паспорт записей, правила эталона, поля S/D/I/N, важные ошибки и время правки. Пустые поля означают, что измерения ещё предстоит выполнить. Это не готовый рейтинг.
Начните с одного разрешённого для загрузки фрагмента, который можете проверить целиком. Подготовьте эталон до сравнения, сохраните сырые результаты и заполните первую строку таблицы. Если нужен быстрый вход в тему, на странице распознавания речи есть публичная проба; для выбора приложения проверяйте именно тот режим, которым планируете пользоваться. Демо и приложение могут обрабатывать запись по-разному.