GigaAM v3 превращает речь в текст. Для русского языка используем лучшую модель: точность >95% на чистой записи. Работает в браузере, без установки и без карты.
Что такое распознавание речи
Распознавание речи (speech-to-text, ASR) — технология, которая превращает звуковую речь в письменный текст. Современные модели на нейросетях понимают:
- Естественную речь (с паузами, оговорками, словами-паразитами — «эээ», «ну», «короче»)
- Несколько говорящих (с разделением)
- Шум на фоне
- Акценты и диалекты
- Терминологию
AI Заметки использует GigaAM v3 — лучшую модель для русского языка в нашем пайплайне распознавания речи.
Два режима распознавания
Реальное время
Говорите в микрофон — текст появляется на экране сразу же. Подходит для голосового ввода в заметку или другое приложение.
Из файла
Загружаете MP3, WAV, M4A, OGG, OPUS, FLAC, WebM, MP4 или AAC — получаете расшифровку через несколько минут. Один файл может быть до 200 МиБ и до 4 часов.
Точность по типам речи
| Тип записи | Точность |
|---|---|
| Чистая речь, один говорящий | >95% |
| Речь с фоном (улица, кафе) | 88–93% |
| Несколько говорящих, перебивают друг друга | 80–88% |
| Шёпот, очень тихая речь | 70–80% |
| Сильный акцент / диалект | 80–90% |
| Профессиональные термины | 88–95% (зависит от области) |
| Песни, стихи с фоновой музыкой | 60–75% |
Для повышения точности можно подсказать тематику («медицина», «юриспруденция», «IT») — модель адаптируется к лексике.
Поддерживаемые языки
Русский — основной. Также:
🇬🇧 английский · 🇨🇳 китайский · 🇪🇸 испанский · 🇩🇪 немецкий · 🇫🇷 французский · 🇮🇹 итальянский · 🇵🇹 португальский · 🇯🇵 японский · 🇰🇷 корейский · 🇰🇿 казахский · 🇺🇿 узбекский · 🇹🇷 турецкий · 🇦🇪 арабский · 🇮🇳 хинди · 🇻🇳 вьетнамский · 🇹🇭 тайский · 🇮🇩 индонезийский · 🇺🇦 украинский · 🇧🇾 белорусский · и ещё 15+
Автоопределение языка работает с 2 секунд речи.
Сравнение программ распознавания речи
| AI Заметки | Yandex SpeechKit | Google Speech-to-Text | Whisper (локально) | |
|---|---|---|---|---|
| Модель для русского | GigaAM v3 | Yandex SpeechKit | Google Speech-to-Text | Whisper |
| Точность на русском | >95% | ~90% | ~85% | ~92% |
| Бесплатно для пользователя | 30 мин/мес | API платный | $0.006/15 сек | бесплатно, но локально |
| Без установки | Да | через API | через API | Нет |
| Диктовка в любые приложения | Glas в подписке | Нет | Нет | Нет |
| Диаризация (кто говорит) | Не поддерживается и не планируется | платно | платно | сторонние решения |
| Серверы в РФ | Да | Да | Нет | локально |
| Готовый интерфейс | Да | только API | только API | нужен код |
Где применяется распознавание речи
- Голосовой ввод текста — печатаете голосом
- Транскрибация записей — встречи, лекции, интервью
- Субтитры к видео — авторасшифровка с таймкодами для YouTube / VK Видео
- Диктофоны с расшифровкой — журналисты, врачи, юристы
- Голосовые ассистенты — встроенные в умные колонки
- Контакт-центры — анализ звонков, контроль качества
- Доступная среда — для людей с нарушением слуха
Как использовать
1. Онлайн в браузере
Откройте aizametki.ru/app/ → нажмите микрофон → говорите. Текст появится в реальном времени.
2. На телефоне
Скачайте приложение AI Заметки → новая заметка → микрофон. Работает на iOS 14+ и Android 8+.
3. Через API
Для разработчиков — есть REST API. Документация: docs.aizametki.ru/api. Условия доступа обсуждаем отдельно для рабочих сценариев.
Что на самом деле влияет на точность
Разброс качества между хорошей и плохой записью больше, чем разброс между моделями. Вот что меняет результат сильнее всего.
Запись важнее модели
На чистой записи любая современная модель даёт больше 90% точности. На записи из кармана — не даёт никакая. Порядок факторов по влиянию:
- Расстояние до говорящего. Один метр и четыре метра — это разные задачи. Каждое удвоение расстояния заметно снижает разборчивость.
- Реверберация. Пустая переговорная с бетоном и стеклом хуже небольшой комнаты с мебелью: эхо накладывает слова друг на друга.
- Постоянный шум. Кондиционер, вентилятор ноутбука и улица за окном съедают верхние частоты, по которым различаются согласные.
- Наложение речи. Когда двое говорят одновременно, распознаётся тот, кто громче.
- Битрейт и пересжатие. Файл, пережатый несколько раз, теряет именно те частоты, которые нужны модели.
Что даёт больше всего за минуту работы
- Положить телефон на стол микрофоном к говорящим, а не убрать в карман или сумку.
- Сесть ближе к центру стола в переговорной.
- Выключить кондиционер на время записи.
- Для звонков через ноутбук — писать звук с гарнитуры, а не с микрофона корпуса.
- Не класть телефон на скатерть: ткань глушит согласные.
Почему для русского нужна русская модель
Мультиязычные модели учат на корпусе, где русский — одна из десятков языковых долей. Модель, обученная на русской речи, лучше держит падежные окончания, редукцию гласных в безударных слогах и характерные для русского сочетания согласных. Разница особенно заметна на профессиональной лексике и именах собственных, где догадаться по контексту нельзя.
Чего распознавание не делает
- Не разделяет говорящих. Диаризация не поддерживается и не планируется — возвращается связный текст речи. Для интервью реплики размечаются вручную — обычно это пара минут.
- Не работает офлайн. Нужен интернет, но трафика уходит немного: около 1 МБ на 10 минут речи.
- Не додумывает пропущенное. Если слово заглушено, оно не появится — модель не выдумывает содержание.
- Не расшифровывает пение. Музыкальная подложка под речью снижает точность, вокал не распознаётся.
Как быстро проверить на своём материале
- Возьмите фрагмент типичной для вас записи — не самый удачный, а обычный.
- Загрузите его в демо на этой странице: до пяти минут, без регистрации.
- Посмотрите не на общий процент, а на конкретные места: имена, термины, числа.
- Если ошибки в терминах — их можно закрыть словарём в Glas при диктовке.
- Если ошибки везде — проблема в записи, а не в модели: см. список выше.
Дальше расшифровка становится заметкой в приложении: правится, ищется по словам и синхронизируется между телефоном и компьютером.
FAQ
Это бесплатно? Да, 30 минут распознавания в месяц доступны бесплатно без карты. Для регулярной работы есть подписка AI Заметок 490 ₽/мес, в которую входит Glas для диктовки.
Какая точность распознавания на русском?
GigaAM v3 даёт 95% на чистой речи. На записях с шумом — 88–93%.
Нужно ли что-то скачивать? Нет, работает прямо в браузере. Но есть и приложения — для офлайн-доступа к заметкам и удобства.
Можно ли распознать английскую речь? Да, 30+ языков. Автоопределение или ручной выбор.
Сохраняется ли моя запись? По умолчанию — нет. После распознавания аудио удаляется с серверов. Можно включить хранение в настройках.
Можно ли распознать видео? Да, загрузите MP4 или WebM со звуковой дорожкой. Для MOV, AVI и MKV сначала извлеките аудио.
Попробовать
Распознать речь онлайн бесплатно
Без карты. Вход по email-коду для сохранения заметок.