Голосовой ввод продают одной фразой: вы говорите, а система записывает. Мы собрали такой инструмент сами, пользуемся им ежедневно, и эта статья о том, чего в той фразе не хватает.
Все числа ниже - с нашего собственного инструмента, а не из чужого кейса. Условия замера указаны у каждого, потому что без условий число о скорости распознавания ничего не стоит.
Зачем мы вообще это строили
Причина была не технологическая. Она была операционная, и, возможно, вам знакомая.
Задача, ради которой человеку надо сесть и расписать её, откладывается. И в обратную сторону больно так же: клиент, который присылает десять голосовых по пять минут за одно утро, прислал пятьдесят минут речи, которую кто-то должен прослушать целиком, чтобы вытащить оттуда три задачи. Наша сборка к 26. 8. 2026 расшифровала их 641. Число не поражающее, и именно поэтому оно наглядное: ручное прослушивание перестаёт окупаться задолго до того, как вы успеете назвать это проблемой.
Инструмент делает одну вещь: превращает речь в записанную задачу со сроком и ответственным и заводит карточку в Trello. Но интереснее того, что работает, - то, что не работало.
Три вещи, которые не вышли с первого раза
Первая версия промпта сокращала слишком сильно. Расшифровка была в порядке, но модель делала из неё настолько экономное задание, что из него пропадали условия - то есть ровно то, ради чего задачу и ставили. Выяснилось это только потому, что задачи возвращались с вопросами. Вывод скучный и работает не только с голосом: краткое изложение, которое никто не сверил с оригиналом, - это предположение о содержании.
Расшифровка поначалу занимала минуту-две. При такой задержке голосовой ввод перестаёт быть быстрее печати, и люди возвращаются к нему только тогда, когда заняты обе руки. Скорость здесь не удобство, а условие пользования.
Ответы клиенту звучали непрофессионально. Когда мы той же сборкой стали диктовать ответы в чат, текст выходил почти дословно так, как был надиктован, - со всеми вставными словами устной речи. Исправилось переписыванием промпта, а не сменой модели. Устный и письменный язык - два разных регистра, и перевод между ними отдельная задача, а не побочный эффект расшифровки.
Замер от 3. 9. 2026: скорость против имён
Это ядро статьи. Десять типичных фраз с нашими названиями, путями и командами, одна машина, восемь потоков, три распознавателя.
| Распознаватель | Медиана на фразу | Сумма | Загрузка модели | Наши имена |
|---|---|---|---|---|
whisper medium |
5,04 с | 50,7 с | 13,2 с | 7 из 14 |
whisper small |
1,98 с | 19,8 с | 1,9 с | 7 из 14 |
| parakeet TDT 0.6b v3 int8 | 0,65 с | 6,2 с | 7,4 с | 1 из 14 |
Самая быстрая модель почти в восемь раз быстрее самой медленной и провалилась на именах собственных. Смысл предложений она сохранила; потеряла ровно имена, пути и команды, то есть единственное, что в постановке задачи нельзя угадать из контекста. Название инструмента она записала фонетически, название команды слепила в одно слово.
Причина конструктивная, а не вопрос качества. У моделей семейства whisper есть входная подсказка, в которую можно написать, как пишутся наши названия, и мы ей пользуемся. У экспортированного трансдьюсера, который мы замерили как самый быстрый, в нашей сборке такого места нет - некуда написать, что это слово пишется вот так. Подсказка для этого семейства моделей существует, но требует другого способа развёртывания; мы его не пробовали, и в замер он не вошёл. Строка в таблице - это разница между двумя конкретными сборками, а не приговор технологии.
Что мы из этого сделали: разговор идёт на small (1,98 с), кнопка для длинной диктовки осталась на medium. Быстрая модель осталась в коде и включается одной строкой в конфигурации - на случай, если выйдет версия с подсказкой.
Честная оговорка к замеру: фразы были начитаны синтетическим голосом, который произносит латиницу по чешским и русским правилам. На живой речи, где английское название звучит по-английски, быстрая модель может выступить лучше. Проверить это может только человек с микрофоном, и этого мы пока не сделали.
Тишина меряется по-разному в разговоре и в команде
Второе число, о котором в инструкциях не пишут, потому что оно настраивается только эксплуатацией.
Система должна понять, что вы договорили. Делает она это по длине тишины, и значение тут не одно. Для короткой команды нам подходит 900 мс. В разговоре, где человек думает вслух, то же значение непригодно - оно режет его на середине мысли. Там у нас 1 200 мс.
Обычно для определения конца реплики приводят пороги короче нашего, и эта разница - намерение, а не недосмотр. Цена слишком короткого и слишком длинного порога несимметрична: длинный порог стоит полсекунды ожидания, короткий - обрезанной фразы и необходимости повторить всю постановку задачи.
К этому три дешёвые правки, заменившие умный детектор:
- Слова-заполнители не открывают фразу. Фрагмент, распознанный как «эм», «ну», «значит», «момент», никуда не отправляется и лишь продлевает ожидание.
- Короче 0,7 с и длиннее 25 с не отправляется. Нижняя граница - против галлюцинации на тишине: модель, которой дали тишину, иногда выдумывает фразу. Верхняя - против того, чтобы конец длинной реплики пропал без предупреждения.
- Преждевременный обрыв не смертелен. Обрезанная фраза уходит, следующая встаёт в очередь. В телефонном разговоре это стоило бы клиента, здесь - одной лишней реплики.
Границу фразы модель найти умеет. Порог громкости - нет
Изначально начало и конец речи мы искали по громкости. Это работает в тишине и разваливается ровно там, где нужно, - в шумном офисе и в машине.
Измеримая разница: при фоновом шуме 0,01 RMS, то есть выше нашего порога 0,006, порог громкости фразу не закрывает вовсе и отправляет всю запись целиком. Модель определения речи из того же входа достаёт 3,3 секунды настоящей реплики. Стоит это 0,05 с процессора на 6,9 с звука, то есть практически ничего.
Это же и лучший пример тихой поломки во всём нашем инструменте. Нигде ничего не ломается, никакой ошибки не выскакивает - просто в расшифровку начинает уходить шум, и результаты ухудшаются так, что вы свяжете это с моделью, а не со входом.
Ловушка, которая к голосу отношения не имеет, и всё равно вас остановит
Последний опыт стоит упомянуть, потому что он касается выбора инструментов вообще, а не только голоса.
Библиотека, на которую мы изначально рассчитывали, устанавливается без ошибки и падает только при первом импорте: политика безопасности Windows блокирует её бинарную часть. Отключить эту политику можно обычной настройкой, беда во втором направлении - обратно на тех машинах она не включается иначе как переустановкой системы. Ради одной библиотеки это того не стоило, поэтому те же файлы моделей мы обслужили через рантайм, который подписан. Работает, но это лишняя работа, о которой мы при выборе не знали.
Правило, которое отсюда следует: у библиотеки с бинарной частью политика и импорт проверяются до того, как решение попадёт в задание. Успешная установка не доказывает, что оно заработает.
Когда голосовой ввод имеет смысл, а когда нет
Суммируя намеренное:
Имеет смысл, когда у человека заняты руки, он говорит структурно и результат кто-то прочитает раньше, чем начнёт по нему действовать. Постановка задач, заметки с выезда, отчёты со стройки, диктовка черновика.
Не имеет смысла там, где результат идёт прямо в систему без подтверждения человеком, и особенно там, где в речи встречаются имена собственные, коды и числа. Именно они теряются первыми и теряются тихо - фраза останется грамматически правильной и будет значить другое.
Практическое следствие: голосовой ввод стоит перед шагом, где вещь увидит человек, а не после него. Кто это правило себе прощает, строит автомат, который иногда пишет неверное число, - а почему это хуже, чем не написать никакого, разбираем в отдельной статье о числах в автомате.
На голосовом вводе надо мерить не точность расшифровки. Надо мерить, сколько имён собственных из десяти выживает, - потому что имя это единственное, что система не додумает.
Хотите попробовать на своём процессе
Расскажите нам, что у вас люди сегодня вносят руками и когда у них при этом не свободны руки. Вернём оценку, окупается ли голосовой ввод, и главное - на каком шаге обязан остаться человек.
Сценарии, подключение и эксплуатацию строим на странице автоматизации. О том, каким каналом такой инструмент должен говорить наружу, есть отдельная статья о выборе между WhatsApp, Telegram и SMS.
Напишите на info@lamapixel.com или звоните +420 775 599 009.