Голосове введення продають однією фразою: ви кажете, а система записує. Ми зібрали такий інструмент самі, користуємося ним щодня, і ця стаття про те, чого в тій фразі бракує.
Усі числа нижче - з нашого власного інструмента, а не з чужого кейсу. Умови заміру вказані в кожного, бо без умов число про швидкість розпізнавання нічого не варте.
Навіщо ми це взагалі будували
Причина була не технологічна. Вона була операційна, і, можливо, вам знайома.
Задача, заради якої людині треба сісти і розписати її, відкладається. І у зворотний бік боляче так само: клієнт, який надсилає десять голосових по п'ять хвилин за один ранок, надіслав п'ятдесят хвилин мовлення, яке хтось має прослухати цілком, щоб витягти звідти три задачі. Наша збірка до 26. 8. 2026 розшифрувала їх 641. Число не вражає, і саме тому воно наочне: ручне прослуховування перестає окупатися задовго до того, як ви встигнете назвати це проблемою.
Інструмент робить одну річ: перетворює мовлення на записану задачу з терміном і відповідальним і заводить картку в Trello. Але цікавіше за те, що працює, - те, що не працювало.
Три речі, які не вийшли з першого разу
Перша версія промпту скорочувала надто сильно. Розшифровка була гаразд, але модель робила з неї настільки ощадливе завдання, що з нього зникали умови - тобто саме те, заради чого задачу й ставили. З'ясувалося це лише тому, що задачі поверталися з питаннями. Висновок нудний і працює не тільки з голосом: стислий виклад, який ніхто не звірив з оригіналом, - це припущення про зміст.
Розшифровка спочатку тривала хвилину-дві. За такої затримки голосове введення перестає бути швидшим за друк, і люди повертаються до нього лише тоді, коли зайняті обидві руки. Швидкість тут не зручність, а умова користування.
Відповіді клієнту звучали непрофесійно. Коли ми тією самою збіркою почали диктувати відповіді в чат, текст виходив майже дослівно так, як був надиктований, - з усіма вставними словами усного мовлення. Виправилося переписуванням промпту, а не зміною моделі. Усна й письмова мова - два різні регістри, і переклад між ними окрема задача, а не побічний ефект розшифровки.
Замір від 3. 9. 2026: швидкість проти імен
Це ядро статті. Десять типових фраз із нашими назвами, шляхами і командами, одна машина, вісім потоків, три розпізнавачі.
| Розпізнавач | Медіана на фразу | Сума | Завантаження моделі | Наші імена |
|---|---|---|---|---|
whisper medium |
5,04 с | 50,7 с | 13,2 с | 7 з 14 |
whisper small |
1,98 с | 19,8 с | 1,9 с | 7 з 14 |
| parakeet TDT 0.6b v3 int8 | 0,65 с | 6,2 с | 7,4 с | 1 з 14 |
Найшвидша модель майже увосьмеро швидша за найповільнішу і провалилася на власних іменах. Зміст речень вона зберегла; втратила саме імена, шляхи і команди, тобто єдине, що в постановці задачі не можна вгадати з контексту. Назву інструмента вона записала фонетично, назву команди зліпила в одне слово.
Причина конструктивна, а не питання якості. У моделей родини whisper є вхідна підказка, у яку можна написати, як пишуться наші назви, і ми нею користуємося. В експортованого трансдьюсера, який ми заміряли як найшвидший, у нашій збірці такого місця немає - нікуди написати, що це слово пишеться саме так. Підказка для цієї родини моделей існує, але вимагає іншого способу розгортання; ми його не пробували, і в замір він не увійшов. Рядок у таблиці - це різниця між двома конкретними збірками, а не вирок технології.
Що ми з цього зробили: розмова йде на small (1,98 с), кнопка для довгої диктовки лишилася на medium. Швидка модель лишилася в коді і вмикається одним рядком у конфігурації - на випадок, якщо вийде версія з підказкою.
Чесне застереження до заміру: фрази були начитані синтетичним голосом, який вимовляє латиницю за чеськими і російськими правилами. На живому мовленні, де англійська назва звучить по-англійськи, швидка модель може виступити краще. Перевірити це може лише людина з мікрофоном, і цього ми поки не зробили.
Тиша міряється по-різному в розмові і в команді
Друге число, про яке в інструкціях не пишуть, бо воно налаштовується лише експлуатацією.
Система має зрозуміти, що ви договорили. Робить вона це за довжиною тиші, і значення тут не одне. Для короткої команди нам підходить 900 мс. У розмові, де людина думає вголос, те саме значення непридатне - воно ріже її на середині думки. Там у нас 1 200 мс.
Зазвичай для визначення кінця репліки наводять пороги коротші за наш, і ця різниця - намір, а не недогляд. Ціна надто короткого і надто довгого порога несиметрична: довгий поріг коштує пів секунди очікування, короткий - обрізаної фрази і потреби повторити всю постановку задачі.
До цього три дешеві правки, що замінили розумний детектор:
- Слова-заповнювачі не відкривають фразу. Фрагмент, розпізнаний як «ем», «ну», «отже», «момент», нікуди не надсилається і лише продовжує очікування.
- Коротше за 0,7 с і довше за 25 с не надсилається. Нижня межа - проти галюцинації на тиші: модель, якій дали тишу, іноді вигадує фразу. Верхня - проти того, щоб кінець довгої репліки зник без попередження.
- Передчасний обрив не смертельний. Обрізана фраза йде, наступна стає в чергу. У телефонній розмові це коштувало б клієнта, тут - однієї зайвої репліки.
Межу фрази модель знайти вміє. Поріг гучності - ні
Спочатку початок і кінець мовлення ми шукали за гучністю. Це працює в тиші і розвалюється саме там, де потрібно, - у гучному офісі і в машині.
Вимірна різниця: за фонового шуму 0,01 RMS, тобто вище за наш поріг 0,006, поріг гучності фразу не закриває взагалі і надсилає весь запис цілком. Модель визначення мовлення з того самого входу дістає 3,3 секунди справжньої репліки. Коштує це 0,05 с процесора на 6,9 с звуку, тобто практично нічого.
Це ж і найкращий приклад тихої поломки в усьому нашому інструменті. Ніде нічого не ламається, жодна помилка не вискакує - просто в розшифровку починає йти шум, і результати гіршають так, що ви пов'яжете це з моделлю, а не зі входом.
Пастка, яка до голосу стосунку не має, і все одно вас зупинить
Останній досвід варто згадати, бо він стосується вибору інструментів загалом, а не лише голосу.
Бібліотека, на яку ми спершу розраховували, встановлюється без помилки і падає лише за першого імпорту: політика безпеки Windows блокує її бінарну частину. Вимкнути цю політику можна звичайним налаштуванням, біда у зворотному напрямку - назад на тих машинах вона не вмикається інакше як перевстановленням системи. Заради однієї бібліотеки це того не вартувало, тож ті самі файли моделей ми обслужили через рантайм, який підписаний. Працює, але це зайва робота, про яку ми під час вибору не знали.
Правило, яке звідси випливає: у бібліотеки з бінарною частиною політика й імпорт перевіряються до того, як рішення потрапить у завдання. Успішне встановлення не доводить, що воно запрацює.
Коли голосове введення має сенс, а коли ні
Підсумовуючи заміряне:
Має сенс, коли в людини зайняті руки, вона говорить структурно і результат хтось прочитає раніше, ніж почне за ним діяти. Постановка задач, нотатки з виїзду, звіти з будівництва, диктовка чернетки.
Не має сенсу там, де результат іде просто в систему без підтвердження людиною, і особливо там, де в мовленні трапляються власні імена, коди і числа. Саме вони губляться першими і губляться тихо - фраза лишиться граматично правильною і означатиме інше.
Практичний наслідок: голосове введення стоїть перед кроком, де річ побачить людина, а не після нього. Хто це правило собі пробачає, будує автомат, який іноді пише хибне число, - а чому це гірше, ніж не написати жодного, розбираємо в окремій статті про числа в автоматі.
На голосовому введенні треба міряти не точність розшифровки. Треба міряти, скільки власних імен із десяти виживає, - бо ім'я це єдине, що система не додумає.
Хочете спробувати на своєму процесі
Розкажіть нам, що у вас люди сьогодні вносять руками і коли в них при цьому не вільні руки. Повернемо оцінку, чи окупається голосове введення, і головне - на якому кроці має лишитися людина.
Сценарії, підключення й експлуатацію будуємо на сторінці автоматизації. Про те, яким каналом такий інструмент має говорити назовні, є окрема стаття про вибір між WhatsApp, Telegram і SMS.
Напишіть на info@lamapixel.com або телефонуйте +420 775 599 009.