Нейросети для распознавания речи сегодня работают в телефонах, умных колонках и медицинских системах. Суть, преобразование звука в текст с задержкой менее 200 мс. Это не фантастика, это уже встроено в Android 14 и iOS 17
Я пробовал три решения: Google Speech-to-Text, Mozilla DeepSpeech, и собственную модель на PyTorch. Результаты: Google, 97% точность на чистом английском, DeepSpeech, 89% с шумом, а мой вариант, 93% после 30 часов обучения на домашних данных.
- Google STT: идеален для смартфонов, но требует интернета
- DeepSpeech: локальный, но требует 4 ГБ ОЗУ и GPU
- Своя модель: можно обучать на локальных данных, но нужен опыт в ML
Если че, не полагайся на «облако». В экстренных случаях, когда интернета нет, локальные решения спасают. У меня в барахолке лежит старый Raspberry Pi 4, с ним можно запустить DeepSpeech без тормозов.
Важно: тренируй модель на голосах, похожих на твои. Мой голос, низкий, с акцентом. Без аугментации (добавления шума, изменения темпа) точность падала до 72%.
Сейчас все больше приложений используют локальную обработку. Apple запустила настройку приватности, данные не уходят в облако. Это не просто мода. Это будущее.:)
