Страницы

Поиск по вопросам

Показаны сообщения с ярлыком распознавание-речи. Показать все сообщения
Показаны сообщения с ярлыком распознавание-речи. Показать все сообщения

пятница, 20 декабря 2019 г.

Как сделать распознавание речи на WPF/C# приложении?

#c_sharp #wpf #распознавание_речи


Например кнопка "Начать" -> нажимаешь-воспринимается звук- 
кнопка "Остановить"(она же)-> 
отправляется звуковой файл на google сервер-> получаю ответ.

Как это реализовать?
    


Ответы

Ответ 1



Конкретно WPF тебе, кроме интерфейса, врядли, чем-то поможет. Т.о. задача распадается на 2. Записать аудио. Наверняка, поможет проект NAudio. NAudio это открытый проект - Api для .NET для работы с аудио Конвертировать в нужный аудио формат и разпознать при помощи Google Voice. С позволения авторов, направляю на эту статью. Удачи!

Ответ 2



Советую посмотреть на SpeechKit Cloud от Яндекс. https://tech.yandex.ru/speechkit/cloud/ К сожалению, готовой библиотеки для C# не существует.

суббота, 6 июля 2019 г.

Зачем распознавать отдельные фонемы?

Изучая распознавание речи, наткнулся на данную статью. В ней происходит распознавание фонем, а затем их объединение в слова.
Зачем так делать, ведь можно разбить входящий поток на слова, затем сгенерировать MFCC для них и сравнивать уже MFCC со словарем через нейронную сеть? Или так нельзя?


Ответ

Потому что в аудиопотоке нет такого понятия как слово/слова. Есть поток аудиоряда и выделить в нем слова без использования тех же нейронных сетей очень сложно - разные люди обладают разным произношением, мелодикой, скоростью произношения и т.д. Иногда целая фраза/предложение звучит слитно (без пауз), в других случаях люди делают паузы при произношении единственного слова.
В общем если бы было легко разбить аудиопоток на слова, то задача распознавания речи сильно упростилась бы...