Silero-TTS-Service- готовый
onpremise TTS сервис для умного дома на базе Home Assistant
Данный проект я создал, чтобы обеспечить свой умный дом нормальным синтезом речи. Также, чтобы обеспечить rhasspy нормальным синтезом речи. Уже готовые решения меня не устроили и было решено изобрести свой велосипед. За основу были взяты модели Silero.Вдохновился я проектом
silero-ha-http-tts от Gromina. Он был сыроват и я решил сделать всё по уму разуму, с настройками и готовыми контейнерами. https://github.com/Navatusein/Silero-TTS-Service
опубликовано в @gitgate
#tts #hass #homeassistant #silero #russian
GitHub
GitHub - Navatusein/Silero-TTS-Service: Silero TTS backend service. Can be used with Home Assistant and Rhasspy.
Silero TTS backend service. Can be used with Home Assistant and Rhasspy. - Navatusein/Silero-TTS-Service
👍9🔥6
gitgate.wav
85.2 KB
piper - быстрая локальная нейронная система преобразования текста в речь (TTS), которая великолепно звучит и оптимизирована для Raspberry Pi 4, но работает и на x86 платформе.Генерирует весьма недурно, для русского языка 4 готовых модели:
denis - medium
dmitri - medium
irina - medium
ruslan - medium
Для
HomeAssistant доступна в виде нативного плагина - просто добавьте по имени piperhttps://github.com/rhasspy/piper
опубликовано в @gitgate
#tts #speech #russian #hass #homeassistant
👍14🔥8
Moonshine Voice - преобразование речи в текст (TTS) с очень низкой задержкой, распознавание намерений и преобразование текста в речь для создания голосовых агентов и интерфейсов. Инструментарий с открытым исходным кодом для разработчиков, создающих голосовые приложения реального времени.Возможности:
- всё работает на устройстве, поэтому это быстро, конфиденциально, и вам не нужна учетная запись, кредитная карта или ключи
API.- данная структура и модели оптимизированы для приложений потоковой передачи в реальном времени, обеспечивая низкую задержку за счет выполнения большей части работы, пока пользователь еще говорит.
- все модели преобразования речи в текст основаны на наших передовых исследованиях и обучены с нуля, поэтому мы можем предложить более высокую точность, чем
Whisper Large V3, даже в самых компактных моделях размером 26 МБ для ограниченных ресурсов.- интеграция между платформами проста: одна и та же библиотека работает на
Python, iOS, Android, MacOS, Linux, Windows, Raspberry Pi, устройствах IoT и носимых устройствах.- высокоуровневые
API-интерфейсы предлагают комплексные решения для распространенных задач, таких как транскрипция, преобразование текста в речь, идентификация говорящего (диалогизация) и распознавание команд, поэтому вам не нужно быть экспертом, чтобы создать голосовое приложение.- он поддерживает множество языков, включая английский, испанский, китайский (мандаринский диалект), японский, корейский, вьетнамский, украинский и арабский для преобразования речи в речь, а также английский, испанский, арабский, немецкий, французский, хинди, итальянский, японский, корейский, голландский, португальский, русский, турецкий, украинский, вьетнамский и китайский (мандаринский диалект) для преобразования речи в речь.
https://github.com/moonshine-ai/moonshine
Опубликовано в @gitgate
#tts #stt #voice
GitHub
GitHub - moonshine-ai/moonshine: Very low latency speech to text, intent recognition, and text to speech, for building voice agents…
Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces - moonshine-ai/moonshine
👍18🔥1
Supertonic - молниеносно быстрая многоязычная система преобразования текста в речь (TTS), работающая непосредственно на устройстве и предназначенная для локального распознавания речи с минимальными накладными расходами. Благодаря среде выполнения ONNX Runtime, она полностью функционирует на вашем устройстве - без облака, без вызовов API и без проблем с конфиденциальностью.Возможности:
- невероятно быстро: синтез в реальном времени с низкой задержкой на настольных компьютерах, в браузерах, на мобильных устройствах и периферийных устройствах - достаточно быстро, чтобы превратить целую веб-страницу в аудиофайл менее чем за секунду.
- многоязычная поддержка 31 языка: синтезируйте текст непосредственно на 31 языке или передайте параметр
lang="na", чтобы Supertonic обрабатывал текст независимо от языка, если вы не знаете язык ввода - отдельные языковые адаптеры не требуются.- модель с 99 МБ параметров и открытым весом: компактная, полностью открытая контрольная точка - значительно меньше по размеру, чем открытые системы
TTS класса 0,7–2 млрд - для уменьшения объема загрузки, более быстрого холодного запуска и меньшего объема используемой памяти.- готовность к работе на периферийных устройствах: Запускается локально на настольных компьютерах, мобильных устройствах, браузерах и устройствах с ограниченными ресурсами, таких как
Raspberry Pi или электронные книги, без зависимости от сети, с полной конфиденциальностью и без необходимости использования графического процессора.- высококачественный звук 44,1 кГц: Выводит студийный 16-битный
WAV-файл с частотой 44,1 кГц напрямую, готовый к воспроизведению без использования внешнего апсемплера.- теги выражений: 10 встроенных тегов (например, <смех>, <дыхание>, <вздох>) добавляют естественные человеческие нюансы в генерируемую речь без использования подсказок или эталонного аудио.
- многофункциональные
SDK: готовые к использованию примеры через среду выполнения ONNX для Python, Node.js, браузера (WebGPU), Java, C++, C#, Go, Swift, iOS, Rust и Flutter- поддержка русского языка из коробки !
https://github.com/supertone-inc/supertonic
Опубликовано в @gitgate
#tts
👍9🔥8