Useful Tools | Linux | GitOps | DevOps
6.77K subscribers
404 photos
10 videos
13 files
1.12K links
Полезные бесплатные opensource инструменты на все случаи жизни, а иногда и советы.

Понравился проект из поста - поддержи автора звездой!

Web: https://gitgate.d3.ru

Сотрудничество: @maxgrue
Download Telegram
Silero-TTS-Service
- готовый onpremise TTS сервис для умного дома на базе Home Assistant


Данный проект я создал, чтобы обеспечить свой умный дом нормальным синтезом речи. Также, чтобы обеспечить rhasspy нормальным синтезом речи. Уже готовые решения меня не устроили и было решено изобрести свой велосипед. За основу были взяты модели Silero.

Вдохновился я проектом silero-ha-http-tts от Gromina. Он был сыроват и я решил сделать всё по уму разуму, с настройками и готовыми контейнерами.

https://github.com/Navatusein/Silero-TTS-Service

опубликовано в @gitgate

#tts #hass #homeassistant #silero #russian
👍9🔥6
gitgate.wav
85.2 KB
piper - быстрая локальная нейронная система преобразования текста в речь (TTS), которая великолепно звучит и оптимизирована для Raspberry Pi 4, но работает и на x86 платформе.

Генерирует весьма недурно, для русского языка 4 готовых модели:

denis - medium
dmitri - medium
irina - medium
ruslan - medium

Для HomeAssistant доступна в виде нативного плагина - просто добавьте по имени piper

https://github.com/rhasspy/piper

опубликовано в @gitgate

#tts #speech #russian #hass #homeassistant
👍14🔥8
Moonshine Voice - преобразование речи в текст (TTS) с очень низкой задержкой, распознавание намерений и преобразование текста в речь для создания голосовых агентов и интерфейсов. Инструментарий с открытым исходным кодом для разработчиков, создающих голосовые приложения реального времени.

Возможности:
- всё работает на устройстве, поэтому это быстро, конфиденциально, и вам не нужна учетная запись, кредитная карта или ключи API.
- данная структура и модели оптимизированы для приложений потоковой передачи в реальном времени, обеспечивая низкую задержку за счет выполнения большей части работы, пока пользователь еще говорит.
- все модели преобразования речи в текст основаны на наших передовых исследованиях и обучены с нуля, поэтому мы можем предложить более высокую точность, чем Whisper Large V3, даже в самых компактных моделях размером 26 МБ для ограниченных ресурсов.
- интеграция между платформами проста: одна и та же библиотека работает на Python, iOS, Android, MacOS, Linux, Windows, Raspberry Pi, устройствах IoT и носимых устройствах.
- высокоуровневые API-интерфейсы предлагают комплексные решения для распространенных задач, таких как транскрипция, преобразование текста в речь, идентификация говорящего (диалогизация) и распознавание команд, поэтому вам не нужно быть экспертом, чтобы создать голосовое приложение.
- он поддерживает множество языков, включая английский, испанский, китайский (мандаринский диалект), японский, корейский, вьетнамский, украинский и арабский для преобразования речи в речь, а также английский, испанский, арабский, немецкий, французский, хинди, итальянский, японский, корейский, голландский, португальский, русский, турецкий, украинский, вьетнамский и китайский (мандаринский диалект) для преобразования речи в речь.

https://github.com/moonshine-ai/moonshine

Опубликовано в @gitgate

#tts #stt #voice
👍18🔥1
Supertonic - молниеносно быстрая многоязычная система преобразования текста в речь (TTS), работающая непосредственно на устройстве и предназначенная для локального распознавания речи с минимальными накладными расходами. Благодаря среде выполнения ONNX Runtime, она полностью функционирует на вашем устройстве - без облака, без вызовов API и без проблем с конфиденциальностью.

Возможности:
- невероятно быстро: синтез в реальном времени с низкой задержкой на настольных компьютерах, в браузерах, на мобильных устройствах и периферийных устройствах - достаточно быстро, чтобы превратить целую веб-страницу в аудиофайл менее чем за секунду.
- многоязычная поддержка 31 языка: синтезируйте текст непосредственно на 31 языке или передайте параметр lang="na", чтобы Supertonic обрабатывал текст независимо от языка, если вы не знаете язык ввода - отдельные языковые адаптеры не требуются.
- модель с 99 МБ параметров и открытым весом: компактная, полностью открытая контрольная точка - значительно меньше по размеру, чем открытые системы TTS класса 0,7–2 млрд - для уменьшения объема загрузки, более быстрого холодного запуска и меньшего объема используемой памяти.
- готовность к работе на периферийных устройствах: Запускается локально на настольных компьютерах, мобильных устройствах, браузерах и устройствах с ограниченными ресурсами, таких как Raspberry Pi или электронные книги, без зависимости от сети, с полной конфиденциальностью и без необходимости использования графического процессора.
- высококачественный звук 44,1 кГц: Выводит студийный 16-битный WAV-файл с частотой 44,1 кГц напрямую, готовый к воспроизведению без использования внешнего апсемплера.
- теги выражений: 10 встроенных тегов (например, <смех>, <дыхание>, <вздох>) добавляют естественные человеческие нюансы в генерируемую речь без использования подсказок или эталонного аудио.
- многофункциональные SDK: готовые к использованию примеры через среду выполнения ONNX для Python, Node.js, браузера (WebGPU), Java, C++, C#, Go, Swift, iOS, Rust и Flutter
- поддержка русского языка из коробки !

https://github.com/supertone-inc/supertonic

Опубликовано в @gitgate

#tts
👍9🔥8