speech-to-speech huggingface

Build local voice agents with open-source models

主要言語
Python
Stars
12,039
Forks
1,475

タグ

  • ライブラリ/SDK
  • AIワークフロー
  • 音声エージェント
  • リアルタイム
  • ローカルAI
  • セルフホスト
  • バックエンド

概要

VAD→STT→LLM→TTSの4段構成を低遅延・完全モジュール化した音声エージェント用Pythonライブラリ。OpenAI Realtime互換のWebSocket APIを公開し、各コンポーネントを自由に差し替えられる。LLMはOpenAI互換プロトコルに対応し、ホスト型プロバイダーからvLLMやllama.cppによる完全ローカル構成まで柔軟に選択可能。ロボットの会話バックエンドとして本番運用されている。

README

<div align="center"> <div>&nbsp;</div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: オープンソースモデルで音声エージェントを構築する [![PyPI](https://img.shields.io/pypi/v/speech-to-speech)](https://pypi.org/project/speech-to-speech/) [![Python](…

查看完整页面