HomeRessources, Guides & Actualités – Actualités de l’intelligence artificielleIntelligence artificielleVoicebox : 14 Fonctionnalités clés de ce Studio Vocal IA open source

Voicebox : 14 Fonctionnalités clés de ce Studio Vocal IA open source

Vous cherchez une alternative locale et privée aux services cloud comme ElevenLabs et WisprFlow ? Voicebox réunit la synthèse vocale, la dictée globale et le pilotage d’agents IA dans une seule application gratuite qui s’exécute directement sur votre ordinateur. Conçu sans transmission de données externes, ce studio open source combine sept moteurs TTS, le modèle Whisper et un protocole MCP complet.

Contrairement aux solutions propriétaires réparties entre la saisie et la restitution, Voicebox boucle la chaîne d’entrée et de sortie vocale en local. L’application repose sur une architecture native construite avec Tauri et Rust, évitant la lourdeur d’Electron, et dialogue avec un serveur Python FastAPI en arrière-plan. Les modèles, les enregistrements et les métadonnées ne quittent jamais votre machine.

Les 14 fonctionnalités majeures de Voicebox

1. Le clonage vocal multi-moteur avec sept moteurs TTS

Voicebox intègre sept moteurs de synthèse vocale distincts, interchangeables à chaque génération selon vos besoins en langues, vitesse de calcul ou ressources matérielles. Vous pouvez cloner une voix en quelques secondes à partir d’un échantillon de référence (zero-shot cloning) ou utiliser plus de 50 voix préconfigurées.

MoteurLanguesPoints forts
Qwen3-TTS (0.6B / 1.7B)10Clonage multilingue haute qualité, instructions de débit (comme chuchoter ou parler lentement).
Qwen CustomVoice109 voix prédéfinies avec contrôle d’élocution en langage naturel, sans fichier audio de référence.
LuxTTSAnglaisEmpreinte mémoire réduite (~1 Go de VRAM), sortie audio 48 kHz, 150 fois le temps réel sur CPU.
Chatterbox Multilingual23Couverture linguistique la plus vaste (arabe, danois, finnois, grec, hébreu, hindi, malais, norvégien, polonais, swahili, suédois, turc, etc.).
Chatterbox TurboAnglaisModèle rapide de 350M paramètres interprétant les balises d’émotions et de sons paralinguistiques.
TADA (1B / 3B)10Modèle de HumeAI offrant plus de 700 secondes d’audio cohérent avec double alignement texte-acoustique.
Kokoro850 voix préconfigurées, modèle compact de 82M paramètres, inférence CPU rapide.

2. Les balises paralinguistiques et le contrôle expressif de la parole

L’expressivité vocale varie nettement selon le moteur sélectionné. Seul le modèle Chatterbox Turbo interprète activement les balises paralinguistiques pour insérer des réactions sonores humaines dans le flux de parole.

Règle de compatibilité : Seul Chatterbox Turbo interprète les balises d’émotion. Les moteurs Qwen3-TTS, LuxTTS, Chatterbox Multilingual et HumeAI TADA lisent ces balises textuellement au lieu de produire les sons correspondants.

Lorsque Chatterbox Turbo est actif, la touche / dans la zone de texte ouvre un sélecteur d’émotions permettant d’insérer directement :

  • [laugh] et [chuckle]
  • [gasp] et [sigh]
  • [cough] et [clear throat]
  • [groan], [sniff] et [shush]

Pour Qwen CustomVoice et Qwen3-TTS, le contrôle de l’élocution s’effectue par des directives textuelles en langage naturel.

3. Les huit effets audio de post-traitement via Pedalboard

Voicebox intègre la bibliothèque Pedalboard de Spotify pour appliquer des effets en temps réel sur l’audio généré, sans recalculer la synthèse brute. L’application propose quatre préréglages (Robotic, Radio, Echo Chamber, Deep Voice) et permet d’enregistrer des configurations personnalisées.

EffetPlage de réglage et description
Pitch ShiftVariation de hauteur jusqu’à 12 demi-tons vers le haut ou vers le bas.
ReverbTaille de pièce, amortissement et balance signal sec / signal traité (wet/dry).
DelayÉcho avec réglage du temps, du feedback et du mix.
Chorus / FlangerRetard modulé générant des textures métalliques ou denses.
CompressorRéduction et contrôle de la dynamique sonore.
GainAjustement du volume de sortie entre -40 dB et +40 dB.
High-Pass FilterFiltre passe-haut supprimant les fréquences basses indésirables.
Low-Pass FilterFiltre passe-bas coupant les fréquences aiguës.

4. La génération de longueur illimitée par découpage et fondu enchaîné

Pour traiter des textes longs comme des scripts, des articles ou des chapitres entiers, Voicebox segmente automatiquement le texte au niveau des phrases. Chaque bloc est généré individuellement avant d’être raccordé par un fondu sonore.

  • Limite de découpage : configurable entre 100 et 5 000 caractères par bloc.
  • Fondu enchaîné (crossfade) : réglable de 0 à 200 ms pour assurer des transitions fluides.
  • Capacité maximale : jusqu’à 50 000 caractères par soumission.
  • Segmentation intelligente : préservation des abréviations, de la ponctuation CJK et des balises entre crochets.

5. La gestion des versions et la traçabilité des générations

Chaque génération conserve son historique complet pour éviter la perte de rendus satisfaisants :

  • Version originale : le rendu audio brut du moteur TTS reste intact en permanence.
  • Versions d’effets : possibilité d’appliquer plusieurs chaînes de traitement audio différentes à partir d’une même version source.
  • Prises alternatives (Takes) : régénération avec une graine aléatoire (seed) différente pour modifier l’intonation.
  • Traçabilité : chaque fichier conserve la trace de son modèle parent et de ses réglages.
  • Favoris : système d’étoiles pour retrouver rapidement les meilleures prises.

6. La file d’attente asynchrone non bloquante

La génération s’exécute en arrière-plan sans bloquer l’interface. Vous pouvez lancer un calcul et continuer immédiatement à rédiger le bloc suivant.

  • Exécution en série : traitement séquentiel pour éviter les conflits d’allocation et la saturation de la VRAM GPU.
  • Streaming d’état SSE : progression diffusée en direct via Server-Sent Events.
  • Résilience : relance manuelle des générations en échec et récupération automatique des tâches interrompues après une fermeture inattendue.

7. La gestion approfondie des profils vocaux

Les profils constituent la base du clonage dans Voicebox. Ils regroupent les échantillons de référence analysés par les modèles d’IA.

  • Création : import de fichiers existants (WAV, MP3, M4A) ou capture directe au microphone.
  • Support multi-échantillons : accumulation de plusieurs extraits pour une fidélité accrue du timbre.
  • Paramètres dédiés : association d’une chaîne d’effets audio par défaut propre à chaque profil.
  • Portabilité : fonctions d’importation et d’exportation pour sauvegarder ou transférer vos voix d’une machine à l’autre.

8. L’éditeur multipiste Stories

Voicebox intègre un séquenceur audio complet sous forme de timeline pour assembler des podcasts, des récits audio ou des dialogues entre plusieurs intervenants.

  • Agencement multipiste par glisser-déposer.
  • Rognage et découpage précis des clips audio directement sur la piste.
  • Génération de nouveaux clips sans quitter la timeline.
  • Lecture continue synchronisée avec la tête de lecture.
  • Épinglage de versions spécifiques par extrait audio.
  • Exportation du mixage complet vers un fichier final.

9. La dictée vocale globale avec collage direct

Voicebox assure l’entrée vocale du système pour concurrencer les outils comme WisprFlow. Un raccourci clavier global déclenche la capture vocale depuis n’importe quelle application.

  • Modes de déclenchement : maintien de touche (push-to-talk) ou bascule (tap-to-toggle). L’appui sur la barre d’espace pendant le maintien bascule en session continue sans rupture d’enregistrement.
  • Collage contextuel (macOS) : injection directe dans le champ de texte actif avec préservation et restauration atomiques du presse-papier.
  • Bouton micro interne : présent sur chaque champ de saisie de Voicebox pour dicter des descriptions ou des scripts.
  • Raffinement par LLM : option de nettoyage automatique des hésitations, bégaiements et faux départs avant le collage.
  • Indicateur visuel flottant (pill) : bandeau affichant à l’écran les états d’enregistrement, de transcription, de correction et de synthèse.

10. La transcription Speech-to-Text via Whisper

Le moteur de transcription d’OpenAI tourne en local sur votre configuration pour alimenter la dictée, le traitement de fichiers et l’API /transcribe.

  • Moteurs d’exécution : MLX sur Apple Silicon, PyTorch (avec CUDA, ROCm, DirectML ou CPU) sur les autres systèmes.
  • Modèles standards : Base, Small, Medium et Large pour arbitrer entre vitesse et précision.
  • Modèle Turbo : cadence environ 8 fois plus rapide que Whisper Large avec une fidélité quasi identique.

11. Le gestionnaire de captures audio et textuelles

L’onglet Captures archive chaque enregistrement issu de la dictée, du microphone interne ou d’un fichier audio importé.

  • Réévaluation : possibilité de relancer la transcription avec un modèle Whisper plus grand ou d’appliquer un filtrage LLM (retrait des tics de langage, suppression des auto-corrections, préservation des termes techniques).
  • Édition directe : modification manuelle du texte avec sauvegarde dès la perte de focus.
  • Transformation vocale : conversion d’une capture en parole avec une voix clonée en un clic.
  • Promotion en échantillon : transformation directe de l’audio et du texte d’une capture en échantillon de référence pour enrichir un profil de voix.
  • Stockage local : conservation des données dans le répertoire de Voicebox avec bouton d’accès direct dans les paramètres.

12. La sortie vocale pour agents IA via serveur MCP et API REST

Voicebox fonctionne comme un serveur de voix pour les environnements de développement et agents autonomes (Claude Code, Cursor, Windsurf, Cline, extensions VS Code).

Un simple appel d’outil permet à un agent de s’exprimer avec une voix clonée :

await voicebox.speak({
  text: "Deploy complete.",
  profile: "Morgan"
});

Les fonctionnalités de pilotage externe comprennent :

  • 4 outils MCP intégrés : voicebox.speak, voicebox.transcribe, voicebox.list_captures et voicebox.list_profiles.
  • Double transport : connexion HTTP sur http://127.0.0.1:17493/mcp ou binaire autonome stdio (voicebox-mcp).
  • Assignation par agent : possibilité d’attribuer une voix spécifique à Claude Code et une autre à Cursor dans Paramètres → MCP, avec affichage de l’horodatage last_seen_at.
  • Contrôle visuel permanent : chaque prise de parole par un agent déclenche l’affichage du bandeau flottant avec le nom du profil vocal utilisé. Aucun son n’est émis en arrière-plan sans confirmation visuelle.
  • API REST dédiée : routes POST /generate, POST /speak, POST /transcribe et GET /profiles avec documentation Swagger sur http://127.0.0.1:17493/docs.

13. Les personnalités vocales animées par un LLM local Qwen3

Vous pouvez associer une personnalité rédigée en texte libre à n’importe quel profil pour définir son identité, son registre de langue et son comportement.

Le traitement repose sur un modèle Qwen3 (0.6B, 1.7B ou 4B) embarqué, partageant le runtime des moteurs vocaux (MLX ou PyTorch) pour ne pas encombrer inutilement la mémoire vidéo :

  • Composer : génère aléatoirement une réplique inédite en accord avec le personnage.
  • Parler dans le personnage : réécrit automatiquement le texte saisi selon le style de la personnalité avant de l’envoyer au moteur TTS.
  • Support MCP : les agents peuvent déclencher cette réécriture stylistique en passant le paramètre personality: true dans l’appel d’outil.

14. Le contrôle granulaire des modèles et de la mémoire

Voicebox permet de gérer précisément l’empreinte disque et l’allocation de votre matériel :

  • Déchargement individuel des modèles de la VRAM sans effacer les fichiers téléchargés.
  • Redirection du dossier de stockage via la variable d’environnement VOICEBOX_MODELS_DIR.
  • Assistant de migration de l’emplacement des modèles avec suivi de progression.
  • Gestionnaire de téléchargement permettant d’annuler ou de purger les transferts en cours.

Guide de prise en main : profil et première génération

Étape 1 : Créer un profil vocal

  1. Ouvrez l’onglet Profiles dans la barre latérale puis cliquez sur + New Profile.
  2. Renseignez le nom, la langue principale et une description optionnelle.
  3. Choisissez votre méthode d’échantillonnage :
    • Option A (Import) : téléversez un fichier WAV, MP3 ou M4A contenant entre 10 et 30 secondes de voix claire.
    • Option B (Enregistrement) : enregistrez directement votre voix pendant 10 à 30 secondes dans un environnement silencieux.
  4. Cliquez sur Create Profile. L’utilisation d’échantillons au ton régulier sans réverbération garantit un meilleur résultat.

Étape 2 : Générer un rendu audio

  1. Rendez-vous dans l’onglet Generate.
  2. Sélectionnez votre profil dans la liste déroulante.
  3. Saisissez votre texte. Si vous utilisez Chatterbox Turbo, tapez / pour insérer des balises expressives.
  4. Cliquez sur Generate. Le premier calcul peut nécessiter 2 à 5 minutes pour télécharger et charger le modèle en mémoire. Les synthèses suivantes seront nettement plus rapides.
  5. Écoutez le résultat avec le bouton de lecture, exportez le fichier via Download ou retrouvez-le dans votre historique.

Étape 3 : Créer un récit multipiste (Stories)

  1. Dans la section Stories, cliquez sur + New Story puis sur + Add Track.
  2. Glissez des extraits depuis votre historique ou générez directement de nouveaux segments audio sur les pistes.
  3. Ajustez la position des blocs, rognez leurs extrémités et lancez la lecture synchronisée.
  4. Cliquez sur Export pour compiler le fichier final.

Compatibilité matérielle et accélération GPU

L’application s’adapte automatiquement à l’architecture de votre machine :

PlateformeBackend utiliséParticularités techniques
macOS (Apple Silicon)MLX (Metal)Accélération 4 à 5 fois plus rapide via le Neural Engine.
Windows (NVIDIA)PyTorch (CUDA)Téléchargement automatique des binaires CUDA depuis l’application.
Linux (NVIDIA)PyTorch (CUDA)Utilise un environnement Python local ou distant configuré avec CUDA.
Linux (AMD)PyTorch (ROCm)Configuration automatique de la variable HSA_OVERRIDE_GFX_VERSION.
Windows (tous GPU)DirectMLSupport d’accélération universel pour les puces graphiques sous Windows.
Intel ArcIPEX / XPUAccélération pour cartes graphiques dédiées Intel.
Toute plateformeCPUFonctionnement garanti sans GPU dédié, avec une cadence de calcul ralentie.

Des paquets précompilés sont proposés sous forme de fichiers DMG pour macOS (Apple Silicon et Intel), d’installateurs MSI pour Windows et via docker compose up pour Docker. Pour Linux, les binaires précompilés ne sont pas encore distribués ; l’installation demande une compilation depuis les sources selon les instructions d’installation Linux de Voicebox.

Stack technique et environnement de développement

Le projet se divise en plusieurs couches spécialisées :

  • Application desktop : Tauri (Rust) pour la légèreté et la gestion des accès système de bas niveau (raccourcis globaux, injection de texte).
  • Interface utilisateur : React, TypeScript, Tailwind CSS, gérés avec Zustand et React Query.
  • Backend de calcul : FastAPI (Python) exécutant les moteurs de synthèse et de transcription.
  • Composants audio : WaveSurfer.js pour le rendu visuel, librosa et Spotify Pedalboard pour le traitement du signal.
  • Persistance : SQLite pour la base de données locale.

Pour lancer l’environnement de développement depuis le dépôt officiel disponible sur le dépôt GitHub de Voicebox :

git clone https://github.com/jamiepine/voicebox.git
cd voicebox

just setup   # crée le venv Python et installe les dépendances
just dev     # lance le backend et l'application Tauri

Les prérequis comprennent Bun, Rust, Python 3.11+, les dépendances Tauri et Xcode sous macOS. Le fichier .mcp.json fourni à la racine connecte automatiquement les outils Voicebox à Claude Code dès l’exécution de l’application.

Guide de dépannage des erreurs courantes

Problèmes d’installation et de sécurité OS

  • macOS : « L’application est endommagée et ne peut pas être ouverte » : ce message apparaît car Voicebox n’est pas signé avec un certificat Apple Developer officiel. Supprimez l’attribut de quarantaine avec la commande suivante dans votre terminal : xattr -cr /Applications/Voicebox.app
  • Windows SmartScreen : cliquez sur « Informations complémentaires » puis sur « Exécuter quand même ».
  • Linux AppImage : attribuez les droits d’exécution avant lancement : chmod +x voicebox-*.AppImage ./voicebox-*.AppImage

Avertissement flash-attn dans les journaux serveur

Warning: flash-attn is not installed. Will only run the manual PyTorch version.

Cet avertissement est émis par les moteurs Chatterbox et Qwen au démarrage. Il est inoffensif. En l’absence de FlashAttention, PyTorch bascule sur son mécanisme interne SDPA (Scaled Dot-Product Attention), dont les débits approchent ceux de FlashAttention-2 sur les GPU récents. Windows ne dispose pas de support officiel stable pour cette bibliothèque, macOS utilise les kernels optimisés de MLX, et l’installation sous Linux reste sensible aux versions. La recommandation officielle est d’ignorer ce message.

Blocages et corruption de la base de données SQLite

Si l’erreur Database is locked survient, quittez toutes les instances de l’application et supprimez les fichiers de verrouillage temporaires :

rm ~/Library/Application\ Support/sh.voicebox.app/data/voicebox.db-shm
rm ~/Library/Application\ Support/sh.voicebox.app/data/voicebox.db-wal

Si la base est corrompue et empêche l’ouverture de Voicebox, supprimez le fichier voicebox.db (cette action efface vos profils et votre historique de génération) :

# macOS
rm ~/Library/Application\ Support/sh.voicebox.app/data/voicebox.dbWindows
del %APPDATA%\sh.voicebox.app\data\voicebox.db

Échecs de téléchargement et saturation mémoire

  • Téléchargement de modèle bloqué : vérifiez votre connexion ou passez par l’outil en ligne de commande Hugging Face : pip install huggingface_hub huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base
  • Mauvaise version ou dégradation soudaine : videz le cache local du modèle : # macOS et Linux rm -rf ~/.cache/huggingface/hub/models--Qwen*Windows rmdir /s %USERPROFILE%.cache\huggingface\hub\models--Qwen*
  • Erreur CUDA out of memory : fermez les profils vocaux inutilisés, déchargez les moteurs non sollicités dans Paramètres → Modèles, ou basculez temporairement le calcul sur le mode CPU.
  • Erreur MLX « Failed to load the default metallib » sous macOS : reconstruisez le binaire du serveur ou réinstallez les dépendances MLX de votre environnement.

Si une difficulté persiste, vous pouvez consulter ou ouvrir un ticket sur les issues GitHub de Voicebox en joignant les informations de diagnostic requises : système d’exploitation (uname -a ou systeminfo), version de Voicebox (menu Help → About), version de Python et relevé GPU via nvidia-smi.

Feuille de route technique

Le document docs/PROJECT_STATUS.md recense les fonctionnalités planifiées pour les prochaines versions de Voicebox :

  • Parité de collage automatique : intégration de SendInput sur Windows et de uinput / AT-SPI sur Linux pour égaler l’injection de dictée présente sur macOS.
  • Nouveaux moteurs STT : intégration de Parakeet v3 et Qwen3-ASR pour étendre la reconnaissance vocale à plus de 50 langues.
  • Routage de pipelines : chaînes configurables source → transformation → destination avec connecteurs webhooks et sorties MCP.
  • Transcription en continu : endpoint WebSocket /transcribe/stream pour afficher le texte au fil de l’élocution.
  • Modèles vocaux de bout en bout : intégration de Moshi, GLM-4-Voice et Qwen2.5 Omni pour une communication directe de voix à voix sans passerelle textuelle intermédiaire.
  • Voice Design : création synthétique de nouveaux timbres à partir d’une simple description textuelle.
  • Capture longue durée : enregistrement double flux (microphone et son système simultanés) avec résumé généré par LLM.
  • Destinations externes : export direct vers Apple Notes et Obsidian.
  • Architecture d’extensions et compagnon mobile : support de plugins pour modèles sur mesure et application mobile pour piloter Voicebox à distance.

Leave a Reply

Your email address will not be published. Required fields are marked *