Ceci est une traduction automatique du document original en anglais. En cas de divergence entre cette traduction et la version originale anglaise, la version anglaise fera foi. Consulter la version originale en anglais
Voix : Parler et Écouter
Vous voulez que l'IA lise les réponses à haute voix ? Ou dicter des messages au lieu de les taper ? Caiioo propose l'entrée et la sortie vocales — toutes configurables, certaines s'exécutant localement sur votre appareil.

Sortie vocale (Synthèse vocale)
Faites lire les réponses de l'IA à haute voix. Choisissez parmi :
| Option | Type | Qualité | Configuration |
|---|---|---|---|
| Navigateur par défaut | Local | Basique | Gratuit, sans configuration |
| Kokoro Neural TTS | Local | Élevée | Gratuit, s'exécute sur votre appareil |
| Google Gemini | Cloud | Naturel | Ajoutez votre clé API |
| OpenAI (gpt-4o-mini-tts) | Cloud | Naturel, restitution orientable | Ajoutez votre clé API OpenAI |
| ElevenLabs | Cloud | Premium | Ajoutez votre clé API |
| Cartesia (Sonic 3.5) | Cloud | Premium | Ajoutez votre clé API |
| Resemble.ai | Cloud | Excellent (clonage vocal) | Ajoutez votre clé API |
Taille de téléchargement de Kokoro : Le modèle Kokoro est livré en deux variantes, et celle qui sera téléchargée dépend de votre plateforme. macOS et iOS chargent le modèle quantifié INT8 plus petit (~88 Mo), tandis que l'extension/le navigateur utilise la version WebGPU en pleine précision plus grande (~330 Mo). C'est un téléchargement unique.
Notes par plateforme :
- Kokoro natif iOS (v0.9.720+) : s'exécute dans le processus hôte iOS via OnnxRuntime au lieu de WebView, ce qui corrige les plantages sur iPhone 13/14.
- Kokoro macOS : diffuse phrase par phrase (en l'espace d'environ 1s après avoir appuyé sur lecture) via le processus d'assistance de bureau.
- Gemini TTS (v0.9.723+) : lit phrase par phrase, de sorte que l'audio commence après la première phrase au lieu d'attendre que la réponse entière soit synthétisée.
- OpenAI (v0.9.724+) : gpt-4o-mini-tts avec restitution orientable — demandez un accent, un ton ou un rythme en langage naturel (par ex. « lis ceci avec un chaleureux accent irlandais ») et la voix s'y adapte. Utilise la même clé API OpenAI que le fournisseur LLM OpenAI. Un champ Instructions de style vocal dans Paramètres > Voix applique votre directive de style à chaque réponse parlée.
- Cartesia (v0.9.723+) : une seule clé API alimente à la fois Sonic 3.5 (sortie) et Ink (entrée). Il n'y a pas de voix par défaut — choisissez-en une dans Paramètres > Voix avant de l'activer.
Latence : Gemini et OpenAI génèrent la totalité de la réponse avant que la lecture ne commence, de sorte que le premier son peut accuser un retard de quelques secondes sur les réponses plus longues — Paramètres > Voix affiche une note lorsque vous en sélectionnez un. Pour une parole à faible latence, choisissez ElevenLabs, Cartesia ou Resemble.
Vitesse de lecture : Le curseur de vitesse (0,5×–2,0×) est appliqué par le fournisseur pour ElevenLabs (limité à 0,7–1,2×) et Cartesia (limité à 0,6–1,5×). Les voix du navigateur et Kokoro accélèrent localement. Gemini et OpenAI n'ont pas de contrôle de vitesse propre, le curseur est donc masqué lorsqu'ils sont sélectionnés ; Resemble.ai applique la vitesse sur la lecture standard (hors streaming).
Pour l'activer :
- Allez dans Paramètres > Voix
- Choisissez une option de synthèse vocale
- Activez l'option « Lire automatiquement les réponses » si vous souhaitez que l'IA lise automatiquement
- Ajustez la vitesse de lecture si vous le souhaitez
Si la lecture échoue : Les erreurs vocales s'affichent désormais sous forme de notification (toast) au lieu d'échouer silencieusement — ainsi, une clé API manquante ou invalide, ou une voix incompatible avec le modèle sélectionné (fréquent avec Resemble.ai et Cartesia), vous indique exactement quoi corriger.
Local vs Cloud : Les voix du navigateur et Kokoro ne envoient jamais rien hors de votre appareil. Gemini, OpenAI, ElevenLabs, Cartesia et Resemble.ai envoient du texte à leurs serveurs (en utilisant vos clés API) pour générer l'audio. Consultez Confidentialité et données pour plus de détails.
Coûts vocaux (TTS + STT) sont regroupés sous voice_cost dans la conversation, correspondant au parcours à exécution unique.
Entrée vocale (Saisie vocale)
Dictez vos messages au lieu de les taper. Cliquez sur l'icône microphone dans l'éditeur pour démarrer l'enregistrement. Caiioo transcrit vos paroles et les insère dans le champ de message.
Choisissez le mode de transcription :
| Option | Type | Confidentialité | Configuration |
|---|---|---|---|
| Whisper (Navigateur) | Local | Totalement privé | GRATIS, s'exécute sur votre appareil |
| WhisperKit (iOS) | Local | Totalement privé | GRATIS, sur l'appareil |
| whisper.cpp & Moonshine (Android) | Local | Totalement privé | GRATIS, sur l'appareil |
| Browser Speech | Local | Privé | GRATIS, intégré |
| ElevenLabs Scribe | Cloud | Précis (idéal hors anglais) | Ajoutez votre clé API ElevenLabs |
| Cartesia Ink | Cloud | Précis, faible latence | Ajoutez votre clé API Cartesia |
Les options locales gardent votre audio en local — rien n'est envoyé à un serveur. ElevenLabs et Cartesia envoient l'audio à leurs serveurs pour la transcription (via votre clé API) et offrent une meilleure précision, surtout pour les langues autres que l'anglais.
Pour l'utiliser :
- Cliquez sur l'icône micro dans l'éditeur
- Dites votre message
- Arrêtez quand vous avez fini
- La transcription apparaît dans le champ de message
- Modifiez si besoin, puis envoyez
Première configuration : La première fois que vous utilisez un modèle vocal sur l'appareil, il doit être téléchargé. L'éditeur affiche la progression ("Téléchargement du modèle vocal… N%", puis "Préparation"/"Chargement"), une brève pause lors du premier clic est donc normale.
Enregistrer de l'audio et l'attacher
Outre la dictée, vous pouvez enregistrer un clip et l'attacher à votre message : ouvrez le menu + de la zone de saisie et choisissez Enregistrer l'audio. Disponible sur iPhone, iPad, macOS et l'extension de navigateur. S'associe naturellement aux applications qui écoutent vos enregistrements, comme le coach de prononciation "pour les langues".
Laisser le modèle écouter votre enregistrement
Deux fonctionnalités vont au-delà de la transcription et permettent à un modèle capable d'entendre de travailler avec l'audio réel :
- Inclure l'audio pour le modèle (Paramètres > Voix) : attache votre enregistrement afin qu'un modèle doté de capacités audio (par ex. Gemini) examine l'audio réel en même temps que votre invite — ton, prononciation, sons d'ambiance, et pas seulement les mots. Désactivé par défaut ; rien n'est envoyé autrement. Un bouton de forme d'onde à côté du micro l'active ou le désactive par message, mais le bouton n'apparaît que dans les modes et applications qui l'autorisent (comme "pour les langues"), afin de ne pas encombrer la zone de saisie pour les tâches quotidiennes.
- Écoute (un outil gratuit, activé par défaut) : permet à l'assistant de revenir en arrière et de réécouter n'importe quelle pièce jointe audio avec une question de suivi ciblée — "Quels mots ont été mal prononcés ?", "Quel est le ton de la voix ?" — lors du tour où vous l'attachez ou lors d'un tour ultérieur. Le modèle d'assistance audio dédié effectue l'écoute, ce qui fonctionne même lorsque votre modèle de chat ne peut pas entendre.
Dictée système (macOS)
Les abonnés Pro sur macOS peuvent également installer PrivateVoice, une application compagnon séparée qui ajoute un raccourci clavier global pour dicter dans n'importe quelle application — pas seulement Caiioo. Voir la page de téléchargement de bureau pour plus de détails.
Voir aussi
- Confidentialité et données — Comment les données vocales sont traitées
- Plateforme et configuration — Disponibilité de l'application de bureau et de PrivateVoice
- Réglages > Voix — Configurez les options vocales pour votre installation
This guide is maintained by the Caiioo team using Slate, our built-in editor.