Ceci est une traduction automatique du document original en anglais. En cas de divergence entre cette traduction et la version originale anglaise, la version anglaise fera foi. Consulter la version originale en anglais
Voix : Parler et Écouter
Vous voulez que l'IA lise les réponses à haute voix ? Ou dicter des messages au lieu de les taper ? Caiioo propose l'entrée et la sortie vocales — toutes configurables, certaines s'exécutant localement sur votre appareil.

Voice Output (Text-to-Speech)
Permettez à l'IA de lire ses réponses à voix haute. Choisissez parmi :
| Option | Type | Qualité | Configuration |
|---|---|---|---|
| Browser Default | Local | Basique | Gratuit, sans configuration |
| Kokoro Neural TTS | Local | Élevée | Gratuit, s'exécute sur votre appareil |
| Google Gemini | Cloud | Naturel | Ajoutez votre clé API |
| OpenAI (gpt-4o-mini-tts) | Cloud | Naturel, diffusion contrôlable | Ajoutez votre clé API OpenAI |
| ElevenLabs | Cloud | Premium | Ajoutez votre clé API |
| Cartesia (Sonic 3.5) | Cloud | Premium | Ajoutez votre clé API |
| Resemble.ai | Cloud | Excellent (clonage vocal) | Ajoutez votre clé API |
Taille de téléchargement de Kokoro : Le modèle Kokoro est disponible en deux variantes, et le téléchargement dépend de votre plateforme. macOS et iOS chargent le modèle quantifié INT8 plus petit (~88 Mo), tandis que l'extension/le navigateur utilise la version WebGPU en pleine précision plus grande (~330 Mo). Il s'agit d'un téléchargement unique.
Notes sur les plateformes :
- iOS native Kokoro (v0.9.720+) : s'exécute dans le processus hôte iOS via OnnxRuntime au lieu de WebView, ce qui corrige les plantages sur iPhone 13/14.
- macOS Kokoro : diffuse phrase par phrase (dans la seconde suivant le lancement de la lecture) via le processus d'assistance de bureau.
- Gemini TTS (v0.9.723+) : lit phrase par phrase, de sorte que l'audio commence après la première phrase au lieu d'attendre que la réponse entière soit synthétisée.
- OpenAI (v0.9.724+) : gpt-4o-mini-tts avec diffusion contrôlable — demandez un accent, un ton ou un rythme en langage naturel (par ex. « lis ceci avec un chaleureux accent irlandais ») et la voix suit. Utilise la même clé API OpenAI que le fournisseur LLM OpenAI. Un champ Voice style instructions dans Settings > AI Setup > Voice applique votre consigne de style à chaque réponse parlée.
- Cartesia (v0.9.723+) : une seule clé API alimente à la fois Sonic 3.5 (sortie) et Ink (entrée). Il n'y a pas de voix par défaut — choisissez-en une dans Settings > AI Setup > Voice avant de l'activer.
- ElevenLabs : chaque voix ElevenLabs commence à parler dès qu'elle a quelque chose à dire, y compris la version expressive v3, sélectionnable dans le sélecteur de voix. Le modèle vocal par défaut est Flash v2.5 : ElevenLabs l'estime d'une qualité équivalente au précédent défaut, et il coûte deux fois moins cher par caractère.
- ElevenLabs v3 Conversational (v0.9.777+) : sélectionnez le modèle v3 Conversational dans la liste des modèles vocaux pour un dialogue expressif et à faible latence dans plus de 70 langues. ElevenLabs le facture actuellement à moitié tarif par rapport au taux standard par caractère, et les estimations de coûts de Caiioo en tiennent compte.
Latence : Gemini et OpenAI restituent la réponse complète avant que la lecture ne commence, de sorte que le premier audio peut accuser un retard de quelques secondes sur les réponses plus longues — Settings > AI Setup > Voice affiche une note lorsque vous en choisissez un. Pour une parole à faible latence, choisissez ElevenLabs, Cartesia ou Resemble.
Vitesse de lecture : Le curseur de vitesse (0,5×–2,0×) est appliqué par le fournisseur pour ElevenLabs (limité à 0,7–1,2×) et Cartesia (limité à 0,6–1,5×). Les voix du navigateur et Kokoro s'accélèrent localement. Gemini et OpenAI n'ont pas de contrôle de vitesse propre, le curseur est donc masqué lorsqu'ils sont sélectionnés ; Resemble.ai applique la vitesse lors de la lecture standard (non en streaming). Une exception : les modèles ElevenLabs v3 (v3 et v3 Conversational) ne peuvent pas modifier leur vitesse eux-mêmes, c'est donc Caiioo qui applique votre vitesse pendant la lecture, tout en conservant un ton naturel — le compromis est que lorsque le curseur s'écarte de la normale, ils attendent l'intégralité du clip avant de commencer à parler. À vitesse normale, ils démarrent toujours immédiatement.
Caiioo peut choisir une voix adaptée au moment : lorsque la lecture d'un contenu à voix haute fait partie d'une tâche, l'IA peut choisir une voix, un débit et un modèle vocal adaptés au contenu — une voix différente pour une histoire du soir par rapport à un bulletin d'information —, au lieu d'utiliser systématiquement votre paramètre vocal global. Vos propres paramètres restent la valeur par défaut pour tout le reste.
Pour l'activer :
- Allez dans Settings > AI Setup > Voice
- Choisissez une option de synthèse vocale (Text-to-Speech)
- Activez l'option « Auto-read responses » si vous souhaitez que l'IA lise automatiquement
- Ajustez la vitesse de lecture si vous le souhaitez
Si la lecture échoue : Les erreurs vocales s'affichent désormais sous forme de notification (toast) au lieu d'échouer silencieusement — ainsi, une clé API manquante ou invalide, ou une voix incompatible avec le modèle sélectionné (fréquent avec Resemble.ai et Cartesia), vous indique exactement quoi corriger.
Local vs Cloud : Les voix du navigateur et Kokoro ne envoient jamais rien de votre appareil. Gemini, OpenAI, ElevenLabs, Cartesia et Resemble.ai envoient du texte à leurs serveurs (en utilisant vos clés API) pour générer l'audio. Consultez la section Privacy & Data pour plus de détails.
Les coûts vocaux (TTS + STT) sont regroupés sous voice_cost dans la conversation, conformément au parcours à usage unique (one-shot).
Entrée vocale (Saisie vocale)
Dictez vos messages au lieu de les taper. Cliquez sur l'icône microphone dans l'éditeur pour démarrer l'enregistrement. Caiioo transcrit vos paroles et les insère dans le champ de message.
Choisissez le mode de transcription :
| Option | Type | Confidentialité | Configuration |
|---|---|---|---|
| Whisper (Navigateur) | Local | Totalement privé | GRATIS, s'exécute sur votre appareil |
| WhisperKit (iOS) | Local | Totalement privé | GRATIS, sur l'appareil |
| whisper.cpp & Moonshine (Android) | Local | Totalement privé | GRATIS, sur l'appareil |
| Browser Speech | Local | Privé | GRATIS, intégré |
| ElevenLabs Scribe | Cloud | Précis (idéal hors anglais) | Ajoutez votre clé API ElevenLabs |
| Cartesia Ink | Cloud | Précis, faible latence | Ajoutez votre clé API Cartesia |
Les options locales gardent votre audio en local — rien n'est envoyé à un serveur. ElevenLabs et Cartesia envoient l'audio à leurs serveurs pour la transcription (via votre clé API) et offrent une meilleure précision, surtout pour les langues autres que l'anglais.
Pour l'utiliser :
- Cliquez sur l'icône micro dans l'éditeur
- Dites votre message
- Arrêtez quand vous avez fini
- La transcription apparaît dans le champ de message
- Modifiez si besoin, puis envoyez
Première configuration : La première fois que vous utilisez un modèle vocal sur l'appareil, il doit être téléchargé. L'éditeur affiche la progression ("Téléchargement du modèle vocal… N%", puis "Préparation"/"Chargement"), une brève pause lors du premier clic est donc normale.
Enregistrer de l'audio et l'attacher
Outre la dictée, vous pouvez enregistrer un clip et l'attacher à votre message : ouvrez le menu + de la zone de saisie et choisissez Enregistrer l'audio. Disponible sur iPhone, iPad, macOS et l'extension de navigateur. S'associe naturellement aux applications qui écoutent vos enregistrements, comme le coach de prononciation "pour les langues".
Laisser le modèle écouter votre enregistrement
Deux fonctionnalités vont au-delà de la transcription et permettent à un modèle capable d'entendre de travailler avec l'audio réel :
- Inclure l'audio pour le modèle (Paramètres > Configuration de l'IA > Voix) : joint votre enregistrement afin qu'un modèle capable de traiter l'audio (par exemple Gemini) examine l'audio réel en même temps que votre invite — ton, prononciation, bruits de fond, et pas seulement les mots. Désactivé par défaut ; rien n'est envoyé autrement. Un bouton de forme d'onde à côté du micro l'active pour chaque message, mais le bouton n'apparaît que dans les modes et applications qui l'autorisent (comme « pour les langues »), de sorte qu'il n'encombre pas le compositeur pour les tâches quotidiennes.
- Écoute (un outil gratuit, activé par défaut) : permet à l'assistant de revenir en arrière et de réécouter n'importe quelle pièce jointe audio avec une question de suivi ciblée — « quels mots ont été mal prononcés ? », « quel est le ton de la voix ? » — lors du tour où vous l'attachez ou de tout tour ultérieur. Le modèle d'assistance audio dédié effectue l'écoute, ce qui fonctionne même lorsque votre modèle de chat ne peut pas entendre.
Dictée à l'échelle du système (Bureau)
Dictez dans n'importe quelle application sur votre ordinateur — pas seulement Caiioo :
Les abonnés Pro disposent d'une fonction de dictée intégrée à l'échelle du système dans les applications de bureau macOS, Windows et Linux — aucune application compagnon à installer. Maintenez le raccourci de dictée n'importe où, parlez, et ce que vous dites est saisi dans l'application active.
Voir aussi
- Confidentialité et données — Comment les données vocales sont traitées
- Plateforme et configuration — Disponibilité de l'application de bureau
- Paramètres > Configuration de l'IA > Voix — Configurer les options vocales pour votre installation
This guide is maintained by the Caiioo team using Slate, our built-in editor.