Questa è una traduzione automatica del documento originale in inglese. In caso di discrepanze tra la presente traduzione e la versione originale in inglese, prevarrà la versione inglese. Leggi la versione originale in inglese
Voce: Parla e Ascolta
Vuoi che l'IA legga le risposte ad alta voce? O dettare messaggi invece di digitarli? Caiioo offre input e output vocale: tutto configurabile, in parte eseguito localmente sul tuo dispositivo.

Voice Output (Text-to-Speech)
Fai leggere ad alta voce le risposte dell'AI. Scegli tra:
| Opzione | Tipo | Qualità | Configurazione |
|---|---|---|---|
| Browser Default | Locale | Base | Gratuito, nessuna configurazione |
| Kokoro Neural TTS | Locale | Alta | Gratuito, eseguito sul tuo dispositivo |
| Google Gemini | Cloud | Naturale | Aggiungi la tua API key |
| OpenAI (gpt-4o-mini-tts) | Cloud | Naturale, erogazione pilotabile | Aggiungi la tua API key di OpenAI |
| ElevenLabs | Cloud | Premium | Aggiungi la tua API key |
| Cartesia (Sonic 3.5) | Cloud | Premium | Aggiungi la tua API key |
| Resemble.ai | Cloud | Eccellente (clonazione vocale) | Aggiungi la tua API key |
Dimensioni del download di Kokoro: Il modello Kokoro è disponibile in due varianti e quella scaricata dipende dalla tua piattaforma. macOS e iOS caricano il modello quantizzato INT8 più piccolo (~88 MB), mentre l'estensione/browser utilizza la build WebGPU a precisione intera più grande (~330 MB). Si tratta di un download una tantum.
Note sulle piattaforme:
- Kokoro nativo per iOS (v0.9.720+): viene eseguito nel processo host iOS tramite OnnxRuntime anziché WebView, risolvendo i crash di iPhone 13/14.
- Kokoro per macOS: trasmette in streaming frase per frase (entro circa 1 secondo dalla pressione del tasto riproduci) tramite il processo di supporto desktop.
- Gemini TTS (v0.9.723+): riproduce frase per frase, quindi l'audio inizia dopo la prima frase anziché attendere la sintesi dell'intera risposta.
- OpenAI (v0.9.724+): gpt-4o-mini-tts con erogazione pilotabile: chiedi un accento, un tono o un ritmo in linguaggio naturale (ad es. "leggi questo con un caldo accento irlandese") e la voce lo seguirà. Utilizza la stessa API key di OpenAI del provider OpenAI LLM. Un campo Voice style instructions in Settings > Voice applica la tua direttiva di stile a ogni risposta parlata.
- Cartesia (v0.9.723+): una singola API key alimenta sia Sonic 3.5 (output) che Ink (input). Non esiste una voce predefinita: scegline una in Settings > Voice prima di abilitarla.
Latenza: Gemini e OpenAI eseguono il rendering dell'intera risposta prima dell'inizio della riproduzione, quindi il primo audio potrebbe subire un ritardo di qualche secondo sulle risposte più lunghe; Settings > Voice mostra una nota quando ne selezioni uno. Per una voce a bassa latenza, scegli ElevenLabs, Cartesia o Resemble.
Velocità di riproduzione: Il cursore della velocità (0,5×–2,0×) viene applicato dal provider per ElevenLabs (limitato a 0,7–1,2×) e Cartesia (limitato a 0,6–1,5×). Le voci del browser e Kokoro accelerano localmente. Gemini e OpenAI non dispongono di un controllo della velocità proprio, quindi il cursore viene nascosto quando sono selezionati; Resemble.ai applica la velocità sulla riproduzione standard (non in streaming).
Per abilitarlo:
- Vai su Settings > Voice
- Scegli un'opzione di text-to-speech
- Attiva "Auto-read responses" se desideri che l'AI legga automaticamente
- Regola la velocità di riproduzione se lo desideri
Se la riproduzione fallisce: Gli errori vocali ora compaiono come un avviso (toast) anziché fallire silenziosamente, quindi un'API key mancante o non valida, o una voce non compatibile con il modello selezionato (comune con Resemble.ai e Cartesia), ti indica esattamente cosa correggere.
Locale vs Cloud: Le voci del browser e Kokoro non inviano mai nulla al di fuori del tuo dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia e Resemble.ai inviano il testo ai propri server (utilizzando le tue API key) per generare l'audio. Vedi Privacy & Data per i dettagli.
Costi della voce (TTS + STT) si sommano come voice_cost nella conversazione, corrispondendo al percorso una tantum.
Input Vocale (Speech-to-Text)
Ditta i tuoi messaggi invece di digitarli. Clicca sull'icona del microfono nel composer per avviare la registrazione. Caiioo trascrive ciò che dici e lo inserisce nel campo del messaggio.
Scegli come trascrivere:
| Opzione | Tipo | Privacy | Configurazione |
|---|---|---|---|
| Whisper (Browser) | Locale | Completamente privata | GRATIS, gira sul tuo dispositivo |
| WhisperKit (iOS) | Locale | Completamente privata | GRATIS, sul dispositivo |
| whisper.cpp & Moonshine (Android) | Locale | Completamente privata | GRATIS, sul dispositivo |
| Browser Speech | Locale | Privata | GRATIS, integrato |
| ElevenLabs Scribe | Cloud | Accurata (ottima per lingue non inglesi) | Aggiungi la tua chiave API ElevenLabs |
| Cartesia Ink | Cloud | Accurata, bassa latenza | Aggiungi la tua chiave API Cartesia |
Le opzioni locali (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) mantengono l'audio in locale — nulla viene inviato ai server. ElevenLabs e Cartesia inviano l'audio ai loro server per la trascrizione (usando la tua chiave API) e offrono una precisione maggiore, specialmente per l'italiano e altre lingue.
Per usarlo:
- Clicca sull'icona del microfono nel composer
- Pronuncia il tuo messaggio
- Ferma quando hai finito
- La trascrizione appare nel campo del messaggio
- Modifica se necessario, poi invia
Prima configurazione: La prima volta che usi un modello vocale sul dispositivo, questo deve essere scaricato e preparato. Il composer mostrerà l'avanzamento ("Download modello vocale… N%", poi "Preparazione"/"Caricamento"), quindi una breve pausa al primo tocco del microfono è normale.
Registra audio e allegalo
Oltre alla dettatura, puoi registrare una clip e allegarla al tuo messaggio: apri il menu + del compositore e scegli Registra audio. Disponibile su iPhone, iPad, macOS e sull'estensione per browser. Si abbina perfettamente alle app che ascoltano le tue registrazioni, come il coach di pronuncia "per le lingue".
Lascia che il modello ascolti la tua registrazione
Due funzionalità vanno oltre la trascrizione e consentono a un modello in grado di ascoltare di lavorare con l'audio effettivo:
- Includi l'audio per il modello (Impostazioni > Voce): allega la tua registrazione in modo che un modello in grado di elaborare l'audio (ad es. Gemini) esamini l'audio reale insieme al tuo prompt (tono, pronuncia, suoni di fondo, non solo le parole). Disattivato per impostazione predefinita; altrimenti non viene inviato nulla. Un pulsante a forma di forma d'onda accanto al microfono lo attiva o disattiva per ogni messaggio, ma il pulsante appare solo nelle modalità e nelle app che lo supportano (come "per le lingue"), in modo da non ingombrare il compositore per le attività quotidiane.
- Ascolto (uno strumento gratuito, attivo per impostazione predefinita): consente all'assistente di tornare indietro e riascoltare qualsiasi allegato audio con una domanda di follow-up mirata ("quali parole sono state pronunciate male?", "qual è il tono di voce?") nel turno in cui lo alleghi o in uno successivo. Il modello di supporto audio dedicato si occupa dell'ascolto, quindi questa funzione funziona anche quando il tuo modello di chat non è in grado di ascoltare l'audio.
Dettatura di Sistema (macOS)
Gli abbonati Pro su macOS possono anche installare PrivateVoice, un'app complementare separata che aggiunge una scorciatoia globale "premi per parlare" per dettare in qualsiasi applicazione, non solo in Caiioo. Consulta la pagina di download desktop per i dettagli.
Vedi Anche
- Privacy e Dati — Come vengono gestiti i dati vocali
- Piattaforma e Configurazione — Disponibilità dell'app desktop e di PrivateVoice
- Impostazioni > Voce — Configura le opzioni vocali per la tua configurazione
This guide is maintained by the Caiioo team using Slate, our built-in editor.