Questa è una traduzione automatica del documento originale in inglese. In caso di discrepanze tra la presente traduzione e la versione originale in inglese, prevarrà la versione inglese. Leggi la versione originale in inglese


Voce: Parla e Ascolta

Vuoi che l'IA legga le risposte ad alta voce? O dettare messaggi invece di digitarli? Caiioo offre input e output vocale: tutto configurabile, in parte eseguito localmente sul tuo dispositivo.

Impostazioni vocali con opzioni di input e output, interruttore di lettura automatica e velocità di riproduzione

Voice Output (Text-to-Speech)

Fai leggere ad alta voce le risposte dell'AI. Scegli tra:

Opzione Tipo Qualità Configurazione
Browser Default Locale Base Gratuito, nessuna configurazione
Kokoro Neural TTS Locale Alta Gratuito, eseguito sul tuo dispositivo
Google Gemini Cloud Naturale Aggiungi la tua API key
OpenAI (gpt-4o-mini-tts) Cloud Naturale, erogazione pilotabile Aggiungi la tua API key di OpenAI
ElevenLabs Cloud Premium Aggiungi la tua API key
Cartesia (Sonic 3.5) Cloud Premium Aggiungi la tua API key
Resemble.ai Cloud Eccellente (clonazione vocale) Aggiungi la tua API key

Dimensioni del download di Kokoro: Il modello Kokoro è disponibile in due varianti e quella scaricata dipende dalla tua piattaforma. macOS e iOS caricano il modello quantizzato INT8 più piccolo (~88 MB), mentre l'estensione/browser utilizza la build WebGPU a precisione intera più grande (~330 MB). Si tratta di un download una tantum.

Note sulle piattaforme:

  • Kokoro nativo per iOS (v0.9.720+): viene eseguito nel processo host iOS tramite OnnxRuntime anziché WebView, risolvendo i crash di iPhone 13/14.
  • Kokoro per macOS: trasmette in streaming frase per frase (entro circa 1 secondo dalla pressione del tasto riproduci) tramite il processo di supporto desktop.
  • Gemini TTS (v0.9.723+): riproduce frase per frase, quindi l'audio inizia dopo la prima frase anziché attendere la sintesi dell'intera risposta.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts con erogazione pilotabile: chiedi un accento, un tono o un ritmo in linguaggio naturale (ad es. "leggi questo con un caldo accento irlandese") e la voce lo seguirà. Utilizza la stessa API key di OpenAI del provider OpenAI LLM. Un campo Voice style instructions in Settings > Voice applica la tua direttiva di stile a ogni risposta parlata.
  • Cartesia (v0.9.723+): una singola API key alimenta sia Sonic 3.5 (output) che Ink (input). Non esiste una voce predefinita: scegline una in Settings > Voice prima di abilitarla.

Latenza: Gemini e OpenAI eseguono il rendering dell'intera risposta prima dell'inizio della riproduzione, quindi il primo audio potrebbe subire un ritardo di qualche secondo sulle risposte più lunghe; Settings > Voice mostra una nota quando ne selezioni uno. Per una voce a bassa latenza, scegli ElevenLabs, Cartesia o Resemble.

Velocità di riproduzione: Il cursore della velocità (0,5×–2,0×) viene applicato dal provider per ElevenLabs (limitato a 0,7–1,2×) e Cartesia (limitato a 0,6–1,5×). Le voci del browser e Kokoro accelerano localmente. Gemini e OpenAI non dispongono di un controllo della velocità proprio, quindi il cursore viene nascosto quando sono selezionati; Resemble.ai applica la velocità sulla riproduzione standard (non in streaming).

Per abilitarlo:

  1. Vai su Settings > Voice
  2. Scegli un'opzione di text-to-speech
  3. Attiva "Auto-read responses" se desideri che l'AI legga automaticamente
  4. Regola la velocità di riproduzione se lo desideri

Se la riproduzione fallisce: Gli errori vocali ora compaiono come un avviso (toast) anziché fallire silenziosamente, quindi un'API key mancante o non valida, o una voce non compatibile con il modello selezionato (comune con Resemble.ai e Cartesia), ti indica esattamente cosa correggere.

Locale vs Cloud: Le voci del browser e Kokoro non inviano mai nulla al di fuori del tuo dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia e Resemble.ai inviano il testo ai propri server (utilizzando le tue API key) per generare l'audio. Vedi Privacy & Data per i dettagli.

Costi della voce (TTS + STT) si sommano come voice_cost nella conversazione, corrispondendo al percorso una tantum.

Input Vocale (Speech-to-Text)

Ditta i tuoi messaggi invece di digitarli. Clicca sull'icona del microfono nel composer per avviare la registrazione. Caiioo trascrive ciò che dici e lo inserisce nel campo del messaggio.

Scegli come trascrivere:

Opzione Tipo Privacy Configurazione
Whisper (Browser) Locale Completamente privata GRATIS, gira sul tuo dispositivo
WhisperKit (iOS) Locale Completamente privata GRATIS, sul dispositivo
whisper.cpp & Moonshine (Android) Locale Completamente privata GRATIS, sul dispositivo
Browser Speech Locale Privata GRATIS, integrato
ElevenLabs Scribe Cloud Accurata (ottima per lingue non inglesi) Aggiungi la tua chiave API ElevenLabs
Cartesia Ink Cloud Accurata, bassa latenza Aggiungi la tua chiave API Cartesia

Le opzioni locali (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) mantengono l'audio in locale — nulla viene inviato ai server. ElevenLabs e Cartesia inviano l'audio ai loro server per la trascrizione (usando la tua chiave API) e offrono una precisione maggiore, specialmente per l'italiano e altre lingue.

Per usarlo:

  1. Clicca sull'icona del microfono nel composer
  2. Pronuncia il tuo messaggio
  3. Ferma quando hai finito
  4. La trascrizione appare nel campo del messaggio
  5. Modifica se necessario, poi invia

Prima configurazione: La prima volta che usi un modello vocale sul dispositivo, questo deve essere scaricato e preparato. Il composer mostrerà l'avanzamento ("Download modello vocale… N%", poi "Preparazione"/"Caricamento"), quindi una breve pausa al primo tocco del microfono è normale.

Registra audio e allegalo

Oltre alla dettatura, puoi registrare una clip e allegarla al tuo messaggio: apri il menu + del compositore e scegli Registra audio. Disponibile su iPhone, iPad, macOS e sull'estensione per browser. Si abbina perfettamente alle app che ascoltano le tue registrazioni, come il coach di pronuncia "per le lingue".

Lascia che il modello ascolti la tua registrazione

Due funzionalità vanno oltre la trascrizione e consentono a un modello in grado di ascoltare di lavorare con l'audio effettivo:

  • Includi l'audio per il modello (Impostazioni > Voce): allega la tua registrazione in modo che un modello in grado di elaborare l'audio (ad es. Gemini) esamini l'audio reale insieme al tuo prompt (tono, pronuncia, suoni di fondo, non solo le parole). Disattivato per impostazione predefinita; altrimenti non viene inviato nulla. Un pulsante a forma di forma d'onda accanto al microfono lo attiva o disattiva per ogni messaggio, ma il pulsante appare solo nelle modalità e nelle app che lo supportano (come "per le lingue"), in modo da non ingombrare il compositore per le attività quotidiane.
  • Ascolto (uno strumento gratuito, attivo per impostazione predefinita): consente all'assistente di tornare indietro e riascoltare qualsiasi allegato audio con una domanda di follow-up mirata ("quali parole sono state pronunciate male?", "qual è il tono di voce?") nel turno in cui lo alleghi o in uno successivo. Il modello di supporto audio dedicato si occupa dell'ascolto, quindi questa funzione funziona anche quando il tuo modello di chat non è in grado di ascoltare l'audio.

Dettatura di Sistema (macOS)

Gli abbonati Pro su macOS possono anche installare PrivateVoice, un'app complementare separata che aggiunge una scorciatoia globale "premi per parlare" per dettare in qualsiasi applicazione, non solo in Caiioo. Consulta la pagina di download desktop per i dettagli.

Vedi Anche

  • Privacy e Dati — Come vengono gestiti i dati vocali
  • Piattaforma e Configurazione — Disponibilità dell'app desktop e di PrivateVoice
  • Impostazioni > Voce — Configura le opzioni vocali per la tua configurazione

This guide is maintained by the Caiioo team using Slate, our built-in editor.