Questa è una traduzione automatica del documento originale in inglese. In caso di discrepanze tra la presente traduzione e la versione originale in inglese, prevarrà la versione inglese. Leggi la versione originale in inglese


Voce: Parla e Ascolta

Vuoi che l'IA legga le risposte ad alta voce? O dettare messaggi invece di digitarli? Caiioo offre input e output vocale: tutto configurabile, in parte eseguito localmente sul tuo dispositivo.

Impostazioni vocali con opzioni di input e output, interruttore di lettura automatica e velocità di riproduzione

Voice Output (Text-to-Speech)

Fai leggere ad alta voce le risposte dall'IA. Scegli tra:

Opzione Tipo Qualità Configurazione
Predefinita del browser Locale Base Gratuita, nessuna configurazione
Kokoro Neural TTS Locale Alta Gratuita, eseguita sul tuo dispositivo
Google Gemini Cloud Naturale Aggiungi la tua API key
OpenAI (gpt-4o-mini-tts) Cloud Naturale, riproduzione orientabile Aggiungi la tua API key OpenAI
ElevenLabs Cloud Premium Aggiungi la tua API key
Cartesia (Sonic 3.5) Cloud Premium Aggiungi la tua API key
Resemble.ai Cloud Eccellente (clonazione vocale) Aggiungi la tua API key

Dimensioni di download di Kokoro: Il modello Kokoro è disponibile in due varianti e quella scaricata dipende dalla tua piattaforma. macOS e iOS caricano il modello quantizzato INT8 più piccolo (~88 MB), mentre l'estensione/browser utilizza la build WebGPU a precisione intera più grande (~330 MB). Si tratta di un download una tantum.

Note sulle piattaforme:

  • Kokoro nativo per iOS (v0.9.720+): Viene eseguito nel processo host di iOS tramite OnnxRuntime anziché in WebView, risolvendo i crash su iPhone 13/14.
  • Kokoro per macOS: Trasmette in streaming frase per frase (entro circa 1 secondo dalla pressione del tasto di riproduzione) tramite il processo helper desktop.
  • Gemini TTS (v0.9.723+): Riproduce frase per frase, quindi l'audio inizia dopo la prima frase anziché attendere la sintesi dell'intera risposta.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts con riproduzione orientabile — chiedi un accento, un tono o un ritmo in linguaggio naturale (ad es. "leggi questo con un caldo accento irlandese") e la voce seguirà l'indicazione. Utilizza la stessa API key di OpenAI del provider LLM OpenAI. Un campo Istruzioni sullo stile della voce in Impostazioni > Configurazione IA > Voce applica la tua direttiva di stile a ogni risposta parlata.
  • Cartesia (v0.9.723+): Una singola API key alimenta sia Sonic 3.5 (output) che Ink (input). Non c'è una voce predefinita: scegline una in Impostazioni > Configurazione IA > Voce prima di abilitarla.
  • ElevenLabs: Ogni voce di ElevenLabs inizia a parlare non appena ha qualcosa da dire, inclusa la versione espressiva v3, selezionabile nel selettore della voce. Il modello vocale predefinito è Flash v2.5: ElevenLabs lo valuta di qualità equivalente al precedente predefinito, con un costo dimezzato per carattere.
  • ElevenLabs v3 Conversational (v0.9.777+): Scegli il modello v3 Conversational nell'elenco dei modelli vocali per dialoghi espressivi e a bassa latenza in più di 70 lingue. Attualmente ElevenLabs lo fattura alla metà della tariffa standard per carattere, e le stime dei costi di Caiioo ne tengono conto.

Latenza: Gemini e OpenAI renderizzano l'intera risposta prima che inizi la riproduzione, quindi il primo audio può subire un ritardo di alcuni secondi in caso di risposte più lunghe: Impostazioni > Configurazione IA > Voce mostra una nota quando ne selezioni una. Per un parlato a bassa latenza, scegli ElevenLabs, Cartesia o Resemble.

Velocità di riproduzione: Il cursore della velocità (0,5×–2,0×) viene applicato dal provider per ElevenLabs (limitato a 0,7–1,2×) e Cartesia (limitato a 0,6–1,5×). Le voci del browser e Kokoro accelerano localmente. Gemini e OpenAI non dispongono di un controllo di velocità proprio, quindi il cursore viene nascosto quando sono selezionati; Resemble.ai applica la velocità sulla riproduzione standard (non in streaming). Un'eccezione: i modelli ElevenLabs v3 (v3 e v3 Conversational) non possono modificare la velocità autonomamente, quindi Caiioo applica la tua velocità durante la riproduzione, mantenendo l'intonazione naturale — il compromesso è che, con il cursore lontano dalla normalità, attendono l'intero clip prima di iniziare a parlare. A velocità normale partono comunque immediatamente.

Caiioo può scegliere una voce adatta al momento: quando la lettura ad alta voce di qualcosa fa parte di un'attività, l'IA può scegliere una voce, una velocità di parlato e un modello vocale adatti al contenuto — una voce diversa per una favola della buonanotte rispetto a un notiziario — anziché utilizzare sempre la tua impostazione vocale globale. Le tue impostazioni rimangono quelle predefinite per tutto il resto.

Per abilitarlo:

  1. Vai su Impostazioni > Configurazione IA > Voce
  2. Scegli un'opzione di sintesi vocale (text-to-speech)
  3. Attiva "Leggi automaticamente le risposte" se vuoi che l'IA legga in automatico
  4. Regola la velocità di riproduzione se lo desideri

Se la riproduzione fallisce: Gli errori vocali ora vengono visualizzati come un avviso (toast) anziché fallire silenziosamente; pertanto, un'API key mancante o non valida, o una voce non compatibile con il modello selezionato (frequente con Resemble.ai e Cartesia), ti indicheranno esattamente cosa correggere.

Locale vs Cloud: Le voci del browser e Kokoro non inviano mai nulla al di fuori del tuo dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia e Resemble.ai inviano testo ai propri server (tramite le tue API key) per generare l'audio. Vedi Privacy e dati per i dettagli.

I costi della voce (TTS + STT) si sommano come voice_cost sulla conversazione, rispecchiando il percorso one-shot.

Input Vocale (Speech-to-Text)

Ditta i tuoi messaggi invece di digitarli. Clicca sull'icona del microfono nel composer per avviare la registrazione. Caiioo trascrive ciò che dici e lo inserisce nel campo del messaggio.

Scegli come trascrivere:

Opzione Tipo Privacy Configurazione
Whisper (Browser) Locale Completamente privata GRATIS, gira sul tuo dispositivo
WhisperKit (iOS) Locale Completamente privata GRATIS, sul dispositivo
whisper.cpp & Moonshine (Android) Locale Completamente privata GRATIS, sul dispositivo
Browser Speech Locale Privata GRATIS, integrato
ElevenLabs Scribe Cloud Accurata (ottima per lingue non inglesi) Aggiungi la tua chiave API ElevenLabs
Cartesia Ink Cloud Accurata, bassa latenza Aggiungi la tua chiave API Cartesia

Le opzioni locali (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) mantengono l'audio in locale — nulla viene inviato ai server. ElevenLabs e Cartesia inviano l'audio ai loro server per la trascrizione (usando la tua chiave API) e offrono una precisione maggiore, specialmente per l'italiano e altre lingue.

Per usarlo:

  1. Clicca sull'icona del microfono nel composer
  2. Pronuncia il tuo messaggio
  3. Ferma quando hai finito
  4. La trascrizione appare nel campo del messaggio
  5. Modifica se necessario, poi invia

Prima configurazione: La prima volta che usi un modello vocale sul dispositivo, questo deve essere scaricato e preparato. Il composer mostrerà l'avanzamento ("Download modello vocale… N%", poi "Preparazione"/"Caricamento"), quindi una breve pausa al primo tocco del microfono è normale.

Registra audio e allegalo

Oltre alla dettatura, puoi registrare una clip e allegarla al tuo messaggio: apri il menu + del compositore e scegli Registra audio. Disponibile su iPhone, iPad, macOS e sull'estensione per browser. Si abbina perfettamente alle app che ascoltano le tue registrazioni, come il coach di pronuncia "per le lingue".

Lascia che il modello ascolti la tua registrazione

Due funzioni vanno oltre la trascrizione e consentono a un modello in grado di ascoltare di lavorare con l'audio effettivo:

  • Includi l'audio per il modello (Impostazioni > Configurazione IA > Voce): allega la tua registrazione in modo che un modello in grado di elaborare l'audio (ad es. Gemini) esamini l'audio reale insieme al tuo prompt (tono, pronuncia, suoni di sottofondo, non solo le parole). Disattivato per impostazione predefinita; altrimenti nulla viene inviato. Un pulsante a forma di forma d'onda accanto al microfono lo attiva per ciascun messaggio, ma il pulsante appare solo nelle modalità e nelle app che lo supportano (come "per le lingue"), in modo da non affollare il compositore per le attività quotidiane.
  • Ascolto (uno strumento gratuito, attivo per impostazione predefinita): consente all'assistente di tornare indietro e riascoltare qualsiasi allegato audio con una domanda di follow-up mirata ("quali parole sono state pronunciate male?", "qual è il tono di voce?") nel turno in cui lo alleghi o in uno qualsiasi successivo. Il modello di supporto audio dedicato si occupa dell'ascolto, quindi questo funziona anche quando il tuo modello di chat non è in grado di ascoltare.

Detttatura a Livello di Sistema (Desktop)

Dettare in qualsiasi applicazione sul tuo computer — non solo in Caiioo:

Gli abbonati Pro hanno la dettatura a livello di sistema integrata nelle app desktop per macOS, Windows e Linux — nessuna app companion da installare. Tieni premuta la scorciatoia di dettatura ovunque, parla e ciò che dici viene digitato nell'applicazione attualmente attiva.

Vedi anche

  • Privacy e dati — Come vengono gestiti i dati vocali
  • Piattaforma e configurazione — Disponibilità dell'app desktop
  • Impostazioni > Configurazione IA > Voce — Configura le opzioni vocali per la tua configurazione

This guide is maintained by the Caiioo team using Slate, our built-in editor.