Esta é uma tradução automática do documento original em inglês. Em caso de conflito entre esta tradução e a versão original em inglês, a versão em inglês prevalecerá. Ler a versão original em inglês
Voz: Fale e Ouça
Quer que a IA leia as respostas em voz alta? Ou ditar mensagens em vez de digitar? O Caiioo oferece entrada e saída de voz — tudo configurável, com algumas opções rodando localmente no seu dispositivo.

Voice Output (Text-to-Speech)
Faça a IA ler suas respostas em voz alta. Escolha entre:
| Opção | Tipo | Qualidade | Configuração |
|---|---|---|---|
| Browser Default | Local | Básica | Gratuito, sem configuração |
| Kokoro Neural TTS | Local | Alta | Gratuito, roda no seu dispositivo |
| Google Gemini | Cloud | Natural | Adicione sua API key |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natural, entrega controlável | Adicione sua OpenAI API key |
| ElevenLabs | Cloud | Premium | Adicione sua API key |
| Cartesia (Sonic 3.5) | Cloud | Premium | Adicione sua API key |
| Resemble.ai | Cloud | Excelente (clonagem de voz) | Adicione sua API key |
Tamanho do download do Kokoro: O modelo Kokoro é fornecido em duas variantes, e qual delas é baixada depende da sua plataforma. macOS e iOS carregam o modelo menor quantizado em INT8 (~88 MB), enquanto a extensão/navegador usa a compilação WebGPU de precisão total maior (~330 MB). É um download único.
Notas sobre plataformas:
- Kokoro nativo para iOS (v0.9.720+): Roda no processo host do iOS via OnnxRuntime em vez do WebView, corrigindo falhas no iPhone 13/14.
- Kokoro para macOS: Transmite frase por frase (em até ~1s após pressionar play) através do processo auxiliar de desktop.
- Gemini TTS (v0.9.723+): Reproduz frase por frase, para que o áudio comece após a primeira frase em vez de esperar a resposta inteira ser sintetizada.
- OpenAI (v0.9.724+): gpt-4o-mini-tts com entrega controlável — peça um sotaque, tom ou ritmo em linguagem natural (ex: "leia isto com um sotaque irlandês caloroso") e a voz seguirá. Usa a mesma OpenAI API key do provedor LLM da OpenAI. Um campo Voice style instructions em Settings > AI Setup > Voice aplica sua diretriz de estilo a todas as respostas faladas.
- Cartesia (v0.9.723+): Uma única API key alimenta tanto o Sonic 3.5 (saída) quanto o Ink (entrada). Não há voz padrão — escolha uma em Settings > AI Setup > Voice antes de ativá-la.
- ElevenLabs: Cada voz do ElevenLabs começa a falar assim que tem algo a dizer — incluindo a expressiva v3, que pode ser selecionada no seletor de voz. O modelo de voz padrão é o Flash v2.5: o ElevenLabs o classifica com qualidade equivalente à do padrão anterior, custando metade por caractere.
- ElevenLabs v3 Conversational (v0.9.777+): Escolha o modelo v3 Conversational na lista de modelos de voz para diálogos expressivos e de baixa latência em mais de 70 idiomas. Atualmente, o ElevenLabs cobra metade da taxa padrão por caractere, e as estimativas de custo do Caiioo refletem isso.
Latência: Gemini e OpenAI renderizam a resposta completa antes que a reprodução comece, portanto, o primeiro áudio pode atrasar alguns segundos em respostas mais longas — Settings > AI Setup > Voice exibe uma nota quando você seleciona um deles. Para fala de baixa latência, escolha ElevenLabs, Cartesia ou Resemble.
Velocidade de reprodução: O controle deslizante de velocidade (0.5×–2.0×) é aplicado pelo provedor para ElevenLabs (limitado a 0.7–1.2×) e Cartesia (limitado a 0.6–1.5×). As vozes do navegador e o Kokoro aceleram localmente. Gemini e OpenAI não possuem controle de velocidade próprio, portanto o controle deslizante fica oculto enquanto estão selecionados; Resemble.ai aplica a velocidade na reprodução padrão (não em streaming). Uma exceção: os modelos ElevenLabs v3 (v3 e v3 Conversational) não conseguem alterar a velocidade por si mesmos, então o Caiioo aplica a sua velocidade durante a reprodução, mantendo o tom natural — a compensação é que, com o controle deslizante diferente do normal, eles aguardam o clipe inteiro antes de começar a falar. Na velocidade normal, eles ainda começam imediatamente.
O Caiioo pode escolher uma voz adequada ao momento: quando ler algo em alta voz faz parte de uma tarefa, a IA pode escolher uma voz, uma taxa de fala e um modelo de fala que se ajustem ao conteúdo — uma voz diferente para uma história de ninar em comparação com um resumo de notícias —, em vez de usar sempre a sua configuração de voz global. Suas próprias configurações continuam sendo o padrão para todo o resto.
Para ativar:
- Vá para Settings > AI Setup > Voice
- Escolha uma opção de text-to-speech
- Ative "Auto-read responses" se quiser que a IA leia automaticamente
- Ajuste a velocidade de reprodução, se desejar
Se a reprodução falhar: Erros de voz agora aparecem como um toast em vez de falharem silenciosamente — portanto, uma API key ausente ou inválida, ou uma voz que não seja compatível com o modelo selecionado (comum no Resemble.ai e Cartesia), diz exatamente o que corrigir.
Local vs Cloud: As vozes do navegador e o Kokoro nunca enviam nada para fora do seu dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia e Resemble.ai enviam texto para seus servidores (usando suas API keys) para gerar o áudio. Consulte Privacy & Data para obter detalhes.
Custos de voz (TTS + STT) são contabilizados como voice_cost na conversa, correspondendo ao caminho de uso único.
Entrada de Voz (Fala para Texto)
Dite suas mensagens em vez de digitar. Clique no ícone do microfone no compositor para começar a gravar. O Caiioo transcreve o que você diz e coloca no campo de mensagem.
Escolha como transcrever:
| Opção | Tipo | Privacidade | Configuração |
|---|---|---|---|
| Whisper (Navegador) | Local | Totalmente privada | GRATIS, roda no seu dispositivo |
| WhisperKit (iOS) | Local | Totalmente privada | GRATIS, no dispositivo |
| whisper.cpp & Moonshine (Android) | Local | Totalmente privada | GRATIS, no dispositivo |
| Browser Speech | Local | Privada | GRATIS, integrado |
| ElevenLabs Scribe | Nuvem | Precisa (ótima para não-inglês) | Adicione sua chave API ElevenLabs |
| Cartesia Ink | Nuvem | Precisa, baixa latência | Adicione sua chave API Cartesia |
As opções locais (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) mantêm seu áudio local — nada é enviado para nenhum servidor. ElevenLabs e Cartesia enviam áudio para seus servidores para transcrição (usando sua chave API) e oferecem maior precisão, especialmente para idiomas que não o inglês.
Para usar:
- Clique no ícone do microfone no compositor
- Fale sua mensagem
- Pare quando terminar
- A transcrição aparece no campo de mensagem
- Edite se necessário e envie
Configuração inicial: A primeira vez que você usa um modelo de fala no dispositivo, ele precisa baixar e carregar. O compositor mostra o progresso ("Baixando modelo de fala… N%", depois "Preparando"/"Carregando"), então uma breve pausa no seu primeiro toque no microfone é esperada, não um travamento.
Gravar Áudio e Anexá-lo
Além da ditação, pode gravar um clipe e anexá-lo à sua mensagem: abra o menu + do compositor e escolha Gravar áudio. Disponível no iPhone, iPad, macOS e na extensão de navegador. Combina naturalmente com aplicações que ouvem as suas gravações, como o treinador de pronúncia "para Idiomas".
Deixe o Modelo Ouvir Sua Gravação
Dois recursos vão além da transcrição e permitem que um modelo capaz de ouvir trabalhe com o áudio real:
- Incluir áudio para o modelo (Configurações > Configuração de IA > Voz): anexa sua gravação para que um modelo compatível com áudio (por exemplo, Gemini) analise o áudio real junto com seu prompt — tom, pronúncia, sons de fundo, não apenas as palavras. Desativado por padrão; nada é enviado caso contrário. Um botão de forma de onda ao lado do microfone alterna isso por mensagem, mas o botão aparece apenas nos modos e aplicativos que optam por ele (como "para Idiomas"), para não poluir o compositor para tarefas cotidianas.
- Audição (uma ferramenta gratuita, ativada por padrão): permite que o assistente volte e ouça novamente qualquer anexo de áudio com uma pergunta de acompanhamento direcionada — "quais palavras foram mal pronunciadas?", "qual é o tom de voz?" — na rodada em que você o anexou ou em qualquer outra posterior. O modelo auxiliar de áudio dedicado faz a escuta, então isso funciona mesmo quando seu modelo de chat não pode ouvir.
Ditado em Todo o Sistema (Desktop)
Ditado em qualquer aplicativo do seu computador — não apenas no Caiioo:
Assinantes Pro possuem ditado em todo o sistema integrado aos aplicativos de desktop para macOS, Windows e Linux — sem necessidade de instalar aplicativo complementar. Mantenha pressionada a tecla de Atalho de ditado em qualquer lugar, fale e o que você disser será digitado no aplicativo que estiver em foco.
Veja Também
- Privacidade e Dados — Como os dados de voz são tratados
- Plataforma e Configuração — Disponibilidade do aplicativo de desktop
- Configurações > Configuração de IA > Voz — Configure opções de voz para sua configuração
This guide is maintained by the Caiioo team using Slate, our built-in editor.