Esta é uma tradução automática do documento original em inglês. Em caso de conflito entre esta tradução e a versão original em inglês, a versão em inglês prevalecerá. Ler a versão original em inglês
Voz: Fale e Ouça
Quer que a IA leia as respostas em voz alta? Ou ditar mensagens em vez de digitar? O Caiioo oferece entrada e saída de voz — tudo configurável, com algumas opções rodando localmente no seu dispositivo.

Voice Output (Text-to-Speech)
Faça com que a IA leia suas respostas em voz alta. Escolha entre:
| Opção | Tipo | Qualidade | Configuração |
|---|---|---|---|
| Browser Default | Local | Básica | Gratuito, sem configuração |
| Kokoro Neural TTS | Local | Alta | Gratuito, roda no seu dispositivo |
| Google Gemini | Nuvem | Natural | Adicione sua API key |
| OpenAI (gpt-4o-mini-tts) | Nuvem | Natural, entrega controlável | Adicione sua API key da OpenAI |
| ElevenLabs | Nuvem | Premium | Adicione sua API key |
| Cartesia (Sonic 3.5) | Nuvem | Premium | Adicione sua API key |
| Resemble.ai | Nuvem | Excelente (clonagem de voz) | Adicione sua API key |
Tamanho do download do Kokoro: O modelo Kokoro é fornecido em duas variantes, e qual delas é baixada depende da sua plataforma. macOS e iOS carregam o modelo menor quantizado em INT8 (~88 MB), enquanto a extensão/navegador usa a versão WebGPU de precisão total maior (~330 MB). É um download único.
Notas sobre a plataforma:
- Kokoro nativo para iOS (v0.9.720+): Roda no processo host do iOS via OnnxRuntime em vez do WebView, corrigindo falhas no iPhone 13/14.
- Kokoro para macOS: Transmite frase por frase (dentro de ~1s após pressionar play) através do processo auxiliar de desktop.
- Gemini TTS (v0.9.723+): Reproduz frase por frase, para que o áudio comece após a primeira frase em vez de esperar a resposta inteira ser sintetizada.
- OpenAI (v0.9.724+): gpt-4o-mini-tts com entrega controlável — peça um sotaque, tom ou ritmo em linguagem natural (ex: "leia isto com um sotaque irlandês caloroso") e a voz seguirá. Usa a mesma API key da OpenAI que o provedor LLM da OpenAI. Um campo Voice style instructions em Settings > Voice aplica sua diretriz de estilo a cada resposta falada.
- Cartesia (v0.9.723+): Uma única API key alimenta tanto o Sonic 3.5 (saída) quanto o Ink (entrada). Não há voz padrão — escolha uma em Settings > Voice antes de ativá-la.
Latência: Gemini e OpenAI renderizam a resposta completa antes que a reprodução comece, portanto, o primeiro áudio pode atrasar alguns segundos em respostas mais longas — Settings > Voice exibe uma nota quando você seleciona um deles. Para fala de baixa latência, escolha ElevenLabs, Cartesia ou Resemble.
Velocidade de reprodução: O controle deslizante de velocidade (0.5×–2.0×) é aplicado pelo provedor para ElevenLabs (limitado a 0.7–1.2×) e Cartesia (limitado a 0.6–1.5×). As vozes do navegador e o Kokoro aceleram localmente. Gemini e OpenAI não possuem controle de velocidade próprio, portanto o controle deslizante fica oculto enquanto estão selecionados; Resemble.ai aplica a velocidade na reprodução padrão (não em streaming).
Para ativar:
- Vá em Settings > Voice
- Escolha uma opção de texto para fala
- Ative "Auto-read responses" se quiser que a IA leia automaticamente
- Ajuste a velocidade de reprodução, se desejar
Se a reprodução falhar: Erros de voz agora aparecem como uma notificação toast em vez de falharem silenciosamente — assim, uma API key ausente ou inválida, ou uma voz que não seja compatível com o modelo selecionado (comum no Resemble.ai e Cartesia), diz exatamente o que corrigir.
Local vs Nuvem: As vozes do navegador e o Kokoro nunca enviam nada para fora do seu dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia e Resemble.ai enviam texto para seus servidores (usando suas API keys) para gerar o áudio. Consulte Privacy & Data para obter detalhes.
Custos de voz (TTS + STT) são acumulados como voice_cost na conversa, correspondendo ao caminho de disparo único.
Entrada de Voz (Fala para Texto)
Dite suas mensagens em vez de digitar. Clique no ícone do microfone no compositor para começar a gravar. O Caiioo transcreve o que você diz e coloca no campo de mensagem.
Escolha como transcrever:
| Opção | Tipo | Privacidade | Configuração |
|---|---|---|---|
| Whisper (Navegador) | Local | Totalmente privada | GRATIS, roda no seu dispositivo |
| WhisperKit (iOS) | Local | Totalmente privada | GRATIS, no dispositivo |
| whisper.cpp & Moonshine (Android) | Local | Totalmente privada | GRATIS, no dispositivo |
| Browser Speech | Local | Privada | GRATIS, integrado |
| ElevenLabs Scribe | Nuvem | Precisa (ótima para não-inglês) | Adicione sua chave API ElevenLabs |
| Cartesia Ink | Nuvem | Precisa, baixa latência | Adicione sua chave API Cartesia |
As opções locais (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) mantêm seu áudio local — nada é enviado para nenhum servidor. ElevenLabs e Cartesia enviam áudio para seus servidores para transcrição (usando sua chave API) e oferecem maior precisão, especialmente para idiomas que não o inglês.
Para usar:
- Clique no ícone do microfone no compositor
- Fale sua mensagem
- Pare quando terminar
- A transcrição aparece no campo de mensagem
- Edite se necessário e envie
Configuração inicial: A primeira vez que você usa um modelo de fala no dispositivo, ele precisa baixar e carregar. O compositor mostra o progresso ("Baixando modelo de fala… N%", depois "Preparando"/"Carregando"), então uma breve pausa no seu primeiro toque no microfone é esperada, não um travamento.
Gravar Áudio e Anexá-lo
Além da ditação, pode gravar um clipe e anexá-lo à sua mensagem: abra o menu + do compositor e escolha Gravar áudio. Disponível no iPhone, iPad, macOS e na extensão de navegador. Combina naturalmente com aplicações que ouvem as suas gravações, como o treinador de pronúncia "para Idiomas".
Deixe o Modelo Ouvir a Sua Gravação
Duas funcionalidades vão além da transcrição e permitem que um modelo capaz de ouvir trabalhe com o áudio real:
- Incluir áudio para o modelo (Definições > Voz): anexa a sua gravação para que um modelo com capacidade de áudio (por exemplo, o Gemini) reveja o áudio real juntamente com o seu prompt — tom, pronúncia, sons de fundo, e não apenas as palavras. Desativado por predefinição; nada é enviado de outra forma. Um botão de forma de onda ao lado do microfone alterna-o por mensagem, mas o botão só aparece nos modos e aplicações que o ativam (como "para Idiomas"), para que não sobrecarregue o compositor para tarefas diárias.
- Audição (uma ferramenta gratuita, ativada por predefinição): permite que o assistente volte atrás e volte a ouvir qualquer anexo de áudio com uma pergunta de acompanhamento direcionada — "quais palavras foram mal pronunciadas?", "qual é o tom de voz?" — na vez em que o anexa ou em qualquer outra posterior. O modelo auxiliar de áudio dedicado faz a escuta, pelo que isto funciona mesmo quando o seu modelo de chat não consegue ouvir.
Ditado em Todo o Sistema (macOS)
Assinantes Pro no macOS também podem instalar o PrivateVoice, um app complementar separado que adiciona uma tecla de atalho global para ditar em qualquer aplicativo — não apenas no Caiioo. Consulte a página de download para desktop para detalhes.
Veja Também
- Privacidade e Dados — Como os dados de voz são tratados
- Plataforma e Configuração — Disponibilidade do app de desktop e PrivateVoice
- Configurações > Voz — Configure as opções de voz para sua instalação
This guide is maintained by the Caiioo team using Slate, our built-in editor.