Esta es una traducción automática del documento original en inglés. En caso de cualquier discrepancia entre esta traducción y la versión original en inglés, prevalecerá la versión en inglés. Leer la versión original en inglés
Voz: Habla y escucha
¿Quieres que la IA lea las respuestas en voz alta? ¿O dictar mensajes en lugar de escribirlos? Caiioo ofrece entrada y salida de voz, todo configurable, y algunas opciones se ejecutan localmente en tu dispositivo.

Salida de voz (Texto a voz)
Haz que la IA lea sus respuestas en voz alta. Elige entre:
| Opción | Tipo | Calidad | Configuración |
|---|---|---|---|
| Predeterminado del navegador | Local | Básica | Gratis, sin configuración |
| Kokoro Neural TTS | Local | Alta | Gratis, se ejecuta en tu dispositivo |
| Google Gemini | Nube | Natural | Añade tu API key |
| OpenAI (gpt-4o-mini-tts) | Nube | Natural, locución controlable | Añade tu API key de OpenAI |
| ElevenLabs | Nube | Premium | Añade tu API key |
| Cartesia (Sonic 3.5) | Nube | Premium | Añade tu API key |
| Resemble.ai | Nube | Excelente (clonación de voz) | Añade tu API key |
Tamaño de descarga de Kokoro: El modelo Kokoro se distribuye en dos variantes, y cuál se descarga depende de tu plataforma. macOS e iOS cargan el modelo cuantizado INT8 más pequeño (~88 MB), mientras que la extensión/navegador utiliza la compilación WebGPU de precisión completa más grande (~330 MB). Es una descarga única.
Notas de la plataforma:
- Kokoro nativo para iOS (v0.9.720+): Se ejecuta en el proceso host de iOS mediante OnnxRuntime en lugar de WebView, lo que soluciona los bloqueos en iPhone 13/14.
- Kokoro para macOS: Transmite oración por oración (en un plazo de ~1 s tras pulsar reproducir) a través del proceso auxiliar de escritorio.
- Gemini TTS (v0.9.723+): Reproduce oración por oración, por lo que el audio comienza después de la primera oración en lugar de esperar a que se sintetice toda la respuesta.
- OpenAI (v0.9.724+): gpt-4o-mini-tts con locución controlable; solicita un acento, tono o ritmo en lenguaje natural (por ejemplo, "lee esto con un acento irlandés cálido") y la voz lo seguirá. Utiliza la misma API key de OpenAI que el proveedor LLM de OpenAI. Un campo de Instrucciones de estilo de voz en Ajustes > Voz aplica tu directiva de estilo a cada respuesta hablada.
- Cartesia (v0.9.723+): Una sola API key alimenta tanto a Sonic 3.5 (salida) como a Ink (entrada). No hay una voz predeterminada; elige una en Ajustes > Voz antes de activarla.
Latencia: Gemini y OpenAI procesan la respuesta completa antes de que comience la reproducción, por lo que el primer audio puede retrasarse unos segundos en respuestas más largas; Ajustes > Voz muestra una nota cuando seleccionas uno de ellos. Para voz de baja latencia, elige ElevenLabs, Cartesia o Resemble.
Velocidad de reproducción: El control deslizante de velocidad (0.5×–2.0×) lo aplica el proveedor para ElevenLabs (limitado a 0.7–1.2×) y Cartesia (limitado a 0.6–1.5×). Las voces del navegador y Kokoro aceleran localmente. Gemini y OpenAI no tienen un control de velocidad propio, por lo que el control deslizante se oculta mientras están seleccionados; Resemble.ai aplica la velocidad en la reproducción estándar (sin transmisión).
Para activarlo:
- Ve a Ajustes > Voz
- Elige una opción de texto a voz
- Activa "Leer respuestas automáticamente" si quieres que la IA lea de forma automática
- Ajusta la velocidad de reproducción si lo deseas
Si la reproducción falla: Los errores de voz ahora se muestran como una notificación flotante en lugar de fallar silenciosamente, por lo que si falta una API key o no es válida, o si una voz no es compatible con el modelo seleccionado (común con Resemble.ai y Cartesia), se te indicará exactamente qué debes corregir.
Local frente a Nube: Las voces del navegador y Kokoro nunca envían nada fuera de tu dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia y Resemble.ai envían texto a sus servidores (utilizando tus API keys) para generar el audio. Consulta Privacidad y datos para obtener más detalles.
Costes de voz (TTS + STT) se acumulan como voice_cost en la conversación, coincidiendo con la ruta de una sola ejecución.
Entrada de voz (Voz a texto)
Dicta tus mensajes en lugar de escribirlos. Haz clic en el icono del micrófono en el editor para empezar a grabar. Caiioo transcribe lo que dices y lo coloca en el campo de mensaje.
Elige cómo se transcribe:
| Opción | Tipo | Privacidad | Configuración |
|---|---|---|---|
| Whisper (Navegador) | Local | Totalmente privada | GRATIS, se ejecuta en tu dispositivo |
| WhisperKit (iOS) | Local | Totalmente privada | GRATIS, en el dispositivo |
| whisper.cpp y Moonshine (Android) | Local | Totalmente privada | GRATIS, en el dispositivo |
| Voz del navegador | Local | Privada | GRATIS, integrada |
| ElevenLabs Scribe | Nube | Precisa (ideal para idiomas distintos al inglés) | Añade tu clave API de ElevenLabs |
| Cartesia Ink | Nube | Precisa, baja latencia | Añade tu clave API de Cartesia |
Las opciones locales (Whisper, WhisperKit, whisper.cpp, Moonshine, Voz del navegador) mantienen tu audio de forma local; nada se envía a ningún servidor. ElevenLabs y Cartesia envían el audio a sus servidores para la transcripción (usando tu clave API) y ofrecen una mayor precisión, especialmente para idiomas que no son inglés.
Para usarlo:
- Haz clic en el icono del micrófono en el editor
- Di tu mensaje
- Detente cuando hayas terminado
- La transcripción aparece en el campo de mensaje
- Edita si es necesario y envía
Configuración inicial: La primera vez que uses un modelo de voz en el dispositivo, este debe descargarse y prepararse. El editor muestra el progreso ("Descargando modelo de voz... N%", luego "Preparando"/"Cargando"), por lo que es normal una breve pausa al tocar el micrófono por primera vez.
Grabar audio y adjuntarlo
Además del dictado, puede grabar un clip y adjuntarlo a su mensaje: abra el menú + del editor y elija Grabar audio. Disponible en iPhone, iPad, macOS y la extensión del navegador. Se combina de forma natural con aplicaciones que escuchan sus grabaciones, como el entrenador de pronunciación "para idiomas".
Dejar que el modelo escuche su grabación
Dos funciones van más allá de la transcripción y permiten que un modelo capaz de escuchar trabaje con el audio real:
- Incluir audio para el modelo (Configuración > Voz): adjunta su grabación para que un modelo con capacidad de audio (p. ej., Gemini) revise el audio real junto con su instrucción: tono, pronunciación, sonidos de fondo, no solo las palabras. Desactivado por defecto; de lo contrario, no se envía nada. Un botón de forma de onda junto al micrófono lo alterna por mensaje, pero el botón solo aparece en los modos y aplicaciones que lo aceptan (como "para idiomas"), por lo que no satura el editor para las tareas cotidianas.
- Audición (una herramienta gratuita, activada por defecto): permite al asistente volver y escuchar de nuevo cualquier archivo adjunto de audio con una pregunta de seguimiento específica («¿qué palabras se pronunciaron mal?», «¿cuál es el tono de voz?») en el turno en que lo adjunte o en cualquier otro posterior. El modelo auxiliar de audio dedicado realiza la escucha, por lo que esto funciona incluso cuando su modelo de chat no puede oír.
Dictado en todo el sistema (macOS)
Los suscriptores Pro en macOS también pueden instalar PrivateVoice, una aplicación complementaria independiente que añade una tecla de acceso rápido global para dictar en cualquier aplicación, no solo en Caiioo. Consulta la página de descarga de escritorio para más detalles.
Ver también
- Privacidad y datos — Cómo se manejan los datos de voz
- Plataforma y configuración — Disponibilidad de la aplicación de escritorio y PrivateVoice
- Ajustes > Voz — Configura las opciones de voz para tu equipo
This guide is maintained by the Caiioo team using Slate, our built-in editor.