Esta es una traducción automática del documento original en inglés. En caso de cualquier discrepancia entre esta traducción y la versión original en inglés, prevalecerá la versión en inglés. Leer la versión original en inglés
Voz: Habla y escucha
¿Quieres que la IA lea las respuestas en voz alta? ¿O dictar mensajes en lugar de escribirlos? Caiioo ofrece entrada y salida de voz, todo configurable, y algunas opciones se ejecutan localmente en tu dispositivo.

Salida de voz (Texto a voz)
Haz que la IA lea sus respuestas en voz alta. Elige entre:
| Opción | Tipo | Calidad | Configuración |
|---|---|---|---|
| Navegador predeterminado | Local | Básica | Gratis, sin configuración |
| Kokoro Neural TTS | Local | Alta | Gratis, se ejecuta en tu dispositivo |
| Google Gemini | Nube | Natural | Añade tu clave de API |
| OpenAI (gpt-4o-mini-tts) | Nube | Natural, entrega controlable | Añade tu clave de API de OpenAI |
| ElevenLabs | Nube | Premium | Añade tu clave de API |
| Cartesia (Sonic 3.5) | Nube | Premium | Añade tu clave de API |
| Resemble.ai | Nube | Excelente (clonación de voz) | Añade tu clave de API |
Tamaño de descarga de Kokoro: El modelo Kokoro se distribuye en dos variantes, y cuál se descarga depende de tu plataforma. macOS e iOS cargan el modelo cuantizado INT8 más pequeño (~88 MB), mientras que la extensión/navegador utiliza la compilación WebGPU de precisión completa más grande (~330 MB). Es una descarga única.
Notas sobre plataformas:
- Kokoro nativo de iOS (v0.9.720+): Se ejecuta en el proceso host de iOS a través de OnnxRuntime en lugar de WebView, lo que soluciona los bloqueos en iPhone 13/14.
- Kokoro de macOS: Transmite frase por frase (en un plazo de ~1 s desde que se presiona reproducir) a través del proceso auxiliar de escritorio.
- Gemini TTS (v0.9.723+): Reproduce frase por frase, por lo que el audio comienza después de la primera frase en lugar de esperar a que se sintetice toda la respuesta.
- OpenAI (v0.9.724+): gpt-4o-mini-tts con entrega controlable; solicita un acento, tono o ritmo en lenguaje natural (por ejemplo, "lee esto con un cálido acento irlandés") y la voz lo sigue. Utiliza la misma clave de API de OpenAI que el proveedor de LLM de OpenAI. Un campo de Instrucciones de estilo de voz en Ajustes > Configuración de IA > Voz aplica tu directiva de estilo a cada respuesta hablada.
- Cartesia (v0.9.723+): Una sola clave de API alimenta tanto a Sonic 3.5 (salida) como a Ink (entrada). No hay una voz predeterminada; elige una en Ajustes > Configuración de IA > Voz antes de activarla.
- ElevenLabs: Cada voz de ElevenLabs empieza a hablar en cuanto tiene algo que decir, incluida la expresiva v3, que se puede seleccionar en el selector de voces. El modelo de voz predeterminado es Flash v2.5: ElevenLabs lo califica como equivalente en calidad al valor predeterminado anterior, y cuesta la mitad por carácter.
- ElevenLabs v3 Conversational (v0.9.777+): Selecciona el modelo v3 Conversational en la lista de modelos de voz para un diálogo expresivo y de baja latencia en más de 70 idiomas. Actualmente, ElevenLabs lo factura a la mitad de la tarifa estándar por carácter, y las estimaciones de costos de Caiioo reflejan esto.
Latencia: Gemini y OpenAI renderizan la respuesta completa antes de que comience la reproducción, por lo que el primer audio puede retrasarse unos segundos en respuestas más largas; Ajustes > Configuración de IA > Voz muestra una nota cuando seleccionas uno de ellos. Para voz de baja latencia, elige ElevenLabs, Cartesia o Resemble.
Velocidad de reproducción: El control deslizante de velocidad (0,5×–2,0×) es aplicado por el proveedor para ElevenLabs (limitado a 0,7–1,2×) y Cartesia (limitado a 0,6–1,5×). Las voces del navegador y Kokoro se aceleran localmente. Gemini y OpenAI no tienen control de velocidad propio, por lo que el control deslizante se oculta mientras están seleccionados; Resemble.ai aplica la velocidad en la reproducción estándar (sin streaming). Una excepción: los modelos de ElevenLabs v3 (v3 y v3 Conversational) no pueden cambiar la velocidad por sí mismos, por lo que Caiioo aplica tu velocidad durante la reproducción, manteniendo el tono natural; el inconveniente es que, con el control deslizante fuera de lo normal, esperan a que todo el clip termine antes de empezar a hablar. A velocidad normal siguen empezando de inmediato.
Caiioo puede elegir una voz que se adapte al momento: cuando leer algo en voz alta forma parte de una tarea, la IA puede elegir una voz, una velocidad de habla y un modelo de voz que se ajusten al contenido —una voz diferente para un cuento antes de dormir que para un resumen de noticias— en lugar de usar siempre tu configuración de voz global. Tus propias configuraciones siguen siendo las predeterminadas para todo lo demás.
Para activarlo:
- Ve a Ajustes > Configuración de IA > Voz
- Elige una opción de texto a voz
- Activa "Leer respuestas automáticamente" si quieres que la IA lea automáticamente
- Ajusta la velocidad de reproducción si lo deseas
Si la reproducción falla: Los errores de voz ahora aparecen como una notificación flotante en lugar de fallar silenciosamente; por lo tanto, una clave de API faltante o no válida, o una voz que no sea compatible con el modelo seleccionado (común con Resemble.ai y Cartesia), te indica exactamente qué corregir.
Local vs Nube: Las voces del navegador y Kokoro nunca envían nada fuera de tu dispositivo. Gemini, OpenAI, ElevenLabs, Cartesia y Resemble.ai envían texto a sus servidores (utilizando tus claves de API) para generar el audio. Consulta Privacidad y datos para obtener más detalles.
Los costos de voz (TTS + STT) se acumulan como voice_cost en la conversación, coincidiendo con la ruta de una sola solicitud.
Entrada de voz (Voz a texto)
Dicta tus mensajes en lugar de escribirlos. Haz clic en el icono del micrófono en el editor para empezar a grabar. Caiioo transcribe lo que dices y lo coloca en el campo de mensaje.
Elige cómo se transcribe:
| Opción | Tipo | Privacidad | Configuración |
|---|---|---|---|
| Whisper (Navegador) | Local | Totalmente privada | GRATIS, se ejecuta en tu dispositivo |
| WhisperKit (iOS) | Local | Totalmente privada | GRATIS, en el dispositivo |
| whisper.cpp y Moonshine (Android) | Local | Totalmente privada | GRATIS, en el dispositivo |
| Voz del navegador | Local | Privada | GRATIS, integrada |
| ElevenLabs Scribe | Nube | Precisa (ideal para idiomas distintos al inglés) | Añade tu clave API de ElevenLabs |
| Cartesia Ink | Nube | Precisa, baja latencia | Añade tu clave API de Cartesia |
Las opciones locales (Whisper, WhisperKit, whisper.cpp, Moonshine, Voz del navegador) mantienen tu audio de forma local; nada se envía a ningún servidor. ElevenLabs y Cartesia envían el audio a sus servidores para la transcripción (usando tu clave API) y ofrecen una mayor precisión, especialmente para idiomas que no son inglés.
Para usarlo:
- Haz clic en el icono del micrófono en el editor
- Di tu mensaje
- Detente cuando hayas terminado
- La transcripción aparece en el campo de mensaje
- Edita si es necesario y envía
Configuración inicial: La primera vez que uses un modelo de voz en el dispositivo, este debe descargarse y prepararse. El editor muestra el progreso ("Descargando modelo de voz... N%", luego "Preparando"/"Cargando"), por lo que es normal una breve pausa al tocar el micrófono por primera vez.
Grabar audio y adjuntarlo
Además del dictado, puede grabar un clip y adjuntarlo a su mensaje: abra el menú + del editor y elija Grabar audio. Disponible en iPhone, iPad, macOS y la extensión del navegador. Se combina de forma natural con aplicaciones que escuchan sus grabaciones, como el entrenador de pronunciación "para idiomas".
Deja que el modelo escuche tu grabación
Dos funciones van más allá de la transcripción y permiten que un modelo que puede oír trabaje con el audio real:
- Incluir audio para el modelo (Configuración > Configuración de IA > Voz): adjunta tu grabación para que un modelo con capacidad de audio (p. ej., Gemini) revise el audio real junto con tu indicación: tono, pronunciación, sonidos de fondo, no solo las palabras. Desactivado de forma predeterminada; de lo contrario, no se envía nada. Un botón de forma de onda junto al micrófono lo alterna por mensaje, pero el botón solo aparece en los modos y aplicaciones que lo admiten (como "para idiomas"), para que no sature el compositor para las tareas cotidianas.
- Audición (una herramienta gratuita, activada de forma predeterminada): permite al asistente volver y volver a escuchar cualquier archivo adjunto de audio con una pregunta de seguimiento dirigida ("¿qué palabras se pronunciaron mal?", "¿cuál es el tono de voz?") en el turno en el que lo adjuntes o en cualquier otro posterior. El modelo auxiliar de audio dedicado realiza la escucha, por lo que esto funciona incluso cuando tu modelo de chat no puede oír.
Dictado en todo el sistema (Escritorio)
Dicta en cualquier aplicación de tu computadora, no solo en Caiioo:
Los suscriptores Pro tienen el dictado en todo el sistema integrado en las aplicaciones de escritorio de macOS, Windows y Linux, sin necesidad de instalar aplicaciones complementarias. Mantén presionado el atajo de dictado en cualquier lugar, habla y lo que digas se escribirá en la aplicación que esté activa.
Ver también
- Privacidad y datos — Cómo se manejan los datos de voz
- Plataforma y configuración — Disponibilidad de la aplicación de escritorio
- Configuración > Configuración de IA > Voz — Configura las opciones de voz para tu configuración
This guide is maintained by the Caiioo team using Slate, our built-in editor.