Dit is een machinevertaling van het originele Engelstalige document. In het geval van een conflict tussen deze vertaling en de originele Engelse versie, is de Engelse versie doorslaggevend. Lees de originele Engelse versie
Spraak: Spreken en luisteren
Wil je dat de AI reacties hardop voorleest? Of berichten dicteren in plaats van typen? Caiioo biedt spraakinvoer en -uitvoer — allemaal configureerbaar, sommige draaien lokaal op je apparaat.

Voice Output (Text-to-Speech)
Laat de AI zijn antwoorden hardop voorlezen. Kies uit:
| Optie | Type | Kwaliteit | Instelling |
|---|---|---|---|
| Browser Default | Lokaal | Basis | Gratis, geen instelling vereist |
| Kokoro Neural TTS | Lokaal | Hoog | Gratis, draait op je apparaat |
| Google Gemini | Cloud | Natuurlijk | Voeg je API-sleutel toe |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natuurlijk, stuurbaar | Voeg je OpenAI API-sleutel toe |
| ElevenLabs | Cloud | Premium | Voeg je API-sleutel toe |
| Cartesia (Sonic 3.5) | Cloud | Premium | Voeg je API-sleutel toe |
| Resemble.ai | Cloud | Uitstekend (stemklonen) | Voeg je API-sleutel toe |
Kokoro-downloadgrootte: Het Kokoro-model wordt geleverd in twee varianten, en welke wordt gedownload hangt af van je platform. macOS en iOS laden het kleinere INT8-gekwantiseerde model (~88 MB), terwijl de extensie/browser de grotere WebGPU-build met volledige precisie gebruikt (~330 MB). Dit is een eenmalige download.
Platformopmerkingen:
- iOS native Kokoro (v0.9.720+): Draait in het iOS-hostproces via OnnxRuntime in plaats van WebView, waarmee crashes op iPhone 13/14 worden opgelost.
- macOS Kokoro: Streamt zin voor zin (binnen ~1 seconde na het indrukken van afspelen) via het desktophelperproces.
- Gemini TTS (v0.9.723+): Speelt zin voor zin af, zodat de audio begint na de eerste zin in plaats van te wachten tot het hele antwoord is gesynthetiseerd.
- OpenAI (v0.9.724+): gpt-4o-mini-tts met stuurbare levering — vraag om een accent, toon of tempo in natuurlijke taal (bijv. "lees dit voor met een warm Iers accent") en de stem volgt dit. Maakt gebruik van dezelfde OpenAI API-sleutel als de OpenAI LLM-provider. Een veld voor Stemstijlinstructies in Instellingen > Stem past je stijlinstructie toe op elk gesproken antwoord.
- Cartesia (v0.9.723+): Eén API-sleutel voedt zowel Sonic 3.5 (uitvoer) als Ink (invoer). Er is geen standaardstem — kies er een in Instellingen > Stem voordat je deze inschakelt.
Latentie: Gemini en OpenAI renderen het volledige antwoord voordat het afspelen begint, waardoor de eerste audio bij langere antwoorden enkele seconden kan achterlopen — Instellingen > Stem toont een opmerking wanneer je een van beide kiest. Kies voor spraak met een lage latentie voor ElevenLabs, Cartesia of Resemble.
Afspeelsnelheid: De snelheidsschuifregelaar (0,5×–2,0×) wordt door de provider toegepast voor ElevenLabs (begrensd op 0,7–1,2×) en Cartesia (begrensd op 0,6–1,5×). Browserstemmen en Kokoro versnellen lokaal. Gemini en OpenAI hebben geen eigen snelheidsregeling, dus de schuifregelaar is verborgen wanneer deze zijn geselecteerd; Resemble.ai past de snelheid toe bij standaard afspelen (niet-streaming).
Inschakelen:
- Ga naar Instellingen > Stem
- Kies een tekst-naar-spraakoptie
- Schakel "Antwoorden automatisch voorlezen" in als je wilt dat de AI automatisch voorleest
- Pas desgewenst de afspeelsnelheid aan
Als het afspelen mislukt: Spraakfouten verschijnen voortaan als een melding (toast) in plaats van stilletjes te falen — zodat een ontbrekende of ongeldige API-sleutel, of een stem die niet compatibel is met het geselecteerd model (komt veel voor bij Resemble.ai en Cartesia), precies aangeeft wat je moet oplossen.
Lokaal vs. Cloud: Browserstemmen en Kokoro sturen nooit iets weg van je apparaat. Gemini, OpenAI, ElevenLabs, Cartesia en Resemble.ai sturen tekst naar hun servers (met gebruik van je API-sleutels) om de audio te genereren. Zie Privacy & Data voor details.
Stemkosten (TTS + STT) worden verzameld als voice_cost voor het gesprek, passend bij het one-shotpad.
Spraakinvoer (Speech-to-Text)
Dicteer je berichten in plaats van te typen. Klik op het microfoon-icoon in de composer om de opname te starten. Caiioo transcribeert wat je zegt en plaatst het in het berichtveld.
Kies hoe er wordt getranscribeerd:
| Optie | Type | Privacy | Installatie |
|---|---|---|---|
| Whisper (Browser) | Lokaal | Volledig privé | GRATIS, draait op jouw apparaat |
| WhisperKit (iOS) | Lokaal | Volledig privé | GRATIS, op het apparaat |
| whisper.cpp & Moonshine (Android) | Lokaal | Volledig privé | GRATIS, op het apparaat |
| Browser Speech | Lokaal | Privé | GRATIS, ingebouwd |
| ElevenLabs Scribe | Cloud | Nauwkeurig (goed voor niet-Engels) | Voeg je ElevenLabs API-sleutel toe |
| Cartesia Ink | Cloud | Nauwkeurig, lage latentie | Voeg je Cartesia API-sleutel toe |
Lokale opties (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) houden je audio lokaal—er wordt niets naar een server gestuurd. ElevenLabs en Cartesia sturen audio naar hun servers voor transcriptie (met jouw API-sleutel) en bieden een hogere nauwkeurigheid, vooral voor niet-Engelse talen.
Hoe te gebruiken:
- Klik op het microfoon-icoon in de composer
- Spreek je bericht in
- Stop wanneer je klaar bent
- De transcriptie verschijnt in het berichtveld
- Bewerk indien nodig en verzend
Eerste installatie: De eerste keer dat je een lokaal spraakmodel gebruikt, moet het worden gedownload en opgewarmd. De composer toont de voortgang ("Spraakmodel downloaden… N%", daarna "Voorbereiden"/"Laden"), dus een korte pauze bij de eerste klik op de microfoon is normaal en geen vastloper.
Audio Opnemen en Bijvoegen
Naast dicteren kun je een fragment opnemen en aan je bericht toevoegen: open het +-menu in het invoerveld en kies Audio opnemen. Beschikbaar op iPhone, iPad, macOS en de browserextensie. Sluit naadloos aan bij apps die naar je opnames luisteren, zoals de uitspraakcoach "voor Talen".
Laat het Model naar Je Opname Luisteren
Functies die verder gaan dan transcriptie en waarmee een model dat kan horen met de daadwerkelijke audio kan werken:
- Inclusief audio voor het model (Instellingen > Stem): voegt je opname toe zodat een audiodragend model (bijv. Gemini) de echte audio naast je prompt beoordeelt — toon, uitspraak, achtergrondgeluiden, en niet alleen de woorden. Standaard uitgeschakeld; er wordt anders niets verzonden. Een golfvormknop naast de microfoon schakelt dit per bericht in, maar de knop verschijnt alleen in modi en apps die hiervoor kiezen (zoals "voor Talen"), zodat het de invoer voor alledaagse taken niet overzichteloos maakt.
- Horen (een gratis tool, standaard ingeschakeld): stelt de assistent in staat om terug te gaan en te luisteren naar audio-bijlagen met een gerichte vervolgvraag — "welke woorden werden verkeerd uitgesproken?", "wat is de toon van de stem?" — op het moment dat je deze bijvoegt of op elk later moment. Het speciale audio-hulpmodel voert het luisteren uit, dus dit werkt zelfs wanneer je chatmodel niet kan horen.
Systeembreed dicteren (macOS)
Pro-abonnees op macOS kunnen ook PrivateVoice installeren, een aparte bijbehorende app die een globale sneltoets toevoegt om in elke applicatie te dicteren — niet alleen in Caiioo. Zie de desktop-downloadpagina voor details.
Zie ook
- Privacy & Gegevens — Hoe spraakgegevens worden verwerkt
- Platform & Installatie — Beschikbaarheid van desktop-app en PrivateVoice
- Instellingen > Spraak — Configureer spraakopties voor uw setup
This guide is maintained by the Caiioo team using Slate, our built-in editor.