Dit is een machinevertaling van het originele Engelstalige document. In het geval van een conflict tussen deze vertaling en de originele Engelse versie, is de Engelse versie doorslaggevend. Lees de originele Engelse versie
Spraak: Spreken en luisteren
Wil je dat de AI reacties hardop voorleest? Of berichten dicteren in plaats van typen? Caiioo biedt spraakinvoer en -uitvoer — allemaal configureerbaar, sommige draaien lokaal op je apparaat.

Voice Output (Text-to-Speech)
Laat de AI zijn reacties hardop voorlezen. Kies uit:
| Optie | Type | Kwaliteit | Instelling |
|---|---|---|---|
| Browser Default | Lokaal | Basis | Gratis, geen instelling vereist |
| Kokoro Neural TTS | Lokaal | Hoog | Gratis, draait op je apparaat |
| Google Gemini | Cloud | Natuurlijk | Voeg je API-sleutel toe |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natuurlijk, stuurbaar | Voeg je OpenAI API-sleutel toe |
| ElevenLabs | Cloud | Premium | Voeg je API-sleutel toe |
| Cartesia (Sonic 3.5) | Cloud | Premium | Voeg je API-sleutel toe |
| Resemble.ai | Cloud | Uitstekend (stemklonen) | Voeg je API-sleutel toe |
Downloadgrootte Kokoro: Het Kokoro-model is beschikbaar in twee varianten, en welke wordt gedownload hangt af van je platform. macOS en iOS laden het kleinere INT8-gekwantiseerde model (~88 MB), terwijl de extensie/browser de grotere volprecision WebGPU-build (~330 MB) gebruikt. Dit is een eenmalige download.
Platformopmerkingen:
- iOS native Kokoro (v0.9.720+): Draait in het iOS-hostproces via OnnxRuntime in plaats van WebView, wat crashes op de iPhone 13/14 oplost.
- macOS Kokoro: Streamt zin voor zin (binnen ~1 seconde na het drukken op afspelen) via het desktop-helperproces.
- Gemini TTS (v0.9.723+): Speelt zin voor zin af, zodat de audio begint na de eerste zin in plaats van te wachten tot het hele antwoord is gegenereerd.
- OpenAI (v0.9.724+): gpt-4o-mini-tts met stuurbare weergave — vraag om een accent, toon of tempo in natuurlijke taal (bijv. "lees dit voor met een warm Iers accent") en de stem volgt dit. Maakt gebruik van dezelfde OpenAI API-sleutel als de OpenAI LLM-provider. Een veld voor Stemstijlinstructies in Instellingen > AI-instellingen > Stem past je stijlrichtlijn toe op elk gesproken antwoord.
- Cartesia (v0.9.723+): Één API-sleutel stuurt zowel Sonic 3.5 (uitvoer) als Ink (invoer) aan. Er is geen standaardstem — kies er een in Instellingen > AI-instellingen > Stem voordat je dit inschakelt.
- ElevenLabs: Elke ElevenLabs-stem begint te spreken zodra deze iets te zeggen heeft — inclusief de expressieve v3, die selecteerbaar is in de stemkiezer. Het standaard stemmodel is Flash v2.5: ElevenLabs schat de kwaliteit hiervan in als gelijkwaardig aan de vorige standaard, en het kost de helft per teken.
- ElevenLabs v3 Conversational (v0.9.777+): Kies het v3 Conversational-model in de stemmodellijst voor expressieve dialoog met lage latentie in meer dan 70 talen. ElevenLabs berekent momenteel de helft van het standaardtarief per teken, en de kostenramingen van Caiioo weerspiegelen dit.
Latentie: Gemini en OpenAI renderen het volledige antwoord voordat het afspelen begint, waardoor de eerste audio bij langere antwoorden enkele seconden kan achterlopen — Instellingen > AI-instellingen > Stem toont een opmerking wanneer je een van beide kiest. Kies voor spraak met een lage latentie voor ElevenLabs, Cartesia of Resemble.
Afspeelsnelheid: De snelheidsschuifregelaar (0.5×–2.0×) wordt toegepast door de provider voor ElevenLabs (beperkt tot 0.7–1.2×) en Cartesia (beperkt tot 0.6–1.5×). Browserstemmen en Kokoro versnellen lokaal. Gemini en OpenAI hebben geen eigen snelheidsregeling, dus de schuifregelaar is verborgen zolang deze zijn geselecteerd; Resemble.ai past de snelheid toe bij standaard (niet-streamend) afspelen. Één uitzondering: de ElevenLabs v3-modellen (v3 en v3 Conversational) kunnen de snelheid zelf niet wijzigen, dus Caiioo past je snelheid tijdens het afspelen toe met behoud van een natuurlijke toonhoogte — het nadeel is dat ze, wanneer de schuifregelaar niet op normaal staat, wachten op het hele fragment voordat ze beginnen te spreken. Op normale snelheid beginnen ze nog steeds direct.
Caiioo kan een stem kiezen die bij het moment past: wanneer het hardop voorlezen van iets deel uitmaakt van een taak, kan de AI een stem, spreeksnelheid en spraakmodel kiezen die bij de inhoud passen — een andere stem voor een voorleesverhaal dan voor een nieuwsoverzicht — in plaats de globale steminstelling altijd te gebruiken. Je eigen instellingen blijven de standaard voor al het overige.
Inschakelen:
- Ga naar Instellingen > AI-instellingen > Stem
- Kies een tekst-naar-spraakoptie
- Schakel "Antwoorden automatisch voorlezen" in als je wilt dat de AI automatisch voorleest
- Pas de afspeelsnelheid naar wens aan
Als het afspelen mislukt: Stemfouten worden voortaan weergegeven als een melding (toast) in plaats van stilletjes te mislukken — zodat een ontbrekende of ongeldige API-sleutel, of een stem die niet compatibel is met het geselecteerde model (gebruikelijk bij Resemble.ai en Cartesia), precies aangeeft wat je moet oplossen.
Lokaal vs Cloud: Browserstemmen en Kokoro sturen nooit iets weg van je apparaat. Gemini, OpenAI, ElevenLabs, Cartesia en Resemble.ai sturen tekst naar hun servers (met gebruik van je API-sleutels) om de audio te genereren. Zie Privacy & Data voor details.
Stemkosten (TTS + STT) worden opgeteld als voice_cost bij het gesprek, overeenkomend met het eenmalige pad.
Spraakinvoer (Speech-to-Text)
Dicteer je berichten in plaats van te typen. Klik op het microfoon-icoon in de composer om de opname te starten. Caiioo transcribeert wat je zegt en plaatst het in het berichtveld.
Kies hoe er wordt getranscribeerd:
| Optie | Type | Privacy | Installatie |
|---|---|---|---|
| Whisper (Browser) | Lokaal | Volledig privé | GRATIS, draait op jouw apparaat |
| WhisperKit (iOS) | Lokaal | Volledig privé | GRATIS, op het apparaat |
| whisper.cpp & Moonshine (Android) | Lokaal | Volledig privé | GRATIS, op het apparaat |
| Browser Speech | Lokaal | Privé | GRATIS, ingebouwd |
| ElevenLabs Scribe | Cloud | Nauwkeurig (goed voor niet-Engels) | Voeg je ElevenLabs API-sleutel toe |
| Cartesia Ink | Cloud | Nauwkeurig, lage latentie | Voeg je Cartesia API-sleutel toe |
Lokale opties (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) houden je audio lokaal—er wordt niets naar een server gestuurd. ElevenLabs en Cartesia sturen audio naar hun servers voor transcriptie (met jouw API-sleutel) en bieden een hogere nauwkeurigheid, vooral voor niet-Engelse talen.
Hoe te gebruiken:
- Klik op het microfoon-icoon in de composer
- Spreek je bericht in
- Stop wanneer je klaar bent
- De transcriptie verschijnt in het berichtveld
- Bewerk indien nodig en verzend
Eerste installatie: De eerste keer dat je een lokaal spraakmodel gebruikt, moet het worden gedownload en opgewarmd. De composer toont de voortgang ("Spraakmodel downloaden… N%", daarna "Voorbereiden"/"Laden"), dus een korte pauze bij de eerste klik op de microfoon is normaal en geen vastloper.
Audio Opnemen en Bijvoegen
Naast dicteren kun je een fragment opnemen en aan je bericht toevoegen: open het +-menu in het invoerveld en kies Audio opnemen. Beschikbaar op iPhone, iPad, macOS en de browserextensie. Sluit naadloos aan bij apps die naar je opnames luisteren, zoals de uitspraakcoach "voor Talen".
Laat het model je opname horen
Functies die verder gaan dan transcriptie en een model dat kan horen laten werken met de daadwerkelijke audio:
- Audio opnemen voor het model (Instellingen > AI-instellingen > Stem): voegt je opname toe zodat een audiogeschikt model (bijv. Gemini) de echte audio naast je prompt beoordeelt — toon, uitspraak, achtergrondgeluiden, niet alleen de woorden. Standaard uitgeschakeld; anders wordt er niets verzonden. Een golfvormknop naast de microfoon schakelt dit per bericht in of uit, maar de knop verschijnt alleen in modi en apps die hiervoor kiezen (zoals "voor talen"), zodat het de invoer niet overwoekert voor alledaagse taken.
- Horen (een gratis tool, standaard ingeschakeld): stelt de assistent in staat om terug te gaan en te luisteren naar elke audio-bijlage met een gerichte vervolgvraag — "welke woorden werden verkeerd uitgesproken?", "wat is de toon van de stem?" — op de beurt dat je deze bijvoegt of een latere. Het dedicated audiohulpmodel luistert mee, dus dit werkt zelfs wanneer je chatmodel niet kan horen.
Systeembrede Dictatie (Desktop)
Dicteer in elke willekeurige toepassing op uw computer — niet alleen in Caiioo:
Pro-abonnees hebben systeembrede dictatie ingebouwd in de desktop-apps voor macOS, Windows en Linux — er hoeft geen extra app te worden geïnstalleerd. Houd de dictatiesneltoets overal ingedrukt, spreek, en wat u zegt wordt getypt in de app die op dat moment actief is.
Zie ook
- Privacy & Gegevens — Hoe wordt omgegaan met spraakgegevens
- Platform & Installatie — Beschikbaarheid van de bureaublad-app
- Instellingen > AI-instellingen > Stem — Configureer spraakopties voor je opstelling
This guide is maintained by the Caiioo team using Slate, our built-in editor.