Dit is een machinevertaling van het originele Engelstalige document. In het geval van een conflict tussen deze vertaling en de originele Engelse versie, is de Engelse versie doorslaggevend. Lees de originele Engelse versie


Spraak: Spreken en luisteren

Wil je dat de AI reacties hardop voorleest? Of berichten dicteren in plaats van typen? Caiioo biedt spraakinvoer en -uitvoer — allemaal configureerbaar, sommige draaien lokaal op je apparaat.

Spraakinstellingen met invoer- en uitvoeropties, schakelaar voor automatisch lezen en afspeelsnelheid

Voice Output (Text-to-Speech)

Laat de AI zijn reacties hardop voorlezen. Kies uit:

Optie Type Kwaliteit Instelling
Browser Default Lokaal Basis Gratis, geen instelling vereist
Kokoro Neural TTS Lokaal Hoog Gratis, draait op je apparaat
Google Gemini Cloud Natuurlijk Voeg je API-sleutel toe
OpenAI (gpt-4o-mini-tts) Cloud Natuurlijk, stuurbaar Voeg je OpenAI API-sleutel toe
ElevenLabs Cloud Premium Voeg je API-sleutel toe
Cartesia (Sonic 3.5) Cloud Premium Voeg je API-sleutel toe
Resemble.ai Cloud Uitstekend (stemklonen) Voeg je API-sleutel toe

Downloadgrootte Kokoro: Het Kokoro-model is beschikbaar in twee varianten, en welke wordt gedownload hangt af van je platform. macOS en iOS laden het kleinere INT8-gekwantiseerde model (~88 MB), terwijl de extensie/browser de grotere volprecision WebGPU-build (~330 MB) gebruikt. Dit is een eenmalige download.

Platformopmerkingen:

  • iOS native Kokoro (v0.9.720+): Draait in het iOS-hostproces via OnnxRuntime in plaats van WebView, wat crashes op de iPhone 13/14 oplost.
  • macOS Kokoro: Streamt zin voor zin (binnen ~1 seconde na het drukken op afspelen) via het desktop-helperproces.
  • Gemini TTS (v0.9.723+): Speelt zin voor zin af, zodat de audio begint na de eerste zin in plaats van te wachten tot het hele antwoord is gegenereerd.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts met stuurbare weergave — vraag om een accent, toon of tempo in natuurlijke taal (bijv. "lees dit voor met een warm Iers accent") en de stem volgt dit. Maakt gebruik van dezelfde OpenAI API-sleutel als de OpenAI LLM-provider. Een veld voor Stemstijlinstructies in Instellingen > AI-instellingen > Stem past je stijlrichtlijn toe op elk gesproken antwoord.
  • Cartesia (v0.9.723+): Één API-sleutel stuurt zowel Sonic 3.5 (uitvoer) als Ink (invoer) aan. Er is geen standaardstem — kies er een in Instellingen > AI-instellingen > Stem voordat je dit inschakelt.
  • ElevenLabs: Elke ElevenLabs-stem begint te spreken zodra deze iets te zeggen heeft — inclusief de expressieve v3, die selecteerbaar is in de stemkiezer. Het standaard stemmodel is Flash v2.5: ElevenLabs schat de kwaliteit hiervan in als gelijkwaardig aan de vorige standaard, en het kost de helft per teken.
  • ElevenLabs v3 Conversational (v0.9.777+): Kies het v3 Conversational-model in de stemmodellijst voor expressieve dialoog met lage latentie in meer dan 70 talen. ElevenLabs berekent momenteel de helft van het standaardtarief per teken, en de kostenramingen van Caiioo weerspiegelen dit.

Latentie: Gemini en OpenAI renderen het volledige antwoord voordat het afspelen begint, waardoor de eerste audio bij langere antwoorden enkele seconden kan achterlopen — Instellingen > AI-instellingen > Stem toont een opmerking wanneer je een van beide kiest. Kies voor spraak met een lage latentie voor ElevenLabs, Cartesia of Resemble.

Afspeelsnelheid: De snelheidsschuifregelaar (0.5×–2.0×) wordt toegepast door de provider voor ElevenLabs (beperkt tot 0.7–1.2×) en Cartesia (beperkt tot 0.6–1.5×). Browserstemmen en Kokoro versnellen lokaal. Gemini en OpenAI hebben geen eigen snelheidsregeling, dus de schuifregelaar is verborgen zolang deze zijn geselecteerd; Resemble.ai past de snelheid toe bij standaard (niet-streamend) afspelen. Één uitzondering: de ElevenLabs v3-modellen (v3 en v3 Conversational) kunnen de snelheid zelf niet wijzigen, dus Caiioo past je snelheid tijdens het afspelen toe met behoud van een natuurlijke toonhoogte — het nadeel is dat ze, wanneer de schuifregelaar niet op normaal staat, wachten op het hele fragment voordat ze beginnen te spreken. Op normale snelheid beginnen ze nog steeds direct.

Caiioo kan een stem kiezen die bij het moment past: wanneer het hardop voorlezen van iets deel uitmaakt van een taak, kan de AI een stem, spreeksnelheid en spraakmodel kiezen die bij de inhoud passen — een andere stem voor een voorleesverhaal dan voor een nieuwsoverzicht — in plaats de globale steminstelling altijd te gebruiken. Je eigen instellingen blijven de standaard voor al het overige.

Inschakelen:

  1. Ga naar Instellingen > AI-instellingen > Stem
  2. Kies een tekst-naar-spraakoptie
  3. Schakel "Antwoorden automatisch voorlezen" in als je wilt dat de AI automatisch voorleest
  4. Pas de afspeelsnelheid naar wens aan

Als het afspelen mislukt: Stemfouten worden voortaan weergegeven als een melding (toast) in plaats van stilletjes te mislukken — zodat een ontbrekende of ongeldige API-sleutel, of een stem die niet compatibel is met het geselecteerde model (gebruikelijk bij Resemble.ai en Cartesia), precies aangeeft wat je moet oplossen.

Lokaal vs Cloud: Browserstemmen en Kokoro sturen nooit iets weg van je apparaat. Gemini, OpenAI, ElevenLabs, Cartesia en Resemble.ai sturen tekst naar hun servers (met gebruik van je API-sleutels) om de audio te genereren. Zie Privacy & Data voor details.

Stemkosten (TTS + STT) worden opgeteld als voice_cost bij het gesprek, overeenkomend met het eenmalige pad.

Spraakinvoer (Speech-to-Text)

Dicteer je berichten in plaats van te typen. Klik op het microfoon-icoon in de composer om de opname te starten. Caiioo transcribeert wat je zegt en plaatst het in het berichtveld.

Kies hoe er wordt getranscribeerd:

Optie Type Privacy Installatie
Whisper (Browser) Lokaal Volledig privé GRATIS, draait op jouw apparaat
WhisperKit (iOS) Lokaal Volledig privé GRATIS, op het apparaat
whisper.cpp & Moonshine (Android) Lokaal Volledig privé GRATIS, op het apparaat
Browser Speech Lokaal Privé GRATIS, ingebouwd
ElevenLabs Scribe Cloud Nauwkeurig (goed voor niet-Engels) Voeg je ElevenLabs API-sleutel toe
Cartesia Ink Cloud Nauwkeurig, lage latentie Voeg je Cartesia API-sleutel toe

Lokale opties (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) houden je audio lokaal—er wordt niets naar een server gestuurd. ElevenLabs en Cartesia sturen audio naar hun servers voor transcriptie (met jouw API-sleutel) en bieden een hogere nauwkeurigheid, vooral voor niet-Engelse talen.

Hoe te gebruiken:

  1. Klik op het microfoon-icoon in de composer
  2. Spreek je bericht in
  3. Stop wanneer je klaar bent
  4. De transcriptie verschijnt in het berichtveld
  5. Bewerk indien nodig en verzend

Eerste installatie: De eerste keer dat je een lokaal spraakmodel gebruikt, moet het worden gedownload en opgewarmd. De composer toont de voortgang ("Spraakmodel downloaden… N%", daarna "Voorbereiden"/"Laden"), dus een korte pauze bij de eerste klik op de microfoon is normaal en geen vastloper.

Audio Opnemen en Bijvoegen

Naast dicteren kun je een fragment opnemen en aan je bericht toevoegen: open het +-menu in het invoerveld en kies Audio opnemen. Beschikbaar op iPhone, iPad, macOS en de browserextensie. Sluit naadloos aan bij apps die naar je opnames luisteren, zoals de uitspraakcoach "voor Talen".

Laat het model je opname horen

Functies die verder gaan dan transcriptie en een model dat kan horen laten werken met de daadwerkelijke audio:

  • Audio opnemen voor het model (Instellingen > AI-instellingen > Stem): voegt je opname toe zodat een audiogeschikt model (bijv. Gemini) de echte audio naast je prompt beoordeelt — toon, uitspraak, achtergrondgeluiden, niet alleen de woorden. Standaard uitgeschakeld; anders wordt er niets verzonden. Een golfvormknop naast de microfoon schakelt dit per bericht in of uit, maar de knop verschijnt alleen in modi en apps die hiervoor kiezen (zoals "voor talen"), zodat het de invoer niet overwoekert voor alledaagse taken.
  • Horen (een gratis tool, standaard ingeschakeld): stelt de assistent in staat om terug te gaan en te luisteren naar elke audio-bijlage met een gerichte vervolgvraag — "welke woorden werden verkeerd uitgesproken?", "wat is de toon van de stem?" — op de beurt dat je deze bijvoegt of een latere. Het dedicated audiohulpmodel luistert mee, dus dit werkt zelfs wanneer je chatmodel niet kan horen.

Systeembrede Dictatie (Desktop)

Dicteer in elke willekeurige toepassing op uw computer — niet alleen in Caiioo:

Pro-abonnees hebben systeembrede dictatie ingebouwd in de desktop-apps voor macOS, Windows en Linux — er hoeft geen extra app te worden geïnstalleerd. Houd de dictatiesneltoets overal ingedrukt, spreek, en wat u zegt wordt getypt in de app die op dat moment actief is.

Zie ook

  • Privacy & Gegevens — Hoe wordt omgegaan met spraakgegevens
  • Platform & Installatie — Beschikbaarheid van de bureaublad-app
  • Instellingen > AI-instellingen > Stem — Configureer spraakopties voor je opstelling

This guide is maintained by the Caiioo team using Slate, our built-in editor.