Dit is een machinevertaling van het originele Engelstalige document. In het geval van een conflict tussen deze vertaling en de originele Engelse versie, is de Engelse versie doorslaggevend. Lees de originele Engelse versie


Spraak: Spreken en luisteren

Wil je dat de AI reacties hardop voorleest? Of berichten dicteren in plaats van typen? Caiioo biedt spraakinvoer en -uitvoer — allemaal configureerbaar, sommige draaien lokaal op je apparaat.

Spraakinstellingen met invoer- en uitvoeropties, schakelaar voor automatisch lezen en afspeelsnelheid

Voice Output (Text-to-Speech)

Laat de AI zijn antwoorden hardop voorlezen. Kies uit:

Optie Type Kwaliteit Instelling
Browser Default Lokaal Basis Gratis, geen instelling vereist
Kokoro Neural TTS Lokaal Hoog Gratis, draait op je apparaat
Google Gemini Cloud Natuurlijk Voeg je API-sleutel toe
OpenAI (gpt-4o-mini-tts) Cloud Natuurlijk, stuurbaar Voeg je OpenAI API-sleutel toe
ElevenLabs Cloud Premium Voeg je API-sleutel toe
Cartesia (Sonic 3.5) Cloud Premium Voeg je API-sleutel toe
Resemble.ai Cloud Uitstekend (stemklonen) Voeg je API-sleutel toe

Kokoro-downloadgrootte: Het Kokoro-model wordt geleverd in twee varianten, en welke wordt gedownload hangt af van je platform. macOS en iOS laden het kleinere INT8-gekwantiseerde model (~88 MB), terwijl de extensie/browser de grotere WebGPU-build met volledige precisie gebruikt (~330 MB). Dit is een eenmalige download.

Platformopmerkingen:

  • iOS native Kokoro (v0.9.720+): Draait in het iOS-hostproces via OnnxRuntime in plaats van WebView, waarmee crashes op iPhone 13/14 worden opgelost.
  • macOS Kokoro: Streamt zin voor zin (binnen ~1 seconde na het indrukken van afspelen) via het desktophelperproces.
  • Gemini TTS (v0.9.723+): Speelt zin voor zin af, zodat de audio begint na de eerste zin in plaats van te wachten tot het hele antwoord is gesynthetiseerd.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts met stuurbare levering — vraag om een accent, toon of tempo in natuurlijke taal (bijv. "lees dit voor met een warm Iers accent") en de stem volgt dit. Maakt gebruik van dezelfde OpenAI API-sleutel als de OpenAI LLM-provider. Een veld voor Stemstijlinstructies in Instellingen > Stem past je stijlinstructie toe op elk gesproken antwoord.
  • Cartesia (v0.9.723+): Eén API-sleutel voedt zowel Sonic 3.5 (uitvoer) als Ink (invoer). Er is geen standaardstem — kies er een in Instellingen > Stem voordat je deze inschakelt.

Latentie: Gemini en OpenAI renderen het volledige antwoord voordat het afspelen begint, waardoor de eerste audio bij langere antwoorden enkele seconden kan achterlopen — Instellingen > Stem toont een opmerking wanneer je een van beide kiest. Kies voor spraak met een lage latentie voor ElevenLabs, Cartesia of Resemble.

Afspeelsnelheid: De snelheidsschuifregelaar (0,5×–2,0×) wordt door de provider toegepast voor ElevenLabs (begrensd op 0,7–1,2×) en Cartesia (begrensd op 0,6–1,5×). Browserstemmen en Kokoro versnellen lokaal. Gemini en OpenAI hebben geen eigen snelheidsregeling, dus de schuifregelaar is verborgen wanneer deze zijn geselecteerd; Resemble.ai past de snelheid toe bij standaard afspelen (niet-streaming).

Inschakelen:

  1. Ga naar Instellingen > Stem
  2. Kies een tekst-naar-spraakoptie
  3. Schakel "Antwoorden automatisch voorlezen" in als je wilt dat de AI automatisch voorleest
  4. Pas desgewenst de afspeelsnelheid aan

Als het afspelen mislukt: Spraakfouten verschijnen voortaan als een melding (toast) in plaats van stilletjes te falen — zodat een ontbrekende of ongeldige API-sleutel, of een stem die niet compatibel is met het geselecteerd model (komt veel voor bij Resemble.ai en Cartesia), precies aangeeft wat je moet oplossen.

Lokaal vs. Cloud: Browserstemmen en Kokoro sturen nooit iets weg van je apparaat. Gemini, OpenAI, ElevenLabs, Cartesia en Resemble.ai sturen tekst naar hun servers (met gebruik van je API-sleutels) om de audio te genereren. Zie Privacy & Data voor details.

Stemkosten (TTS + STT) worden verzameld als voice_cost voor het gesprek, passend bij het one-shotpad.

Spraakinvoer (Speech-to-Text)

Dicteer je berichten in plaats van te typen. Klik op het microfoon-icoon in de composer om de opname te starten. Caiioo transcribeert wat je zegt en plaatst het in het berichtveld.

Kies hoe er wordt getranscribeerd:

Optie Type Privacy Installatie
Whisper (Browser) Lokaal Volledig privé GRATIS, draait op jouw apparaat
WhisperKit (iOS) Lokaal Volledig privé GRATIS, op het apparaat
whisper.cpp & Moonshine (Android) Lokaal Volledig privé GRATIS, op het apparaat
Browser Speech Lokaal Privé GRATIS, ingebouwd
ElevenLabs Scribe Cloud Nauwkeurig (goed voor niet-Engels) Voeg je ElevenLabs API-sleutel toe
Cartesia Ink Cloud Nauwkeurig, lage latentie Voeg je Cartesia API-sleutel toe

Lokale opties (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) houden je audio lokaal—er wordt niets naar een server gestuurd. ElevenLabs en Cartesia sturen audio naar hun servers voor transcriptie (met jouw API-sleutel) en bieden een hogere nauwkeurigheid, vooral voor niet-Engelse talen.

Hoe te gebruiken:

  1. Klik op het microfoon-icoon in de composer
  2. Spreek je bericht in
  3. Stop wanneer je klaar bent
  4. De transcriptie verschijnt in het berichtveld
  5. Bewerk indien nodig en verzend

Eerste installatie: De eerste keer dat je een lokaal spraakmodel gebruikt, moet het worden gedownload en opgewarmd. De composer toont de voortgang ("Spraakmodel downloaden… N%", daarna "Voorbereiden"/"Laden"), dus een korte pauze bij de eerste klik op de microfoon is normaal en geen vastloper.

Audio Opnemen en Bijvoegen

Naast dicteren kun je een fragment opnemen en aan je bericht toevoegen: open het +-menu in het invoerveld en kies Audio opnemen. Beschikbaar op iPhone, iPad, macOS en de browserextensie. Sluit naadloos aan bij apps die naar je opnames luisteren, zoals de uitspraakcoach "voor Talen".

Laat het Model naar Je Opname Luisteren

Functies die verder gaan dan transcriptie en waarmee een model dat kan horen met de daadwerkelijke audio kan werken:

  • Inclusief audio voor het model (Instellingen > Stem): voegt je opname toe zodat een audiodragend model (bijv. Gemini) de echte audio naast je prompt beoordeelt — toon, uitspraak, achtergrondgeluiden, en niet alleen de woorden. Standaard uitgeschakeld; er wordt anders niets verzonden. Een golfvormknop naast de microfoon schakelt dit per bericht in, maar de knop verschijnt alleen in modi en apps die hiervoor kiezen (zoals "voor Talen"), zodat het de invoer voor alledaagse taken niet overzichteloos maakt.
  • Horen (een gratis tool, standaard ingeschakeld): stelt de assistent in staat om terug te gaan en te luisteren naar audio-bijlagen met een gerichte vervolgvraag — "welke woorden werden verkeerd uitgesproken?", "wat is de toon van de stem?" — op het moment dat je deze bijvoegt of op elk later moment. Het speciale audio-hulpmodel voert het luisteren uit, dus dit werkt zelfs wanneer je chatmodel niet kan horen.

Systeembreed dicteren (macOS)

Pro-abonnees op macOS kunnen ook PrivateVoice installeren, een aparte bijbehorende app die een globale sneltoets toevoegt om in elke applicatie te dicteren — niet alleen in Caiioo. Zie de desktop-downloadpagina voor details.

Zie ook


This guide is maintained by the Caiioo team using Slate, our built-in editor.