Detta är en maskinöversättning av det engelska originaldokumentet. Vid eventuella avvikelser mellan denna översättning och den engelska originalversionen ska den engelska versionen ha företräde. Läs den engelska originalversionen
Röst: Tala och lyssna
Vill du att AI:n ska läsa upp svar? Eller diktera meddelanden istället för att skriva? Caiioo erbjuder röstinmatning och röstutmatning — allt konfigurerbart, vissa körs lokalt på din enhet.

Röstutmatning (Text-till-tal)
Låt AI:n läsa upp sina svar högt. Välj mellan:
| Alternativ | Typ | Kvalitet | Konfiguration |
|---|---|---|---|
| Webbläsarens standard | Lokalt | Enkel | Gratis, ingen konfiguration |
| Kokoro Neural TTS | Lokalt | Hög | Gratis, körs på din enhet |
| Google Gemini | Molnet | Naturlig | Lägg till din API-nyckel |
| OpenAI (gpt-4o-mini-tts) | Molnet | Naturlig, styrbar leverans | Lägg till din OpenAI API-nyckel |
| ElevenLabs | Molnet | Premium | Lägg till din API-nyckel |
| Cartesia (Sonic 3.5) | Molnet | Premium | Lägg till din API-nyckel |
| Resemble.ai | Molnet | Utmärkt (röstkloning) | Lägg till din API-nyckel |
Hämtningsstorlek för Kokoro: Kokoro-modellen levereras i två varianter, och vilken som laddas ner beror på din plattform. macOS och iOS laddar in den mindre INT8-kvantiserade modellen (~88 MB), medan tillägget/webbläsaren använder den större fullprecisionsversionen för WebGPU (~330 MB). Det är en engångsnedladdning.
Plattformsanteckningar:
- iOS-intern Kokoro (v0.9.720+): Körs i iOS-värdprocessen via OnnxRuntime i stället för WebView, vilket åtgärdar krascher på iPhone 13/14.
- macOS Kokoro: Strömmar mening för mening (inom ca 1 s efter att du tryckt på spela upp) via skrivbordets hjälpprocess.
- Gemini TTS (v0.9.723+): Spelar upp mening för mening, så att ljudet startar efter den första meningen i stället för att vänta på att hela svaret ska syntetiseras.
- OpenAI (v0.9.724+): gpt-4o-mini-tts med styrbar leverans – be om en accent, ton eller ett tempo på naturligt språk (t.ex. "läs detta med en varm irländsk accent") så följer rösten det. Använder samma OpenAI API-nyckel som OpenAI LLM-leverantören. Ett fält för Röststilsinstruktioner i Inställningar > Röst tillämpar ditt stildirektiv på varje talat svar.
- Cartesia (v0.9.723+): En enda API-nyckel driver både Sonic 3.5 (utmatning) och Ink (inmatning). Det finns ingen standardröst – välj en under Inställningar > Röst innan du aktiverar den.
Latens: Gemini och OpenAI renderar hela svaret innan uppspelningen börjar, vilket gör att det första ljudet kan fördröjas några sekunder vid längre svar – Inställningar > Röst visar en anmärkning när du väljer någon av dem. För tal med låg latens väljer du ElevenLabs, Cartesia eller Resemble.
Uppspelningshastighet: Hastighetsreglaget (0,5×–2,0×) tillämpas av leverantören för ElevenLabs (begränsat till 0,7–1,2×) och Cartesia (begränsat till 0,6–1,5×). Webbläsarröster och Kokoro ökar hastigheten lokalt. Gemini och OpenAI har ingen egen hastighetskontroll, så reglaget döljs när de är valda; Resemble.ai tillämpar hastigheten vid standarduppspelning (ej strömmande).
Så här aktiverar du det:
- Gå till Inställningar > Röst
- Välj ett text-till-tal-alternativ
- Aktivera "Läs upp svar automatiskt" om du vill att AI:n ska läsa upp automatiskt
- Justera uppspelningshastigheten om du vill
Om uppspelningen misslyckas: Röstfel visas nu som en popup-notifiering (toast) i stället för att misslyckas tyst – så en saknad eller ogiltig API-nyckel, eller en röst som inte är kompatibel med den valda modellen (vilket är vanligt med Resemble.ai och Cartesia), talar om exakt vad du behöver åtgärda.
Lokalt vs. Molnet: Webbläsarröster och Kokoro skickar aldrig iväg någonting från din enhet. Gemini, OpenAI, ElevenLabs, Cartesia och Resemble.ai skickar text till sina servrar (med hjälp av dina API-nycklar) för att generera ljudet. Se Sekretess och data för information.
Röstkostnader (TTS + STT) räknas samman som voice_cost för konversationen, vilket matchar engångsvägen.
Röstinmatning (Tal-till-text)
Diktera dina meddelanden istället för att skriva. Klicka på mikrofonikonen i kompositören för att börja spela in. Caiioo transkriberar vad du säger och lägger in det i meddelandefältet.
Välj hur det transkriberas:
| Alternativ | Typ | Integritet | Installation |
|---|---|---|---|
| Whisper (Webbläsare) | Lokal | Helt privat | Gratis, körs på din enhet |
| WhisperKit (iOS) | Lokal | Helt privat | Gratis, på enheten |
| whisper.cpp & Moonshine (Android) | Lokal | Helt privat | Gratis, på enheten |
| Webbläsartal | Lokal | Privat | Gratis, inbyggd |
| ElevenLabs Scribe | Moln | Exakt (bra för icke-engelska) | Lägg till din ElevenLabs API-nyckel |
| Cartesia Ink | Moln | Exakt, låg latens | Lägg till din Cartesia API-nyckel |
Lokala alternativ (Whisper, WhisperKit, whisper.cpp, Moonshine, Webbläsartal) behåller ditt ljud lokalt — inget skickas till någon server. ElevenLabs och Cartesia skickar ljud till sina servrar för transkribering (med din API-nyckel) och erbjuder högre noggrannhet, särskilt för andra språk än engelska.
För att använda det:
- Klicka på mikrofonikonen i kompositören
- Säg ditt meddelande
- Stoppa när du är klar
- Transkriberingen visas i meddelandefältet
- Redigera vid behov, skicka sedan
Förstagångsinställning: Första gången du använder en talmodell på enheten måste den laddas ner och förberedas. Kompositören visar framsteg ("Laddar ner talmodell... N%", sedan "Förbereder"/"Laddar"), så en kort paus vid ditt första tryck på mikrofonen är förväntat, inte ett häng.
Spela in ljud och bifoga det
Förutom diktering kan du spela in ett klipp och bifoga det till ditt meddelande: öppna kompositörens +-meny och välj Spela in ljud. Finns på iPhone, iPad, macOS och webbläsartillägget. Passar naturligt med appar som lyssnar på dina inspelningar, som uttalscoachen "for Languages".
Låt modellen höra din inspelning
Två funktioner går längre än transkription och låter en modell som kan höra arbeta med det faktiska ljudet:
- Inkludera ljud för modellen (Inställningar > Röst): bifogar din inspelning så att en ljudkapabel modell (t.ex. Gemini) granskar det verkliga ljudet tillsammans med din prompt – ton, uttal, bakgrundsljud, inte bara orden. Av som standard; ingenting skickas annars. En vågformsknapp bredvid mikron växlar det per meddelande, men knappen visas bara i lägen och appar som väljer att göra det (som "for Languages"), så den belamrar inte kompositören för vardagliga uppgifter.
- Hörsel (ett kostnadsfritt verktyg, på som standard): låter assistenten gå tillbaka och lyssna på valfri ljudbilaga igen med en riktad följdfråga – "vilka ord uttalades fel?", "vilken röstton är det?" – i den tur du bifogar det eller någon senare. Den dedikerade ljudhjälpmodellen utför lyssnandet, så detta fungerar även när din chattmodell inte kan höra.
Systemomfattande diktering (macOS)
Pro-prenumeranter på macOS kan också installera PrivateVoice, en separat medföljande app som lägger till en global snabbknapp för att diktera i vilket program som helst — inte bara Caiioo. Se nedladdningssidan för skrivbord för detaljer.
Se även
- Integritet & Data — Hur röstdata hanteras
- Plattform & Installation — Tillgänglighet för skrivbordsapp och PrivateVoice
- Inställningar > Röst — Konfigurera röstalternativ för din setup
This guide is maintained by the Caiioo team using Slate, our built-in editor.