Detta är en maskinöversättning av det engelska originaldokumentet. Vid eventuella avvikelser mellan denna översättning och den engelska originalversionen ska den engelska versionen ha företräde. Läs den engelska originalversionen
Röst: Tala och lyssna
Vill du att AI:n ska läsa upp svar? Eller diktera meddelanden istället för att skriva? Caiioo erbjuder röstinmatning och röstutmatning — allt konfigurerbart, vissa körs lokalt på din enhet.

Röstutmatning (Text-till-tal)
Låt AI:n läsa upp sina svar högt. Välj mellan:
| Alternativ | Typ | Kvalitet | Installation |
|---|---|---|---|
| Webbläsarens standard | Lokal | Enkel | Gratis, ingen installation |
| Kokoro Neural TTS | Lokal | Hög | Gratis, körs på din enhet |
| Google Gemini | Moln | Naturlig | Lägg till din API-nyckel |
| OpenAI (gpt-4o-mini-tts) | Moln | Naturlig, styrbar leverans | Lägg till din OpenAI API-nyckel |
| ElevenLabs | Moln | Premium | Lägg till din API-nyckel |
| Cartesia (Sonic 3.5) | Moln | Premium | Lägg till din API-nyckel |
| Resemble.ai | Moln | Utmärkt (röstkloning) | Lägg till din API-nyckel |
Hämtningsstorlek för Kokoro: Kokoro-modellen levereras i två varianter, och vilken som hämtas beror på din plattform. macOS och iOS läser in den mindre INT8-kvantiserade modellen (~88 MB), medan tillägget/webbläsaren använder den större med full precision byggda WebGPU-versionen (~330 MB). Det är en engångshämtning.
Plattformsanteckningar:
- Inbyggd Kokoro för iOS (v0.9.720+): Körs i iOS-värdprocessen via OnnxRuntime i stället för WebView, vilket åtgärdar krascher på iPhone 13/14.
- Kokoro för macOS: Strömmar mening för mening (inom ca 1 s efter att du trycker på spela upp) via skrivbordets hjälpprocess.
- Gemini TTS (v0.9.723+): Spelar upp mening för mening, vilket gör att ljudet startar efter den första meningen i stället för att vänta på att hela svaret ska syntetiseras.
- OpenAI (v0.9.724+): gpt-4o-mini-tts med styrbar leverans — be om en accent, ton eller ett tempo med vanligt språk (t.ex. "läs detta med en varm irländsk accent") så följer rösten det. Använder samma OpenAI API-nyckel som OpenAI LLM-leverantören. Ett fält för Röststilsinstruktioner i Inställningar > AI-inställningar > Röst tillämpar ditt stildirektiv på varje uppläst svar.
- Cartesia (v0.9.723+): En enda API-nyckel driver både Sonic 3.5 (utdata) och Ink (indata). Det finns ingen standardröst — välj en i Inställningar > AI-inställningar > Röst innan du aktiverar den.
- ElevenLabs: Varje ElevenLabs-röst börjar tala så snart den har något att säga — inklusive den uttrycksfulla v3, som kan väljas i röstväljaren. Standardröstmodellen är Flash v2.5: ElevenLabs klassar den som likvärdig i kvalitet med den föregående standarden, och den kostar hälften så mycket per tecken.
- ElevenLabs v3 Conversational (v0.9.777+): Välj v3 Conversational-modellen i röstmodellistan för uttrycksfull dialog med låg latens på mer än 70 språk. ElevenLabs debiterar för närvarande hälften av standardpriset per tecken, och Caiioos kostnadsuppskattningar återspeglar det.
Latens: Gemini och OpenAI renderar hela svaret innan uppspelningen börjar, så det första ljudet kan fördröjas några sekunder vid längre svar — Inställningar > AI-inställningar > Röst visar en anmärkning när du väljer någon av dem. För tal med låg latens väljer du ElevenLabs, Cartesia eller Resemble.
Uppspelningshastighet: Hastighetsreglaget (0,5×–2,0×) tillämpas av leverantören för ElevenLabs (begränsat till 0,7–1,2×) och Cartesia (begränsat till 0,6–1,5×). Webbläsarröster och Kokoro ökar hastigheten lokalt. Gemini och OpenAI har ingen egen hastighetskontroll, så reglaget är dolt medan de är valda; Resemble.ai tillämpar hastigheten vid standarduppspelning (utan strömning). Ett undantag: ElevenLabs v3-modellerna (v3 och v3 Conversational) kan inte ändra hastighet på egen hand, så Caiioo tillämpar din hastighet under uppspelning i stället, vilket håller tonhöjden naturlig — nackdelen är att när reglaget inte står på normalt väntar de på hela klippet innan de börjar tala. Vid normal hastighet startar de fortfarande direkt.
Caiioo kan välja en röst som passar stunden: när uppläsning av något är en del av en uppgift kan AI:n välja röst, talhastighet och talmodell som passar innehållet — en annan röst för en godnattsaga än för en nyhetssammanfattning — i stället för att alltid använda din globala röstinställning. Dina egna inställningar förblir standard för allt annat.
Så här aktiverar du det:
- Gå till Inställningar > AI-inställningar > Röst
- Välj ett text-till-tal-alternativ
- Aktivera "Läs upp svar automatiskt" om du vill att AI:n ska läsa automatiskt
- Justera uppspelningshastigheten om du vill
Om uppspelningen misslyckas: Röstfel visas nu som en meddelanderuta (toast) i stället för att misslyckas i tysthet — så att en saknad eller ogiltig API-nyckel, eller en röst som inte är kompatibel med den valda modellen (vilket är vanligt med Resemble.ai och Cartesia), talar om exakt vad du behöver åtgärda.
Lokal vs Moln: Webbläsarröster och Kokoro skickar aldrig något från din enhet. Gemini, OpenAI, ElevenLabs, Cartesia och Resemble.ai skickar text till sina servrar (med hjälp av dina API-nycklar) för att generera ljudet. Se Integritet och data för mer information.
Röstkostnader (TTS + STT) räknas samman som voice_cost för konversationen, vilket matchar engångssökvägen.
Röstinmatning (Tal-till-text)
Diktera dina meddelanden istället för att skriva. Klicka på mikrofonikonen i kompositören för att börja spela in. Caiioo transkriberar vad du säger och lägger in det i meddelandefältet.
Välj hur det transkriberas:
| Alternativ | Typ | Integritet | Installation |
|---|---|---|---|
| Whisper (Webbläsare) | Lokal | Helt privat | Gratis, körs på din enhet |
| WhisperKit (iOS) | Lokal | Helt privat | Gratis, på enheten |
| whisper.cpp & Moonshine (Android) | Lokal | Helt privat | Gratis, på enheten |
| Webbläsartal | Lokal | Privat | Gratis, inbyggd |
| ElevenLabs Scribe | Moln | Exakt (bra för icke-engelska) | Lägg till din ElevenLabs API-nyckel |
| Cartesia Ink | Moln | Exakt, låg latens | Lägg till din Cartesia API-nyckel |
Lokala alternativ (Whisper, WhisperKit, whisper.cpp, Moonshine, Webbläsartal) behåller ditt ljud lokalt — inget skickas till någon server. ElevenLabs och Cartesia skickar ljud till sina servrar för transkribering (med din API-nyckel) och erbjuder högre noggrannhet, särskilt för andra språk än engelska.
För att använda det:
- Klicka på mikrofonikonen i kompositören
- Säg ditt meddelande
- Stoppa när du är klar
- Transkriberingen visas i meddelandefältet
- Redigera vid behov, skicka sedan
Förstagångsinställning: Första gången du använder en talmodell på enheten måste den laddas ner och förberedas. Kompositören visar framsteg ("Laddar ner talmodell... N%", sedan "Förbereder"/"Laddar"), så en kort paus vid ditt första tryck på mikrofonen är förväntat, inte ett häng.
Spela in ljud och bifoga det
Förutom diktering kan du spela in ett klipp och bifoga det till ditt meddelande: öppna kompositörens +-meny och välj Spela in ljud. Finns på iPhone, iPad, macOS och webbläsartillägget. Passar naturligt med appar som lyssnar på dina inspelningar, som uttalscoachen "for Languages".
Låt modellen höra din inspelning
Två funktioner går bortom transkribering och låter en modell som kan höra arbeta med det faktiska ljudet:
- Inkludera ljud för modellen (Inställningar > AI-installation > Röst): bifogar din inspelning så att en ljudkompatibel modell (t.ex. Gemini) granskar det verkliga ljudet tillsammans med din prompt — ton, uttal, bakgrundsljud, inte baraorden. Av som standard; ingenting skickas annars. En vågforms knapp bredvid mikron växlar det per meddelande, men knappen visas bara i lägen och appar som väljer att göra det (som "för språk"), så den rör inte till kompositören för vardagliga uppgifter.
- Hörsel (ett gratis verktyg, på som standard): låter assistenten gå tillbaka och lyssna på valfri ljudbilaga med en riktad följdfråga — "vilka ord uttalades fel?", "vilken röstton är det?" — på den vända du bifogar den eller någon senare. Den dedikerade ljudhjälpmodellen gör lyssnandet, så detta fungerar även när din chattmodell inte kan höra.
Systemomspännande diktering (Skrivbord)
Diktera i vilken applikation som helst på din dator — inte bara Caiioo:
Pro-prenumeranter har systemomspännande diktering inbyggt i skrivbordsapparna för macOS, Windows och Linux — ingen extra app behöver installeras. Håll ned dikteringssnabbknappen var som helst, tala, och det du säger skrivs in i den app som är aktiv.
Se även
- Integritet & Data — Hur röstdata hanteras
- Plattform & Installation — Tillgänglighet för skrivbordsapp
- Inställningar > AI-installation > Röst — Konfigurera röstalternativ för din installation
This guide is maintained by the Caiioo team using Slate, our built-in editor.