Detta är en maskinöversättning av det engelska originaldokumentet. Vid eventuella avvikelser mellan denna översättning och den engelska originalversionen ska den engelska versionen ha företräde. Läs den engelska originalversionen


Röst: Tala och lyssna

Vill du att AI:n ska läsa upp svar? Eller diktera meddelanden istället för att skriva? Caiioo erbjuder röstinmatning och röstutmatning — allt konfigurerbart, vissa körs lokalt på din enhet.

Röstinställningar med in- och utmatningsalternativ, reglage för automatisk uppläsning och uppspelningshastighet

Röstutmatning (Text-till-tal)

Låt AI:n läsa upp sina svar högt. Välj mellan:

Alternativ Typ Kvalitet Konfiguration
Webbläsarens standard Lokalt Enkel Gratis, ingen konfiguration
Kokoro Neural TTS Lokalt Hög Gratis, körs på din enhet
Google Gemini Molnet Naturlig Lägg till din API-nyckel
OpenAI (gpt-4o-mini-tts) Molnet Naturlig, styrbar leverans Lägg till din OpenAI API-nyckel
ElevenLabs Molnet Premium Lägg till din API-nyckel
Cartesia (Sonic 3.5) Molnet Premium Lägg till din API-nyckel
Resemble.ai Molnet Utmärkt (röstkloning) Lägg till din API-nyckel

Hämtningsstorlek för Kokoro: Kokoro-modellen levereras i två varianter, och vilken som laddas ner beror på din plattform. macOS och iOS laddar in den mindre INT8-kvantiserade modellen (~88 MB), medan tillägget/webbläsaren använder den större fullprecisionsversionen för WebGPU (~330 MB). Det är en engångsnedladdning.

Plattformsanteckningar:

  • iOS-intern Kokoro (v0.9.720+): Körs i iOS-värdprocessen via OnnxRuntime i stället för WebView, vilket åtgärdar krascher på iPhone 13/14.
  • macOS Kokoro: Strömmar mening för mening (inom ca 1 s efter att du tryckt på spela upp) via skrivbordets hjälpprocess.
  • Gemini TTS (v0.9.723+): Spelar upp mening för mening, så att ljudet startar efter den första meningen i stället för att vänta på att hela svaret ska syntetiseras.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts med styrbar leverans – be om en accent, ton eller ett tempo på naturligt språk (t.ex. "läs detta med en varm irländsk accent") så följer rösten det. Använder samma OpenAI API-nyckel som OpenAI LLM-leverantören. Ett fält för Röststilsinstruktioner i Inställningar > Röst tillämpar ditt stildirektiv på varje talat svar.
  • Cartesia (v0.9.723+): En enda API-nyckel driver både Sonic 3.5 (utmatning) och Ink (inmatning). Det finns ingen standardröst – välj en under Inställningar > Röst innan du aktiverar den.

Latens: Gemini och OpenAI renderar hela svaret innan uppspelningen börjar, vilket gör att det första ljudet kan fördröjas några sekunder vid längre svar – Inställningar > Röst visar en anmärkning när du väljer någon av dem. För tal med låg latens väljer du ElevenLabs, Cartesia eller Resemble.

Uppspelningshastighet: Hastighetsreglaget (0,5×–2,0×) tillämpas av leverantören för ElevenLabs (begränsat till 0,7–1,2×) och Cartesia (begränsat till 0,6–1,5×). Webbläsarröster och Kokoro ökar hastigheten lokalt. Gemini och OpenAI har ingen egen hastighetskontroll, så reglaget döljs när de är valda; Resemble.ai tillämpar hastigheten vid standarduppspelning (ej strömmande).

Så här aktiverar du det:

  1. Gå till Inställningar > Röst
  2. Välj ett text-till-tal-alternativ
  3. Aktivera "Läs upp svar automatiskt" om du vill att AI:n ska läsa upp automatiskt
  4. Justera uppspelningshastigheten om du vill

Om uppspelningen misslyckas: Röstfel visas nu som en popup-notifiering (toast) i stället för att misslyckas tyst – så en saknad eller ogiltig API-nyckel, eller en röst som inte är kompatibel med den valda modellen (vilket är vanligt med Resemble.ai och Cartesia), talar om exakt vad du behöver åtgärda.

Lokalt vs. Molnet: Webbläsarröster och Kokoro skickar aldrig iväg någonting från din enhet. Gemini, OpenAI, ElevenLabs, Cartesia och Resemble.ai skickar text till sina servrar (med hjälp av dina API-nycklar) för att generera ljudet. Se Sekretess och data för information.

Röstkostnader (TTS + STT) räknas samman som voice_cost för konversationen, vilket matchar engångsvägen.

Röstinmatning (Tal-till-text)

Diktera dina meddelanden istället för att skriva. Klicka på mikrofonikonen i kompositören för att börja spela in. Caiioo transkriberar vad du säger och lägger in det i meddelandefältet.

Välj hur det transkriberas:

Alternativ Typ Integritet Installation
Whisper (Webbläsare) Lokal Helt privat Gratis, körs på din enhet
WhisperKit (iOS) Lokal Helt privat Gratis, på enheten
whisper.cpp & Moonshine (Android) Lokal Helt privat Gratis, på enheten
Webbläsartal Lokal Privat Gratis, inbyggd
ElevenLabs Scribe Moln Exakt (bra för icke-engelska) Lägg till din ElevenLabs API-nyckel
Cartesia Ink Moln Exakt, låg latens Lägg till din Cartesia API-nyckel

Lokala alternativ (Whisper, WhisperKit, whisper.cpp, Moonshine, Webbläsartal) behåller ditt ljud lokalt — inget skickas till någon server. ElevenLabs och Cartesia skickar ljud till sina servrar för transkribering (med din API-nyckel) och erbjuder högre noggrannhet, särskilt för andra språk än engelska.

För att använda det:

  1. Klicka på mikrofonikonen i kompositören
  2. Säg ditt meddelande
  3. Stoppa när du är klar
  4. Transkriberingen visas i meddelandefältet
  5. Redigera vid behov, skicka sedan

Förstagångsinställning: Första gången du använder en talmodell på enheten måste den laddas ner och förberedas. Kompositören visar framsteg ("Laddar ner talmodell... N%", sedan "Förbereder"/"Laddar"), så en kort paus vid ditt första tryck på mikrofonen är förväntat, inte ett häng.

Spela in ljud och bifoga det

Förutom diktering kan du spela in ett klipp och bifoga det till ditt meddelande: öppna kompositörens +-meny och välj Spela in ljud. Finns på iPhone, iPad, macOS och webbläsartillägget. Passar naturligt med appar som lyssnar på dina inspelningar, som uttalscoachen "for Languages".

Låt modellen höra din inspelning

Två funktioner går längre än transkription och låter en modell som kan höra arbeta med det faktiska ljudet:

  • Inkludera ljud för modellen (Inställningar > Röst): bifogar din inspelning så att en ljudkapabel modell (t.ex. Gemini) granskar det verkliga ljudet tillsammans med din prompt – ton, uttal, bakgrundsljud, inte bara orden. Av som standard; ingenting skickas annars. En vågformsknapp bredvid mikron växlar det per meddelande, men knappen visas bara i lägen och appar som väljer att göra det (som "for Languages"), så den belamrar inte kompositören för vardagliga uppgifter.
  • Hörsel (ett kostnadsfritt verktyg, på som standard): låter assistenten gå tillbaka och lyssna på valfri ljudbilaga igen med en riktad följdfråga – "vilka ord uttalades fel?", "vilken röstton är det?" – i den tur du bifogar det eller någon senare. Den dedikerade ljudhjälpmodellen utför lyssnandet, så detta fungerar även när din chattmodell inte kan höra.

Systemomfattande diktering (macOS)

Pro-prenumeranter på macOS kan också installera PrivateVoice, en separat medföljande app som lägger till en global snabbknapp för att diktera i vilket program som helst — inte bara Caiioo. Se nedladdningssidan för skrivbord för detaljer.

Se även


This guide is maintained by the Caiioo team using Slate, our built-in editor.