Ito ay isang machine translation ng orihinal na dokumentong Ingles. Sa kaganapan ng anumang salungatan sa pagitan ng pagsasaling ito at ng orihinal na bersyong Ingles, ang bersyong Ingles ang mangingibabaw. Basahin ang orihinal na bersyong Ingles


Voice: Magsalita at Makinig

Gusto mo bang basahin ng AI ang mga tugon nang malakas? O idikta ang mga mensahe sa halip na i-type? Nag-aalok ang Caiioo ng voice input at output—lahat ay maaaring i-configure, ang ilan ay tumatakbo nang lokal sa iyong device.

Voice settings na may mga input at output option, auto-read toggle, at playback speed

Voice Output (Text-to-Speech)

Ipabasa nang malakas sa AI ang mga tugon nito. Pumili mula sa:

Option Type Quality Setup
Browser Default Lokal Basic Libre, walang setup
Kokoro Neural TTS Lokal Mataas Libre, tumatakbo sa iyong device
Google Gemini Cloud Natural Idagdag ang iyong API key
OpenAI (gpt-4o-mini-tts) Cloud Natural, naaayos na pagbigkas Idagdag ang iyong OpenAI API key
ElevenLabs Cloud Premium Idagdag ang iyong API key
Cartesia (Sonic 3.5) Cloud Premium Idagdag ang iyong API key
Resemble.ai Cloud Napakahusay (voice cloning) Idagdag ang iyong API key

Laki ng pag-download ng Kokoro: Ang modelong Kokoro ay may dalawang variant, at kung alin ang mada-download ay nakadepende sa iyong platform. Naglo-load ang macOS at iOS ng mas maliit na modelong may INT8-quantized (~88 MB), habang ang extension/browser naman ay gumagamit ng mas malaking full-precision WebGPU build (~330 MB). Minsan lamang itong ida-download.

Mga tala sa platform:

  • iOS native Kokoro (v0.9.720+): Tumatakbo sa iOS host process sa pamamagitan ng OnnxRuntime sa halip na WebView, na nag-aayos sa mga pag-crash sa iPhone 13/14.
  • macOS Kokoro: Nagsa-stream bawat pangungusap (sa loob ng ~1s pagkatapos pindutin ang play) sa pamamagitan ng desktop helper process.
  • Gemini TTS (v0.9.723+): Nagpe-play bawat pangungusap, kaya nagsisimula ang audio pagkatapos ng unang pangungusap sa halip na maghintay na matapos ma-synthesize ang buong tugon.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts na may naaayos na pagbigkas — humingi ng accent, tono, o bilis sa natural na wika (hal. "basahin ito nang may mainit na Irish accent") at susundin ito ng boses. Ginagamit nito ang parehong OpenAI API key tulad ng sa OpenAI LLM provider. Ang isang field na Voice style instructions sa Settings > Voice ay naglalapat ng iyong direktiba sa estilo sa bawat sinasalitang tugon.
  • Cartesia (v0.9.723+): Pinapagana ng isang API key ang parehong Sonic 3.5 (output) at Ink (input). Walang default na boses—pumili ng isa sa Settings > Voice bago ito i-enable.

Latency: Binubuo ng Gemini at OpenAI ang buong tugon bago magsimula ang pag-playback, kaya maaaring maantala nang ilang segundo ang unang audio sa masahol na mga mas mahabang tugon — nagpapakita ang Settings > Voice ng tala kapag pumili ka ng isa sa kanila. Para sa mababang latency ng pagsasalita, pumili ng ElevenLabs, Cartesia, o Resemble.

Bilis ng pag-playback: Ang slider ng bilis (0.5×–2.0×) ay inilalapat ng provider para sa ElevenLabs (nilimitahan sa 0.7–1.2×) at Cartesia (nilimitahan sa 0.6–1.5×). Ang mga boses sa browser at Kokoro ay bumibilis nang lokal. Walang sariling kontrol sa bilis ang Gemini at OpenAI, kaya nakatago ang slider habang pinipili ang mga ito; inilalapat ng Resemble.ai ang bilis sa karaniwang (hindi nag-a-stream) pag-playback.

Para i-enable ito:

  1. Pumunta sa Settings > Voice
  2. Pumili ng opsyon sa text-to-speech
  3. I-toggle ang "Auto-read responses" kung gusto mong awtomatikong magbasa ang AI
  4. Ayusin ang bilis ng pag-playback kung gusto mo

Kung nabigo ang pag-playback: Ang mga error sa boses ay lumalabas na ngayon bilang toast sa halip na mabigo nang tahimik—kaya ang nawawala o di-valid na API key, o boses na hindi tugma sa napiling model (karaniwan sa Resemble.ai at Cartesia), ay magsasabi sa iyo nang eksakto kung ano ang dapat ayusin.

Lokal kumpara sa Cloud: Ang mga boses sa browser at Kokoro ay kailanman hindi nagpapadala ng anuman mula sa iyong device. Ang Gemini, OpenAI, ElevenLabs, Cartesia, at Resemble.ai ay nagpapadala ng teksto sa kanilang mga server (gamit ang iyong mga API key) upang buuin ang audio. Tingnan ang Privacy & Data para sa mga detalye.

Mga gastusin sa boses (TTS + STT) ay lumalabas bilang voice_cost sa usapan, na tumutugma sa one-shot path.

Voice Input (Speech-to-Text)

Idikta ang iyong mga mensahe sa halip na i-type ang mga ito. I-click ang microphone icon sa composer para magsimulang mag-record. I-tra-transcribe ng Caiioo ang iyong sinasabi at ilalagay ito sa message field.

Pumili kung paano ito mag-tra-transcribe:

Opsyon Uri Privacy Setup
Whisper (Browser) Lokal Ganap na pribado FREE, tumatakbo sa iyong device
WhisperKit (iOS) Lokal Ganap na pribado FREE, on-device
whisper.cpp & Moonshine (Android) Lokal Ganap na pribado FREE, on-device
Browser Speech Lokal Pribado FREE, built-in
ElevenLabs Scribe Cloud Tumpak (mahusay para sa hindi Ingles) Idagdag ang iyong ElevenLabs API key
Cartesia Ink Cloud Tumpak, low-latency Idagdag ang iyong Cartesia API key

Ang mga lokal na opsyon (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) ay nagpapanatili ng iyong audio sa lokal—walang ipinapadala sa anumang server. Ang ElevenLabs at Cartesia ay nagpapadala ng audio sa kanilang mga server para sa transcription (gamit ang iyong API key) at nag-aalok ng mas mataas na katumpakan, lalo na para sa mga wikang hindi Ingles.

Para gamitin ito:

  1. I-click ang microphone icon sa composer
  2. Bigkasin ang iyong mensahe
  3. Itigil kapag tapos ka na
  4. Lalabas ang transcript sa message field
  5. I-edit kung kailangan, pagkatapos ay ipadala

First-time setup: Sa unang pagkakataon na gagamit ka ng on-device speech model, kailangan muna itong i-download at i-warm up. Ipinapakita ng composer ang progreso ("Downloading speech model… N%", pagkatapos ay "Preparing"/"Loading"), kaya asahan ang maikling paghinto sa iyong unang pag-tap sa mic.

Mag-record ng Audio at I-attach Ito

Bukod sa dictation, maaari kang mag-record ng clip at i-attach ito sa iyong mensahe: buksan ang + menu ng composer at piliin ang Record audio. Magagamit sa iPhone, iPad, macOS, at sa browser extension. Likas na ipinapares sa mga app na nakikinig sa iyong mga pag-record, tulad ng "for Languages" pronunciation coach.

Hayaan ang Modelo na Pakinggan ang Iyong Pag-record

Dalawang tampok ang lumalampas sa transcription at hinahayaan ang isang modelong nakakarinig na magtrabaho kasama ang aktwal na audio:

  • Isama ang audio para sa modelo (Settings > Voice): inilalakip ang iyong pag-record upang ang isang modelong may kakayahang audio (hal. Gemini) ay suriin ang totoong audio kasama ng iyong prompt — tono, pagbigkas, mga tunog sa background, hindi lamang ang mga salita. Naka-off bilang default; walang ipinapadala kung hindi man. Ang isang waveform button sa tabi ng mic ay nag-i-toggle nito sa bawat mensahe, ngunit ang button ay lumilitaw lamang sa mga mode at app na nag-opt in dito (tulad ng "for Languages"), kaya hindi nito ginugulo ang composer para sa mga pang-araw-araw na gawain.
  • Hearing (isang libreng tool, naka-off bilang default): hinahayaan ang katulong na bumalik at muling pakinggan ang anumang audio attachment na may naka-target na follow-up na tanong — "aling mga salita ang maling binigkas?", "ano ang tono ng boses?" — sa turn na inilalakip mo ito o sa anumang huli pa. Ang dedikadong audio helper model ang gumagawa ng pakikinig, kaya gumagana ito kahit na ang iyong chat model ay hindi makarinig.

System-Wide Dictation (macOS)

Ang mga Pro subscriber sa macOS ay maaari ding mag-install ng PrivateVoice, isang hiwalay na companion app na nagdaragdag ng global press-to-talk hotkey para sa pag-dictate sa anumang application—hindi lang sa Caiioo. Tingnan ang desktop download page para sa mga detalye.

Tingnan Din

  • Privacy at Data — Paano pinangangasiwaan ang voice data
  • Platform at Pag-set up — Availability ng desktop app at PrivateVoice
  • Settings > Voice — I-configure ang mga voice option para sa iyong setup

This guide is maintained by the Caiioo team using Slate, our built-in editor.