Ito ay isang machine translation ng orihinal na dokumentong Ingles. Sa kaganapan ng anumang salungatan sa pagitan ng pagsasaling ito at ng orihinal na bersyong Ingles, ang bersyong Ingles ang mangingibabaw. Basahin ang orihinal na bersyong Ingles
Voice: Magsalita at Makinig
Gusto mo bang basahin ng AI ang mga tugon nang malakas? O idikta ang mga mensahe sa halip na i-type? Nag-aalok ang Caiioo ng voice input at output—lahat ay maaaring i-configure, ang ilan ay tumatakbo nang lokal sa iyong device.

Voice Output (Text-to-Speech)
Ipabasa nang malakas sa AI ang mga tugon nito. Pumili mula sa:
| Option | Type | Quality | Setup |
|---|---|---|---|
| Browser Default | Lokal | Basic | Libre, walang setup |
| Kokoro Neural TTS | Lokal | Mataas | Libre, tumatakbo sa iyong device |
| Google Gemini | Cloud | Natural | Idagdag ang iyong API key |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natural, naaayos na pagbigkas | Idagdag ang iyong OpenAI API key |
| ElevenLabs | Cloud | Premium | Idagdag ang iyong API key |
| Cartesia (Sonic 3.5) | Cloud | Premium | Idagdag ang iyong API key |
| Resemble.ai | Cloud | Napakahusay (voice cloning) | Idagdag ang iyong API key |
Laki ng pag-download ng Kokoro: Ang modelong Kokoro ay may dalawang variant, at kung alin ang mada-download ay nakadepende sa iyong platform. Naglo-load ang macOS at iOS ng mas maliit na modelong may INT8-quantized (~88 MB), habang ang extension/browser naman ay gumagamit ng mas malaking full-precision WebGPU build (~330 MB). Minsan lamang itong ida-download.
Mga tala sa platform:
- iOS native Kokoro (v0.9.720+): Tumatakbo sa iOS host process sa pamamagitan ng OnnxRuntime sa halip na WebView, na nag-aayos sa mga pag-crash sa iPhone 13/14.
- macOS Kokoro: Nagsa-stream bawat pangungusap (sa loob ng ~1s pagkatapos pindutin ang play) sa pamamagitan ng desktop helper process.
- Gemini TTS (v0.9.723+): Nagpe-play bawat pangungusap, kaya nagsisimula ang audio pagkatapos ng unang pangungusap sa halip na maghintay na matapos ma-synthesize ang buong tugon.
- OpenAI (v0.9.724+): gpt-4o-mini-tts na may naaayos na pagbigkas — humingi ng accent, tono, o bilis sa natural na wika (hal. "basahin ito nang may mainit na Irish accent") at susundin ito ng boses. Ginagamit nito ang parehong OpenAI API key tulad ng sa OpenAI LLM provider. Ang isang field na Voice style instructions sa Settings > Voice ay naglalapat ng iyong direktiba sa estilo sa bawat sinasalitang tugon.
- Cartesia (v0.9.723+): Pinapagana ng isang API key ang parehong Sonic 3.5 (output) at Ink (input). Walang default na boses—pumili ng isa sa Settings > Voice bago ito i-enable.
Latency: Binubuo ng Gemini at OpenAI ang buong tugon bago magsimula ang pag-playback, kaya maaaring maantala nang ilang segundo ang unang audio sa masahol na mga mas mahabang tugon — nagpapakita ang Settings > Voice ng tala kapag pumili ka ng isa sa kanila. Para sa mababang latency ng pagsasalita, pumili ng ElevenLabs, Cartesia, o Resemble.
Bilis ng pag-playback: Ang slider ng bilis (0.5×–2.0×) ay inilalapat ng provider para sa ElevenLabs (nilimitahan sa 0.7–1.2×) at Cartesia (nilimitahan sa 0.6–1.5×). Ang mga boses sa browser at Kokoro ay bumibilis nang lokal. Walang sariling kontrol sa bilis ang Gemini at OpenAI, kaya nakatago ang slider habang pinipili ang mga ito; inilalapat ng Resemble.ai ang bilis sa karaniwang (hindi nag-a-stream) pag-playback.
Para i-enable ito:
- Pumunta sa Settings > Voice
- Pumili ng opsyon sa text-to-speech
- I-toggle ang "Auto-read responses" kung gusto mong awtomatikong magbasa ang AI
- Ayusin ang bilis ng pag-playback kung gusto mo
Kung nabigo ang pag-playback: Ang mga error sa boses ay lumalabas na ngayon bilang toast sa halip na mabigo nang tahimik—kaya ang nawawala o di-valid na API key, o boses na hindi tugma sa napiling model (karaniwan sa Resemble.ai at Cartesia), ay magsasabi sa iyo nang eksakto kung ano ang dapat ayusin.
Lokal kumpara sa Cloud: Ang mga boses sa browser at Kokoro ay kailanman hindi nagpapadala ng anuman mula sa iyong device. Ang Gemini, OpenAI, ElevenLabs, Cartesia, at Resemble.ai ay nagpapadala ng teksto sa kanilang mga server (gamit ang iyong mga API key) upang buuin ang audio. Tingnan ang Privacy & Data para sa mga detalye.
Mga gastusin sa boses (TTS + STT) ay lumalabas bilang voice_cost sa usapan, na tumutugma sa one-shot path.
Voice Input (Speech-to-Text)
Idikta ang iyong mga mensahe sa halip na i-type ang mga ito. I-click ang microphone icon sa composer para magsimulang mag-record. I-tra-transcribe ng Caiioo ang iyong sinasabi at ilalagay ito sa message field.
Pumili kung paano ito mag-tra-transcribe:
| Opsyon | Uri | Privacy | Setup |
|---|---|---|---|
| Whisper (Browser) | Lokal | Ganap na pribado | FREE, tumatakbo sa iyong device |
| WhisperKit (iOS) | Lokal | Ganap na pribado | FREE, on-device |
| whisper.cpp & Moonshine (Android) | Lokal | Ganap na pribado | FREE, on-device |
| Browser Speech | Lokal | Pribado | FREE, built-in |
| ElevenLabs Scribe | Cloud | Tumpak (mahusay para sa hindi Ingles) | Idagdag ang iyong ElevenLabs API key |
| Cartesia Ink | Cloud | Tumpak, low-latency | Idagdag ang iyong Cartesia API key |
Ang mga lokal na opsyon (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) ay nagpapanatili ng iyong audio sa lokal—walang ipinapadala sa anumang server. Ang ElevenLabs at Cartesia ay nagpapadala ng audio sa kanilang mga server para sa transcription (gamit ang iyong API key) at nag-aalok ng mas mataas na katumpakan, lalo na para sa mga wikang hindi Ingles.
Para gamitin ito:
- I-click ang microphone icon sa composer
- Bigkasin ang iyong mensahe
- Itigil kapag tapos ka na
- Lalabas ang transcript sa message field
- I-edit kung kailangan, pagkatapos ay ipadala
First-time setup: Sa unang pagkakataon na gagamit ka ng on-device speech model, kailangan muna itong i-download at i-warm up. Ipinapakita ng composer ang progreso ("Downloading speech model… N%", pagkatapos ay "Preparing"/"Loading"), kaya asahan ang maikling paghinto sa iyong unang pag-tap sa mic.
Mag-record ng Audio at I-attach Ito
Bukod sa dictation, maaari kang mag-record ng clip at i-attach ito sa iyong mensahe: buksan ang + menu ng composer at piliin ang Record audio. Magagamit sa iPhone, iPad, macOS, at sa browser extension. Likas na ipinapares sa mga app na nakikinig sa iyong mga pag-record, tulad ng "for Languages" pronunciation coach.
Hayaan ang Modelo na Pakinggan ang Iyong Pag-record
Dalawang tampok ang lumalampas sa transcription at hinahayaan ang isang modelong nakakarinig na magtrabaho kasama ang aktwal na audio:
- Isama ang audio para sa modelo (Settings > Voice): inilalakip ang iyong pag-record upang ang isang modelong may kakayahang audio (hal. Gemini) ay suriin ang totoong audio kasama ng iyong prompt — tono, pagbigkas, mga tunog sa background, hindi lamang ang mga salita. Naka-off bilang default; walang ipinapadala kung hindi man. Ang isang waveform button sa tabi ng mic ay nag-i-toggle nito sa bawat mensahe, ngunit ang button ay lumilitaw lamang sa mga mode at app na nag-opt in dito (tulad ng "for Languages"), kaya hindi nito ginugulo ang composer para sa mga pang-araw-araw na gawain.
- Hearing (isang libreng tool, naka-off bilang default): hinahayaan ang katulong na bumalik at muling pakinggan ang anumang audio attachment na may naka-target na follow-up na tanong — "aling mga salita ang maling binigkas?", "ano ang tono ng boses?" — sa turn na inilalakip mo ito o sa anumang huli pa. Ang dedikadong audio helper model ang gumagawa ng pakikinig, kaya gumagana ito kahit na ang iyong chat model ay hindi makarinig.
System-Wide Dictation (macOS)
Ang mga Pro subscriber sa macOS ay maaari ding mag-install ng PrivateVoice, isang hiwalay na companion app na nagdaragdag ng global press-to-talk hotkey para sa pag-dictate sa anumang application—hindi lang sa Caiioo. Tingnan ang desktop download page para sa mga detalye.
Tingnan Din
- Privacy at Data — Paano pinangangasiwaan ang voice data
- Platform at Pag-set up — Availability ng desktop app at PrivateVoice
- Settings > Voice — I-configure ang mga voice option para sa iyong setup
This guide is maintained by the Caiioo team using Slate, our built-in editor.