Ito ay isang machine translation ng orihinal na dokumentong Ingles. Sa kaganapan ng anumang salungatan sa pagitan ng pagsasaling ito at ng orihinal na bersyong Ingles, ang bersyong Ingles ang mangingibabaw. Basahin ang orihinal na bersyong Ingles


Voice: Magsalita at Makinig

Gusto mo bang basahin ng AI ang mga tugon nang malakas? O idikta ang mga mensahe sa halip na i-type? Nag-aalok ang Caiioo ng voice input at output—lahat ay maaaring i-configure, ang ilan ay tumatakbo nang lokal sa iyong device.

Voice settings na may mga input at output option, auto-read toggle, at playback speed

Voice Output (Text-to-Speech)

Hayaing basahin ng AI ang mga tugon nito nang malakas. Pumili mula sa:

Opsyon Uri Kalidad Setup
Browser Default Lokal Pangkaraniwan Libre, walang setup
Kokoro Neural TTS Lokal Mataas Libre, tumatakbo sa iyong device
Google Gemini Cloud Natural Magdagdag ng iyong API key
OpenAI (gpt-4o-mini-tts) Cloud Natural, nakokontrol na pagbigkas Magdagdag ng iyong OpenAI API key
ElevenLabs Cloud Premium Magdagdag ng iyong API key
Cartesia (Sonic 3.5) Cloud Premium Magdagdag ng iyong API key
Resemble.ai Cloud Napakahusay (voice cloning) Magdagdag ng iyong API key

Laki ng pag-download ng Kokoro: Ang Kokoro model ay may dalawang uri, at kung aling uri ang manginginig ay nakadepende sa iyong platform. Ang macOS at iOS ay naglo-load ng mas maliit na INT8-quantized model (~88 MB), habang ang extension/browser ay gumagamit ng mas malaking full-precision WebGPU build (~330 MB). Isang beses lamang ito ida-download.

Mga tala sa platform:

  • iOS native Kokoro (v0.9.720+): Tumatakbo sa iOS host process sa pamamagitan ng OnnxRuntime sa halip na WebView, na nag-aayos sa mga pag-crash sa iPhone 13/14.
  • macOS Kokoro: Nagsi-stream ng pangungusap-bawat-pangungusap (sa loob ng ~1s mula sa pagpindot ng play) sa pamamagitan ng desktop helper process.
  • Gemini TTS (v0.9.723+): Nagtataas ng pangungusap-bawat-pangungusap, kaya magsisimula ang audio pagkatapos ng unang pangungusap sa halip na maghintay na mabuo ang buong tugon.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts na may nakokontrol na pagbigkas — humingi ng accent, tono, o bilis sa natural na wika (hal. "basahin ito nang may mainit na Irish accent") at susundin ito ng boses. Ginagamit nito ang parehong OpenAI API key tulad ng OpenAI LLM provider. Ang isang field na Voice style instructions sa Settings > AI Setup > Voice ay naglalapat ng iyong direktiba sa estilo sa bawat sinasalitang tugon.
  • Cartesia (v0.9.723+): Pinapatakbo ng isang API key ang parehong Sonic 3.5 (output) at Ink (input). Walang default na boses—pumili ng isa sa Settings > AI Setup > Voice bago ito paganahin.
  • ElevenLabs: Ang bawat boses ng ElevenLabs ay nagsisimulang magsalita sa sandaling mayroon itong sasabihin — kasama ang nagpapahayag na v3, na maaaring piliin sa voice picker. Ang default voice model ay Flash v2.5: Itinuturing ito ng ElevenLabs na katumbas ang kalidad sa nakaraang default, at kalahati ang gastos bawat character.
  • ElevenLabs v3 Conversational (v0.9.777+): Piliin ang v3 Conversational model sa listahan ng voice model para sa nagpapahayag, mababang-latency na diyalogo sa higit sa 70 mga wika. Kasalukuyang sinisingil ito ng ElevenLabs sa kalahati ng karaniwang singil bawat character, at ipinapakita ito ng mga pagtatantya ng gastos ng Caiioo.

Latency: Ang Gemini at OpenAI ay nagre-render ng buong tugon bago magsimula ang pag-playback, kaya ang unang audio ay maaaring maantala ng ilang segundo sa masahol na mga tugon — nagpapakita ang Settings > AI Setup > Voice ng isang tala kapag pumili ka ng isa sa kanila. Para sa mababang-latency na pananalita, pumili ng ElevenLabs, Cartesia, o Resemble.

Bilis ng pag-playback: Ang slider ng bilis (0.5×–2.0×) ay inilalapat ng provider para sa ElevenLabs (nakatali sa 0.7–1.2×) at Cartesia (nakatali sa 0.6–1.5×). Ang mga boses ng browser at Kokoro ay bumibilis nang lokal. Ang Gemini at OpenAI ay walang sariling kontrol sa bilis, kaya nakatago ang slider habang pinipili ang mga ito; inilalapat ng Resemble.ai ang bilis sa karaniwan (non-streaming) na pag-playback. Isang pagbubukod: ang mga model ng ElevenLabs v3 (v3 at v3 Conversational) ay hindi kayang baguhin ang bilis sa kanilang sarili, kaya inilalapat ng Caiioo ang iyong bilis sa panahon ng pag-playback, pinapanatili ang natural na pitch — ang kabayaran ay sa pagpapanatili ng slider palayo sa normal, naghihintay sila para sa buong clip bago magsimulang magsalita. Sa normal na bilis, nagsisimula pa rin sila kaagad.

Maaaring pumili ang Caiioo ng boses na babagay sa sandali: kapag ang pagbasa ng isang bagay nang malakas ay bahagi ng isang gawain, ang AI ay maaaring pumili ng boses, bilis ng pagsasalita, at speech model na angkop sa nilalaman — ibang boses para sa kuwento bago matulog kaysa sa buod ng balita — sa halip na laging gamit ang iyong global voice setting. Ang iyong sariling mga setting ay nananatiling default para sa lahat ng iba pa.

Para paganahin ito:

  1. Pumunta sa Settings > AI Setup > Voice
  2. Pumili ng opsyon sa text-to-speech
  3. I-toggle ang "Auto-read responses" kung nais mong basahin nang awtomatiko ng AI
  4. Ayusin ang bilis ng pag-playback kung nais mo

Kung mabigo ang pag-playback: Ang mga error sa boses ay lumilitaw ngayon bilang isang toast sa halip na mabigo nang tahimik—kaya ang nawawala o hindi wastong API key, o boses na hindi tugma sa napiling modelo (karaniwan sa Resemble.ai at Cartesia), ay nagsasabi sa iyo nang eksakto kung ano ang aayusin.

Lokal kumpara sa Cloud: Ang mga boses ng browser at Kokoro ay hindi kailanman nagpapadala ng anuman mula sa iyong device. Ang Gemini, OpenAI, ElevenLabs, Cartesia, at Resemble.ai ay nagpapadala ng teksto sa kanilang mga server (gamit ang iyong mga API key) upang buuin ang audio. Tingnan ang Privacy & Data para sa mga detalye.

Mga gastos sa boses (TTS + STT) ay naiipon bilang voice_cost sa pag-uusap, na tumutugma sa one-shot path.

Voice Input (Speech-to-Text)

Idikta ang iyong mga mensahe sa halip na i-type ang mga ito. I-click ang microphone icon sa composer para magsimulang mag-record. I-tra-transcribe ng Caiioo ang iyong sinasabi at ilalagay ito sa message field.

Pumili kung paano ito mag-tra-transcribe:

Opsyon Uri Privacy Setup
Whisper (Browser) Lokal Ganap na pribado FREE, tumatakbo sa iyong device
WhisperKit (iOS) Lokal Ganap na pribado FREE, on-device
whisper.cpp & Moonshine (Android) Lokal Ganap na pribado FREE, on-device
Browser Speech Lokal Pribado FREE, built-in
ElevenLabs Scribe Cloud Tumpak (mahusay para sa hindi Ingles) Idagdag ang iyong ElevenLabs API key
Cartesia Ink Cloud Tumpak, low-latency Idagdag ang iyong Cartesia API key

Ang mga lokal na opsyon (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) ay nagpapanatili ng iyong audio sa lokal—walang ipinapadala sa anumang server. Ang ElevenLabs at Cartesia ay nagpapadala ng audio sa kanilang mga server para sa transcription (gamit ang iyong API key) at nag-aalok ng mas mataas na katumpakan, lalo na para sa mga wikang hindi Ingles.

Para gamitin ito:

  1. I-click ang microphone icon sa composer
  2. Bigkasin ang iyong mensahe
  3. Itigil kapag tapos ka na
  4. Lalabas ang transcript sa message field
  5. I-edit kung kailangan, pagkatapos ay ipadala

First-time setup: Sa unang pagkakataon na gagamit ka ng on-device speech model, kailangan muna itong i-download at i-warm up. Ipinapakita ng composer ang progreso ("Downloading speech model… N%", pagkatapos ay "Preparing"/"Loading"), kaya asahan ang maikling paghinto sa iyong unang pag-tap sa mic.

Mag-record ng Audio at I-attach Ito

Bukod sa dictation, maaari kang mag-record ng clip at i-attach ito sa iyong mensahe: buksan ang + menu ng composer at piliin ang Record audio. Magagamit sa iPhone, iPad, macOS, at sa browser extension. Likas na ipinapares sa mga app na nakikinig sa iyong mga pag-record, tulad ng "for Languages" pronunciation coach.

Hayaan ang Model na Marinig ang Iyong Pag-record

Ang dalawang feature ay lumalampas sa transkripsyon at hinahayaan ang isang modelong nakakarinig na makipagtulungan sa aktibong audio:

  • Isama ang audio para sa model (Settings > AI Setup > Voice): ikinakabit ang iyong pag-record upang ang isang modelong may kakayahang audio (hal. Gemini) ay suriin ang totoong audio kasama ng iyong prompt — tono, pagbigkas, mga tunog sa background, hindi lamang ang mga salita. Naka-off bilang default; walang ipinapadala kung hindi man. Ang isang waveform button sa tabi ng mic ay nag-t-toggle nito bawat mensahe, ngunit ang button ay lumilitaw lamang sa mga mode at app na nag-o-opt in dito (tulad ng para sa "for Languages"), kaya hindi nito sinisiksikan ang composer para sa mga pang-araw-araw na gawain.
  • Pandinig (isang libreng tool, naka-on bilang default): hinahayaan ang assistant na bumalik at makinig muli sa anumang attachment ng audio na may naka-target na follow-up na tanong — "aling mga salita ang maling pagbigkas?", "ano ang tono ng boses?" — sa turn na ikinakabit mo ito o anumang susunod. Ginagawa ng dedikadong audio helper model ang pakikinig, kaya gumagana ito kahit na hindi marinig ng iyong chat model.

System-Wide Dictation (Desktop)

Magdikta sa anumang aplikasyon sa iyong computer — hindi lang sa Caiioo:

Ang mga Pro subscriber ay may system-wide dictation na naka-built in sa mga desktop app ng macOS, Windows, at Linux — walang companion app na kailangang i-install. Pindutin lamang ang dictation hotkey kahit saan, magsalita, at ang iyong sinasabi ay ita-type sa kung aling app ang naka-focus.

Tingnan Din

  • Privacy & Data — Kung paano hinahawakan ang data ng boses
  • Platform & Setup — Availability ng desktop app
  • Settings > AI Setup > Voice — I-configure ang mga opsyon ng boses para sa iyong setup

This guide is maintained by the Caiioo team using Slate, our built-in editor.