Ini adalah terjemahan mesin dari dokumen asli berbahasa Inggris. Jika terjadi perbedaan antara terjemahan ini dan versi asli bahasa Inggris, maka versi bahasa Inggris yang akan berlaku. Baca versi asli bahasa Inggris
Suara: Bicara dan Dengar
Ingin AI membacakan respons dengan keras? Atau mendiktekan pesan alih-alih mengetik? Caiioo menawarkan input dan output suara—semuanya dapat dikonfigurasi, beberapa berjalan secara lokal di perangkat Anda.

Voice Output (Text-to-Speech)
Minta AI membacakan responsnya dengan suara keras. Pilih dari:
| Opsi | Jenis | Kualitas | Pengaturan |
|---|---|---|---|
| Browser Default | Lokal | Dasar | Gratis, tanpa pengaturan |
| Kokoro Neural TTS | Lokal | Tinggi | Gratis, berjalan di perangkat Anda |
| Google Gemini | Cloud | Natural | Tambahkan kunci API Anda |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natural, penyampaian dapat diatur | Tambahkan kunci API OpenAI Anda |
| ElevenLabs | Cloud | Premium | Tambahkan kunci API Anda |
| Cartesia (Sonic 3.5) | Cloud | Premium | Tambahkan kunci API Anda |
| Resemble.ai | Cloud | Sangat baik (kloning suara) | Tambahkan kunci API Anda |
Ukuran unduhan Kokoro: Model Kokoro hadir dalam dua varian, dan varian mana yang diunduh bergantung pada platform Anda. macOS dan iOS memuat model terkuantisasi INT8 yang lebih kecil (~88 MB), sementara ekstensi/browser menggunakan build WebGPU presisi penuh yang lebih besar (~330 MB). Ini adalah unduhan satu kali.
Catatan platform:
- Kokoro native iOS (v0.9.720+): Berjalan dalam proses host iOS melalui OnnxRuntime alih-alih WebView, memperbaiki masalah katering (crash) pada iPhone 13/14.
- Kokoro macOS: Melakukan streaming kalimat demi kalimat (dalam waktu ~1 detik setelah menekan putar) melalui proses pembantu desktop.
- Gemini TTS (v0.9.723+): Memutar kalimat demi kalimat, sehingga audio dimulai setelah kalimat pertama alih-alih menunggu seluruh balasan selesai disintesis.
- OpenAI (v0.9.724+): gpt-4o-mini-tts dengan penyampaian yang dapat diatur — minta aksen, nada, atau kecepatan dalam bahasa natural (mis. "baca ini dengan aksen Irlandia yang hangat") dan suara akan mengikutinya. Menggunakan kunci API OpenAI yang sama dengan penyedia LLM OpenAI. Kolom Instruksi gaya suara di Pengaturan > Suara menerapkan direktif gaya Anda ke setiap balasan yang diucapkan.
- Cartesia (v0.9.723+): Satu kunci API mendukung Sonic 3.5 (output) sekaligus Ink (input). Tidak ada suara default—pilih satu di Pengaturan > Suara sebelum Anda mengaktifkannya.
Latensi: Gemini dan OpenAI merender seluruh balasan sebelum pemutaran dimulai, sehingga audio pertama mungkin mengalami jeda beberapa detik pada respons yang lebih panjang — Pengaturan > Suara menampilkan catatan saat Anda memilih salah satunya. Untuk ucapan latensi rendah, pilih ElevenLabs, Cartesia, atau Resemble.
Kecepatan pemutaran: Penggeser kecepatan (0,5×–2,0×) diterapkan oleh penyedia untuk ElevenLabs (dibatasi hingga 0,7–1,2×) dan Cartesia (dibatasi hingga 0,6–1,5×). Suara browser dan Kokoro mempercepat secara lokal. Gemini and OpenAI tidak memiliki kontrol kecepatan sendiri, sehingga penggeser disembunyikan saat keduanya dipilih; Resemble.ai menerapkan kecepatan pada pemutaran standar (non-streaming).
Cara mengaktifkan:
- Buka Pengaturan > Suara
- Pilih opsi text-to-speech
- Aktifkan "Baca otomatis respons" jika Anda ingin AI membacakan secara otomatis
- Sesuaikan kecepatan pemutaran jika Anda mau
Jika pemutaran gagal: Kesalahan suara sekarang muncul sebagai toast alih-alih gagal secara senyap — sehingga kunci API yang hilang atau tidak valid, atau suara yang tidak kompatibel dengan model yang dipilih (umum terjadi pada Resemble.ai dan Cartesia), memberi tahu Anda persis apa yang harus diperbaiki.
Lokal vs Cloud: Suara browser dan Kokoro tidak pernah mengirim apa pun ke luar perangkat Anda. Gemini, OpenAI, ElevenLabs, Cartesia, dan Resemble.ai mengirimkan teks ke server mereka (menggunakan kunci API Anda) untuk menghasilkan audio. Lihat Privacy & Data untuk detailnya.
Biaya suara (TTS + STT) terakumulasi sebagai voice_cost pada percakapan, yang cocok dengan jalur sekali jalan (one-shot).
Input Suara (Speech-to-Text)
Diktekan pesan Anda alih-alih mengetik. Klik ikon mikrofon di komposer untuk mulai merekam. Caiioo mentranskripsikan apa yang Anda katakan dan memasukkannya ke kolom pesan.
Pilih cara transkripsinya:
| Opsi | Tipe | Privasi | Penyiapan |
|---|---|---|---|
| Whisper (Browser) | Lokal | Sepenuhnya pribadi | GRATIS, berjalan di perangkat Anda |
| WhisperKit (iOS) | Lokal | Sepenuhnya pribadi | GRATIS, di perangkat |
| whisper.cpp & Moonshine (Android) | Lokal | Sepenuhnya pribadi | GRATIS, di perangkat |
| Browser Speech | Lokal | Pribadi | GRATIS, bawaan |
| ElevenLabs Scribe | Cloud | Akurat (bagus untuk non-Inggris) | Tambahkan kunci API ElevenLabs Anda |
| Cartesia Ink | Cloud | Akurat, latensi rendah | Tambahkan kunci API Cartesia Anda |
Opsi lokal (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) menjaga audio Anda tetap lokal—tidak ada yang dikirim ke server mana pun. ElevenLabs dan Cartesia mengirimkan audio ke server mereka untuk transkripsi (menggunakan kunci API Anda) dan menawarkan akurasi yang lebih tinggi, terutama untuk bahasa selain bahasa Inggris.
Cara menggunakannya:
- Klik ikon mikrofon di komposer
- Ucapkan pesan Anda
- Berhenti setelah selesai
- Transkrip muncul di kolom pesan
- Edit jika perlu, lalu kirim
Penyiapan pertama kali: Pertama kali Anda menggunakan model ucapan di perangkat, model tersebut harus diunduh dan disiapkan. Komposer menunjukkan progresnya ("Mengunduh model ucapan… N%", lalu "Menyiapkan"/"Memuat"), jadi jeda singkat pada ketukan mikrofon pertama adalah hal yang wajar, bukan macet.
Rekam Audio dan Lampirkan
Selain dikte, Anda dapat merekam klip dan melampirkannya ke pesan Anda: buka menu + pada komposer dan pilih Rekam audio. Tersedia di iPhone, iPad, macOS, dan ekstensi peramban. Sangat cocok dipasangkan dengan aplikasi yang mendengarkan rekaman Anda, seperti pelatih pelafalan "untuk Bahasa" (for Languages).
Biarkan Model Mendengarkan Rekaman Anda
有两个 fitur melampaui transkripsi dan memungkinkan model yang dapat mendengarkan untuk bekerja dengan audio aktual:
- Sertakan audio untuk model (Pengaturan > Suara): melampirkan rekaman Anda sehingga model yang mendukung audio (mis. Gemini) meninjau audio nyata di samping prompt Anda — nada, pelafalan, suara latar belakang, bukan hanya kata-kata. Nonaktifkan secara default; tidak ada yang dikirim jika tidak diaktifkan. Tombol bentuk gelombang di sebelah tombol mikrofon mengaktifkannya per pesan, tetapi tombol tersebut hanya muncul di mode dan aplikasi yang ikut serta (seperti "untuk Bahasa"), sehingga tidak memenuhi komposer untuk tugas sehari-hari.
- Pendengaran (alat gratis, aktif secara default): memungkinkan asisten kembali dan mendengarkan ulang lampiran audio apa pun dengan pertanyaan tindak lanjut yang ditargetkan — "kata mana yang salah diucapkan?", "bagaimana nada suaranya?" — pada giliran Anda melampirkannya atau giliran berikutnya. Model pembantu audio khusus melakukan pendengaran, jadi ini berfungsi bahkan ketika model obrolan Anda tidak dapat mendengar.
Dikte Seluruh Sistem (macOS)
Pelanggan Pro di macOS juga dapat menginstal PrivateVoice, aplikasi pendamping terpisah yang menambahkan hotkey tekan-untuk-bicara global untuk mendikte ke aplikasi apa pun—tidak hanya Caiioo. Lihat halaman unduhan desktop untuk detailnya.
Lihat Juga
- Privasi & Data — Bagaimana data suara ditangani
- Platform & Penyiapan — Ketersediaan aplikasi desktop dan PrivateVoice
- Pengaturan > Suara — Konfigurasikan opsi suara untuk penyiapan Anda
This guide is maintained by the Caiioo team using Slate, our built-in editor.