Ini adalah terjemahan mesin dari dokumen asli berbahasa Inggris. Jika terjadi perbedaan antara terjemahan ini dan versi asli bahasa Inggris, maka versi bahasa Inggris yang akan berlaku. Baca versi asli bahasa Inggris
Suara: Bicara dan Dengar
Ingin AI membacakan respons dengan keras? Atau mendiktekan pesan alih-alih mengetik? Caiioo menawarkan input dan output suara—semuanya dapat dikonfigurasi, beberapa berjalan secara lokal di perangkat Anda.

Voice Output (Text-to-Speech)
Biarkan AI membacakan tanggapan secara lantang. Pilih dari:
| Opsi | Jenis | Kualitas | Penyiapan |
|---|---|---|---|
| Browser Default | Lokal | Dasar | Gratis, tanpa penyiapan |
| Kokoro Neural TTS | Lokal | Tinggi | Gratis, berjalan di perangkat Anda |
| Google Gemini | Cloud | Alami | Tambahkan kunci API Anda |
| OpenAI (gpt-4o-mini-tts) | Cloud | Alami, pengiriman dapat dikontrol | Tambahkan kunci API OpenAI Anda |
| ElevenLabs | Cloud | Premium | Tambahkan kunci API Anda |
| Cartesia (Sonic 3.5) | Cloud | Premium | Tambahkan kunci API Anda |
| Resemble.ai | Cloud | Sangat baik (kloning suara) | Tambahkan kunci API Anda |
Ukuran unduhan Kokoro: Model Kokoro hadir dalam dua varian, dan model mana yang diunduh tergantung pada platform Anda. macOS dan iOS memuat model terkuantisasi INT8 yang lebih kecil (~88 MB), sementara ekstensi/browser menggunakan versi WebGPU presisi penuh yang lebih besar (~330 MB). Ini adalah unduhan satu kali.
Catatan platform:
- Kokoro asli iOS (v0.9.720+): Berjalan di proses inang iOS melalui OnnxRuntime alih-alih WebView, memperbaiki masalah crash pada iPhone 13/14.
- Kokoro macOS: Melakukan streaming kalimat demi kalimat (dalam waktu ~1 detik setelah menekan tombol putar) melalui proses pembantu desktop.
- Gemini TTS (v0.9.723+): Memutar kalimat demi kalimat, sehingga audio dimulai setelah kalimat pertama alih-alih menunggu seluruh balasan selesai disintesis.
- OpenAI (v0.9.724+): gpt-4o-mini-tts dengan pengiriman yang dapat dikontrol — minta aksen, nada, atau kecepatan dalam bahasa alami (misalnya "baca ini dengan aksen Irlandia yang hangat") dan suara akan mengikutinya. Menggunakan kunci API OpenAI yang sama dengan penyedia OpenAI LLM. Kolom Voice style instructions di Settings > AI Setup > Voice menerapkan direktif gaya Anda pada setiap balasan lisan.
- Cartesia (v0.9.723+): Satu kunci API mendukung Sonic 3.5 (keluaran) dan Ink (masukan). Tidak ada suara default — pilih satu di Settings > AI Setup > Voice sebelum Anda mengaktifkannya.
- ElevenLabs: Setiap suara ElevenLabs mulai berbicara segera setelah ia memiliki sesuatu untuk dikatakan — termasuk v3 yang ekspresif, yang dapat dipilih di pemilih suara. Model suara default adalah Flash v2.5: ElevenLabs menilainya setara dalam kualitas dengan default sebelumnya, dan biayanya setengah lebih murah per karakter.
- ElevenLabs v3 Conversational (v0.9.777+): Pilih model v3 Conversational dalam daftar model suara untuk dialog yang ekspresif dan berlatensi rendah dalam lebih dari 70 bahasa. ElevenLabs saat ini mengenakan tarif setengah dari tarif standar per karakter, dan estimasi biaya Caiioo mencerminkan hal tersebut.
Latensi: Gemini dan OpenAI merender balasan penuh sebelum pemutaran dimulai, sehingga audio pertama mungkin mengalami sedikit jeda pada tanggapan yang lebih panjang — Settings > AI Setup > Voice menampilkan catatan ketika Anda memilih salah satunya. Untuk ucapan berlatensi rendah, pilih ElevenLabs, Cartesia, atau Resemble.
Kecepatan pemutaran: Penggeser kecepatan (0.5×–2.0×) diterapkan oleh penyedia untuk ElevenLabs (dibatasi pada 0.7–1.2×) dan Cartesia (dibatasi pada 0.6–1.5×). Suara browser dan Kokoro mempercepat secara lokal. Gemini dan OpenAI tidak memiliki kontrol kecepatan sendiri, sehingga penggeser disembunyikan saat keduanya dipilih; Resemble.ai menerapkan kecepatan pada pemutaran standar (non-streaming). Satu pengecualian: model ElevenLabs v3 (v3 dan v3 Conversational) tidak dapat mengubah kecepatan sendiri, sehingga Caiioo menerapkan kecepatan Anda selama pemutaran, menjaga nada tetap alami — kekurangannya adalah ketika penggeser diubah dari normal, pemutar harus menunggu seluruh klip selesai sebelum mulai berbicara. Pada kecepatan normal, suara tetap akan langsung mulai.
Caiioo dapat memilih suara yang sesuai dengan situasi: ketika membaca sesuatu dengan suara lantang adalah bagian dari tugas, AI dapat memilih suara, kecepatan bicara, dan model ucapan yang sesuai dengan konten — suara yang berbeda untuk cerita pengantar tidur daripada ringkasan berita — alih-alih selalu menggunakan pengaturan suara global Anda. Pengaturan Anda sendiri tetap menjadi default untuk hal lainnya.
Untuk mengaktifkannya:
- Buka Settings > AI Setup > Voice
- Pilih opsi teks-ke-suara
- Aktifkan "Auto-read responses" jika Anda ingin AI membaca secara otomatis
- Sesuaikan kecepatan pemutaran jika diinginkan
Jika pemutaran gagal: Galat suara sekarang muncul sebagai pemberitahuan toast alih-alih gagal secara diam-diam — sehingga kunci API yang hilang atau tidak valid, atau suara yang tidak kompatibel dengan model yang dipilih (umum terjadi pada Resemble.ai dan Cartesia), memberi tahu Anda secara persis apa yang perlu diperbaiki.
Lokal vs Cloud: Suara browser dan Kokoro tidak pernah mengirimkan apa pun ke luar perangkat Anda. Gemini, OpenAI, ElevenLabs, Cartesia, and Resemble.ai mengirimkan teks ke server mereka (menggunakan kunci API Anda) untuk menghasilkan audio. Lihat Privacy & Data untuk detailnya.
Biaya suara (TTS + STT) diakumulasikan sebagai voice_cost pada percakapan, sesuai dengan jalur one-shot.
Input Suara (Speech-to-Text)
Diktekan pesan Anda alih-alih mengetik. Klik ikon mikrofon di komposer untuk mulai merekam. Caiioo mentranskripsikan apa yang Anda katakan dan memasukkannya ke kolom pesan.
Pilih cara transkripsinya:
| Opsi | Tipe | Privasi | Penyiapan |
|---|---|---|---|
| Whisper (Browser) | Lokal | Sepenuhnya pribadi | GRATIS, berjalan di perangkat Anda |
| WhisperKit (iOS) | Lokal | Sepenuhnya pribadi | GRATIS, di perangkat |
| whisper.cpp & Moonshine (Android) | Lokal | Sepenuhnya pribadi | GRATIS, di perangkat |
| Browser Speech | Lokal | Pribadi | GRATIS, bawaan |
| ElevenLabs Scribe | Cloud | Akurat (bagus untuk non-Inggris) | Tambahkan kunci API ElevenLabs Anda |
| Cartesia Ink | Cloud | Akurat, latensi rendah | Tambahkan kunci API Cartesia Anda |
Opsi lokal (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) menjaga audio Anda tetap lokal—tidak ada yang dikirim ke server mana pun. ElevenLabs dan Cartesia mengirimkan audio ke server mereka untuk transkripsi (menggunakan kunci API Anda) dan menawarkan akurasi yang lebih tinggi, terutama untuk bahasa selain bahasa Inggris.
Cara menggunakannya:
- Klik ikon mikrofon di komposer
- Ucapkan pesan Anda
- Berhenti setelah selesai
- Transkrip muncul di kolom pesan
- Edit jika perlu, lalu kirim
Penyiapan pertama kali: Pertama kali Anda menggunakan model ucapan di perangkat, model tersebut harus diunduh dan disiapkan. Komposer menunjukkan progresnya ("Mengunduh model ucapan… N%", lalu "Menyiapkan"/"Memuat"), jadi jeda singkat pada ketukan mikrofon pertama adalah hal yang wajar, bukan macet.
Rekam Audio dan Lampirkan
Selain dikte, Anda dapat merekam klip dan melampirkannya ke pesan Anda: buka menu + pada komposer dan pilih Rekam audio. Tersedia di iPhone, iPad, macOS, dan ekstensi peramban. Sangat cocok dipasangkan dengan aplikasi yang mendengarkan rekaman Anda, seperti pelatih pelafalan "untuk Bahasa" (for Languages).
Biarkan Model Mendengar Rekaman Anda
有两个 fitur melampaui transkripsi dan memungkinkan model yang dapat mendengarkan untuk bekerja dengan audio yang sebenarnya:
- Sertakan audio untuk model (Pengaturan > Pengaturan AI > Suara): melampirkan rekaman Anda sehingga model yang mendukung audio (misalnya Gemini) meninjau audio nyata di samping prompt Anda — nada, pelafalan, suara latar belakang, bukan hanya kata-kata. Dinonaktifkan secara default; tidak ada yang dikirim jika tidak. Tombol bentuk gelombang di sebelah mikrofon切换 diaktifkan per pesan, tetapi tombol tersebut hanya muncul di mode dan aplikasi yang ikut serta (seperti "untuk Bahasa"), sehingga tidak mengacaukan pembuat pesan untuk tugas sehari-hari.
- Mendengarkan (alat gratis, aktif secara default): memungkinkan asisten kembali dan mendengarkan ulang lampiran audio apa pun dengan pertanyaan tindak lanjut yang ditargetkan — "kata mana yang salah diucapkan?", "apa nada suaranya?" — pada giliran saat Anda melampirkannya atau giliran berikutnya. Model pembantu audio khusus yang melakukan pendengaran, sehingga ini tetap berfungsi bahkan ketika model obrolan Anda tidak dapat mendengarkan.
Dikte Seluruh Sistem (Desktop)
Dikte ke dalam aplikasi apa pun di komputer Anda — bukan hanya Caiioo:
Pelanggan Pro memiliki fitur dikte seluruh sistem yang terintegrasi di aplikasi desktop macOS, Windows, dan Linux — tidak perlu menginstal aplikasi pendamping. Tahan tombol pintas dikte di mana saja, bicaralah, dan apa yang Anda katakan akan diketik ke aplikasi mana pun yang sedang aktif.
Lihat Juga
- Privasi & Data — Cara data suara ditangani
- Platform & Pengaturan — Ketersediaan aplikasi desktop
- Pengaturan > Pengaturan AI > Suara — Konfigurasikan opsi suara untuk pengaturan Anda
This guide is maintained by the Caiioo team using Slate, our built-in editor.