Bu belge, orijinal İngilizce metnin makine çevirisidir. Bu çeviri ile orijinal İngilizce sürüm arasında herhangi bir çelişki olması durumunda, İngilizce sürüm geçerli olacaktır. İngilizce orijinal metni oku


Ses: Konuşun ve Dinleyin

AI'nın yanıtları yüksek sesle okumasını mı istiyorsunuz? Yoksa mesajları yazmak yerine dikte etmek mi? Caiioo sesli giriş ve çıkış sunar — hepsi yapılandırılabilir, bazıları cihazınızda yerel olarak çalışır.

Giriş ve çıkış seçenekleri, otomatik okuma geçişi ve oynatma hızı ile ses ayarları

Ses Çıktısı (Metin Okuma - Text-to-Speech)

Yapay zekanın yanıtlarını sesli olarak okumasını sağlayın. Seçenekler:

Seçenek Tür Kalite Kurulum
Tarayıcı Varsayılanı Yerel Temel Ücretsiz, kurulum yok
Kokoro Neural TTS Yerel Yüksek Ücretsiz, cihazınızda çalışır
Google Gemini Bulut Doğal API anahtarınızı ekleyin
OpenAI (gpt-4o-mini-tts) Bulut Doğal, yönlendirilebilir seslendirme OpenAI API anahtarınızı ekleyin
ElevenLabs Bulut Premium API anahtarınızı ekleyin
Cartesia (Sonic 3.5) Bulut Premium API anahtarınızı ekleyin
Resemble.ai Bulut Mükemmel (ses klonlama) API anahtarınızı ekleyin

Kokoro indirme boyutu: Kokoro modeli iki varyant halinde sunulur ve hangisinin indirileceği platformunuza bağlıdır. macOS ve iOS, daha küçük INT8 kuantize modeli (~88 MB) yüklerken; eklenti/tarayıcı daha büyük, tam hassasiyetli WebGPU derlemesini (~330 MB) kullanır. Bu tek seferlik bir indirmedir.

Platform notları:

  • iOS yerel Kokoro (v0.9.720+): WebView yerine OnnxRuntime aracılığıyla iOS ana işleminde çalışır, bu da iPhone 13/14 çökmelerini düzeltir.
  • macOS Kokoro: Masaüstü yardımcı süreci aracılığıyla cümle cümle (oynat tuşuna basıldıktan sonra ~1 sn içinde) akış sağlar.
  • Gemini TTS (v0.9.723+): Cümle cümle oynatır, böylece ses, tüm yanıtın sentezlenmesini beklemek yerine ilk cümleden sonra başlar.
  • OpenAI (v0.9.724+): Yönlendirilebilir seslendirmeye sahip gpt-4o-mini-tts — doğal dilde bir aksan, ton veya tempo isteyin (ör. "bunu sıcak bir İrlanda aksanıyla oku") ve ses bunu takip eder. OpenAI LLM sağlayıcısı ile aynı OpenAI API anahtarını kullanır. Ayarlar > Ses (Settings > Voice) bölümündeki Ses stili talimatları alanı, stil yönergenizi her sesli yanıta uygular.
  • Cartesia (v0.9.723+): Tek bir API anahtarı hem Sonic 3.5 (çıkış) hem de Ink (giriş) özelliklerine güç sağlar. Varsayılan ses yoktur — etkinleştirmeden önce Ayarlar > Ses (Settings > Voice) bölümünden bir tane seçin.

Gecikme: Gemini ve OpenAI, oynatma başlamadan önce tam yanıtı işler, bu nedenle daha uzun yanıt ilk ses için birkaç saniye gecikebilir — bunlardan birini seçtiğinizde Ayarlar > Ses (Settings > Voice) bir not gösterir. Düşük gecikmeli konuşma için ElevenLabs, Cartesia veya Resemble'ı seçin.

Oynatma hızı: Hız kaydırıcısı (0,5×–2,0×), ElevenLabs (0,7–1,2× ile sınırlandırılmıştır) ve Cartesia (0,6–1,5× ile sınırlandırılmıştır) için sağlayıcı tarafından uygulanır. Tarayıcı sesleri ve Kokoro yerel olarak hızlanır. Gemini ve OpenAI'ın kendi hız kontrolü yoktur, bu nedenle seçildiklerinde kaydırıcı gizlenir; Resemble.ai hızı standart (akış dışı) oynatmada uygular.

Etkinleştirmek için:

  1. Ayarlar > Ses (Settings > Voice) bölümüne gidin
  2. Bir metin okuma seçeneği belirleyin
  3. Yapay zekanın otomatik olarak okumasını istiyorsanız "Yanıtları otomatik oku" (Auto-read responses) seçeneğini etkinleştirin
  4. İsterseniz oynatma hızını ayarlayın

Oynatma başarısız olursa: Ses hataları artık sessizce başarısız olmak yerine bir bildirim (toast) olarak görünür; bu sayede eksik veya geçersiz bir API anahtarı ya da seçilen modelle uyumlu olmayan bir ses (Resemble.ai ve Cartesia'da yaygındır) tam olarak neyi düzeltmeniz gerektiğini söyler.

Yerel ve Bulut: Tarayıcı sesleri ve Kokoro hiçbir şeyi cihazınızın dışına göndermez. Gemini, OpenAI, ElevenLabs, Cartesia ve Resemble.ai ses oluşturmak için (API anahtarlarınızı kullanarak) sunucularına metin gönderir. Ayrıntılar için Gizlilik ve Veriler sayfasına bakın.

Ses maliyetleri (TTS + STT), tek seferlik yol ile eşleşecek şekilde konuşma üzerinde voice_cost olarak toplanır.

Sesli Giriş (Konuşmadan Metne)

Mesajlarınızı yazmak yerine dikte edin. Kaydı başlatmak için oluşturucudaki mikrofon simgesine tıklayın. Caiioo söylediklerinizi metne dönüştürür ve mesaj alanına bırakır.

Nasıl dönüştürüleceğini seçin:

Seçenek Tür Gizlilik Kurulum
Whisper (Tarayıcı) Yerel Tamamen gizli ÜCRETSİZ, cihazınızda çalışır
WhisperKit (iOS) Yerel Tamamen gizli ÜCRETSİZ, cihaz üzerinde
whisper.cpp & Moonshine (Android) Yerel Tamamen gizli ÜCRETSİZ, cihaz üzerinde
Tarayıcı Konuşma Yerel Gizli ÜCRETSİZ, yerleşik
ElevenLabs Scribe Bulut Doğru (İngilizce dışı için harika) ElevenLabs API anahtarınızı ekleyin
Cartesia Ink Bulut Doğru, düşük gecikme Cartesia API anahtarınızı ekleyin

Yerel seçenekler (Whisper, WhisperKit, whisper.cpp, Moonshine, Tarayıcı Konuşma) sesinizi yerelde tutar; hiçbir sunucuya gönderilmez. ElevenLabs ve Cartesia, transkripsiyon için sesi kendi sunucularına gönderir (API anahtarınızı kullanarak) ve özellikle İngilizce dışındaki diller için daha yüksek doğruluk sunar.

Kullanmak için:

  1. Oluşturucudaki mikrofon simgesine tıklayın
  2. Mesajınızı söyleyin
  3. Bitirdiğinizde durdurun
  4. Metin mesaj alanında görünür
  5. Gerekirse düzenleyin ve gönderin

İlk kurulum: Cihaz içi bir konuşma modelini ilk kez kullandığınızda, modelin indirilmesi ve hazırlanması gerekir. Oluşturucu ilerlemeyi gösterir ("Konuşma modeli indiriliyor... %N", ardından "Hazırlanıyor"/"Yükleniyor"), bu nedenle ilk mikrofon dokunuşunuzda kısa bir duraklama beklenir, bu bir donma değildir.

Ses Kaydetme ve Ekleme

Dikte etmenin yanı sıra, bir ses klipi kaydedip mesajınıza ekleyebilirsiniz: giriş panelinin + menüsünü açın ve Ses kaydet seçeneğini seçin. iPhone, iPad, macOS ve tarayıcı uzantısında kullanılabilir. "Diller için" (for Languages) telaffuz koçu gibi kayıtlarınızı dinleyen uygulamalarla doğal bir şekilde eşleşir.

Modelin Kaydınızı Dinlemesine İzin Verin

İki özellik, transkripsiyonun ötesine geçer ve duyabilen bir modelin gerçek sesle çalışmasına izin verir:

  • Model için ses ekle (Ayarlar > Ses): Ses uyumlu bir modelin (örn. Gemini) isteminizin yanı sıra gerçek sesi — tonu, telaffuzu, arka plan seslerini, yalnızca kelimeleri değil — incelemesi için kaydınızı ekler. Varsayılan olarak kapalıdır; aksi takdirde hiçbir şey gönderilmez. Mikronun yanındaki dalga formu düğmesi her mesaj için bunu açıp kapatır, ancak düğme yalnızca bunu destekleyen modlarda ve uygulamalarda ("Diller için" gibi) görünür, böylece günlük görevler için giriş panelini kalabalıklaştırmaz.
  • Dinleme (Hearing) (ücretsiz bir araç, varsayılan olarak açık): Asistanın, eklediğiniz turda veya daha sonraki herhangi bir turda hedeflenmiş bir takip sorusuyla ("hangi kelimeler yanlış telaffuz edildi?", "ses tonu nedir?") herhangi bir ses eklemesini geri alıp yeniden dinlemesini sağlar. Özel ses yardımcısı modeli dinleme işlemini gerçekleştirir, bu nedenle sohbet modeliniz duyamasa bile bu çalışır.

Sistem Genelinde Dikte (macOS)

macOS'taki Pro aboneleri, yalnızca Caiioo'ya değil, herhangi bir uygulamaya dikte etmek için küresel bir bas-konuş kısayol tuşu ekleyen ayrı bir yardımcı uygulama olan PrivateVoice'u da yükleyebilirler. Ayrıntılar için masaüstü indirme sayfasına bakın.

Ayrıca Bakınız

  • Gizlilik ve Veri — Ses verilerinin nasıl işlendiği
  • Platform ve Kurulum — Masaüstü uygulaması ve PrivateVoice kullanılabilirliği
  • Ayarlar > Ses — Kurulumunuz için ses seçeneklerini yapılandırın

This guide is maintained by the Caiioo team using Slate, our built-in editor.