Bu belge, orijinal İngilizce metnin makine çevirisidir. Bu çeviri ile orijinal İngilizce sürüm arasında herhangi bir çelişki olması durumunda, İngilizce sürüm geçerli olacaktır. İngilizce orijinal metni oku


Ses: Konuşun ve Dinleyin

AI'nın yanıtları yüksek sesle okumasını mı istiyorsunuz? Yoksa mesajları yazmak yerine dikte etmek mi? Caiioo sesli giriş ve çıkış sunar — hepsi yapılandırılabilir, bazıları cihazınızda yerel olarak çalışır.

Giriş ve çıkış seçenekleri, otomatik okuma geçişi ve oynatma hızı ile ses ayarları

Sesli Çıktı (Metinden Sese)

Yapay zekanın yanıtlarını yüksek sesle okumasını sağlayın. Şunlar arasından seçim yapın:

Seçenek Tür Kalite Kurulum
Tarayıcı Varsayılanı Yerel Temel Ücretsiz, kurulum gerektirmez
Kokoro Neural TTS Yerel Yüksek Ücretsiz, cihazınızda çalışır
Google Gemini Bulut Doğal API anahtarınızı ekleyin
OpenAI (gpt-4o-mini-tts) Bulut Doğal, yönlendirilebilir seslendirme OpenAI API anahtarınızı ekleyin
ElevenLabs Bulut Premium API anahtarınızı ekleyin
Cartesia (Sonic 3.5) Bulut Premium API anahtarınızı ekleyin
Resemble.ai Bulut Mükemmel (ses klonlama) API anahtarınızı ekleyin

Kokoro indirme boyutu: Kokoro modeli iki varyant halinde gelir ve hangisinin indirileceği platformunuza bağlıdır. macOS ve iOS, daha küçük olan INT8 kuantize edilmiş modeli (~88 MB) yüklerken, eklenti/tarayıcı daha büyük olan tam hassasiyetli WebGPU derlemesini (~330 MB) kullanır. Bu tek seferlik bir indirmedir.

Platform notları:

  • iOS yerel Kokoro (v0.9.720+): iPhone 13/14 çökmelerini düzeltmek için WebView yerine OnnxRuntime aracılığıyla iOS ana işleminde çalışır.
  • macOS Kokoro: Masaüstü yardımcı süreci aracılığıyla cümle cümle (oynat düğmesine basıldıktan sonra ~1 saniye içinde) akış sağlar.
  • Gemini TTS (v0.9.723+): Cümle cümle oynatır, böylece ses tüm yanıtın sentezlenmesini beklemek yerine ilk cümleden sonra başlar.
  • OpenAI (v0.9.724+): Yönlendirilebilir seslendirmeye sahip gpt-4o-mini-tts — doğal dilde bir aksan, ton veya tempo isteyin (ör. "bunu sıcak bir İrlanda aksanıyla oku") ve ses bunu takip eder. OpenAI LLM sağlayıcısıyla aynı OpenAI API anahtarını kullanır. Ayarlar > Yapay Zeka Kurulumu > Ses bölümündeki bir Ses stili yönergeleri alanı, stil direktifinizi her sözlü yanıta uygular.
  • Cartesia (v0.9.723+): Tek bir API anahtarı hem Sonic 3.5'i (çıktı) hem de Ink'i (giriş) destekler. Varsayılan bir ses yoktur — etkinleştirmeden önce Ayarlar > Yapay Zeka Kurulumu > Ses bölümünden bir tane seçin.
  • ElevenLabs: Her ElevenLabs sesi, söyleyecek bir şeyi olduğu anda konuşmaya başlar; buna ses seçicide seçilebilen ifade gücü yüksek v3 de dahildir. Varsayılan ses modeli Flash v2.5'tir: ElevenLabs bunu önceki varsayılanla eşdeğer kalitede olarak değerlendirir ve karakter başına maliyeti yarı yarıyadır.
  • ElevenLabs v3 Konuşma (Conversational) (v0.9.777+): 70'ten fazla dilde ifade gücü yüksek, düşük gecikmeli diyaloglar için ses modeli listesinden v3 Conversational modelini seçin. ElevenLabs şu anda bunu standart karakter başı ücretin yarısı olarak faturalandırır ve Caiioo'nun maliyet tahminleri bunu yansıtır.

Gecikme: Gemini ve OpenAI, oynatma başlamadan önce tam yanıtı oluşturur, bu nedenle daha uzun yanıtlarda ilk ses birkaç saniye gecikebilir — Ayarlar > Yapay Zeka Kurulumu > Ses bölümünden bunlardan birini seçtiğinizde bir not görünür. Düşük gecikmeli konuşma için ElevenLabs, Cartesia veya Resemble.ai'yi seçin.

Oynatma hızı: Hız kaydırıcısı (0,5×–2,0×), ElevenLabs (0,7–1,2× ile sınırlandırılmıştır) ve Cartesia (0,6–1,5× ile sınırlandırılmıştır) için sağlayıcı tarafından uygulanır. Tarayıcı sesleri ve Kokoro yerel olarak hızlanır. Gemini ve OpenAI'nin kendi hız kontrolleri yoktur, bu nedenle seçildiklerinde kaydırıcı gizlenir; Resemble.ai hızı standart (akış dışı) oynatmada uygular. Bir istisna: ElevenLabs v3 modelleri (v3 ve v3 Conversational) hızı kendi başlarına değiştiremez, bu nedenle Caiioo oynatma sırasında hızınızı uygulayarak perdeyi doğal tutar — buradaki ödünleşim, kaydırıcı normalden uzak olduğunda, konuşmaya başlamak için tüm klibi beklemeleridir. Normal hızda yine de hemen başlarlar.

Caiioo ana üretime uygun bir ses seçebilir: Sesli bir şeyleri okumak bir görevin parçası olduğunda, yapay zeka her zaman küresel ses ayarınızı kullanmak yerine içeriğe uyan bir ses, konuşma hızı ve konuşma modeli seçebilir — bir masal için haber özetinden farklı bir ses. Kendi ayarlarınız diğer her şey için varsayılan olarak kalır.

Etkinleştirmek için:

  1. Ayarlar > Yapay Zeka Kurulumu > Ses bölümüne gidin
  2. Bir metinden sese seçeneği belirleyin
  3. Yapay zekanın otomatik olarak okumasını istiyorsanız "Yanıtları otomatik oku" seçeneğini etkinleştirin
  4. İsterseniz oynatma hızını ayarlayın

Oynatma başarısız olursa: Ses hataları artık sessizce başarısız olmak yerine bir bildirim (toast) olarak görünür — böylece eksik veya geçersiz bir API anahtarı veya seçilen modelle uyumlu olmayan bir ses (Resemble.ai ve Cartesia'da yaygındır), tam olarak neyi düzeltmeniz gerektiğini söyler.

Yerel ve Bulut: Tarayıcı sesleri ve Kokoro asla cihazınızın dışına hiçbir şey göndermez. Gemini, OpenAI, ElevenLabs, Cartesia ve Resemble.ai sesi üretmek için sunucularına metin gönderir (API anahtarlarınızı kullanarak). Ayrıntılar için Gizlilik ve Veriler sayfasına bakın.

Ses maliyetleri (TTS + STT), tek seferlik yolla eşleşecek şekilde konuşma üzerinde voice_cost olarak toplanır.

Sesli Giriş (Konuşmadan Metne)

Mesajlarınızı yazmak yerine dikte edin. Kaydı başlatmak için oluşturucudaki mikrofon simgesine tıklayın. Caiioo söylediklerinizi metne dönüştürür ve mesaj alanına bırakır.

Nasıl dönüştürüleceğini seçin:

Seçenek Tür Gizlilik Kurulum
Whisper (Tarayıcı) Yerel Tamamen gizli ÜCRETSİZ, cihazınızda çalışır
WhisperKit (iOS) Yerel Tamamen gizli ÜCRETSİZ, cihaz üzerinde
whisper.cpp & Moonshine (Android) Yerel Tamamen gizli ÜCRETSİZ, cihaz üzerinde
Tarayıcı Konuşma Yerel Gizli ÜCRETSİZ, yerleşik
ElevenLabs Scribe Bulut Doğru (İngilizce dışı için harika) ElevenLabs API anahtarınızı ekleyin
Cartesia Ink Bulut Doğru, düşük gecikme Cartesia API anahtarınızı ekleyin

Yerel seçenekler (Whisper, WhisperKit, whisper.cpp, Moonshine, Tarayıcı Konuşma) sesinizi yerelde tutar; hiçbir sunucuya gönderilmez. ElevenLabs ve Cartesia, transkripsiyon için sesi kendi sunucularına gönderir (API anahtarınızı kullanarak) ve özellikle İngilizce dışındaki diller için daha yüksek doğruluk sunar.

Kullanmak için:

  1. Oluşturucudaki mikrofon simgesine tıklayın
  2. Mesajınızı söyleyin
  3. Bitirdiğinizde durdurun
  4. Metin mesaj alanında görünür
  5. Gerekirse düzenleyin ve gönderin

İlk kurulum: Cihaz içi bir konuşma modelini ilk kez kullandığınızda, modelin indirilmesi ve hazırlanması gerekir. Oluşturucu ilerlemeyi gösterir ("Konuşma modeli indiriliyor... %N", ardından "Hazırlanıyor"/"Yükleniyor"), bu nedenle ilk mikrofon dokunuşunuzda kısa bir duraklama beklenir, bu bir donma değildir.

Ses Kaydetme ve Ekleme

Dikte etmenin yanı sıra, bir ses klipi kaydedip mesajınıza ekleyebilirsiniz: giriş panelinin + menüsünü açın ve Ses kaydet seçeneğini seçin. iPhone, iPad, macOS ve tarayıcı uzantısında kullanılabilir. "Diller için" (for Languages) telaffuz koçu gibi kayıtlarınızı dinleyen uygulamalarla doğal bir şekilde eşleşir.

Modelin Kaydınızı Duymasına İzin Verin

İki özellik transkripsiyonun ötesine geçer ve duyabilen bir modelin gerçek sesle çalışmasına izin verir:

  • Sesin model tarafından duyulmasını dahil et (Ayarlar > Yapay Zeka Kurulumu > Ses): ses kayıtlarınızı ekler, böylece ses özellikli bir model (örn. Gemini) isteminizle birlikte gerçek sesi inceler — ton, telaffuz, arka plan sesleri, yalnızca kelimeler değil. Varsayılan olarak kapalıdır; aksi takdirde hiçbir şey gönderilmez. Mikrofona yakın bir dalga formu düğmesi her mesaj için bunu değiştirir, ancak düğme yalnızca bunu destekleyen modlarda ve uygulamalarda ("Diller için" gibi) görünür, böylece günlük görevler için besteciyi karıştırmaz.
  • Duyma (ücretsiz bir araç, varsayılan olarak açık): asistanın hedefli bir takip sorusuyla herhangi bir ses ekine geri dönüp yeniden dinlemesini sağlar — "hangi kelimeler yanlış telaffuz edildi?", "ses tonu nedir?" — eklediğiniz turda veya sonraki herhangi bir turda. Özel ses yardımcısı modeli dinleme işlemini gerçekleştirir, böylece sohbet modeliniz duyamadığında bile bu çalışır.

Sistem Çapında Dikte (Masaüstü)

Bilgisayarınızdaki herhangi bir uygulamaya dikte edin — yalnızca Caiioo'da değil:

Pro aboneleri, macOS, Windows ve Linux masaüstü uygulamalarında yerleşik sistem çapında dikte özelliğine sahiptir — kurulacak ek bir uygulama yoktur. Herhangi bir yerde dikte kısayol tuşunu basılı tutun, konuşun ve söyledikleriniz odaklanılan uygulamaya yazılır.

Ayrıca Bakınız

  • Gizlilik ve Veriler — Ses verilerinin nasıl işlendiği
  • Platform ve Kurulum — Masaüstü uygulaması kullanılabilirliği
  • Ayarlar > Yapay Zeka Kurulumu > Ses — Kurulumunuz için ses seçeneklerini yapılandırın

This guide is maintained by the Caiioo team using Slate, our built-in editor.