यह मूल अंग्रेजी दस्तावेज़ का मशीन अनुवाद है। इस अनुवाद और मूल अंग्रेजी संस्करण के बीच किसी भी विवाद की स्थिति में, अंग्रेजी संस्करण ही मान्य होगा। मूल अंग्रेजी संस्करण पढ़ें


आवाज़: बोलें और सुनें

चाहते हैं कि AI जवाबों को ज़ोर से पढ़े? या टाइप करने के बजाय संदेश बोलें? Caiioo वॉयस इनपुट और आउटपुट प्रदान करता है—सभी कॉन्फ़िगर करने योग्य, कुछ आपके डिवाइस पर स्थानीय रूप से चलते हैं।

इनपुट और आउटपुट विकल्पों, ऑटो-रीड टॉगल और प्लेबैक गति के साथ वॉयस सेटिंग्स

वॉयस आउटपुट (टेक्स्ट-टू-स्पीच)

AI को उसके उत्तर ज़ोर से पढ़कर सुनाने दें। इनमें से चुनें:

विकल्प प्रकार गुणवत्ता सेटअप
ब्राउज़र डिफ़ॉल्ट स्थानीय बुनियादी मुफ़्त, कोई सेटअप नहीं
Kokoro Neural TTS स्थानीय उच्च मुफ़्त, आपके डिवाइस पर चलता है
Google Gemini क्लाउड प्राकृतिक अपनी API key जोड़ें
OpenAI (gpt-4o-mini-tts) क्लाउड प्राकृतिक, नियंत्रित प्रस्तुति अपनी OpenAI API key जोड़ें
ElevenLabs क्लाउड प्रीमियम अपनी API key जोड़ें
Cartesia (Sonic 3.5) क्लाउड प्रीमियम अपनी API key जोड़ें
Resemble.ai क्लाउड उत्कृष्ट (वॉयस क्लोनिंग) अपनी API key जोड़ें

Kokoro डाउनलोड आकार: Kokoro मॉडल दो वेरिएंट में आता है, और कौन सा डाउनलोड होगा यह आपके प्लेटफ़ॉर्म पर निर्भर करता है। macOS और iOS छोटे INT8-क्वांटाइज़्ड मॉडल (~88 MB) को लोड करते हैं, जबकि एक्सटेंशन/ब्राउज़र बड़े पूर्ण-सटीकता वाले WebGPU बिल्ड (~330 MB) का उपयोग करता है। यह एक बार का डाउनलोड है।

प्लेटफ़ॉर्म नोट्स:

  • iOS नेटिव Kokoro (v0.9.720+): WebView के बजाय OnnxRuntime के माध्यम से iOS होस्ट प्रोसेस में चलता है, जिससे iPhone 13/14 क्रैश की समस्या ठीक हो जाती है।
  • macOS Kokoro: डेस्कटॉप हेल्पर प्रोसेस के माध्यम से वाक्य-दर-वाक्य (प्ले दबाने के ~1 सेकंड के भीतर) स्ट्रीम करता है।
  • Gemini TTS (v0.9.723+): वाक्य-दर-वाक्य प्ले करता है, इसलिए पूरा उत्तर सिंथाइज होने का इंतज़ार करने के बजाय पहले वाक्य के बाद ऑडियो शुरू हो जाता है।
  • OpenAI (v0.9.724+): नियंत्रित प्रस्तुति के साथ gpt-4o-mini-tts — प्राकृतिक भाषा में किसी लहजे, टोन या गति के लिए कहें (जैसे "इसे गर्मजोशी भरे आयरिश लहजे में पढ़ें") और आवाज़ उसका पालन करती है। OpenAI LLM प्रदाता जैसी ही OpenAI API key का उपयोग करता है। Settings > Voice में Voice style instructions फ़ील्ड आपके स्टाइल निर्देश को हर बोले गए उत्तर पर लागू करता है।
  • Cartesia (v0.9.723+): एक API key Sonic 3.5 (आउटपुट) और Ink (इनपुट) दोनों को संचालित करती है। कोई डिफ़ॉल्ट आवाज़ नहीं है—इसे सक्षम करने से पहले Settings > Voice में एक चुनें।

विलंबता (Latency): Gemini और OpenAI प्लेबैक शुरू होने से पहले पूरे उत्तर को रेंडर करते हैं, इसलिए लंबे उत्तरों पर पहला ऑडियो कुछ सेकंड देरी से आ सकता है — जब आप उनमें से किसी एक को चुनते हैं तो Settings > Voice एक नोट दिखाता है। कम विलंबता वाली स्पीच के लिए, ElevenLabs, Cartesia, या Resemble चुनें।

प्लेबैक गति: गति स्लाइडर (0.5×–2.0×) ElevenLabs (0.7–1.2× तक सीमित) और Cartesia (0.6–1.5× तक सीमित) के लिए प्रदाता द्वारा लागू किया जाता है। ब्राउज़र की आवाज़ें और Kokoro स्थानीय रूप से गति बढ़ाते हैं। Gemini और OpenAI का अपना कोई गति नियंत्रण नहीं है, इसलिए उनके चुने जाने पर स्लाइडर छिपा रहता है; Resemble.ai मानक (नॉन-स्ट्रीमिंग) प्लेबैक पर गति लागू करता है।

इसे सक्षम करने के लिए:

  1. Settings > Voice पर जाएं
  2. टेक्स्ट-टू-स्पीच विकल्प चुनें
  3. यदि आप चाहते हैं कि AI स्वतः पढ़े तो "Auto-read responses" टॉगल करें
  4. यदि आप चाहें तो प्लेबैक गति समायोजित करें

यदि प्लेबैक विफल हो जाता है: वॉयस त्रुटियां अब चुपचाप विफल होने के बजाय एक टॉस के रूप में सामने आती हैं — इसलिए गायब या अमान्य API key, या कोई ऐसी आवाज़ जो चयनित मॉडल के साथ संगत नहीं है (Resemble.ai और Cartesia के साथ आम है), आपको बिल्कुल बताती है कि क्या ठीक करना है।

स्थानीय बनाम क्लाउड: ब्राउज़र की आवाज़ें और Kokoro आपके डिवाइस से कभी कुछ बाहर नहीं भेजते हैं। Gemini, OpenAI, ElevenLabs, Cartesia, और Resemble.ai ऑडियो जनरेट करने के लिए (आपकी API key का उपयोग करके) अपने सर्वर पर टेक्स्ट भेजते हैं। विवरण के लिए Privacy & Data देखें।

वॉयस लागत (TTS + STT) वन-शॉट पाथ से मेल खाते हुए, वार्तालाप पर voice_cost के रूप में जुड़ती है।

वॉयस इनपुट (स्पीच-टू-टेक्स्ट)

टाइप करने के बजाय अपने संदेश बोलकर लिखवाएं। रिकॉर्डिंग शुरू करने के लिए कंपोज़र में माइक्रोफ़ोन आइकन पर क्लिक करें। Caiioo आपके द्वारा कही गई बातों को ट्रांसक्राइब करता है और उसे मैसेज फ़ील्ड में डाल देता है।

चुनें कि यह कैसे ट्रांसक्राइब करता है:

विकल्प प्रकार गोपनीयता सेटअप
Whisper (ब्राउज़र) लोकल पूरी तरह निजी FREE, आपके डिवाइस पर चलता है
WhisperKit (iOS) लोकल पूरी तरह निजी FREE, ऑन-डिवाइस
whisper.cpp & Moonshine (Android) लोकल पूरी तरह निजी FREE, ऑन-डिवाइस
Browser Speech लोकल निजी FREE, इन-बिल्ट
ElevenLabs Scribe क्लाउड सटीक (गैर-अंग्रेजी के लिए बढ़िया) अपनी ElevenLabs API key जोड़ें
Cartesia Ink क्लाउड सटीक, कम विलंबता अपनी Cartesia API key जोड़ें

लोकल विकल्प (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) आपके ऑडियो को लोकल रखते हैं—कुछ भी किसी सर्वर पर नहीं भेजा जाता है। ElevenLabs और Cartesia ट्रांसक्रिप्शन के लिए ऑडियो अपने सर्वर पर भेजते हैं (आपकी API key का उपयोग करके) और उच्च सटीकता प्रदान करते हैं, विशेष रूप से गैर-अंग्रेजी भाषाओं के लिए।

इसका उपयोग करने के लिए:

  1. कंपोज़र में माइक्रोफ़ोन आइकन पर क्लिक करें
  2. अपना संदेश बोलें
  3. पूरा होने पर रुकें
  4. ट्रांसक्रिप्ट मैसेज फ़ील्ड में दिखाई देता है
  5. यदि आवश्यक हो तो एडिट करें, फिर भेजें

पहली बार सेटअप: पहली बार जब आप ऑन-डिवाइस स्पीच मॉडल का उपयोग करते हैं, तो इसे डाउनलोड और वार्म-अप होना पड़ता है। कंपोज़र प्रगति दिखाता है ("Downloading speech model… N%", फिर "Preparing"/"Loading"), इसलिए आपके पहले माइक टैप पर एक संक्षिप्त ठहराव की उम्मीद है, यह हैंग होना नहीं है।

ऑडियो रिकॉर्ड करें और इसे संलग्न करें

डिक्टेशन के अलावा, आप एक क्लिप रिकॉर्ड कर सकते हैं और इसे अपने संदेश से संलग्न कर सकते हैं: कंपोज़र के + मेनू को खोलें और Record audio चुनें। iPhone, iPad, macOS और ब्राउज़र एक्सटेंशन पर उपलब्ध है। उन ऐप्स के साथ स्वाभाविक रूप से जोड़े जो आपकी रिकॉर्डिंग को सुनते हैं, जैसे "for Languages" उच्चारण कोच।

मॉडल को अपनी रिकॉर्डिंग सुनने दें

दो विशेषताएं प्रतिलेखन से आगे निकल जाती हैं और एक ऐसे मॉडल को अनुमति देती हैं जो वास्तविक ऑडियो के साथ काम कर सकता है:

  • मॉडल के लिए ऑडियो शामिल करें (Settings > Voice): आपकी रिकॉर्डिंग को संलग्न करता है ताकि एक ऑडियो-सक्षम मॉडल (उदा. Gemini) आपके प्रॉम्प्ट के साथ वास्तविक ऑडियो की समीक्षा करे — स्वर, उच्चारण, पृष्ठभूमि की आवाज़ें, न कि केवल शब्द। डिफ़ॉल्ट रूप से बंद; अन्यथा कुछ भी नहीं भेजा जाता है। माइक के बगल में एक वेवफॉर्म बटन इसे प्रति संदेश टॉगल करता है, लेकिन बटन केवल उन मोड और ऐप्स में दिखाई देता है जो इसके लिए ऑप्ट-इन करते हैं (जैसे "for Languages"), इसलिए यह रोजमर्रा के कार्यों के लिए कंपोज़र को अव्यवस्थित नहीं करता है।
  • सुनना (एक मुफ्त टूल, डिफ़ॉल्ट रूप से चालू): सहायक को वापस जाने और लक्षित अनुवर्ती प्रश्न के साथ किसी भी ऑडियो संलग्नक को फिर से सुनने की अनुमति देता है — "किन शब्दों का उच्चारण गलत था?", "आवाज़ का स्वर क्या है?" — उस मोड़ पर जब आप इसे संलग्न करते हैं या बाद के किसी भी मोड़ पर। समर्पित ऑडियो हेल्पर मॉडल सुनने का काम करता है, इसलिए यह तब भी काम करता है जब आपका चैट मॉडल सुन नहीं सकता है।

सिस्टम-वाइड डिक्टेशन (macOS)

macOS पर Pro ग्राहक PrivateVoice भी इंस्टॉल कर सकते हैं, जो एक अलग साथी ऐप है जो किसी भी एप्लिकेशन में डिक्टेट करने के लिए एक वैश्विक प्रेस-टू-टॉक हॉटकी जोड़ता है—न केवल Caiioo में। विवरण के लिए डेस्कटॉप डाउनलोड पेज देखें।

यह भी देखें


This guide is maintained by the Caiioo team using Slate, our built-in editor.