यह मूल अंग्रेजी दस्तावेज़ का मशीन अनुवाद है। इस अनुवाद और मूल अंग्रेजी संस्करण के बीच किसी भी विवाद की स्थिति में, अंग्रेजी संस्करण ही मान्य होगा। मूल अंग्रेजी संस्करण पढ़ें
आवाज़: बोलें और सुनें
चाहते हैं कि AI जवाबों को ज़ोर से पढ़े? या टाइप करने के बजाय संदेश बोलें? Caiioo वॉयस इनपुट और आउटपुट प्रदान करता है—सभी कॉन्फ़िगर करने योग्य, कुछ आपके डिवाइस पर स्थानीय रूप से चलते हैं।

Voice Output (Text-to-Speech)
AI को अपने जवाब ज़ोर से पढ़ने दें। इनमें से चुनें:
| विकल्प | प्रकार | गुणवत्ता | सेटअप |
|---|---|---|---|
| Browser Default | लोकल | बेसिक | मुफ़्त, कोई सेटअप नहीं |
| Kokoro Neural TTS | लोकल | उच्च | मुफ़्त, आपके डिवाइस पर चलता है |
| Google Gemini | क्लाउड | प्राकृतिक | अपनी API key जोड़ें |
| OpenAI (gpt-4o-mini-tts) | क्लाउड | प्राकृतिक, नियंत्रित डिलीवरी | अपनी OpenAI API key जोड़ें |
| ElevenLabs | क्लाउड | प्रीमियम | अपनी API key जोड़ें |
| Cartesia (Sonic 3.5) | क्लाउड | प्रीमियम | अपनी API key जोड़ें |
| Resemble.ai | क्लाउड | उत्कृष्ट (वॉइस क्लोनिंग) | अपनी API key जोड़ें |
Kokoro डाउनलोड साइज़: Kokoro मॉडल दो वेरिएंट्स में आता है, और कौन सा डाउनलोड होगा यह आपके प्लेटफ़ॉर्म पर निर्भर करता है। macOS और iOS छोटे INT8-quantized मॉडल (~88 MB) को लोड करते हैं, जबकि एक्सटेंशन/ब्राउज़र बड़े फुल-प्रिसिजन WebGPU बिल्ड (~330 MB) का उपयोग करता है। यह एक बार का डाउनलोड है।
प्लेटफ़ॉर्म नोट्स:
- iOS native Kokoro (v0.9.720+): WebView के बजाय OnnxRuntime के ज़रिए iOS होस्ट प्रोसेस में चलता है, जिससे iPhone 13/14 क्रैश की समस्या ठीक हो जाती है।
- macOS Kokoro: डेस्कटॉप हेल्पर प्रोसेस के ज़रिए वाक्य-दर-वाक्य (प्ले दबाने के लगभग ~1 सेकंड के भीतर) स्ट्रीम करता है।
- Gemini TTS (v0.9.723+): वाक्य-दर-वाक्य प्ले करता है, इसलिए पूरे रिप्लाई के सिंथेटाइज़ होने का इंतज़ार करने के बजाय पहले वाक्य के बाद ऑडियो शुरू हो जाता है।
- OpenAI (v0.9.724+): नियंत्रित डिलीवरी के साथ gpt-4o-mini-tts — प्राकृतिक भाषा में किसी लहजे (accent), टोन या गति के लिए कहें (जैसे "इसे गर्मजोशी भरे आयरिश लहजे में पढ़ें") और आवाज़ उसका पालन करती है। OpenAI LLM प्रदाता जैसी ही OpenAI API key का उपयोग करता है। Settings > AI Setup > Voice में एक Voice style instructions फ़ील्ड आपके स्टाइल निर्देश को हर बोले गए जवाब पर लागू करती है।
- Cartesia (v0.9.723+): एक API key Sonic 3.5 (आउटपुट) और Ink (इनपुट) दोनों को पावर देती है। कोई डिफ़ॉल्ट आवाज़ नहीं है — इसे सक्षम करने से पहले Settings > AI Setup > Voice में एक चुनें।
- ElevenLabs: हर ElevenLabs आवाज़ कुछ भी कहने के लिए उपलब्ध होते ही बोलना शुरू कर देती है — जिसमें अभिव्यंजक v3 भी शामिल है, जिसे वॉइस पिकर में चुना जा सकता है। डिफ़ॉल्ट वॉइस मॉडल Flash v2.5 है: ElevenLabs इसे पिछले डिफ़ॉल्ट के समान गुणवत्ता वाला बताता है, और इसकी लागत प्रति कैरेक्टर आधी है।
- ElevenLabs v3 Conversational (v0.9.777+): 70 से अधिक भाषाओं में अभिव्यंजक, कम-विलंबता (low-latency) संवाद के लिए वॉइस मॉडल सूची में v3 Conversational मॉडल चुनें। ElevenLabs वर्तमान में इसके लिए मानक प्रति-कैरेक्टर दर से आधी कीमत लेता है, और Caiioo के लागत अनुमान इसे दर्शाते हैं।
विलंबता (Latency): Gemini और OpenAI प्लेबैक शुरू होने से पहले पूरे रिप्लाई को रेंडर करते हैं, इसलिए लंबे जवाबों पर पहला ऑडियो कुछ सेकंड देरी से आ सकता है — जब आप उनमें से किसी एक को चुनते हैं तो Settings > AI Setup > Voice एक नोट दिखाता है। कम विलंबता वाली स्पीच के लिए, ElevenLabs, Cartesia, या Resemble.ai चुनें।
प्लेबैक स्पीड: स्पीड स्लाइडर (0.5×–2.0×) ElevenLabs (0.7–1.2× तक सीमित) और Cartesia (0.6–1.5× तक सीमित) के लिए प्रदाता द्वारा लागू किया जाता है। ब्राउज़र आवाज़ें और Kokoro लोकल रूप से गति बढ़ाते हैं। Gemini और OpenAI का अपना कोई स्पीड कंट्रोल नहीं है, इसलिए उनके चुने जाने पर स्लाइडर छिपा रहता है; Resemble.ai मानक (गैर-स्ट्रीमिंग) प्लेबैक पर स्पीड लागू करता है। एक अपवाद: ElevenLabs v3 मॉडल (v3 और v3 Conversational) अपने आप स्पीड नहीं बदल सकते, इसलिए Caiioo प्लेबैक के दौरान आपकी स्पीड लागू करता है, जिससे पिच प्राकृतिक बनी रहती है — इसका ट्रेड-ऑफ यह है कि स्लाइडर को सामान्य से अलग रखने पर, वे बोलने से पहले पूरी क्लिप का इंतज़ार करते हैं। सामान्य गति पर वे अभी भी तुरंत शुरू हो जाते हैं।
Caiioo पल के अनुकूल आवाज़ चुन सकता है: जब किसी चीज़ को ज़ोर से पढ़ना किसी टास्क का हिस्सा होता है, तो AI सामग्री के अनुकूल आवाज़, बोलने की गति और स्पीच मॉडल चुन सकता है — सोने की कहानी के लिए समाचार सारांश से अलग आवाज़ — न कि हमेशा आपकी ग्लोबल वॉइस सेटिंग का उपयोग करना। आपकी अपनी सेटिंग बाकी सब चीज़ों के लिए डिफ़ॉल्ट बनी रहती हैं।
सक्षम करने के लिए:
- Settings > AI Setup > Voice पर जाएं
- टेक्स्ट-टू-स्पीच विकल्प चुनें
- यदि आप चाहते हैं कि AI अपने आप पढ़े तो "Auto-read responses" टॉगल करें
- चाहें तो प्लेबैक स्पीड समायोजित करें
यदि प्लेबैक विफल रहता है: वॉइस त्रुटियां अब चुपचाप विफल होने के बजाय एक टॉस्ट के रूप में सामने आती हैं — इसलिए गायब या अमान्य API key, या कोई ऐसी आवाज़ जो चयनित मॉडल के साथ संगत नहीं है (Resemble.ai और Cartesia के साथ आम है), आपको बिल्कुल बताती है कि क्या ठीक करना है।
लोकल बनाम क्लाउड: ब्राउज़र आवाज़ें और Kokoro आपके डिवाइस से कभी कुछ बाहर नहीं भेजते। Gemini, OpenAI, ElevenLabs, Cartesia, और Resemble.ai ऑडियो जनरेट करने के लिए (आपकी API keys का उपयोग करके) अपने सर्वर पर टेक्स्ट भेजते हैं। विवरण के लिए Privacy & Data देखें।
वॉइस लागत (TTS + STT) वन-शॉट पाथ से मेल खाते हुए, बातचीत पर voice_cost के रूप में जुड़ती जाती है।
वॉयस इनपुट (स्पीच-टू-टेक्स्ट)
टाइप करने के बजाय अपने संदेश बोलकर लिखवाएं। रिकॉर्डिंग शुरू करने के लिए कंपोज़र में माइक्रोफ़ोन आइकन पर क्लिक करें। Caiioo आपके द्वारा कही गई बातों को ट्रांसक्राइब करता है और उसे मैसेज फ़ील्ड में डाल देता है।
चुनें कि यह कैसे ट्रांसक्राइब करता है:
| विकल्प | प्रकार | गोपनीयता | सेटअप |
|---|---|---|---|
| Whisper (ब्राउज़र) | लोकल | पूरी तरह निजी | FREE, आपके डिवाइस पर चलता है |
| WhisperKit (iOS) | लोकल | पूरी तरह निजी | FREE, ऑन-डिवाइस |
| whisper.cpp & Moonshine (Android) | लोकल | पूरी तरह निजी | FREE, ऑन-डिवाइस |
| Browser Speech | लोकल | निजी | FREE, इन-बिल्ट |
| ElevenLabs Scribe | क्लाउड | सटीक (गैर-अंग्रेजी के लिए बढ़िया) | अपनी ElevenLabs API key जोड़ें |
| Cartesia Ink | क्लाउड | सटीक, कम विलंबता | अपनी Cartesia API key जोड़ें |
लोकल विकल्प (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) आपके ऑडियो को लोकल रखते हैं—कुछ भी किसी सर्वर पर नहीं भेजा जाता है। ElevenLabs और Cartesia ट्रांसक्रिप्शन के लिए ऑडियो अपने सर्वर पर भेजते हैं (आपकी API key का उपयोग करके) और उच्च सटीकता प्रदान करते हैं, विशेष रूप से गैर-अंग्रेजी भाषाओं के लिए।
इसका उपयोग करने के लिए:
- कंपोज़र में माइक्रोफ़ोन आइकन पर क्लिक करें
- अपना संदेश बोलें
- पूरा होने पर रुकें
- ट्रांसक्रिप्ट मैसेज फ़ील्ड में दिखाई देता है
- यदि आवश्यक हो तो एडिट करें, फिर भेजें
पहली बार सेटअप: पहली बार जब आप ऑन-डिवाइस स्पीच मॉडल का उपयोग करते हैं, तो इसे डाउनलोड और वार्म-अप होना पड़ता है। कंपोज़र प्रगति दिखाता है ("Downloading speech model… N%", फिर "Preparing"/"Loading"), इसलिए आपके पहले माइक टैप पर एक संक्षिप्त ठहराव की उम्मीद है, यह हैंग होना नहीं है।
ऑडियो रिकॉर्ड करें और इसे संलग्न करें
डिक्टेशन के अलावा, आप एक क्लिप रिकॉर्ड कर सकते हैं और इसे अपने संदेश से संलग्न कर सकते हैं: कंपोज़र के + मेनू को खोलें और Record audio चुनें। iPhone, iPad, macOS और ब्राउज़र एक्सटेंशन पर उपलब्ध है। उन ऐप्स के साथ स्वाभाविक रूप से जोड़े जो आपकी रिकॉर्डिंग को सुनते हैं, जैसे "for Languages" उच्चारण कोच।
मॉडल को आपकी रिकॉर्डिंग सुनने दें
दो विशेषताएं ट्रांसक्रिप्शन से परे जाती हैं और एक ऐसे मॉडल को अनुमति देती हैं जो सुन सकता है वास्तविक ऑडियो के साथ काम कर सकता है:
- मॉडल के लिए ऑडियो शामिल करें (सेटिंग्स > AI सेटअप > आवाज़): आपकी रिकॉर्डिंग संलग्न करता है ताकि ऑडियो-सक्षम मॉडल (उदा. Gemini) आपके प्रॉम्प्ट के साथ वास्तविक ऑडियो की समीक्षा कर सके — स्वर, उच्चारण, पृष्ठभूमि की आवाज़ें, न कि केवल शब्द। डिफ़ॉल्ट रूप से बंद; अन्यथा कुछ भी नहीं भेजा जाता है। माइक के बगल में एक वेवफ़ॉर्म बटन इसे प्रति संदेश टॉगल करता है, लेकिन बटन केवल उन मोड और ऐप्स में दिखाई देता है जो इसमें ऑप्ट-इन करते हैं (जैसे "भाषाओं के लिए"), ताकि यह रोज़मर्रा के कार्यों के लिए कंपोज़र को अव्यवस्थित न करे।
- सुनना (एक मुफ़्त टूल, डिफ़ॉल्ट रूप से चालू): सहायक को वापस जाने और लक्षित अनुवर्ती प्रश्न के साथ किसी भी ऑडियो अटैचमेंट को फिर से सुनने की अनुमति देता है — "किन शब्दों का उच्चारण गलत था?", "आवाज़ का स्वर क्या है?" — उस टर्न पर जब आप इसे संलग्न करते हैं या किसी बाद के टर्न पर। समर्पित ऑडियो सहायक मॉडल सुनता है, इसलिए यह तब भी काम करता है जब आपका चैट मॉडल नहीं सुन सकता है।
सिस्टम-व्यापी डिक्टेशन (डेस्कटॉप)
अपने कंप्यूटर के किसी भी एप्लिकेशन में डिक्टेट करें — केवल Caiioo में नहीं:
Pro ग्राहकों के पास macOS, Windows, और Linux डेस्कटॉप ऐप्स में सिस्टम-व्यापी डिक्टेशन अंतर्निहित है — इंस्टॉल करने के लिए किसी साथी ऐप की आवश्यकता नहीं है। किसी भी स्थान पर डिक्टेशन हॉटकी को दबाए रखें, बोलें, और जो आप कहते हैं वह उस ऐप में टाइप हो जाता है जो फोकस में है।
यह भी देखें
- गोपनीयता और डेटा — आवाज़ के डेटा को कैसे संभाला जाता है
- प्लेटफ़ॉर्म और सेटअप — डेस्कटॉप ऐप की उपलब्धता
- सेटिंग्स > AI सेटअप > आवाज़ — अपने सेटअप के लिए आवाज़ के विकल्प कॉन्फ़िगर करें
This guide is maintained by the Caiioo team using Slate, our built-in editor.