یہ اصل انگریزی دستاویز کا مشینی ترجمہ ہے۔ اس ترجمے اور اصل انگریزی ورژن کے درمیان کسی بھی تضاد کی صورت میں، انگریزی ورژن ہی معتبر تصور ہوگا۔ اصل انگریزی ورژن پڑھیں


آواز: بولیں اور سنیں

کیا آپ چاہتے ہیں کہ AI جوابات بلند آواز میں پڑھے؟ یا ٹائپ کرنے کے بجائے پیغامات بول کر لکھوائیں؟ Caiioo صوتی ان پٹ اور آؤٹ پٹ پیش کرتا ہے—سب کچھ قابلِ ترتیب ہے، کچھ آپ کے آلے پر مقامی طور پر چلتے ہیں۔

ان پٹ اور آؤٹ پٹ کے اختیارات، آٹو ریڈ ٹوگل، اور پلے بیک اسپیڈ کے ساتھ صوتی ترتیبات

Voice Output (Text-to-Speech)

AI کو اپنے جوابات آواز میں پڑھنے دیں۔ ان میں سے انتخاب کریں:

آپشن قسم کوالٹی سیٹ اپ
Browser Default مقامی بنیادی مفت، کوئی سیٹ اپ نہیں
Kokoro Neural TTS مقامی اعلیٰ مفت، آپ کے ڈیوائس پر چلتا ہے
Google Gemini کلاؤڈ فطری اپنی API key شامل کریں
OpenAI (gpt-4o-mini-tts) کلاؤڈ فطری، قابلِ کنٹرول ترسیل اپنی OpenAI API key شامل کریں
ElevenLabs کلاؤڈ پریمیم اپنی API key شامل کریں
Cartesia (Sonic 3.5) کلاؤڈ پریمیم اپنی API key شامل کریں
Resemble.ai کلاؤڈ بہترین (وائس کلوننگ) اپنی API key شامل کریں

Kokoro ڈاؤن لوڈ سائز: Kokoro ماڈل دو ورژنز میں آتا ہے، اور کون سا ڈاؤن لوڈ ہوگا یہ آپ کے پلیٹ فارم پر منحصر ہے۔ macOS اور iOS چھوٹے INT8-quantized ماڈل (~88 MB) کو لوڈ کرتے ہیں، جبکہ ایکسٹینشن/براؤزر بڑے فل پرسیژن WebGPU بلڈ (~330 MB) کا استعمال کرتا ہے۔ یہ ایک بار کی ڈاؤن لوڈ ہے۔

پلیٹ فارم کے نوٹس:

  • iOS native Kokoro (v0.9.720+): WebView کے بجائے OnnxRuntime کے ذریعے iOS ہوسٹ پروسیس میں چلتا ہے، جو iPhone 13/14 کے کریشز کو ٹھیک کرتا ہے۔
  • macOS Kokoro: ڈیسک ٹاپ ہیلپر پروسیس کے ذریعے جملہ بہ جملہ (پلے دبانے کے تقریباً 1 سیکنڈ کے اندر) اسٹریم کرتا ہے۔
  • Gemini TTS (v0.9.723+): جملہ بہ جملہ پلے ہوتا ہے، لہٰذا پورے جواب کی ترکیب (synthesize) کا انتظار کرنے کے بجائے پہلے جملے کے بعد آڈیو شروع ہو جاتی ہے۔
  • OpenAI (v0.9.724+): قابلِ کنٹرول ترسیل کے ساتھ gpt-4o-mini-tts — قدرتی زبان میں لہجے، ٹোন، یا رفتار کی درخواست کریں (مثال کے طور پر "اسے آئرش لہجے میں پڑھیں") اور آواز اس کی پیروی کرتی ہے۔ OpenAI LLM فراہم کنندہ والی ہی OpenAI API key استعمال کرتا ہے۔ Settings > Voice میں Voice style instructions کا فیلڈ آپ کے اسٹائل کی ہدایت کو ہر بولے جانے والے جواب پر لاگو کرتا ہے۔
  • Cartesia (v0.9.723+): ایک API key Sonic 3.5 (آؤٹ پٹ) اور Ink (ان پٹ) دونوں کو چلاتی ہے۔ کوئی ڈیفالٹ آواز نہیں ہے — اسے فعال کرنے سے پہلے Settings > Voice میں سے کسی ایک کا انتخاب کریں۔

لیٹینسی (Latency): Gemini اور OpenAI پلے بیک شروع ہونے سے پہلے پورے جواب کو رینڈر کرتے ہیں، لہٰذا طویل جوابات پر پہلی آڈیو میں چند سیکنڈ کی تاخیر ہو سکتی ہے — جب آپ ان میں سے کسی کا انتخاب کرتے ہیں تو Settings > Voice ایک نوٹ دکھاتا ہے۔ کم لیٹینسی والی تقریر کے لیے، ElevenLabs، Cartesia، یا Resemble کا انتخاب کریں۔

پلے بیک کی رفتار: رفتار کا سلائیڈر (0.5×–2.0×) ElevenLabs (0.7–1.2× تک محدود) اور Cartesia (0.6–1.5× تک محدود) کے لیے فراہم کنندہ کی طرف سے لاگو کیا جاتا ہے۔ براؤزر کی آوازیں اور Kokoro مقامی طور پر رفتار بڑھاتے ہیں۔ Gemini اور OpenAI کا اپنا کوئی رفتار کا کنٹرول نہیں ہے، لہٰذا جب وہ منتخب ہوں تو سلائیڈر چھپا ہوتا ہے؛ Resemble.ai معیاری (نان اسٹریمنگ) پلے بیک پر رفتار لاگو کرتا ہے۔

اسے فعال کرنے کے لیے:

  1. Settings > Voice پر جائیں
  2. Text-to-speech کا کوئی آپشن منتخب کریں
  3. اگر آپ چاہتے ہیں کہ AI خود بخود پڑھے تو "Auto-read responses" کو ٹوگل کریں
  4. اگر آپ چاہیں تو پلے بیک کی رفتار کو ایڈجسٹ کریں

اگر پلے بیک ناکام ہو جائے: آواز کی خرابیاں اب خاموشی سے ناکام ہونے کے بجائے ایک ٹاسٹ (toast) کے طور پر ظاہر ہوتی ہیں — لہٰذا غائب یا غلط API key، یا ایسی آواز جو منتخب ماڈل کے ساتھ مطابقت نہیں رکھتی (Resemble.ai اور Cartesia میں عام ہے)، آپ کو بالکل بتاتی ہے کہ کیا درست کرنا ہے۔

مقامی بمقابلہ کلاؤڈ: براؤزر کی آوازیں اور Kokoro کبھی بھی آپ کے ڈیوائس سے باہر کچھ نہیں بھیجتے۔ Gemini، OpenAI، ElevenLabs، Cartesia، اور Resemble.ai آڈیو تیار کرنے کے لیے (آپ کی API keys استعمال کرتے ہوئے) اپنے سرورز پر متن بھیجتے ہیں۔ تفصیلات کے لیے Privacy & Data دیکھیں۔

آواز کے اخراجات (TTS + STT) گفتگو پر voice_cost کے طور پر جمع ہوتے ہیں، جو ون شاٹ پاتھ سے مطابقت رکھتے ہیں۔

صوتی ان پٹ (Speech-to-Text)

ٹائپ کرنے کے بجائے اپنے پیغامات بول کر لکھوائیں۔ ریکارڈنگ شروع کرنے کے لیے کمپوزر میں مائیکروفون آئیکن پر کلک کریں۔ Caiioo آپ کی بات کو تحریر میں بدل کر میسج فیلڈ میں ڈال دے گا۔

انتخاب کریں کہ یہ کیسے تحریر میں بدلے:

آپشن قسم رازداری سیٹ اپ
Whisper (براؤزر) مقامی مکمل نجی مفت، آپ کے آلے پر چلتا ہے
WhisperKit (iOS) مقامی مکمل نجی مفت، آلے پر
whisper.cpp & Moonshine (Android) مقامی مکمل نجی مفت، آلے پر
Browser Speech مقامی نجی مفت، بلٹ ان
ElevenLabs Scribe کلاؤڈ درست (غیر انگریزی کے لیے بہترین) اپنی ElevenLabs API key شامل کریں
Cartesia Ink کلاؤڈ درست، کم تاخیر اپنی Cartesia API key شامل کریں

مقامی اختیارات (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) آپ کی آڈیو کو مقامی رکھتے ہیں—کچھ بھی کسی سرور پر نہیں بھیجا جاتا۔ ElevenLabs اور Cartesia آڈیو کو تحریر میں بدلنے کے لیے اپنے سرورز پر بھیجتے ہیں (آپ کی API key استعمال کرتے ہوئے) اور زیادہ درستگی فراہم کرتے ہیں، خاص طور پر غیر انگریزی زبانوں کے لیے۔

استعمال کرنے کے لیے:

  1. کمپوزر میں مائیکروفون آئیکن پر کلک کریں
  2. اپنا پیغام بولیں
  3. ختم ہونے پر روک دیں
  4. تحریر میسج فیلڈ میں ظاہر ہو جائے گی
  5. اگر ضرورت ہو تو ترمیم کریں، پھر بھیجیں

پہلی بار سیٹ اپ: جب آپ پہلی بار آلے پر موجود اسپیچ ماڈل استعمال کرتے ہیں، تو اسے ڈاؤن لوڈ اور تیار ہونا پڑتا ہے۔ کمپوزر پیش رفت دکھاتا ہے ("Downloading speech model… N%"، پھر "Preparing"/"Loading")، لہذا مائیک پر پہلی بار کلک کرنے پر تھوڑا سا وقفہ متوقع ہے، یہ ایپ کا رکنا نہیں ہے۔

آڈیو ریکارڈ کریں اور اسے منسلک کریں

ڈکٹیشن کے علاوہ، آپ ایک کلپ ریکارڈ کر سکتے ہیں اور اسے اپنے پیغام سے منسلک کر سکتے ہیں: کمپوزر کا + مینو کھولیں اور Record audio منتخب کریں۔ آئی فون، آئی پیڈ، میک او ایس، اور براؤزر ایکسٹینشن پر دستیاب ہے۔ ان ایپس کے ساتھ قدرتی طور پر جو آپ کی ریکارڈنگز کو سنتی ہیں، جیسے کہ "for Languages" تلفظ کوچ۔

ماڈل کو اپنی ریکارڈنگ سننے دیں

دو خصوصیات ٹرانسکرپشن سے آگے جاتی ہیں اور ایک ایسے ماڈل کو اجازت دیتی ہیں جو سن سکتا ہے اصل آڈیو کے ساتھ کام کرے:

  • ماڈل کے لیے آڈیو شامل کریں (Settings > Voice): آپ کی ریکارڈنگ منسلک کرتا ہے تاکہ آڈیو کے قابل ماڈل (مثلاً Gemini) آپ کے پرامپٹ کے ساتھ اصل آڈیو کا جائزہ لے سکے — لہجہ، تلفظ، پس منظر کی آوازیں، نہ صرف الفاظ۔ پہلے سے طے شدہ طور پر آف؛ بصورت دیگر کچھ نہیں بھیجا جاتا ہے۔ مائیک کے ساتھ ایک ویو فارم بٹن اسے فی پیغام ٹوگل کرتا ہے، لیکن بٹن صرف ان موڈز اور ایپس میں ظاہر ہوتا ہے جو اس میں آپٹ ان کرتے ہیں (جیسے "for Languages")، لہذا یہ روزمرہ کے کاموں کے لیے کمپوزر کو گندا نہیں کرتا۔
  • سننا (ایک مفت ٹول، پہلے سے طے شدہ طور پر آن): اسسٹنٹ کو واپس جانے اور ہدف شدہ فالو اپ سوال کے ساتھ کسی بھی آڈیو اٹیچمنٹ کو دوبارہ سننے دیتا ہے — "کون سے الفاظ کا غلط تلفظ کیا گیا تھا؟"، "آواز کا لہجہ کیا ہے؟" — اس موڑ پر جب آپ اسے منسلک کرتے ہیں یا کسی بعد کے موڑ پر۔ سرشار آڈیو ہیلپر ماڈل سنتا ہے، لہذا یہ اس وقت بھی کام کرتا ہے جب آپ کا چیٹ ماڈل سن نہیں سکتا۔

سسٹم وائڈ ڈکٹیشن (macOS)

macOS پر Pro سبسکرائبرز PrivateVoice بھی انسٹال کر سکتے ہیں، جو ایک علیحدہ ساتھی ایپ ہے جو کسی بھی ایپلی کیشن میں — نہ صرف Caiioo میں — ڈکٹیشن کے لیے ایک عالمی پریس ٹو ٹاک (press-to-talk) ہاٹ کی (hotkey) شامل کرتی ہے۔ تفصیلات کے لیے ڈیسک ٹاپ ڈاؤن لوڈ پیج دیکھیں۔

یہ بھی دیکھیں

  • Privacy & Data — وائس ڈیٹا کو کیسے ہینڈل کیا جاتا ہے
  • Platform & Setup — ڈیسک ٹاپ ایپ اور PrivateVoice کی دستیابی
  • Settings > Voice — اپنے سیٹ اپ کے لیے وائس آپشنز کنفیگر کریں

This guide is maintained by the Caiioo team using Slate, our built-in editor.