یہ اصل انگریزی دستاویز کا مشینی ترجمہ ہے۔ اس ترجمے اور اصل انگریزی ورژن کے درمیان کسی بھی تضاد کی صورت میں، انگریزی ورژن ہی معتبر تصور ہوگا۔ اصل انگریزی ورژن پڑھیں


آواز: بولیں اور سنیں

کیا آپ چاہتے ہیں کہ AI جوابات بلند آواز میں پڑھے؟ یا ٹائپ کرنے کے بجائے پیغامات بول کر لکھوائیں؟ Caiioo صوتی ان پٹ اور آؤٹ پٹ پیش کرتا ہے—سب کچھ قابلِ ترتیب ہے، کچھ آپ کے آلے پر مقامی طور پر چلتے ہیں۔

ان پٹ اور آؤٹ پٹ کے اختیارات، آٹو ریڈ ٹوگل، اور پلے بیک اسپیڈ کے ساتھ صوتی ترتیبات

Voice Output (Text-to-Speech)

AI کو اپنے جوابات بلند آواز میں پڑھنے دیں۔ ان میں سے انتخاب کریں:

آپشن قسم معیار سیٹ اپ
Browser Default لوکل بنیادی مفت، کوئی سیٹ اپ نہیں
Kokoro Neural TTS لوکل اعلیٰ مفت، آپ کے ڈیوائس پر چلتا ہے
Google Gemini کلاؤڈ فطری اپنی API key شامل کریں
OpenAI (gpt-4o-mini-tts) کلاؤڈ فطری، قابلِ کنٹرول ترسیل اپنی OpenAI API key شامل کریں
ElevenLabs کلاؤڈ پریمیم اپنی API key شامل کریں
Cartesia (Sonic 3.5) کلاؤڈ پریمیم اپنی API key شامل کریں
Resemble.ai کلاؤڈ بہترین (وائس کلوننگ) اپنی API key شامل کریں

Kokoro ڈاؤن لوڈ کا سائز: Kokoro ماڈل دو ورژنز میں آتا ہے، اور کون سا ڈاؤن لوڈ ہوگا یہ آپ کے پلیٹ فارم پر منحصر ہے۔ macOS اور iOS چھوٹے INT8-quantized ماڈل (~88 MB) لوڈ کرتے ہیں، جبکہ ایکسٹینشن/براؤزر بڑے فل پریزিশন WebGPU بلڈ (~330 MB) کا استعمال کرتا ہے۔ یہ ایک بار کی ڈاؤن لوڈ ہے۔

پلیٹ فارم کے نوٹس:

  • iOS native Kokoro (v0.9.720+): WebView کے بجائے OnnxRuntime کے ذریعے iOS ہوسٹ پروسیس میں چلتا ہے، جس سے iPhone 13/14 کے کریشز ٹھیک ہو جاتے ہیں۔
  • macOS Kokoro: ڈیسک ٹاپ ہیلپر پروسیس کے ذریعے جملہ بہ جملہ (پلے دبانے کے ~1s کے اندر) اسٹریمنگ کرتا ہے۔
  • Gemini TTS (v0.9.723+): جملہ بہ جملہ چلاتا ہے، لہٰذا پورا جواب ترکیب (synthesize) ہونے کا انتظار کرنے کے بجائے پہلے جملے کے بعد ہی آڈیو شروع ہو جاتی ہے۔
  • OpenAI (v0.9.724+): قابلِ کنٹرول ترسیل کے ساتھ gpt-4o-mini-tts — قدرتی زبان میں لہجے، ٹೋನ್، یا رفتار کی درخواست کریں (مثال کے طور پر "اسے گرمجوشی بھرے آئرش لہجے میں پڑھیں") اور آواز اس کی پیروی کرتی ہے۔ وہی OpenAI API key استعمال کرتا ہے جو OpenAI LLM فراہم کنندہ کے لیے ہے۔ Settings > AI Setup > Voice میں Voice style instructions کا فیلڈ آپ کی اسٹائل کی ہدایت کو ہر بولی جانے والے جواب پر لاگو کرتا ہے۔
  • Cartesia (v0.9.723+): ایک API key Sonic 3.5 (آؤٹ پٹ) اور Ink (ان پٹ) دونوں کو چلاتی ہے۔ کوئی ڈیفالٹ آواز نہیں ہے — اسے فعال کرنے سے پہلے Settings > AI Setup > Voice میں سے کسی ایک کا انتخاب کریں۔
  • ElevenLabs: ہر ElevenLabs کی آواز بولنا شروع کر دیتی ہے جیسے ہی اس کے پاس کہنے کے لیے کچھ ہوتا ہے — بشمول اظہار سے بھرپور v3، جسے وائس پکر میں منتخب کیا جا سکتا ہے۔ ڈیفالٹ وائس ماڈل Flash v2.5 ہے: ElevenLabs اسے پچھلے ڈیفالٹ کے معیار کے برابر قرار دیتا ہے، اور اس کی قیمت فی حرف آدھی ہے۔
  • ElevenLabs v3 Conversational (v0.9.777+): 70 سے زیادہ زبانوں میں اظہار سے بھرپور، کم تاخیر والے مکالمے کے لیے وائس ماڈل کی فہرست میں v3 Conversational ماڈل کا انتخاب کریں۔ ElevenLabs فی الحال اس کا بل معیاری فی حرف شرح سے آدھا وصول کرتا ہے، اور Caiioo کے لاگت کے تخمینے اس کی عکاسی کرتے ہیں۔

تاخیر (Latency): Gemini اور OpenAI پلے بیک شروع ہونے سے پہلے پورا جواب رینڈر کرتے ہیں، لہٰذا طویل جوابات پر پہلی آڈیو کو کچھ سیکنڈ کی تاخیر ہو سکتی ہے — جب آپ ان میں سے کسی ایک کا انتخاب کرتے ہیں تو Settings > AI Setup > Voice ایک نوٹ دکھاتا ہے۔ کم تاخیر والی اسپیچ کے لیے، ElevenLabs، Cartesia، یا Resemble.ai کا انتخاب کریں۔

پلے بیک کی رفتار: رفتار کا سلائیڈر (0.5×–2.0×) ElevenLabs (0.7–1.2× تک محدود) اور Cartesia (0.6–1.5× تک محدود) کے لیے فراہم کنندہ کی طرف سے لاگو کیا جاتا ہے۔ براؤزر کی آوازیں اور Kokoro مقامی طور پر رفتار بڑھاتے ہیں۔ Gemini اور OpenAI کا اپنا کوئی اسپیڈ کنٹرول نہیں ہے، اس لیے جب وہ منتخب ہوتے ہیں تو سلائیڈر پوشیدہ رہتا ہے؛ Resemble.ai معیاری (نان اسٹریمنگ) پلے بیک پر رفتار لاگو کرتا ہے۔ ایک استثنا: ElevenLabs v3 ماڈلز (v3 اور v3 Conversational) خود رفتار تبدیل نہیں کر سکتے، اس لیے Caiioo پلے بیک کے دوران آپ کی رفتار کا اطلاق کرتا ہے، جس سے پچ قدرتی رہتی ہے — اس کا نقصان یہ ہے کہ سلائیڈر کو نارمل سے ہٹانے پر، وہ بولنا شروع کرنے سے پہلے پورے کلپ کا انتظار کرتے ہیں۔ نارمل اسپیڈ پر وہ اب بھی فوراً شروع ہو جاتے ہیں۔

Caiioo موقع کے مطابق آواز کا انتخاب کر سکتا ہے: جب کسی کام کے حصے کے طور پر کسی چیز کو بلند آواز میں پڑھنا ہو، تو AI مواد کے مطابق آواز، بولنے کی رفتار، اور اسپیچ ماڈل کا انتخاب کر سکتا ہے — سونے کی کہانی کے لیے خبروں کے خلاصے سے مختلف آواز — نہ کہ ہمیشہ آپ کی گلوبل وائس سیٹنگ کا استعمال۔ آپ کی اپنی ترجیحات باقی سب چیزوں کے لیے ڈیفالٹ رہتی ہیں۔

اس کو فعال کرنے کے لیے:

  1. Settings > AI Setup > Voice پر جائیں
  2. ٹیکسٹ ٹو اسپیچ کا آپشن منتخب کریں
  3. اگر آپ چاہتے ہیں کہ AI خود بخود پڑھے تو "Auto-read responses" کو ٹوگل کریں
  4. اگر آپ چاہیں تو پلے بیک کی رفتار کو ایڈجسٹ کریں

اگر پلے بیک ناکام ہو جائے: آواز کی خرابیاں اب خاموشی سے ناکام ہونے کے بجائے ایک ٹاسٹ (toast) کے طور پر سامنے آتی ہیں — لہذا غائب یا غیر موزوں API key، یا ایسی آواز جو منتخب ماڈل کے ساتھ مطابقت نہیں رکھتی (Resemble.ai اور Cartesia کے ساتھ عام ہے)، بالکل بتاتی ہے کہ کیا درست کرنا ہے۔

لوکل بمقابلہ کلاؤڈ: براؤزر کی آوازیں اور Kokoro آپ کے ڈیوائس سے باہر کبھی کچھ نہیں بھیجتے۔ Gemini، OpenAI، ElevenLabs، Cartesia، اور Resemble.ai آڈیو تیار کرنے کے لیے (آپ کی API keys کا استعمال کرتے ہوئے) اپنے سرورز پر ٹیکسٹ بھیجتے ہیں۔ تفصیلات کے لیے Privacy & Data دیکھیں۔

وائس کے اخراجات (TTS + STT) گفتگو پر voice_cost کے طور پر جمع ہوتے ہیں، جو ون شاٹ پاتھ سے مطابقت رکھتے ہیں۔

صوتی ان پٹ (Speech-to-Text)

ٹائپ کرنے کے بجائے اپنے پیغامات بول کر لکھوائیں۔ ریکارڈنگ شروع کرنے کے لیے کمپوزر میں مائیکروفون آئیکن پر کلک کریں۔ Caiioo آپ کی بات کو تحریر میں بدل کر میسج فیلڈ میں ڈال دے گا۔

انتخاب کریں کہ یہ کیسے تحریر میں بدلے:

آپشن قسم رازداری سیٹ اپ
Whisper (براؤزر) مقامی مکمل نجی مفت، آپ کے آلے پر چلتا ہے
WhisperKit (iOS) مقامی مکمل نجی مفت، آلے پر
whisper.cpp & Moonshine (Android) مقامی مکمل نجی مفت، آلے پر
Browser Speech مقامی نجی مفت، بلٹ ان
ElevenLabs Scribe کلاؤڈ درست (غیر انگریزی کے لیے بہترین) اپنی ElevenLabs API key شامل کریں
Cartesia Ink کلاؤڈ درست، کم تاخیر اپنی Cartesia API key شامل کریں

مقامی اختیارات (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) آپ کی آڈیو کو مقامی رکھتے ہیں—کچھ بھی کسی سرور پر نہیں بھیجا جاتا۔ ElevenLabs اور Cartesia آڈیو کو تحریر میں بدلنے کے لیے اپنے سرورز پر بھیجتے ہیں (آپ کی API key استعمال کرتے ہوئے) اور زیادہ درستگی فراہم کرتے ہیں، خاص طور پر غیر انگریزی زبانوں کے لیے۔

استعمال کرنے کے لیے:

  1. کمپوزر میں مائیکروفون آئیکن پر کلک کریں
  2. اپنا پیغام بولیں
  3. ختم ہونے پر روک دیں
  4. تحریر میسج فیلڈ میں ظاہر ہو جائے گی
  5. اگر ضرورت ہو تو ترمیم کریں، پھر بھیجیں

پہلی بار سیٹ اپ: جب آپ پہلی بار آلے پر موجود اسپیچ ماڈل استعمال کرتے ہیں، تو اسے ڈاؤن لوڈ اور تیار ہونا پڑتا ہے۔ کمپوزر پیش رفت دکھاتا ہے ("Downloading speech model… N%"، پھر "Preparing"/"Loading")، لہذا مائیک پر پہلی بار کلک کرنے پر تھوڑا سا وقفہ متوقع ہے، یہ ایپ کا رکنا نہیں ہے۔

آڈیو ریکارڈ کریں اور اسے منسلک کریں

ڈکٹیشن کے علاوہ، آپ ایک کلپ ریکارڈ کر سکتے ہیں اور اسے اپنے پیغام سے منسلک کر سکتے ہیں: کمپوزر کا + مینو کھولیں اور Record audio منتخب کریں۔ آئی فون، آئی پیڈ، میک او ایس، اور براؤزر ایکسٹینشن پر دستیاب ہے۔ ان ایپس کے ساتھ قدرتی طور پر جو آپ کی ریکارڈنگز کو سنتی ہیں، جیسے کہ "for Languages" تلفظ کوچ۔

ماڈل کو آپ کی ریکارڈنگ سننے دیں

دو فیچرز ٹرانسکرپشن سے آگے بڑھتے ہیں اور سننے کے قابل ماڈل کو اصل آڈیو کے ساتھ کام کرنے دیتے ہیں:

  • ماڈل کے لیے آڈیو شامل کریں (Settings > AI Setup > Voice): آپ کی ریکارڈنگ منسلک کرتا ہے تاکہ آڈیو کی صلاحیت رکھنے والا ماڈل (مثلاً Gemini) آپ کے پرامپٹ کے ساتھ ساتھ اصل آڈیو کا جائزہ لے — لہجہ، تلفظ، پس منظر کی آوازیں، نہ کہ صرف الفاظ۔ ڈیفالٹ کے طور پر آف؛ بصورت دیگر کچھ نہیں بھیجا جاتا۔ مائیک کے ساتھ ایک ویو فارم کا بٹن اسے فی پیغام ٹوگل کرتا ہے، لیکن بٹن صرف ان موڈز اور ایپس میں ظاہر ہوتا ہے جو اس کا آپٹ ان کرتے ہیں (جیسے "for Languages")، تاکہ یہ روزمرہ کے کاموں کے لیے کمپوزر کو گڈمڈ نہ کرے۔
  • سننا (ایک مفت ٹूल، ڈیفالٹ کے طور پر آن): اسسٹنٹ کو واپس جانے اور کسی بھی آڈیو اٹیچمنٹ کو ہدف بنائے گئے فالو اپ سوال کے ساتھ دوبارہ سننے کی اجازت دیتا ہے — "کون سے الفاظ کا غلط تلفظ کیا گیا تھا؟"، "آواز کا لہجہ کیا ہے؟" — اس موڈ پر جب آپ اسے منسلک کرتے ہیں یا کسی بعد والے موڈ پر۔ وقف شدہ آڈیو ہیلپر ماڈل سنتا ہے، لہذا یہ اس وقت بھی کام کرتا ہے جب آپ کا چیٹ ماڈل سن نہیں سکتا۔

سسٹم وائڈ ڈکٹیشن (ڈیسک ٹاپ)

اپنے کمپیوٹر کی کسی بھی ایپلیکیشن میں بول کر لکھیں — صرف Caiioo میں نہیں:

پرو سبسکرائبرز کے لیے macOS، Windows، اور Linux ڈیسک ٹاپ ایپس میں سسٹم وائڈ ڈکٹیشن بلٹ ان ہوتی ہے — کوئی دوسری ایپ انسٹال کرنے کی ضرورت نہیں۔ کسی بھی جگہ ڈکٹیشن ہاٹ کی کو دبا کر رکھیں، بولیں، اور جو کچھ آپ کہیں گے وہ اس ایپ میں ٹائپ ہو جائے گا جو اس وقت فوکس میں ہو۔

یہ بھی دیکھیں


This guide is maintained by the Caiioo team using Slate, our built-in editor.