এটি মূল ইংরেজি নথির একটি মেশিন অনুবাদ। এই অনুবাদ এবং মূল ইংরেজি সংস্করণের মধ্যে কোনো বিরোধ দেখা দিলে, ইংরেজি সংস্করণটিই প্রাধান্য পাবে। মূল ইংরেজি সংস্করণটি পড়ুন


ভয়েস: কথা বলুন এবং শুনুন

AI কি উত্তরগুলো জোরে পড়ে শোনাক তা চান? অথবা টাইপ করার বদলে বার্তাগুলো মুখে বলতে চান? Caiioo ভয়েস ইনপুট এবং আউটপুট অফার করে—সবই কনফিগারেবল, যার কিছু আপনার ডিভাইসে লোকালভাবে চলে।

ইনপুট এবং আউটপুট অপশন, অটো-রিড টগল এবং প্লেব্যাক স্পিড সহ ভয়েস সেটিংস

Voice Output (Text-to-Speech)

এআই-কে তার উত্তরগুলি জোরে পড়তে বলুন। পছন্দ করুন:

বিকল্প ধরণ গুণমান সেটআপ
Browser Default লোকাল সাধারণ বিনামূল্যে, কোনো সেটআপ নেই
Kokoro Neural TTS লোকাল উচ্চ বিনামূল্যে, আপনার ডিভাইসে চলে
Google Gemini ক্লাউড স্বাভাবিক আপনার API key যোগ করুন
OpenAI (gpt-4o-mini-tts) ক্লাউড স্বাভাবিক, নিয়ন্ত্রণযোগ্য ডেলিভারি আপনার OpenAI API key যোগ করুন
ElevenLabs ক্লাউড প্রিমিয়াম আপনার API key যোগ করুন
Cartesia (Sonic 3.5) ক্লাউড প্রিমিয়াম আপনার API key যোগ করুন
Resemble.ai ক্লাউড চমৎকার (ভয়েস ক্লোনিং) আপনার API key যোগ করুন

Kokoro ডাউনলোডের সাইজ: Kokoro মডেলটি দুটি রূপভেদে আসে, এবং আপনার প্ল্যাটফর্মের ওপর নির্ভর করে কোনটি ডাউনলোড হবে। macOS এবং iOS-এ ছোট INT8-quantized মডেলটি (~88 MB) লোড হয়, অন্যদিকে এক্সটেনশন/ব্রাউজারে বড় ফুল-প্রিসিশন WebGPU বিল্ডটি (~330 MB) ব্যবহার করা হয়। এটি একটি ওয়ান-টাইম ডাউনলোড।

প্ল্যাটফর্ম নোট:

  • iOS native Kokoro (v0.9.720+): WebView-এর পরিবর্তে OnnxRuntime-এর মাধ্যমে সরাসরি iOS হোস্ট প্রসেসে চলে, যার ফলে iPhone 13/14 ক্র্যাশ হওয়া ঠিক হয়।
  • macOS Kokoro: ডেস্কটপ হেল্পার প্রসেসের মাধ্যমে বাক্য ধরে ধরে (প্লে প্রেস করার ~1 সেকেন্ডের মধ্যে) স্ট্রিম করে।
  • Gemini TTS (v0.9.723+): বাক্য ধরে ধরে প্লে করে, তাই পুরো উত্তরের সিন্থেসাইজ হওয়ার জন্য অপেক্ষা না করে প্রথম বাক্যের পরেই অডিও শুরু হয়ে যায়।
  • OpenAI (v0.9.724+): নিয়ন্ত্রণযোগ্য ডেলিভারি সহ gpt-4o-mini-tts — স্বাভাবিক ভাষায় কোনো অ্যাকসেন্ট, টোন বা গতির জন্য বলুন (যেমন: "উষ্ণ আইরিশ অ্যাকসেন্টে এটি পড়ুন") এবং ভয়েস সে অনুযায়ী কাজ করবে। OpenAI LLM প্রোভাইডারের মতো একই OpenAI API key ব্যবহার করে। Settings > AI Setup > Voice-এর মধ্যে থাকা একটি Voice style instructions ফিল্ড প্রতিটি স্পোকেন উত্তরে আপনার স্টাইল নির্দেশিকা প্রয়োগ করে।
  • Cartesia (v0.9.723+): একটি একক API key Sonic 3.5 (আউটপুট) এবং Ink (ইনপুট) উভয়কেই চালিত করে। কোনো ডিফল্ট ভয়েস নেই—এটি সক্রিয় করার আগে Settings > AI Setup > Voice থেকে একটি বেছে নিন।
  • ElevenLabs: যেকোনো ElevenLabs ভয়েস কিছু বলার মতো ডেটা পাওয়ার সাথে সাথেই কথা বলা শুরু করে—এর মধ্যে এক্সপ্রেসভ v3 ও রয়েছে, যা ভয়েস পিকার থেকে নির্বাচন করা যায়। ডিফল্ট ভয়েস মডেলটি হলো Flash v2.5: ElevenLabs এটিকে আগের ডিফল্টের সমতুল্য গুণমানসম্পন্ন বলে মূল্যায়ন করে, এবং প্রতি ক্যারেক্টারে এর খরচ অর্ধেক।
  • ElevenLabs v3 Conversational (v0.9.777+): ৭০টিরও বেশি ভাষায় এক্সপ্রেসভ এবং কম লেটেন্সির সংলাপের জন্য ভয়েস মডেল তালিকা থেকে v3 Conversational মডেলটি বেছে নিন। ElevenLabs বর্তমানে প্রতি ক্যারেক্টারের আদর্শ হারের অর্ধেকে এটি বিল করে, এবং Caiioo-এর খরচ অনুমান এটি প্রতিফলিত করে।

লেটেন্সি: প্লেব্যাক শুরু হওয়ার আগে Gemini এবং OpenAI সম্পূর্ণ উত্তর রেন্ডার করে, তাই দীর্ঘ উত্তরের ক্ষেত্রে প্রথম অডিও কিছুটা বিলম্বিত হতে পারে — এর মধ্যে যেকোনো একটি বেছে নিলে Settings > AI Setup > Voice-এ একটি নোট দেখা যায়। কম লেটেন্সির স্পিচের জন্য ElevenLabs, Cartesia বা Resemble বেছে নিন।

প্লেব্যাক স্পিড: ElevenLabs (0.7–1.2× এ সীমাবদ্ধ) এবং Cartesia (0.6–1.5× এ সীমাবদ্ধ) এর ক্ষেত্রে প্রোভাইডার দ্বারা স্পিড স্লাইডার (0.5×–2.0×) প্রয়োগ করা হয়। ব্রাউজার ভয়েস এবং Kokoro লোকালি গতি বৃদ্ধি করে। Gemini এবং OpenAI-এর নিজস্ব কোনো স্পিড কন্ট্রোল নেই, তাই এগুলো নির্বাচিত থাকলে স্লাইডারটি লুকানো থাকে; Resemble.ai স্ট্যান্ডার্ড (নন-স্ট্রিমিং) প্লেব্যাকে স্পিড প্রয়োগ করে। একটি ব্যতিক্রম: ElevenLabs v3 মডেলগুলি (v3 এবং v3 Conversational) নিজেরাই গতি পরিবর্তন করতে পারে না, তাই Caiioo এর পরিবর্তে প্লেব্যাকের সময় আপনার স্পিড প্রয়োগ করে, পিচ স্বাভাবিক রাখে — এর নেতিবাচক দিক হলো স্লাইডারটি স্বাভাবিকের বাইরে থাকলে, কথা বলা শুরু করার আগে তারা সম্পূর্ণ ক্লিপটির জন্য অপেক্ষা করে। স্বাভাবিক গতিতে তারা এখনও সাথে সাথেই শুরু করে।

Caiioo মুহূর্তের সাথে মানানসই একটি ভয়েস বেছে নিতে পারে: জোরে কোনো কিছু পড়া যখন কোনো কাজের অংশ হয়, তখন এআই কন্টেন্টের সাথে মানানসই একটি ভয়েস, বলার গতি এবং স্পিচ মডেল বেছে নিতে পারে — খবরের সারসংক্ষেপের চেয়ে শোওয়ার সময়ের গল্পের জন্য একটি ভিন্ন ভয়েস — সর্বদা আপনার গ্লোবাল ভয়েস সেটিংস ব্যবহার না করে। আপনার নিজের সেটিংস অন্য সবকিছুর জন্য ডিফল্ট হিসেবে রয়ে যায়।

সক্রিয় করতে:

  1. Settings > AI Setup > Voice-এ যান
  2. একটি টেক্সট-টু-স্পিচ বিকল্প বেছে নিন
  3. এআই নিজে থেকে পড়তে চাইলে "Auto-read responses" টগল করুন
  4. আপনার পছন্দ অনুযায়ী প্লেব্যাক স্পিড সামঞ্জস্য করুন

প্লেব্যাক ব্যর্থ হলে: ভয়েস ত্রুটিগুলি এখন নীরবে ব্যর্থ হওয়ার পরিবর্তে একটি টোস্ট হিসেবে প্রদর্শিত হয়—তাই অনুপস্থিত বা অবৈধ API key, অথবা নির্বাচিত মডেলের সাথে সামঞ্জস্যপূর্ণ নয় এমন কোনো ভয়েস (Resemble.ai এবং Cartesia-এর ক্ষেত্রে সাধারণ) আপনাকে ঠিক কী ঠিক করতে হবে তা বলে দেয়।

লোকাল বনাম ক্লাউড: ব্রাউজার ভয়েস এবং Kokoro আপনার ডিভাইস থেকে কখনোই কিছু বাইরে পাঠায় না। অডিও জেনারেট করার জন্য Gemini, OpenAI, ElevenLabs, Cartesia এবং Resemble.ai তাদের সার্ভারে টেক্সট পাঠায় (আপনার API keys ব্যবহার করে)। বিস্তারিত জানতে Privacy & Data দেখুন।

Voice costs (TTS + STT) কথোপকথনে voice_cost হিসেবে যোগ হয়, যা ওয়ান-শট পাথ-এর সাথে মিলে যায়।

ভয়েস ইনপুট (স্পিচ-টু-টেক্সট)

টাইপ করার পরিবর্তে আপনার মেসেজগুলো মুখে বলুন। রেকর্ডিং শুরু করতে কম্পোজারে মাইক্রোফোন আইকনে ক্লিক করুন। Caiioo আপনি যা বলছেন তা ট্রান্সক্রাইব করবে এবং মেসেজ ফিল্ডে বসিয়ে দেবে।

কীভাবে ট্রান্সক্রাইব হবে তা বেছে নিন:

অপশন ধরন গোপনীয়তা সেটআপ
Whisper (Browser) লোকাল সম্পূর্ণ ব্যক্তিগত ফ্রি, আপনার ডিভাইসে চলে
WhisperKit (iOS) লোকাল সম্পূর্ণ ব্যক্তিগত ফ্রি, অন-ডিভাইস
whisper.cpp & Moonshine (Android) লোকাল সম্পূর্ণ ব্যক্তিগত ফ্রি, অন-ডিভাইস
Browser Speech লোকাল ব্যক্তিগত ফ্রি, বিল্ট-ইন
ElevenLabs Scribe ক্লাউড নির্ভুল (ইংরেজি বাদে অন্য ভাষার জন্য ভালো) আপনার ElevenLabs API key যোগ করুন
Cartesia Ink ক্লাউড নির্ভুল, কম ল্যাটেন্সি আপনার Cartesia API key যোগ করুন

লোকাল অপশনগুলো (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) আপনার অডিও লোকাল রাখে—কোনো সার্ভারে কিছু পাঠানো হয় না। ElevenLabs এবং Cartesia ট্রান্সক্রিপশনের জন্য তাদের সার্ভারে অডিও পাঠায় (আপনার API key ব্যবহার করে) এবং উচ্চতর নির্ভুলতা প্রদান করে, বিশেষ করে ইংরেজি বাদে অন্য ভাষার জন্য।

এটি ব্যবহার করতে: ১. কম্পোজারে মাইক্রোফোন আইকনে ক্লিক করুন ২. আপনার মেসেজটি বলুন ৩. বলা শেষ হলে থামুন ৪. ট্রান্সক্রিপ্টটি মেসেজ ফিল্ডে প্রদর্শিত হবে ৫. প্রয়োজন হলে এডিট করুন, তারপর পাঠান

প্রথমবার সেটআপ: প্রথমবার অন-ডিভাইস স্পিচ মডেল ব্যবহার করার সময় এটি ডাউনলোড এবং প্রস্তুত হতে হয়। কম্পোজার এর অগ্রগতি দেখায় ("Downloading speech model… N%", তারপর "Preparing"/"Loading"), তাই প্রথমবার মাইক্রোফোন ট্যাপ করার সময় সামান্য বিরতি স্বাভাবিক, এটি হ্যাং হওয়া নয়।

অডিও রেকর্ড করুন এবং এটি সংযুক্ত করুন

ডিকটেশনের পাশাপাশি, আপনি একটি ক্লিপ রেকর্ড করতে পারেন এবং এটি আপনার বার্তায় সংযুক্ত করতে পারেন: কম্পোজরের + মেনু খুলুন এবং Record audio বেছে নিন। iPhone, iPad, macOS এবং ব্রাউজার এক্সটেনশনে উপলব্ধ। "for Languages" উচ্চারণ কোচের মতো আপনার রেকর্ডিং শোনে এমন অ্যাপগুলির সাথে স্বাভাবিকভাবেই জোড়া লাগে।

মডেলকে আপনার রেকর্ডিং শুনতে দিন

দুটি বৈশিষ্ট্য প্রতিলিপির বাইরে যায় এবং শুনতে সক্ষম এমন একটি মডেলকে আসল অডিওর সাথে কাজ করার অনুমতি দেয়:

  • মডেলের জন্য অডিও অন্তর্ভুক্ত করুন (Settings > AI Setup > Voice): আপনার রেকর্ডিং সংযুক্ত করে যাতে অডিও-সক্ষম মডেল (যেমন Gemini) আপনার প্রম্পটের পাশাপাশি আসল অডিও পর্যালোচনা করতে পারে — সুর, উচ্চারণ, পটভূমির শব্দ, শুধুমাত্র শব্দগুলো নয়। ডিফল্টভাবে বন্ধ থাকে; অন্যথায় কিছুই পাঠানো হয় না। মাইকের পাশের একটি ওয়েভফর্ম বোতাম প্রতিটি বার্তার জন্য এটি টগল করে, তবে বোতামটি শুধুমাত্র সেই মোড এবং অ্যাপগুলোতে প্রদর্শিত হয় যা এতে অপ্ট-ইন করে (যেমন "for Languages"), যাতে এটি দৈনন্দিন কাজের জন্য কম্পোজারকে ভিড় করে না তোলে।
  • শোনা (Hearing) (একটি বিনামূল্যে টুল, ডিফল্টভাবে চালু থাকে): সহকারীকে যেকোনো অডিও সংযুক্তি পিছিয়ে যেতে এবং একটি লক্ষ্যযুক্ত ফলো-আপ প্রশ্ন সহ আবার শুনতে দেয় — "কোন শব্দগুলো ভুল উচ্চারিত হয়েছিল?", "কণ্ঠস্বরের সুর কেমন?" — আপনি এটি সংযুক্ত করার পালা বা পরবর্তী যেকোনোটিতে। উৎসর্গীকৃত অডিও সহায়ক মডেলটি শোনার কাজ করে, তাই আপনার চ্যাট মডেল শুনতে না পারলেও এটি কাজ করে।

সিস্টেম-ওয়াইড ডিকটেশন (ডেস্কটপ)

আপনার কম্পিউটারের যেকোনো অ্যাপ্লিকেশনে ডিকটেট করুন — কেবল Caiioo-তে নয়:

প্রো সাবস্ক্রাইবারদের জন্য macOS, Windows, এবং Linux ডেস্কটপ অ্যাপে সিস্টেম-ওয়াইড ডিকটেশন বিল্ট-ইন রয়েছে — আলাদা কোনো কম্প্যানিয়ন অ্যাপ ইনস্টল করার প্রয়োজন নেই। যেকোনো জায়গায় ডিকটেশন হটকি চেপে ধরে কথা বলুন, আর আপনি যা বলবেন তা ফোকাসে থাকা যেকোনো অ্যাপে টাইপ হয়ে যাবে।

আরও দেখুন


This guide is maintained by the Caiioo team using Slate, our built-in editor.