এটি মূল ইংরেজি নথির একটি মেশিন অনুবাদ। এই অনুবাদ এবং মূল ইংরেজি সংস্করণের মধ্যে কোনো বিরোধ দেখা দিলে, ইংরেজি সংস্করণটিই প্রাধান্য পাবে। মূল ইংরেজি সংস্করণটি পড়ুন
ভয়েস: কথা বলুন এবং শুনুন
AI কি উত্তরগুলো জোরে পড়ে শোনাক তা চান? অথবা টাইপ করার বদলে বার্তাগুলো মুখে বলতে চান? Caiioo ভয়েস ইনপুট এবং আউটপুট অফার করে—সবই কনফিগারেবল, যার কিছু আপনার ডিভাইসে লোকালভাবে চলে।

ভয়েস আউটপুট (টেক্সট-টু-স্পিচ)
AI-কে তার উত্তরগুলো উচ্চস্বরে পড়তে বলুন। নিচের অপশনগুলো থেকে বেছে নিন:
| অপশন | ধরন | কোয়ালিটি | সেটআপ |
|---|---|---|---|
| ব্রাউজার ডিফল্ট (Browser Default) | লোকাল | মৌলিক | ফ্রি, কোনো সেটআপ নেই |
| Kokoro নিউরাল TTS | লোকাল | উচ্চ | ফ্রি, আপনার ডিভাইসে চলে |
| Google Gemini | ক্লাউড | প্রাকৃতিক | আপনার API কি যোগ করুন |
| OpenAI (gpt-4o-mini-tts) | ক্লাউড | প্রাকৃতিক, নিয়ন্ত্রণযোগ্য ডেলিভারি | আপনার OpenAI API কি যোগ করুন |
| ElevenLabs | ক্লাউড | প্রিমিয়াম | আপনার API কি যোগ করুন |
| Cartesia (Sonic 3.5) | ক্লাউড | প্রিমিয়াম | আপনার API কি যোগ করুন |
| Resemble.ai | ক্লাউড | চমৎকার (ভয়েস ক্লোনিং) | আপনার API কি যোগ করুন |
Kokoro ডাউনলোড সাইজ: Kokoro মডেলটি দুটি সংস্করণে আসে এবং আপনার প্ল্যাটফর্মের ওপর নির্ভর করে কোনটি ডাউনলোড হবে। macOS এবং iOS ছোট INT8-quantized মডেলটি (~88 MB) লোড করে, অন্যদিকে এক্সটেনশন/ব্রাউজার বড় ফুল-প্রিসিশন WebGPU বিল্ড (~330 MB) ব্যবহার করে। এটি একটি ওয়ান-টাইম ডাউনলোড।
প্ল্যাটফর্ম নোট:
- iOS নেটিভ Kokoro (v0.9.720+): WebView-এর পরিবর্তে OnnxRuntime-এর মাধ্যমে iOS হোস্ট প্রক্রিয়ায় চলে, যা iPhone 13/14 ক্র্যাশ সমস্যার সমাধান করে।
- macOS Kokoro: ডেস্কটপ হেল্পার প্রক্রিয়ার মাধ্যমে বাক্য-প্রতি-বাক্য (প্লে চাপার প্রায় ~1 সেকেন্ডের মধ্যে) স্ট্রিম করে।
- Gemini TTS (v0.9.723+): বাক্য-প্রতি-বাক্য প্লে করে, তাই পুরো উত্তরের সিন্থেসাইজ হওয়ার জন্য অপেক্ষা না করে প্রথম বাক্যের পরেই অডিও শুরু হয়।
- OpenAI (v0.9.724+): নিয়ন্ত্রণযোগ্য ডেলিভারি সহ gpt-4o-mini-tts — স্বাভাবিক ভাষায় কোনো অ্যাকসেন্ট, টোন বা গতির জন্য বলুন (যেমন: "এটি একটি উষ্ণ আইরিশ অ্যাকসেন্টে পড়ুন") এবং ভয়েস সে অনুযায়ী কাজ করবে। OpenAI LLM প্রোভাইডারের মতো একই OpenAI API কি ব্যবহার করে। Settings > Voice-এ থাকা একটি Voice style instructions ফিল্ড প্রতিটি কথ্য উত্তরে আপনার স্টাইল নির্দেশিকা প্রয়োগ করে।
- Cartesia (v0.9.723+): একটি API কি Sonic 3.5 (আউটপুট) এবং Ink (ইনপুট) উভয়কেই চালিত করে। কোনো ডিফল্ট ভয়েস নেই—এটি এনাবল করার আগে Settings > Voice থেকে একটি বেছে নিন।
লেটেেন্সি: Gemini এবং OpenAI প্লেব্যাক শুরু হওয়ার আগে পুরো উত্তর রেন্ডার করে, তাই দীর্ঘ উত্তরের ক্ষেত্রে প্রথম অডিওতে কয়েক সেকেন্ড দেরি হতে পারে — এগুলোর কোনো একটি বেছে নিলে Settings > Voice একটি নোট দেখায়। কম লেটেেন্সির স্পিচের জন্য ElevenLabs, Cartesia বা Resemble বেছে নিন।
প্লেব্যাক স্পিড: স্পিড স্লাইডারটি (0.5×–2.0×) ElevenLabs (0.7–1.2× এ সীমাবদ্ধ) এবং Cartesia-র (0.6–1.5× এ সীমাবদ্ধ) জন্য প্রোভাইডার দ্বারা প্রয়োগ করা হয়। ব্রাউজার ভয়েস এবং Kokoro লোকালি গতি বাড়িয়ে দেয়। Gemini এবং OpenAI-এর নিজস্ব কোনো স্পিড কন্ট্রোল নেই, তাই এগুলো সিলেক্ট করা থাকলে স্লাইডারটি লুকানো থাকে; Resemble.ai স্ট্যান্ডার্ড (নন-স্ট্র্রিমিং) প্লেব্যাকে স্পিড প্রয়োগ করে।
এটি এনাবল করতে:
- Settings > Voice-এ যান
- একটি টেক্সট-টু-স্পিচ অপশন বেছে নিন
- AI নিজে থেকেই পড়তে চাইলে "Auto-read responses" টগল করুন
- আপনার পছন্দমতো প্লেব্যাক স্পিড অ্যাডজাস্ট করুন
প্লেব্যাক ফেইল হলে: ভয়েস ত্রুটিগুলো এখন নীরবে ফেইল হওয়ার পরিবর্তে একটি টোস্ট হিসেবে দেখা যায়—তাই অনুপস্থিত বা ইনভ্যালিড API কি, অথবা সিলেক্ট করা মডেলের সাথে সামঞ্জস্যপূর্ণ নয় এমন কোনো ভয়েস (Resemble.ai এবং Cartesia-র ক্ষেত্রে সাধারণ) ঠিক কী ঠিক করতে হবে তা আপনাকে বলে দেয়।
লোকাল বনাম ক্লাউড: ব্রাউজার ভয়েস এবং Kokoro আপনার ডিভাইস থেকে কখনো কিছু বাইরে পাঠায় না। অডিও জেনারেট করতে Gemini, OpenAI, ElevenLabs, Cartesia এবং Resemble.ai (আপনার API কি ব্যবহার করে) তাদের সার্ভারে টেক্সট পাঠায়। বিস্তারিত জানতে Privacy & Data দেখুন।
ভয়েস খরচ (TTS + STT) ওয়ান-শাট পাথের সাথে মিলিয়ে কনভারসেশনে voice_cost হিসেবে যোগ হয়।
ভয়েস ইনপুট (স্পিচ-টু-টেক্সট)
টাইপ করার পরিবর্তে আপনার মেসেজগুলো মুখে বলুন। রেকর্ডিং শুরু করতে কম্পোজারে মাইক্রোফোন আইকনে ক্লিক করুন। Caiioo আপনি যা বলছেন তা ট্রান্সক্রাইব করবে এবং মেসেজ ফিল্ডে বসিয়ে দেবে।
কীভাবে ট্রান্সক্রাইব হবে তা বেছে নিন:
| অপশন | ধরন | গোপনীয়তা | সেটআপ |
|---|---|---|---|
| Whisper (Browser) | লোকাল | সম্পূর্ণ ব্যক্তিগত | ফ্রি, আপনার ডিভাইসে চলে |
| WhisperKit (iOS) | লোকাল | সম্পূর্ণ ব্যক্তিগত | ফ্রি, অন-ডিভাইস |
| whisper.cpp & Moonshine (Android) | লোকাল | সম্পূর্ণ ব্যক্তিগত | ফ্রি, অন-ডিভাইস |
| Browser Speech | লোকাল | ব্যক্তিগত | ফ্রি, বিল্ট-ইন |
| ElevenLabs Scribe | ক্লাউড | নির্ভুল (ইংরেজি বাদে অন্য ভাষার জন্য ভালো) | আপনার ElevenLabs API key যোগ করুন |
| Cartesia Ink | ক্লাউড | নির্ভুল, কম ল্যাটেন্সি | আপনার Cartesia API key যোগ করুন |
লোকাল অপশনগুলো (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) আপনার অডিও লোকাল রাখে—কোনো সার্ভারে কিছু পাঠানো হয় না। ElevenLabs এবং Cartesia ট্রান্সক্রিপশনের জন্য তাদের সার্ভারে অডিও পাঠায় (আপনার API key ব্যবহার করে) এবং উচ্চতর নির্ভুলতা প্রদান করে, বিশেষ করে ইংরেজি বাদে অন্য ভাষার জন্য।
এটি ব্যবহার করতে: ১. কম্পোজারে মাইক্রোফোন আইকনে ক্লিক করুন ২. আপনার মেসেজটি বলুন ৩. বলা শেষ হলে থামুন ৪. ট্রান্সক্রিপ্টটি মেসেজ ফিল্ডে প্রদর্শিত হবে ৫. প্রয়োজন হলে এডিট করুন, তারপর পাঠান
প্রথমবার সেটআপ: প্রথমবার অন-ডিভাইস স্পিচ মডেল ব্যবহার করার সময় এটি ডাউনলোড এবং প্রস্তুত হতে হয়। কম্পোজার এর অগ্রগতি দেখায় ("Downloading speech model… N%", তারপর "Preparing"/"Loading"), তাই প্রথমবার মাইক্রোফোন ট্যাপ করার সময় সামান্য বিরতি স্বাভাবিক, এটি হ্যাং হওয়া নয়।
অডিও রেকর্ড করুন এবং এটি সংযুক্ত করুন
ডিকটেশনের পাশাপাশি, আপনি একটি ক্লিপ রেকর্ড করতে পারেন এবং এটি আপনার বার্তায় সংযুক্ত করতে পারেন: কম্পোজরের + মেনু খুলুন এবং Record audio বেছে নিন। iPhone, iPad, macOS এবং ব্রাউজার এক্সটেনশনে উপলব্ধ। "for Languages" উচ্চারণ কোচের মতো আপনার রেকর্ডিং শোনে এমন অ্যাপগুলির সাথে স্বাভাবিকভাবেই জোড়া লাগে।
মডেলটিকে আপনার রেকর্ডিং শুনতে দিন
দুটি বৈশিষ্ট্য ট্রান্সক্রিপশনের বাইরে যায় এবং শুনতে সক্ষম এমন একটি মডেলকে প্রকৃত অডিও নিয়ে কাজ করতে দেয়:
- Include audio for the model (Settings > Voice): আপনার রেকর্ডিং সংযুক্ত করে যাতে একটি অডিও-সক্ষম মডেল (যেমন Gemini) আপনার প্রম্পটের পাশাপাশি আসল অডিও পর্যালোচনা করে — টোন, উচ্চারণ, ব্যাকগ্রাউন্ড সাউন্ড, কেবল শব্দগুলি নয়। ডিফল্টভাবে বন্ধ; অন্যথায় কিছুই পাঠানো হয় না। মাইকের পাশের একটি ওয়েভফর্ম বোতাম প্রতি বার্তায় এটি টগল করে, তবে বোতামটি শুধুমাত্র মোড এবং অ্যাপগুলিতে উপস্থিত হয় যেগুলি এটি বেছে নেয় (যেমন "for Languages"), তাই এটি দৈনন্দিন কাজের জন্য কম্পোজারকে অপ্রাসঙ্গিক করে তোলে না।
- Hearing (একটি ফ্রি টুল, ডিফল্টভাবে চালু): সহকারীকে ফিরে যেতে এবং একটি লক্ষ্যযুক্ত ফলো-আপ প্রশ্ন সহ যেকোনো অডিও সংযুক্তি পুনরায় শুনতে দেয় — "কোন শব্দগুলি ভুল উচ্চারিত হয়েছিল?", "গলার স্বরের টোন কী?" — যে টার্নে আপনি এটি সংযুক্ত করেন বা পরবর্তীতে যেকোনোটিতে। নিবেদিত অডিও হেল্পার মডেলটি শোনার কাজটি করে, তাই আপনার চ্যাট মডেল শুনতে না পেলেও এটি কাজ করে।
সিস্টেম-ওয়াইড ডিক্টেশন (macOS)
macOS-এ Pro সাবস্ক্রাইবাররা PrivateVoice ইনস্টল করতে পারেন, যা একটি আলাদা কম্প্যানিয়ন অ্যাপ। এটি শুধুমাত্র Caiioo নয়, যেকোনো অ্যাপ্লিকেশনে ডিক্টেট করার জন্য একটি গ্লোবাল প্রেস-টু-টক হটকি যোগ করে। বিস্তারিত জানতে ডেস্কটপ ডাউনলোড পেজ দেখুন।
আরও দেখুন
- গোপনীয়তা এবং ডেটা — ভয়েস ডেটা কীভাবে পরিচালনা করা হয়
- প্ল্যাটফর্ম এবং সেটআপ — ডেস্কটপ অ্যাপ এবং PrivateVoice-এর প্রাপ্যতা
- Settings > Voice — আপনার সেটআপের জন্য ভয়েস বিকল্পগুলি কনফিগার করুন
This guide is maintained by the Caiioo team using Slate, our built-in editor.