هذه ترجمة آلية للمستند الأصلي باللغة الإنجليزية. في حال وجود أي تعارض بين هذه الترجمة والنسخة الإنجليزية الأصلية، تُعتمد النسخة الإنجليزية. اقرأ النسخة الإنجليزية الأصلية
الصوت: تحدث واستمع
هل تريد أن يقرأ الذكاء الاصطناعي الاستجابات بصوت عالٍ؟ أو تملي الرسائل بدلاً من كتابتها؟ يقدم Caiioo إدخالاً وإخراجاً صوتياً — كلها قابلة للتكوين، وبعضها يعمل محلياً على جهازك.

Voice Output (Text-to-Speech)
دع الذكاء الاصطناعي يقرأ ردوده بصوت عالٍ. اختر من بين ما يلي:
| الخيار | النوع | الجودة | الإعداد |
|---|---|---|---|
| Browser Default | محلي | أساسي | مجاني، بدون إعداد |
| Kokoro Neural TTS | محلي | عالي | مجاني، يعمل على جهازك |
| Google Gemini | سحابي | طبيعي | أضف مفتاح API الخاص بك |
| OpenAI (gpt-4o-mini-tts) | سحابي | طبيعي، إلقاء قابل للتوجيه | أضف مفتاح OpenAI API الخاص بك |
| ElevenLabs | سحابي | متميز | أضف مفتاح API الخاص بك |
| Cartesia (Sonic 3.5) | سحابي | متميز | أضف مفتاح API الخاص بك |
| Resemble.ai | سحابي | ممتاز (استنساخ الصوت) | أضف مفتاح API الخاص بك |
حجم تنزيل Kokoro: يأتي نموذج Kokoro في نوعين مختلفين، ويعتمد النموذج الذي يتم تنزيله على النظام الأساسي الخاص بك. يقوم نظاما macOS وiOS بتحميل نموذج INT8-quantized الأصغر (~88 ميغابايت)، بينما يستخدم امتداد المتصفح/المتصفح إصدار WebGPU الأكبر عالي الدقة بالكامل (~330 ميغابايت). إنه تنزيل لمرة واحدة.
ملاحظات المنصة:
- Kokoro الأصلي لنظام iOS (الإصدار v0.9.720+): يعمل داخل عملية مضيف iOS عبر OnnxRuntime بدلاً من WebView، مما يؤدي إلى إصلاح الأعطال في أجهزة iPhone 13/14.
- Kokoro لنظام macOS: يقوم ببث جملة بجملة (في غضون ثانية واحدة تقريبًا من الضغط على تشغيل) من خلال عملية المساعد لجهاز الكمبيوتر.
- Gemini TTS (الإصدار v0.9.723+): يقوم بالتشغيل جملة بجملة، لذلك يبدأ الصوت بعد الجملة الأولى بدلاً من انتظار تركيب الرد بأكمله.
- OpenAI (الإصدار v0.9.724+): نموذج gpt-4o-mini-tts مع إلقاء قابل للتوجيه — اطلب لكنة أو نبرة أو سرعة بلغة طبيعية (مثل "اقرأ هذا بلكنة أيرلندية دافئة") وسيتبع الصوت ذلك. يغنيك عن استخدام مفتاح OpenAI API نفسه الخاص بمزود OpenAI LLM. يعمل حقل تعليمات نمط الصوت (Voice style instructions) في الإعدادات > إعداد الذكاء الاصطناعي > الصوت (Settings > AI Setup > Voice) على تطبيق توجيه النمط الخاص بك على كل رد منطوق.
- Cartesia (الإصدار v0.9.723+): مفتاح API واحد يشغل كلاً من Sonic 3.5 (الإخراج) وInk (الإدخال). لا يوجد صوت افتراضي — اختر واحداً في الإعدادات > إعداد الذكاء الاصطناعي > الصوت (Settings > AI Setup > Voice) قبل تمكينه.
- ElevenLabs: يبدأ كل صوت من ElevenLabs في التحدث بمجرد أن يكون لديه ما يقوله — بما في ذلك الإصدار v3 التعبيري، والذي يمكن تحديده في منتقي الأصوات. نموذج الصوت الافتراضي هو Flash v2.5: تعتبره ElevenLabs مكافئًا في الجودة للإصدار الافتراضي السابق، وتكلفته نصف السعر لكل حرف.
- ElevenLabs v3 Conversational (الإصدار v0.9.777+): اختر نموذج v3 Conversational في قائمة نماذج الأصوات للحصول على حوار تعبيري ومنخفض التأخير بأكثر من 70 لغة. تتقاضى ElevenLabs رسومًا حالية تعادل نصف معدل الحرف الواحد القياسي، وتنعكس تقديرات تكلفة Caiioo على ذلك.
وقت الاستجابة (Latency): يقوم Gemini وOpenAI بعرض الرد بالكامل قبل بدء التشغيل، لذلك قد يتأخر الصوت الأول بضع ثوانٍ في الردود الأطول — تعرض الإعدادات > إعداد الذكاء الاصطناعي > الصوت (Settings > AI Setup > Voice) ملاحظة عندما تختار أحدهما. للحصول على كلام منخفض التأخير، اختر ElevenLabs أو Cartesia أو Resemble.
سرعة التشغيل: يتم تطبيق شريط التمرير الخاص بالسرعة (0.5×–2.0×) بواسطة المزود لـ ElevenLabs (محدد بين 0.7–1.2×) وCartesia (محدد بين 0.6–1.5×). تتسارع أصوات المتصفح وKokoro محليًا. لا يحتوي Gemini وOpenAI على تحكم خاص بهما في السرعة، لذا يتم إخفاء شريط التمرير أثناء تحديدهما؛ بينما يطبق Resemble.ai السرعة على التشغيل القياسي (غير البث المباشر). استثناء واحد: لا يمكن لنماذج ElevenLabs v3 (v3 وv3 Conversational) تغيير السرعة بأنفسهما، لذا يقوم Caiioo بتطبيق سرعتك أثناء التشغيل بدلاً من ذلك، مع الحفاظ على طبقة الصوت طبيعية — المقايضة هنا هي أنه مع وجود شريط التمرير بعيدًا عن الوضع الطبيعي، فإنها تنتظر المقطع بأكمله قبل البدء في التحدث. أما في السرعة العادية فإنها لا تزال تبدأ على الفور.
يمكن لـ Caiioo اختيار صوت يناسب اللحظة: عندما تكون قراءة شيء ما بصوت عالٍ جزءًا من مهمة، يمكن للذكاء الاصطناعي اختيار صوت ومعدل تحدث ونموذج كلام يناسب المحتوى — صوت مختلف لقصة قبل النوم مقارنة بملخص إخباري — بدلاً من استخدام إعداد الصوت العام الخاص بك طوال الوقت. تظل إعداداتك الخاصة هي الإعداد الافتراضي لكل شيء آخر.
لتمكينه:
- انتقل إلى الإعدادات > إعداد الذكاء الاصطناعي > الصوت (Settings > AI Setup > Voice)
- اختر خيار تحويل النص إلى كلام
- قم بتبديل خيار "القراءة التلقائية للردود" (Auto-read responses) إذا كنت تريد أن يقرأ الذكاء الاصطناعي تلقائيًا
- اضبط سرعة التشغيل إذا رغبت في ذلك
إذا فشل التشغيل: تظهر أخطاء الصوت الآن كإشعار منبثق (toast) بدلاً من الفشل بصمت — لذا فإن مفتاح API المفقود أو غير الصالحة، أو الصوت غير المتوافق مع النموذج المحدد (وهو أمر شائع مع Resemble.ai وCartesia)، يخبرك بدقة بما يجب إصلاحه.
محلي مقابل سحابي: لا ترسل أصوات المتصفح وKokoro أي شيء خارج جهازك. بينما يرسل Gemini وOpenAI وElevenLabs وCartesia وResemble.ai النصوص إلى خوادمهم (باستخدام مفاتيح API الخاصة بك) لتوليد الصوت. راجع الخصوصية والبيانات للحصول على التفاصيل.
تكاليف الصوت (تحويل النص إلى كلام TTS + تحويل الكلام إلى نص STT) تُجمع تحت voice_cost في المحادثة، مطابقة لمسار الطلب الواحد (one-shot).
الإدخال الصوتي (تحويل الكلام إلى نص)
أملِ رسائلك بدلاً من كتابتها. انقر فوق أيقونة الميكروفون في حقل الكتابة لبدء التسجيل. سيقوم Caiioo بنسخ ما تقوله ووضعه في حقل الرسالة.
اختر طريقة النسخ:
| الخيار | النوع | الخصوصية | الإعداد |
|---|---|---|---|
| Whisper (المتصفح) | محلي | خصوصية كاملة | مجاني، يعمل على جهازك |
| WhisperKit (iOS) | محلي | خصوصية كاملة | مجاني، على الجهاز |
| whisper.cpp & Moonshine (أندرويد) | محلي | خصوصية كاملة | مجاني، على الجهاز |
| Browser Speech | محلي | خاص | مجاني، مدمج |
| ElevenLabs Scribe | سحابي | دقيق (رائع لغير الإنجليزية) | أضف مفتاح API الخاص بـ ElevenLabs |
| Cartesia Ink | سحابي | دقيق، زمن انتقال منخفض | أضف مفتاح API الخاص بـ Cartesia |
الخيارات المحلية (Whisper، WhisperKit، whisper.cpp، Moonshine، Browser Speech) تبقي صوتك محليًا—لا يتم إرسال أي شيء إلى أي خادم. ترسل ElevenLabs و Cartesia الصوت إلى خوادمهما للنسخ (باستخدام مفتاح API الخاص بك) وتوفر دقة أعلى، خاصة للغات غير الإنجليزية.
لاستخدامه:
- انقر فوق أيقونة الميكروفون في حقل الكتابة
- تحدث برسالتك
- توقف عند الانتهاء
- يظهر النص المنسوخ في حقل الرسالة
- قم بالتحرير إذا لزم الأمر، ثم أرسل
الإعداد لأول مرة: في المرة الأولى التي تستخدم فيها نموذج كلام على الجهاز، يجب تنزيله وتهيئته. يظهر حقل الكتابة التقدم ("جاري تنزيل نموذج الكلام... N%"، ثم "جاري التحضير"/"جاري التحميل")، لذا فإن توقفًا قصيرًا عند أول نقرة على الميكروفون أمر متوقع، وليس تعليقًا.
تسجيل الصوت وإرفاقه
إلى جانب الإملاء، يمكنك تسجيل مقطع وإرفاقه برسالتك: افتح قائمة + الخاصة بـ composer واختر تسجيل صوت. متوفر على iPhone و iPad و macOS وامتداد المتصفح. يتوافق بشكل طبيعي مع التطبيقات التي تستمع إلى تسجلاتك، مثل مدرب النطق "لغات".
دع النموذج يسمع تسجيلك
ميزتان تتجاوزان النسخ وتسمحان للنموذج الذي يمكنه السمع بالعمل مع الصوت الفعلي:
- تضمين الصوت للنموذج (الإعدادات > إعداد الذكاء الاصطناعي > الصوت): يرفق تسجيلك بحيث يقوم نموذج قادر على الصوت (مثل Gemini) بمراجعة الصوت الحقيقي بجانب موجهك — النبرة، النطق، أصوات الخلفية، وليس الكلمات فقط. متوقف افتراضياً؛ لا شيء يرسل بخلاف ذلك. زر الموجة الصوتية بجوار الميكروفون يبدله لكل رسالة، لكن الزر يظهر فقط في الأنماط والتطبيقات التي تختار المشاركة فيها (مثل "اللغات")، حتى لا يزدحم الملحن للمهام اليومية.
- السمع (أداة مجانية، قيد التشغيل افتراضياً): يتيح للمساعد العودة وإعادة الاستماع إلى أي مرفق صوتي بسؤال متابعة مستهدف — "ما هي الكلمات التي أُسيء نطقها؟"، "ما هي نبرة الصوت؟" — في الدور الذي ترفقه أو أي دور لاحق. نموذج مساعد الصوت المخصص يقوم بالاستماع، لذا يعمل هذا حتى عندما لا يستطيع نموذج الدردشة الخاص بك السمع.
الإملاء على مستوى النظام (سطح المكتب)
قم بالإملاء في أي تطبيق على جهاز الكمبيوتر الخاص بك — وليس فقط في Caiioo:
يتمتع مشستركو باقة Pro بميزة الإملاء المدمجة على مستوى النظام في تطبيقات سطح المكتب لـ macOS وWindows وLinux — دون الحاجة لتثبيت أي تطبيق إضافي. استمر بالضغط على اختصار الإملاء في أي مكان، وتحدث، وسيتم كتابة ما تقوله في التطبيق النشط حالياً.
انظر أيضاً
- الخصوصية والبيانات — كيف يتم التعامل مع بيانات الصوت
- المنصة والإعداد — توفر تطبيق سطح المكتب
- الإعدادات > إعداد الذكاء الاصطناعي > الصوت — تكوين خيارات الصوت لإعدادك
This guide is maintained by the Caiioo team using Slate, our built-in editor.