هذه ترجمة آلية للمستند الأصلي باللغة الإنجليزية. في حال وجود أي تعارض بين هذه الترجمة والنسخة الإنجليزية الأصلية، تُعتمد النسخة الإنجليزية. اقرأ النسخة الإنجليزية الأصلية


الصوت: تحدث واستمع

هل تريد أن يقرأ الذكاء الاصطناعي الاستجابات بصوت عالٍ؟ أو تملي الرسائل بدلاً من كتابتها؟ يقدم Caiioo إدخالاً وإخراجاً صوتياً — كلها قابلة للتكوين، وبعضها يعمل محلياً على جهازك.

إعدادات الصوت مع خيارات الإدخال والإخراج، وتبديل القراءة التلقائية، وسرعة التشغيل

الإخراج الصوتي (تحويل النص إلى كلام)

اجعل الذكاء الاصطناعي يقرأ ردوده بصوت عالٍ. اختر من بين ما يلي:

الخيار النوع الجودة الإعداد
افتراضي المتصفح (Browser Default) محلي أساسي مجاني، بدون إعداد
Kokoro Neural TTS محلي عالي مجاني، يعمل على جهازك
Google Gemini سحابي طبيعي أضف مفتاح API الخاص بك
OpenAI (gpt-4o-mini-tts) سحابي طبيعي، أداء قابل للتوجيه أضف مفتاح OpenAI API الخاص بك
ElevenLabs سحابي مميز أضف مفتاح API الخاص بك
Cartesia (Sonic 3.5) سحابي مميز أضف مفتاح API الخاص بك
Resemble.ai سحابي ممتاز (استنساخ الصوت) أضف مفتاح API الخاص بك

حجم تنزيل Kokoro: يأتي نموذج Kokoro في نوعين مختلفين، ويعتمد النموذج الذي يتم تنزيله على منصتك. يقوم نظاما macOS وiOS بتحميل نموذج INT8-quantized الأصغر (~88 ميجابايت)، بينما تستخدم الإضافات/المتصفحات إصدار WebGPU الأكبر عالي الدقة (~330 ميجابايت). إنه تنزيل لمرة واحدة.

ملاحظات المنصات:

  • Kokoro الأصلي على iOS (الإصدار v0.9.720+): يعمل في عملية مضيف iOS عبر OnnxRuntime بدلاً من WebView، مما يصحح أعطال أجهزة iPhone 13/14.
  • Kokoro على macOS: يبث الصوت جملة بجملة (في غضون ثانية واحدة تقريباً من الضغط على تشغيل) عبر عملية المساعد لسطح المكتب.
  • Gemini TTS (الإصدار v0.9.723+): يقوم بتشغيل الصوت جملة بجملة، بحيث تبدأ الصوتيّات بعد الجملة الأولى بدلاً من انتظار تركيب الرد بأكمله.
  • OpenAI (الإصدار v0.9.724+): نموذج gpt-4o-mini-tts مع أداء قابل للتوجيه — اطلب لكنة أو نبرة أو سرعة معينة بلغة طبيعية (مثل "اقرأ هذا بلهجة إيرلندية دافئة") وسيتبع الصوت ذلك. يستخدم نفس مفتاح OpenAI API الخاص بمزود LLM في OpenAI. يتيح لك حقل تعليمات نمط الصوت (Voice style instructions) في الإعدادات > الصوت (Settings > Voice) تطبيق توجيه النمط الخاص بك على كل رد منطوق.
  • Cartesia (الإصدار v0.9.723+): مفتاح API واحد يشغل كلاً من Sonic 3.5 (للإخراج) وInk (للإدخال). لا توجد صوته افتراضية — اختر واحدة من الإعدادات > الصوت (Settings > Voice) قبل تمكينها.

زمن الانتقال (Latency): يقوم كل من Gemini وOpenAI بمعالجة الرد بالكامل قبل بدء التشغيل، لذلك قد يتأخر الصوت الأول بضع ثوانٍ في الردود الأطول — تعرض الإعدادات > الصوت (Settings > Voice) ملاحظة عند اختيار أي منهما. للحصول على كلام منخفض زمن الانتقال، اختر ElevenLabs أو Cartesia أو Resemble.

سرعة التشغيل: يتم تطبيق شريط تمرير السرعة (0.5×–2.0×) بواسطة المزود لـ ElevenLabs (محدد بين 0.7 و1.2×) وCartesia (محدد بين 0.6 و1.5×). تتسارع أصوات المتصفحات وKokoro محلياً. لا تحتوي نماذج Gemini وOpenAI على تحكم خاص بها في السرعة، لذا يتم إخفاء شريط التمرير عند تحديدها؛ بينما تطبق Resemble.ai السرعة على التشغيل القياسي (غير البثي).

لتمكين الميزة:

  1. انتقل إلى الإعدادات > الصوت (Settings > Voice)
  2. اختر خيار تحويل النص إلى كلام
  3. قم بتبديل خيار "القراءة التلقائية للردود (Auto-read responses)" إذا كنت تريد أن يقرأ الذكاء الاصطناعي تلقائياً
  4. اضبط سرعة التشغيل إذا رغبت في ذلك

إذا فشل التشغيل: تظهر أخطاء الصوت الآن كإشعار منبثق (toast) بدلاً من الفشل بصمت — لذا فإن مفتاح API المفقود أو غير الصالح، أو الصوت غير المتوافق مع النموذج المحدد (وهو أمر شائع مع Resemble.ai وCartesia)، سيخبرك بدقة بما يجب إصلاحه.

محلي مقابل سحابي: لا ترسل أصوات المتصفح وKokoro أي شيء خارج جهازك. بينما ترسل نماذج Gemini وOpenAI وElevenLabs وCartesia وResemble.ai النصوص إلى خوادمها (باستخدام مفاتيح API الخاصة بك) لتوليد الصوت. راجع الخصوصية والبيانات للحصول على التفاصيل.

تكاليف الصوت (تحويل النص إلى كلام + تحويل الكلام إلى نص) تتجمع تحت اسم voice_cost في المحادثة، مطابقة لمسار الطلب الفردي (one-shot).

الإدخال الصوتي (تحويل الكلام إلى نص)

أملِ رسائلك بدلاً من كتابتها. انقر فوق أيقونة الميكروفون في حقل الكتابة لبدء التسجيل. سيقوم Caiioo بنسخ ما تقوله ووضعه في حقل الرسالة.

اختر طريقة النسخ:

الخيار النوع الخصوصية الإعداد
Whisper (المتصفح) محلي خصوصية كاملة مجاني، يعمل على جهازك
WhisperKit (iOS) محلي خصوصية كاملة مجاني، على الجهاز
whisper.cpp & Moonshine (أندرويد) محلي خصوصية كاملة مجاني، على الجهاز
Browser Speech محلي خاص مجاني، مدمج
ElevenLabs Scribe سحابي دقيق (رائع لغير الإنجليزية) أضف مفتاح API الخاص بـ ElevenLabs
Cartesia Ink سحابي دقيق، زمن انتقال منخفض أضف مفتاح API الخاص بـ Cartesia

الخيارات المحلية (Whisper، WhisperKit، whisper.cpp، Moonshine، Browser Speech) تبقي صوتك محليًا—لا يتم إرسال أي شيء إلى أي خادم. ترسل ElevenLabs و Cartesia الصوت إلى خوادمهما للنسخ (باستخدام مفتاح API الخاص بك) وتوفر دقة أعلى، خاصة للغات غير الإنجليزية.

لاستخدامه:

  1. انقر فوق أيقونة الميكروفون في حقل الكتابة
  2. تحدث برسالتك
  3. توقف عند الانتهاء
  4. يظهر النص المنسوخ في حقل الرسالة
  5. قم بالتحرير إذا لزم الأمر، ثم أرسل

الإعداد لأول مرة: في المرة الأولى التي تستخدم فيها نموذج كلام على الجهاز، يجب تنزيله وتهيئته. يظهر حقل الكتابة التقدم ("جاري تنزيل نموذج الكلام... N%"، ثم "جاري التحضير"/"جاري التحميل")، لذا فإن توقفًا قصيرًا عند أول نقرة على الميكروفون أمر متوقع، وليس تعليقًا.

تسجيل الصوت وإرفاقه

إلى جانب الإملاء، يمكنك تسجيل مقطع وإرفاقه برسالتك: افتح قائمة + الخاصة بـ composer واختر تسجيل صوت. متوفر على iPhone و iPad و macOS وامتداد المتصفح. يتوافق بشكل طبيعي مع التطبيقات التي تستمع إلى تسجلاتك، مثل مدرب النطق "لغات".

السماح للنموذج بسماع تسجيلك

تتجاوز ميزتان النسخ وتسمحان لنموذج قادر على السمع بالعمل مع الصوت الفعلي:

  • تضمين الصوت للنموذج (الإعدادات > الصوت): يرفق تسجيلك حتى يتمكن نموذج قادر على الصوت (مثل Gemini) من مراجعة الصوت الحقيقي جنباً إلى جنب مع موجهك — النبرة، النطق، الأصوات في الخلفية، وليس الكلمات فقط. متوقف افتراضياً؛ لا يتم إرسال أي شيء بخلاف ذلك. زر الموجة الصوتية بجوار الميكروفون يبدله لكل رسالة، لكن الزر يظهر فقط في الأنماط والتطبيقات التي تدعمه (مثل "لغات")، لذلك لا يزحم نافذة الإنشاء للمهام اليومية.
  • السمع (أداة مجانية، مفعلة افتراضياً): تتيح للمساعد العودة وإعادة الاستماع إلى أي مرفق صوتي بسؤال متابعة مستهدف — "ما هي الكلمات التي تم نطقها بشكل خاطئ؟"، "ما هي نبرة الصوت؟" — في الدور الذي ترفقه فيه أو أي دور لاحق. يقوم نموذج المساعد الصوتي المخصص بعملية الاستماع، لذا يعمل هذا حتى عندما لا يستطيع نموذج المحادثة الخاص بك سماع الصوت.

الإملاء على مستوى النظام (macOS)

يمكن لمشتركي Pro على macOS أيضاً تثبيت PrivateVoice، وهو تطبيق مرافق منفصل يضيف مفتاح اختصار عالمي للتحدث والإملاء في أي تطبيق — وليس فقط Caiioo. راجع صفحة تنزيل سطح المكتب لمزيد من التفاصيل.

انظر أيضاً


This guide is maintained by the Caiioo team using Slate, our built-in editor.