זוהי תרגום מכונה של המסמך המקורי באנגלית. במקרה של סתירה בין תרגום זה לבין הגרסה המקורית באנגלית, הגרסה באנגלית היא הקובעת. קרא את הגרסה המקורית באנגלית
קול: לדבר ולהקשיב
רוצים שה-AI יקרא תגובות בקול רם? או להכתיב הודעות במקום להקליד? Caiioo מציעה קלט ופלט קולי — הכל ניתן להגדרה, וחלק מהאפשרויות רצות מקומית על המכשיר שלכם.

פלט קול (טקסט לדיבור)
תן ל-AI לקרוא את התשובות שלו בקול רם. בחר מתוך:
| אפשרות | סוג | איכות | הגדרה |
|---|---|---|---|
| ברירת המחדל של הדפדפן | מקומי | בסיסי | חינם, ללא הגדרה |
| Kokoro Neural TTS | מקומי | גבוהה | חינם, פועל על המכשיר שלך |
| Google Gemini | ענן | טבעי | הוסף את מפתח ה-API שלך |
| OpenAI (gpt-4o-mini-tts) | ענן | טבעי, הגשה ניתנת להכוונה | הוסף את מפתח ה-API של OpenAI שלך |
| ElevenLabs | ענן | פרמיום | הוסף את מפתח ה-API שלך |
| Cartesia (Sonic 3.5) | ענן | פרמיום | הוסף את מפתח ה-API שלך |
| Resemble.ai | ענן | מעולה (שכפול קול) | הוסף את מפתח ה-API שלך |
גודל הורדה של Kokoro: מודל Kokoro מגיע בשני וריאנטים, והמודל שיוורד תלוי בפלטפורמה שלך. ב-macOS וב-iOS נטען מודל ה-INT8-quantized הקטן יותר (~88 מגה-בייט), בעוד שהתוסף/דפדפן משתמש בבניית WebGPU הגדולה יותר בדיוק מלא (~330 מגה-בייט). זוהי הורדה חד-פעמית.
הערות פלטפורמה:
- Kokoro מקומי ל-iOS (גרסה 0.9.720+): פועל בתהליך המארח של iOS דרך OnnxRuntime במקום ב-WebView, מה שמתקן קריסות באייפון 13/14.
- Kokoro ל-macOS: משדר משפט אחר משפט (תוך כשנייה מרגע הלחיצה על הפעלה) דרך תהליך העזר של שולחן העבודה.
- Gemini TTS (גרסה 0.9.723+): מנגן משפט אחר משפט, כך שהשמע מתחיל לאחר המשפט הראשון במקום להמתן לסינתזה של כל התשובה.
- OpenAI (גרסה 0.9.724+): gpt-4o-mini-tts עם הגשה ניתנת להכוונה — בקש מבטא, טון או קצב בשפה טבעית (למשל "קרא את זה במבטא אירי חם") והקול יעקוב אחריו. משתמש באותו מפתח API של OpenAI כמו ספק ה-LLM של OpenAI. שדה הוראות סגנון קול תחת הגדרות > הגדרת AI > קול מחיל את הנחיית הסגנון שלך על כל תשובה מדוברת.
- Cartesia (גרסה 0.9.723+): מפתח API אחד מפעיל גם את Sonic 3.5 (פלט) וגם את Ink (קלט). אין קול ברירת מחדל — בחר אחד תחת הגדרות > הגדרת AI > קול לפני שתפעיל אותו.
- ElevenLabs: כל קול של ElevenLabs מתחיל לדבר ברגע שיש לו מה לומר — כולל v3 האקספרסיבי, שניתן לבחירה בבורר הקולות. מודל הקול ברירת המחדל הוא Flash v2.5: ElevenLabs מדרגים אותו כשווה באיכותו לברירת המחדל הקודמת, והוא עולה חצי מחיר לכל תווים.
- ElevenLabs v3 Conversational (גרסה 0.9.777+): בחר את מודל v3 Conversational ברשימת מודלי הקול עבור דיאלוג אקספרסיבי ובעל השהיה נמוכה ביותר מ-70 שפות. ElevenLabs מחייבת כרגע בחצי מתעריף ברירת המחדל לכל תו, ותחזיות העלויות של Caiioo משקפות זאת.
השהיה (Latency): Gemini וOpenAI מעבדים את כל התשובה לפני שההשמעה מתחילה, כך שהשמע הראשון עשוי להתעכב בכמה שניות בתשובות ארוכות יותר — הגדרות > הגדרת AI > קול מציג הערה כאשר אתה בוחר באחד מהם. לדיבור בהשהיה נמוכה, בחר ב-ElevenLabs, Cartesia או Resemble.
מהירות השמעה: מחוון המהירות (0.5×–2.0×) מוחל על ידי הספק עבור ElevenLabs (מוגבל ל-0.7–1.2×) ו-Cartesia (מוגבל ל-0.6–1.5×). קולות הדפדפן ו-Kokoro מאיצים מקומית. ל-Gemini ול-OpenAI אין בקרת מהירות משל עצמם, ולכן המחוון מוסתר כאשר הם נבחרים; Resemble.ai מחיל את הממהירות בהשמעה רגילה (לא סטרימינג). חריגה אחת: מודלי ElevenLabs v3 (v3 ו-v3 Conversational) אינם יכולים לשנות מהירות בעצמם, ולכן Caiioo מחיל את המהירות שלך במהלך ההשמעה במקום זאת, תוך שמירה על גובה הצליל (pitch) טבעי — המחיר הוא שכאשר המחוון אינו במצב רגיל, הם ממתינים לקليب המלא לפני תחילת הדיבור. במהירות רגילה הם עדיין מתחילים מיד.
Caiioo יכול לבחור קול שיתאים לרגע: כאשר קריאת משהו בקול רם היא חלק ממשימה, ה-AI יכול לבחור קול, קצב דיבור ומודל דיבור המתאימים לתוכן — קול אחר לסיפור לפני השינה מאשר לסיכום חדשות — במקום להשתמש תמיד בהגדרת הקול הגלובלית שלך. ההגדרות שלך נשארות ברירת המחדל עבור כל השאר.
כדי להפעיל:
- עבור אל הגדרות > הגדרת AI > קול
- בחר אפשרות טקסט לדיבור
- הפעל את "קרא תשובות אוטומטית" אם ברצונך שה-AI יקרא באופן אוטומטי
- התאם את מהירות ההשמעה אם תרצה
אם ההשמעה נכשלת: שגיאות קול מופיעות כעת כהודעת צף (toast) במקום להיכשל בשקט — כך שמפתח API חסר או לא תקף, או קול שאינו תואם למודל שנבחר (נפוץ ב-Resemble.ai ו-Cartesia), אומרים לך בדיוק מה לתקן.
מקומי לעומת ענן: קולות הדפדפן ו-Kokoro לעולם אינם שולחים דבר מחוץ למכשיר שלך. Gemini, OpenAI, ElevenLabs, Cartesia ו-Resemble.ai שולחים טקסט לשרתים שלהם (באמצעות מפתחות ה-API שלך) כדי לייצר את השמע. ראה פרטיות ונתונים לפרטים נוספים.
עלויות קול (TTS + STT) מצטברות כ-voice_cost בשיחה, בהתאמה לנתיב החד-פעמי.
קלט קולי (דיבור לטקסט)
הכתב את ההודעות שלך במקום להקליד. לחץ על אייקון המיקרופון בתיבת הכתיבה כדי להתחיל להקליט. Caiioo מתמלל את מה שאתה אומר ומכניס אותו לשדה ההודעה.
בחר כיצד הוא מתמלל:
| אפשרות | סוג | פרטיות | הגדרה |
|---|---|---|---|
| Whisper (דפדפן) | מקומי | פרטי לחלוטין | חינם, רץ על המכשיר שלך |
| WhisperKit (iOS) | מקומי | פרטי לחלוטין | חינם, על המכשיר |
| whisper.cpp & Moonshine (Android) | מקומי | פרטי לחלוטין | חינם, על המכשיר |
| Browser Speech | מקומי | פרטי | חינם, מובנה |
| ElevenLabs Scribe | ענן | מדויק (מעולה לשפות שאינן אנגלית) | הוסף מפתח API של ElevenLabs |
| Cartesia Ink | ענן | מדויק, השהיה נמוכה | הוסף מפתח API של Cartesia |
אפשרויות מקומיות שומרות את האודיו שלך מקומי — שום דבר לא נשלח לשרת. ElevenLabs ו-Cartesia שולחות אודיו לשרתים שלהן לתמלול (באמצעות מפתח ה-API שלך) ומציעות דיוק גבוה יותר, במיוחד לשפות שאינן אנגלית.
כדי להשתמש בזה:
- לחץ על אייקון המיקרופון בתיבת הכתיבה
- אמור את ההודעה שלך
- עצור כשתסיים
- התמלול יופיע בשדה ההודעה
- ערוך במידת הצורך, ואז שלח
הגדרה ראשונית: בפעם הראשונה שמשתמשים במודל דיבור על המכשיר, עליו לרדת ולהתחמם. תיבת הכתיבה מציגה את ההתקדמות ("מוריד מודל דיבור… N%", ואז "מכין"/"טוען"), לכן השהיה קצרה בלחיצה הראשונה על המיקרופון היא צפויה.
הקלטת אודיו וצירופו
בנוסף להכתבה, באפשרותך להקליט קטע קול ולצרף אותו להודעה שלך: פתח את תפריט ה-+ של שורת הכתיבה ובחר הקלט אודיו. זמין ב-iPhone, iPad, macOS ובתוסף הדפדפן. משתלב באופן טבעי עם אפליקציות המאזינות להקלטות שלך, כמו מאמן ההגייה "for Languages".
תנו למודל לשמוע את ההקלטה שלכם
שתי תכונות חורגות מתמליל ומאפשרות למודל שיכול לשמוע לעבוד עם האודיו בפועל:
- כלול אודיו עבור המודל (הגדרות > הגדרת בינה מלאכותית > קול): מצרף את ההקלטה שלך כך שמודל בעל יכולת שמע (למשל Gemini) סוקר את האודיו האמיתי לצד ההנחיה שלך — טון, הגייה, צלילי רקע, ולא רק המילים. כבוי כברירת מחדל; שום דבר לא נשלח אחרת. כפתור צורת גל לצד המיקרופון מפעיל/מכבה זאת לכל הודעה, אך הכפתור מופיע רק במצבים ובאפליקציות התומכים בכך (כמו "עבור שפות"), כך שהוא אינו מעמיס על המלחין למשימות יומיומיות.
- שמיעה (כלי חינמי, פעיל כברירת מחדל): מאפשר לעוזר לחזור ולהקשיב מחדש לכל קובץ אודיו מצורף עם שאלה ממוקדת — "אילו מילים בוטאו לא באופן תקין?", "מהו טון הדיבור?" — בתור שבו צירפת אותו או בכל תור מאוחר יותר. מודל העזר הייעודי לשמע מבצע את האזנה, כך שזה עובד גם כאשר מודל הצ'אט שלך אינו יכול לשמוע.
הכתבה כלל-מערכתית (שולחן עבודה)
הכתב לתוך כל יישום במחשב שלך — לא רק ב-Caiioo:
למנויי Pro יש הכתבה כלל-מערכתית מובנית באפליקציות שולחן העבודה של macOS, Windows ו-Linux — אין צורך להתקין אפליקציה נלווית. החזק את מקש ההכתבה בכל מקום, דבר, ומה שאתה אומר יוקלד ליישום הפעיל כרגע.
ראו גם
- פרטיות ונתונים — כיצד נתוני קול מטופלים
- פלטפורמה והגדרה — זמינות אפליקציית שולחן העבודה
- הגדרות > הגדרת בינה מלאכותית > קול — הגדר אפשרויות קול עבור ההגדרה שלך
This guide is maintained by the Caiioo team using Slate, our built-in editor.