זוהי תרגום מכונה של המסמך המקורי באנגלית. במקרה של סתירה בין תרגום זה לבין הגרסה המקורית באנגלית, הגרסה באנגלית היא הקובעת. קרא את הגרסה המקורית באנגלית
קול: לדבר ולהקשיב
רוצים שה-AI יקרא תגובות בקול רם? או להכתיב הודעות במקום להקליד? Caiioo מציעה קלט ופלט קולי — הכל ניתן להגדרה, וחלק מהאפשרויות רצות מקומית על המכשיר שלכם.

Voice Output (Text-to-Speech)
תן בינה מלאכותית לקרוא את התשובות שלה בקול רם. בחר מתוך:
| אפשרות | סוג | איכות | הגדרה |
|---|---|---|---|
| Browser Default | מקומי | בסיסי | חינם, ללא הגדרה |
| Kokoro Neural TTS | מקומי | גבוהה | חינם, פועל על המכשיר שלך |
| Google Gemini | בענן | טבעי | הוסף את מפתח ה-API שלך |
| OpenAI (gpt-4o-mini-tts) | בענן | טבעי, הגשה ניתנת לשליטה | הוסף את מפתח ה-OpenAI API שלך |
| ElevenLabs | בענן | פרימיום | הוסף את מפתח ה-API שלך |
| Cartesia (Sonic 3.5) | בענן | פרימיום | הוסף את מפתח ה-API שלך |
| Resemble.ai | בענן | מצוין (שכפול קול) | הוסף את מפתח ה-API שלך |
גודל הורדה של Kokoro: מודל Kokoro מגיע בשני וריאנטים, והמודל שיורד תלוי בפלטפורמה שלך. מערכות macOS ו-iOS טוענות את מודל ה-INT8-quantized הקטן יותר (~88 מגה-בייט), בעוד שהתוסף/דפדפן משתמש בבניית WebGPU המלאה והגדולה יותר (~330 מגה-בייט). זוהי הורדה חד-פעמית.
הערות פלטפורמה:
- Kokoro מקורי ב-iOS (גרסה v0.9.720+): פועל בתהליך המארח של iOS דרך OnnxRuntime במקום WebView, מה שמתקן קריסות באייפון 13/14.
- Kokoro ב-macOS: ממריא משפט אחר משפט (תוך כשנייה מרגע הלחיצה על הפעלה) דרך תהליך העזר השולחני.
- Gemini TTS (גרסה v0.9.723+): מנגן משפט אחר משפט, כך שהשמע מתחיל לאחר המשפט הראשון במקום להמתן לסינתזה של כל התשובה.
- OpenAI (גרסה v0.9.724+): gpt-4o-mini-tts עם הגשה ניתנת לשליטה — בקש מבטא, טון או קצב בשפה טבעית (למשל "קרא את זה עם מבטא אירי חם") והקול יעקוב אחריו. משתמש באותו מפתח OpenAI API כמו ספק ה-OpenAI LLM. שדה Voice style instructions (הוראות סגנון קול) תחת Settings > Voice מחיל את הנחיית הסגנון שלך על כל תשובה מדוברת.
- Cartesia (גרסה v0.9.723+): מפתח API יחיד מפעיל גם את Sonic 3.5 (פלט) וגם את Ink (קלט). אין קול ברירת מחדל — בחר אחד תחת Settings > Voice לפני שתפעיל אותו.
שיהוי (Latency): Gemini ו-OpenAI מרנדרים את כל התשובה לפני שההשבקה מתחילה, כך שהשמע הראשון עשוי להתעכב מספר שניות בתשובות ארוכות יותר — Settings > Voice מציג הערה כאשר אתה בוחר באחד מהם. לדיבור בשיהוי נמוך, בחר ב-ElevenLabs, Cartesia או Resemble.
מהירות השמעה: מחוון המהירות (0.5×–2.0×) מוחל על ידי הספק עבור ElevenLabs (מוגבל ל-0.7–1.2×) ו-Cartesia (מוגבל ל-0.6–1.5×). קולות דפדפן ו-Kokoro מאיצים מקומית. ל-Gemini ול-OpenAI אין בקרת מהירות משל עצמם, ולכן המחוון מוסתר כל עוד הם נבחרים; Resemble.ai מחיל את המהירות בהשמעה סטנדרטית (לא סטרימינג).
כדי להפעיל זאת:
- עבור אל Settings > Voice
- בחר אפשרות טקסט-לדיבור
- הפעל את "Auto-read responses" אם אתה רוצה שהבינה המלאכותית תקרא באופן אוטומטי
- התאם את מהירות ההשמעה אם תרצה
אם ההשמעה נכשלת: שגיאות קול מופיעות כעת כהודעת Toast במקום להיכשל בשקט — כך שמפתח API חסר או לא חוקי, או קול שאינו תואם למודל שנבחר (נפוץ ב-Resemble.ai וב-Cartesia), אומר לך בדיוק מה לתקן.
מקומי לעומת ענן: קולות דפדפן ו-Kokoro לעולם אינם שולחים דבר מחוץ למכשיר שלך. Gemini, OpenAI, ElevenLabs, Cartesia ו-Resemble.ai שולחים טקסט לשרתים שלהם (באמצעות מפתחות ה-API שלך) כדי לייצר את השמע. ראה Privacy & Data לפרטים נוספים.
עלויות קול (TTS + STT) מצטברות כ-voice_cost בשיחה, בהתאמה לנתיב החד-פעמי (one-shot).
קלט קולי (דיבור לטקסט)
הכתב את ההודעות שלך במקום להקליד. לחץ על אייקון המיקרופון בתיבת הכתיבה כדי להתחיל להקליט. Caiioo מתמלל את מה שאתה אומר ומכניס אותו לשדה ההודעה.
בחר כיצד הוא מתמלל:
| אפשרות | סוג | פרטיות | הגדרה |
|---|---|---|---|
| Whisper (דפדפן) | מקומי | פרטי לחלוטין | חינם, רץ על המכשיר שלך |
| WhisperKit (iOS) | מקומי | פרטי לחלוטין | חינם, על המכשיר |
| whisper.cpp & Moonshine (Android) | מקומי | פרטי לחלוטין | חינם, על המכשיר |
| Browser Speech | מקומי | פרטי | חינם, מובנה |
| ElevenLabs Scribe | ענן | מדויק (מעולה לשפות שאינן אנגלית) | הוסף מפתח API של ElevenLabs |
| Cartesia Ink | ענן | מדויק, השהיה נמוכה | הוסף מפתח API של Cartesia |
אפשרויות מקומיות שומרות את האודיו שלך מקומי — שום דבר לא נשלח לשרת. ElevenLabs ו-Cartesia שולחות אודיו לשרתים שלהן לתמלול (באמצעות מפתח ה-API שלך) ומציעות דיוק גבוה יותר, במיוחד לשפות שאינן אנגלית.
כדי להשתמש בזה:
- לחץ על אייקון המיקרופון בתיבת הכתיבה
- אמור את ההודעה שלך
- עצור כשתסיים
- התמלול יופיע בשדה ההודעה
- ערוך במידת הצורך, ואז שלח
הגדרה ראשונית: בפעם הראשונה שמשתמשים במודל דיבור על המכשיר, עליו לרדת ולהתחמם. תיבת הכתיבה מציגה את ההתקדמות ("מוריד מודל דיבור… N%", ואז "מכין"/"טוען"), לכן השהיה קצרה בלחיצה הראשונה על המיקרופון היא צפויה.
הקלטת אודיו וצירופו
בנוסף להכתבה, באפשרותך להקליט קטע קול ולצרף אותו להודעה שלך: פתח את תפריט ה-+ של שורת הכתיבה ובחר הקלט אודיו. זמין ב-iPhone, iPad, macOS ובתוסף הדפדפן. משתלב באופן טבעי עם אפליקציות המאזינות להקלטות שלך, כמו מאמן ההגייה "for Languages".
לתת למודל לשמוע את ההקלטה שלך
שתי תכונות חורגות מתמלול ומאפשרות למודל שיכול לשמוע לעבוד עם האודיו בפועל:
- כלול אודיו עבור המודל (הגדרות > קול): מצרף את ההקלטה שלך כך שמודל התומך בשמע (למשל Gemini) יבחן את האודיו האמיתי לצד ההנחיה שלך — טון, הגייה, צול סביבתיים, ולא רק את המילים. כבוי כברירת מחדל; שום דבר לא נשלח אחרת. לחצן צורת גל (waveform) לצד מיקרופון מפעיל/מכבה זאת לכל הודעה, אך הלחצן מופיע רק במצבים ובאפליקציות התומכים בכך (כמו "for Languages"), כך שהוא אינו מעמיס על שורת הכתיבה במשימות יומיומיות.
- שמיעה (כלי חינמי, פעיל כברירת מחדל): מאפשר לעוזר לחזור ולהאזין מחדש לכל קובץ מצורף של אודיו עם שאלה ממוקדת המשך — "אילו מילים בטאו לא נכון?", "מהו טון הדיבור?" — בסיבוב שבו צירفته או בכל סיבוב מאוחר יותר. מודל עוזר האודיו הייעודי מבצע את ההאאזנה, כך שזה עובד גם כאשר מודל הצ'אט שלך אינו יכול לשמוע.
הכתבה כלל-מערכתית (macOS)
מנויי Pro ב-macOS יכולים גם להתקין את PrivateVoice, אפליקציה נלווית נפרדת שמוסיפה מקש קיצור גלובלי של "לחץ כדי לדבר" להכתבה לכל אפליקציה — לא רק ל-Caiioo. ראה את דף ההורדה לשולחן העבודה לפרטים.
ראה גם
- פרטיות ונתונים — כיצד מטופלים נתוני קול
- פלטפורמה והגדרה — זמינות אפליקציית שולחן עבודה ו-PrivateVoice
- הגדרות > קול — הגדר אפשרויות קול עבור המערכת שלך
This guide is maintained by the Caiioo team using Slate, our built-in editor.