Це машинний переклад оригінального документа англійською мовою. У разі будь-яких розбіжностей між цим перекладом та оригінальною англійською версією, пріоритет має версія англійською мовою. Читати оригінал англійською мовою
Голос: Говоріть та слухайте
Хочете, щоб ШІ читав відповіді вголос? Або диктувати повідомлення замість друку? Caiioo пропонує голосове введення та виведення — все налаштовується, деякі функції працюють локально на вашому пристрої.

Voice Output (Text-to-Speech)
Дозвольте ШІ читати свої відповіді вголос. Виберіть із таких варіантів:
| Параметр | Тип | Якість | Налаштування |
|---|---|---|---|
| Browser Default | Локально | Базова | Безкоштовно, без налаштувань |
| Kokoro Neural TTS | Локально | Висока | Безкоштовно, працює на вашому пристрої |
| Google Gemini | Хмара | Природна | Додайте свій API key |
| OpenAI (gpt-4o-mini-tts) | Хмара | Природна, керована манера читання | Додайте свій OpenAI API key |
| ElevenLabs | Хмара | Преміум | Додайте свій API key |
| Cartesia (Sonic 3.5) | Хмара | Преміум | Додайте свій API key |
| Resemble.ai | Хмара | Чудова (клонування голосу) | Додайте свій API key |
Розмір завантаження Kokoro: Модель Kokoro постачається у двох варіантах, і завантаження залежить від вашої платформи. macOS та iOS завантажують меншу модель з квантуванням INT8 (~88 МБ), тоді як розширення/браузер використовують більшу повноточну збірку WebGPU (~330 МБ). Це одноразове завантаження.
Примітки щодо платформ:
- Власний Kokoro для iOS (v0.9.720+): Працює в хост-процесі iOS через OnnxRuntime замість WebView, що усуває збої на iPhone 13/14.
- Kokoro для macOS: Потокове відтворення речення за реченням (протягом ~1 с після натискання кнопки відтворення) через допоміжний процес настільного комп'ютера.
- Gemini TTS (v0.9.723+): Відтворює речення за реченням, тому аудіо починається після першого речення, замість того щоб чекати на синтез усієї відповіді.
- OpenAI (v0.9.724+): gpt-4o-mini-tts з керованою манерою читання — попросіть про акцент, тон або темп природною мовою (наприклад, «прочитай це з теплим ірландським акцентом»), і голос наслідуватиме його. Використовує той самий API key OpenAI, що й провайдер OpenAI LLM. Поле Voice style instructions у розділі Settings > AI Setup > Voice застосовує вашу директиву щодо стилю до кожної озвученої відповіді.
- Cartesia (v0.9.723+): Один API key забезпечує роботу як Sonic 3.5 (вивід), так і Ink (ввід). Голосу за замовчуванням немає — виберіть його в розділі Settings > AI Setup > Voice, перш ніж увімкнути.
- ElevenLabs: Кожен голос ElevenLabs починає говорити одразу, як тільки має що сказати, зокрема експресивний v3, який можна вибрати у засобі вибору голосу. Модель голосу за замовчуванням — Flash v2.5: ElevenLabs оцінює її якість як рівноцінну попередній за замовчуванням, при цьому вона коштує вдвічі дешевше за один символ.
- ElevenLabs v3 Conversational (v0.9.777+): Виберіть модель v3 Conversational у списку моделей голосу для виразного діалогу з низькою затримкою понад 70 мовами. Наразі ElevenLabs тарифікує її за половину стандартної ставки за символ, і оцінки витрат у Caiioo це відображають.
Затримка: Gemini та OpenAI обробляють усю відповідь повністю перед початком відтворення, тому перше аудіо може затримуватися на кілька секунд у разі довших відповідей — у Settings > AI Setup > Voice відображається примітка, коли ви вибираєте один із них. Для мовлення з низькою затримкою виберіть ElevenLabs, Cartesia або Resemble.
Швидкість відтворення: Повзунок швидкості (0.5×–2.0×) застосовується провайдером для ElevenLabs (обмежено діапазоном 0.7–1.2×) та Cartesia (обмежено діапазоном 0.6–1.5×). Браузерні голоси та Kokoro прискорюються локально. Gemini та OpenAI не мають власних елементів керування швидкістю, тому повзунок приховано під час їх вибору; Resemble.ai застосовує швидкість під час стандартного (непотокового) відтворення. Єдиний виняток: моделі ElevenLabs v3 (v3 та v3 Conversational) не можуть самі змінювати швидкість, тому Caiioo натомість застосовує вашу швидкість під час відтворення, зберігаючи висоту звуку природною — компроміс полягає в тому, що якщо повзунок зміщено від нормального значення, вони чекають на весь кліп, перш ніж почати говорити. На нормальній швидкості вони все одно починають одразу.
Caiioo може підбирати голос під ситуацію: коли читання чогось уголос є частиною завдання, ШІ може вибрати голос, темп мовлення та модель мовлення, які відповідають контенту — інший голос для казки на ніч, ніж для новинного зведення, — замість того, щоб завжди використовувати ваше глобальне налаштування голосу. Ваші власні налаштування залишаються стандартними для всього іншого.
Щоб увімкнути:
- Перейдіть до Settings > AI Setup > Voice
- Виберіть параметр перетворення тексту в мовлення
- Увімкніть «Auto-read responses», якщо ви хочете, щоб ШІ читав автоматично
- Налаштуйте швидкість відтворення за бажанням
Якщо відтворення не вдалося: Помилки голосу тепер з'являються у вигляді спливаючого вікна (toast), а не мовчки завершуються збоєм — тож відсутній чи недійсний API key або голос, несумісний із вибраною моделлю (поширено для Resemble.ai та Cartesia), чітко вкаже, що саме потрібно виправити.
Локально чи в хмарі: Браузерні голоси та Kokoro ніколи нічого не надсилають з вашого пристрою. Gemini, OpenAI, ElevenLabs, Cartesia та Resemble.ai надсилають текст на свої сервери (використовуючи ваші API keys) для створення аудіо. Докладні дивіться в розділі Privacy & Data.
Витрати на голос (TTS + STT) сумуються як voice_cost у розмові, що відповідає шляху одноразового запиту.
Голосове введення (Speech-to-Text)
Диктуйте свої повідомлення замість того, щоб друкувати. Натисніть іконку мікрофона в полі введення, щоб почати запис. Caiioo транскрибує те, що ви говорите, і вставляє це в поле повідомлення.
Виберіть спосіб транскрипції:
| Опція | Тип | Конфіденційність | Налаштування |
|---|---|---|---|
| Whisper (Браузер) | Локально | Повністю приватно | FREE, працює на вашому пристрої |
| WhisperKit (iOS) | Локально | Повністю приватно | FREE, на пристрої |
| whisper.cpp & Moonshine (Android) | Локально | Повністю приватно | FREE, на пристрої |
| Browser Speech | Локально | Приватно | FREE, вбудовано |
| ElevenLabs Scribe | Хмара | Точно (чудово для неанглійських мов) | Додайте свій API ключ ElevenLabs |
| Cartesia Ink | Хмара | Точно, низька затримка | Додайте свій API ключ Cartesia |
Локальні варіанти (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) зберігають ваше аудіо локально — нічого не надсилається на сервер. ElevenLabs та Cartesia надсилають аудіо на свої сервери для транскрипції (використовуючи ваш API ключ) і пропонують вищу точність, особливо для мов, відмінних від англійської.
Як користуватися:
- Натисніть іконку мікрофона в полі введення
- Продиктуйте повідомлення
- Зупиніть запис, коли закінчите
- Текст з'явиться в полі повідомлення
- Відредагуйте за потреби та надішліть
Перше налаштування: Коли ви вперше використовуєте модель мовлення на пристрої, їй потрібно завантажитися та підготуватися. Поле введення показуватиме прогрес ("Завантаження моделі мовлення… N%", потім "Підготовка"/"Завантаження"), тому невелика пауза при першому натисканні на мікрофон є нормальною, це не зависання.
Запис аудіо та його прикріплення
Окрім диктування, ви можете записати кліп і прикріпити його до свого повідомлення: відкрийте меню + в редакторі та виберіть Записати аудіо. Доступно на iPhone, iPad, macOS та в розширенні для браузера. Природно поєднується з додатками, які слухають ваші записи, наприклад з тренером вимови «для мов».
Надайте моделі можливість чути ваш запис
Дві функції виходять за рамки транскрипції та дозволяють моделі, яка здатна чути, працювати з фактичним аудіо:
- Включати аудіо для моделі (Налаштування > Налаштування ШІ > Голос): додає ваш запис, щоб модель з підтримкою аудіо (наприклад, Gemini) переглядала реальне аудіо разом із вашим промптом — тон, вимову, фонові звуки, а не лише слова. Вимкнено за замовчуванням; інакше нічого не надсилається. Кнопка форми хвилі поруч із мікрофоном перемикає це для кожного повідомлення, але вона з'являється лише в режимах і додатках, які підтримують це (наприклад, «для мов»), тому вона не захаращує поле введення для повсякденних завдань.
- Прослуховування (безкоштовний інструмент, увімкнений за замовчуванням): дозволяє асистенту повертатися та повторно слухати будь-яке аудіовкладення з цільовим додатковим запитанням — «які слова були вимовлені з помилкою?», «який тон голосу?» — під час завантаження вкладення або будь-якого наступного. Спеціальна допоміжна аудіомодель виконує прослуховування, тому це працює, навіть якщо ваша модель чату не здатна чути.
Диктування на рівні системи (ПК)
Диктуйте в будь-якій програмі на вашому комп'ютері — не лише в Caiioo:
Передплатники Pro мають вбудоване системне диктування в настільних додатках для macOS, Windows та Linux — жодних додаткових програм встановлювати не потрібно. Утримуйте гарячу клавішу диктування будь-де, говорите, і сказане з'явиться в тій програмі, яка зараз активна.
Дивіться також
- Конфіденційність і дані — Як обробляються голосові дані
- Платформа та налаштування — Доступність настільного додатка
- Налаштування > Налаштування ШІ > Голос — Налаштування параметрів голосу
This guide is maintained by the Caiioo team using Slate, our built-in editor.