Це машинний переклад оригінального документа англійською мовою. У разі будь-яких розбіжностей між цим перекладом та оригінальною англійською версією, пріоритет має версія англійською мовою. Читати оригінал англійською мовою
Голос: Говоріть та слухайте
Хочете, щоб ШІ читав відповіді вголос? Або диктувати повідомлення замість друку? Caiioo пропонує голосове введення та виведення — все налаштовується, деякі функції працюють локально на вашому пристрої.

Voice Output (Text-to-Speech)
Увімкніть озвучення відповідей штучним інтелектом. Виберіть один із варіантів:
| Параметр | Тип | Якість | Налаштування |
|---|---|---|---|
| Browser Default | Локальний | Базова | Безкоштовно, без налаштувань |
| Kokoro Neural TTS | Локальний | Висока | Безкоштовно, працює на вашому пристрої |
| Google Gemini | Хмарний | Природна | Додайте ваш API ключ |
| OpenAI (gpt-4o-mini-tts) | Хмарний | Природна, керована подача | Додайте ваш API ключ OpenAI |
| ElevenLabs | Хмарний | Преміум | Додайте ваш API ключ |
| Cartesia (Sonic 3.5) | Хмарний | Преміум | Додайте ваш API ключ |
| Resemble.ai | Хмарний | Чудова (клонування голосу) | Додайте ваш API ключ |
Розмір завантаження Kokoro: Модель Kokoro постачається у двох варіантах, і завантаження залежить від вашої платформи. macOS та iOS завантажують меншу модель з квантуванням INT8 (~88 МБ), тоді як розширення / браузер використовують більшу повноточну збірку WebGPU (~330 МБ). Це одноразове завантаження.
Примітки щодо платформ:
- Власний Kokoro для iOS (v0.9.720+): Працює в хост-процесі iOS через OnnxRuntime замість WebView, що усуває збої на iPhone 13/14.
- Kokoro для macOS: Потокове відтворення речення за реченням (протягом ~1 с після натискання кнопки відтворення) через допоміжний процес настільного ПК.
- Gemini TTS (v0.9.723+): Відтворює речення за реченням, тому аудіо починається після першого речення, замість того щоб чекати на синтез усієї відповіді.
- OpenAI (v0.9.724+): gpt-4o-mini-tts з керованою подачею — попросіть про акцент, тон або темп природною мовою (наприклад, "прочитай це з теплим ірландським акцентом"), і голос підлаштується під це. Використовує той самий API ключ OpenAI, що й провайдер LLM OpenAI. Поле Voice style instructions у розділі Settings > Voice застосовує вашу вказівку щодо стилю до кожної озвученої відповіді.
- Cartesia (v0.9.723+): Один API ключ забезпечує роботу як Sonic 3.5 (вивід), так і Ink (ввід). Голосу за замовчуванням немає — виберіть його в Settings > Voice перед увімкненням.
Затримка: Gemini та OpenAI генерують усю відповідь повністю перед початком відтворення, тому перше аудіо може затримуватися на кілька секунд для довших відповідей — у Settings > Voice з'явиться примітка, коли ви виберете один із них. Для мовлення з низькою затримкою виберіть ElevenLabs, Cartesia або Resemble.
Швидкість відтворення: Повзунок швидкості (0.5×–2.0×) застосовується провайдером для ElevenLabs (обмежено в межах 0.7–1.2×) та Cartesia (обмежено в межах 0.6–1.5×). Голоси браузера та Kokoro прискорюються локально. Gemini та OpenAI не мають власних елементів керування швидкістю, тому повзунок приховано, коли вони вибрані; Resemble.ai застосовує швидкість під час стандартного (непотокового) відтворення.
Як увімкнути:
- Перейдіть до Settings > Voice
- Виберіть параметр перетворення тексту в мовлення
- Увімкніть перемикач "Auto-read responses", якщо хочете, щоб штучний інтелект читав автоматично
- Налаштуйте швидкість відтворення за бажанням
Якщо відтворення не вдається: Помилки голосу тепер з'являються у вигляді спливаючого вікна (toast), а не завершуються мовчки — тож якщо відсутній чи недійсний API ключ, або голос несумісний із вибраною моделлю (поширена проблема для Resemble.ai та Cartesia), ви точно знатимете, що саме потрібно виправити.
Локальні та хмарні рішення: Голоси браузера та Kokoro ніколи нічого не надсилають за межі вашого пристрою. Gemini, OpenAI, ElevenLabs, Cartesia та Resemble.ai надсилають текст на свої сервери (використовуючи ваші API ключі) для генерації аудіо. Докладнішу інформацію див. у розділі Privacy & Data.
Витрати на голос (TTS + STT) підсумовуються як voice_cost для розмови, що відповідає шляху одноразового запиту.
Голосове введення (Speech-to-Text)
Диктуйте свої повідомлення замість того, щоб друкувати. Натисніть іконку мікрофона в полі введення, щоб почати запис. Caiioo транскрибує те, що ви говорите, і вставляє це в поле повідомлення.
Виберіть спосіб транскрипції:
| Опція | Тип | Конфіденційність | Налаштування |
|---|---|---|---|
| Whisper (Браузер) | Локально | Повністю приватно | FREE, працює на вашому пристрої |
| WhisperKit (iOS) | Локально | Повністю приватно | FREE, на пристрої |
| whisper.cpp & Moonshine (Android) | Локально | Повністю приватно | FREE, на пристрої |
| Browser Speech | Локально | Приватно | FREE, вбудовано |
| ElevenLabs Scribe | Хмара | Точно (чудово для неанглійських мов) | Додайте свій API ключ ElevenLabs |
| Cartesia Ink | Хмара | Точно, низька затримка | Додайте свій API ключ Cartesia |
Локальні варіанти (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) зберігають ваше аудіо локально — нічого не надсилається на сервер. ElevenLabs та Cartesia надсилають аудіо на свої сервери для транскрипції (використовуючи ваш API ключ) і пропонують вищу точність, особливо для мов, відмінних від англійської.
Як користуватися:
- Натисніть іконку мікрофона в полі введення
- Продиктуйте повідомлення
- Зупиніть запис, коли закінчите
- Текст з'явиться в полі повідомлення
- Відредагуйте за потреби та надішліть
Перше налаштування: Коли ви вперше використовуєте модель мовлення на пристрої, їй потрібно завантажитися та підготуватися. Поле введення показуватиме прогрес ("Завантаження моделі мовлення… N%", потім "Підготовка"/"Завантаження"), тому невелика пауза при першому натисканні на мікрофон є нормальною, це не зависання.
Запис аудіо та його прикріплення
Окрім диктування, ви можете записати кліп і прикріпити його до свого повідомлення: відкрийте меню + в редакторі та виберіть Записати аудіо. Доступно на iPhone, iPad, macOS та в розширенні для браузера. Природно поєднується з додатками, які слухають ваші записи, наприклад з тренером вимови «для мов».
Дозвольте моделі почути ваш запис
Дві функції виходять за рамки транскрипції та дозволяють моделі, яка вміє чути, працювати з фактичним аудіо:
- Включити аудіо для моделі («Налаштування» > «Голос»): прикріплює ваш запис, щоб модель із підтримкою аудіо (наприклад, Gemini) переглянула реальне аудіо разом із вашою підказкою — тон, вимову, фонові звуки, а не лише слова. Вимкнено за замовчуванням; інакше нічого не надсилається. Кнопка у вигляді форми хвилі поруч із мікрофоном перемикає її для кожного повідомлення, але кнопка з'являється лише в режимах і додатках, які підтримують це (як-от «для мов»), тому вона не захаращує поле введення для повсякденних завдань.
- Слухання (безкоштовний інструмент, увімкнений за замовчуванням): дозволяє асистенту повертатися та переслуховувати будь-яке аудіовкладення із цільовим додатковим запитанням — «які слова були вимовлені неправильно?», «який тон голосу?» — під час черги, коли ви його прикріплюєте, або будь-якого наступного. Спеціальна допоміжна модель аудіо виконує прослуховування, тому це працює навіть тоді, коли ваша модель чату не може чути.
Системне диктування (macOS)
Підписники Pro на macOS також можуть встановити PrivateVoice, окремий допоміжний додаток, який додає глобальну гарячу клавішу для диктування в будь-яку програму — не лише в Caiioo. Подробиці дивіться на сторінці завантаження для десктопа.
Дивіться також
- Приватність та дані — як обробляються голосові дані
- Платформа та налаштування — доступність десктопного додатка та PrivateVoice
- Налаштування > Голос — налаштуйте голосові параметри для вашої системи
This guide is maintained by the Caiioo team using Slate, our built-in editor.