Це машинний переклад оригінального документа англійською мовою. У разі будь-яких розбіжностей між цим перекладом та оригінальною англійською версією, пріоритет має версія англійською мовою. Читати оригінал англійською мовою


Голос: Говоріть та слухайте

Хочете, щоб ШІ читав відповіді вголос? Або диктувати повідомлення замість друку? Caiioo пропонує голосове введення та виведення — все налаштовується, деякі функції працюють локально на вашому пристрої.

Налаштування голосу з опціями введення та виведення, перемикачем авточитання та швидкістю відтворення

Voice Output (Text-to-Speech)

Дозвольте ШІ читати свої відповіді вголос. Виберіть із таких варіантів:

Параметр Тип Якість Налаштування
Browser Default Локально Базова Безкоштовно, без налаштувань
Kokoro Neural TTS Локально Висока Безкоштовно, працює на вашому пристрої
Google Gemini Хмара Природна Додайте свій API key
OpenAI (gpt-4o-mini-tts) Хмара Природна, керована манера читання Додайте свій OpenAI API key
ElevenLabs Хмара Преміум Додайте свій API key
Cartesia (Sonic 3.5) Хмара Преміум Додайте свій API key
Resemble.ai Хмара Чудова (клонування голосу) Додайте свій API key

Розмір завантаження Kokoro: Модель Kokoro постачається у двох варіантах, і завантаження залежить від вашої платформи. macOS та iOS завантажують меншу модель з квантуванням INT8 (~88 МБ), тоді як розширення/браузер використовують більшу повноточну збірку WebGPU (~330 МБ). Це одноразове завантаження.

Примітки щодо платформ:

  • Власний Kokoro для iOS (v0.9.720+): Працює в хост-процесі iOS через OnnxRuntime замість WebView, що усуває збої на iPhone 13/14.
  • Kokoro для macOS: Потокове відтворення речення за реченням (протягом ~1 с після натискання кнопки відтворення) через допоміжний процес настільного комп'ютера.
  • Gemini TTS (v0.9.723+): Відтворює речення за реченням, тому аудіо починається після першого речення, замість того щоб чекати на синтез усієї відповіді.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts з керованою манерою читання — попросіть про акцент, тон або темп природною мовою (наприклад, «прочитай це з теплим ірландським акцентом»), і голос наслідуватиме його. Використовує той самий API key OpenAI, що й провайдер OpenAI LLM. Поле Voice style instructions у розділі Settings > AI Setup > Voice застосовує вашу директиву щодо стилю до кожної озвученої відповіді.
  • Cartesia (v0.9.723+): Один API key забезпечує роботу як Sonic 3.5 (вивід), так і Ink (ввід). Голосу за замовчуванням немає — виберіть його в розділі Settings > AI Setup > Voice, перш ніж увімкнути.
  • ElevenLabs: Кожен голос ElevenLabs починає говорити одразу, як тільки має що сказати, зокрема експресивний v3, який можна вибрати у засобі вибору голосу. Модель голосу за замовчуванням — Flash v2.5: ElevenLabs оцінює її якість як рівноцінну попередній за замовчуванням, при цьому вона коштує вдвічі дешевше за один символ.
  • ElevenLabs v3 Conversational (v0.9.777+): Виберіть модель v3 Conversational у списку моделей голосу для виразного діалогу з низькою затримкою понад 70 мовами. Наразі ElevenLabs тарифікує її за половину стандартної ставки за символ, і оцінки витрат у Caiioo це відображають.

Затримка: Gemini та OpenAI обробляють усю відповідь повністю перед початком відтворення, тому перше аудіо може затримуватися на кілька секунд у разі довших відповідей — у Settings > AI Setup > Voice відображається примітка, коли ви вибираєте один із них. Для мовлення з низькою затримкою виберіть ElevenLabs, Cartesia або Resemble.

Швидкість відтворення: Повзунок швидкості (0.5×–2.0×) застосовується провайдером для ElevenLabs (обмежено діапазоном 0.7–1.2×) та Cartesia (обмежено діапазоном 0.6–1.5×). Браузерні голоси та Kokoro прискорюються локально. Gemini та OpenAI не мають власних елементів керування швидкістю, тому повзунок приховано під час їх вибору; Resemble.ai застосовує швидкість під час стандартного (непотокового) відтворення. Єдиний виняток: моделі ElevenLabs v3 (v3 та v3 Conversational) не можуть самі змінювати швидкість, тому Caiioo натомість застосовує вашу швидкість під час відтворення, зберігаючи висоту звуку природною — компроміс полягає в тому, що якщо повзунок зміщено від нормального значення, вони чекають на весь кліп, перш ніж почати говорити. На нормальній швидкості вони все одно починають одразу.

Caiioo може підбирати голос під ситуацію: коли читання чогось уголос є частиною завдання, ШІ може вибрати голос, темп мовлення та модель мовлення, які відповідають контенту — інший голос для казки на ніч, ніж для новинного зведення, — замість того, щоб завжди використовувати ваше глобальне налаштування голосу. Ваші власні налаштування залишаються стандартними для всього іншого.

Щоб увімкнути:

  1. Перейдіть до Settings > AI Setup > Voice
  2. Виберіть параметр перетворення тексту в мовлення
  3. Увімкніть «Auto-read responses», якщо ви хочете, щоб ШІ читав автоматично
  4. Налаштуйте швидкість відтворення за бажанням

Якщо відтворення не вдалося: Помилки голосу тепер з'являються у вигляді спливаючого вікна (toast), а не мовчки завершуються збоєм — тож відсутній чи недійсний API key або голос, несумісний із вибраною моделлю (поширено для Resemble.ai та Cartesia), чітко вкаже, що саме потрібно виправити.

Локально чи в хмарі: Браузерні голоси та Kokoro ніколи нічого не надсилають з вашого пристрою. Gemini, OpenAI, ElevenLabs, Cartesia та Resemble.ai надсилають текст на свої сервери (використовуючи ваші API keys) для створення аудіо. Докладні дивіться в розділі Privacy & Data.

Витрати на голос (TTS + STT) сумуються як voice_cost у розмові, що відповідає шляху одноразового запиту.

Голосове введення (Speech-to-Text)

Диктуйте свої повідомлення замість того, щоб друкувати. Натисніть іконку мікрофона в полі введення, щоб почати запис. Caiioo транскрибує те, що ви говорите, і вставляє це в поле повідомлення.

Виберіть спосіб транскрипції:

Опція Тип Конфіденційність Налаштування
Whisper (Браузер) Локально Повністю приватно FREE, працює на вашому пристрої
WhisperKit (iOS) Локально Повністю приватно FREE, на пристрої
whisper.cpp & Moonshine (Android) Локально Повністю приватно FREE, на пристрої
Browser Speech Локально Приватно FREE, вбудовано
ElevenLabs Scribe Хмара Точно (чудово для неанглійських мов) Додайте свій API ключ ElevenLabs
Cartesia Ink Хмара Точно, низька затримка Додайте свій API ключ Cartesia

Локальні варіанти (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) зберігають ваше аудіо локально — нічого не надсилається на сервер. ElevenLabs та Cartesia надсилають аудіо на свої сервери для транскрипції (використовуючи ваш API ключ) і пропонують вищу точність, особливо для мов, відмінних від англійської.

Як користуватися:

  1. Натисніть іконку мікрофона в полі введення
  2. Продиктуйте повідомлення
  3. Зупиніть запис, коли закінчите
  4. Текст з'явиться в полі повідомлення
  5. Відредагуйте за потреби та надішліть

Перше налаштування: Коли ви вперше використовуєте модель мовлення на пристрої, їй потрібно завантажитися та підготуватися. Поле введення показуватиме прогрес ("Завантаження моделі мовлення… N%", потім "Підготовка"/"Завантаження"), тому невелика пауза при першому натисканні на мікрофон є нормальною, це не зависання.

Запис аудіо та його прикріплення

Окрім диктування, ви можете записати кліп і прикріпити його до свого повідомлення: відкрийте меню + в редакторі та виберіть Записати аудіо. Доступно на iPhone, iPad, macOS та в розширенні для браузера. Природно поєднується з додатками, які слухають ваші записи, наприклад з тренером вимови «для мов».

Надайте моделі можливість чути ваш запис

Дві функції виходять за рамки транскрипції та дозволяють моделі, яка здатна чути, працювати з фактичним аудіо:

  • Включати аудіо для моделі (Налаштування > Налаштування ШІ > Голос): додає ваш запис, щоб модель з підтримкою аудіо (наприклад, Gemini) переглядала реальне аудіо разом із вашим промптом — тон, вимову, фонові звуки, а не лише слова. Вимкнено за замовчуванням; інакше нічого не надсилається. Кнопка форми хвилі поруч із мікрофоном перемикає це для кожного повідомлення, але вона з'являється лише в режимах і додатках, які підтримують це (наприклад, «для мов»), тому вона не захаращує поле введення для повсякденних завдань.
  • Прослуховування (безкоштовний інструмент, увімкнений за замовчуванням): дозволяє асистенту повертатися та повторно слухати будь-яке аудіовкладення з цільовим додатковим запитанням — «які слова були вимовлені з помилкою?», «який тон голосу?» — під час завантаження вкладення або будь-якого наступного. Спеціальна допоміжна аудіомодель виконує прослуховування, тому це працює, навіть якщо ваша модель чату не здатна чути.

Диктування на рівні системи (ПК)

Диктуйте в будь-якій програмі на вашому комп'ютері — не лише в Caiioo:

Передплатники Pro мають вбудоване системне диктування в настільних додатках для macOS, Windows та Linux — жодних додаткових програм встановлювати не потрібно. Утримуйте гарячу клавішу диктування будь-де, говорите, і сказане з'явиться в тій програмі, яка зараз активна.

Дивіться також


This guide is maintained by the Caiioo team using Slate, our built-in editor.