Данный документ является машинным переводом оригинальной английской версии. В случае любых расхождений между переводом и оригиналом на английском языке, приоритет имеет английская версия. Читать оригинал на английском языке
Голос: Говорите и слушайте
Хотите, чтобы ИИ читал ответы вслух? Или диктовать сообщения вместо печати? Caiioo предлагает голосовой ввод и вывод — всё настраивается, часть функций работает локально на вашем устройстве.

Voice Output (Text-to-Speech)
Позвольте ИИ читать его ответы вслух. Выберите один из вариантов:
| Вариант | Тип | Качество | Настройка |
|---|---|---|---|
| Browser Default | Локальный | Базовое | Бесплатно, без настройки |
| Kokoro Neural TTS | Локальный | Высокое | Бесплатно, работает на вашем устройстве |
| Google Gemini | Облачный | Естественное | Добавьте свой API ключ |
| OpenAI (gpt-4o-mini-tts) | Облачный | Естественное, управляемая подача | Добавьте свой API ключ OpenAI |
| ElevenLabs | Облачный | Премиум | Добавьте свой API ключ |
| Cartesia (Sonic 3.5) | Облачный | Премиум | Добавьте свой API ключ |
| Resemble.ai | Облачный | Отличное (клонирование голоса) | Добавьте свой API ключ |
Размер загрузки Kokoro: Модель Kokoro поставляется в двух вариантах, и то, какая именно загружается, зависит от вашей платформы. macOS и iOS загружают меньшую INT8-квантованную модель (~88 МБ), в то время как расширение/браузер используют большую полноточную сборку WebGPU (~330 МБ). Это однократная загрузка.
Примечания по платформам:
- Нативный Kokoro для iOS (v0.9.720+): Запускается в хост-процессе iOS через OnnxRuntime вместо WebView, что устраняет сбои на iPhone 13/14.
- Kokoro для macOS: Передает аудиопоток предложение за предложением (примерно в течение 1 секунды после нажатия кнопки воспроизведения) через вспомогательный процесс рабочего стола.
- Gemini TTS (v0.9.723+): Воспроизводит аудио предложение за предложением, поэтому звук начинается после первого предложения, а не ожидает синтеза всего ответа целиком.
- OpenAI (v0.9.724+): gpt-4o-mini-tts с управляемой подачей — запросите акцент, тон или темп на естественном языке (например, «прочти это с теплым ирландским акцентом»), и голос подстроится под него. Использует тот же API ключ OpenAI, что и провайдер LLM OpenAI. Поле Voice style instructions в разделе Settings > AI Setup > Voice применяет вашу директиву стиля к каждому произносимому ответу.
- Cartesia (v0.9.723+): Один API ключ обеспечивает работу как Sonic 3.5 (вывод), так и Ink (ввод). Голос по умолчанию отсутствует — выберите его в разделе Settings > AI Setup > Voice перед включением.
- ElevenLabs: Каждый голос ElevenLabs начинает говорить сразу же, как только ему есть что сказать, включая выразительную версию v3, которую можно выбрать в селекторе голосов. Модель голоса по умолчанию — Flash v2.5: ElevenLabs оценивает ее качество как эквивалентное предыдущему стандарту, при этом она стоит вдвое дешевле в пересчете на один символ.
- ElevenLabs v3 Conversational (v0.9.777+): Выберите модель v3 Conversational в списке голосовых моделей для получения выразительного диалога с низким уровнем задержки на более чем 70 языках. В настоящее время ElevenLabs тарифицирует ее по половинной стандартной ставке за символ, и оценка стоимости в Caiioo это учитывает.
Задержка: Gemini и OpenAI рендерят весь ответ полностью перед началом воспроизведения, поэтому при длинных ответах первый звук может задерживаться на несколько секунд — в Settings > AI Setup > Voice появляется примечание, когда вы выбираете один из них. Для речи с низким уровнем задержки выбирайте ElevenLabs, Cartesia или Resemble.
Скорость воспроизведения: Ползунок скорости (0.5×–2.0×) применяется провайдером для ElevenLabs (ограничено до 0.7–1.2×) и Cartesia (ограничено до 0.6–1.5×). Голоса браузера и Kokoro ускоряются локально. У Gemini и OpenAI нет собственного контроля скорости, поэтому ползунок скрывается, когда они выбраны; Resemble.ai применяет скорость при стандартном (не потоковом) воспроизведении. Одно исключение: модели ElevenLabs v3 (v3 и v3 Conversational) не могут менять скорость самостоятельно, поэтому Caiioo применяет вашу скорость во время воспроизведения, сохраняя естественную высоту тона — компромисс заключается в том, что при положении ползунка, отличном от нормального, они ожидают весь клип целиком, прежде чем начать говорить. На нормальной скорости они по-прежнему начинают говорить сразу же.
Caiioo может подобрать голос под текущий момент: когда чтение текста вслух является частью задачи, ИИ может выбрать голос, скорость речи и языковую модель, соответствующие контенту (другой голос для сказки на ночь по сравнению со сводкой новостей), вместо того чтобы всегда использовать ваши глобальные настройки голоса. Ваши собственные настройки остаются стандартными для всего остального.
Чтобы включить:
- Перейдите в Settings > AI Setup > Voice
- Выберите вариант преобразования текста в речь
- Включите параметр «Auto-read responses», если хотите, чтобы ИИ читал автоматически
- При желании настройте скорость воспроизведения
Если воспроизведение не удается: Ошибки голосового движка теперь отображаются во всплывающем уведомлении (тосте), а не завершаются молча — таким образом, отсутствующий или недействительный API ключ, либо голос, несовместимый с выбранной моделью (что часто случается с Resemble.ai и Cartesia), точно укажут, что именно нужно исправить.
Локальный и облачный режимы: Голоса браузера и Kokoro никогда не отправляют данные с вашего устройства. Gemini, OpenAI, ElevenLabs, Cartesia и Resemble.ai отправляют текст на свои серверы (используя ваши API ключи) для генерации аудио. Подробности см. в разделе Privacy & Data.
Расходы на голос (TTS + STT) суммируются как voice_cost для беседы, соответствуя одноразовому пути выполнения.
Голосовой ввод (Speech-to-Text)
Диктуйте сообщения вместо того, чтобы печатать. Нажмите иконку микрофона в поле ввода, чтобы начать запись. Caiioo расшифрует сказанное и вставит текст в поле сообщения.
Выберите способ транскрибации:
| Опция | Тип | Конфиденциальность | Настройка |
|---|---|---|---|
| Whisper (Браузер) | Локально | Полностью приватно | FREE, работает на вашем устройстве |
| WhisperKit (iOS) | Локально | Полностью приватно | FREE, на устройстве |
| whisper.cpp & Moonshine (Android) | Локально | Полностью приватно | FREE, на устройстве |
| Browser Speech | Локально | Приватно | FREE, встроено |
| ElevenLabs Scribe | Облако | Точно (отлично для не-английских языков) | Добавьте ваш API ключ ElevenLabs |
| Cartesia Ink | Облако | Точно, низкая задержка | Добавьте ваш API ключ Cartesia |
Локальные варианты (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) обрабатывают аудио на месте — ничего не отправляется на сервер. ElevenLabs и Cartesia отправляют аудио на свои серверы для расшифровки (используя ваш API ключ) и обеспечивают более высокую точность, особенно для русского языка.
Как использовать:
- Нажмите иконку микрофона в поле ввода
- Произнесите сообщение
- Остановите запись, когда закончите
- Текст появится в поле ввода
- Отредактируйте при необходимости и отправьте
Первичная настройка: При первом использовании локальной модели речи ей необходимо загрузиться. В поле ввода будет отображаться прогресс («Загрузка речевой модели… N%», затем «Подготовка»/«Загрузка»), поэтому небольшая пауза при первом нажатии на микрофон — это нормально.
Запись аудио и его прикрепление
Помимо диктовки, вы можете записать фрагмент и прикрепить его к сообщению: откройте меню + в поле ввода и выберите Записать аудио. Доступно на iPhone, iPad, macOS и в расширении для браузера. Отлично сочетается с приложениями, которые прослушивают ваши записи, такими как тренер по произношению «для языков» (for Languages).
Позвольте модели услышать вашу запись
Две функции выходят за рамки простого преобразования речи в текст и позволяют модели с поддержкой аудио работать напрямую со звуком:
- Включать аудио для модели (Настройки > Настройка AI > Голос): прикрепляет вашу запись, чтобы модель с поддержкой аудио (например, Gemini) анализировала реальный звук вместе с вашим промптом — тон, произношение, фоновые звуки, а не только слова. По умолчанию выключено; в противном случае ничего не отправляется. Кнопка в виде звуковой волны рядом с микрофоном переключает эту функцию для каждого сообщения, но кнопка появляется только в тех режимах и приложениях, которые ее поддерживают (например, «Для языков»), поэтому она не загромождает поле ввода для повседневных задач.
- Прослушивание (Hearing) (бесплатный инструмент, включен по умолчанию): позволяет ассистенту вернуться и прослушать любое звуковое вложение с помощью целенаправленного уточняющего вопроса — «какие слова были произнесены с ошибкой?», «каков тон голоса?» — как в сообщении, к которому оно прикреплено, так и в любом последующем. Прослушивание выполняет специализированная вспомогательная аудиомодель, поэтому это работает, даже если ваша основная модель чата не умеет воспринимать звук.
Общесистемная диктовка (ПК)
Диктуйте в любое приложение на вашем компьютере — не только в Caiioo:
У подписчиков Pro общесистемная диктовка встроена в десктопные приложения для macOS, Windows и Linux — не нужно устанавливать дополнительные программы. Удерживайте горячую клавишу диктовки где угодно, говорите, и сказанное будет напечатано в активном в данный момент приложении.
Смотрите также
- Конфиденциальность и данные — Как обрабатываются голосовые данные
- Платформа и установка — Доступность десктопного приложения
- Настройки > Настройка AI > Голос — Настройка параметров голосового управления
This guide is maintained by the Caiioo team using Slate, our built-in editor.