Данный документ является машинным переводом оригинальной английской версии. В случае любых расхождений между переводом и оригиналом на английском языке, приоритет имеет английская версия. Читать оригинал на английском языке
Голос: Говорите и слушайте
Хотите, чтобы ИИ читал ответы вслух? Или диктовать сообщения вместо печати? Caiioo предлагает голосовой ввод и вывод — всё настраивается, часть функций работает локально на вашем устройстве.

Голосовой вывод (синтез речи)
Заставьте ИИ озвучивать свои ответы вслух. Выберите один из вариантов:
| Опция | Тип | Качество | Настройка |
|---|---|---|---|
| Browser Default | Локально | Базовое | Бесплатно, без настройки |
| Kokoro Neural TTS | Локально | Высокое | Бесплатно, работает на вашем устройстве |
| Google Gemini | Облако | Естественное | Добавьте свой API key |
| OpenAI (gpt-4o-mini-tts) | Облако | Естественное, с возможностью управления подачей | Добавьте свой API key для OpenAI |
| ElevenLabs | Облако | Премиум | Добавьте свой API key |
| Cartesia (Sonic 3.5) | Облако | Премиум | Добавьте свой API key |
| Resemble.ai | Облако | Отличное (клонирование голоса) | Добавьте свой API key |
Размер загрузки Kokoro: Модель Kokoro поставляется в двух вариантах, и то, какая именно загружается, зависит от вашей платформы. На macOS и iOS загружается меньшая INT8-квантованная модель (~88 МБ), в то время как в расширении/браузере используется более крупная сборка WebGPU полной точности (~330 МБ). Это одноразовая загрузка.
Примечания к платформам:
- Нативный Kokoro для iOS (v0.9.720+): Работает в хост-процессе iOS через OnnxRuntime вместо WebView, что устраняет сбои на iPhone 13/14.
- Kokoro для macOS: Передает аудио по предложениям (примерно в течение 1 секунды после нажатия кнопки воспроизведения) через вспомогательный процесс рабочего стола.
- Gemini TTS (v0.9.723+): Воспроизведение по предложениям, поэтому аудио начинается после первого предложения, а не дожидается синтеза всего ответа.
- OpenAI (v0.9.724+): gpt-4o-mini-tts с возможностью управления подачей — запросите акцент, тон или темп на естественном языке (например, «прочти это с теплым ирландским акцентом»), и голос подстроится под него. Использует тот же API key OpenAI, что и провайдер LLM от OpenAI. Поле Voice style instructions в разделе Settings > Voice применяет ваше указание к любому озвученному ответу.
- Cartesia (v0.9.723+): Один API key обслуживает как Sonic 3.5 (вывод), так и Ink (ввод). Голос по умолчанию отсутствует — выберите его в Settings > Voice перед включением.
Задержка: Gemini и OpenAI генерируют весь ответ целиком перед началом воспроизведения, поэтому при длинных ответах первое аудио может воспроизводиться с задержкой в несколько секунд — в Settings > Voice появляется примечание при выборе одного из них. Для речи с низкой задержкой выбирайте ElevenLabs, Cartesia или Resemble.ai.
Скорость воспроизведения: Ползунок скорости (0,5×–2,0×) применяется провайдером для ElevenLabs (ограничено до 0,7–1,2×) и Cartesia (ограничено до 0,6–1,5×). Голоса браузера и Kokoro ускоряются локально. У Gemini и OpenAI нет собственных элементов управления скоростью, поэтому ползунок скрыт при их выборе; Resemble.ai применяет скорость при стандартном (не потоковом) воспроизведении.
Как включить:
- Перейдите в Settings > Voice
- Выберите опцию синтеза речи
- Включите переключатель «Auto-read responses», если хотите, чтобы ИИ читал автоматически
- Настройте скорость воспроизведения по желанию
В случае сбоя воспроизведения: Ошибки голосового воспроизведения теперь отображаются во всплывающем уведомлении (тост) вместо безмолвного сбоя — так что пропавший или недействительный API key, либо голос, несовместимый с выбранным вариантом (что часто бывает с Resemble.ai и Cartesia), точно подскажет, что именно нужно исправить.
Локально против Облака: Голоса браузера и Kokoro никогда не отправляют данные за пределы вашего устройства. Gemini, OpenAI, ElevenLabs, Cartesia и Resemble.ai отправляют текст на свои серверы (используя ваши API keys) для генерации аудио. Подробности см. в разделе Privacy & Data.
Расходы на голос (TTS + STT) суммируются как voice_cost для беседы, аналогично однократному запросу.
Голосовой ввод (Speech-to-Text)
Диктуйте сообщения вместо того, чтобы печатать. Нажмите иконку микрофона в поле ввода, чтобы начать запись. Caiioo расшифрует сказанное и вставит текст в поле сообщения.
Выберите способ транскрибации:
| Опция | Тип | Конфиденциальность | Настройка |
|---|---|---|---|
| Whisper (Браузер) | Локально | Полностью приватно | FREE, работает на вашем устройстве |
| WhisperKit (iOS) | Локально | Полностью приватно | FREE, на устройстве |
| whisper.cpp & Moonshine (Android) | Локально | Полностью приватно | FREE, на устройстве |
| Browser Speech | Локально | Приватно | FREE, встроено |
| ElevenLabs Scribe | Облако | Точно (отлично для не-английских языков) | Добавьте ваш API ключ ElevenLabs |
| Cartesia Ink | Облако | Точно, низкая задержка | Добавьте ваш API ключ Cartesia |
Локальные варианты (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) обрабатывают аудио на месте — ничего не отправляется на сервер. ElevenLabs и Cartesia отправляют аудио на свои серверы для расшифровки (используя ваш API ключ) и обеспечивают более высокую точность, особенно для русского языка.
Как использовать:
- Нажмите иконку микрофона в поле ввода
- Произнесите сообщение
- Остановите запись, когда закончите
- Текст появится в поле ввода
- Отредактируйте при необходимости и отправьте
Первичная настройка: При первом использовании локальной модели речи ей необходимо загрузиться. В поле ввода будет отображаться прогресс («Загрузка речевой модели… N%», затем «Подготовка»/«Загрузка»), поэтому небольшая пауза при первом нажатии на микрофон — это нормально.
Запись аудио и его прикрепление
Помимо диктовки, вы можете записать фрагмент и прикрепить его к сообщению: откройте меню + в поле ввода и выберите Записать аудио. Доступно на iPhone, iPad, macOS и в расширении для браузера. Отлично сочетается с приложениями, которые прослушивают ваши записи, такими как тренер по произношению «для языков» (for Languages).
Позвольте модели услышать вашу запись
Две функции выходят за рамки транскрипции и позволяют модели с функцией восприятия звука работать с реальным аудио:
- Включать аудио для модели («Настройки > Голос»): прикрепляет вашу запись, чтобы модель с поддержкой аудио (например, Gemini) анализировала реальный звук вместе с вашим запросом — тон, произношение, фоновые звуки, а не только слова. По умолчанию отключено; в противном случае ничего не отправляется. Кнопка в виде формы волны рядом с микрофоном переключает этот параметр для каждого сообщения, но эта кнопка появляется только в режимах и приложениях, которые поддерживают ее (например, «для языков»), поэтому она не захламляет поле ввода при выполнении повседневных задач.
- Прослушивание (бесплатный инструмент, включен по умолчанию): позволяет ассистенту вернуться и прослушать любое аудиовложение заново с помощью целенаправленного последующего вопроса — «какие слова были произнесены с ошибками?», «какой тон голоса?» — в том сообщении, к которому вы его прикрепили, или в любом последующем. Специализированная вспомогательная аудиомодель выполняет прослушивание, поэтому это работает, даже если ваша модель чата не умеет воспринимать звук.
Системная диктовка (macOS)
Подписчики Pro на macOS также могут установить PrivateVoice — отдельное приложение-компаньон, которое добавляет глобальную горячую клавишу для диктовки в любое приложение, а не только в Caiioo. Подробности на странице загрузки для десктопа.
См. также
- Приватность и данные — Как обрабатываются голосовые данные
- Платформа и настройка — Доступность приложения для ПК и PrivateVoice
- Настройки > Голос — Настройте параметры голоса для вашей конфигурации
This guide is maintained by the Caiioo team using Slate, our built-in editor.