Данный документ является машинным переводом оригинальной английской версии. В случае любых расхождений между переводом и оригиналом на английском языке, приоритет имеет английская версия. Читать оригинал на английском языке


Голос: Говорите и слушайте

Хотите, чтобы ИИ читал ответы вслух? Или диктовать сообщения вместо печати? Caiioo предлагает голосовой ввод и вывод — всё настраивается, часть функций работает локально на вашем устройстве.

Настройки голоса с опциями ввода и вывода, переключателем авточтения и скоростью воспроизведения

Голосовой вывод (синтез речи)

Заставьте ИИ озвучивать свои ответы вслух. Выберите один из вариантов:

Опция Тип Качество Настройка
Browser Default Локально Базовое Бесплатно, без настройки
Kokoro Neural TTS Локально Высокое Бесплатно, работает на вашем устройстве
Google Gemini Облако Естественное Добавьте свой API key
OpenAI (gpt-4o-mini-tts) Облако Естественное, с возможностью управления подачей Добавьте свой API key для OpenAI
ElevenLabs Облако Премиум Добавьте свой API key
Cartesia (Sonic 3.5) Облако Премиум Добавьте свой API key
Resemble.ai Облако Отличное (клонирование голоса) Добавьте свой API key

Размер загрузки Kokoro: Модель Kokoro поставляется в двух вариантах, и то, какая именно загружается, зависит от вашей платформы. На macOS и iOS загружается меньшая INT8-квантованная модель (~88 МБ), в то время как в расширении/браузере используется более крупная сборка WebGPU полной точности (~330 МБ). Это одноразовая загрузка.

Примечания к платформам:

  • Нативный Kokoro для iOS (v0.9.720+): Работает в хост-процессе iOS через OnnxRuntime вместо WebView, что устраняет сбои на iPhone 13/14.
  • Kokoro для macOS: Передает аудио по предложениям (примерно в течение 1 секунды после нажатия кнопки воспроизведения) через вспомогательный процесс рабочего стола.
  • Gemini TTS (v0.9.723+): Воспроизведение по предложениям, поэтому аудио начинается после первого предложения, а не дожидается синтеза всего ответа.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts с возможностью управления подачей — запросите акцент, тон или темп на естественном языке (например, «прочти это с теплым ирландским акцентом»), и голос подстроится под него. Использует тот же API key OpenAI, что и провайдер LLM от OpenAI. Поле Voice style instructions в разделе Settings > Voice применяет ваше указание к любому озвученному ответу.
  • Cartesia (v0.9.723+): Один API key обслуживает как Sonic 3.5 (вывод), так и Ink (ввод). Голос по умолчанию отсутствует — выберите его в Settings > Voice перед включением.

Задержка: Gemini и OpenAI генерируют весь ответ целиком перед началом воспроизведения, поэтому при длинных ответах первое аудио может воспроизводиться с задержкой в несколько секунд — в Settings > Voice появляется примечание при выборе одного из них. Для речи с низкой задержкой выбирайте ElevenLabs, Cartesia или Resemble.ai.

Скорость воспроизведения: Ползунок скорости (0,5×–2,0×) применяется провайдером для ElevenLabs (ограничено до 0,7–1,2×) и Cartesia (ограничено до 0,6–1,5×). Голоса браузера и Kokoro ускоряются локально. У Gemini и OpenAI нет собственных элементов управления скоростью, поэтому ползунок скрыт при их выборе; Resemble.ai применяет скорость при стандартном (не потоковом) воспроизведении.

Как включить:

  1. Перейдите в Settings > Voice
  2. Выберите опцию синтеза речи
  3. Включите переключатель «Auto-read responses», если хотите, чтобы ИИ читал автоматически
  4. Настройте скорость воспроизведения по желанию

В случае сбоя воспроизведения: Ошибки голосового воспроизведения теперь отображаются во всплывающем уведомлении (тост) вместо безмолвного сбоя — так что пропавший или недействительный API key, либо голос, несовместимый с выбранным вариантом (что часто бывает с Resemble.ai и Cartesia), точно подскажет, что именно нужно исправить.

Локально против Облака: Голоса браузера и Kokoro никогда не отправляют данные за пределы вашего устройства. Gemini, OpenAI, ElevenLabs, Cartesia и Resemble.ai отправляют текст на свои серверы (используя ваши API keys) для генерации аудио. Подробности см. в разделе Privacy & Data.

Расходы на голос (TTS + STT) суммируются как voice_cost для беседы, аналогично однократному запросу.

Голосовой ввод (Speech-to-Text)

Диктуйте сообщения вместо того, чтобы печатать. Нажмите иконку микрофона в поле ввода, чтобы начать запись. Caiioo расшифрует сказанное и вставит текст в поле сообщения.

Выберите способ транскрибации:

Опция Тип Конфиденциальность Настройка
Whisper (Браузер) Локально Полностью приватно FREE, работает на вашем устройстве
WhisperKit (iOS) Локально Полностью приватно FREE, на устройстве
whisper.cpp & Moonshine (Android) Локально Полностью приватно FREE, на устройстве
Browser Speech Локально Приватно FREE, встроено
ElevenLabs Scribe Облако Точно (отлично для не-английских языков) Добавьте ваш API ключ ElevenLabs
Cartesia Ink Облако Точно, низкая задержка Добавьте ваш API ключ Cartesia

Локальные варианты (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) обрабатывают аудио на месте — ничего не отправляется на сервер. ElevenLabs и Cartesia отправляют аудио на свои серверы для расшифровки (используя ваш API ключ) и обеспечивают более высокую точность, особенно для русского языка.

Как использовать:

  1. Нажмите иконку микрофона в поле ввода
  2. Произнесите сообщение
  3. Остановите запись, когда закончите
  4. Текст появится в поле ввода
  5. Отредактируйте при необходимости и отправьте

Первичная настройка: При первом использовании локальной модели речи ей необходимо загрузиться. В поле ввода будет отображаться прогресс («Загрузка речевой модели… N%», затем «Подготовка»/«Загрузка»), поэтому небольшая пауза при первом нажатии на микрофон — это нормально.

Запись аудио и его прикрепление

Помимо диктовки, вы можете записать фрагмент и прикрепить его к сообщению: откройте меню + в поле ввода и выберите Записать аудио. Доступно на iPhone, iPad, macOS и в расширении для браузера. Отлично сочетается с приложениями, которые прослушивают ваши записи, такими как тренер по произношению «для языков» (for Languages).

Позвольте модели услышать вашу запись

Две функции выходят за рамки транскрипции и позволяют модели с функцией восприятия звука работать с реальным аудио:

  • Включать аудио для модели («Настройки > Голос»): прикрепляет вашу запись, чтобы модель с поддержкой аудио (например, Gemini) анализировала реальный звук вместе с вашим запросом — тон, произношение, фоновые звуки, а не только слова. По умолчанию отключено; в противном случае ничего не отправляется. Кнопка в виде формы волны рядом с микрофоном переключает этот параметр для каждого сообщения, но эта кнопка появляется только в режимах и приложениях, которые поддерживают ее (например, «для языков»), поэтому она не захламляет поле ввода при выполнении повседневных задач.
  • Прослушивание (бесплатный инструмент, включен по умолчанию): позволяет ассистенту вернуться и прослушать любое аудиовложение заново с помощью целенаправленного последующего вопроса — «какие слова были произнесены с ошибками?», «какой тон голоса?» — в том сообщении, к которому вы его прикрепили, или в любом последующем. Специализированная вспомогательная аудиомодель выполняет прослушивание, поэтому это работает, даже если ваша модель чата не умеет воспринимать звук.

Системная диктовка (macOS)

Подписчики Pro на macOS также могут установить PrivateVoice — отдельное приложение-компаньон, которое добавляет глобальную горячую клавишу для диктовки в любое приложение, а не только в Caiioo. Подробности на странице загрузки для десктопа.

См. также


This guide is maintained by the Caiioo team using Slate, our built-in editor.