本文档由英文原版机器翻译而成。如果翻译版本与英文原版之间存在任何冲突,请以英文原版为准。 阅读英文原版


语音:说与听

想让 AI 大声朗读响应吗?或者想口述消息而不是打字?Caiioo 提供语音输入和输出功能 —— 全部可配置,部分在您的设备本地运行。

语音设置包含输入和输出选项、自动朗读开关和播放速度

语音输出 (Text-to-Speech)

让 AI 大声朗读其回复。可选方案包括:

选项 类型 质量 设置
Browser Default 本地 基础 免费,无需设置
Kokoro Neural TTS 本地 免费,在您的设备上运行
Google Gemini 云端 自然 添加您的 API key
OpenAI (gpt-4o-mini-tts) 云端 自然,可引导语调 添加您的 OpenAI API key
ElevenLabs 云端 高级 添加 your API key
Cartesia (Sonic 3.5) 云端 高级 添加您的 API key
Resemble.ai 云端 极佳(语音克隆) 添加您的 API key

Kokoro 下载大小: Kokoro 模型提供两种变体,具体下载哪种取决于您的平台。macOS 和 iOS 加载较小的 INT8 量化模型(约 88 MB),而扩展程序/浏览器则使用较大的全精度 WebGPU 构建版本(约 330 MB)。这是一个一次性下载。

平台说明:

  • iOS 原生 Kokoro (v0.9.720+):通过 OnnxRuntime 在 iOS 主机进程中运行,而不是 WebView,从而修复了 iPhone 13/14 崩溃的问题。
  • macOS Kokoro:通过桌面助手进程逐句流式传输(在按下播放后约 1 秒内)。
  • Gemini TTS (v0.9.723+):逐句播放,因此音频在第一句生成后即可开始播放,而无需等待整个回复合成完毕。
  • OpenAI (v0.9.724+):带可引导语调的 gpt-4o-mini-tts — 用自然语言请求口音、语调或语速(例如:“用温暖的爱尔兰口音朗读这段话”),语音便会遵照执行。使用与 OpenAI LLM 提供商相同的 OpenAI API key。Settings > Voice 中的 Voice style instructions 字段可将您的风格指令应用到每一次语音回复中。
  • Cartesia (v0.9.723+):一个 API key 同时支持 Sonic 3.5(输出)和 Ink(输入)。没有默认语音 — 在启用它之前,请先在 Settings > Voice 中选择一个。

延迟: Gemini 和 OpenAI 在播放开始前会渲染完整的回复,因此对于较长的回复,第一段音频可能会延迟几秒钟 — 当您选择其中之一时,Settings > Voice 会显示一条提示。对于低延迟语音,请选择 ElevenLabs、Cartesia 或 Resemble。

播放速度: 速度滑块(0.5×–2.0×)由提供商针对 ElevenLabs(限制在 0.7–1.2×)和 Cartesia(限制在 0.6–1.5×)进行应用。浏览器语音和 Kokoro 在本地加速。Gemini 和 OpenAI 没有自带的速度控制,因此选中它们时滑块会隐藏;Resemble.ai 在标准(非流式)播放时应用速度。

启用方法:

  1. 转到 Settings > Voice
  2. 选择一个文本转语音选项
  3. 如果您希望 AI 自动朗读,请开启“Auto-read responses”
  4. 根据需要调整播放速度

如果播放失败: 语音错误现在会以浮动提示(toast)的形式显示,而不再是静默失败 — 因此缺少或无效的 API key,或者与所选模型不兼容的语音(在 Resemble.ai 和 Cartesia 中很常见),会准确告诉您需要修复什么。

本地与云端: 浏览器语音和 Kokoro 绝不会将任何内容发送出您的设备。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 会将文本发送到其服务器(使用您的 API key)以生成音频。有关详情,请参阅 Privacy & Data

语音费用(TTS + STT)会作为 voice_cost 计入对话中,与单次调用路径相匹配。

语音输入 (语音转文字)

通过口述代替打字。点击输入框中的麦克风图标开始录音。Caiioo 会转录您说的话并将其放入消息字段中。

选择转录方式:

选项 类型 隐私 设置
Whisper (浏览器) 本地 完全私密 FREE,在您的设备上运行
WhisperKit (iOS) 本地 完全私密 FREE,设备端运行
whisper.cpp & Moonshine (Android) 本地 完全私密 FREE,设备端运行
浏览器语音 本地 私密 FREE,内置
ElevenLabs Scribe 云端 准确(适合非英语) 添加您的 ElevenLabs API 密钥
Cartesia Ink 云端 准确、低延迟 添加您的 Cartesia API 密钥

本地选项(Whisper, WhisperKit, whisper.cpp, Moonshine, 浏览器语音)将音频保留在本地 —— 不会发送到任何服务器。ElevenLabs 和 Cartesia 会将音频发送到其服务器进行转录(使用您的 API 密钥),并提供更高的准确度,尤其是对于非英语语言。

使用方法:

  1. 点击输入框中的麦克风图标
  2. 说出您的消息
  3. 完成后停止
  4. 转录文本将出现在消息字段中
  5. 根据需要编辑,然后发送

首次设置: 第一次使用设备端语音模型时,需要下载并预热。输入框会显示进度(“正在下载语音模型… N%”,然后是“正在准备”/“正在加载”),因此第一次点击麦克风时出现短暂暂停是正常的,并非卡死。

录制音频并附加

除了听写之外,您还可以录制音频片段并将其附加到您的消息中:打开输入框的 + 菜单并选择录制音频。适用于 iPhone、iPad、macOS 和浏览器扩展。与那些会听取您录音的应用(例如“语言学习”发音教练)自然契合。

让模型聆听您的录音

有两项功能超越了转录,允许具备听觉功能的模型直接处理实际音频:

  • 包含模型音频(设置 > 语音):附加您的录音,以便支持音频的模型(例如 Gemini)在您的提示词旁边审查真实的音频 —— 包括语调、发音、背景声音,而不仅仅是文字。默认关闭;否则不会发送任何内容。麦克风旁边的波形按钮可按每条消息进行切换,但该按钮仅出现在支持它的模式和应用中(例如“语言学习”),因此不会让日常任务的输入框显得凌乱。
  • 聆听(一项免费工具,默认开启):允许助手通过有针对性的后续问题返回并重新聆听任何音频附件 —— “哪些单词发音不准?”、“说话的语调是什么?” —— 无论是在您附加的轮次还是任何后续轮次中。专门的音频助手模型负责聆听,因此即使您的聊天模型无法听到音频,此功能也能正常工作。

全局听写 (macOS)

macOS 上的 Pro 订阅者还可以安装 PrivateVoice,这是一个独立的配套应用,它添加了一个全局按住通话热键,可将语音听写到任何应用程序中 —— 不仅仅是 Caiioo。详情请参阅桌面端下载页面。

另请参阅

  • 隐私与数据 —— 语音数据如何处理
  • 平台与设置 —— 桌面应用和 PrivateVoice 的可用性
  • 设置 > 语音 —— 为您的环境配置语音选项

This guide is maintained by the Caiioo team using Slate, our built-in editor.