本文档由英文原版机器翻译而成。如果翻译版本与英文原版之间存在任何冲突,请以英文原版为准。 阅读英文原版
语音:说与听
想让 AI 大声朗读响应吗?或者想口述消息而不是打字?Caiioo 提供语音输入和输出功能 —— 全部可配置,部分在您的设备本地运行。

语音输出 (Text-to-Speech)
让 AI 大声朗读其回复。可选方案包括:
| 选项 | 类型 | 质量 | 设置 |
|---|---|---|---|
| Browser Default | 本地 | 基础 | 免费,无需设置 |
| Kokoro Neural TTS | 本地 | 高 | 免费,在您的设备上运行 |
| Google Gemini | 云端 | 自然 | 添加您的 API key |
| OpenAI (gpt-4o-mini-tts) | 云端 | 自然,可引导语调 | 添加您的 OpenAI API key |
| ElevenLabs | 云端 | 高级 | 添加 your API key |
| Cartesia (Sonic 3.5) | 云端 | 高级 | 添加您的 API key |
| Resemble.ai | 云端 | 极佳(语音克隆) | 添加您的 API key |
Kokoro 下载大小: Kokoro 模型提供两种变体,具体下载哪种取决于您的平台。macOS 和 iOS 加载较小的 INT8 量化模型(约 88 MB),而扩展程序/浏览器则使用较大的全精度 WebGPU 构建版本(约 330 MB)。这是一个一次性下载。
平台说明:
- iOS 原生 Kokoro (v0.9.720+):通过 OnnxRuntime 在 iOS 主机进程中运行,而不是 WebView,从而修复了 iPhone 13/14 崩溃的问题。
- macOS Kokoro:通过桌面助手进程逐句流式传输(在按下播放后约 1 秒内)。
- Gemini TTS (v0.9.723+):逐句播放,因此音频在第一句生成后即可开始播放,而无需等待整个回复合成完毕。
- OpenAI (v0.9.724+):带可引导语调的 gpt-4o-mini-tts — 用自然语言请求口音、语调或语速(例如:“用温暖的爱尔兰口音朗读这段话”),语音便会遵照执行。使用与 OpenAI LLM 提供商相同的 OpenAI API key。Settings > Voice 中的 Voice style instructions 字段可将您的风格指令应用到每一次语音回复中。
- Cartesia (v0.9.723+):一个 API key 同时支持 Sonic 3.5(输出)和 Ink(输入)。没有默认语音 — 在启用它之前,请先在 Settings > Voice 中选择一个。
延迟: Gemini 和 OpenAI 在播放开始前会渲染完整的回复,因此对于较长的回复,第一段音频可能会延迟几秒钟 — 当您选择其中之一时,Settings > Voice 会显示一条提示。对于低延迟语音,请选择 ElevenLabs、Cartesia 或 Resemble。
播放速度: 速度滑块(0.5×–2.0×)由提供商针对 ElevenLabs(限制在 0.7–1.2×)和 Cartesia(限制在 0.6–1.5×)进行应用。浏览器语音和 Kokoro 在本地加速。Gemini 和 OpenAI 没有自带的速度控制,因此选中它们时滑块会隐藏;Resemble.ai 在标准(非流式)播放时应用速度。
启用方法:
- 转到 Settings > Voice
- 选择一个文本转语音选项
- 如果您希望 AI 自动朗读,请开启“Auto-read responses”
- 根据需要调整播放速度
如果播放失败: 语音错误现在会以浮动提示(toast)的形式显示,而不再是静默失败 — 因此缺少或无效的 API key,或者与所选模型不兼容的语音(在 Resemble.ai 和 Cartesia 中很常见),会准确告诉您需要修复什么。
本地与云端: 浏览器语音和 Kokoro 绝不会将任何内容发送出您的设备。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 会将文本发送到其服务器(使用您的 API key)以生成音频。有关详情,请参阅 Privacy & Data。
语音费用(TTS + STT)会作为 voice_cost 计入对话中,与单次调用路径相匹配。
语音输入 (语音转文字)
通过口述代替打字。点击输入框中的麦克风图标开始录音。Caiioo 会转录您说的话并将其放入消息字段中。
选择转录方式:
| 选项 | 类型 | 隐私 | 设置 |
|---|---|---|---|
| Whisper (浏览器) | 本地 | 完全私密 | FREE,在您的设备上运行 |
| WhisperKit (iOS) | 本地 | 完全私密 | FREE,设备端运行 |
| whisper.cpp & Moonshine (Android) | 本地 | 完全私密 | FREE,设备端运行 |
| 浏览器语音 | 本地 | 私密 | FREE,内置 |
| ElevenLabs Scribe | 云端 | 准确(适合非英语) | 添加您的 ElevenLabs API 密钥 |
| Cartesia Ink | 云端 | 准确、低延迟 | 添加您的 Cartesia API 密钥 |
本地选项(Whisper, WhisperKit, whisper.cpp, Moonshine, 浏览器语音)将音频保留在本地 —— 不会发送到任何服务器。ElevenLabs 和 Cartesia 会将音频发送到其服务器进行转录(使用您的 API 密钥),并提供更高的准确度,尤其是对于非英语语言。
使用方法:
- 点击输入框中的麦克风图标
- 说出您的消息
- 完成后停止
- 转录文本将出现在消息字段中
- 根据需要编辑,然后发送
首次设置: 第一次使用设备端语音模型时,需要下载并预热。输入框会显示进度(“正在下载语音模型… N%”,然后是“正在准备”/“正在加载”),因此第一次点击麦克风时出现短暂暂停是正常的,并非卡死。
录制音频并附加
除了听写之外,您还可以录制音频片段并将其附加到您的消息中:打开输入框的 + 菜单并选择录制音频。适用于 iPhone、iPad、macOS 和浏览器扩展。与那些会听取您录音的应用(例如“语言学习”发音教练)自然契合。
让模型聆听您的录音
有两项功能超越了转录,允许具备听觉功能的模型直接处理实际音频:
- 包含模型音频(设置 > 语音):附加您的录音,以便支持音频的模型(例如 Gemini)在您的提示词旁边审查真实的音频 —— 包括语调、发音、背景声音,而不仅仅是文字。默认关闭;否则不会发送任何内容。麦克风旁边的波形按钮可按每条消息进行切换,但该按钮仅出现在支持它的模式和应用中(例如“语言学习”),因此不会让日常任务的输入框显得凌乱。
- 聆听(一项免费工具,默认开启):允许助手通过有针对性的后续问题返回并重新聆听任何音频附件 —— “哪些单词发音不准?”、“说话的语调是什么?” —— 无论是在您附加的轮次还是任何后续轮次中。专门的音频助手模型负责聆听,因此即使您的聊天模型无法听到音频,此功能也能正常工作。
全局听写 (macOS)
macOS 上的 Pro 订阅者还可以安装 PrivateVoice,这是一个独立的配套应用,它添加了一个全局按住通话热键,可将语音听写到任何应用程序中 —— 不仅仅是 Caiioo。详情请参阅桌面端下载页面。
另请参阅
This guide is maintained by the Caiioo team using Slate, our built-in editor.