本文档由英文原版机器翻译而成。如果翻译版本与英文原版之间存在任何冲突,请以英文原版为准。 阅读英文原版
语音:说与听
想让 AI 大声朗读响应吗?或者想口述消息而不是打字?Caiioo 提供语音输入和输出功能 —— 全部可配置,部分在您的设备本地运行。

语音输出(文本转语音)
让 AI 大声朗读其回复。可选方案包括:
| 选项 | 类型 | 质量 | 设置 |
|---|---|---|---|
| 浏览器默认 (Browser Default) | 本地 | 基础 | 免费,无需设置 |
| Kokoro 神经网络 TTS (Kokoro Neural TTS) | 本地 | 高 | 免费,在您的设备上运行 |
| Google Gemini | 云端 | 自然 | 添加您的 API key |
| OpenAI (gpt-4o-mini-tts) | 云端 | 自然,可引导发音 | 添加您的 OpenAI API key |
| ElevenLabs | 云端 | 高级 | 添加您的 API key |
| Cartesia (Sonic 3.5) | 云端 | 高级 | 添加您的 API key |
| Resemble.ai | 云端 | 极佳(支持声音克隆) | 添加您的 API key |
Kokoro 下载大小: Kokoro 模型分为两个变体,具体下载哪个版本取决于您的平台。macOS 和 iOS 会加载较小的 INT8 量化模型(约 88 MB),而扩展程序/浏览器则使用较大的全精度 WebGPU 构建版本(约 330 MB)。这是一个一次性下载。
平台说明:
- iOS 原生 Kokoro(v0.9.720+):通过 OnnxRuntime 在 iOS 主进程中运行,而非通过 WebView,从而修复了 iPhone 13/14 崩溃的问题。
- macOS Kokoro:通过桌面辅助进程按句流式传输(在点击播放后约 1 秒内)。
- Gemini TTS(v0.9.723+):按句播放,因此音频会在第一句话生成后开始播放,而无需等待整个回复合成完毕。
- OpenAI(v0.9.724+):带有可引导发音功能的 gpt-4o-mini-tts — 可用自然语言要求特定的口音、语调或语速(例如“用温暖的爱尔兰口音朗读这段话”),语音便会随之调整。使用与 OpenAI LLM 提供商相同的 OpenAI API key。“设置 > AI 设置 > 语音”中的语音风格指令字段会将您的风格指令应用于每次语音回复。
- Cartesia(v0.9.723+):一个 API key 同时支持 Sonic 3.5(输出)和 Ink(输入)。此功能没有默认声音——在启用它之前,请先在“设置 > AI 设置 > 语音”中选择一个声音。
- ElevenLabs:每个 ElevenLabs 声音在有内容可说时都会立即开始说话——包括可在声音选择器中选择的富有表现力的 v3。默认语音模型为 Flash v2.5:ElevenLabs 评估其质量与之前的默认版本相当,且每个字符的成本减半。
- ElevenLabs v3 对话 (v3 Conversational)(v0.9.777+):在语音模型列表中选择 v3 对话模型,即可在 70 多种语言中获得富有表现力、低延迟的对话体验。ElevenLabs 目前按标准单字符速率的一半计费,Caiioo 的成本估算也反映了这一点。
延迟: Gemini 和 OpenAI 会在播放开始前渲染完整回复,因此对于较长的回复,第一个音频可能会延迟几秒钟——当您选择其中之一时,“设置 > AI 设置 > 语音”中会显示一条提示。如需低延迟的语音,请选择 ElevenLabs、Cartesia 或 Resemble.ai。
播放速度: 速度滑块(0.5×–2.0×)由提供商针对 ElevenLabs(限制在 0.7–1.2×)和 Cartesia(限制在 0.6–1.5×)应用。浏览器声音和 Kokoro 在本地加速。Gemini 和 OpenAI 没有自带的速度控制,因此当选中它们时滑块会隐藏;Resemble.ai 在标准(非流式)播放时应用速度。有一个例外:ElevenLabs v3 模型(v3 和 v3 Conversational)无法自行更改速度,因此 Caiioo 会在播放期间应用您的速度,同时保持音调自然——这样做的权衡是,当滑块偏离正常速度时,它们会等待整个剪辑加载完毕才开始说话。在正常速度下,它们依然会立即开始。
Caiioo 可以根据情境选择声音: 当朗读内容是任务的一部分时,AI 可以选择适合内容的语音、语速和语音模型——睡前故事和新闻摘要会使用不同的声音——而不是始终使用您的全局语音设置。您自己的设置仍然是其他所有情况的默认设置。
启用方法:
- 前往“设置 > AI 设置 > 语音”
- 选择一个文本转语音选项
- 如果您希望 AI 自动朗读,请开启“自动朗读回复”开关
- 根据需要调整播放速度
如果播放失败: 语音错误现在会以悬浮提示 (toast) 的形式显示,而不是静默失败——因此,缺失或无效的 API key,或者与所选模型不兼容的声音(在 Resemble.ai 和 Cartesia 中很常见),会明确告诉您需要修复什么。
本地与云端: 浏览器自带的声音和 Kokoro 绝不会将任何数据发送出您的设备。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 会将文本发送到其服务器(使用您的 API key)来生成音频。详情请参阅隐私与数据。
语音成本(TTS + STT)会作为 voice_cost 汇总到对话中,与单次调用路径一致。
语音输入 (语音转文字)
通过口述代替打字。点击输入框中的麦克风图标开始录音。Caiioo 会转录您说的话并将其放入消息字段中。
选择转录方式:
| 选项 | 类型 | 隐私 | 设置 |
|---|---|---|---|
| Whisper (浏览器) | 本地 | 完全私密 | FREE,在您的设备上运行 |
| WhisperKit (iOS) | 本地 | 完全私密 | FREE,设备端运行 |
| whisper.cpp & Moonshine (Android) | 本地 | 完全私密 | FREE,设备端运行 |
| 浏览器语音 | 本地 | 私密 | FREE,内置 |
| ElevenLabs Scribe | 云端 | 准确(适合非英语) | 添加您的 ElevenLabs API 密钥 |
| Cartesia Ink | 云端 | 准确、低延迟 | 添加您的 Cartesia API 密钥 |
本地选项(Whisper, WhisperKit, whisper.cpp, Moonshine, 浏览器语音)将音频保留在本地 —— 不会发送到任何服务器。ElevenLabs 和 Cartesia 会将音频发送到其服务器进行转录(使用您的 API 密钥),并提供更高的准确度,尤其是对于非英语语言。
使用方法:
- 点击输入框中的麦克风图标
- 说出您的消息
- 完成后停止
- 转录文本将出现在消息字段中
- 根据需要编辑,然后发送
首次设置: 第一次使用设备端语音模型时,需要下载并预热。输入框会显示进度(“正在下载语音模型… N%”,然后是“正在准备”/“正在加载”),因此第一次点击麦克风时出现短暂暂停是正常的,并非卡死。
录制音频并附加
除了听写之外,您还可以录制音频片段并将其附加到您的消息中:打开输入框的 + 菜单并选择录制音频。适用于 iPhone、iPad、macOS 和浏览器扩展。与那些会听取您录音的应用(例如“语言学习”发音教练)自然契合。
让模型听到您的录音
两项功能超越了单纯的转录,允许能够听到声音的模型直接处理实际音频:
- 为模型包含音频(设置 > AI 设置 > 语音):附加您的录音,以便支持音频的模型(例如 Gemini)除了您的提示词之外,还能审查真实的音频 —— 语调、发音、背景声音,而不仅仅是文字。默认关闭;否则不发送任何内容。麦克风旁边的波形按钮可按消息切换它,但该按钮仅出现在选择加入它的模式和应用中(例如“用于语言”),因此它不会在日常任务的编写器中显得凌乱。
- 听觉(免费工具,默认开启):允许助手带着有针对性的后续问题返回并重新听取任何音频附件 —— “哪些词发音不准?”、“语调是怎样的?” —— 在您附加该附件的轮次或任何后续轮次中进行。专门的音频辅助模型负责倾听,因此即使您的聊天模型无法听到音频,此功能也能正常工作。
全局听写(桌面端)
可在计算机上的任意应用程序中进行听写,不仅限于 Caiioo:
专业版订阅用户可在 macOS、Windows 和 Linux 桌面应用中使用内置的全局听写功能,无需安装辅助应用。在任意位置按住听写快捷键并说话,语音内容就会输入到当前获得焦点的应用程序中。
参见
This guide is maintained by the Caiioo team using Slate, our built-in editor.