本文档由英文原版机器翻译而成。如果翻译版本与英文原版之间存在任何冲突,请以英文原版为准。 阅读英文原版


语音:说与听

想让 AI 大声朗读响应吗?或者想口述消息而不是打字?Caiioo 提供语音输入和输出功能 —— 全部可配置,部分在您的设备本地运行。

语音设置包含输入和输出选项、自动朗读开关和播放速度

语音输出(文本转语音)

让 AI 大声朗读其回复。可选方案包括:

选项 类型 质量 设置
浏览器默认 (Browser Default) 本地 基础 免费,无需设置
Kokoro 神经网络 TTS (Kokoro Neural TTS) 本地 免费,在您的设备上运行
Google Gemini 云端 自然 添加您的 API key
OpenAI (gpt-4o-mini-tts) 云端 自然,可引导发音 添加您的 OpenAI API key
ElevenLabs 云端 高级 添加您的 API key
Cartesia (Sonic 3.5) 云端 高级 添加您的 API key
Resemble.ai 云端 极佳(支持声音克隆) 添加您的 API key

Kokoro 下载大小: Kokoro 模型分为两个变体,具体下载哪个版本取决于您的平台。macOS 和 iOS 会加载较小的 INT8 量化模型(约 88 MB),而扩展程序/浏览器则使用较大的全精度 WebGPU 构建版本(约 330 MB)。这是一个一次性下载。

平台说明:

  • iOS 原生 Kokoro(v0.9.720+):通过 OnnxRuntime 在 iOS 主进程中运行,而非通过 WebView,从而修复了 iPhone 13/14 崩溃的问题。
  • macOS Kokoro:通过桌面辅助进程按句流式传输(在点击播放后约 1 秒内)。
  • Gemini TTS(v0.9.723+):按句播放,因此音频会在第一句话生成后开始播放,而无需等待整个回复合成完毕。
  • OpenAI(v0.9.724+):带有可引导发音功能的 gpt-4o-mini-tts — 可用自然语言要求特定的口音、语调或语速(例如“用温暖的爱尔兰口音朗读这段话”),语音便会随之调整。使用与 OpenAI LLM 提供商相同的 OpenAI API key。“设置 > AI 设置 > 语音”中的语音风格指令字段会将您的风格指令应用于每次语音回复。
  • Cartesia(v0.9.723+):一个 API key 同时支持 Sonic 3.5(输出)和 Ink(输入)。此功能没有默认声音——在启用它之前,请先在“设置 > AI 设置 > 语音”中选择一个声音。
  • ElevenLabs:每个 ElevenLabs 声音在有内容可说时都会立即开始说话——包括可在声音选择器中选择的富有表现力的 v3。默认语音模型为 Flash v2.5:ElevenLabs 评估其质量与之前的默认版本相当,且每个字符的成本减半。
  • ElevenLabs v3 对话 (v3 Conversational)(v0.9.777+):在语音模型列表中选择 v3 对话模型,即可在 70 多种语言中获得富有表现力、低延迟的对话体验。ElevenLabs 目前按标准单字符速率的一半计费,Caiioo 的成本估算也反映了这一点。

延迟: Gemini 和 OpenAI 会在播放开始前渲染完整回复,因此对于较长的回复,第一个音频可能会延迟几秒钟——当您选择其中之一时,“设置 > AI 设置 > 语音”中会显示一条提示。如需低延迟的语音,请选择 ElevenLabs、Cartesia 或 Resemble.ai。

播放速度: 速度滑块(0.5×–2.0×)由提供商针对 ElevenLabs(限制在 0.7–1.2×)和 Cartesia(限制在 0.6–1.5×)应用。浏览器声音和 Kokoro 在本地加速。Gemini 和 OpenAI 没有自带的速度控制,因此当选中它们时滑块会隐藏;Resemble.ai 在标准(非流式)播放时应用速度。有一个例外:ElevenLabs v3 模型(v3 和 v3 Conversational)无法自行更改速度,因此 Caiioo 会在播放期间应用您的速度,同时保持音调自然——这样做的权衡是,当滑块偏离正常速度时,它们会等待整个剪辑加载完毕才开始说话。在正常速度下,它们依然会立即开始。

Caiioo 可以根据情境选择声音: 当朗读内容是任务的一部分时,AI 可以选择适合内容的语音、语速和语音模型——睡前故事和新闻摘要会使用不同的声音——而不是始终使用您的全局语音设置。您自己的设置仍然是其他所有情况的默认设置。

启用方法:

  1. 前往“设置 > AI 设置 > 语音”
  2. 选择一个文本转语音选项
  3. 如果您希望 AI 自动朗读,请开启“自动朗读回复”开关
  4. 根据需要调整播放速度

如果播放失败: 语音错误现在会以悬浮提示 (toast) 的形式显示,而不是静默失败——因此,缺失或无效的 API key,或者与所选模型不兼容的声音(在 Resemble.ai 和 Cartesia 中很常见),会明确告诉您需要修复什么。

本地与云端: 浏览器自带的声音和 Kokoro 绝不会将任何数据发送出您的设备。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 会将文本发送到其服务器(使用您的 API key)来生成音频。详情请参阅隐私与数据

语音成本(TTS + STT)会作为 voice_cost 汇总到对话中,与单次调用路径一致。

语音输入 (语音转文字)

通过口述代替打字。点击输入框中的麦克风图标开始录音。Caiioo 会转录您说的话并将其放入消息字段中。

选择转录方式:

选项 类型 隐私 设置
Whisper (浏览器) 本地 完全私密 FREE,在您的设备上运行
WhisperKit (iOS) 本地 完全私密 FREE,设备端运行
whisper.cpp & Moonshine (Android) 本地 完全私密 FREE,设备端运行
浏览器语音 本地 私密 FREE,内置
ElevenLabs Scribe 云端 准确(适合非英语) 添加您的 ElevenLabs API 密钥
Cartesia Ink 云端 准确、低延迟 添加您的 Cartesia API 密钥

本地选项(Whisper, WhisperKit, whisper.cpp, Moonshine, 浏览器语音)将音频保留在本地 —— 不会发送到任何服务器。ElevenLabs 和 Cartesia 会将音频发送到其服务器进行转录(使用您的 API 密钥),并提供更高的准确度,尤其是对于非英语语言。

使用方法:

  1. 点击输入框中的麦克风图标
  2. 说出您的消息
  3. 完成后停止
  4. 转录文本将出现在消息字段中
  5. 根据需要编辑,然后发送

首次设置: 第一次使用设备端语音模型时,需要下载并预热。输入框会显示进度(“正在下载语音模型… N%”,然后是“正在准备”/“正在加载”),因此第一次点击麦克风时出现短暂暂停是正常的,并非卡死。

录制音频并附加

除了听写之外,您还可以录制音频片段并将其附加到您的消息中:打开输入框的 + 菜单并选择录制音频。适用于 iPhone、iPad、macOS 和浏览器扩展。与那些会听取您录音的应用(例如“语言学习”发音教练)自然契合。

让模型听到您的录音

两项功能超越了单纯的转录,允许能够听到声音的模型直接处理实际音频:

  • 为模型包含音频(设置 > AI 设置 > 语音):附加您的录音,以便支持音频的模型(例如 Gemini)除了您的提示词之外,还能审查真实的音频 —— 语调、发音、背景声音,而不仅仅是文字。默认关闭;否则不发送任何内容。麦克风旁边的波形按钮可按消息切换它,但该按钮仅出现在选择加入它的模式和应用中(例如“用于语言”),因此它不会在日常任务的编写器中显得凌乱。
  • 听觉(免费工具,默认开启):允许助手带着有针对性的后续问题返回并重新听取任何音频附件 —— “哪些词发音不准?”、“语调是怎样的?” —— 在您附加该附件的轮次或任何后续轮次中进行。专门的音频辅助模型负责倾听,因此即使您的聊天模型无法听到音频,此功能也能正常工作。

全局听写(桌面端)

可在计算机上的任意应用程序中进行听写,不仅限于 Caiioo:

专业版订阅用户可在 macOS、Windows 和 Linux 桌面应用中使用内置的全局听写功能,无需安装辅助应用。在任意位置按住听写快捷键并说话,语音内容就会输入到当前获得焦点的应用程序中。

参见

  • 隐私与数据 — 如何处理语音数据
  • 平台与设置 — 桌面应用可用性
  • 设置 > AI 设置 > 语音 — 为您的设置配置语音选项

This guide is maintained by the Caiioo team using Slate, our built-in editor.