本文件為英文原版的機器翻譯。若翻譯版本與英文原版之間存在任何歧義,概以英文原版為準。 閱讀英文原版
語音:說話與聆聽
想要 AI 大聲朗讀回應嗎?或者想口述訊息而不是打字?Caiioo 提供語音輸入和輸出功能 — 全部可配置,部分在您的裝置本機執行。

語音輸出 (文字轉語音)
讓 AI 大聲朗讀其回覆。請從以下選項中選擇:
| 選項 | 類型 | 品質 | 設定 |
|---|---|---|---|
| 瀏覽器預設 | 本地 | 基本 | 免費,無需設定 |
| Kokoro 類神經 TTS | Local | 高 | 免費,在您的裝置上運行 |
| Google Gemini | 雲端 | 自然 | 新增您的 API key |
| OpenAI (gpt-4o-mini-tts) | 雲端 | 自然、可引導的語調 | 新增您的 OpenAI API key |
| ElevenLabs | 雲端 | 高級 | 新增您的 API key |
| Cartesia (Sonic 3.5) | 雲端 | 高級 | 新增您的 API key |
| Resemble.ai | 雲端 | 極佳 (語音複製) | 新增您的 API key |
Kokoro 下載大小: Kokoro 模型提供兩種版本,下載哪一種取決於您的平台。macOS 和 iOS 會載入較小的 INT8 量化模型 (~88 MB),而擴充功能/瀏覽器則使用較大的全精準度 WebGPU 建置 (~330 MB)。這是一次性下載。
平台注意事項:
- iOS 原生 Kokoro (v0.9.720+):透過 OnnxRuntime 在 iOS 主處理程序中運行,而非 WebView,修復了 iPhone 13/14 當機的問題。
- macOS Kokoro: 透過桌面輔助處理程序逐句串流播放(在按下播放後約 1 秒內)。
- Gemini TTS (v0.9.723+):逐句播放,因此音訊會在第一句話之後開始播放,而不需要等待整個回覆合成完成。
- OpenAI (v0.9.724+):gpt-4o-mini-tts 具有可引導的語調 — 以自然語言要求口音、語調或速度(例如:「用溫暖的愛爾蘭口音朗讀這段話」),語音便會隨之調整。使用與 OpenAI LLM 提供者相同的 OpenAI API key。「設定 > AI 設定 > 語音」中的 語音風格指示 欄位會將您的風格指令套用到每一個語音回覆。
- Cartesia (v0.9.723+):只需一個 API key 即可同時驅動 Sonic 3.5 (輸出) 和 Ink (輸入)。沒有預設語音 — 請在啟用它之前前往「設定 > AI 設定 > 語音」選擇一個。
- ElevenLabs: 每個 ElevenLabs 語音只要有內容可說就會立即開始說話 — 包含可在語音選擇器中選取的具表現力的 v3。預設語音模型為 Flash v2.5:ElevenLabs 評估其品質與先前的預設相當,且每個字元的成本減半。
- ElevenLabs v3 互動 (v0.9.777+):在語音模型列表中選擇 v3 互動模型,即可在 70 多種語言中獲得具表現力、低延遲的對話。ElevenLabs 目前按標準每個字元費率的一半計費,Caiioo 的成本估算也反映了這一點。
延遲: Gemini 和 OpenAI 在播放開始前會完整算繪整個回覆,因此較長的回覆可能會導致第一個音訊延遲幾秒鐘 — 當您選擇其中之一時,「設定 > AI 設定 > 語音」會顯示提示。若要獲得低延遲語音,請選擇 ElevenLabs、Cartesia 或 Resemble。
播放速度: 速度滑桿 (0.5×–2.0×) 由提供者套用於 ElevenLabs (限制在 0.7–1.2×) 和 Cartesia (限制在 0.6–1.5×)。瀏覽器語音和 Kokoro 會在本地加速。Gemini 和 OpenAI 沒有自己的速度控制,因此當選取它們時滑桿會隱藏;Resemble.ai 則在標準 (非串流) 播放上套用速度。有一個例外:ElevenLabs v3 模型 (v3 和 v3 互動) 無法自行變更速度,因此 Caiioo 會在播放期間套用您的速度,同時保持音調自然 — 代價是當滑桿離開正常位置時,它們會等待整個剪輯完成後才開始說話。在正常速度下,它們仍然會立即開始。
Caiioo 可以根據當下情境選擇合適的語音: 當大聲朗讀某個內容是任務的一部分時,AI 可以選擇適合內容的語音、說話速率和語音模型 — 睡前故事的語音與新聞摘要的語音不同 — 而不是始終使用您的全域語音設定。您自己的設定仍會是其他所有內容的預設值。
若要啟用:
- 前往「設定 > AI 設定 > 語音」
- 選擇文字轉語音選項
- 如果您希望 AI 自動朗讀,請切換「自動朗讀回覆」
- 依喜好調整播放速度
如果播放失敗: 語音錯誤現在會以快顯提示 (toast) 顯示,而不是無聲失敗 — 因此遺失或無效的 API key,或與所選模型不相容的語音 (常見於 Resemble.ai 和 Cartesia),會精確告訴您需要修正什麼。
本地 vs 雲端: 瀏覽器語音和 Kokoro 絕不會將任何資料傳送出您的裝置。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 會將文字傳送到其伺服器 (使用您的 API keys) 來產生音訊。詳情請參閱隱私權與資料。
語音成本 (TTS + STT) 會在對話中以 voice_cost 累計,與單次執行路徑相符。
語音輸入 (語音轉文字)
用聽寫代替打字。點擊編輯器中的麥克風圖示開始錄音。Caiioo 會轉錄您說的話並將其放入訊息欄位。
選擇轉錄方式:
| 選項 | 類型 | 隱私 | 設定 |
|---|---|---|---|
| Whisper (瀏覽器) | 本地 | 完全隱私 | FREE,在您的裝置上執行 |
| WhisperKit (iOS) | 本地 | 完全隱私 | FREE,裝置端執行 |
| whisper.cpp & Moonshine (Android) | 本地 | 完全隱私 | FREE,裝置端執行 |
| 瀏覽器語音 | 本地 | 隱私 | FREE,內建 |
| ElevenLabs Scribe | 雲端 | 精準 (適合非英語) | 新增您的 ElevenLabs API 金鑰 |
| Cartesia Ink | 雲端 | 精準、低延遲 | 新增您的 Cartesia API 金鑰 |
本地選項(Whisper、WhisperKit、whisper.cpp、Moonshine、瀏覽器語音)將您的音訊保留在本地 — 不會發送到任何伺服器。ElevenLabs 和 Cartesia 會將音訊發送到其伺服器進行轉錄(使用您的 API 金鑰),並提供更高的精確度,特別是針對非英語語言。
使用方法:
- 點擊編輯器中的麥克風圖示
- 說出您的訊息
- 完成後停止
- 逐字稿會出現在訊息欄位中
- 根據需要編輯,然後發送
首次設定: 第一次使用裝置端語音模型時,需要下載並預熱。編輯器會顯示進度(「正在下載語音模型... N%」,然後是「正在準備/載入」),因此第一次點擊麥克風時出現短暫停頓是正常的,並非當機。
錄製音訊並附加它
除了聽寫之外,您還可以錄製語音片段並将其附加到訊息中:開啟輸入框的 + 功能表並選擇 錄製音訊。適用於 iPhone、iPad、macOS 和瀏覽器擴充功能。與會聆聽您錄音的應用程式(例如「for Languages」發音教練)自然搭配。
讓模型聆聽您的錄音
有兩個功能超越了單純的轉錄,能讓具備聽覺的模型直接處理實際音訊:
- 將音訊納入模型考量(設定 > AI 設定 > Voice):附加您的錄音,讓具備音訊處理能力的模型(例如 Gemini)能夠結合您的提示詞一起檢閱真實音訊——包含語調、發音、背景聲音,而不僅僅是文字。預設為關閉;否則不會發送任何內容。麥克風旁邊的波形按鈕可用於逐則訊息切換,但該按鈕只會出現在支援它的模式和應用程式中(例如「用於語言」),因此不會在日常任務的編寫介面中造成凌亂。
- 聽覺(免費工具,預設開啟):讓助理能夠透過針對性的後續問題回頭重新聆聽任何音訊附件——「哪些字發音不準?」、「語音語調為何?」——無論是在您附加音訊的那一回合還是任何後續回合。專屬的語音輔助模型負責聆聽,因此即使您的聊天模型無法聽見聲音,這項功能依然管用。
系統全域聽寫功能(桌面版)
可在電腦上的任何應用程式中使用聽寫功能 — 不僅限於 Caiioo:
Pro 訂閱者在 macOS、Windows 和 Linux 桌面應用程式中內建了系統全域聽寫功能 — 無需安裝輔助應用程式。只需在任何地方按住聽寫快速鍵、開口說話,您所說的內容就會直接輸入到當前取得焦點的應用程式中。
另請參閱
This guide is maintained by the Caiioo team using Slate, our built-in editor.