本文件為英文原版的機器翻譯。若翻譯版本與英文原版之間存在任何歧義,概以英文原版為準。 閱讀英文原版
語音:說話與聆聽
想要 AI 大聲朗讀回應嗎?或者想口述訊息而不是打字?Caiioo 提供語音輸入和輸出功能 — 全部可配置,部分在您的裝置本機執行。

語音輸出(文字轉語音)
讓 AI 大聲朗讀其回覆。可從以下選項中選擇:
| 選項 | 類型 | 品質 | 設定 |
|---|---|---|---|
| 瀏覽器預設 | 本機 | 基礎 | 免費,無需設定 |
| Kokoro Neural TTS | 本機 | 高 | 免費,在您的裝置上執行 |
| Google Gemini | 雲端 | 自然 | 新增您的 API key |
| OpenAI (gpt-4o-mini-tts) | 雲端 | 自然、可引導的語調 | 新增您的 OpenAI API key |
| ElevenLabs | 雲端 | 進階 | 新增您的 API key |
| Cartesia (Sonic 3.5) | 雲端 | 進階 | 新增您的 API key |
| Resemble.ai | 雲端 | 極佳(語音複製) | 新增您的 API key |
Kokoro 下載大小: Kokoro 模型有兩種版本,具體下載哪一種取決於您的平台。macOS 和 iOS 會載入較小的 INT8 量化模型(約 88 MB),而擴充功能/瀏覽器則使用較大的全精度 WebGPU 建置版本(約 330 MB)。這是一次性下載。
平台注意事項:
- iOS 原生 Kokoro (v0.9.720+):透過 OnnxRuntime 在 iOS 主處理程序中執行,而不是 WebView,藉此修正 iPhone 13/14 當機的問題。
- macOS Kokoro: 透過桌面輔助處理程序逐句串流播放(按下播放後約 1 秒內)。
- Gemini TTS (v0.9.723+):逐句播放,因此音訊會在第一句話完成後開始播放,而不需要等待整個回覆合成完畢。
- OpenAI (v0.9.724+):gpt-4o-mini-tts 具備可引導的語調 — 以自然語言要求特定的口音、語調或速度(例如:「用溫暖的愛爾蘭口音朗讀這段話」),語音便會隨之調整。使用與 OpenAI LLM 提供者相同的 OpenAI API key。「設定 > 語音」中的 Voice style instructions 欄位會將您的風格指令套用到每一個語音回覆。
- Cartesia (v0.9.723+):只要一個 API key 即可同時驅動 Sonic 3.5(輸出)和 Ink(輸入)。這裡沒有預設語音 — 請在啟用它之前前往「設定 > 語音」挑選一個。
延遲: Gemini 和 OpenAI 會在播放開始前完整算繪整個回覆,因此較長的回覆可能會讓第一段音訊延遲幾秒鐘 — 當您選擇其中之一時,「設定 > 語音」會顯示提示。若需要低延遲語音,請選擇 ElevenLabs、Cartesia 或 Resemble。
播放速度: 速度滑桿(0.5×–2.0×)由提供者套用於 ElevenLabs(限制在 0.7–1.2×)和 Cartesia(限制在 0.6–1.5×)。瀏覽器語音和 Kokoro 則是在本機加速。Gemini 和 OpenAI 沒有內建的速度控制,因此當選取它們時,速度滑桿會隱藏;Resemble.ai 會在標準(非串流)播放時套用速度。
如何啟用:
- 前往「設定 > 語音」
- 挑選一個文字轉語音選項
- 如果您希望 AI 自動朗讀,請切換「自動朗讀回覆」
- 依喜好調整播放速度
如果播放失敗: 語音錯誤現在會以快顯提示(toast)的形式顯示,而不是默默失敗 — 因此當 API key 遺失或無效,或是語音與所選模型不相容(這在 Resemble.ai 和 Cartesia 中很常見)時,系統會精準告訴您需要修正什麼。
本機與雲端: 瀏覽器語音和 Kokoro 絕不會將任何資料傳送出您的裝置。Gemini、OpenAI、ElevenLabs、Cartesia 和 Resemble.ai 會將文字傳送至其伺服器(使用您的 API keys)以產生音訊。詳情請參閱隱私與資料。
語音費用(TTS + STT)會以 voice_cost 形式計入對話中,與單次執行路徑一致。
語音輸入 (語音轉文字)
用聽寫代替打字。點擊編輯器中的麥克風圖示開始錄音。Caiioo 會轉錄您說的話並將其放入訊息欄位。
選擇轉錄方式:
| 選項 | 類型 | 隱私 | 設定 |
|---|---|---|---|
| Whisper (瀏覽器) | 本地 | 完全隱私 | FREE,在您的裝置上執行 |
| WhisperKit (iOS) | 本地 | 完全隱私 | FREE,裝置端執行 |
| whisper.cpp & Moonshine (Android) | 本地 | 完全隱私 | FREE,裝置端執行 |
| 瀏覽器語音 | 本地 | 隱私 | FREE,內建 |
| ElevenLabs Scribe | 雲端 | 精準 (適合非英語) | 新增您的 ElevenLabs API 金鑰 |
| Cartesia Ink | 雲端 | 精準、低延遲 | 新增您的 Cartesia API 金鑰 |
本地選項(Whisper、WhisperKit、whisper.cpp、Moonshine、瀏覽器語音)將您的音訊保留在本地 — 不會發送到任何伺服器。ElevenLabs 和 Cartesia 會將音訊發送到其伺服器進行轉錄(使用您的 API 金鑰),並提供更高的精確度,特別是針對非英語語言。
使用方法:
- 點擊編輯器中的麥克風圖示
- 說出您的訊息
- 完成後停止
- 逐字稿會出現在訊息欄位中
- 根據需要編輯,然後發送
首次設定: 第一次使用裝置端語音模型時,需要下載並預熱。編輯器會顯示進度(「正在下載語音模型... N%」,然後是「正在準備/載入」),因此第一次點擊麥克風時出現短暫停頓是正常的,並非當機。
錄製音訊並附加它
除了聽寫之外,您還可以錄製語音片段並将其附加到訊息中:開啟輸入框的 + 功能表並選擇 錄製音訊。適用於 iPhone、iPad、macOS 和瀏覽器擴充功能。與會聆聽您錄音的應用程式(例如「for Languages」發音教練)自然搭配。
讓模型聆聽您的錄音
有兩項功能超越了純粹的轉錄,能讓具備聽覺的模型直接處理實際的音訊:
- 包含模型專用的音訊(「設定」>「語音」):附加您的錄音,以便具備音訊處理能力的模型(例如 Gemini)除了您的提示詞之外,還能審查真實的音訊 — 語調、發音、背景聲音,而不僅僅是文字。預設為關閉;否則不會傳送任何內容。麥克風旁邊的波形按鈕可在每個訊息中進行切換,但該按鈕只會出現在啟用該功能的模式和應用程式中(例如「for Languages」),因此它不會在日常任務中讓輸入框顯得雜亂。
- 聽覺(免費工具,預設開啟):讓助手能夠透過有針對性的後續問題回過頭來重新聆聽任何音訊附件 — 「哪些字發音不正確?」、「語氣如何?」 — 無論是在您附加音訊的那一回合還是之後的任何回合。專門的音訊輔助模型會負責聆聽,因此即使您的聊天模型無法聽見,此功能也能正常運作。
系統級聽寫 (macOS)
macOS 上的 Pro 訂閱者還可以安裝 PrivateVoice,這是一個獨立的輔助應用程式,它新增了一個全域按住說話快捷鍵,可將聽寫內容輸入到任何應用程式中 — 不僅限於 Caiioo。詳情請參閱桌面版下載頁面。
另請參閱
This guide is maintained by the Caiioo team using Slate, our built-in editor.