この文書は元の英語版を機械翻訳したものです。翻訳版と英語版の間に相違がある場合は、英語版が優先されるものとします。 英語版の原文を読む
音声:話す・聴く
AIに応答を読み上げさせたいですか?あるいはタイピングの代わりにメッセージを口述したいですか?Caiiooは音声の入力と出力を提供します。すべて設定可能で、一部はデバイス上でローカルに動作します。

Voice Output (Text-to-Speech)
AIに返答を声に出して読み上げさせます。以下から選択します:
| オプション | タイプ | 品質 | セットアップ |
|---|---|---|---|
| ブラウザデフォルト | ローカル | 基本 | 無料、セットアップ不要 |
| Kokoro Neural TTS | Local | 高 | 無料、お使いのデバイスで実行 |
| Google Gemini | クラウド | 自然 | APIキーを追加 |
| OpenAI (gpt-4o-mini-tts) | クラウド | 自然、制御可能な配信 | OpenAI APIキーを追加 |
| ElevenLabs | クラウド | プレミアム | APIキーを追加 |
| Cartesia (Sonic 3.5) | クラウド | プレミアム | APIキーを追加 |
| Resemble.ai | クラウド | 非常に優れている(音声クローン) | APIキーを追加 |
Kokoroのダウンロードサイズ: Kokoroモデルには2つのバリエーションがあり、どちらがダウンロードされるかはプラットフォームによって異なります。macOSおよびiOSは小さめのINT8量子化モデル(約88 MB)を読み込みますが、拡張機能/ブラウザでは大きめの高精度WebGPUビルド(約330 MB)を使用します。ダウンロードは初回のみです。
プラットフォームの注意点:
- iOS版ネイティブ Kokoro(v0.9.720以降):WebViewではなくOnnxRuntimeを介してiOSホストプロセスで実行され、iPhone 13/14のクラッシュを修正します。
- macOS版 Kokoro:デスクトップヘルパープロセスを通じて、文単位でストリーミング再生(再生ボタンを押してから約1秒以内)します。
- Gemini TTS(v0.9.723以降):文単位で再生されるため、返答全体の合成を待つのではなく、最初の文の後に音声が開始されます。
- OpenAI(v0.9.724以降):配信の制御が可能な gpt-4o-mini-tts — 自然言語でアクセント、トーン、ペースを指定すると(例:「温かみのあるアイルランドのアクセントで読んで」)、音声がそれに従います。OpenAI LLMプロバイダーと同じOpenAI APIキーを使用します。「Settings > AI Setup > Voice」にある Voice style instructions フィールドを使用すると、すべての音声返答にスタイル指示が適用されます。
- Cartesia(v0.9.723以降):1つのAPIキーで Sonic 3.5(出力)と Ink(入力)の両方が機能します。デフォルトの声はありません — 有効にする前に「Settings > AI Setup > Voice」で1つ選択してください。
- ElevenLabs:すべての ElevenLabs の声は、話す準備ができ次第(音声ピッカーで選択可能な表現豊かな v3 を含む)すぐに話し始めます。デフォルトの音声モデルは Flash v2.5 です。ElevenLabs は前回のデフォルトと同等の品質でありながら、1文字あたりのコストが半額になると評価しています。
- ElevenLabs v3 Conversational(v0.9.777以降):音声モデルリストから v3 Conversational モデルを選択すると、70以上の言語で表現力豊かで低レイテンシな対話が可能になります。ElevenLabs は現在、標準の文字単価の半額で請求しており、Caiiooのコスト見積もりにもそれが反映されています。
レイテンシ: Gemini と OpenAI は再生が始まる前に返答全体をレンダリングするため、長めの返答では最初の音声までに数秒の遅延が発生する場合があります — 「Settings > AI Setup > Voice」でいずれかを選択すると、その旨の注記が表示されます。低レイテンシの音声が必要な場合は、ElevenLabs、Cartesia、または Resemble.ai を選択してください。
再生速度: 速度スライダー(0.5×〜2.0×)は、ElevenLabs(0.7〜1.2×に制限)および Cartesia(0.6〜1.5×に制限)ではプロバイダーによって適用されます。ブラウザの音声と Kokoro はローカルで速度を上げます。Gemini と OpenAI には独自の速度制御がないため、これらを選択している間はスライダーが非表示になります。Resemble.ai は標準(非ストリーミング)再生時に速度を適用します。例外として、ElevenLabs v3 モデル(v3 および v3 Conversational)は単体で速度を変更できないため、Caiioo が再生中に速度を適用してピッチを自然に保ちます。トレードオフとして、スライダーを通常から外すと、話し始めるまでにクリップ全体を待つことになります。通常速度の場合は、これまで通りすぐに話し始めます。
Caiiooが状況に合わせた声を選択: 声に出して読み上げることがタスクの一部である場合、AIは常にグローバルな音声設定を使用するのではなく、コンテンツに合った声、話速、音声モデル(ニュースの要約とは異なる、おやすみ絵本用の声など)を選択できます。その他のすべての要素については、ご自身の設定が引き続きデフォルトとして使用されます。
有効にする方法:
- Settings > AI Setup > Voice に移動する
- テキスト読み上げオプションを選択する
- AIに自動で読み上げさせたい場合は、「Auto-read responses」をオンにする
- 必要に応じて再生速度を調整する
再生に失敗する場合: 音声のエラーがサイレント失敗ではなくトーストとして表示されるようになりました。これにより、APIキーの欠落や無効、選択したモデルと互換性のない声(Resemble.aiやCartesiaでよくある問題)が発生した際、何を修正すべきかが正確に伝えられます。
ローカルとクラウド: ブラウザの音声と Kokoro は、デバイス外へデータを送信することはありません。Gemini、OpenAI、ElevenLabs、Cartesia、および Resemble.ai は、音声を生成するためにテキストをそれぞれのサーバー(APIキーを使用)に送信します。詳細は Privacy & Data を参照してください。
音声のコスト(TTS + STT)は、ワンショットパスと同様に、会話上で voice_cost として集計されます。
音声入力 (文字起こし)
タイピングの代わりにメッセージを口述できます。コンポーザーのマイクアイコンをクリックして録音を開始してください。Caiioo が発言を文字に起こし、メッセージフィールドに入力します。
文字起こしの方法を選択してください:
| オプション | タイプ | プライバシー | セットアップ |
|---|---|---|---|
| Whisper (ブラウザ) | ローカル | 完全プライベート | 無料、デバイス上で実行 |
| WhisperKit (iOS) | ローカル | 完全プライベート | 無料、デバイス上 |
| whisper.cpp & Moonshine (Android) | ローカル | 完全プライベート | 無料、デバイス上 |
| ブラウザ音声入力 | ローカル | プライベート | 無料、内蔵機能 |
| ElevenLabs Scribe | クラウド | 高精度(英語以外に最適) | ElevenLabs API キーが必要 |
| Cartesia Ink | クラウド | 高精度、低遅延 | Cartesia API キーが必要 |
ローカルオプション(Whisper、WhisperKit、whisper.cpp、Moonshine、ブラウザ音声入力)は、音声をローカルに保持し、サーバーに送信しません。ElevenLabs と Cartesia は、文字起こしのために音声をサーバーに送信しますが(お客様の API キーを使用)、特に英語以外の言語で高い精度を提供します。
使い方:
- コンポーザーのマイクアイコンをクリックします
- メッセージを話します
- 終わったら停止します
- 文字起こしされたテキストがメッセージフィールドに表示されます
- 必要に応じて編集し、送信します
初回セットアップ: デバイス上の音声モデルを初めて使用するときは、ダウンロードと準備が必要です。コンポーザーに進行状況(「音声モデルをダウンロード中… N%」、「準備中」/「読み込み中」)が表示されます。最初のマイクタップ時に少し時間がかかることがありますが、フリーズではありません。
オーディオを録音して添付する
音声入力に加えて、クリップを録音してメッセージに添付できます:コンポーザーの + メニューを開き、オーディオを録音を選択します。iPhone、iPad、macOS、およびブラウザ拡張機能で利用可能です。「言語学習用」の発音コーチのように、録音を聞き取るアプリと自然に連携します。
モデルに録音を聞かせる
文字起こしを超えて、聞き取り可能なモデルが実際の音声データを処理できるようにする2つの機能があります:
- モデルに音声を含める(設定 > AI設定 > 音声):録音を添付することで、音声対応モデル(Geminiなど)が言葉だけでなく、トーン、発音、背景音などの実際の音声をプロンプトと一緒に確認できます。デフォルトではオフになっており、それ以外の場合は何も送信されません。マイクの横にある波形ボタンでメッセージごとに切り替えますが、このボタンはそれをオプトインしているモードやアプリ(「言語用」など)にのみ表示されるため、日常的なタスクのコンポーザーが煩雑になることはありません。
- 聞き取り(無料ツール、デフォルトで有効):アシスタントに戻り、「どの発音が間違っていましたか?」、「声のトーンはどうですか?」といったターゲットを絞ったフォローアップ質問で、添付した音声や後続の音声を再聴取させることができます。専用の音声ヘルパーモデルがリスニングを行うため、チャットモデルが音声を聞き取れない場合でも機能します。
システム全体での音声入力(デスクトップ)
Caiiooだけでなく、コンピュータ上のあらゆるアプリケーションに音声入力できます:
Proサブスクライバー向けに、macOS、Windows、Linuxのデスクトップアプリにシステム全体の音声入力機能が組み込まれており、追加のコンパニオンアプリをインストールする必要はありません。どこでも音声入力のホットキーを押しながら話すだけで、フォーカスされているアプリに発言内容が入力されます。
関連項目
- プライバシーとデータ — 音声データの処理方法
- プラットフォームとセットアップ — デスクトップアプリの可用性
- 設定 > AI設定 > 音声 — セットアップの音声オプションを構成
This guide is maintained by the Caiioo team using Slate, our built-in editor.