Dies ist eine maschinelle Übersetzung des englischen Originaldokuments. Im Falle von Widersprüchen zwischen dieser Übersetzung und der englischen Originalversion ist die englische Version maßgeblich. Englische Originalversion lesen
Voice: Sprechen und Zuhören
Möchten Sie, dass die KI Antworten vorliest? Oder Nachrichten diktieren? Caiioo bietet Sprach-Ein- und Ausgabe – alles konfigurierbar, teils lokal auf Ihrem Gerät laufend.

Sprachausgabe (Text-to-Speech)
Lassen Sie die KI ihre Antworten laut vorlesen. Wählen Sie aus:
| Option | Typ | Qualität | Einrichtung |
|---|---|---|---|
| Browser-Standard | Lokal | Einfach | Kostenlos, keine Einrichtung |
| Kokoro Neural TTS | Lokal | Hoch | Kostenlos, läuft auf Ihrem Gerät |
| Google Gemini | Cloud | Natürlich | Fügen Sie Ihren API-Schlüssel hinzu |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natürlich, steuerbare Wiedergabe | Fügen Sie Ihren OpenAI API-Schlüssel hinzu |
| ElevenLabs | Cloud | Premium | Fügen Sie Ihren API-Schlüssel hinzu |
| Cartesia (Sonic 3.5) | Cloud | Premium | Fügen Sie Ihren API-Schlüssel hinzu |
| Resemble.ai | Cloud | Ausgezeichnet (Stimmklonung) | Fügen Sie Ihren API-Schlüssel hinzu |
Kokoro-Downloadgröße: Das Kokoro-Modell wird in zwei Varianten ausgeliefert, und welche davon heruntergeladen wird, hängt von Ihrer Plattform ab. macOS und iOS laden das kleinere INT8-quantisierte Modell (~88 MB), während die Erweiterung/der Browser den größeren, vollagenaueren WebGPU-Build (~330 MB) verwendet. Es handelt sich um einen einmaligen Download.
Plattformhinweise:
- iOS-natives Kokoro (v0.9.720+): Läuft im iOS-Host-Prozess über OnnxRuntime anstelle von WebView, wodurch Abstürze auf dem iPhone 13/14 behoben werden.
- macOS Kokoro: Streamt Satz für Satz (innerhalb von ca. 1 Sekunde nach dem Drücken von Play) über den Desktop-Hilfsprozess.
- Gemini TTS (v0.9.723+): Gibt den Text Satz für Satz wieder, sodass die Audiowiedergabe nach dem ersten Satz beginnt, anstatt auf die Synthese der gesamten Antwort zu warten.
- OpenAI (v0.9.724+): gpt-4o-mini-tts mit steuerbarer Wiedergabe — fragen Sie nach einem Akzent, Tonfall oder Tempo in natürlicher Sprache (z. B. „lies dies mit einem warmen irischen Akzent vor“) und die Stimme folgt dem. Verwendet denselben OpenAI API-Schlüssel wie der OpenAI LLM-Anbieter. Ein Feld Stimmstil-Anweisungen in Einstellungen > KI-Einrichtung > Stimme wendet Ihre Stilanweisung auf jede gesprochene Antwort an.
- Cartesia (v0.9.723+): Ein einzelner API-Schlüssel betreibt sowohl Sonic 3.5 (Ausgabe) als auch Ink (Eingabe). Es gibt keine Standardstimme – wählen Sie eine in Einstellungen > KI-Einrichtung > Stimme aus, bevor Sie sie aktivieren.
- ElevenLabs: Jede ElevenLabs-Stimme beginnt zu sprechen, sobald sie etwas zu sagen hat — einschließlich des expressiven v3, das im Stimmen-Auswahlmenü ausgewählt werden kann. Das Standard-Stimmenmodell ist Flash v2.5: ElevenLabs stuft es als qualitativ gleichwertig mit dem vorherigen Standard ein, und es kostet halb so viel pro Zeichen.
- ElevenLabs v3 Conversational (v0.9.777+): Wählen Sie das v3 Conversational-Modell in der Stimmenmodell-Liste für expressive, latenzarme Dialoge in mehr als 70 Sprachen. ElevenLabs berechnet dies derzeit zum halben Standard-Zeichentarif, und die Kostenschätzungen von Caiioo spiegeln dies wider.
Latenz: Gemini und OpenAI rendern die vollständige Antwort vor Beginn der Wiedergabe, sodass die erste Audioausgabe bei längeren Antworten einige Sekunden verzögert sein kann — Einstellungen > KI-Einrichtung > Stimme zeigt einen Hinweis an, wenn Sie eine davon auswählen. Für sprachliche Wiedergabe mit geringer Latenz wählen Sie ElevenLabs, Cartesia oder Resemble.
Wiedergabegeschwindigkeit: Der Geschwindigkeitsregler (0,5×–2,0×) wird für ElevenLabs (eingeschränkt auf 0,7–1,2×) und Cartesia (eingeschränkt auf 0,6–1,5×) vom Anbieter angewendet. Browser-Stimmen und Kokoro beschleunigen lokal. Gemini und OpenAI verfügen über keine eigene Geschwindigkeitssteuerung, weshalb der Regler ausgeblendet ist, während sie ausgewählt sind; Resemble.ai wendet die Geschwindigkeit bei der Standardwiedergabe (ohne Streaming) an. Eine Ausnahme: Die ElevenLabs v3-Modelle (v3 und v3 Conversational) können ihre Geschwindigkeit nicht selbst ändern, daher wendet Caiioo Ihre Geschwindigkeit stattdessen während der Wiedergabe an, wobei die Tonhöhe natürlich bleibt — der Nachteil ist, dass sie bei vom Normalwert abweichendem Regler auf den gesamten Clip warten, bevor sie zu sprechen beginnen. Bei normaler Geschwindigkeit starten sie weiterhin sofort.
Caiioo kann eine zum Moment passende Stimme wählen: Wenn das laute Vorlesen von etwas Teil einer Aufgabe ist, kann die KI eine Stimme, Sprechgeschwindigkeit und ein Sprachmodell wählen, die zum Inhalt passen — eine andere Stimme für eine Gute-Geschichten-Geschichte als für eine Nachrichtenzusammenfassung —, anstatt immer Ihre globale Stimmeinstellung zu verwenden. Ihre eigenen Einstellungen bleiben für alles andere der Standard.
So aktivieren Sie es:
- Gehen Sie zu Einstellungen > KI-Einrichtung > Stimme
- Wählen Sie eine Text-to-Speech-Option
- Aktivieren Sie „Antworten automatisch vorlesen“, wenn die KI automatisch vorlesen soll
- Passen Sie die Wiedergabegeschwindigkeit nach Wunsch an
Wenn die Wiedergabe fehlschlägt: Sprachfehler werden nun als Toast-Benachrichtigung angezeigt, anstatt im Stillen fehlzuschlagen — sodass ein fehlender oder ungültiger API-Schlüssel oder eine Stimme, die nicht mit dem ausgewählten Modell kompatibel ist (häufig bei Resemble.ai und Cartesia), Ihnen genau sagt, was zu beheben ist.
Lokal vs. Cloud: Browser-Stimmen und Kokoro senden niemals Daten von Ihrem Gerät weg. Gemini, OpenAI, ElevenLabs, Cartesia und Resemble.ai senden Text an ihre Server (unter Verwendung Ihrer API-Schlüssel), um das Audio zu generieren. Siehe Datenschutz & Daten für Details.
Sprachkosten (TTS + STT) werden als voice_cost für die Konversation erfasst, entsprechend dem One-Shot-Pfad.
Spracheingabe (Speech-to-Text)
Diktieren Sie Ihre Nachrichten, anstatt zu tippen. Klicken Sie auf das Mikrofonsymbol im Composer, um die Aufnahme zu starten. Caiioo transkribiert das Gesagte und fügt es in das Nachrichtenfeld ein.
Wählen Sie die Transkriptionsmethode:
| Option | Typ | Privatsphäre | Einrichtung |
|---|---|---|---|
| Whisper (Browser) | Lokal | Vollständig privat | GRATIS, läuft auf Ihrem Gerät |
| WhisperKit (iOS) | Lokal | Vollständig privat | GRATIS, auf dem Gerät |
| whisper.cpp & Moonshine (Android) | Lokal | Vollständig privat | GRATIS, auf dem Gerät |
| Browser Speech | Lokal | Privat | GRATIS, integriert |
| ElevenLabs Scribe | Cloud | Präzise (ideal für nicht-englische Sprachen) | ElevenLabs API-Key hinzufügen |
| Cartesia Ink | Cloud | Präzise, geringe Latenz | Cartesia API-Key hinzufügen |
Lokale Optionen (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) behalten Ihr Audio lokal – nichts wird an einen Server gesendet. ElevenLabs und Cartesia senden Audio zur Transkription an deren Server (unter Verwendung Ihres API-Keys) und bieten eine höhere Genauigkeit, insbesondere für Deutsch und andere Sprachen.
Verwendung:
- Klicken Sie auf das Mikrofonsymbol im Composer
- Sprechen Sie Ihre Nachricht
- Stoppen Sie, wenn Sie fertig sind
- Das Transkript erscheint im Nachrichtenfeld
- Bei Bedarf bearbeiten, dann senden
Ersteinrichtung: Wenn Sie zum ersten Mal ein On-Device-Sprachmodell verwenden, muss dieses heruntergeladen und vorbereitet werden. Der Composer zeigt den Fortschritt an ("Sprachmodell wird heruntergeladen... N%", dann "Vorbereiten"/"Laden"). Eine kurze Pause beim ersten Tippen auf das Mikrofon ist also normal.
Audio aufnehmen und anhängen
Neben dem Diktieren können Sie einen Clip aufnehmen und an Ihre Nachricht anhängen: Öffnen Sie das +-Menü des Composers und wählen Sie Audio aufnehmen. Verfügbar auf iPhone, iPad, macOS und der Browser-Erweiterung. Passt nativ zu Apps, die Ihren Aufnahmen zuhören, wie dem Aussprache-Trainer „for Languages“.
Lass das Modell deine Aufnahme hören
Zwei Funktionen gehen über die Transkription hinaus und ermöglichen es einem hörenden Modell, mit dem tatsächlichen Audio zu arbeiten:
- Audio für das Modell einbeziehen (Einstellungen > KI-Einrichtung > Sprache): Hängt deine Aufnahme an, sodass ein audiotaugliches Modell (z. B. Gemini) neben deinem Prompt auch das echte Audio überprüft — Tonfall, Aussprache, Hintergrundgeräusche, nicht nur die Wörter. Standardmäßig aus; ansonsten wird nichts gesendet. Eine Wellenform-Schaltfläche neben dem Mikrofon schaltet dies pro Nachricht um, aber die Schaltfläche erscheint nur in Modi und Apps, die dies unterstützen (wie „für Sprachen“), damit der Composer für alltägliche Aufgaben übersichtlich bleibt.
- Hören (ein kostenloses Werkzeug, standardmäßig aktiv): Ermöglicht es dem Assistenten, zu jedem Audioanhang mit einer gezielten Follow-up-Frage zurückzukehren und diesen erneut anzuhören — „Welche Wörter wurden falsch ausgesprochen?“, „Wie ist der Tonfall?“ — in dem Zug, in dem du ihn anhängst, oder in jedem späteren. Das dedizierte Audio-Hilfsmodell übernimmt das Zuhören, sodass dies selbst dann funktioniert, wenn dein Chat-Modell nicht hören kann.
Systemweites Diktieren (Desktop)
Diktieren Sie in jede Anwendung auf Ihrem Computer — nicht nur in Caiioo:
Pro-Abonnenten haben das systemweite Diktieren direkt in den Desktop-Apps für macOS, Windows und Linux integriert — es muss keine Begleit-App installiert werden. Halten Sie den Diktier-Kurzbefehl überall gedrückt, sprechen Sie, und das Gesprochene wird in die App getippt, die gerade aktiv ist.
Siehe auch
- Datenschutz & Daten — Wie mit Sprachdaten umgegangen wird
- Plattform & Einrichtung — Verfügbarkeit der Desktop-App
- Einstellungen > KI-Einrichtung > Sprache — Konfiguriere Sprachoptionen für deine Einrichtung
This guide is maintained by the Caiioo team using Slate, our built-in editor.