Dies ist eine maschinelle Übersetzung des englischen Originaldokuments. Im Falle von Widersprüchen zwischen dieser Übersetzung und der englischen Originalversion ist die englische Version maßgeblich. Englische Originalversion lesen
Voice: Sprechen und Zuhören
Möchten Sie, dass die KI Antworten vorliest? Oder Nachrichten diktieren? Caiioo bietet Sprach-Ein- und Ausgabe – alles konfigurierbar, teils lokal auf Ihrem Gerät laufend.

Voice Output (Text-to-Speech)
Lassen Sie die KI ihre Antworten laut vorlesen. Wählen Sie aus:
| Option | Typ | Qualität | Einrichtung |
|---|---|---|---|
| Browser Default | Lokal | Einfach | Kostenlos, keine Einrichtung |
| Kokoro Neural TTS | Lokal | Hoch | Kostenlos, läuft auf Ihrem Gerät |
| Google Gemini | Cloud | Natürlich | Fügen Sie Ihren API-Schlüssel hinzu |
| OpenAI (gpt-4o-mini-tts) | Cloud | Natürlich, steuerbare Wiedergabe | Fügen Sie Ihren OpenAI-API-Schlüssel hinzu |
| ElevenLabs | Cloud | Premium | Fügen Sie Ihren API-Schlüssel hinzu |
| Cartesia (Sonic 3.5) | Cloud | Premium | Fügen Sie Ihren API-Schlüssel hinzu |
| Resemble.ai | Cloud | Ausgezeichnet (Stimmklonung) | Fügen Sie Ihren API-Schlüssel hinzu |
Kokoro-Download-Größe: Das Kokoro-Modell wird in zwei Varianten ausgeliefert, und welche davon heruntergeladen wird, hängt von Ihrer Plattform ab. macOS und iOS laden das kleinere INT8-quantisierte Modell (~88 MB), während die Erweiterung/der Browser den größeren WebGPU-Build mit voller Präzision (~330 MB) verwendet. Dies ist ein einmaliger Download.
Plattformhinweise:
- iOS native Kokoro (v0.9.720+): Läuft im iOS-Host-Prozess über OnnxRuntime statt WebView, wodurch Abstürze auf dem iPhone 13/14 behoben werden.
- macOS Kokoro: Streamt Satz für Satz (ca. 1 Sekunde nach dem Drücken der Wiedergabetaste) über den Desktop-Hilfsprozess.
- Gemini TTS (v0.9.723+): Spielt Satz für Satz ab, sodass die Audiowiedergabe nach dem ersten Satz beginnt, anstatt auf die Synthese der gesamten Antwort zu warten.
- OpenAI (v0.9.724+): gpt-4o-mini-tts mit steuerbarer Wiedergabe – fragen Sie in natürlicher Sprache nach einem Akzent, Tonfall oder Tempo (z. B. „lies das mit einem warmen irischen Akzent“) und die Stimme folgt dem. Verwendet denselben OpenAI-API-Schlüssel wie der OpenAI-LLM-Anbieter. Ein Feld Stimmstil-Anweisungen unter Einstellungen > Stimme wendet Ihre Stilvorgabe auf jede gesprochene Antwort an.
- Cartesia (v0.9.723+): Ein einzelner API-Schlüssel steuert sowohl Sonic 3.5 (Ausgabe) als auch Ink (Eingabe). Es gibt keine Standardstimme – wählen Sie eine unter Einstellungen > Stimme aus, bevor Sie sie aktivieren.
Latenz: Gemini und OpenAI rendern die vollständige Antwort, bevor die Wiedergabe beginnt, sodass das erste Audio bei längeren Antworten einige Sekunden verzögert sein kann – Einstellungen > Stimme zeigt einen Hinweis an, wenn Sie eine davon auswählen. Für Sprache mit geringer Latenz wählen Sie ElevenLabs, Cartesia oder Resemble.
Wiedergabegeschwindigkeit: Der Geschwindigkeitsregler (0,5×–2,0×) wird vom Anbieter für ElevenLabs (eingeschränkt auf 0,7–1,2×) und Cartesia (eingeschränkt auf 0,6–1,5×) angewendet. Browser-Stimmen und Kokoro beschleunigen lokal. Gemini und OpenAI haben keine eigene Geschwindigkeitssteuerung, weshalb der Regler ausgeblendet ist, während sie ausgewählt sind; Resemble.ai wendet die Geschwindigkeit bei der Standardwiedergabe (ohne Streaming) an.
So aktivieren Sie es:
- Gehen Sie zu Einstellungen > Stimme
- Wählen Sie eine Text-to-Speech-Option
- Aktivieren Sie „Antworten automatisch vorlesen“, wenn die KI automatisch vorlesen soll
- Passen Sie die Wiedergabegeschwindigkeit nach Wunsch an
Wenn die Wiedergabe fehlschlägt: Sprachfehler werden nun als Toast-Benachrichtigung angezeigt, statt stillschweigend fehlschlagen – so teilt Ihnen ein fehlender oder ungültiger API-Schlüssel oder eine Stimme, die nicht mit dem ausgewählten Modell kompatibel ist (häufig bei Resemble.ai und Cartesia), genau mit, was behoben werden muss.
Lokal vs. Cloud: Browser-Stimmen und Kokoro senden niemals Daten von Ihrem Gerät weg. Gemini, OpenAI, ElevenLabs, Cartesia und Resemble.ai senden Text an ihre Server (unter Verwendung Ihrer API-Schlüssel), um das Audio zu generieren. Weitere Einzelheiten finden Sie unter Datenschutz & Daten.
Sprachkosten (TTS + STT) werden als voice_cost für die Unterhaltung zusammengefasst, entsprechend dem One-Shot-Pfad.
Spracheingabe (Speech-to-Text)
Diktieren Sie Ihre Nachrichten, anstatt zu tippen. Klicken Sie auf das Mikrofonsymbol im Composer, um die Aufnahme zu starten. Caiioo transkribiert das Gesagte und fügt es in das Nachrichtenfeld ein.
Wählen Sie die Transkriptionsmethode:
| Option | Typ | Privatsphäre | Einrichtung |
|---|---|---|---|
| Whisper (Browser) | Lokal | Vollständig privat | GRATIS, läuft auf Ihrem Gerät |
| WhisperKit (iOS) | Lokal | Vollständig privat | GRATIS, auf dem Gerät |
| whisper.cpp & Moonshine (Android) | Lokal | Vollständig privat | GRATIS, auf dem Gerät |
| Browser Speech | Lokal | Privat | GRATIS, integriert |
| ElevenLabs Scribe | Cloud | Präzise (ideal für nicht-englische Sprachen) | ElevenLabs API-Key hinzufügen |
| Cartesia Ink | Cloud | Präzise, geringe Latenz | Cartesia API-Key hinzufügen |
Lokale Optionen (Whisper, WhisperKit, whisper.cpp, Moonshine, Browser Speech) behalten Ihr Audio lokal – nichts wird an einen Server gesendet. ElevenLabs und Cartesia senden Audio zur Transkription an deren Server (unter Verwendung Ihres API-Keys) und bieten eine höhere Genauigkeit, insbesondere für Deutsch und andere Sprachen.
Verwendung:
- Klicken Sie auf das Mikrofonsymbol im Composer
- Sprechen Sie Ihre Nachricht
- Stoppen Sie, wenn Sie fertig sind
- Das Transkript erscheint im Nachrichtenfeld
- Bei Bedarf bearbeiten, dann senden
Ersteinrichtung: Wenn Sie zum ersten Mal ein On-Device-Sprachmodell verwenden, muss dieses heruntergeladen und vorbereitet werden. Der Composer zeigt den Fortschritt an ("Sprachmodell wird heruntergeladen... N%", dann "Vorbereiten"/"Laden"). Eine kurze Pause beim ersten Tippen auf das Mikrofon ist also normal.
Audio aufnehmen und anhängen
Neben dem Diktieren können Sie einen Clip aufnehmen und an Ihre Nachricht anhängen: Öffnen Sie das +-Menü des Composers und wählen Sie Audio aufnehmen. Verfügbar auf iPhone, iPad, macOS und der Browser-Erweiterung. Passt nativ zu Apps, die Ihren Aufnahmen zuhören, wie dem Aussprache-Trainer „for Languages“.
Das Modell Ihre Aufnahme hören lassen
Zwei Funktionen gehen über die Transkription hinaus und ermöglichen es einem hörfähigen Modell, mit dem tatsächlichen Audio zu arbeiten:
- Audio für das Modell einbeziehen (Einstellungen > Sprache): Hängt Ihre Aufnahme an, sodass ein audiomäßig fähiges Modell (z. B. Gemini) das echte Audio zusammen mit Ihrem Prompt überprüft – Tonfall, Aussprache, Hintergrundgeräusche, nicht nur die Wörter. Standardmäßig deaktiviert; andernfalls wird nichts gesendet. Eine Wellenform-Schaltfläche neben dem Mikrofon schaltet dies pro Nachricht um, aber die Schaltfläche wird nur in Modi und Apps angezeigt, die dies unterstützen (wie „for Languages“), sodass sie den Composer für alltägliche Aufgaben nicht überlädt.
- Hören (ein kostenloses Tool, standardmäßig aktiv): Ermöglicht dem Assistenten, zu jedem Audio-Anhang mit einer gezielten Follow-up-Frage zurückzukehren und ihn erneut anzuhören – „welche Wörter wurden falsch ausgesprochen?“, „wie ist der Tonfall?“ –, und zwar in dem Zug, in dem Sie ihn anhängen, oder in jedem späteren. Das dedizierte Audio-Hilfsmodell übernimmt das Zuhören, sodass dies selbst dann funktioniert, wenn Ihr Chat-Modell nicht hören kann.
Systemweite Diktierfunktion (macOS)
Pro-Abonnenten auf macOS können zusätzlich PrivateVoice installieren, eine separate Begleit-App, die einen globalen Push-to-Talk-Hotkey zum Diktieren in jeder Anwendung hinzufügt – nicht nur in Caiioo. Weitere Details finden Sie auf der Desktop-Download-Seite.
Siehe auch
- Datenschutz & Daten — Umgang mit Sprachdaten
- Plattform & Einrichtung — Verfügbarkeit von Desktop-App und PrivateVoice
- Einstellungen > Sprache — Konfigurieren Sie die Sprachoptionen für Ihr Setup
This guide is maintained by the Caiioo team using Slate, our built-in editor.