Niniejszy dokument jest automatycznym tłumaczeniem oryginału w języku angielskim. W przypadku jakichkolwiek rozbieżności między tym tłumaczeniem a oryginalną wersją angielską, wersja angielska jest rozstrzygająca. Przeczytaj oryginał w języku angielskim
Głos: Mów i słuchaj
Chcesz, aby AI czytała odpowiedzi na głos? A może wolisz dyktować wiadomości zamiast pisać? Caiioo oferuje wejście i wyjście głosowe — wszystko konfigurowalne, niektóre opcje działają lokalnie na Twoim urządzeniu.

Wyjście głosowe (Text-to-Speech)
Pozwól sztucznej inteligencji czytać jej odpowiedzi na głos. Wybierz spośród:
| Opcja | Typ | Jakość | Konfiguracja |
|---|---|---|---|
| Domyślna przeglądarka | Lokalna | Podstawowa | Darmowa, bez konfiguracji |
| Kokoro Neural TTS | Lokalna | Wysoka | Darmowa, działa na Twoim urządzeniu |
| Google Gemini | Chmura | Naturalna | Dodaj swój klucz API |
| OpenAI (gpt-4o-mini-tts) | Chmura | Naturalna, sterowana intonacja | Dodaj swój klucz API OpenAI |
| ElevenLabs | Chmura | Premium | Dodaj swój klucz API |
| Cartesia (Sonic 3.5) | Chmura | Premium | Dodaj swój klucz API |
| Resemble.ai | Chmura | Doskonała (klonowanie głosu) | Dodaj swój klucz API |
Rozmiar pobierania Kokoro: Model Kokoro jest dostarczany w dwóch wariantach, a to, który z nich zostanie pobrany, zależy od Twojej platformy. Systemy macOS i iOS ładują mniejszy model kwantowany do INT8 (~88 MB), podczas gdy rozszerzenie/przeglądarka korzysta z większej, pełnoprecyzyjnej kompilacji WebGPU (~330 MB). Jest to jednorazowe pobieranie.
Uwagi dotyczące platform:
- Natywne Kokoro dla iOS (v0.9.720+): Działa w procesie hosta iOS za pośrednictwem OnnxRuntime zamiast WebView, co naprawia awarie na iPhone 13/14.
- Kokoro dla macOS: Strumieniuje zdanie po zdaniu (w ciągu ~1 sekundy od naciśnięcia odtwarzania) za pośrednictwem pomocniczego procesu komputerowego.
- Gemini TTS (v0.9.723+): Odtwarza zdanie po zdaniu, dzięki czemu dźwięk rozpoczyna się po pierwszym zdaniu zamiast czekać na syntezę całej odpowiedzi.
- OpenAI (v0.9.724+): gpt-4o-mini-tts ze sterowaną intonacją — poproś o akcent, ton lub tempo w języku naturalnym (np. „przeczytaj to z ciepłym irlandzkim akcentem”), a głos się do tego dostosuje. Używa tego samego klucza API OpenAI co dostawca LLM OpenAI. Pole Instrukcje stylu głosu w Ustawienia > Głos stosuje Twoją dyrektywę stylu do każdej wypowiadanej odpowiedzi.
- Cartesia (v0.9.723+): Jeden klucz API obsługuje zarówno Sonic 3.5 (wyjście), jak i Ink (wejście). Brak domyślnego głosu — wybierz jeden w Ustawienia > Głos przed jego włączeniem.
Opóźnienie (Latencja): Gemini i OpenAI renderują całą odpowiedź przed rozpoczęciem odtwarzania, więc pierwszy dźwięk może mieć kilkusekundowe opóźnienie przy dłuższych odpowiedziach — Ustawienia > Głos wyświetlają informację, gdy wybierzesz jedno z nich. Aby uzyskać mniejsze opóźnienie mowy, wybierz ElevenLabs, Cartesia lub Resemble.
Prędkość odtwarzania: Suwak prędkości (0,5×–2,0×) jest stosowany przez dostawcę dla ElevenLabs (ograniczonego do 0,7–1,2×) oraz Cartesia (ograniczonego do 0,6–1,5×). Głosy przeglądarki i Kokoro przyspieszają lokalnie. Gemini i OpenAI nie posiadają własnej kontroli prędkości, więc suwak jest ukryty, gdy są wybrane; Resemble.ai stosuje prędkość przy standardowym odtwarzaniu (bez strumieniowania).
Aby włączyć:
- Przejdź do Ustawienia > Głos
- Wybierz opcję zamiany tekstu na mowę
- Włącz opcję „Automatyczne czytanie odpowiedzi”, jeśli chcesz, aby AI czytało automatycznie
- Dostosuj prędkość odtwarzania, jeśli chcesz
Jeśli odtwarzanie się nie powiedzie: Błędy głosu pojawiają się teraz jako powiadomienie (toast) zamiast cichego niepowodzenia — dzięki temu brakujący lub nieprawidłowy klucz API bądź głos niekompatybilny z wybranym modelem (co jest częste w przypadku Resemble.ai i Cartesia) poinformuje Cię dokładnie, co należy naprawić.
Lokalne a chmura: Głosy przeglądarki i Kokoro nigdy nie wysyłają niczego poza Twoje urządzenie. Gemini, OpenAI, ElevenLabs, Cartesia i Resemble.ai wysyłają tekst na swoje serwery (używając Twoich kluczy API), aby wygenerować dźwięk. Zobacz Prywatność i dane, aby uzyskać szczegóły.
Koszty głosu (TTS + STT) są sumowane jako voice_cost dla konwersacji, pasując do ścieżki jednorazowej.
Wejście głosowe (Speech-to-Text)
Dyktuj wiadomości zamiast pisać. Kliknij ikonę mikrofonu w edytorze, aby rozpocząć nagrywanie. Caiioo dokona transkrypcji Twoich słów i wstawi je do pola wiadomości.
Wybierz sposób transkrypcji:
| Opcja | Typ | Prywatność | Konfiguracja |
|---|---|---|---|
| Whisper (Przeglądarka) | Lokalny | W pełni prywatny | FREE, działa na Twoim urządzeniu |
| WhisperKit (iOS) | Lokalny | W pełni prywatny | FREE, na urządzeniu |
| whisper.cpp & Moonshine (Android) | Lokalny | W pełni prywatny | FREE, na urządzeniu |
| Mowa przeglądarki | Lokalny | Prywatny | FREE, wbudowany |
| ElevenLabs Scribe | Chmura | Dokładny (świetny dla języków innych niż ang.) | Dodaj swój klucz API ElevenLabs |
| Cartesia Ink | Chmura | Dokładny, niskie opóźnienia | Dodaj swój klucz API Cartesia |
Opcje lokalne (Whisper, WhisperKit, whisper.cpp, Moonshine, Mowa przeglądarki) przechowują dźwięk lokalnie — nic nie jest wysyłane na serwer. ElevenLabs i Cartesia wysyłają dźwięk na swoje serwery w celu transkrypcji (używając Twojego klucza API) i oferują wyższą dokładność, szczególnie dla języka polskiego i innych języków poza angielskim.
Jak używać:
- Kliknij ikonę mikrofonu w edytorze
- Wypowiedz wiadomość
- Zatrzymaj, gdy skończysz
- Transkrypcja pojawi się w polu wiadomości
- Edytuj w razie potrzeby, a następnie wyślij
Pierwsza konfiguracja: Przy pierwszym użyciu modelu mowy na urządzeniu musi on zostać pobrany i przygotowany. Edytor pokazuje postęp („Pobieranie modelu mowy… N%”, następnie „Przygotowywanie”/„Ładowanie”), więc krótka pauza przy pierwszym dotknięciu mikrofonu jest normalna.
Nagrywanie dźwięku i jego dołączanie
Oprócz dyktowania możesz nagrać klip i dołączyć go do wiadomości: otwórz menu + w edytorze i wybierz Nagraj dźwięk. Dostępne na iPhone'ach, iPadach, systemie macOS oraz w rozszerzeniu przeglądarki. Naturalnie współgra z aplikacjami nasłuchującymi nagrań, takimi jak trener wymowy „for Languages”.
Pozwól modelowi usłyszeć Twoje nagranie
Funkcje te wykraczają poza transkrypcję i pozwalają modelowi zdolnemu do słuchania pracować z rzeczywistym dźwiękiem:
- Dołącz dźwięk dla modelu (Ustawienia > Głos): dołącza Twoje nagranie, aby model obsługujący dźwięk (np. Gemini) mógł przeanalizować prawdziwe nagranie obok Twojego promptu – ton, wymowę, dźwięki w tle, a nie tylko słowa. Domyślnie wyłączone; w przeciwnym razie nic nie jest wysyłane. Przycisk fali dźwiękowej obok mikrofonu włącza tę opcję dla każdej wiadomości, ale pojawia się on tylko w trybach i aplikacjach, które ją obsługują (takich jak „for Languages”), dzięki czemu nie zagraca edytora przy codziennych zadaniach.
- Słuchanie (bezpłatne narzędzie, domyślnie włączone): pozwala asystentowi wrócić i ponowne odsłuchać dowolny załącznik audio z ukierunkowanym pytaniem uzupełniającym – „które słowa zostały źle wymawiane?”, „jaki jest ton głosu?” – w turze, w której go dołączasz, lub w każdej kolejnej. Dedykowany pomocniczy model audio zajmuje się nasłuchiwaniem, więc działa to nawet wtedy, gdy model czatu nie potrafi słyszeć.
Dyktowanie systemowe (macOS)
Subskrybenci Pro na macOS mogą również zainstalować PrivateVoice, osobną aplikację towarzyszącą, która dodaje globalny skrót klawiszowy „naciśnij i mów” do dyktowania w dowolnej aplikacji — nie tylko w Caiioo. Zobacz stronę pobierania wersji desktopowej po szczegóły.
Zobacz także
- Prywatność i dane — Jak przetwarzane są dane głosowe
- Platforma i konfiguracja — Dostępność aplikacji desktopowej i PrivateVoice
- Ustawienia > Głos — Skonfiguruj opcje głosowe dla swojej konfiguracji
This guide is maintained by the Caiioo team using Slate, our built-in editor.