Niniejszy dokument jest automatycznym tłumaczeniem oryginału w języku angielskim. W przypadku jakichkolwiek rozbieżności między tym tłumaczeniem a oryginalną wersją angielską, wersja angielska jest rozstrzygająca. Przeczytaj oryginał w języku angielskim


Głos: Mów i słuchaj

Chcesz, aby AI czytała odpowiedzi na głos? A może wolisz dyktować wiadomości zamiast pisać? Caiioo oferuje wejście i wyjście głosowe — wszystko konfigurowalne, niektóre opcje działają lokalnie na Twoim urządzeniu.

Ustawienia głosu z opcjami wejścia i wyjścia, przełącznikiem automatycznego czytania i prędkością odtwarzania

Wyjście głosowe (Text-to-Speech)

Pozwól sztucznej inteligencji czytać jej odpowiedzi na głos. Wybierz spośród:

Opcja Typ Jakość Konfiguracja
Domyślna przeglądarka Lokalna Podstawowa Darmowa, bez konfiguracji
Kokoro Neural TTS Lokalna Wysoka Darmowa, działa na Twoim urządzeniu
Google Gemini Chmura Naturalna Dodaj swój klucz API
OpenAI (gpt-4o-mini-tts) Chmura Naturalna, sterowana intonacja Dodaj swój klucz API OpenAI
ElevenLabs Chmura Premium Dodaj swój klucz API
Cartesia (Sonic 3.5) Chmura Premium Dodaj swój klucz API
Resemble.ai Chmura Doskonała (klonowanie głosu) Dodaj swój klucz API

Rozmiar pobierania Kokoro: Model Kokoro jest dostarczany w dwóch wariantach, a to, który z nich zostanie pobrany, zależy od Twojej platformy. Systemy macOS i iOS ładują mniejszy model kwantowany do INT8 (~88 MB), podczas gdy rozszerzenie/przeglądarka korzysta z większej, pełnoprecyzyjnej kompilacji WebGPU (~330 MB). Jest to jednorazowe pobieranie.

Uwagi dotyczące platform:

  • Natywne Kokoro dla iOS (v0.9.720+): Działa w procesie hosta iOS za pośrednictwem OnnxRuntime zamiast WebView, co naprawia awarie na iPhone 13/14.
  • Kokoro dla macOS: Strumieniuje zdanie po zdaniu (w ciągu ~1 sekundy od naciśnięcia odtwarzania) za pośrednictwem pomocniczego procesu komputerowego.
  • Gemini TTS (v0.9.723+): Odtwarza zdanie po zdaniu, dzięki czemu dźwięk rozpoczyna się po pierwszym zdaniu zamiast czekać na syntezę całej odpowiedzi.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts ze sterowaną intonacją — poproś o akcent, ton lub tempo w języku naturalnym (np. „przeczytaj to z ciepłym irlandzkim akcentem”), a głos się do tego dostosuje. Używa tego samego klucza API OpenAI co dostawca LLM OpenAI. Pole Instrukcje stylu głosu w Ustawienia > Głos stosuje Twoją dyrektywę stylu do każdej wypowiadanej odpowiedzi.
  • Cartesia (v0.9.723+): Jeden klucz API obsługuje zarówno Sonic 3.5 (wyjście), jak i Ink (wejście). Brak domyślnego głosu — wybierz jeden w Ustawienia > Głos przed jego włączeniem.

Opóźnienie (Latencja): Gemini i OpenAI renderują całą odpowiedź przed rozpoczęciem odtwarzania, więc pierwszy dźwięk może mieć kilkusekundowe opóźnienie przy dłuższych odpowiedziach — Ustawienia > Głos wyświetlają informację, gdy wybierzesz jedno z nich. Aby uzyskać mniejsze opóźnienie mowy, wybierz ElevenLabs, Cartesia lub Resemble.

Prędkość odtwarzania: Suwak prędkości (0,5×–2,0×) jest stosowany przez dostawcę dla ElevenLabs (ograniczonego do 0,7–1,2×) oraz Cartesia (ograniczonego do 0,6–1,5×). Głosy przeglądarki i Kokoro przyspieszają lokalnie. Gemini i OpenAI nie posiadają własnej kontroli prędkości, więc suwak jest ukryty, gdy są wybrane; Resemble.ai stosuje prędkość przy standardowym odtwarzaniu (bez strumieniowania).

Aby włączyć:

  1. Przejdź do Ustawienia > Głos
  2. Wybierz opcję zamiany tekstu na mowę
  3. Włącz opcję „Automatyczne czytanie odpowiedzi”, jeśli chcesz, aby AI czytało automatycznie
  4. Dostosuj prędkość odtwarzania, jeśli chcesz

Jeśli odtwarzanie się nie powiedzie: Błędy głosu pojawiają się teraz jako powiadomienie (toast) zamiast cichego niepowodzenia — dzięki temu brakujący lub nieprawidłowy klucz API bądź głos niekompatybilny z wybranym modelem (co jest częste w przypadku Resemble.ai i Cartesia) poinformuje Cię dokładnie, co należy naprawić.

Lokalne a chmura: Głosy przeglądarki i Kokoro nigdy nie wysyłają niczego poza Twoje urządzenie. Gemini, OpenAI, ElevenLabs, Cartesia i Resemble.ai wysyłają tekst na swoje serwery (używając Twoich kluczy API), aby wygenerować dźwięk. Zobacz Prywatność i dane, aby uzyskać szczegóły.

Koszty głosu (TTS + STT) są sumowane jako voice_cost dla konwersacji, pasując do ścieżki jednorazowej.

Wejście głosowe (Speech-to-Text)

Dyktuj wiadomości zamiast pisać. Kliknij ikonę mikrofonu w edytorze, aby rozpocząć nagrywanie. Caiioo dokona transkrypcji Twoich słów i wstawi je do pola wiadomości.

Wybierz sposób transkrypcji:

Opcja Typ Prywatność Konfiguracja
Whisper (Przeglądarka) Lokalny W pełni prywatny FREE, działa na Twoim urządzeniu
WhisperKit (iOS) Lokalny W pełni prywatny FREE, na urządzeniu
whisper.cpp & Moonshine (Android) Lokalny W pełni prywatny FREE, na urządzeniu
Mowa przeglądarki Lokalny Prywatny FREE, wbudowany
ElevenLabs Scribe Chmura Dokładny (świetny dla języków innych niż ang.) Dodaj swój klucz API ElevenLabs
Cartesia Ink Chmura Dokładny, niskie opóźnienia Dodaj swój klucz API Cartesia

Opcje lokalne (Whisper, WhisperKit, whisper.cpp, Moonshine, Mowa przeglądarki) przechowują dźwięk lokalnie — nic nie jest wysyłane na serwer. ElevenLabs i Cartesia wysyłają dźwięk na swoje serwery w celu transkrypcji (używając Twojego klucza API) i oferują wyższą dokładność, szczególnie dla języka polskiego i innych języków poza angielskim.

Jak używać:

  1. Kliknij ikonę mikrofonu w edytorze
  2. Wypowiedz wiadomość
  3. Zatrzymaj, gdy skończysz
  4. Transkrypcja pojawi się w polu wiadomości
  5. Edytuj w razie potrzeby, a następnie wyślij

Pierwsza konfiguracja: Przy pierwszym użyciu modelu mowy na urządzeniu musi on zostać pobrany i przygotowany. Edytor pokazuje postęp („Pobieranie modelu mowy… N%”, następnie „Przygotowywanie”/„Ładowanie”), więc krótka pauza przy pierwszym dotknięciu mikrofonu jest normalna.

Nagrywanie dźwięku i jego dołączanie

Oprócz dyktowania możesz nagrać klip i dołączyć go do wiadomości: otwórz menu + w edytorze i wybierz Nagraj dźwięk. Dostępne na iPhone'ach, iPadach, systemie macOS oraz w rozszerzeniu przeglądarki. Naturalnie współgra z aplikacjami nasłuchującymi nagrań, takimi jak trener wymowy „for Languages”.

Pozwól modelowi usłyszeć Twoje nagranie

Funkcje te wykraczają poza transkrypcję i pozwalają modelowi zdolnemu do słuchania pracować z rzeczywistym dźwiękiem:

  • Dołącz dźwięk dla modelu (Ustawienia > Głos): dołącza Twoje nagranie, aby model obsługujący dźwięk (np. Gemini) mógł przeanalizować prawdziwe nagranie obok Twojego promptu – ton, wymowę, dźwięki w tle, a nie tylko słowa. Domyślnie wyłączone; w przeciwnym razie nic nie jest wysyłane. Przycisk fali dźwiękowej obok mikrofonu włącza tę opcję dla każdej wiadomości, ale pojawia się on tylko w trybach i aplikacjach, które ją obsługują (takich jak „for Languages”), dzięki czemu nie zagraca edytora przy codziennych zadaniach.
  • Słuchanie (bezpłatne narzędzie, domyślnie włączone): pozwala asystentowi wrócić i ponowne odsłuchać dowolny załącznik audio z ukierunkowanym pytaniem uzupełniającym – „które słowa zostały źle wymawiane?”, „jaki jest ton głosu?” – w turze, w której go dołączasz, lub w każdej kolejnej. Dedykowany pomocniczy model audio zajmuje się nasłuchiwaniem, więc działa to nawet wtedy, gdy model czatu nie potrafi słyszeć.

Dyktowanie systemowe (macOS)

Subskrybenci Pro na macOS mogą również zainstalować PrivateVoice, osobną aplikację towarzyszącą, która dodaje globalny skrót klawiszowy „naciśnij i mów” do dyktowania w dowolnej aplikacji — nie tylko w Caiioo. Zobacz stronę pobierania wersji desktopowej po szczegóły.

Zobacz także


This guide is maintained by the Caiioo team using Slate, our built-in editor.