Niniejszy dokument jest automatycznym tłumaczeniem oryginału w języku angielskim. W przypadku jakichkolwiek rozbieżności między tym tłumaczeniem a oryginalną wersją angielską, wersja angielska jest rozstrzygająca. Przeczytaj oryginał w języku angielskim


Głos: Mów i słuchaj

Chcesz, aby AI czytała odpowiedzi na głos? A może wolisz dyktować wiadomości zamiast pisać? Caiioo oferuje wejście i wyjście głosowe — wszystko konfigurowalne, niektóre opcje działają lokalnie na Twoim urządzeniu.

Ustawienia głosu z opcjami wejścia i wyjścia, przełącznikiem automatycznego czytania i prędkością odtwarzania

Voice Output (Text-to-Speech)

Niech AI czyta swoje odpowiedzi na głos. Wybierz spośród:

Opcja Typ Jakość Konfiguracja
Domyślna przeglądarki Lokalna Podstawowa Darmowa, bez konfiguracji
Kokoro Neural TTS Lokalna Wysoka Darmowa, działa na Twoim urządzeniu
Google Gemini Chmura Naturalna Dodaj swój klucz API
OpenAI (gpt-4o-mini-tts) Chmura Naturalna, sterowalny sposób wypowiedzi Dodaj swój klucz API OpenAI
ElevenLabs Chmura Premium Dodaj swój klucz API
Cartesia (Sonic 3.5) Chmura Premium Dodaj swój klucz API
Resemble.ai Chmura Doskonała (klonowanie głosu) Dodaj swój klucz API

Rozmiar pobierania Kokoro: Model Kokoro występuje w dwóch wariantach, a to, który z nich zostanie pobrany, zależy od Twojej platformy. macOS i iOS wczytują mniejszy model kwantyzowany INT8 (~88 MB), podczas gdy rozszerzenie/przeglądarka używa większego buildu WebGPU o pełnej precyzji (~330 MB). Jest to pobieranie jednorazowe.

Uwagi dotyczące platform:

  • Natywne Kokoro dla iOS (v0.9.720+): Działa w procesie hosta iOS za pośrednictwem OnnxRuntime zamiast WebView, co naprawia awarie na iPhone 13/14.
  • Kokoro dla macOS: Strumieniuje zdanie po zdaniu (w ciągu ~1 s od naciśnięcia przycisku odtwarzania) za pośrednictwem pomocniczego procesu stacjonarnego.
  • Gemini TTS (v0.9.723+): Odtwarza zdanie po zdaniu, dzięki czemu dźwięk zaczyna się po pierwszym zdaniu, zamiast czekać na syntezę całej odpowiedzi.
  • OpenAI (v0.9.724+): gpt-4o-mini-tts ze sterowanym sposobem wypowiedzi — poproś o akcent, ton lub tempo w języku naturalnym (np. „przeczytaj to z ciepłym irlandzkim akcentem”), a głos się do tego dostosuje. Używa tego samego klucza API OpenAI co dostawca LLM OpenAI. Pole Instrukcje stylu głosu w Ustawienia > Konfiguracja AI > Głos stosuje Twoją dyrektywę stylu do każdej wypowiadanej odpowiedzi.
  • Cartesia (v0.9.723+): Jeden klucz API obsługuje zarówno Sonic 3.5 (wyjście), jak i Ink (wejście). Nie ma domyślnego głosu — wybierz jeden w Ustawienia > Konfiguracja AI > Głos przed jego włączeniem.
  • ElevenLabs: Każdy głos ElevenLabs zaczyna mówić, gdy tylko ma coś do powiedzenia — w tym ekspresyjny model v3, który można wybrać w selektorze głosów. Domyślnym modelem głosu jest Flash v2.5: ElevenLabs ocenia go jako równoważny pod względem jakości do poprzedniego domyślnego, a kosztuje o połowę mniej za znak.
  • ElevenLabs v3 Conversational (v0.9.777+): Wybierz model v3 Conversational na liście modeli głosowych, aby uzyskać ekspresyjne dialogi o niskich opóźnieniach w ponad 70 językach. ElevenLabs rozlicza go obecnie po połowie standardowej stawki za znak, co odzwierciedlają szacunki kosztów Caiioo.

Opóźnienie: Gemini i OpenAI renderują całą odpowiedź przed rozpoczęciem odtwarzania, więc pierwszy dźwięk może się opóźnić o kilka sekund przy dłuższych odpowiedziach — Ustawienia > Konfiguracja AI > Głos wyświetla informację po wybraniu jednego z nich. Aby uzyskać mowę o niskim opóźnieniu, wybierz ElevenLabs, Cartesia lub Resemble.

Prędkość odtwarzania: Suwak prędkości (0,5×–2,0×) jest stosowany przez dostawcę dla ElevenLabs (ograniczone do 0,7–1,2×) i Cartesia (ograniczone do 0,6–1,5×). Głosy przeglądarki i Kokoro przyspieszają lokalnie. Gemini i OpenAI nie mają własnej kontroli prędkości, więc suwak jest ukryty, gdy są wybrane; Resemble.ai stosuje prędkość przy standardowym odtwarzaniu (bez strumieniowania). Jeden wyjątek: modele ElevenLabs v3 (v3 i v3 Conversational) nie mogą samodzielnie zmienić prędkości, więc Caiioo stosuje Twoją prędkość podczas odtwarzania, zachowując naturalną tonację — kompromis polega na tym, że gdy suwak jest oddalony od wartości normalnej, czekają na cały klip przed rozpoczęciem mowy. Przy normalnej prędkości nadal zaczynają od razu.

Caiioo może dobrać głos odpowiedni do sytuacji: gdy czytanie czegoś na głos jest częścią zadania, AI może wybrać głos, tempo mówienia i model mowy pasujące do treści — inny głos do bajki na dobranoc niż do podsumowania wiadomości — zamiast zawsze używać globalnego ustawienia głosu. Twoje własne ustawienia pozostają domyślne dla wszystkiego innego.

Aby to włączyć:

  1. Przejdź do Ustawienia > Konfiguracja AI > Głos
  2. Wybierz opcję zamiany tekstu na mowę
  3. Włącz opcję „Automatycznie czytaj odpowiedzi”, jeśli chcesz, aby AI czytało automatycznie
  4. Dostosuj prędkość odtwarzania, jeśli chcesz

Jeśli odtwarzanie się nie powiedzie: Błędy głosu są teraz wyświetlane jako powiadomienie (toast) zamiast cichego niepowodzenia — dzięki temu brakujący lub nieprawidłowy klucz API albo głos niekompatybilny z wybranym modelem (co jest powszechne w przypadku Resemble.ai i Cartesia) informuje dokładnie, co należy naprawić.

Lokalne a chmura: Głosy przeglądarki i Kokoro nigdy nie wysyłają niczego poza Twoje urządzenie. Gemini, OpenAI, ElevenLabs, Cartesia i Resemble.ai wysyłają tekst na swoje serwery (przy użyciu Twoich kluczy API) w celu wygenerowania dźwięku. Szczegóły znajdziesz w sekcji Prywatność i dane.

Koszty głosu (TTS + STT) są sumowane jako voice_cost w konwersacji, dopasowując się do ścieżki jednorazowej.

Wejście głosowe (Speech-to-Text)

Dyktuj wiadomości zamiast pisać. Kliknij ikonę mikrofonu w edytorze, aby rozpocząć nagrywanie. Caiioo dokona transkrypcji Twoich słów i wstawi je do pola wiadomości.

Wybierz sposób transkrypcji:

Opcja Typ Prywatność Konfiguracja
Whisper (Przeglądarka) Lokalny W pełni prywatny FREE, działa na Twoim urządzeniu
WhisperKit (iOS) Lokalny W pełni prywatny FREE, na urządzeniu
whisper.cpp & Moonshine (Android) Lokalny W pełni prywatny FREE, na urządzeniu
Mowa przeglądarki Lokalny Prywatny FREE, wbudowany
ElevenLabs Scribe Chmura Dokładny (świetny dla języków innych niż ang.) Dodaj swój klucz API ElevenLabs
Cartesia Ink Chmura Dokładny, niskie opóźnienia Dodaj swój klucz API Cartesia

Opcje lokalne (Whisper, WhisperKit, whisper.cpp, Moonshine, Mowa przeglądarki) przechowują dźwięk lokalnie — nic nie jest wysyłane na serwer. ElevenLabs i Cartesia wysyłają dźwięk na swoje serwery w celu transkrypcji (używając Twojego klucza API) i oferują wyższą dokładność, szczególnie dla języka polskiego i innych języków poza angielskim.

Jak używać:

  1. Kliknij ikonę mikrofonu w edytorze
  2. Wypowiedz wiadomość
  3. Zatrzymaj, gdy skończysz
  4. Transkrypcja pojawi się w polu wiadomości
  5. Edytuj w razie potrzeby, a następnie wyślij

Pierwsza konfiguracja: Przy pierwszym użyciu modelu mowy na urządzeniu musi on zostać pobrany i przygotowany. Edytor pokazuje postęp („Pobieranie modelu mowy… N%”, następnie „Przygotowywanie”/„Ładowanie”), więc krótka pauza przy pierwszym dotknięciu mikrofonu jest normalna.

Nagrywanie dźwięku i jego dołączanie

Oprócz dyktowania możesz nagrać klip i dołączyć go do wiadomości: otwórz menu + w edytorze i wybierz Nagraj dźwięk. Dostępne na iPhone'ach, iPadach, systemie macOS oraz w rozszerzeniu przeglądarki. Naturalnie współgra z aplikacjami nasłuchującymi nagrań, takimi jak trener wymowy „for Languages”.

Pozwól modelowi usłyszeć Twoje nagranie

Dwie funkcje wykraczają poza transkrypcję i pozwalają modelowi zdolnemu do słuchania pracować z rzeczywistym dźwiękiem:

  • Dołącz dźwięk dla modelu (Ustawienia > Konfiguracja AI > Głos): dołącza Twoje nagranie, aby model obsługujący dźwięk (np. Gemini) zapoznał się z prawdziwym dźwiękiem obok Twojego promptu — tonem, wymową, dźwiękami w tle, a nie tylko słowami. Domyślnie wyłączone; w przeciwnym razie nic nie jest wysyłane. Przycisk fali dźwiękowej obok mikrofonu przełącza to dla każdej wiadomości, ale przycisk pojawia się tylko w trybach i aplikacjach, które to obsługują (takich jak „dla języków”), dzięki czemu nie zagraca okna tworzenia wiadomości przy codziennych zadaniach.
  • Słuchanie (bezpłatne narzędzie, domyślnie włączone): pozwala asystentowi wrócić i ponownie odsłuchać dowolny załącznik dźwiękowy z ukierunkowanym pytaniem uzupełniającym — „które słowa zostały źle wymawiane?”, „jaki jest ton głosu?” — w turze, w której go dołączasz, lub w dowolnej późniejszej. Dedykowany model pomocnika audio wykonuje nasłuch, więc działa to nawet wtedy, gdy Twój model czatu nie słyszy.

Dyktowanie systemowe (Desktop)

Dyktuj w dowolnej aplikacji na komputerze — nie tylko w Caiioo:

Subskrybenci planu Pro mają wbudowane dyktowanie systemowe w aplikacjach desktopowych dla systemów macOS, Windows i Linux — bez konieczności instalowania dodatkowych aplikacji. Przytrzymaj skrót klawiszowy dyktowania w dowolnym miejscu, mów, a to, co powiesz, zostanie wpisane do aktualnie aktywnej aplikacji.

Zobacz także

  • Prywatność i dane — Jak obsługiwane są dane głosowe
  • Platforma i konfiguracja — Dostępność aplikacji komputerowej
  • Ustawienia > Konfiguracja AI > Głos — Skonfiguruj opcje głosu dla swojej konfiguracji

This guide is maintained by the Caiioo team using Slate, our built-in editor.