본 문서는 영어 원본을 기계 번역한 것입니다. 번역본과 영어 원본 사이에 내용이 상충할 경우 영어 원본이 우선합니다. 영어 원본 보기


음성: 말하기 및 듣기

AI가 응답을 소리 내어 읽어주기를 원하시나요? 아니면 타이핑 대신 메시지를 말로 입력하고 싶으신가요? Caiioo는 음성 입력 및 출력을 제공하며, 모든 설정이 가능하고 일부는 기기에서 로컬로 실행됩니다.

입력 및 출력 옵션, 자동 읽기 토글, 재생 속도가 포함된 음성 설정

음성 출력 (Text-to-Speech)

AI가 응답을 소리 내어 읽도록 설정합니다. 다음 옵션 중에서 선택하세요:

옵션 유형 품질 설정
브라우저 기본 (Browser Default) 로컬 기본 무료, 설정 필요 없음
Kokoro Neural TTS 로컬 높음 무료, 기기에서 실행
Google Gemini 클라우드 자연스러움 API 키 추가
OpenAI (gpt-4o-mini-tts) 클라우드 자연스러움, 제어 가능한 전달력 OpenAI API 키 추가
ElevenLabs 클라우드 프리미엄 API 키 추가
Cartesia (Sonic 3.5) 클라우드 프리미엄 API 키 추가
Resemble.ai 클라우드 우수함 (음성 복제) API 키 추가

Kokoro 다운로드 크기: Kokoro 모델은 두 가지 버전으로 제공되며, 플랫폼에 따라 다운로드되는 버전이 다릅니다. macOS 및 iOS는 더 작은 INT8 양자화 모델(~88 MB)을 로드하고, 확장 프로그램/브라우저는 더 큰 전체 정밀도 WebGPU 빌드(~330 MB)를 사용합니다. 일회성 다운로드입니다.

플랫폼 참고 사항:

  • iOS 네이티브 Kokoro (v0.9.720+): WebView 대신 OnnxRuntime을 통해 iOS 호스트 프로세스에서 실행되어 iPhone 13/14 크래시 문제를 해결합니다.
  • macOS Kokoro: 데스크톱 도우미 프로세스를 통해 문장 단위로 스트리밍합니다(재생 버튼을 누른 후 약 1초 이내).
  • Gemini TTS (v0.9.723+): 문장 단위로 재생되므로 전체 답변이 합성될 때까지 기다리지 않고 첫 번째 문장부터 오디오가 시작됩니다.
  • OpenAI (v0.9.724+): 제어 가능한 전달력을 갖춘 gpt-4o-mini-tts — 자연어(예: "따뜻한 아일랜드 억양으로 읽어줘")로 억양, 톤, 속도를 요청하면 목소리가 이를 반영합니다. OpenAI LLM 제공자와 동일한 OpenAI API 키를 사용합니다. 설정 > 음성(Settings > Voice)의 음성 스타일 지침(Voice style instructions) 필드에 입력한 스타일 지시사항이 모든 음성 응답에 적용됩니다.
  • Cartesia (v0.9.723+): 하나의 API 키로 Sonic 3.5(출력)와 Ink(입력)를 모두 구동합니다. 기본 음성이 없으므로 활성화하기 전에 설정 > 음성(Settings > Voice)에서 음성을 선택하세요.

지연 시간: Gemini와 OpenAI는 재생이 시작되기 전에 전체 답변을 렌더링하므로, 답변이 길어지면 첫 번째 오디오 재생이 몇 초 정도 지연될 수 있습니다. 둘 중 하나를 선택하면 설정 > 음성(Settings > Voice)에 관련 안내가 표시됩니다. 지연 시간이 짧은 음성이 필요하다면 ElevenLabs, Cartesia 또는 Resemble을 선택하세요.

재생 속도: 속도 슬라이더(0.5×–2.0×)는 ElevenLabs(0.7–1.2×로 제한) 및 Cartesia(0.6–1.5×로 제한)에서 제공자에 의해 적용됩니다. 브라우저 음성과 Kokoro는 로컬에서 속도가 조절됩니다. Gemini와 OpenAI는 자체 속도 제어 기능이 없으므로 선택 시 슬라이더가 숨겨집니다. Resemble.ai는 표준(비스트리밍) 재생 시 속도를 적용합니다.

활성화 방법:

  1. 설정 > 음성(Settings > Voice)으로 이동합니다.
  2. 텍스트 음성 변환 옵션을 선택합니다.
  3. AI가 자동으로 읽게 하려면 "응답 자동 읽기(Auto-read responses)"를 토글합니다.
  4. 원하는 경우 재생 속도를 조절합니다.

재생 실패 시: 이제 음성 오류가 조용히 실패하는 대신 토스트 메시지로 표시되므로, 누락되었거나 유효하지 않은 API 키 또는 선택한 모델과 호환되지 않는 음성(Resemble.ai 및 Cartesia에서 흔히 발생)의 경우 정확히 무엇을 수정해야 하는지 확인할 수 있습니다.

로컬 대 클라우드: 브라우저 음성과 Kokoro는 기기 외부로 어떠한 데이터도 전송하지 않습니다. Gemini, OpenAI, ElevenLabs, Cartesia 및 Resemble.ai는 오디오 생성을 위해(사용자의 API 키를 사용하여) 서버로 텍스트를 전송합니다. 자세한 내용은 개인정보 보호 및 데이터(Privacy & Data)를 참조하세요.

음성 비용 (TTS + STT)은 단발성(one-shot) 경로와 일치하여 대화의 voice_cost로 합산됩니다.

음성 입력 (Speech-to-Text)

타이핑 대신 메시지를 받아쓰게 하세요. 작성기의 마이크 아이콘을 클릭하여 녹음을 시작하세요. Caiioo가 말소리를 텍스트로 변환하여 메시지 필드에 입력합니다.

변환 방식을 선택하세요:

옵션 유형 개인정보 보호 설정
Whisper (브라우저) 로컬 완전 비공개 FREE, 기기에서 실행
WhisperKit (iOS) 로컬 완전 비공개 FREE, 기기 내 실행
whisper.cpp & Moonshine (Android) 로컬 완전 비공개 FREE, 기기 내 실행
브라우저 음성 로컬 비공개 FREE, 내장 기능
ElevenLabs Scribe 클라우드 정확함 (비영어권 우수) ElevenLabs API 키 추가 필요
Cartesia Ink 클라우드 정확함, 낮은 지연 시간 Cartesia API 키 추가 필요

로컬 옵션(Whisper, WhisperKit, whisper.cpp, Moonshine, 브라우저 음성)은 오디오를 로컬에 유지하며 서버로 전송하지 않습니다. ElevenLabs와 Cartesia는 텍스트 변환을 위해 오디오를 서버로 전송하며(사용자 API 키 사용), 특히 한국어 등 비영어권 언어에서 더 높은 정확도를 제공합니다.

사용 방법:

  1. 작성기의 마이크 아이콘을 클릭합니다.
  2. 메시지를 말합니다.
  3. 완료되면 중지합니다.
  4. 변환된 텍스트가 메시지 필드에 나타납니다.
  5. 필요한 경우 편집 후 전송합니다.

최초 설정: 기기 내 음성 모델을 처음 사용할 때는 모델을 다운로드하고 준비해야 합니다. 작성기에 진행 상황("음성 모델 다운로드 중… N%", 이후 "준비 중"/"로딩 중")이 표시되므로, 첫 마이크 탭 시 잠시 멈추는 것은 오류가 아닌 정상적인 과정입니다.

오디오 녹음 및 첨부

받아쓰기 외에도 클립을 녹음하여 메시지에 첨부할 수 있습니다. 입력창의 + 메뉴를 열고 오디오 녹음을 선택하세요. iPhone, iPad, macOS 및 브라우저 확장 프로그램에서 사용할 수 있습니다. "언어 학습용(for Languages)" 발음 코칭처럼 녹음 내용을 청취하는 앱과 자연스럽게 페어링됩니다.

모델이 녹음 내용을 직접 듣도록 설정

텍스트 변환을 넘어 청취 가능한 모델이 실제 오디오를 직접 다룰 수 있도록 하는 두 가지 기능이 있습니다:

  • 모델에 오디오 포함 (설정 > 음성): 오디오 지원 모델(예: Gemini)이 프롬프트와 함께 실제 오디오(말투, 발음, 배경 소음 등 단순한 텍스트 이상의 요소)를 검토할 수 있도록 녹음 내용을 첨부합니다. 기본적으로 꺼져 있으며, 그렇지 않은 경우 아무것도 전송되지 않습니다. 마이크 옆의 파형 버튼을 통해 메시지별로 토글할 수 있지만, 이 버튼은 해당 기능을 지원하는 모드 및 앱(예: "언어 학습용")에서만 나타나므로 일상적인 작업 시 입력창이 복잡해지지 않습니다.
  • 청취 (Hearing) (무료 도구, 기본 활성화): 어시스턴트가 첨부한 턴 또는 이후의 모든 턴에서 대상 후속 질문("어떤 단어의 발음이 틀렸나요?", "목소리의 톤이 어때요?")과 함께 오디오 첨부 파일을 다시 듣고 확인할 수 있도록 합니다. 전용 오디오 도우미 모델이 청취를 담당하므로 채팅 모델이 오디오를 직접 듣지 못하는 경우에도 작동합니다.

시스템 전역 받아쓰기 (macOS)

macOS의 Pro 구독자는 Caiioo뿐만 아니라 모든 애플리케이션에서 받아쓰기를 할 수 있는 글로벌 푸시 투 토크(press-to-talk) 단축키를 추가하는 별도의 동반 앱인 PrivateVoice를 설치할 수 있습니다. 자세한 내용은 데스크톱 다운로드 페이지를 참조하세요.

관련 항목


This guide is maintained by the Caiioo team using Slate, our built-in editor.