본 문서는 영어 원본을 기계 번역한 것입니다. 번역본과 영어 원본 사이에 내용이 상충할 경우 영어 원본이 우선합니다. 영어 원본 보기
음성: 말하기 및 듣기
AI가 응답을 소리 내어 읽어주기를 원하시나요? 아니면 타이핑 대신 메시지를 말로 입력하고 싶으신가요? Caiioo는 음성 입력 및 출력을 제공하며, 모든 설정이 가능하고 일부는 기기에서 로컬로 실행됩니다.

음성 출력 (Text-to-Speech)
AI가 응답을 소리 내어 읽도록 설정합니다. 다음 옵션 중에서 선택하세요:
| 옵션 | 유형 | 품질 | 설정 |
|---|---|---|---|
| 브라우저 기본 (Browser Default) | 로컬 | 기본 | 무료, 설정 필요 없음 |
| Kokoro Neural TTS | 로컬 | 높음 | 무료, 기기에서 실행 |
| Google Gemini | 클라우드 | 자연스러움 | API 키 추가 |
| OpenAI (gpt-4o-mini-tts) | 클라우드 | 자연스러움, 제어 가능한 전달력 | OpenAI API 키 추가 |
| ElevenLabs | 클라우드 | 프리미엄 | API 키 추가 |
| Cartesia (Sonic 3.5) | 클라우드 | 프리미엄 | API 키 추가 |
| Resemble.ai | 클라우드 | 우수함 (음성 복제) | API 키 추가 |
Kokoro 다운로드 크기: Kokoro 모델은 두 가지 버전으로 제공되며, 플랫폼에 따라 다운로드되는 버전이 다릅니다. macOS 및 iOS는 더 작은 INT8 양자화 모델(~88 MB)을 로드하고, 확장 프로그램/브라우저는 더 큰 전체 정밀도 WebGPU 빌드(~330 MB)를 사용합니다. 일회성 다운로드입니다.
플랫폼 참고 사항:
- iOS 네이티브 Kokoro (v0.9.720+): WebView 대신 OnnxRuntime을 통해 iOS 호스트 프로세스에서 실행되어 iPhone 13/14 크래시 문제를 해결합니다.
- macOS Kokoro: 데스크톱 도우미 프로세스를 통해 문장 단위로 스트리밍합니다(재생 버튼을 누른 후 약 1초 이내).
- Gemini TTS (v0.9.723+): 문장 단위로 재생되므로 전체 답변이 합성될 때까지 기다리지 않고 첫 번째 문장부터 오디오가 시작됩니다.
- OpenAI (v0.9.724+): 제어 가능한 전달력을 갖춘 gpt-4o-mini-tts — 자연어(예: "따뜻한 아일랜드 억양으로 읽어줘")로 억양, 톤, 속도를 요청하면 목소리가 이를 반영합니다. OpenAI LLM 제공자와 동일한 OpenAI API 키를 사용합니다. 설정 > 음성(Settings > Voice)의 음성 스타일 지침(Voice style instructions) 필드에 입력한 스타일 지시사항이 모든 음성 응답에 적용됩니다.
- Cartesia (v0.9.723+): 하나의 API 키로 Sonic 3.5(출력)와 Ink(입력)를 모두 구동합니다. 기본 음성이 없으므로 활성화하기 전에 설정 > 음성(Settings > Voice)에서 음성을 선택하세요.
지연 시간: Gemini와 OpenAI는 재생이 시작되기 전에 전체 답변을 렌더링하므로, 답변이 길어지면 첫 번째 오디오 재생이 몇 초 정도 지연될 수 있습니다. 둘 중 하나를 선택하면 설정 > 음성(Settings > Voice)에 관련 안내가 표시됩니다. 지연 시간이 짧은 음성이 필요하다면 ElevenLabs, Cartesia 또는 Resemble을 선택하세요.
재생 속도: 속도 슬라이더(0.5×–2.0×)는 ElevenLabs(0.7–1.2×로 제한) 및 Cartesia(0.6–1.5×로 제한)에서 제공자에 의해 적용됩니다. 브라우저 음성과 Kokoro는 로컬에서 속도가 조절됩니다. Gemini와 OpenAI는 자체 속도 제어 기능이 없으므로 선택 시 슬라이더가 숨겨집니다. Resemble.ai는 표준(비스트리밍) 재생 시 속도를 적용합니다.
활성화 방법:
- 설정 > 음성(Settings > Voice)으로 이동합니다.
- 텍스트 음성 변환 옵션을 선택합니다.
- AI가 자동으로 읽게 하려면 "응답 자동 읽기(Auto-read responses)"를 토글합니다.
- 원하는 경우 재생 속도를 조절합니다.
재생 실패 시: 이제 음성 오류가 조용히 실패하는 대신 토스트 메시지로 표시되므로, 누락되었거나 유효하지 않은 API 키 또는 선택한 모델과 호환되지 않는 음성(Resemble.ai 및 Cartesia에서 흔히 발생)의 경우 정확히 무엇을 수정해야 하는지 확인할 수 있습니다.
로컬 대 클라우드: 브라우저 음성과 Kokoro는 기기 외부로 어떠한 데이터도 전송하지 않습니다. Gemini, OpenAI, ElevenLabs, Cartesia 및 Resemble.ai는 오디오 생성을 위해(사용자의 API 키를 사용하여) 서버로 텍스트를 전송합니다. 자세한 내용은 개인정보 보호 및 데이터(Privacy & Data)를 참조하세요.
음성 비용 (TTS + STT)은 단발성(one-shot) 경로와 일치하여 대화의 voice_cost로 합산됩니다.
음성 입력 (Speech-to-Text)
타이핑 대신 메시지를 받아쓰게 하세요. 작성기의 마이크 아이콘을 클릭하여 녹음을 시작하세요. Caiioo가 말소리를 텍스트로 변환하여 메시지 필드에 입력합니다.
변환 방식을 선택하세요:
| 옵션 | 유형 | 개인정보 보호 | 설정 |
|---|---|---|---|
| Whisper (브라우저) | 로컬 | 완전 비공개 | FREE, 기기에서 실행 |
| WhisperKit (iOS) | 로컬 | 완전 비공개 | FREE, 기기 내 실행 |
| whisper.cpp & Moonshine (Android) | 로컬 | 완전 비공개 | FREE, 기기 내 실행 |
| 브라우저 음성 | 로컬 | 비공개 | FREE, 내장 기능 |
| ElevenLabs Scribe | 클라우드 | 정확함 (비영어권 우수) | ElevenLabs API 키 추가 필요 |
| Cartesia Ink | 클라우드 | 정확함, 낮은 지연 시간 | Cartesia API 키 추가 필요 |
로컬 옵션(Whisper, WhisperKit, whisper.cpp, Moonshine, 브라우저 음성)은 오디오를 로컬에 유지하며 서버로 전송하지 않습니다. ElevenLabs와 Cartesia는 텍스트 변환을 위해 오디오를 서버로 전송하며(사용자 API 키 사용), 특히 한국어 등 비영어권 언어에서 더 높은 정확도를 제공합니다.
사용 방법:
- 작성기의 마이크 아이콘을 클릭합니다.
- 메시지를 말합니다.
- 완료되면 중지합니다.
- 변환된 텍스트가 메시지 필드에 나타납니다.
- 필요한 경우 편집 후 전송합니다.
최초 설정: 기기 내 음성 모델을 처음 사용할 때는 모델을 다운로드하고 준비해야 합니다. 작성기에 진행 상황("음성 모델 다운로드 중… N%", 이후 "준비 중"/"로딩 중")이 표시되므로, 첫 마이크 탭 시 잠시 멈추는 것은 오류가 아닌 정상적인 과정입니다.
오디오 녹음 및 첨부
받아쓰기 외에도 클립을 녹음하여 메시지에 첨부할 수 있습니다. 입력창의 + 메뉴를 열고 오디오 녹음을 선택하세요. iPhone, iPad, macOS 및 브라우저 확장 프로그램에서 사용할 수 있습니다. "언어 학습용(for Languages)" 발음 코칭처럼 녹음 내용을 청취하는 앱과 자연스럽게 페어링됩니다.
모델이 녹음 내용을 직접 듣도록 설정
텍스트 변환을 넘어 청취 가능한 모델이 실제 오디오를 직접 다룰 수 있도록 하는 두 가지 기능이 있습니다:
- 모델에 오디오 포함 (설정 > 음성): 오디오 지원 모델(예: Gemini)이 프롬프트와 함께 실제 오디오(말투, 발음, 배경 소음 등 단순한 텍스트 이상의 요소)를 검토할 수 있도록 녹음 내용을 첨부합니다. 기본적으로 꺼져 있으며, 그렇지 않은 경우 아무것도 전송되지 않습니다. 마이크 옆의 파형 버튼을 통해 메시지별로 토글할 수 있지만, 이 버튼은 해당 기능을 지원하는 모드 및 앱(예: "언어 학습용")에서만 나타나므로 일상적인 작업 시 입력창이 복잡해지지 않습니다.
- 청취 (Hearing) (무료 도구, 기본 활성화): 어시스턴트가 첨부한 턴 또는 이후의 모든 턴에서 대상 후속 질문("어떤 단어의 발음이 틀렸나요?", "목소리의 톤이 어때요?")과 함께 오디오 첨부 파일을 다시 듣고 확인할 수 있도록 합니다. 전용 오디오 도우미 모델이 청취를 담당하므로 채팅 모델이 오디오를 직접 듣지 못하는 경우에도 작동합니다.
시스템 전역 받아쓰기 (macOS)
macOS의 Pro 구독자는 Caiioo뿐만 아니라 모든 애플리케이션에서 받아쓰기를 할 수 있는 글로벌 푸시 투 토크(press-to-talk) 단축키를 추가하는 별도의 동반 앱인 PrivateVoice를 설치할 수 있습니다. 자세한 내용은 데스크톱 다운로드 페이지를 참조하세요.
관련 항목
- 개인정보 및 데이터 — 음성 데이터 처리 방식
- 플랫폼 및 설정 — 데스크톱 앱 및 PrivateVoice 사용 가능 여부
- 설정 > 음성 — 환경에 맞는 음성 옵션 구성
This guide is maintained by the Caiioo team using Slate, our built-in editor.