본 문서는 영어 원본을 기계 번역한 것입니다. 번역본과 영어 원본 사이에 내용이 상충할 경우 영어 원본이 우선합니다. 영어 원본 보기
음성: 말하기 및 듣기
AI가 응답을 소리 내어 읽어주기를 원하시나요? 아니면 타이핑 대신 메시지를 말로 입력하고 싶으신가요? Caiioo는 음성 입력 및 출력을 제공하며, 모든 설정이 가능하고 일부는 기기에서 로컬로 실행됩니다.

Voice Output (Text-to-Speech)
AI가 응답을 소리 내어 읽어줍니다. 다음 옵션 중에서 선택하세요:
| 옵션 | 유형 | 품질 | 설정 |
|---|---|---|---|
| Browser Default | 로컬 | 기본 | 무료, 설정 필요 없음 |
| Kokoro Neural TTS | 로컬 | 높음 | 무료, 기기에서 실행 |
| Google Gemini | 클라우드 | 자연스러움 | API 키 추가 |
| OpenAI (gpt-4o-mini-tts) | 클라우드 | 자연스러움, 제어 가능한 전달 | OpenAI API 키 추가 |
| ElevenLabs | 클라우드 | 프리미엄 | API 키 추가 |
| Cartesia (Sonic 3.5) | 클라우드 | 프리미엄 | API 키 추가 |
| Resemble.ai | 클라우드 | 우수함 (음성 복제) | API 키 추가 |
Kokoro 다운로드 크기: Kokoro 모델은 두 가지 버전으로 제공되며, 플랫폼에 따라 다운로드되는 버전이 다릅니다. macOS와 iOS는 더 작은 INT8 양자화 모델(~88 MB)을 로드하고, 확장 프로그램/브라우저는 더 큰 정밀도의 WebGPU 빌드(~330 MB)를 사용합니다. 일회성 다운로드입니다.
플랫폼 참고 사항:
- iOS native Kokoro (v0.9.720+): WebView 대신 OnnxRuntime을 통해 iOS 호스트 프로세스에서 실행되어 iPhone 13/14 충돌 문제를 해결합니다.
- macOS Kokoro: 데스크톱 도우미 프로세스를 통해 문장 단위로 스트리밍합니다(재생 누르고 ~1초 이내).
- Gemini TTS (v0.9.723+): 문장 단위로 재생되므로, 전체 답변이 합성될 때까지 기다리는 대신 첫 번째 문장부터 오디오가 시작됩니다.
- OpenAI (v0.9.724+): 제어 가능한 전달 기능을 갖춘 gpt-4o-mini-tts — 자연어(예: "따뜻한 아일랜드 억양으로 읽어줘")로 악센트, 톤, 속도를 요청하면 음성이 이에 따릅니다. OpenAI LLM 제공자와 동일한 OpenAI API 키를 사용합니다. 설정(Settings) > AI 설정(AI Setup) > 음성(Voice)의 음성 스타일 지시(Voice style instructions) 필드에 스타일 지시를 입력하면 모든 음성 응답에 적용됩니다.
- Cartesia (v0.9.723+): 하나의 API 키로 Sonic 3.5(출력)와 Ink(입력)를 모두 구동합니다. 기본 음성이 없으므로 활성화하기 전에 설정(Settings) > AI 설정(AI Setup) > 음성(Voice)에서 음성을 선택하세요.
- ElevenLabs: 모든 ElevenLabs 음성은 음성 선택기에서 선택할 수 있는 표현력 있는 v3를 포함하여, 말할 내용이 생기는 즉시 말하기를 시작합니다. 기본 음성 모델은 Flash v2.5입니다. ElevenLabs는 이 모델의 품질이 이전 기본값과 동등하다고 평가하며, 비용은 문자당 절반 수준입니다.
- ElevenLabs v3 Conversational (v0.9.777+): 음성 모델 목록에서 v3 Conversational 모델을 선택하여 70개 이상의 언어에서 표현력이 풍부하고 지연 시간이 짧은 대화를 나누세요. ElevenLabs는 현재 표준 문자당 요금의 절반으로 과금하고 있으며, Caiioo의 비용 견적에도 이는 반영되어 있습니다.
지연 시간: Gemini와 OpenAI는 재생이 시작되기 전에 전체 답변을 렌더링하므로, 긴 답변의 경우 첫 오디오가 몇 초 정도 지연될 수 있습니다 — 이 중 하나를 선택하면 설정(Settings) > AI 설정(AI Setup) > 음성(Voice)에 관련 안내가 표시됩니다. 지연 시간이 짧은 음성을 원하시면 ElevenLabs, Cartesia 또는 Resemble.ai를 선택하세요.
재생 속도: 속도 슬라이더(0.5×–2.0×)는 ElevenLabs(0.7–1.2×로 제한)와 Cartesia(0.6–1.5×로 제한)의 경우 제공자에 의해 적용됩니다. 브라우저 음성과 Kokoro는 로컬에서 속도가 조절됩니다. Gemini와 OpenAI는 자체 속도 제어 기능이 없으므로 선택 시 슬라이더가 숨겨집니다. Resemble.ai는 표준(비스트리밍) 재생 시 속도를 적용합니다. 한 가지 예외로, ElevenLabs v3 모델(v3 및 v3 Conversational)은 자체적으로 속도를 변경할 수 없으므로, Caiioo가 재생 중에 속도를 적용하여 음높이를 자연스럽게 유지합니다. 단점은 슬라이더가 기본값에서 벗어난 경우 말하기 시작하기 전에 전체 클립을 기다린다는 점입니다. 일반 속도에서는 여전히 바로 시작됩니다.
Caiioo가 상황에 맞는 음성을 선택할 수 있습니다: 소리 내어 읽기가 작업의 일부일 때, AI는 전역 음성 설정을 항상 사용하는 대신 뉴스 요약과 취침 전 동화에 각각 다른 음성을 사용하는 등 콘텐츠에 어울리는 음성, 발화 속도 및 음성 모델을 선택할 수 있습니다. 그 외의 모든 기능에는 사용자의 기본 설정이 유지됩니다.
활성화 방법:
- 설정(Settings) > AI 설정(AI Setup) > 음성(Voice)으로 이동합니다.
- 텍스트 음성 변환(TTS) 옵션을 선택합니다.
- AI가 자동으로 읽도록 하려면 "응답 자동 읽기(Auto-read responses)"를 켭니다.
- 원하는 경우 재생 속도를 조절합니다.
재생 실패 시: 이제 음성 오류가 조용히 실패하는 대신 토스트 메시지로 표시되므로, 누락되었거나 잘못된 API 키 또는 선택한 모델과 호환되지 않는 음성(Resemble.ai 및 Cartesia에서 흔히 발생)이 있을 때 무엇을 수정해야 하는지 정확히 알 수 있습니다.
로컬 대 클라우드: 브라우저 음성과 Kokoro는 기기 외부로 어떠한 데이터도 전송하지 않습니다. Gemini, OpenAI, ElevenLabs, Cartesia, Resemble.ai는 오디오 생성을 위해 (사용자의 API 키를 사용하여) 서버로 텍스트를 전송합니다. 자세한 내용은 개인정보 보호 및 데이터를 참조하세요.
음성 비용(TTS + STT)은 원샷 경로와 마찬가지로 대화에 voice_cost로 집계됩니다.
음성 입력 (Speech-to-Text)
타이핑 대신 메시지를 받아쓰게 하세요. 작성기의 마이크 아이콘을 클릭하여 녹음을 시작하세요. Caiioo가 말소리를 텍스트로 변환하여 메시지 필드에 입력합니다.
변환 방식을 선택하세요:
| 옵션 | 유형 | 개인정보 보호 | 설정 |
|---|---|---|---|
| Whisper (브라우저) | 로컬 | 완전 비공개 | FREE, 기기에서 실행 |
| WhisperKit (iOS) | 로컬 | 완전 비공개 | FREE, 기기 내 실행 |
| whisper.cpp & Moonshine (Android) | 로컬 | 완전 비공개 | FREE, 기기 내 실행 |
| 브라우저 음성 | 로컬 | 비공개 | FREE, 내장 기능 |
| ElevenLabs Scribe | 클라우드 | 정확함 (비영어권 우수) | ElevenLabs API 키 추가 필요 |
| Cartesia Ink | 클라우드 | 정확함, 낮은 지연 시간 | Cartesia API 키 추가 필요 |
로컬 옵션(Whisper, WhisperKit, whisper.cpp, Moonshine, 브라우저 음성)은 오디오를 로컬에 유지하며 서버로 전송하지 않습니다. ElevenLabs와 Cartesia는 텍스트 변환을 위해 오디오를 서버로 전송하며(사용자 API 키 사용), 특히 한국어 등 비영어권 언어에서 더 높은 정확도를 제공합니다.
사용 방법:
- 작성기의 마이크 아이콘을 클릭합니다.
- 메시지를 말합니다.
- 완료되면 중지합니다.
- 변환된 텍스트가 메시지 필드에 나타납니다.
- 필요한 경우 편집 후 전송합니다.
최초 설정: 기기 내 음성 모델을 처음 사용할 때는 모델을 다운로드하고 준비해야 합니다. 작성기에 진행 상황("음성 모델 다운로드 중… N%", 이후 "준비 중"/"로딩 중")이 표시되므로, 첫 마이크 탭 시 잠시 멈추는 것은 오류가 아닌 정상적인 과정입니다.
오디오 녹음 및 첨부
받아쓰기 외에도 클립을 녹음하여 메시지에 첨부할 수 있습니다. 입력창의 + 메뉴를 열고 오디오 녹음을 선택하세요. iPhone, iPad, macOS 및 브라우저 확장 프로그램에서 사용할 수 있습니다. "언어 학습용(for Languages)" 발음 코칭처럼 녹음 내용을 청취하는 앱과 자연스럽게 페어링됩니다.
모델이 녹음 내용을 듣도록 설정
받아쓰기를 넘어 들을 수 있는 모델이 실제 오디오를 처리할 수 있도록 하는 두 가지 기능이 있습니다:
- 모델에 오디오 포함 (설정 > AI 설정 > 음성): 녹음 내용을 첨부하여 음성 인식 모델(예: Gemini)이 단순한 텍스트뿐만 아니라 톤, 발음, 배경 소리 등 프롬프트와 함께 실제 오디오를 검토할 수 있도록 합니다. 기본값은 꺼져 있음; 그렇지 않으면 전송되지 않습니다. 마이크 옆의 파형 버튼을 사용하여 메시지별로 토글할 수 있지만, 이 버튼은 일상적인 작업 시 컴포저가 복잡해지지 않도록 해당 기능을 지원하는 모드 및 앱("언어 학습용" 등)에만 표시됩니다.
- 청취(Hearing) (기본적으로 켜져 있는 무료 도구): 어시스턴트가 첨부한 턴이나 그 이후의 턴에서 "어떤 단어가 잘못 발음되었나요?", "목소리 톤이 어때요?"와 같은 타겟팅된 후속 질문과 함께 오디오 첨부 파일을 다시 듣고 확인할 수 있도록 합니다. 전용 오디오 도우미 모델이 청취를 수행하므로 채팅 모델이 음성을 들을 수 없는 경우에도 작동합니다.
시스템 전체 받아쓰기 (데스크톱)
Caiioo뿐만 아니라 컴퓨터의 모든 애플리케이션에서 받아쓰기를 사용할 수 있습니다:
Pro 구독자는 macOS, Windows, Linux 데스크톱 앱에 내장된 시스템 전체 받아쓰기 기능을 별도의 컴패니언 앱 설치 없이 이용할 수 있습니다. 어디서나 받아쓰기 단축키를 누르고 말하면, 현재 활성화된 앱에 그대로 입력됩니다.
참고 항목
- 프라이버시 및 데이터 — 음성 데이터 처리 방식
- 플랫폼 및 설정 — 데스크톱 앱 가용성
- 설정 > AI 설정 > 음성 — 설정에 맞는 음성 옵션 구성
This guide is maintained by the Caiioo team using Slate, our built-in editor.