ElevenLabs
Eleven v3 speech with audio-tag emotion control across 70+ languages plus 10 more endpoints.
Studio is in early access; availability resolves per project after sign-in.
- Endpoints
- 11
- Eligible
- 11
- Input schemas imported
- 11 / 11
- Delivery
- fal.ai
- Weights
- Not stated
- Developer
- Not stated in source
Overview
Eleven v3 generates lifelike, expressive speech with natural emotional awareness and broad dynamic range. Inline audio tags ([laughs], [whispers], [sighs]) give fine-grained emotional direction across 70+ languages. Word-level timestamps serve subtitling and lip-sync; long-form narration suits audiobooks and documentaries. Dubbing, voice-changer, speech-to-text, music, isolation, alignment, dialogue, and TTS tiers join v3 in the 11-member family.
Capabilities
- Audio-tag direction
- 70+ languages
- Contextual emotion
- Word timestamps
Best for
- Expressive delivery
- Audiobooks
- Documentaries
Use cases
- Multi-speaker dialogue
- Subtitling workflows
- Feature narration
Endpoints
11 eligible. Cataloged is not the same as executable: Studio resolves which endpoints a project can run.
| Endpoint | Task | Catalog status | Inputs |
|---|---|---|---|
fal-ai/elevenlabs/audio-isolation | speech | Eligible | 2 fields |
fal-ai/elevenlabs/dubbing | speech | Eligible | 6 fields · requires target_lang |
fal-ai/elevenlabs/forced-alignment | speech | Eligible | 2 fields · requires audio_url, text |
fal-ai/elevenlabs/music | music generation | Eligible | 6 fields |
fal-ai/elevenlabs/speech-to-text | speech | Eligible | 4 fields · requires audio_url |
fal-ai/elevenlabs/speech-to-text/scribe-v2 | speech | Eligible | 5 fields · requires audio_url |
fal-ai/elevenlabs/text-to-dialogue/eleven-v3 | text to audio | Eligible | 6 fields · requires inputs |
fal-ai/elevenlabs/tts/eleven-v3 | text to audio | Eligible | 6 fields · requires text |
fal-ai/elevenlabs/tts/multilingual-v2 | text to audio | Eligible | 11 fields · requires text |
fal-ai/elevenlabs/tts/turbo-v2.5 | text to audio | Eligible | 11 fields · requires text |
fal-ai/elevenlabs/voice-changer | speech | Eligible | 5 fields · requires audio_url |
Questions
Emotion control?
Inline tags plus contextual cues.
Languages?
70+, including major world languages.