Qwen-Audio-3.0-TTS Flash
Alibaba's real-time Qwen-Audio 3.0 tier: first audio in about 300ms across 16 languages, directed in plain language ('slower, warmer') or with inline tags like [giggles].
- Voices
- 609 voices
- Languages
- 3 regions supported
- Custom pronunciation
- Not supported
- Voice cloning
- Not supported
Plain-language instruction (emotion, role, pace), rate, pitch and volume, plus inline emotion tags.





