Skip to main content
Speech-to-text

Speech-to-text models

Choose a model for live captions, file transcription, and more.

Migrate from closed-source models

Replacing Whisper, Deepgram, or Google speech recognition? Use these QwenCloud equivalents.
Use caseClosed-source examplesQwenCloud recommendation
Real-time recognitionDeepgram Nova-3, Google Chirp 3qwen-audio-3.0-asr-flash-streaming
Offline / file transcriptionOpenAI gpt-4o-transcribe, Whisperqwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash
This page walks you through model selection: start with "Decision dimensions" (real-time/offline, domain terminology, speaker diarization, emotion recognition) to identify your scenario; check "Recommended models" for top picks; expand "All models" for full version lists; and verify input constraints in "Audio specifications". Supported languages (including dialects) are listed within each model family under "All models".

Decision dimensions

Use these 4 dimensions to narrow your choice. Each recommends the best-fit model.

Real-time or offline?

Real-time means outputting recognition results while the user is still speaking. Offline means transcribing after the recording ends.
  • Real-time (streaming recognition) — Uses a WebSocket connection to stream audio in and text out. Ideal for live captions, voice assistants, and meeting transcription. Recommended model: qwen-audio-3.0-asr-flash-streaming (hot words, prompt context, multilingual with dialects).
  • Offline (file transcription) — Uses an HTTP API to submit audio files and retrieve transcription results. Suited for call center recordings, podcasts, and interviews. Recommended model: qwen-audio-3.0-asr-flash-filetrans (hot words, prompt context, speaker diarization).
Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, and the Fun-ASR and Qwen-ASR real-time models support the DashScope SDK (Java, Python). All other models require direct WebSocket or HTTP API calls. Qwen-Audio-3.0-ASR-Flash-Streaming and Fun-ASR-Realtime series models also support the AOQ protocol. For client-side integration that prioritizes stable latency, resilience on weak networks, and built-in full-duplex noise suppression and echo cancellation, AOQ is recommended. For a protocol comparison, see Realtime API overview. For real-time integration, see Real-time speech recognition. For offline integration, see Audio file transcription.

Handling domain terminology

Two approaches, ranked by flexibility:
  1. Prompt context injection — Describe your domain in the system prompt. No setup required -- the model adapts per request. Recommended: the Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, and Qwen-Audio-3.0-ASR-Flash series.
  2. Hot words — Supply a weighted vocabulary list. Recommended: the Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, and Qwen-Audio-3.0-ASR-Flash series.

Speaker diarization

The Qwen-Audio-3.0-ASR-Flash-Filetrans series (qwen-audio-3.0-asr-flash-filetrans) and Fun-ASR offline models (fun-asr, fun-asr-mtl) support speaker diarization. To identify who said what, use qwen-audio-3.0-asr-flash-filetrans.

Emotion recognition

Qwen-ASR models detect emotions alongside transcription. Recommended models: qwen3-asr-flash-realtime (real-time) or qwen3-asr-flash-filetrans (offline). The top picks for each scenario. Visit the model gallery for details.
ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
qwen-audio-3.0-asr-flash-streamingReal-timeWebSocketHot words, prompt contextMultilingual with dialectsUnlimited
qwen-audio-3.0-asr-flash-filetransOfflineHTTPHot words, prompt contextMultilingual with dialects12h / 2GB

All models

ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
qwen-audio-3.0-asr-flash-streamingReal-timeWebSocketHot words, prompt contextMultilingual with dialectsUnlimited
Supported languages: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
qwen-audio-3.0-asr-flash-filetransOfflineHTTPHot words, prompt contextMultilingual with dialects12h / 2GB
Supported languages: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
qwen-audio-3.0-asr-flashOfflineHTTPHot words, prompt contextMultilingual with dialects5 min / 2GB
Supported languages: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
fun-asr-realtimeReal-timeWebSocketHot wordsMultilingual with dialectsUnlimited
fun-asr-realtime-2026-02-28Real-timeWebSocketHot wordsChinese, English, JapaneseUnlimited
fun-asr-realtime-2025-11-07Real-timeWebSocketHot wordsMultilingual with dialectsUnlimited
fun-asr-realtime-2025-09-15Real-timeWebSocketHot wordsChinese, EnglishUnlimited
fun-asr-flash-8k-realtimeReal-timeWebSocketHot wordsChineseUnlimited
fun-asr-flash-8k-realtime-2026-01-28Real-timeWebSocketHot wordsChineseUnlimited
fun-asrOfflineHTTPHot wordsMultilingual with dialects12h / 2GB
fun-asr-2025-11-07OfflineHTTPHot wordsMultilingual with dialects12h / 2GB
fun-asr-2025-08-25OfflineHTTPHot wordsChinese, English12h / 2GB
fun-asr-mtlOfflineHTTPHot wordsMultilingual with dialects12h / 2GB
fun-asr-mtl-2025-08-25OfflineHTTPHot wordsMultilingual with dialects12h / 2GB
fun-asr-flash-2026-06-15OfflineHTTPPrompt contextMultilingual with dialects5 min / 2GB
Supported languages (by version):
  • Fun-ASR-Realtime main versions (fun-asr-realtime, fun-asr-realtime-2026-02-28, fun-asr-realtime-2025-11-07): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese
  • fun-asr-realtime-2025-09-15: Chinese (Mandarin), English
  • Fun-ASR-Flash-Realtime(8K) (fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28): Chinese
  • Fun-ASR main versions (fun-asr, fun-asr-2025-11-07): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
  • Fun-ASR-Flash (fun-asr-flash-2026-06-15): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan -- covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
  • fun-asr-2025-08-25: Chinese (Mandarin), English
  • Fun-ASR(MTL) (fun-asr-mtl, fun-asr-mtl-2025-08-25): Chinese (Mandarin, Cantonese), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
ModelModeAPIAccuracy boostEmotionSpeaker diarizationLanguagesMax duration/size
qwen3-asr-flash-realtimeReal-timeWebSocketMultilingual with dialectsUnlimited
qwen3-asr-flash-realtime-2026-02-10Real-timeWebSocketMultilingual with dialectsUnlimited
qwen3-asr-flash-realtime-2025-10-27Real-timeWebSocketMultilingual with dialectsUnlimited
qwen3-asr-flash-filetransOfflineHTTPMultilingual with dialects12h / 2GB
qwen3-asr-flash-filetrans-2025-11-17OfflineHTTPMultilingual with dialects12h / 2GB
qwen3-asr-flashOfflineHTTP (OpenAI compatible)Multilingual with dialects5 min / 10MB
qwen3-asr-flash-2026-02-10OfflineHTTP (OpenAI compatible)Multilingual with dialects5 min / 10MB
qwen3-asr-flash-2025-09-08OfflineHTTP (OpenAI compatible)Multilingual with dialects5 min / 10MB
Supported languages: All Qwen-ASR models (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash and their snapshot versions) support the same language list: Chinese (Mandarin, Sichuanese, Hokkien, Wu, Cantonese), English, Japanese, German, Korean, Russian, French, Portuguese, Arabic, Italian, Spanish, Hindi, Indonesian, Thai, Turkish, Ukrainian, Vietnamese, Czech, Danish, Filipino, Finnish, Icelandic, Malay, Norwegian, Polish, Swedish.
Paraformer is an earlier-generation ASR model family. If your workload allows, migrate to the recommended Fun-ASR or Qwen-ASR models above.
ModelAPIDescription
paraformer-realtime-v2WebSocketReal-time recognition; Chinese, English, Japanese, Korean, German, French, Russian
paraformer-realtime-v1WebSocketReal-time recognition; Chinese, English, Japanese, Korean, German, French, Russian
paraformer-realtime-8k-v2WebSocketReal-time recognition; 8 kHz telephony; Chinese
paraformer-realtime-8k-v1WebSocketReal-time recognition; 8 kHz telephony; Chinese
paraformer-v2HTTPFile transcription with speaker diarization; Chinese, English, Japanese, Korean, German, French, Russian
paraformer-8k-v2HTTPFile transcription; 8 kHz telephony; Chinese
Supported languages (by version):
  • paraformer-realtime-v2, paraformer-v2: Chinese (Mandarin, Cantonese, Wu, Hokkien, Northeastern, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), English, Japanese, Korean, German, French, Russian
  • paraformer-realtime-v1, paraformer-realtime-8k-v2, paraformer-realtime-8k-v1, paraformer-8k-v2: Chinese (Mandarin)

Audio specifications

The tables below summarize audio specs (input method, format, sample rate, size/duration) for real-time and offline modes. For supported languages, see the model family sections under "All models" above.

Real-time

ModelInput methodAudio formatSample rateSize/duration
Qwen-Audio-3.0-ASR-Flash-Streaming (qwen-audio-3.0-asr-flash-streaming)Binary streampcm, wav, mp3, opus, speex, aac, amrAnyUnlimited
Fun-ASR-Realtime (fun-asr-realtime family)Binary streampcm, wav, mp3, opus, speex, aac, amrAnyUnlimited
Fun-ASR-Flash-8K-Realtime (fun-asr-flash-8k-realtime family)Binary streamSame as Fun-ASR-Realtime8 kHzUnlimited
Qwen-ASR-Realtime (qwen3-asr-flash-realtime family)Binary streampcm, opus8 kHz, 16 kHzUnlimited
Paraformer-Realtime (paraformer-realtime-v2/v1, paraformer-realtime-8k-v2/v1)Binary streamSame as Fun-ASR-Realtimeparaformer-realtime-v2 any; paraformer-realtime-v1 16 kHz; paraformer-realtime-8k-* 8 kHzUnlimited
All real-time models require mono input.

Offline

ModelInput methodAudio formatSample rateFile size/duration
Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans)Publicly accessible file URL, 1 per requestaac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmvAny≤2 GB; ≤12 hours (≤2 hours recommended with speaker diarization)
Qwen-Audio-3.0-ASR-Flash (qwen-audio-3.0-asr-flash)URL / Base64, 1 per requestaac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmvAny≤2 GB; ≤5 min
Fun-ASR (fun-asr, fun-asr-mtl family)Publicly accessible file URL, 1 per requestaac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmvAny≤2 GB; ≤12 hours (≤2 hours recommended with speaker diarization)
Fun-ASR-Flash (fun-asr-flash-2026-06-15)URL / Base64, 1 per requestaac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmvAny≤2 GB; ≤5 min
Paraformer (paraformer-v2/v1, paraformer-mtl-v1, paraformer-8k-v2/v1)Same as Fun-ASRSame as Fun-ASRparaformer-v2 any; paraformer-8k-* 8 kHz onlySame as Fun-ASR
Qwen3-ASR-Flash-Filetrans (qwen3-asr-flash-filetrans family)Publicly accessible file URL, 1 per requestaac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmvpcm must be 16 kHz; other formats any (server resamples to 16 kHz)≤2 GB; ≤12 hours
Qwen3-ASR-Flash (qwen3-asr-flash family)URL / Base64 / local file absolute path, 1 per requestaac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmvpcm must be 16 kHz; other formats any (server resamples to 16 kHz)≤10 MB; ≤5 min
Need speech translated to a different language? See Speech-to-Speech models for real-time and file-based translation with LiveTranslate and Qwen-Omni.

Learn more