Overview
2026-03-16
Product Introduction
Real-time conversion of voice content to text in real-time audio and video scenarios such as voice calls, video live streaming, and online meetings. Enables scenarios such as 1v1 voice call real-time subtitles and translation, online meeting real-time subtitles and post-meeting summary, global live streaming subtitles, and live streaming room real-time streamer content summary.
Product Advantages
- Latency around 600ms: From user finishing speaking to getting ASR recognition results, it only takes 600ms to quickly obtain recognition results.
- Recognition accuracy improved by 40%+
- Noise reduction capability specifically optimized for speech recognition, removing interference from environmental noise, distant voices, etc. on recognition
- Better AI echo cancellation capability, removing false recognition caused by live streaming room gift sound effects, BGM, other users speaking in voice chat rooms, etc.
- Save 50%+ cost compared to traditional solutions: Only start speech recognition capability when real valid content is included, improving utilization rate and reducing cost
- Support for multiple ASR models, 20+ languages: Tencent, Alibaba Bailian (paraformer, Gummy models), Microsoft, etc., supporting Chinese (Mandarin, Cantonese, dialects, etc.), English, and various minority languages.
Product Features
| Feature Module | Feature | Description |
|---|---|---|
| Recognition Task Dimension | Room Dimension | Recognize and translate all audio and video streams in the RTC room, and output recognition and translation results separately, including roomid, userid, streamid, userdata, and ASR recognition and translation results |
| Stream Dimension | Start recognition or translation task for individual streams in the RTC room, and output recognition and translation results separately. | |
| Recognition Vendor & Model | Tencent Real-Time Speech Recognition | Chinese Mandarin, Cantonese, English, Korean, Japanese, Thai, Indonesian, Vietnamese, Malay, Filipino, Portuguese, Turkish, Arabic, Spanish, Hindi, French, German, Shanghai dialect, Sichuan dialect, Wuhan dialect, Guiyang dialect, Kunming dialect, Xi'an dialect, Zhengzhou dialect, Taiyuan dialect, Lanzhou dialect, Yinchuan dialect, Xining dialect, Nanjing dialect, Hefei dialect, Nanchang dialect, Changsha dialect, Suzhou dialect, Hangzhou dialect, Jinan dialect, Tianjin dialect, Shijiazhuang dialect, Heilongjiang dialect, Jilin dialect, Liaoning dialect. For details, refer to Tencent Cloud - Real-Time Speech Recognition |
| Alibaba Bailian Paraformer Model (Contact Business) | Chinese (Mandarin, Cantonese, Wu dialect, Minnan dialect, Northeast dialect, Gansu dialect, Guizhou dialect, Henan dialect, Hubei dialect, Hunan dialect, Ningxia dialect, Shanxi dialect, Shaanxi dialect, Shandong dialect, Sichuan dialect, Tianjin dialect, Jiangxi dialect, Yunnan dialect, Shanghai dialect), English, Japanese, Korean, German, French, Russian. For details, refer to Alibaba Cloud Bailian Paraformer Real-Time Speech Recognition | |
| Alibaba Bailian Gummy Model (Contact Business) | Chinese, English, Japanese, Korean, French, German, Spanish, Italian, Russian, Cantonese, Portuguese, Indonesian, Arabic, Thai, Hindi, Danish, Urdu, Turkish, Dutch, Malay, Vietnamese. For details, refer to Alibaba Cloud Bailian Gummy Real-Time Speech Recognition | |
| Microsoft (Contact Business) | Higher support and recognition accuracy for English, minority languages, etc. For details, refer to Microsoft Real-Time Speech-to-Text Overview | |
| Translation Vendor & Model | Doubao doubao-seed-translation | ByteDance's self-developed multilingual translation model, supports dozens of language translations, faithful and fluent translations, Chinese-English translation effect approaches Deepseek-R1, multilingual effect surpasses or matches GPT-4o / Gemini-2.5-Pro, adapts to multi-scenario needs. For details, refer to doubao-seed-translation |
| Qwen-MT | Machine translation large model optimized based on Qwen3, supports 92 language translations, with terminology intervention, domain hints, and memory library functions, better translation effect in complex scenarios. For details, refer to Translation Capability Qwen-MT | |
| Task Parameter Control | Speech Recognition Segmentation Configuration | Set the duration of segmentation interval, default is 500ms |
| RTC Room Streaming Subtitle Delivery | Deliver recognition results and translation results to the RTC room in rounds, can be used for subtitle display, etc. |
