DeepFloodbeta

Qwen3-LiveTranslate 发布:视、听、说全模态同传大模型

image

Qwen3-LiveTranslate-Flash 是一款基于大语言模型的高精度、高响应、高鲁棒性的多语言实时音视频同传模型。依托Qwen3-Omni强大的基座能力、海量多模态数据、百万小时音视频数据,Qwen3-LiveTranslate-Flash 实现了覆盖18种语言的离线和实时两种音视频翻译能力。

核心亮点:
多语言和方言:支持中文、英文、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语、印尼语、泰语、越南语、阿拉伯语、印地语、希腊语、土耳其语等主要官方语言和普通话、粤语、北京话、吴话、四川话、天津话的方言翻译。
视觉增强:首次引入视觉上下文增强技术,让 Qwen3-LiveTranslate-Flash 不仅“听得懂”,还能“看得懂”,通过识别和利用口型、动作、文字、实体等多模态信息,有效应对嘈杂音频环境以及一词多译词场景下的翻译不准问题。
3秒延迟:轻量的混合专家架构与动态采样策略实现最低3秒延迟的同传体验。
无损同传:采用语义单元预测技术缓解跨语言翻译的调序问题,实现与离线翻译几乎无损的翻译质量。
音色自然:海量语音数据训练,可以根据原始语音内容自适应调节语气和表现力的拟人音色。

技术信息:https://qwen.ai/blog?id=4266edf7f3718f2d3fda098b3f4c48f3573215d0&from=home.latest-research-list


总结:模型暂未开源,当前只能走百炼平台调用,Qwen3-LiveTranslate 模型基于 Qwen3-Omni 基座,效果从技术博客的演示来看确实很不错。

  • 有用

  • 通义千问的模型产品线还是很全的

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13137位用户

🎉欢迎新用户🎉