نموذج Qwen الجديد للترجمة الفورية
ويستمع النموذج إلى الكلام المنطوق، مع إمكانية تزويده بإطارات فيديو اختيارية، ثم ينتج النص المترجم والصوت المقابل في الوقت نفسه تقريبًا، دون الحاجة إلى انتظار انتهاء المتحدث من حديثه.
وبحسب تقرير نشره موقع MarkTechPost، يعتمد النموذج على بنية جديدة تحمل اسم Interleave، أسهمت في خفض متوسط زمن الاستجابة من 2.8 ثانية إلى 2.3 ثانية، بتراجع يقارب 18%.
كما أدخلت تحسينات على دقة الترجمة وسلاستها واختصارها، فيما يتوفر النموذج حاليًا من خلال واجهة برمجية مستضافة على منصتي Alibaba Cloud Model Studio وQwenCloud.
محادثات متعددة بلا ارتباك
يقدم النموذج 3 قدرات رئيسية جديدة، من بينها التعرف على المتحدثين في الوقت الفعلي أثناء المحادثات التي تضم عدة أشخاص، مع الحفاظ على صوت كل متحدث بصورة أكثر ثباتًا من خلال تقنية استنساخ الصوت.
كما يوفر عرضًا ثنائي اللغة بالتزامن، بحيث يظهر النص الأصلي إلى جانب ترجمته في الوقت نفسه، إلى جانب قدرة محسنة على التعامل مع السياقات الطويلة وإزالة الالتباس، بما يساعد على الحفاظ على اتساق أسماء الأشخاص والمصطلحات التي تظهر في بداية الاجتماعات عند ورودها مرة أخرى خلال الترجمة.
60 لغة ودعم صوتي
يدعم Qwen3.8-LiveTranslate فهم 60 لغة، بينما يوفر الإخراج الصوتي والنصي لـ29 لغة، في حين تقتصر اللغات الـ31 الأخرى على الترجمة النصية فقط.
وتشمل اللغات المدعومة صوتيًا ونصيًا العربية والصينية والإنجليزية والألمانية والفرنسية والإسبانية واليابانية والكورية والهندية، إلى جانب لغات أخرى.
تكلفة تبدأ من 7.5 دولارات
تبدأ الأسعار المعلنة في سنغافورة من 7.5 دولارات لكل مليون رمز صوتي مدخل، بينما تبلغ تكلفة الرموز الصوتية المخرجة 30 دولارًا لكل مليون رمز.
وبحسب الأسعار المعلنة، تعادل تكلفة معالجة ساعة كاملة من الكلام، دخولًا وخروجًا، نحو 1.54 دولار.