هل يمكن للترجمة بالذكاء الاصطناعي تحقيق الترجمة الفورية؟ الإجابة هي نعم، لكن بين «إمكان تشغيلها» و«إمكان استخدامها في الأعمال» مجموعة كاملة من المسائل الهندسية. سرعة توليد النموذج ليست سوى حلقة واحدة؛ إذ تتراكم عملية التقاط الصوت، واكتشاف نهاية الكلام، والتعرّف على الكلام، وترجمة النص، وتركيب الكلام، والذهاب والإياب عبر الشبكة، إضافة إلى التخزين المؤقت للتشغيل في الواجهة الأمامية، لتشكّل وقت الانتظار الذي يشعر به المستخدم فعلياً. وبالنسبة لمقيّمي الجوانب التقنية، ينبغي أولاً تحديد السيناريو: هل هو ترجمة نصية لاجتماع، أم مكالمة لخدمة العملاء، أم تفاعل في بث مباشر، أم استشارات فورية في موقع متعدد اللغات؟ تختلف متطلبات التأخير والدقة وتحمل الأخطاء باختلاف السيناريوهات.
تعرض كثير من الحلول أثناء التجربة عبارة مثل «بمجرد الانتهاء من جملة، تظهر الترجمة فوراً»، ما يبدو قريباً من الفورية. لكن القبول التقني لا ينبغي أن يقتصر على زمن استجابة واجهة الترجمة. ففي الترجمة من الكلام إلى الكلام مثلاً، يحتاج النظام أولاً إلى تحديد وقت انتهاء المستخدم من الكلام، وتسمى هذه الخطوة اكتشاف نقطة النهاية؛ فالقطع المبكر يؤدي إلى فقدان كلمات، بينما الانتظار الطويل يبطئ الحوار بوضوح. بعد ذلك، يجب أن يتعامل التعرّف على الكلام مع اللهجات والضوضاء البيئية والمصطلحات المهنية والأرقام؛ وبعد إخراج الترجمة الآلية، وإذا كان المطلوب بثها صوتياً، تمر أيضاً عبر تركيب الكلام والتخزين المؤقت لدى العميل.
لذلك، ينبغي التمييز عند الشراء أو التكامل بين ثلاثة أنواع من التأخير: تأخير أول حرف، أي المدة من بدء المستخدم بالكلام حتى ظهور أول جزء من الترجمة النصية؛ وتأخير الترجمة المستقرة، أي الوقت اللازم حتى لا يتغير المعنى الأساسي في الجملة بشكل جوهري؛ وتأخير الدور، أي الوقت حتى يتمكن الطرف الآخر من سماع ترجمة كاملة ومفهومة. يؤثر النوعان الأولان في إحساس المتابعة الفورية، بينما يحدد الأخير ما إذا كان المتحاورون سيقاطع بعضهم بعضاً باستمرار. إن الاكتفاء بالسؤال عن «كم ملي ثانية يستغرق تأخير الواجهة» لا يقدم عادة إجابة تكفي للحكم على قابلية الاستخدام.
لا توجد في القطاع عتبة موحدة تناسب جميع الأعمال، لكن يمكن وضع معايير قبول داخلية وفقاً لكثافة التفاعل. عموماً، تتمتع المحادثات النصية بأعلى مستوى من التسامح: فحصول المستخدم على ترجمة طبيعية وكاملة خلال بضع ثوانٍ من إرسال الرسالة يكفي غالباً لمعالجة استفسارات الأعمال العابرة للحدود. أما الترجمة النصية للاجتماعات، فتعطي أهمية أكبر للاستمرارية، ويمكن أن تتأخر الترجمة قليلاً عن الكلام الأصلي، لكن لا يجوز أن تتراكم حتى يبدأ المتحدث التالي. وتكون المكالمات الهاتفية ومفاوضات الفيديو والتواصل المباشر في البث أكثر حساسية؛ فبمجرد أن يتراكم التأخير إلى درجة تضطر الطرفين إلى التوقف والانتظار، يتحول إيقاع التواصل سريعاً إلى نمط متقطع من «جملة منك وجملة مني».
عملياً، لا يعني التأخير المنخفض السعي الأعمى إلى مقاطع صوتية أقصر. إذا كانت المقاطع قصيرة جداً، فلن يحصل التعرّف على الكلام على سياق كافٍ، وقد تخطئ الترجمة في معالجة أدوات النفي والكميات والطرازات وفاعل الجملة؛ وإذا كانت طويلة جداً، فقد تصبح الدقة أكثر استقراراً، لكن ذلك يأتي على حساب سلاسة الحوار. في مفاوضات التجارة الخارجية، تكون مخاطر الخطأ في معلومات مثل «غير شامل الضريبة» و«مدة التسليم» و«الحد الأدنى لكمية الطلب» و«درجة المادة» أكبر غالباً من الانتظار لفترة قصيرة إضافية. يجب الموازنة في قابلية الاستخدام بين السرعة واكتمال المعنى.

تعد ظروف الشبكة عاملاً يسهل تجاهله. ففي الأعمال العابرة للحدود، قد يأتي الزوار من أمريكا الشمالية أو أوروبا أو الشرق الأوسط أو جنوب شرق آسيا أو أمريكا اللاتينية؛ وإذا نُشرت تدفقات الصوت وخدمة الترجمة وواجهة الأعمال في مناطق متباعدة، فإن زمن الذهاب والإياب عبر الشبكة سيستهلك مباشرة نتائج التحسين في جانب النموذج. لا ينبغي أن يقتصر التقييم التقني على اختبار الضغط عبر شبكة المكتب، بل ينبغي محاكاة مسارات الوصول في الأسواق المستهدفة وتسجيل الأداء في حالات ضعف الشبكة وفقدان الحزم وتبديل الشبكات.
المشكلة الشائعة الثانية هي «إعادة الصياغة المتكررة» بعد الإخراج المتدفق. تقدم بعض الأنظمة ترجمة مؤقتة أولاً، ثم تراجعها مع اكتمال السياق. بالنسبة للترجمة النصية، يمكن لهذه القدرة تقليل انتظار أول حرف؛ ولكن في تواصل عروض الأسعار مع العملاء، إذا جرى تعديل المبلغ أو التاريخ أو معلمات المنتج تباعاً، فقد لا يتذكر المستخدم سوى النسخة الخاطئة. يتمثل النهج الأكثر نضجاً في الفصل بين النتائج المؤقتة والنتائج المؤكدة في الواجهة ومنطق الأعمال، ووضع تحقق إضافي أو مدخل تأكيد يدوي للأرقام والعملات والطرازات والأسماء الخاصة.
الثالث هو اختلاف أزواج اللغات. عادةً ما يكون من الأسهل الحصول على نتائج مستقرة في مجموعات اللغات الغنية بالموارد مثل الإنجليزية والصينية؛ أما اللغات منخفضة الموارد واللهجات المختلطة والتعبيرات التي تتضمن اختصارات قطاعية، فغالباً ما تحتاج إلى سياق أطول أو تدخل بالمصطلحات. لا تستخدم نتائج عرض توضيحي عامة باللغة الإنجليزية للاستدلال على التجربة الفعلية في أسواق الروسية أو العربية أو اليابانية أو اللغات قليلة الانتشار. ولا سيما في عرض النصوص من اليمين إلى اليسار، وصيغ التعبير الاحترامية، وتنسيقات الوحدات والتواريخ، تحتاج الواجهة الأمامية أيضاً إلى اختبار منفصل.
بالنسبة إلى المواقع متعددة اللغات، تتركز قيمة الترجمة الفورية أساساً في حلقات التفاعل، وليس في استبدال جميع محتويات الصفحات. ينبغي أن تظل صفحات المنتجات وتعريفات العلامة التجارية والمواد التقنية وإيضاحات الامتثال وصفحات الهبوط للحملات طويلة الأجل تعتمد أولاً على محتوى محلي خضع للمراجعة. والسبب بسيط: فهذه الصفحات تؤثر في ثقة المستخدم، كما أنها تحمل فهرسة محركات البحث وجودة الإعلانات ومسار التحويل؛ وحتى إن بدت الترجمة الديناميكية سلسة عند القراءة، فقد لا تعبّر بدقة عن سياق الشراء.
يكون المزيج الأكثر منطقية عادةً كالتالي: تستخدم الصفحات الثابتة نظام إنشاء مواقع متعدد اللغات للحفاظ على المحتوى المنظم، وتستخدم الدردشة عبر الإنترنت والفرز الأولي للنماذج الترجمة الفورية، ويراجع موظفو المبيعات النص الأصلي عند الانتقال إلى نقاط رئيسية مثل عرض الأسعار والعقود وتأكيد المواصفات. تقدم 易营宝 خدمات طويلة الأمد لشركات التجارة الخارجية والمصانع المصنعة وبائعي التجارة الإلكترونية العابرة للحدود ومشروعات توسع العلامات التجارية إلى الأسواق الخارجية، وتغطي خدماتها في إنشاء المواقع السحابية الذكية والمتاجر العابرة للحدود والتسويق الخارجي مواقع الويب الرسمية متعددة اللغات وصفحات هبوط الإعلانات وجذب الزيارات عبر وسائل التواصل الاجتماعي وغيرها من الحلقات. وعند النظر إليها ضمن هذه السلسلة، لا ينبغي نشر الترجمة بالذكاء الاصطناعي بصورة معزولة، بل يجب مراعاة مدى اتساق مصدر العملاء المحتملين ولغة الصفحة واستجابة خدمة العملاء وسجلات CRM وتراكم المحتوى اللاحق.
قبل تقييم الحل، يوصى بإعداد مواد لغوية حقيقية لكنها منزوع عنها أي معلومات حساسة: طرازات المنتجات، والمواد، والأبعاد، وطرق التغليف، والمصطلحات التجارية، ودورات التسليم، وشروط الدفع، وطرق الأسئلة الشائعة لدى العملاء في الأسواق المستهدفة. ينبغي أن يغطي الاختبار، كحد أدنى، الكلام المتواصل والمقاطعات بين عدة أشخاص والضوضاء الخلفية وتقلبات الشبكة وخلط الصينية والإنجليزية. وإذا كان النظام يوفر قائمة مصطلحات أو قاموساً مخصصاً، فيجب أيضاً التحقق مما إذا كان يسري قبل التعرّف، أو أثناء الترجمة، أو يُستخدم فقط للاستبدال النهائي؛ إذ تختلف آثار الحالات الثلاث في الفورية والدقة.
ينبغي أيضاً توضيح ما الذي سيحدث عند الفشل. بعد انتهاء مهلة الواجهة، هل يُعرض النص الأصلي، أم يُطلب إعادة المحاولة، أم تُفقد جملة بصمت؟ وهل تُعلّم النتائج منخفضة الثقة عندما يكون النموذج غير متأكد؟ وهل يلزم الاحتفاظ بصوت المحادثة والنصوص، وكيف تُحدد مواقع الحفظ والصلاحيات وفترات الاحتفاظ؟ قد لا تكون هذه الأسئلة لافتة بقدر سؤال «كم لغة يدعم؟»، لكنها ترتبط مباشرة بمدى إمكانية تشغيل الأعمال العابرة للحدود على المدى الطويل.
لذلك، يمكن للترجمة بالذكاء الاصطناعي بالتأكيد تحقيق الترجمة الفورية، لكن لا توجد إجابة معيارية مستقلة عن طبيعة الأعمال للتأخير «المنخفض إلى حد قابل للاستخدام». يمكن لسيناريوهات خدمة العملاء أن تمنح الدقة وقتاً أطول قليلاً، ويجب أن تتحكم الترجمة النصية للاجتماعات في التأخير التراكمي، بينما يجب أن تضم الترجمة الفورية الشفهية الشبكة والمعالجة المتدفقة وتصميم التفاعل معاً ضمن القبول. إن اختبار السلسلة الكاملة أولاً ثم تحديد النموذج وطريقة النشر يكون عادةً أقرب إلى النتائج الفعلية من التركيز على رقم واحد بالملي ثانية.
مقالات ذات صلة
منتجات ذات صلة