أعلنت شركة Google DeepMind عن تطوير نموذج متقدم للترجمة من لغة الإشارة إلى النص، يمثل نقلة نوعية في جودة وشمولية تقنيات الذكاء الاصطناعي الموجهة لمجتمعات الصم وضعاف السمع حول العالم. وتتيح هذه التقنية الجديدة للمستخدمين التواصل عبر الإشارة في أي مكان يتطلب الكتابة عادة، مثل تصفح الويب، وتحرير الرسائل، والتفاعل مع المساعد الذكي Gemini.
تعتمد هذه التقنية على معالجة معقدة تفوق التحويل البسيط للكلمات، نظراً لأن لغات الإشارة تتميز بقواعد وقواميس مستقلة وتتطلب تتبعاً دقيقاً للحركات الجسدية المتزامنة لليدين والرأس والوجه. وقد تم تدريب النموذج على أكثر من مئة ألف ساعة من البيانات تشمل أكثر من خمسين لغة إشارة، بالاعتماد على نهج يجمع بين التنوع اللغوي والتعاون الوثيق مع مجتمع الصم.
ولحماية خصوصية المستخدمين، يعتمد النظام على تقنية MediaPipe للتعرف على النقاط الهيكلية للجسم وتحويلها إلى إحداثيات هندسية بدلاً من نقل مقاطع الفيديو الحية، مما يسمح بحذف التسجيلات المرئية فوراً. ويتجاوز النموذج الوسائط التقليدية عبر الترجمة المباشرة للنص، محققاً نتائج قياسية في معايير الجودة الأكاديمية مثل اختبار FLEURS-ASL.
تضمن تطوير هذا النظام مشاركة واسعة من الخبراء وممثلي مجتمع الصم من خلال تأسيس لجنة استشارية خاصة لتوجيه النشر المسؤول للتقنية وتقييم آثارها. وتتوفر ميزة الإشارة إلى النص حالياً بشكل افتراضي في لوحة المفاتيح Gboard وتطبيق Live Transcribe على أجهزة Pixel 11، على أن يتم توسيع نطاق دعمها ليشمل أجهزة ولغات إضافية قريباً.