संकेत से लेकर पाठ तक: दीपमण्ड मॉडल संकेत भाषाओं को पहचानने के लिए स्मार्टफोन सिखाता है

20 अगस्त 202617 बार देखा गया

पहली बार के लिए SL2T विकास deaf और hard-of-hearing उपयोगकर्ताओं को सीधे ऐप में इशारों के साथ संवाद करने की क्षमता देता है: शब्द मैनुअल टेक्स्ट इनपुट के बजाय स्क्रीन पर दिखाई देते हैं। मॉडल को पचास से अधिक साइन भाषाओं से डेटा पर प्रशिक्षित किया गया था और पहले से ही पिक्सेल 11 पर काम करता है जबकि गोपनीयता बनाए रखने के लिए - केवल मोशन निर्देशांक सर्वर पर भेजे जाते हैं, वीडियो नहीं।.

संकेत से लेकर पाठ तक: दीपमण्ड मॉडल संकेत भाषाओं को पहचानने के लिए स्मार्टफोन सिखाता है

नया क्या है

दुनिया में 200 से अधिक साइन भाषाएं हैं, और लगभग 70 मिलियन डीफ और हार्ड-ऑफ-हेयरिंग लोगों के लिए, वे संचार के प्राथमिक साधन के रूप में काम करते हैं। हाल तक, आर्टिफिशियल इंटेलिजेंस का उपयोग रोजमर्रा के उत्पादों में इन भाषाओं का अनुवाद करने के लिए किया गया था। Google DeepMind ने इसे ठीक करने का फैसला किया: नया SL2T (sign-language-to-text) मॉडल पाठ में भाषा का अनुवाद करता है और पहले से ही परिचित ऐप्स में एकीकृत किया जा रहा है।

उपयोगकर्ता कीबोर्ड पर टाइप करने के बजाय इशारों के साथ "डिकेट" करने में सक्षम होंगे। सुविधा बाहर रोलिंग है Gboard में और पिक्सेल 11 स्मार्टफोन पर लाइव ट्रांसक्रिप्ट कैप्शन ऐप - पहली जोड़ी अमेरिकी साइन भाषा (एएसएल) और अंग्रेजी होगी। बाद में अधिक भाषाओं और उपकरणों का वादा किया जाता है।

इसका क्या मतलब है? आप वेब को इशारों के साथ खोज सकते हैं, संदेश या दस्तावेज़ों की रचना कर सकते हैं, और यहां तक कि बात कर सकते हैं। Gemini सहायक लाइव ट्रांसक्रिप्ट में, आप टेक्स्ट चैट पर स्विच किए बिना बातचीत के बीच में सही संकेतों के साथ जवाब देने में सक्षम होंगे। परीक्षकों के अनुसार, इस तरह का संचार अंग्रेजी में टाइपिंग की तुलना में तेज़ और अधिक प्राकृतिक है। बहरा समुदाय के लिए, यह सिर्फ सुविधा से अधिक है: साइन भाषा सांस्कृतिक पहचान की नींव है, और डिजिटल दुनिया में इसका उपयोग करने में सक्षम होने का मतलब एक बड़ा सौदा है।

क्यों यह कठिन है

साइन भाषाएं "हाथ पर अंग्रेजी" नहीं हैं - वे अपने स्वयं के व्याकरण और शब्दावली के साथ स्वतंत्र प्राकृतिक भाषाएं हैं। यही कारण है कि साइन-टू-टेक्स्ट अनुवाद को प्रत्येक इशारे को एक-एक करके एक शब्द से मिलान करने के लिए कम नहीं किया जा सकता है। अर्थ को एक साथ हाथ, शरीर और सिर के आंदोलनों के साथ चेहरे की अभिव्यक्ति के माध्यम से व्यक्त किया जाता है, और मॉडल को वास्तविक समय में उच्च सटीकता के साथ सभी को ट्रैक करना पड़ता है।

प्रारंभिक प्रयास जैसे "भाषा दस्ताने" मौलिक रूप से सीमित थे क्योंकि वे साधारण शब्दों के लिए एक कोड के रूप में संकेत का इलाज करते थे। रियल मशीन अनुवाद के लिए भाषा की संरचना को समझने की आवश्यकता होती है, जिसमें स्थानिक निर्माण और गैर-मैनुअल मार्कर शामिल हैं। आधुनिक मॉडल बड़े डेटासेट से सीखते हैं: SL2T ने 50 से अधिक साइन भाषाओं में 100,000 घंटे से अधिक वीडियो का उपयोग किया, जिसमें लगभग ASL को समर्पित एक चौथाई शामिल था। विभिन्न भाषाओं और बोलियों में संयुक्त प्रशिक्षण प्रत्येक भाषा के लिए अलग-अलग मॉडलों की तुलना में सामान्य पैटर्न और बेहतर परिणाम प्राप्त करने में मदद करता है।

अनुवाद कैसे काम करता है

वीडियो स्ट्रीम को संसाधित करने के बजाय, मॉडल एक कॉम्पैक्ट प्रतिनिधित्व का उपयोग करता है: यह कुंजी बॉडी पॉइंट के निर्देशांक को ट्रैक करता है और पाठ में निर्देशांक का अनुक्रम बदल जाता है। यह एक बार में दो समस्याओं को हल करता है - यह कम्प्यूटेशनल लोड को कम करता है और गोपनीयता की रक्षा करता है। मूल वीडियो को तुरंत हटा दिया जाता है और अनुवाद के लिए सर्वर को केवल ज्यामितीय निर्देशांक भेजे जाते हैं। पॉइंट ट्रैकिंग को अंतर्निहित MediaPipe holistic मॉडल द्वारा नियंत्रित किया जाता है।

अनुवाद सीधे होता है, बिना मध्यवर्ती एनोटेशन (ग्लॉस)। यह दृष्टिकोण गैर-मैनुअल मार्करों और स्थानिक निर्माण जैसे पहलुओं को व्यक्त करना संभव बनाता है, और कृत्रिम शब्दावली बाधाओं से बचा जाता है। डेटा वॉल्यूम के साथ गुणवत्ता पैमाने, जैसा कि बेंचमार्क पुष्टि करते हैं: FLEURS-ASL (sd-test) परीक्षण पर, मॉडल को पिछले सभी प्रणालियों से आगे 70 BLEURT का शून्य-शॉट स्कोर प्राप्त होता है।

व्यावहारिक सुधार भी। डेवलपर्स ने स्ट्रीमिंग विलंबता को कम कर दिया, मॉडल को गैर-हैंडेड उपयोगकर्ताओं (उनमें से लगभग 10%) के लिए जिम्मेदार गैर-हैंडेड इनपुट पर नहीं होने के लिए पढ़ाया, और एक-हैंडेड साइनिंग की बेहतर पहचान जब दूसरी ओर एक स्मार्टफोन पकड़ रहा है।

गोपनीयता और भविष्य

यह पहली बार है जब साइन भाषाओं के लिए AI बाहर निकल गया है प्रयोगशाला और बड़े पैमाने पर उपभोक्ता उत्पादों में। SL2T प्रौद्योगिकी पहले से ही कुछ उपकरणों पर उपलब्ध है, और अधिक भाषाओं और प्लेटफार्मों की उम्मीद सड़क पर है। बहरेपन और हार्ड-ऑफ-हेयरिंग समुदाय के लिए, यह पूर्ण डिजिटल समावेश का मार्ग खुलता है: अब आप एक साधारण स्मार्टफोन का उपयोग करके अपनी मूल भाषा में स्वतंत्र रूप से संवाद कर सकते हैं।

इस तरह के सिस्टम का भविष्य चिह्न और बोली जाने वाली भाषाओं के बीच अधिक प्राकृतिक और तेजी से बातचीत में निहित है। मॉडल की अगली पीढ़ी न केवल व्यक्तिगत वाक्यांशों का अनुवाद करने में सक्षम होगी बल्कि पूर्ण बातचीत को बनाए रखने के लिए, भावना और शैली की बारीकियों को संरक्षित करने में सक्षम होगी। और यह सिर्फ प्रौद्योगिकी नहीं बदलेगा, लेकिन लाखों लोगों की रोजमर्रा की जिंदगी।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
Deepmind से SL2T - पाठ में साइन भाषा ट्रांसलेट करना