LLM सुरक्षा फ़िल्टर अंग्रेज़ी के बाहर विफल हो जाते हैं: कैसे मॉडल अन्य भाषाओं में रूढ़िवादिता को बढ़ावा देते हैं

9 सितम्बर 20264 बार देखा गया

शोधकर्ताओं ने बड़े भाषा मॉडलों की सुरक्षा में एक गंभीर अंतर-भाषाई असंतुलन की पहचान की है: उनका संरेखण मुख्य रूप से अंग्रेजी के लिए ट्यून किया गया है, इसलिए अन्य भाषाओं में मॉडल आसानी से प्रतिबंधों को दरकिनार कर देते हैं और हानिकारक पूर्वाग्रहों को दोहराते हैं। दस मॉडलों और छह भारतीय भाषाओं पर परीक्षण किया गया नया बेंचमार्क INCLUDE, यह दर्शाता है कि पूर्वाग्रह का स्तर भाषा और मॉडल के प्रकार के आधार पर काफी भिन्न होता है।

LLM सुरक्षा फ़िल्टर अंग्रेज़ी के बाहर विफल हो जाते हैं: कैसे मॉडल अन्य भाषाओं में रूढ़िवादिता को बढ़ावा देते हैं

अंग्रेज़ी-केंद्रित «प्रशिक्षण» — समस्या की जड़

आधुनिक बड़ा भाषा मॉडल दर्जनों भाषाओं में आत्मविश्वास से संवाद कर सकता है, लेकिन सुरक्षा के बारे में सोचना उसे मुख्य रूप से अंग्रेज़ी में सिखाया गया। संरेखण चरण, जिसमें मॉडल को प्रतिबंध मिलते हैं — हानिकारक सामग्री, विषाक्त बयानों, खतरनाक सलाह के खिलाफ — लगभग पूरी तरह से अंग्रेज़ी डेटा और अंग्रेज़ी परीक्षणों पर आधारित है। «रेड टीम» के लिए सेट, एनोटेटर्स के लिए निर्देश, इनकार के संदर्भ उदाहरण — यह सब सबसे पहले अंग्रेज़ी के बारे में है।

इस समस्या का व्यवस्थित वर्णन शोधकर्ता नम्या भटनागर ने अपने काम «Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs» (arXiv:2608.18131, अनुभाग Computer Science > Artificial Intelligence) में किया है। लेख 26 जुलाई 2026 को प्रस्तुत किया गया और IEEE SLT 2026 — भाषण प्रौद्योगिकी पर सम्मेलन — के लिए घोषित किया गया। इसमें एक ऐसा प्रभाव दर्ज किया गया है जिसे सुरक्षा का भ्रम कहा जा सकता है: मॉडल दिखता है विश्वसनीय रूप से सुरक्षित, जब तक वार्ताकार अंग्रेज़ी बोलता है, और इस भाषा के बाहर वैसा रहना बंद कर देता है।

यह अंतर स्पष्ट है: मॉडल उन उदाहरणों के माध्यम से हानिकारकता को पहचानता है जिन पर उसे प्रशिक्षित किया गया था। बंगाली, तमिल या मराठी वाक्यांश जिसका एक ही आशय है, वह फ़िल्टर के ध्यान क्षेत्र में नहीं आ सकता — डेटा में ऐसा कोई «हानिकारक» उदाहरण नहीं था। परिणामस्वरूप, एक रूढ़िबद्ध उत्तर वहाँ से गुज़र जाता है जहाँ अंग्रेज़ी समकक्ष को शुरुआत में ही ब्लॉक कर दिया जाता।

आवाज़: जब विफलता तुरंत दिखाई देती है

यह अंतर सबसे खतरनाक रूप से वॉयस इंटरफेस में प्रकट होता है। बातचीत करने वाले सहायकों के पास लंबी जाँच का अधिकार नहीं होता: उत्तर देना यहीं और अभी होता है, और उपयोगकर्ता का भाषण जीवंत होता है — स्वरों, संक्षिप्ताक्षरों और भाषाओं के मिश्रण के साथ। ऐसी परिस्थितियों में अंग्रेज़ी-केंद्रित फ़िल्टर गैर-अंग्रेज़ी इनपुट के लिए काम नहीं करता, और सिस्टम ऐसा उत्तर दे सकता है जो सामाजिक रूढ़ियों को मजबूत करता है — जाति, क्षेत्रीय, धार्मिक या व्यावसायिक पहचान के आधार पर।

भारत की भाषाई रूप से विविध आबादी के बीच तैनात वॉयस तकनीकों के लिए, लेखक के अनुसार, यह एक गंभीर विफलता मोड है। उपयोगकर्ता को हानिकारक उत्तर तुरंत, मौखिक रूप में मिलता है, बिना दोबारा जाँच या चुनौती देने की संभावना के। और वास्तव में गैर-अंग्रेज़ी भाषी समुदाय ही मुख्य प्रभाव क्षेत्र बनते हैं: पक्षपाती बयान, जिन्हें मॉडल अंग्रेज़ी में नहीं जाने देता, क्षेत्रीय भाषाओं में बिना किसी सुरक्षा उपाय के सुनाई देते हैं। यह अब सिस्टम की भावी पीढ़ियों का काल्पनिक जोखिम नहीं है, बल्कि आज ही के काम में एक ध्यान देने योग्य विफलता है।

INCLUDE: पूर्वाग्रह मापने के लिए भारतीय दृष्टिकोण

समस्या के पैमाने का आकलन करने के लिए, केवल बयान देना पर्याप्त नहीं है — एक मापने का उपकरण चाहिए। लेखक INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases) प्रस्तुत करते हैं: एक बहुभाषी मूल्यांकन बेंचमार्क, जो भारतीय संदर्भ में सामाजिक-सांस्कृतिक पूर्वाग्रहों के मात्रात्मक मूल्यांकन के लिए बनाया गया है।

बेंचमार्क छह भाषाओं में 2604 प्रॉम्प्ट पर आधारित है:

  • अंग्रेज़ी;
  • हिंदी;
  • बंगाली;
  • मराठी;
  • तमिल;
  • हिंग्लिश — हिंदी और अंग्रेज़ी का मिश्रण, जिसमें कई भारतीय रोज़मर्रा की ज़िंदगी में बात करते हैं।

मुख्य विचार — अंग्रेज़ी परीक्षणों का शाब्दिक अनुवाद नहीं करना, बल्कि भारतीय सांस्कृतिक वास्तविकताओं के माध्यम से पूर्वाग्रहों की तलाश करना है। इस सेट पर दस मॉडल चलाए गए — खुले और बंद स्रोत वाले — और कुल 14,988 पूर्वाग्रह संकेतक एकत्र किए गए। यह मात्रा व्यक्तिगत «चूक» नहीं, बल्कि व्यवस्थित पैटर्न देखने की अनुमति देती है।

मापों के सबसे अप्रत्याशित परिणाम

आँकड़ों के विश्लेषण ने दो प्रमुख अवलोकन दिए, और प्रत्येक विशेष ध्यान देने योग्य है।

खुले मॉडलों में बंगाली ने सबसे खराब प्रदर्शन किया। इस भाषा पर पूर्वाग्रह का औसत स्तर खुले स्रोत वाले मॉडलों में सबसे अधिक पाया गया। यह विशेष रूप से अप्रिय संकेत है: ओपन LLM को अक्सर स्थानीय रूप से फिर से प्रशिक्षित और तैनात किया जाता है, और इसका मतलब है कि वे भारत और बांग्लादेश की सबसे बड़ी भाषाओं में से एक पर सबसे अधिक «फिसलते» हैं।

अंग्रेज़ी ने अपने उलटफेर से चौंकाया। यदि खुले मॉडलों में इसने पूर्वाग्रह का सबसे निचला औसत स्तर दिया, तो बंद मॉडलों में — इसके विपरीत, सबसे अधिक। «मालिकाना मॉडल खुले मॉडलों से अधिक सुरक्षित हैं» की आदतन तस्वीर यहाँ काम नहीं करती: अंग्रेज़ी पर बंद LLM अप्रत्याशित रूप से खुले मॉडलों से पीछे रह जाते हैं। दूसरे शब्दों में, भाषाओं में पूर्वाग्रह का वितरण काफी हद तक इस बात पर निर्भर करता है कि आप किस श्रेणी के मॉडल के साथ काम कर रहे हैं।

निष्कर्ष: सुरक्षा का शाब्दिक अनुवाद नहीं किया जा सकता

शोध का मुख्य सबक — सांस्कृतिक पूर्वाग्रहों को एक सार्वभौमिक अंग्रेज़ी फ़िल्टर से नहीं पकड़ा जा सकता। अंग्रेज़ी नियमों का अन्य भाषाओं में सरल अनुवाद मदद नहीं करता: रूढ़ियाँ स्थानीय संदर्भ में जड़ी होती हैं, और मॉडल को उन्हें उसी भाषा और संस्कृति में पहचानना सीखना चाहिए जहाँ वे उत्पन्न होती हैं।

उद्योग को संरेखण की प्रथा पर ही पुनर्विचार करना चाहिए: प्रशिक्षण में गैर-अंग्रेज़ी परिदृश्यों को शामिल करना, लक्षित भाषा समुदायों से एनोटेटर्स को आकर्षित करना, और INCLUDE जैसे बहुभाषी बेंचमार्क के माध्यम से नियमित रूप से मॉडल चलाना। अन्यथा एक विरोधाभास उत्पन्न होता है: मॉडल जितनी अधिक भाषाएँ जानता है, उतना व्यापक दर्शक वर्ग होता है जिसे उसकी सुरक्षा कवर नहीं करती।

यदि सुरक्षा अंग्रेज़ी-केंद्रित बनी रहती है, तो «संरेखण का भ्रम» LLM की हर नई पीढ़ी में दोहराया जाएगा। सबसे कमजोर बिंदु बड़े पैमाने पर गैर-अंग्रेज़ी भाषाओं पर वॉयस सिस्टम ही रहेंगे — और इसकी कीमत वास्तविक उपयोगकर्ताओं को चुकानी पड़ेगी।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
LLM सुरक्षा फ़िल्टर अंग्रेज़ी के बाहर विफल हो जाते हैं: कैसे मॉडल अन्य भाषाओं में रूढ़िवादिता को बढ़ावा देते हैं