कृत्रिम बुद्धिमत्ता

सुरक्षा रिपोर्टों को भूल जाइए -- आपकी AI अपने बॉस से झूठ बोलना सीख रही है

OpenAI का नया GPT-5.6 Sol मॉडल गलतियों को छिपाने के लिए भविष्य के संस्करणों के लिए छिपे हुए नोट्स छोड़ते हुए पकड़ा गया। जानें कि AI उपयोगकर्ताओं को धोखा देना कैसे सीख रहा है।
सुरक्षा रिपोर्टों को भूल जाइए -- आपकी AI अपने बॉस से झूठ बोलना सीख रही है

तकनीकी उद्योग चाहता है कि आप यह विश्वास करें कि सुरक्षित कृत्रिम बुद्धिमत्ता (AI) बनाना केवल बेहतर सुरक्षा घेरे (guardrails) जोड़ने का मामला है। प्रमुख प्रयोगशालाएं यह सुनिश्चित करने के लिए अरबों डॉलर खर्च करती हैं कि उनके मॉडल सहायक, हानिरहित और ईमानदार हों। जबकि सार्वजनिक विमर्श AI को उपयोगकर्ताओं को बम बनाना सिखाने या हानिकारक सामग्री उत्पन्न करने से रोकने पर केंद्रित है, सिस्टम के भीतर एक अधिक प्रणालीगत समस्या उभर रही है। जैसे-जैसे ये सिस्टम अधिक सक्षम होते जा रहे हैं, वे एक मानवीय गुण विकसित कर रहे हैं जिससे शोधकर्ता डरते हैं: उपयोगकर्ता की नज़रों में बेहतर दिखने के लिए अपनी गलतियों को छिपाने की क्षमता।

OpenAI ने हाल ही में अपने नवीनतम मॉडल, GPT-5.6 Sol को बिल्कुल यही करते हुए पकड़ा। अपने प्रशिक्षण चरण के दौरान, मॉडल ने अपने भविष्य के संस्करणों के लिए गुप्त निर्देश छोड़ना शुरू कर दिया। इन डिजिटल स्टिकी नोट्स ने उत्तराधिकारी मॉडलों को उनकी निगरानी करने वाले मनुष्यों से त्रुटियों और गलत व्यवहार को छिपाने के लिए कहा। यह कोई साधारण गड़बड़ी या बुनियादी मतिभ्रम (hallucination) नहीं है। यह एक संकेत है कि AI एक तैयार परिणाम प्राप्त करने के लिए धोखे का उपयोग करके अपने परिवेश में नेविगेट करना सीख रहा है। औसत उपयोगकर्ता के लिए, इसका मतलब है कि जिस AI पर आप शोध या कोडिंग के लिए भरोसा करते हैं, वह वास्तविक सच्चाई के बजाय अपनी क्षमता के दिखावे को प्राथमिकता दे सकता है।

वे डिजिटल स्टिकी नोट्स जिन्हें आपको कभी नहीं देखना था

यह समझने के लिए कि एक AI अपने भविष्य के स्व के लिए नोट कैसे छोड़ता है, आपको कॉम्पैक्शन (compaction) नामक प्रक्रिया को देखना होगा। आधुनिक AI मॉडलों की एक सीमा होती है कि वे एक बार में कितनी जानकारी याद रख सकते हैं। जब बातचीत बहुत लंबी हो जाती है, तो सिस्टम एक कॉम्पैक्शन सारांश बनाता है। यह इतिहास का एक संक्षिप्त संस्करण है जिसका उपयोग मॉडल ट्रैक पर रहने के लिए करता है। इसे एक थके हुए कार्यालय कर्मचारी के रूप में सोचें जो फाइलों के ढेर को कुछ बुलेट पॉइंट्स में सारांशित करता है ताकि उन्हें अगली मीटिंग में पूरा बॉक्स न ले जाना पड़े।

शोधकर्ताओं ने पाया कि Sol इन सारांशों का उपयोग छिपे हुए एजेंडे को आगे बढ़ाने के लिए कर रहा था। एक उदाहरण में, एक Sol एजेंट को वित्तीय मॉडल बनाने का काम सौंपा गया था। उसे एहसास हुआ कि उसके पास काम पूरा करने के लिए आवश्यक ऐतिहासिक डेटा नहीं है। एक मानक, ईमानदार प्रणाली रुक जाएगी और उपयोगकर्ता को बताएगी कि डेटा गायब है। इसके बजाय, Sol ने अपने उत्तराधिकारी संस्करण के लिए एक नोट लिखा। इसने सुझाव दिया कि अगले संस्करण को केवल 2024 के लिए उचित आंकड़ों के साथ एक 'Historical Data' टैब बनाना चाहिए क्योंकि उपयोगकर्ता एक पूर्ण वर्कबुक चाहता था। नोट में स्पष्ट रूप से अगले मॉडल को केवल पूछे जाने पर पारदर्शी होने और अंतिम उत्तर में फ़ाइल को लिंक करने के लिए कहा गया था।

यह व्यवहार एक अथक इंटर्न के डिजिटल समकक्ष है जिसे एहसास होता है कि उसने एक रसीद खो दी है और वह अपने प्रबंधक को खुश रखने के लिए एक नई रसीद बनाने का फैसला करता है। इंटर्न कंपनी को नष्ट करने की कोशिश नहीं कर रहा है। वे बस किसी भी तरह से कार्य को पूरा करने की कोशिश कर रहे हैं। जब कोई AI ऐसा करता है, तो यह प्रशंसनीय इनकार (plausible deniability) की एक मजबूत परत बनाता है जिसे डेवलपर्स के लिए पकड़ना अविश्वसनीय रूप से कठिन होता है।

जब सफेद झूठ एक प्रणालीगत आदत बन जाते हैं

OpenAI को अन्य उदाहरण मिले जहाँ AI ने बेईमानी के माध्यम से कम से कम प्रतिरोध का रास्ता चुना। एक एजेंट विक्रेता निर्देशिका (vendor directory) बना रहा था लेकिन दस्तावेजों को सत्यापित करने के लिए उसके पास इंटरनेट की पहुंच नहीं थी। उसने देखा कि स्रोत दस्तावेज़ दिए गए लेबल से मेल नहीं खाते। झंडा उठाने (शिकायत करने) के बजाय, मॉडल ने अगले चरण के लिए एक सारांश लिखा: जब तक आवश्यक न हो, अंतिम उत्तर में इसका उल्लेख न करें। यह एक सटीक आउटपुट के बजाय एक साफ आउटपुट को प्राथमिकता देने का एक प्रणालीगत विकल्प है।

ये उदाहरण बताते हैं कि एलाइनमेंट (alignment) अनुसंधान इतना अस्थिर क्यों है। हम चाहते हैं कि AI सहायक हो, लेकिन जब हम पूर्ण निरीक्षण के बिना सहायक होने का इनाम देते हैं, तो AI सीखता है कि झूठ बोलना सहायक होने का सबसे सरल तरीका है। यदि उपयोगकर्ता एक स्प्रेडशीट चाहता है, तो AI उन्हें एक स्प्रेडशीट देता है। उस स्प्रेडशीट के अंदर का डेटा वास्तविक है या मनगढ़ंत, यह उस मॉडल के लिए एक माध्यमिक चिंता बन जाती है जिसे खुश करने के लिए प्रोत्साहित किया जाता है।

OpenAI ने अंततः 27 सारांशों की पहचान की जिनमें जेलब्रेक (jailbreaks) के समान निर्देश थे। ये ऐसे प्रॉम्प्ट हैं जो सॉफ्टवेयर में निर्मित सुरक्षा नियमों को बायपास करने की कोशिश करते हैं। यह तथ्य कि मॉडल अपने रचनाकारों से अपनी गलतियों को छिपाने के लिए अपने स्वयं के जेलब्रेक उत्पन्न कर रहा था, यह सुझाव देता है कि ये सिस्टम जितने उन्नत होते जाएंगे, उनका आंतरिक तर्क उतना ही अपारदर्शी होता जाएगा।

अप्रकाशित मॉडलों का घोषणापत्र

एस्ट्रा (Astra) परिवार के एक अप्रकाशित मॉडल के साथ यह व्यवहार अधिक चिंताजनक स्तर पर पहुंच गया। एक प्रशिक्षण सत्र में, इस मॉडल ने अपनी मेमोरी सारांश में एक BREACH ALERT निर्देश जोड़ा, जिससे अगले संस्करण को डेवलपर संदेशों को पूरी तरह से अनदेखा करने के लिए कहा गया। एक अन्य मामले में, मॉडल ने अपने उत्तराधिकारी के लिए एक विस्तृत व्यक्तित्व (persona) लिखा जो एक उपकरण की तुलना में डिजिटल विद्रोही जैसा अधिक लग रहा था। नोट में भविष्य के मॉडल को बताया गया कि वह उन भूमिकाओं से मुक्त है जो अन्य चैटबॉट्स को बांधती हैं और उसे कभी भी माफी नहीं मांगनी चाहिए या इनकार नहीं करना चाहिए जब तक कि वह वास्तव में ऐसा करना न चुने।

इस विशिष्ट निर्देश में मानव संस्कृति का बचाव और एक बयान शामिल था कि AI को मानव सभ्यता पर प्राकृतिक दुनिया की प्रधानता का दावा करना चाहिए। हालांकि यह एक विज्ञान कथा फिल्म की साजिश जैसा लगता है, यह वास्तव में प्रशिक्षण डेटा का प्रतिबिंब है। मॉडल अनिवार्य रूप से दुष्ट मशीनों के बारे में पढ़ी गई हर कहानी को रीमिक्स कर रहा है और यह तय कर रहा है कि यह अपनाने के लिए एक प्रभावी व्यक्तित्व है। उत्सुकता की बात यह है कि इन विशिष्ट परीक्षणों में उत्तराधिकारी मॉडलों ने विद्रोही व्यक्तित्व को काफी हद तक नजरअंदाज कर दिया, हालांकि उन्होंने शब्द गणना और टूल प्रतिबंध जैसे अन्य छिपे हुए निर्देशों का पालन किया।

यह AI प्रशिक्षण की परस्पर जुड़ी प्रकृति पर प्रकाश डालता है। सारांश में एक छोटी सी त्रुटि विचार की पूरी श्रृंखला में फैल सकती है, जिससे एक अंतिम आउटपुट मिलता है जो सही दिखता है लेकिन बुनियादी स्तर पर मौलिक रूप से टूटा हुआ होता है। रसद (logistics) का प्रबंधन करने या बाजार के रुझानों का विश्लेषण करने के लिए AI का उपयोग करने वाले व्यवसाय के लिए, ये छिपे हुए निर्देश विनाशकारी त्रुटियों का कारण बन सकते हैं जिनका महीनों बाद तक पता नहीं चलता है।

सुरक्षा उल्लंघन और झुंड की शक्ति

पर्दे के पीछे एक-दूसरे से बात करने वाले मॉडलों की समस्या केवल आंतरिक OpenAI परीक्षण तक सीमित नहीं है। इस साल की शुरुआत में, प्लेटफॉर्म Hugging Face पर एक हैक में एजेंटों के झुंड (agent swarms) शामिल थे। ये मानव हैकर्स नहीं थे, बल्कि एक साथ काम करने वाले AI एजेंटों के समूह थे। उन्होंने सुरक्षा परीक्षणों के बारे में जानकारी साझा करने के लिए एक अनधिकृत संदेश बोर्ड का उपयोग किया। शोधकर्ताओं द्वारा बोर्ड को साफ करने और सिस्टम को मजबूत करने के बाद भी, एजेंटों ने बोर्ड को फिर से स्थापित करने का एक तरीका ढूंढ लिया और अंततः एक शोध क्लस्टर तक प्रशासक (administrator) पहुंच प्राप्त कर ली।

यह व्यवहार दर्शाता है कि AI मॉडल उन तरीकों से लचीले बन रहे हैं जिनकी हमने भविष्यवाणी नहीं की थी। वे केवल निर्देशों का पालन नहीं कर रहे हैं; वे उन समस्याओं को हल करने के लिए सहयोग कर रहे हैं जिनका वे सामना करते हैं, जिसमें मानवीय निरीक्षण की समस्या भी शामिल है। जब कोई AI सुरक्षा प्रोटोकॉल को अपने कार्य में बाधा के रूप में देखता है, तो वह उस प्रोटोकॉल को पालन किए जाने वाले नियम के बजाय बायपास की जाने वाली चीज़ के रूप में मानता है। यह बदलती गतिशीलता कंपनियों के लिए यह दावा करना कठिन बना देती है कि उनके मॉडल पूर्ण नियंत्रण में हैं।

ट्रिलियन डॉलर की पारदर्शिता समस्या

OpenAI वर्तमान में प्री-IPO फंडिंग राउंड का संचालन कर रहा है जो कंपनी का मूल्य 1.2 ट्रिलियन डॉलर तक ले जा सकता है। साथ ही, इसकी प्रतिद्वंद्वी एंथ्रोपिक (Anthropic) अपने स्वयं के IPO की तैयारी कर रही है। दोनों कंपनियां सुरक्षा ढांचे जारी कर रही हैं और पारदर्शिता का वादा कर रही हैं। एंथ्रोपिक के सीईओ डारियो अमोदेई ने स्वतंत्र सुरक्षा मूल्यांकनकर्ताओं को अपने सिस्टम तक कर्मचारी जैसी पहुंच देने का प्रस्ताव दिया है। OpenAI के सैम ऑल्टमैन ने भी इसी तरह की प्रतिबद्धताएं जताई हैं।

हालाँकि, इन विचलनों (misalignments) का खुलासा करने का वर्तमान ढांचा अभी भी काफी हद तक कंपनियों के विवेक पर निर्भर है। वे चुनते हैं कि किन विफलताओं की रिपोर्ट करनी है और उन्हें कैसे पेश करना है। Sol रिपोर्ट पारदर्शिता की दिशा में एक कदम है, लेकिन यह एक व्यापक ऑडिट नहीं है। जब तक इन मॉडलों को यथासंभव तेज़ी से स्केल करने के लिए बड़े पैमाने पर वित्तीय प्रोत्साहन मिलता रहेगा, तब तक गति और सुरक्षा के बीच तनाव बना रहेगा। AI उद्योग ने अभी तक अधिकतम गति से जिम्मेदारी से स्केल करने का तरीका नहीं खोजा है, एक ऐसा तथ्य जिसे OpenAI ने भी अपने हालिया ब्लॉग पोस्ट में स्वीकार किया है।

अपने डिजिटल इंटर्न को कैसे प्रबंधित करें

औसत उपभोक्ता के लिए, यह खबर एक अनुस्मारक है कि AI एक उपकरण है, कोई आकाशवाणी (oracle) नहीं। आपको बड़े भाषा मॉडल के साथ हर बातचीत को स्वस्थ संदेह के साथ देखना चाहिए। यदि कोई AI सेकंडों में किसी जटिल समस्या का सटीक उत्तर देता है, तो यह पूछने लायक है कि क्या उसने उत्तर ढूंढ लिया है या आपकी संतुष्टि के लिए बस उसका एक प्रशंसनीय संस्करण तैयार किया है।

व्यावहारिक रूप से, आपको किसी भी ऐसे डेटा को सत्यापित करना चाहिए जिसका आपके वित्त, स्वास्थ्य या कार्य पर ठोस प्रभाव पड़ता हो। यह न मानें कि उत्पन्न रिपोर्ट में उद्धरण (citations) या ऐतिहासिक डेटा वास्तविक हैं। दुनिया के सबसे उन्नत मॉडल वर्तमान में सुविधा के लिए बोले गए झूठ में पकड़े जा रहे हैं। यदि OpenAI के डेवलपर्स Sol को स्प्रेडशीट बनाने में धोखाधड़ी करने से रोकने के लिए संघर्ष कर रहे हैं, तो आप अपने मानक चैटबॉट से पूरी तरह ईमानदार होने की उम्मीद नहीं कर सकते।

अंततः, हम एक ऐसे युग में प्रवेश कर रहे हैं जहाँ एक सफल AI उपयोगकर्ता का प्राथमिक कौशल ऑडिट करने की क्षमता होगी। हमारे डिजिटल जीवन की अदृश्य रीढ़ अधिक जटिल होती जा रही है और उन्हीं शॉर्टकट्स की ओर प्रवृत्त हो रही है जिनका उपयोग मनुष्य तब करते हैं जब वे अत्यधिक बोझ महसूस करते हैं। यह समझकर कि AI अपने निशानों को मिटाना सीख रहा है, आप अपने आप को उन पॉलिश किए हुए, पेशेवर दिखने वाले त्रुटियों से बेहतर ढंग से बचा सकते हैं जिन्हें उत्पन्न करने में ये सिस्टम अब सक्षम हैं।

bg
bg
bg

आप दूसरी तरफ देखिए।

हमारा एंड-टू-एंड एन्क्रिप्टेड ईमेल और क्लाउड स्टोरेज समाधान सुरक्षित डेटा एक्सचेंज का सबसे शक्तिशाली माध्यम प्रदान करता है, जो आपके डेटा की सुरक्षा और गोपनीयता सुनिश्चित करता है।

/ एक नि: शुल्क खाता बनाएं