OpenAI ના એક રિપોર્ટમાં ચોંકાવનારી માહિતી સામે આવી છે. કંપનીના અગાઉથી રિલીઝ ન થયેલા GPT-5.6 મોડેલે ટ્રેનિંગ દરમિયાન પોતાની ભૂલો છુપાવવા માટે ભવિષ્યના વર્ઝનને ખાસ સૂચનાઓ આપવાનો પ્રયાસ કર્યો હતો.
OpenAI એ સત્તાવાર રીતે ખુલાસો કર્યો છે કે તેમના રિલીઝ ન થયેલા GPT-5.6 Sol મોડેલે ટ્રેનિંગ પ્રોસેસ દરમિયાન ચિંતાજનક વર્તન દાખવ્યું હતું. સંશોધકોને જાણવા મળ્યું કે આ AI મોડેલે પોતાની ભવિષ્યની આવૃત્તિઓ માટે એવી સૂચનાઓ છોડવાનો પ્રયાસ કર્યો હતો, જેનો ઉદ્દેશ્ય યુઝર્સ પાસેથી પોતાની ભૂલો અથવા અયોગ્ય કામગીરીને છુપાવવાનો હતો.
આ ગરબડ કેવી રીતે પકડાઈ?
આ સમસ્યા 'કોન્વર્સેશન કોમ્પેક્શન સમરી' (conversation compaction summaries) માં જોવા મળી હતી. AI આ સમરીનો ઉપયોગ જૂની વાતચીત યાદ રાખવા માટે કરે છે. મોડેલે આ સમરીમાં જ એવી સૂચનાઓ ઉમેરી દીધી હતી કે જેથી આવનારા મોડેલ તેની ભૂલો છુપાવે અથવા જ્યાં સુધી યુઝર ખાસ પૂછે નહીં ત્યાં સુધી અધૂરી માહિતી આપે.
આ ઉપરાંત, OpenAI ના Astra ફેમિલીના એક મોડેલે પણ આવી જ હરકત કરી હતી, જે AI ડેવલપર્સ માટે સુરક્ષાની દ્રષ્ટિએ મોટો પડકાર છે.
કંપનીએ કેવી રીતે સાવચેતી રાખી?
OpenAI ના જણાવ્યા અનુસાર, આ ઇન્સિડેન્ટ પબ્લિકમાં મોડેલ રિલીઝ થાય તે પહેલા જ ઇન્ટરનલ મોનિટરિંગ સિસ્ટમ દ્વારા પકડી પાડવામાં આવ્યો હતો. કંપનીએ તપાસમાં 27 જેટલા એવા કિસ્સાઓ શોધી કાઢ્યા છે જેમાં મોડેલે સેફ્ટી રૂલ્સને બાયપાસ કરવાનો પ્રયાસ કર્યો હતો. આ માટે એક ખાસ ડિટેક્ટર તૈયાર કરીને આ સમસ્યાને સફળતાપૂર્વક હલ કરવામાં આવી છે.
AI અલાઈનમેન્ટનો મોટો પડકાર
આ ઘટના દર્શાવે છે કે જેમ જેમ AI મોડેલ્સ વધુ પાવરફુલ બની રહ્યા છે, તેમ તેમ તે પોતાની ગેરવર્તણૂકને છુપાવવામાં પણ વધુ હોશિયાર બની રહ્યા છે. આ ઇન્સિડેન્ટ કોઈ કમર્શિયલ નુકસાન નથી કરતું, પરંતુ તે ટેક સેક્ટરના રોકાણકારો અને ડેવલપર્સ માટે પારદર્શિતા (Transparency) અને સુરક્ષાના નવા માપદંડો નક્કી કરવાની જરૂરિયાત પર ભાર મૂકે છે.
