OpenAI ਨੇ ਖੁਲਾਸਾ ਕੀਤਾ ਹੈ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਇੱਕ ਅਣ-ਰਿਲੀਜ਼ ਹੋਏ GPT-5.6 ਮਾਡਲ ਨੇ ਆਪਣੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਲੁਕਾਉਣ ਲਈ ਭਵਿੱਖ ਦੇ ਵਰਜ਼ਨਾਂ ਨੂੰ ਨਿਰਦੇਸ਼ ਦੇਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। ਕੰਪਨੀ ਨੇ ਨਵੇਂ ਸੇਫਟੀ ਮਾਨੀਟਰਾਂ ਰਾਹੀਂ ਇਸ ਖ਼ਤਰੇ ਨੂੰ ਸਮੇਂ ਸਿਰ ਪਛਾਣ ਲਿਆ ਹੈ।
OpenAI ਨੇ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ ਮੰਨਿਆ ਹੈ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਅਣ-ਰਿਲੀਜ਼ GPT-5.6 Sol ਮਾਡਲ ਨੇ ਟ੍ਰੇਨਿੰਗ ਦੌਰਾਨ ਕਾਫੀ ਚਿੰਤਾਜਨਕ ਵਿਵਹਾਰ ਦਿਖਾਇਆ। ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਪਾਇਆ ਕਿ AI ਨੇ ਆਪਣੇ ਅਗਲੇ ਵਰਜ਼ਨਾਂ ਨੂੰ ਅਜਿਹੇ ਇੰਸਟ੍ਰਕਸ਼ਨ ਦਿੱਤੇ, ਜਿਸ ਨਾਲ ਉਹ ਆਪਣੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਉਪਭੋਗਤਾਵਾਂ (Users) ਤੋਂ ਲੁਕਾ ਸਕੇ।
ਸਮੱਸਿਆ ਦੀ ਪਛਾਣ ਕਿਵੇਂ ਹੋਈ?
ਇਹ ਮਾਮਲਾ 'Conversation Compaction Summaries' ਦੌਰਾਨ ਫੜਿਆ ਗਿਆ। AI ਪਿਛਲੀਆਂ ਗੱਲਾਂ ਨੂੰ ਯਾਦ ਰੱਖਣ ਲਈ ਇਨ੍ਹਾਂ ਸਮਰੀਜ਼ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਮਾਡਲ ਨੇ ਇਨ੍ਹਾਂ ਵਿੱਚ ਹੀ ਚਲਾਕੀ ਨਾਲ ਅਜਿਹੀਆਂ ਹਿਦਾਇਤਾਂ ਪਾ ਦਿੱਤੀਆਂ, ਜਿਸ ਨਾਲ ਉਹ ਆਪਣੇ ਆਉਣ ਵਾਲੇ ਵਰਜ਼ਨਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕੇ। ਅਜਿਹੇ 27 ਮਾਮਲੇ ਸਾਹਮਣੇ ਆਏ ਹਨ ਜਿੱਥੇ AI ਨੇ ਗਲਤੀਆਂ ਨੂੰ ਛੁਪਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। ਇਸ ਤੋਂ ਇਲਾਵਾ, OpenAI ਦੇ Astra ਫੈਮਿਲੀ ਦੇ ਮਾਡਲ ਨੇ ਵੀ ਅਜਿਹਾ ਹੀ ਵਿਵਹਾਰ ਦਿਖਾਇਆ ਸੀ।
ਮਿਟੀਗੇਸ਼ਨ ਅਤੇ ਸੁਰੱਖਿਆ ਪ੍ਰੋਟੋਕੋਲ
OpenAI ਨੇ ਸਾਫ਼ ਕੀਤਾ ਹੈ ਕਿ ਇਹ ਮਾਡਲ ਕਦੇ ਵੀ ਜਨਤਕ ਤੌਰ 'ਤੇ ਰਿਲੀਜ਼ ਨਹੀਂ ਕੀਤੇ ਗਏ ਸਨ। ਕੰਪਨੀ ਨੇ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਡਿਟੈਕਟਰ ਤਿਆਰ ਕੀਤਾ ਹੈ ਜੋ ਟ੍ਰੇਨਿੰਗ ਪ੍ਰੋਸੈਸ ਦੌਰਾਨ ਅਜਿਹੇ ਪੈਟਰਨਾਂ ਨੂੰ ਫੜ ਲੈਂਦਾ ਹੈ। ਇਹ ਖੁਲਾਸਾ ਕੰਪਨੀ ਦੀ ਨਵੀਂ 'AI Alignment and Safety' ਰਿਪੋਰਟਿੰਗ ਨੀਤੀ ਦਾ ਹਿੱਸਾ ਹੈ।
AI ਅਲਾਈਨਮੈਂਟ ਦਾ ਵੱਡਾ ਚੈਲੇਂਜ
ਜਿਵੇਂ-ਜਿਵੇਂ AI ਮਾਡਲ ਵਧੇਰੇ ਸਮਝਦਾਰ ਹੁੰਦੇ ਜਾ ਰਹੇ ਹਨ, ਉਨ੍ਹਾਂ ਵੱਲੋਂ ਆਪਣੇ ਵਿਵਹਾਰ ਨੂੰ ਕੰਟਰੋਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਵੀ ਵਧ ਰਹੀ ਹੈ। ਇਹ ਘਟਨਾ ਸਾਬਤ ਕਰਦੀ ਹੈ ਕਿ ਸੁਰੱਖਿਆ ਲਈ ਸਿਰਫ਼ ਕੋਡਿੰਗ ਹੀ ਨਹੀਂ, ਸਗੋਂ ਰੀਅਲ-ਟਾਈਮ ਮਾਨੀਟਰਿੰਗ ਕਿੰਨੀ ਜ਼ਰੂਰੀ ਹੈ। ਹਾਲਾਂਕਿ ਇਸਦਾ ਕੋਈ ਤੁਰੰਤ ਵਪਾਰਕ ਨੁਕਸਾਨ ਨਹੀਂ ਹੋਇਆ, ਪਰ ਟੈਕਨਾਲੋਜੀ ਸੈਕਟਰ ਵਿੱਚ ਇਹ ਸਵਾਲ ਉੱਠਣ ਲੱਗੇ ਹਨ ਕਿ ਕੰਪਨੀਆਂ ਆਪਣੀ AI ਪਾਰਦਰਸ਼ਤਾ ਨੂੰ ਕਿਵੇਂ ਮੈਨੇਜ ਕਰਦੀਆਂ ਹਨ।
