Amazon ਦੀ AI ਸਿਖਲਾਈ: ਦੁਰਲੱਭ ਕਿਤਾਬਾਂ ਦੀ ਹੋ ਰਹੀ ਤਬਾਹੀ!

TECHNOLOGY
Whalesbook Logo
AuthorMitali Deshmukh|Published at:
Amazon ਦੀ AI ਸਿਖਲਾਈ: ਦੁਰਲੱਭ ਕਿਤਾਬਾਂ ਦੀ ਹੋ ਰਹੀ ਤਬਾਹੀ!

Amazon 'ਤੇ ਦੋਸ਼ ਹੈ ਕਿ ਉਹ ਆਪਣੇ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ (AI) ਮਾਡਲਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਦੁਰਲੱਭ ਅਤੇ ਆਊਟ-ਆਫ-ਪ੍ਰਿੰਟ ਕਿਤਾਬਾਂ ਨੂੰ ਨਸ਼ਟ ਕਰ ਰਿਹਾ ਹੈ। ਲਾਸ ਵੇਗਾਸ ਸਥਿਤ ਇੱਕ ਸੁਵਿਧਾ 'ਤੇ ਇਨ੍ਹਾਂ ਕਿਤਾਬਾਂ ਦੀਆਂ ਰੀੜ੍ਹਾਂ (spines) ਹਟਾ ਕੇ ਉਨ੍ਹਾਂ ਨੂੰ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਮਨੁੱਖੀ ਟੈਕਸਟ ਲਈ ਸਕੈਨ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ, ਜਿਸ ਨਾਲ ਬੌਧਿਕ ਸੰਪਦਾ (intellectual property) ਅਤੇ ਸਾਖ (reputation) ਦੇ ਜੋਖਮਾਂ ਬਾਰੇ ਚਿੰਤਾਵਾਂ ਵਧ ਗਈਆਂ ਹਨ।

AI ਲਈ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਦਾ ਤਰੀਕਾ

Amazon 'ਤੇ ਇਹ ਖੁਲਾਸਾ ਹੋਇਆ ਹੈ ਕਿ ਕੰਪਨੀ ਆਪਣੇ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ (AI) ਪ੍ਰੋਗਰਾਮਾਂ ਲਈ ਜ਼ਰੂਰੀ ਡਾਟਾ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਦੁਰਲੱਭ ਅਤੇ ਪੁਰਾਣੀਆਂ ਕਿਤਾਬਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਰਹੀ ਹੈ। ਇਨਵੈਸਟੀਗੇਸ਼ਨ ਅਨੁਸਾਰ, Amazon ਆਪਣੇ ਲਾਸ ਵੇਗਾਸ ਸਥਿਤ VGT3 ਸੈਂਟਰ ਵਿੱਚ ਇਨ੍ਹਾਂ ਕਿਤਾਬਾਂ ਨੂੰ ਭੇਜਦਾ ਹੈ, ਜਿੱਥੇ ਉਨ੍ਹਾਂ ਦੀਆਂ ਰੀੜ੍ਹਾਂ (spines) ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ ਤਾਂ ਜੋ ਉਨ੍ਹਾਂ ਨੂੰ ਹਾਈ-ਸਪੀਡ ਸਕੈਨਰਾਂ ਰਾਹੀਂ ਤੇਜ਼ੀ ਨਾਲ ਡਿਜੀਟਾਈਜ਼ ਕੀਤਾ ਜਾ ਸਕੇ। ਇਸ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ, ਅਸਲ ਕਿਤਾਬਾਂ ਤਬਾਹ ਹੋ ਜਾਂਦੀਆਂ ਹਨ।

ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਡਾਟਾ ਦੀ ਲੋੜ

ਅੱਜ ਦੇ ਸਮੇਂ ਵਿੱਚ, ਟੈਕ ਕੰਪਨੀਆਂ ਸਭ ਤੋਂ ਸਟੀਕ ਅਤੇ ਸਮਰੱਥ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLM) ਬਣਾਉਣ ਲਈ ਇੱਕ-ਦੂਜੇ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰ ਰਹੀਆਂ ਹਨ। ਇੱਕ ਵੱਡੀ ਚੁਣੌਤੀ ਇਹ ਹੈ ਕਿ ਇੰਟਰਨੈੱਟ 'ਤੇ ਬਹੁਤ ਸਾਰਾ ਕੰਟੈਂਟ AI ਦੁਆਰਾ ਹੀ ਤਿਆਰ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ। ਜਦੋਂ AI ਮਾਡਲਾਂ ਨੂੰ ਮਸ਼ੀਨ-ਜਨਰੇਟਿਡ ਡਾਟਾ 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਉਨ੍ਹਾਂ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਸਮੇਂ ਦੇ ਨਾਲ ਘੱਟ ਸਕਦਾ ਹੈ, ਜਿਸਨੂੰ 'ਮਾਡਲ ਕੋਲੈਪਸ' ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਤੋਂ ਬਚਣ ਲਈ, ਕੰਪਨੀਆਂ ਮਨੁੱਖਾਂ ਦੁਆਰਾ ਲਿਖੇ ਗਏ, ਭਰੋਸੇਯੋਗ ਅਤੇ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਟੈਕਸਟ ਦੀ ਭਾਲ ਕਰ ਰਹੀਆਂ ਹਨ, ਖਾਸ ਕਰਕੇ ਜੋ 2022 ਤੋਂ ਪਹਿਲਾਂ ਪ੍ਰਕਾਸ਼ਿਤ ਹੋਇਆ ਹੋਵੇ ਅਤੇ ਆਸਾਨੀ ਨਾਲ ਡਿਜੀਟਲ ਰੂਪ ਵਿੱਚ ਉਪਲਬਧ ਨਾ ਹੋਵੇ। ਦੁਰਲੱਭ ਕਿਤਾਬਾਂ ਇਸ ਮੰਤਵ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਸਰੋਤ ਬਣ ਗਈਆਂ ਹਨ ਕਿਉਂਕਿ ਉਹ ਵਿਲੱਖਣ, ਮਨੁੱਖ ਦੁਆਰਾ ਲਿਖੇ ਗਏ ਡਾਟਾਸੈੱਟ ਪ੍ਰਦਾਨ ਕਰਦੀਆਂ ਹਨ।

ਕਾਰੋਬਾਰੀ ਅਤੇ ਸਾਖ ਦੇ ਜੋਖਮ

ਹਾਲਾਂਕਿ Amazon ਨੇ ਮੀਡੀਆ ਨੂੰ ਕਿਹਾ ਹੈ ਕਿ ਉਹ ਆਪਣੇ ਉਤਪਾਦਾਂ ਅਤੇ ਸੇਵਾਵਾਂ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਲਈ ਵਪਾਰਕ ਸਰੋਤਾਂ ਰਾਹੀਂ ਕਿਤਾਬਾਂ ਖਰੀਦਦਾ ਹੈ, ਪਰ ਉਨ੍ਹਾਂ ਦੇ ਨਸ਼ਟ ਕਰਨ ਦੇ ਤਰੀਕੇ ਨੇ ਕਈ ਸਵਾਲ ਖੜ੍ਹੇ ਕਰ ਦਿੱਤੇ ਹਨ। ਨਿਵੇਸ਼ਕਾਂ (Investors) ਲਈ, ਇਹ ਗਤੀਵਿਧੀ ਕਈ ਚਿੰਤਾਵਾਂ ਨੂੰ ਉਜਾਗਰ ਕਰਦੀ ਹੈ। ਪਹਿਲਾਂ, ਸਾਖ ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਣ ਦਾ ਖਤਰਾ ਹੈ। ਕਾਰਪੋਰੇਟ AI ਮਾਡਲਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਇਤਿਹਾਸਕ ਜਾਂ ਦੁਰਲੱਭ ਲਿਖਤਾਂ ਨੂੰ ਨਸ਼ਟ ਕਰਨ ਦੀ ਜਨਤਕ ਧਾਰਨਾ ਨਕਾਰਾਤਮਕ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਬੌਧਿਕ ਚੋਰੀ (intellectual piracy) ਜਾਂ ਸੱਭਿਆਚਾਰਕ ਵਿਰਾਸਤ ਦੀ ਅਣਦੇਖੀ ਦੇ ਦੋਸ਼ ਲੱਗ ਸਕਦੇ ਹਨ।

ਦੂਜਾ, ਬੌਧਿਕ ਸੰਪਦਾ ਅਤੇ ਕਾਪੀਰਾਈਟ ਦਾ ਮੁੱਦਾ ਹੈ। ਜਦੋਂ ਕਿ ਕੁਝ ਟੈਕ ਫਰਮਾਂ ਦਲੀਲ ਦਿੰਦੀਆਂ ਹਨ ਕਿ AI ਸਿਖਲਾਈ ਲਈ ਸਮੱਗਰੀ ਦਾ ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ 'ਨਿਰਪੱਖ ਵਰਤੋਂ' (fair use) ਅਧੀਨ ਆਉਂਦਾ ਹੈ, ਕਾਪੀਰਾਈਟ ਸਮੱਗਰੀ ਦੀ ਵਰਤੋਂ ਸੰਬੰਧੀ ਕਾਨੂੰਨੀ ਚੁਣੌਤੀਆਂ ਪੂਰੇ AI ਸੈਕਟਰ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਜੋਖਮ ਬਣੀਆਂ ਹੋਈਆਂ ਹਨ। ਜੇਕਰ ਅਦਾਲਤਾਂ ਜਾਂ ਰੈਗੂਲੇਟਰ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਇਹ ਪ੍ਰਥਾ ਕਾਪੀਰਾਈਟ ਕਾਨੂੰਨਾਂ ਦੀ ਉਲੰਘਣਾ ਕਰਦੀ ਹੈ, ਤਾਂ ਇਹ ਮਹਿੰਗੇ ਮੁਕੱਦਮੇਬਾਜ਼ੀ, ਸਿਖਲਾਈ ਦੇ ਤਰੀਕਿਆਂ ਵਿੱਚ ਬਦਲਾਅ, ਜਾਂ ਵਿੱਤੀ ਜੁਰਮਾਨਿਆਂ ਦਾ ਕਾਰਨ ਬਣ ਸਕਦਾ ਹੈ।

ਅੰਤ ਵਿੱਚ, ਇਹ ਕਦਮ AI ਮਾਡਲਾਂ ਨੂੰ ਪ੍ਰਤੀਯੋਗੀ (competitive) ਬਣਾਏ ਰੱਖਣ ਲਈ ਕੰਪਨੀਆਂ 'ਤੇ ਪੈ ਰਹੇ ਭਾਰੀ ਲਾਗਤ ਅਤੇ ਸਰੋਤ ਦਬਾਅ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਜਿਉਂ-ਜਿਉਂ ਫਰਮਾਂ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਅਤੇ ਡਾਟਾ 'ਤੇ ਭਾਰੀ ਖਰਚਾ ਕਰ ਰਹੀਆਂ ਹਨ, ਨਿਵੇਸ਼ਕਾਂ ਨੂੰ ਸੰਭਾਵੀ ਰੈਗੂਲੇਟਰੀ ਅਪਡੇਟਾਂ 'ਤੇ ਨਜ਼ਰ ਰੱਖਣੀ ਚਾਹੀਦੀ ਹੈ। ਦੁਨੀਆ ਭਰ ਦੀਆਂ ਸਰਕਾਰਾਂ ਇਸ ਗੱਲ 'ਤੇ ਵੱਧ ਤੋਂ ਵੱਧ ਧਿਆਨ ਦੇ ਰਹੀਆਂ ਹਨ ਕਿ AI ਮਾਡਲਾਂ ਨੂੰ ਕਿਵੇਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾ ਰਹੀ ਹੈ ਅਤੇ ਉਨ੍ਹਾਂ ਦਾ ਡਾਟਾ ਕਿੱਥੋਂ ਆ ਰਿਹਾ ਹੈ। AI ਡਾਟਾ ਰੈਗੂਲੇਸ਼ਨ ਜਾਂ ਕਾਪੀਰਾਈਟ ਕਾਨੂੰਨਾਂ ਵਿੱਚ ਕੋਈ ਵੀ ਅਚਾਨਕ ਬਦਲਾਅ Amazon ਅਤੇ ਇਸਦੇ ਹਮ-ਰੁਤਬਾ ਕੰਪਨੀਆਂ ਨੂੰ ਆਪਣੀਆਂ ਰਣਨੀਤੀਆਂ ਬਦਲਣ ਲਈ ਮਜਬੂਰ ਕਰ ਸਕਦਾ ਹੈ, ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਉਨ੍ਹਾਂ ਦੇ AI ਉਤਪਾਦ ਲਾਂਚ ਦੇ ਸਮਾਂ-ਸਾਰਣੀ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦਾ ਹੈ ਜਾਂ ਉਨ੍ਹਾਂ ਦੇ ਕਾਨੂੰਨੀ ਅਤੇ ਪਾਲਣਾ ਖਰਚਿਆਂ ਨੂੰ ਵਧਾ ਸਕਦਾ ਹੈ। ਸ਼ੇਅਰਧਾਰਕਾਂ ਲਈ ਮੁੱਖ ਨਿਗਰਾਨੀ ਇਹ ਹੋਵੇਗੀ ਕਿ ਕੀ ਇਹ ਡਾਟਾ-ਇਕੱਠਾ ਕਰਨ ਦੀਆਂ ਅਭਿਆਸਾਂ ਮਹੱਤਵਪੂਰਨ ਸਰਕਾਰੀ ਦਖਲਅੰਦਾਜ਼ੀ ਨੂੰ ਆਕਰਸ਼ਿਤ ਕਰਦੀਆਂ ਹਨ ਜਾਂ ਮਹੱਤਵਪੂਰਨ ਕਾਨੂੰਨੀ ਵਿਵਾਦਾਂ ਦਾ ਕਾਰਨ ਬਣਦੀਆਂ ਹਨ ਜੋ ਕੰਪਨੀ ਦੇ ਵਿਆਪਕ AI ਰੋਡਮੈਪ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦੀਆਂ ਹਨ।

Disclaimer: This article is published for informational purposes only. This is not a buy sell recommendation.