ਹਾਲ ਹੀ ਵਿੱਚ ਇੱਕ-ਤਿਹਾਈ ਤੋਂ ਵੱਧ ਵੈੱਬ ਕੰਟੈਂਟ AI-Generetad ਦੱਸਿਆ ਜਾ ਰਿਹਾ ਹੈ, ਜਿਸ ਨਾਲ AI ਡਿਵੈਲਪਰਾਂ ਲਈ ਇੱਕ ਨਵੀਂ ਚੁਣੌਤੀ ਖੜ੍ਹੀ ਹੋ ਗਈ ਹੈ। ਨਿਵੇਸ਼ਕਾਂ (Investors) ਲਈ, ਇਹ ਬਦਲਾਅ ਪ੍ਰਮਾਣਿਤ, ਮਨੁੱਖ ਦੁਆਰਾ ਬਣਾਏ ਗਏ ਅਤੇ ਪ੍ਰੋਪਰਾਈਟਰੀ ਡਾਟਾਸੈੱਟਾਂ ਦੇ ਮਹੱਤਵ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਕੁਆਲਿਟੀ ਡਾਟਾ AI ਯੁੱਗ ਵਿੱਚ ਨਵੀਂ ਘਾਟ ਬਣ ਗਿਆ ਹੈ।
ਇੰਟਰਨੈੱਟ ਤੇਜ਼ੀ ਨਾਲ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ (AI) ਦੁਆਰਾ ਬਣਾਈ ਗਈ ਸਮੱਗਰੀ ਨਾਲ ਭਰ ਰਿਹਾ ਹੈ। ਤਾਜ਼ਾ ਵਿਸ਼ਲੇਸ਼ਣ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ 2022 ਦੇ ਅਖੀਰ ਤੋਂ ਪ੍ਰਕਾਸ਼ਿਤ ਇੱਕ-ਤਿਹਾਈ ਤੋਂ ਵੱਧ ਵੈੱਬ ਪੰਨਿਆਂ 'ਤੇ AI ਟੂਲਜ਼ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਗਈ ਹੈ ਜਾਂ ਉਨ੍ਹਾਂ ਦੀ ਮਦਦ ਨਾਲ ਬਣਾਇਆ ਗਿਆ ਹੈ। ਸਿੰਥੈਟਿਕ ਡਾਟਾ ਦੀ ਇਹ ਤੇਜ਼ੀ ਨਾਲ ਭਰਪੂਰਤਾ ਟੈਕਨੋਲੋਜੀ ਕੰਪਨੀਆਂ ਅਤੇ ਨਿਵੇਸ਼ਕਾਂ ਦੇ AI ਦੇ ਭਵਿੱਖ ਬਾਰੇ ਸੋਚਣ ਦੇ ਤਰੀਕੇ ਨੂੰ ਬਦਲ ਰਹੀ ਹੈ।
ਡਾਟਾ ਪ੍ਰੋਵੀਨੈਂਸ (Data Provenance) ਵੱਲ ਮੋੜ
ਪਿਛਲੇ ਕੁਝ ਸਾਲਾਂ ਤੋਂ, AI ਦੀ ਦੌੜ ਡਾਟਾ ਦੀ ਮਾਤਰਾ (Quantity) ਦੁਆਰਾ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤੀ ਗਈ ਸੀ। ਟੀਚਾ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ (Large Language Models) ਨੂੰ ਖੁਆਉਣ ਲਈ ਇੰਟਰਨੈੱਟ ਤੋਂ ਵੱਧ ਤੋਂ ਵੱਧ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨਾ ਸੀ। ਹਾਲਾਂਕਿ, AI-Generated Content ਦੇ ਵਧਣ ਨਾਲ 'ਮਾਡਲ ਕੋਲੈਪਸ' (Model Collapse) ਦਾ ਤਕਨੀਕੀ ਖਤਰਾ ਪੈਦਾ ਹੋ ਗਿਆ ਹੈ। ਜੇਕਰ ਭਵਿੱਖ ਦੇ AI ਮਾਡਲਾਂ ਨੂੰ ਮੁੱਖ ਤੌਰ 'ਤੇ ਪਿਛਲੇ AI ਮਾਡਲਾਂ ਦੁਆਰਾ ਬਣਾਏ ਗਏ ਟੈਕਸਟ 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਆਊਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸੂਖਮਤਾ ਸਮੇਂ ਦੇ ਨਾਲ ਘੱਟ ਸਕਦੀ ਹੈ।
ਇਸ ਨੇ ਨਿਵੇਸ਼ਕਾਂ ਲਈ ਇੱਕ ਨਵੇਂ ਸ਼ਬਦ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਂਦਾ ਹੈ: ਡਾਟਾ ਪ੍ਰੋਵੀਨੈਂਸ। ਇਹ ਜਾਣਕਾਰੀ ਦੇ ਮੂਲ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ – ਖਾਸ ਤੌਰ 'ਤੇ, ਕਿ ਕੀ ਡਾਟਾ ਮਨੁੱਖਾਂ, ਮਾਹਰਾਂ, ਜਾਂ ਪ੍ਰਮਾਣਿਤ ਪ੍ਰੋਪਰਾਈਟਰੀ ਸਿਸਟਮਾਂ ਦੁਆਰਾ ਬਣਾਇਆ ਗਿਆ ਸੀ। ਜਿਵੇਂ-ਜਿਵੇਂ ਓਪਨ ਵੈੱਬ ਸਿੰਥੈਟਿਕ ਸ਼ੋਰ ਨਾਲ ਭਰ ਰਿਹਾ ਹੈ, 'ਕਲੀਨ' ਜਾਂ ਪ੍ਰਮਾਣਿਤ ਡਾਟਾ ਦਾ ਮੁੱਲ ਵੱਧ ਰਿਹਾ ਹੈ। ਵਿਸ਼ਲੇਸ਼ਕ ਹੁਣ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ AI ਫਰਮਾਂ ਲਈ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਫਾਇਦਾ ਸਾਰਾ ਇੰਟਰਨੈੱਟ ਸਕ੍ਰੈਪ ਕਰਨ ਤੋਂ ਨਹੀਂ, ਸਗੋਂ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ, ਗੈਰ-AI ਸਰੋਤਾਂ ਤੱਕ ਪਹੁੰਚ ਪ੍ਰਾਪਤ ਕਰਨ ਤੋਂ ਆਵੇਗਾ।
ਨਿਵੇਸ਼ਕ ਦਾ ਪਹਿਲੂ: ਪ੍ਰੋਪਰਾਈਟਰੀ ਡਾਟਾ ਦਾ ਮੁੱਲ
ਇਹ ਰੁਝਾਨ AI ਕੰਪਨੀਆਂ ਦੁਆਰਾ ਸਿਖਲਾਈ ਸਮੱਗਰੀ ਕਿਵੇਂ ਪ੍ਰਾਪਤ ਕੀਤੀ ਜਾਵੇਗੀ, ਇਸ ਬਾਰੇ ਮੁੜ-ਵਿਚਾਰ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰ ਰਿਹਾ ਹੈ। ਪ੍ਰੋਪਰਾਈਟਰੀ ਡਾਟਾ ਲਈ ਇੱਕ ਉੱਭਰ ਰਹੀ ਮਾਰਕੀਟ ਹੈ – ਅਜਿਹੀ ਜਾਣਕਾਰੀ ਜੋ ਨਿੱਜੀ, ਪ੍ਰਮਾਣਿਤ ਹੈ, ਅਤੇ ਜਨਤਕ ਵੈੱਬ 'ਤੇ ਆਸਾਨੀ ਨਾਲ ਉਪਲਬਧ ਨਹੀਂ ਹੈ। ਉਹ ਕੰਪਨੀਆਂ ਜਿਨ੍ਹਾਂ ਕੋਲ ਵਿਲੱਖਣ ਸੰਚਾਰ, ਗਾਹਕ ਵਰਕਫਲੋ, ਪੇਸ਼ੇਵਰ ਜਰਨਲ, ਜਾਂ ਵਿਸ਼ੇਸ਼ ਉਦਯੋਗ ਡਾਟਾ ਦੇ ਵਿਸ਼ਾਲ ਆਰਕਾਈਵ ਹਨ, ਉਹ ਪਾ ਰਹੀਆਂ ਹਨ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਆਰਕਾਈਵ ਡਿਜੀਟਲ ਪੂੰਜੀ (Digital Capital) ਦਾ ਇੱਕ ਨਵਾਂ ਰੂਪ ਬਣ ਗਏ ਹਨ।
ਨਿਵੇਸ਼ਕ ਹੁਣ ਉਨ੍ਹਾਂ ਫਰਮਾਂ 'ਤੇ ਨੇੜਿਓਂ ਨਜ਼ਰ ਰੱਖ ਰਹੇ ਹਨ ਜਿਨ੍ਹਾਂ ਕੋਲ ਇਹ 'ਡਾਟਾ ਮੋਟਸ' (Data Moats) ਹਨ। ਉਦਾਹਰਨ ਲਈ, ਮਾਡਲਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਨਿੱਜੀ ਵਪਾਰਕ ਡਾਟਾ ਖਰੀਦਣ ਵਿੱਚ ਦਿਲਚਸਪੀ ਵੱਧ ਰਹੀ ਹੈ। ਇਹ ਬਦਲਾਅ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਉੱਚ-ਪੱਧਰੀ AI ਵਿਕਸਤ ਕਰਨ ਦੀ ਲਾਗਤ ਵੱਧ ਸਕਦੀ ਹੈ, ਕਿਉਂਕਿ ਕੰਪਨੀਆਂ ਮੁਫਤ, ਜਨਤਕ ਡਾਟਾ ਤੋਂ ਦੂਰ ਭੁਗਤਾਨ ਕੀਤੇ ਗਏ, ਪ੍ਰਮਾਣਿਤ, ਅਤੇ ਉੱਚ-ਅਖੰਡਤਾ ਵਾਲੇ ਡਾਟਾਸੈੱਟਾਂ ਵੱਲ ਜਾਣਗੀਆਂ ਤਾਂ ਜੋ ਇਹ ਯਕੀਨੀ ਬਣਾਇਆ ਜਾ ਸਕੇ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਮਾਡਲ ਪ੍ਰਤੀਯੋਗੀ ਅਤੇ ਭਰੋਸੇਮੰਦ ਬਣੇ ਰਹਿਣ।
ਜੋਖਮ ਅਤੇ ਭਵਿੱਖ ਦੀ ਨਿਗਰਾਨੀ
ਜਦੋਂ ਕਿ ਡਾਟਾ ਦੀ ਮੰਗ ਮੌਕੇ ਪੈਦਾ ਕਰਦੀ ਹੈ, ਇਹ ਨਵੇਂ ਜੋਖਮ ਵੀ ਪੇਸ਼ ਕਰਦੀ ਹੈ। ਅਸਲ ਮਨੁੱਖੀ ਸਮੱਗਰੀ ਅਤੇ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੀ AI ਸਮੱਗਰੀ ਦੇ ਵਿਚਕਾਰ ਅੰਤਰ ਕਰਨਾ ਵਧੇਰੇ ਕਠਿਨ ਅਤੇ ਮਹਿੰਗਾ ਹੁੰਦਾ ਜਾ ਰਿਹਾ ਹੈ। ਜਿਹੜੀਆਂ ਕੰਪਨੀਆਂ ਆਪਣੇ ਸਿਖਲਾਈ ਡਾਟਾ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਫਿਲਟਰ ਕਰਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੀਆਂ ਹਨ, ਉਨ੍ਹਾਂ ਨੂੰ ਆਪਣੇ ਉਤਪਾਦਾਂ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਨ ਗਿਰਾਵਟ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪੈ ਸਕਦਾ ਹੈ, ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਵਧੇਰੇ ਕਲੀਨ ਡਾਟਾ ਪਾਈਪਲਾਈਨਾਂ ਵਾਲੇ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਨੂੰ ਮਾਰਕੀਟ ਹਿੱਸਾ ਗੁਆ ਬੈਠਣਗੇ।
ਇਸ ਸੈਕਟਰ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਵਾਲੇ ਨਿਵੇਸ਼ਕਾਂ ਨੂੰ ਇਸ ਗੱਲ 'ਤੇ ਨਜ਼ਰ ਰੱਖਣੀ ਚਾਹੀਦੀ ਹੈ ਕਿ ਕੰਪਨੀਆਂ ਆਪਣੀ ਡਾਟਾ ਸੋਰਸਿੰਗ ਰਣਨੀਤੀਆਂ ਦੀ ਰਿਪੋਰਟ ਕਿਵੇਂ ਕਰਦੀਆਂ ਹਨ। ਆਉਣ ਵਾਲੇ ਕੁਆਰਟਰਾਂ ਲਈ ਮੁੱਖ ਨਿਗਰਾਨੀ ਇਹ ਹੋਵੇਗੀ ਕਿ ਕੀ ਕਾਰੋਬਾਰ ਵਾਲੀਅਮ (Volume) ਰਾਹੀਂ ਸਕੇਲਿੰਗ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੇ ਹਨ ਜਾਂ ਕੀ ਉਹ ਉੱਚ-ਲਾਗਤ, ਉੱਚ-ਮੁੱਲ ਵਾਲੇ ਡਾਟਾ ਭਾਈਵਾਲੀ ਵੱਲ ਮੁੜਦੇ ਹਨ। ਸਿਖਲਾਈ ਡਾਟਾ ਦੀ ਗੁਣਵੱਤਾ ਅਤੇ ਮੂਲ ਦੀ ਗਰੰਟੀ ਦੇਣ ਦੀ ਸਮਰੱਥਾ AI-ਸੰਚਾਲਿਤ ਬਿਜ਼ਨਸ ਮਾਡਲਾਂ ਦੀ ਲੰਬੇ ਸਮੇਂ ਦੀ ਵਿਹਾਰਕਤਾ ਦਾ ਇੱਕ ਕੇਂਦਰੀ ਕਾਰਕ ਬਣਨ ਦੀ ਸੰਭਾਵਨਾ ਹੈ।
