सध्या इंटरनेटवर कृत्रिम बुद्धिमत्तेद्वारे (AI) तयार केलेल्या कंटेंटचा मोठा पूर आला आहे. आता एक तृतीयांश वेब कंटेंट AI-निर्मित असल्याचा अंदाज आहे. यामुळे AI कंपन्यांसाठी एक नवीन आव्हान उभे राहिले आहे, तर गुंतवणूकदारांसाठी आता मानवी आणि सत्यापित 'प्रोप्रायटरी डेटा'चे महत्त्व प्रचंड वाढले आहे.
AI कंटेंटचा वाढता प्रभाव
आजकाल इंटरनेटवर कृत्रिम बुद्धिमत्तेने (Artificial Intelligence - AI) तयार केलेला मजकूर वेगाने वाढत आहे. ताज्या विश्लेषणानुसार, २०२२ च्या उत्तरार्धापासून प्रकाशित झालेल्या एक तृतीयांशपेक्षा जास्त वेब पेजेस AI टूल्सद्वारे तयार केली गेली आहेत किंवा त्यात AI ची मोठी मदत घेतली गेली आहे. या कृत्रिम डेटाच्या वाढत्या प्रसारामुळे AI कंपन्या आणि गुंतवणूकदार आता आर्टिफिशियल इंटेलिजन्सच्या भविष्याकडे एका नवीन दृष्टीकोनातून पाहत आहेत.
डेटाच्या 'उत्पत्ती'चे महत्त्व (Data Provenance)
गेल्या काही वर्षांपासून AI क्षेत्रातील शर्यत 'डेटाच्या प्रमाणावर' (Quantity of Data) केंद्रित होती. मोठे लँग्वेज मॉडेल्स (Large Language Models) प्रशिक्षित करण्यासाठी इंटरनेटवरील जास्तीत जास्त डेटा गोळा करणे हे उद्दिष्ट होते. मात्र, AI-निर्मित कंटेंटच्या वाढीमुळे 'मॉडेल कोलॅप्स' (Model Collapse) नावाचा तांत्रिक धोका निर्माण झाला आहे. जर भविष्यातील AI मॉडेल्स प्रामुख्याने मागील AI मॉडेल्सनी तयार केलेल्या मजकुरावर प्रशिक्षित झाले, तर त्यांची गुणवत्ता, अचूकता आणि बारकावे कालांतराने कमी होऊ शकतात.
यामुळे गुंतवणूकदारांसाठी 'डेटा प्रोव्हिनन्स' (Data Provenance) ही एक महत्त्वाची संकल्पना म्हणून पुढे आली आहे. याचा अर्थ माहितीच्या स्रोताची पडताळणी करण्याची क्षमता – विशेषतः, डेटा माणसांनी, तज्ञांनी किंवा सत्यापित प्रोप्रायटरी सिस्टीमने तयार केला आहे की नाही हे तपासणे. सार्वजनिक वेब कंटेंट कृत्रिम माहितीने भरले जात असताना, 'स्वच्छ' किंवा सत्यापित डेटाचे मूल्य वाढत आहे. विश्लेषकांच्या मते, AI कंपन्यांसाठी स्पर्धात्मक फायदा मिळवण्यासाठी संपूर्ण इंटरनेट स्क्रॅप करण्याऐवजी उच्च-गुणवत्तेच्या, नॉन-AI स्रोतांमध्ये प्रवेश मिळवणे महत्त्वाचे ठरेल.
गुंतवणूकदारांसाठी प्रोप्रायटरी डेटाचे मूल्य
या ट्रेंडमुळे AI कंपन्यांना प्रशिक्षण सामग्री कशी मिळवावी यावर पुनर्विचार करावा लागत आहे. प्रोप्रायटरी डेटासाठी एक नवीन बाजारपेठ उदयास येत आहे – ही अशी माहिती आहे जी खाजगी, सत्यापित आणि सार्वजनिक वेबवर सहज उपलब्ध नाही. ज्या कंपन्यांकडे युनिक कम्युनिकेशन, ग्राहक वर्कफ्लो, व्यावसायिक जर्नल्स किंवा विशिष्ट उद्योगांचा विशेष डेटा यांचा मोठा संग्रह आहे, त्यांच्यासाठी हा संग्रह आता डिजिटल भांडवलाचा एक नवीन प्रकार बनला आहे.
गुंतवणूकदार आता अशा कंपन्यांवर अधिक लक्ष केंद्रित करत आहेत ज्यांच्याकडे हे 'डेटा मोएट्स' (Data Moats) आहेत. उदाहरणार्थ, मॉडेल्सना प्रशिक्षित करण्यासाठी खाजगी व्यावसायिक डेटा खरेदी करण्याच्या आवडीमध्ये वाढ होत आहे. या बदलाचा अर्थ असा आहे की उच्च-स्तरीय AI विकसित करण्याचा खर्च वाढू शकतो, कारण कंपन्या कदाचित विनामूल्य, सार्वजनिक डेटाऐवजी सशुल्क, प्रमाणित आणि उच्च-अखंडता असलेल्या डेटासेटवर अधिक लक्ष केंद्रित करतील, जेणेकरून त्यांचे मॉडेल्स स्पर्धात्मक आणि विश्वासार्ह राहतील.
धोके आणि भविष्यातील निरीक्षण
डेटाच्या वाढत्या मागणीमुळे संधी निर्माण होत असल्या तरी, नवीन धोके देखील समोर येत आहेत. खरा मानवी कंटेंट आणि उच्च-गुणवत्तेचा AI कंटेंट यातील फरक करणे अधिक कठीण आणि महाग होत आहे. ज्या कंपन्या त्यांच्या प्रशिक्षण डेटामध्ये प्रभावीपणे फिल्टर करू शकत नाहीत, त्यांना त्यांच्या उत्पादनांच्या कार्यक्षमतेत घट येऊ शकते आणि स्वच्छ डेटा पाइपलाइन असलेल्या प्रतिस्पर्धकांकडून मार्केट शेअर गमावावा लागू शकतो.
या क्षेत्राचे निरीक्षण करणाऱ्या गुंतवणूकदारांनी कंपन्या त्यांच्या डेटा सोर्सिंग धोरणांचा अहवाल कसा देतात याचा मागोवा घ्यावा. आगामी तिमाहीत, व्यवसाय व्हॉल्यूमद्वारे स्केलिंगवर लक्ष केंद्रित करतील की उच्च-खर्च, उच्च-मूल्याच्या डेटा भागीदारीकडे वळतील, हे महत्त्वाचे ठरेल. प्रशिक्षण डेटाची गुणवत्ता आणि उत्पत्तीची हमी देण्याची क्षमता AI-आधारित व्यवसाय मॉडेल्सच्या दीर्घकालीन व्यवहार्यतेमध्ये एक मध्यवर्ती घटक बनण्याची शक्यता आहे.
