இணையத்தில் சுமார் மூன்றில் ஒரு பங்கு கன்டென்ட் இப்போது AI மூலம் உருவாக்கப்படுகிறது. இது AI டெவலப்பர்களுக்கு ஒரு புதிய சவாலாக உருவெடுத்துள்ளது. முதலீட்டாளர்களைப் பொறுத்தவரை, இந்த மாற்றம் சரிபார்க்கப்பட்ட, மனிதர்களால் உருவாக்கப்பட்ட, மற்றும் தனிப்பட்ட (proprietary) டேட்டாசெட்களின் மதிப்பை அதிகரிக்கிறது. ஏனெனில், AI உலகில் தரமான டேட்டா தான் இப்போது அரிதாகிவிட்டது.
இணையம் அதிவேகமாக Artificial Intelligence (AI) உருவாக்கிய கன்டென்ட்களால் நிரம்பி வழிகிறது. சமீபத்திய ஆய்வுகளின்படி, 2022 இன் பிற்பகுதியில் இருந்து வெளியிடப்பட்ட வலைப்பக்கங்களில் மூன்றில் ஒரு பங்குக்கு மேல் AI கருவிகள் மூலம் உருவாக்கப்பட்டவை அல்லது அவற்றின் உதவியுடன் உருவாக்கப்பட்டவை. இப்படி செயற்கையான டேட்டா நிறைந்து போவது, AI துறையின் எதிர்காலம் குறித்து தொழில்நுட்ப நிறுவனங்களும் முதலீட்டாளர்களும் எப்படிப் பார்க்கிறார்கள் என்பதை மாற்றியமைக்கிறது.
டேட்டா எங்கிருந்து வருகிறது?
கடந்த சில ஆண்டுகளாக, AI துறையில் யார் எவ்வளவு டேட்டாவை சேகரிக்கிறார்கள் என்பதே போட்டியாக இருந்தது. பெரிய மொழி மாதிரிகளுக்கு (Large Language Models) பயிற்சி அளிக்க இணையத்தில் இருந்து முடிந்தவரை டேட்டாவை எடுப்பதே நோக்கமாக இருந்தது. ஆனால், AI உருவாக்கிய கன்டென்ட் அதிகரிப்பதால் 'மாடல் கொலாப்ஸ்' (Model Collapse) என்ற ஒரு தொழில்நுட்ப ஆபத்து உருவாகியுள்ளது. எதிர்கால AI மாடல்களுக்கு முந்தைய AI மாடல்களால் உருவாக்கப்பட்ட டெக்ஸ்ட்களைப் பயன்படுத்தினால், அதன் தரம், துல்லியம் மற்றும் நுணுக்கம் காலப்போக்கில் குறையக்கூடும்.
இதன் காரணமாக, முதலீட்டாளர்களுக்கு 'டேட்டா ப்ரோவெனன்ஸ்' (Data Provenance) என்ற புதிய வார்த்தை முக்கியத்துவம் பெறுகிறது. இது தகவலின் மூலத்தை சரிபார்க்கும் திறனைக் குறிக்கிறது - குறிப்பாக, டேட்டா மனிதர்களால், நிபுணர்களால் அல்லது சரிபார்க்கப்பட்ட தனிப்பட்ட அமைப்புகளால் உருவாக்கப்பட்டதா என்பதை உறுதிப்படுத்துவது. பொதுவான இணையம் செயற்கையான தகவல்களால் நிறைந்துள்ளதால், 'சுத்தமான' அல்லது சரிபார்க்கப்பட்ட டேட்டாவின் மதிப்பு அதிகரித்து வருகிறது. இணையத்தில் இருந்து மொத்தமாக டேட்டாவை எடுப்பதை விட, உயர்தரமான, AI அல்லாத மூலங்களில் இருந்து டேட்டாவை அணுகுவதே AI நிறுவனங்களுக்கான போட்டித்தன்மையை அதிகரிக்கும் என்று ஆய்வாளர்கள் கூறுகின்றனர்.
முதலீட்டாளர்களின் பார்வை: தனிப்பட்ட டேட்டாவின் மதிப்பு
இந்த போக்கு, AI நிறுவனங்கள் பயிற்சிக்குத் தேவையான கன்டென்ட்டை எப்படிப் பெறுவது என்பது குறித்து மறுபரிசீலனை செய்ய வைக்கிறது. தனிப்பட்ட டேட்டாவுக்கான (proprietary data) ஒரு புதிய சந்தை உருவாகி வருகிறது - அதாவது, தனியார், சரிபார்க்கப்பட்ட மற்றும் பொது இணையத்தில் எளிதாகக் கிடைக்காத தகவல்கள். தனிப்பட்ட தகவல்தொடர்புகள், வாடிக்கையாளர் பணிப்பாய்வுகள், தொழில்முறை இதழ்கள் அல்லது சிறப்புத் துறை தரவுகள் போன்றவற்றை பெருமளவில் வைத்திருக்கும் நிறுவனங்கள், தங்களுடைய பழைய தரவுத்தொகுப்புகள் ஒரு புதிய டிஜிட்டல் மூலதனமாக மாறியிருப்பதைக் காண்கின்றன.
முதலீட்டாளர்கள் இப்போது இந்த 'டேட்டா மோட்ஸ்' (data moats) வைத்திருக்கும் நிறுவனங்களில் அதிக கவனம் செலுத்துகின்றனர். உதாரணமாக, மாடல்களுக்கு பயிற்சி அளிக்க தனிப்பட்ட வணிகத் தரவை வாங்குவதில் ஆர்வம் அதிகரித்து வருகிறது. இந்த மாற்றம், உயர்தர AI-ஐ உருவாக்குவதற்கான செலவு அதிகரிக்கக்கூடும் என்பதைக் குறிக்கிறது. ஏனெனில், நிறுவனங்கள் தங்கள் மாடல்கள் போட்டித்தன்மையுடனும் நம்பகத்தன்மையுடனும் இருப்பதை உறுதிசெய்ய, இலவச பொது டேட்டாவிலிருந்து கட்டணம் செலுத்தும், அங்கீகரிக்கப்பட்ட மற்றும் உயர்-ஒருமைப்பாடு கொண்ட டேட்டாசெட்களுக்கு மாறக்கூடும்.
ஆபத்துகளும் எதிர்கால கண்காணிப்பும்
டேட்டாவிற்கான தேவை வாய்ப்புகளை உருவாக்கும் அதே வேளையில், புதிய ஆபத்துகளையும் அறிமுகப்படுத்துகிறது. உண்மையான மனித உள்ளடக்கத்திற்கும் உயர்தர AI உள்ளடக்கத்திற்கும் இடையில் வேறுபாடு காண்பது கடினமாகவும் விலை உயர்ந்ததாகவும் மாறி வருகிறது. தங்கள் பயிற்சித் தரவை திறம்பட வடிகட்டத் தவறும் நிறுவனங்கள், தங்கள் தயாரிப்புகளில் செயல்திறன் குறைவதை சந்திக்க நேரிடலாம். இதனால், தூய்மையான டேட்டா கொண்ட போட்டியாளர்களிடம் சந்தைப் பங்கை இழக்க நேரிடும்.
இந்தத் துறையைக் கண்காணிக்கும் முதலீட்டாளர்கள், நிறுவனங்கள் தங்கள் டேட்டா ஆதார உத்திகளை எவ்வாறு தெரிவிக்கின்றன என்பதைக் கண்காணிக்க வேண்டும். வரவிருக்கும் காலாண்டுகளில், வணிகங்கள் அளவை அதிகரிப்பதில் கவனம் செலுத்துமா அல்லது அதிக விலை, அதிக மதிப்புள்ள டேட்டா கூட்டாண்மைகளை நோக்கிச் செல்லுமா என்பதைக் கண்காணிப்பது முக்கியம். பயிற்சித் தரவின் தரம் மற்றும் மூலத்தை உறுதிசெய்யும் திறன், AI-உந்துதல் வணிக மாதிரிகளின் நீண்டகால நம்பகத்தன்மைக்கு ஒரு முக்கிய காரணியாக மாறும்.
