આર્ટિફિશિયલ ઇન્ટેલિજન્સ (AI) દ્વારા જનરેટ કરાયેલ કન્ટેન્ટનું પ્રમાણ ઝડપથી વધી રહ્યું છે. નવા અંદાજો મુજબ, તાજેતરમાં પ્રકાશિત થયેલ એક તૃતીયાંશથી વધુ વેબ કન્ટેન્ટ AI દ્વારા જનરેટ થયેલ છે. આ પરિસ્થિતિ AI ડેવલપર્સ માટે એક નવું પડકાર ઊભું કરી રહી છે. રોકાણકારો માટે, આ બદલાવ એ વાત પર ભાર મૂકે છે કે માનવ-નિર્મિત અને પ્રોપરાઇટરી ડેટાસેટ્સનું મહત્વ વધી રહ્યું છે, કારણ કે AI યુગમાં ગુણવત્તાયુક્ત ડેટા એક દુર્લભ સંપત્તિ બની ગયો છે.
ડેટા પ્રોવેનન્સ (Data Provenance) તરફ બદલાવ
છેલ્લા કેટલાક વર્ષોથી, AI ની રેસ ડેટાની માત્રા (Quantity) પર આધારિત હતી. મોટાભાગના મોટા ભાષા મોડેલો (Large Language Models) ને તાલીમ આપવા માટે ઇન્ટરનેટ પરથી શક્ય તેટલો ડેટા એકત્રિત કરવાનો લક્ષ્યાંક હતો. જોકે, AI-જનરેટેડ કન્ટેન્ટના ઉદયથી 'મોડેલ કોલેપ્સ' (Model Collapse) નું ટેકનિકલ જોખમ ઊભું થયું છે. જો ભવિષ્યના AI મોડેલો મુખ્યત્વે અગાઉના AI મોડેલો દ્વારા બનાવેલ ટેક્સ્ટ પર તાલીમ પામે, તો આઉટપુટની ગુણવત્તા, ચોકસાઈ અને સૂક્ષ્મતા સમય જતાં ઘટી શકે છે.
આના કારણે રોકાણકારો માટે એક નવો શબ્દ - ડેટા પ્રોવેનન્સ - સામે આવ્યો છે. આ માહિતીના મૂળને ચકાસવાની ક્ષમતાનો ઉલ્લેખ કરે છે - ખાસ કરીને, શું ડેટા મનુષ્યો, નિષ્ણાતો અથવા ચકાસાયેલ પ્રોપરાઇટરી સિસ્ટમ્સ દ્વારા બનાવવામાં આવ્યો હતો. જેમ જેમ ઓપન વેબ સિન્થેટિક (Synthetic) અવાજથી ભરાઈ રહ્યું છે, તેમ 'ક્લીન' (Clean) અથવા ચકાસાયેલ ડેટાનું મૂલ્ય વધી રહ્યું છે. વિશ્લેષકો સૂચવે છે કે AI ફર્મ્સ માટે સ્પર્ધાત્મક લાભ સમગ્ર ઇન્ટરનેટને સ્ક્રેપ (Scrape) કરવાથી નહીં, પરંતુ ઉચ્ચ-ગુણવત્તાવાળા, નોન-AI સ્ત્રોતો (Non-AI Sources) સુધી પહોંચવાથી આવશે.
રોકાણકારો માટે: પ્રોપરાઇટરી ડેટાનું મહત્વ
આ ટ્રેન્ડ AI કંપનીઓ કેવી રીતે તાલીમ સામગ્રી મેળવશે તે અંગે પુનર્વિચાર કરવા મજબૂર કરી રહ્યું છે. પ્રોપરાઇટરી ડેટા માટે એક ઉભરતું બજાર છે - એવી માહિતી જે ખાનગી, ચકાસાયેલ અને સાર્વજનિક વેબ પર સરળતાથી ઉપલબ્ધ નથી. જે કંપનીઓ અનન્ય સંચાર, ગ્રાહક વર્કફ્લો, વ્યાવસાયિક જર્નલ્સ અથવા વિશિષ્ટ ઉદ્યોગ ડેટાના વિશાળ આર્કાઇવ ધરાવે છે, તેઓ શોધી રહ્યા છે કે તેમના આર્કાઇવ્સ ડિજિટલ મૂડીના નવા સ્વરૂપ બની ગયા છે.
રોકાણકારો હવે એવી ફર્મ્સ પર વધુ ધ્યાન આપી રહ્યા છે જે આ 'ડેટા મોટ્સ' (Data Moats) ધરાવે છે. ઉદાહરણ તરીકે, મોડેલોને તાલીમ આપવા માટે ખાનગી વ્યવસાય ડેટા ખરીદવામાં રસ વધી રહ્યો છે. આ ફેરફાર સૂચવે છે કે ટોચ-સ્તરના AI વિકસાવવાનો ખર્ચ વધી શકે છે, કારણ કે કંપનીઓ મફત, સાર્વજનિક ડેટાથી દૂર જઈને પેઇડ, પ્રમાણિત અને ઉચ્ચ-ઇન્ટિગ્રિટી ડેટાસેટ્સ તરફ જઈ શકે છે જેથી તેમના મોડેલો સ્પર્ધાત્મક અને વિશ્વસનીય રહે.
જોખમો અને ભવિષ્યનું નિરીક્ષણ
જ્યારે ડેટાની માંગ તકો ઊભી કરે છે, ત્યારે તે નવા જોખમો પણ રજૂ કરે છે. વાસ્તવિક માનવ સામગ્રી અને ઉચ્ચ-ગુણવત્તાવાળી AI સામગ્રી વચ્ચે તફાવત કરવો વધુને વધુ મુશ્કેલ અને ખર્ચાળ બની રહ્યું છે. જે કંપનીઓ તેમના તાલીમ ડેટાને અસરકારક રીતે ફિલ્ટર કરવામાં નિષ્ફળ જાય છે તેઓ તેમના ઉત્પાદનોના પ્રદર્શનમાં ઘટાડો અનુભવી શકે છે, સંભવતઃ ક્લીનર ડેટા પાઇપલાઇન્સ ધરાવતા સ્પર્ધકો સામે બજાર હિસ્સો ગુમાવી શકે છે.
આ ક્ષેત્રનું નિરીક્ષણ કરતા રોકાણકારોએ કંપનીઓ તેમની ડેટા સોર્સિંગ વ્યૂહરચનાઓ (Data Sourcing Strategies) કેવી રીતે રિપોર્ટ કરે છે તેનો ટ્રેક રાખવો જોઈએ. આગામી ત્રિમાસિક ગાળા માટે મુખ્ય નિરીક્ષણ એ રહેશે કે શું વ્યવસાયો વોલ્યુમ દ્વારા સ્કેલિંગ (Scaling) પર ધ્યાન કેન્દ્રિત કરે છે કે પછી તેઓ ઉચ્ચ-ખર્ચ, ઉચ્ચ-મૂલ્યવાળા ડેટા ભાગીદારી તરફ વળે છે. તાલીમ ડેટાની ગુણવત્તા અને ઉત્પત્તિની ખાતરી કરવાની ક્ષમતા AI-સંચાલિત વ્યવસાય મોડેલોની લાંબા ગાળાની સદ્ધરતામાં કેન્દ્રીય પરિબળ બનવાની સંભાવના છે.
