భారతదేశంలో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ (AI) అందుబాటును పెంచే లక్ష్యంతో, ఇండియన్ ఇన్స్టిట్యూట్ ఆఫ్ సైన్స్ (IISc) "SraVaani" అనే కొత్త ఓపెన్-సోర్స్ స్పీచ్ AI మోడల్ను విడుదల చేసింది. ఈ మోడల్ **65** భారతీయ భాషలు, యాసలను అర్థం చేసుకుంటుంది. దీని వల్ల సుమారు **25 కోట్ల** మందికి మేలు జరుగుతుంది. ARTPARK, Google సహకారంతో దీన్ని అభివృద్ధి చేశారు.
భాషా అడ్డంకులను తొలగించే AI
ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ (AI) రంగంలో భాషాపరమైన అంతరాలను తగ్గించడానికి, ఇండియన్ ఇన్స్టిట్యూట్ ఆఫ్ సైన్స్ (IISc) "SraVaani" అనే ఒక సరికొత్త స్పీచ్ రికగ్నిషన్ AI మోడల్ను తీసుకొచ్చింది. IIScలోని SPIRE Lab, ARTPARK భాగస్వామ్యంతో, Google సహకారంతో ఈ మోడల్ను రూపొందించింది. ఇది 65 విభిన్న భారతీయ భాషలు, యాసలను అర్థం చేసుకోగలదు.
ప్రపంచవ్యాప్త AI మోడల్స్ పెద్దగా పట్టించుకోని, చారిత్రాత్మకంగా తక్కువ సేవలు అందుకున్న భాషలను మాట్లాడే 250 మిలియన్లకు పైగా ప్రజల అవసరాలను తీర్చడమే దీని ముఖ్య ఉద్దేశ్యం. ప్రస్తుతం ఉన్న చాలా స్పీచ్ టెక్నాలజీలు ప్రధానంగా షెడ్యూల్డ్ భాషలపైనే దృష్టి పెడితే, SraVaani లో 20 షెడ్యూల్డ్ భాషలతో పాటు అదనంగా 45 ప్రాంతీయ భాషలు కూడా ఉన్నాయి. ఈ మోడల్ను Hugging Face ప్లాట్ఫామ్లో ఓపెన్-సోర్స్గా విడుదల చేయడం వల్ల, డెవలపర్లు, స్టార్టప్లు దీన్ని ఉచితంగా ఉపయోగించుకోవచ్చు. MIT లైసెన్స్ కింద అందుబాటులో ఉండటం వల్ల, స్థానిక భారతీయ అప్లికేషన్లను నిర్మించే కంపెనీలకు ఖర్చు, సాంకేతిక అడ్డంకులు తగ్గుతాయి.
సాంకేతిక పునాది & పనితీరు
ఈ మోడల్ "Vaani" అనే భారీ డేటాసెట్పై ఆధారపడి నిర్మించబడింది. ఈ ప్రాజెక్ట్ కింద, భారతదేశంలోని 165 జిల్లాల నుండి 156,000 మంది వ్యక్తుల నుండి 31,000 గంటలకు పైగా సహజమైన సంభాషణలను సేకరించారు. ఇక్కడ ముఖ్యంగా, రిహార్సల్ చేసిన ఆడియో కాకుండా, నిజ జీవితంలో సహజంగా మాట్లాడే మాటలను రికార్డ్ చేయడంపై దృష్టి సారించారు. ఈ శిక్షణా డేటా వల్ల, ప్రస్తుతం ఉన్న సిస్టమ్స్ కంటే అరుదైన భాషల్లో ఈ మోడల్ మెరుగైన పనితీరు కనబరుస్తుంది. ఉదాహరణకు, గారో భాషలో పరీక్షించినప్పుడు, SraVaani 9.5% వర్డ్ ఎర్రర్ రేటును సాధించింది. ఇది ఇతర సిస్టమ్స్తో పోలిస్తే చాలా పెద్ద మెరుగుదల, ఎందుకంటే ఆ సిస్టమ్స్ ప్రాంతీయ యాసలలో తరచుగా అధిక దోషాలతో ఇబ్బంది పడతాయి.
భారత AI ఎకోసిస్టమ్పై ప్రభావం
భారతీయ టెక్నాలజీ రంగానికి, SraVaani విడుదల "Sovereign AI" నిర్మాణంలో ఒక ముందడుగు. అంటే, ప్రపంచ మోడల్స్పై ఆధారపడకుండా, స్థానిక అవసరాలకు అనుగుణంగా టెక్నాలజీని నిర్మించుకోవడం. ప్రాంతీయ భాషల సూక్ష్మ నైపుణ్యాలను అర్థం చేసుకోలేని గ్లోబల్ మోడల్స్ కంటే ఇది చాలా కీలకం. మాన్యువల్ లాంగ్వేజ్ ట్యాగింగ్ అవసరాన్ని తొలగించి, ఆటోమేటెడ్ లాంగ్వేజ్ ఐడెంటిఫికేషన్ను అందించడం ద్వారా, SraVaani డెవలపర్లు విస్తృతమైన సాంకేతిక నైపుణ్యం అవసరం లేకుండానే తమ యాప్లలో వాయిస్ ఫీచర్లను జోడించడానికి సహాయపడుతుంది. ముఖ్యంగా బ్యాంకింగ్, ఇ-గవర్నెన్స్, ఇ-కామర్స్ వంటి రంగాలలో, వినియోగదారులను వారి మాతృభాషలో చేరుకోవడం ఒక ముఖ్యమైన వృద్ధి వ్యూహం కాబట్టి, ఇది చాలా విలువైనది.
పరిశీలించాల్సిన సవాళ్లు
ఈ మోడల్ ఆశాజనకంగా ఉన్నప్పటికీ, 65 విభిన్న భాషలలో అధిక ఖచ్చితత్వాన్ని కొనసాగించడం ఒక సంక్లిష్టమైన సవాలు అని టెక్నాలజీ నిపుణులు అంటున్నారు. నిజ జీవిత పరిస్థితులలో, రద్దీ వాతావరణంలో నేపథ్య శబ్దం లేదా విభిన్న యాసలు వంటివి స్పీచ్ రికగ్నిషన్ టూల్స్ పనితీరును ప్రభావితం చేస్తాయి. కంపెనీలు, డెవలపర్లు SraVaani ని వాణిజ్య అనువర్తనాల్లో పరీక్షించడం ప్రారంభించినప్పుడు, విభిన్న జనాభా, ఆడియో వాతావరణాలలో మోడల్ స్థిరత్వం దాని విస్తృత స్వీకరణకు కీలక అంశం అవుతుంది. రాబోయే నెలల్లో, ఈ ఓపెన్-సోర్స్ సాధనం స్థానిక భాషా-కేంద్రీకృత డిజిటల్ సేవల అభివృద్ధి ఖర్చును ఎలా ప్రభావితం చేస్తుందో ఇన్వెస్టర్లు, పరిశ్రమ భాగస్వాములు గమనిస్తారు.
