
గ్లోబల్ కమ్యూనికేషన్ కోసం ఒక అద్భుతమైన లీపులో, Meta యొక్క ఫండమెంటల్ AI రీసెర్చ్ (FAIR) బృందం 1,600 కంటే ఎక్కువ మాట్లాడే భాషలను అర్థం చేసుకోగల మరియు లిప్యంతరీకరించగల ఓపెన్ సోర్స్ స్పీచ్ రికగ్నిషన్ సిస్టమ్ అయిన Omnilingual ASRని ఆవిష్కరించింది. AI- నడిచే ట్రాన్స్క్రిప్షన్ సాధనాల ద్వారా మునుపెన్నడూ సపోర్ట్ చేయని దాదాపు 500 తక్కువ-వనరుల భాషలు ఇందులో ఉన్నాయి.
ఈ సిస్టమ్ డిజిటల్ స్పీచ్ టెక్నాలజీకి యాక్సెస్ను ప్రజాస్వామ్యీకరించడం లక్ష్యంగా పెట్టుకుంది, ప్రత్యేకించి ప్రధాన AI మోడల్లు తరచుగా పట్టించుకోని భాషా సంఘాల కోసం. X పై ఒక పోస్ట్లో, Meta యొక్క AI చీఫ్ అలెగ్జాండర్ వాంగ్, “Meta Omnilingual ASR స్పీచ్ రికగ్నిషన్ను 1,600+ భాషలకు విస్తరింపజేస్తుంది, మునుపెన్నడూ సపోర్ట్ చేయని 500 భాషలతో సహా, నిజమైన యూనివర్సల్ AI వైపు ఒక ప్రధాన అడుగు. మేము పూర్తి నమూనాలు మరియు డేటాసెట్ను ఓపెన్ సోర్సింగ్ చేస్తున్నాము.”
సార్వత్రిక అవగాహన వైపు ఒక అడుగు
ప్రధానంగా ఆంగ్లం, మాండరిన్ లేదా స్పానిష్ వంటి ఆధిపత్య భాషలకు ప్రాధాన్యతనిచ్చే సాంప్రదాయిక వ్యవస్థల వలె కాకుండా, Omnilingual ASR తక్కువ పత్రాలు లేని భాషలకు డిజిటల్ విభజనను తగ్గించడానికి బయలుదేరింది. ఈ తక్కువ-వనరుల భాషల్లో తరచుగా తగినంత రికార్డింగ్లు మరియు డేటాసెట్లు ఉండవు, సాంప్రదాయ AI మోడల్లు ఖచ్చితమైన ట్రాన్స్క్రిప్షన్ నమూనాలను నేర్చుకోవడం కష్టతరం చేస్తుంది.
Meta యొక్క కొత్త మోడల్ ఈ శూన్యతను పూరించడానికి ప్రయత్నిస్తుంది, డిజిటల్ పర్యావరణ వ్యవస్థలలో చాలా కాలంగా తక్కువ ప్రాతినిధ్యం ఉన్న భాషలను కలిగి ఉన్న కమ్యూనిటీల కోసం చేరికను అందిస్తుంది. ప్రాజెక్ట్ను ఓపెన్-సోర్సింగ్ చేయడం ద్వారా, స్పీచ్ రికగ్నిషన్, ట్రాన్స్లేషన్ మరియు యాక్సెసిబిలిటీ టెక్నాలజీలలో ఆవిష్కరణలు చేయడానికి ప్రపంచ పరిశోధకులు మరియు డెవలపర్లకు అధికారం ఇవ్వాలని Meta భావిస్తోంది.
సర్వభాషా ASR ఎలా పనిచేస్తుంది
ఈ ఆవిష్కరణ యొక్క ప్రధాన భాగంలో ఓమ్నిలింగ్యువల్ wav2vec 2.0 ఉంది, ఇది భారీ ఏడు-బిలియన్-పారామీటర్ బహుభాషా మోడల్-ఇప్పటి వరకు మెటా యొక్క అతిపెద్ద స్పీచ్ రికగ్నిషన్ విడుదలలలో ఒకటి. ప్రపంచవ్యాప్తంగా సేకరించిన విభిన్న డేటాసెట్లపై మోడల్ శిక్షణ పొందింది, స్వరాలు, మాండలికాలు మరియు ప్రసంగ వైవిధ్యాలలో అనుకూలతను నిర్ధారిస్తుంది.
స్థానిక మాట్లాడేవారి నుండి ప్రామాణికమైన ప్రసంగ నమూనాలను సేకరించడానికి మొజిల్లా ఫౌండేషన్ యొక్క కామన్ వాయిస్, లాన్ఫ్రికా మరియు నైజావాయిసెస్తో సహా అనేక ప్రపంచ కార్యక్రమాలతో మెటా సహకరించింది. ల్యాబ్-క్యూరేటెడ్ డేటాపై ఎక్కువగా ఆధారపడే మునుపటి సిస్టమ్ల మాదిరిగా కాకుండా, ఓమ్నిలింగ్వల్ ASR వాస్తవ-ప్రపంచ ఆడియోను కలిగి ఉంటుంది, దీని ఫలితంగా మాట్లాడే భాష యొక్క వాస్తవిక మరియు సాంస్కృతికంగా ఖచ్చితమైన ప్రాతినిధ్యం లభిస్తుంది.
ఖచ్చితత్వం మరియు సవాళ్లు ముందుకు
దాని విస్తృత పరిధి ఉన్నప్పటికీ, భాషలలో ఖచ్చితత్వం మారుతుందని మెటా గుర్తించింది. అధిక మరియు మధ్యస్థ-వనరుల భాషలలో 95% కంటే ఎక్కువ 10% కంటే తక్కువ అక్షర దోష రేటు (CER)ని సాధించినట్లు కంపెనీ నివేదించింది. ఏది ఏమైనప్పటికీ, తక్కువ-వనరుల భాషలలో, కేవలం 36% మాత్రమే అదే ప్రమాణాన్ని చేరుకున్నారు-అండర్ డాక్యుమెంట్ చేయబడిన భాషా సంఘాల కోసం బలమైన AI వ్యవస్థలను నిర్మించడంలో నిరంతర ఇబ్బందులను హైలైట్ చేస్తుంది.
అయినప్పటికీ, Omnilingual ASR యొక్క ఓపెన్-సోర్స్ స్వభావం పరిశోధకులకు మోడల్ను నిరంతరం మెరుగుపరచడానికి మరియు మెరుగుపరచడానికి అవకాశాన్ని అందిస్తుంది, ముఖ్యంగా తక్కువ-వనరుల భాషలకు.
సూపర్ ఇంటెలిజెన్స్ కోసం పునాది వేయడం
మెటా యొక్క తాజా ఆవిష్కరణ సంస్థ యొక్క సూపర్ ఇంటెలిజెన్స్ ప్రాజెక్ట్కి ఒక మెట్టు కావచ్చని నిపుణులు సూచిస్తున్నారు-ఇది మానవుని వంటి అవగాహన మరియు తార్కికం చేయగల AI సిస్టమ్ల యొక్క ప్రతిష్టాత్మక సాధన. ప్రపంచ భాషలపై పట్టు సాధించడం ద్వారా, మెటా AI కోసం భాషాపరమైన పునాదిని సమర్థవంతంగా నిర్మిస్తోంది, ఇది సందర్భం, సంస్కృతి మరియు భావోద్వేగాలను గ్రహించగలదు-మానవ-స్థాయి అభిజ్ఞా మేధస్సుకు దగ్గరగా ఉంటుంది.
సర్వభాషా ASRతో, Meta కేవలం AIకి వినడం నేర్పడం మాత్రమే కాదు-ఇది అన్ని భాషా వైవిధ్యంలో మానవత్వాన్ని అర్థం చేసుకోవడం నేర్పుతుంది.




