আইআইএসসি বেঙ্গালুরু 'শ্রাবণী' নামে একটি বহুভাষিক ভারতীয় বাক-শনাক্তকরণ এআই মডেল প্রকাশ করেছে।
২০২৬ সালের ১৩ আগস্ট, বেঙ্গালুরুর Indian Institute of Science (IISc) স্পায়ার ল্যাব কর্তৃক ARTPARK এর সহযোগিতায় এবং গুগলের সহায়তায় 'SraVaani' নামে একটি ওপেন-সোর্স বহুভাষিক স্পিচ রিকগনিশন মডেল উন্মোচন করে। শ্রাবণী ২০টি তফসিলি ভাষা ও গারো, অঙ্গিকা, তুলু ইত্যাদি ৪৫টি আঞ্চলিক ভাষাসহ মোট ৬৫টি ভারতীয় ভাষা ও উপভাষায় কথিত শব্দকে টেক্সটে রূপান্তর করতে পারে এবং ১০টি লিপি সমর্থন করে। এতে স্বয়ংক্রিয় ভাষা শনাক্তকরণের সুবিধা রয়েছে, যার ফলে ভাষা নির্বাচন ম্যানুয়ালি করার প্রয়োজন হয় না। মডেলটি MIT লাইসেন্সের আওতায় Hugging Face প্ল্যাটফর্মে মুক্ত, যা বৃহত্তর ব্যবহার ও পরিবর্তনের সুযোগ দেয়। এই উদ্ভাবন প্রজেক্ট বাণী-র অধীনে ২৮টি রাজ্যের ১৬৫টি জেলার ১,৫৬,০০০ মানুষের কাছ থেকে সংগৃহীত ৩১,০০০ ঘণ্টারও বেশি স্পিচ ডেটা ব্যবহার করে তৈরি, যা সীমিত সম্পদযুক্ত ভারতীয় ভাষাগুলির জন্য উন্নত স্পিচ প্রযুক্তি প্রদান করে।
মূল তথ্য
- মুক্তির তারিখ: ১৩ আগস্ট ২০২৬
- উন্নয়নকারী: আইআইএসসি বেঙ্গালুরুর SPIRE ল্যাব, ARTPARK-এর সহযোগিতায়, গুগলের পৃষ্ঠপোষকতায়।
- মডেলের নাম: শ্রাবণী
- ভাষা ও উপভাষাগুলির সংখ্যা: মোট ৬৫ — যার মধ্যে রয়েছে ২০টি তফসিলি ভারতীয় ভাষা এবং গারো, অঙ্গিকা, চাকমা, কোকবোরোক, তুলু, বুন্দেলি এবং বাজ্জিকা সহ ৪৫টি আঞ্চলিক ভাষা ও উপভাষা।
- সমর্থিত লিপি: ১০টি লিপি
- বৈশিষ্ট্য: স্বয়ংক্রিয় ভাষা শনাক্তকরণ, যা স্পিচ রিকগনিশনের পূর্বে ম্যানুয়াল ভাষা নির্বাচনের প্রয়োজনীয়তা দূর করে।
- প্রাপ্যতা: MIT লাইসেন্সের অধীনে ওপেন-সোর্স, Hugging Face প্ল্যাটফর্মে উপলব্ধ।
- প্রশিক্ষণের ডেটা উৎস: প্রজেক্ট বাণী স্পিচ কর্পাস, যেখানে ২৮টি রাজ্যের ১৬৫টি জেলার ১,৫৬,০০০ ব্যক্তির ৩১,০০০ ঘণ্টারও বেশি স্বাভাবিক কথোপকথনের রেকর্ড রয়েছে।
- কর্মক্ষমতা: গারো ভাষায় ৯.৫% শব্দ ত্রুটি হার, যা পরবর্তী সেরা সিস্টেমের ৬৯.৪% এর চেয়ে উল্লেখযোগ্য উন্নতি।
পটভূমি ও প্রেক্ষাপট
স্পিচ রিকগনিশন প্রযুক্তি কথিত ভাষাকে টেক্সটে রূপান্তর করে, যা ন্যাচারাল ল্যাঙ্গুয়েজ প্রসেসিং এবং সহায়ক প্রযুক্তিসহ বিভিন্ন এআই অ্যাপ্লিকেশনের জন্য মৌলিক প্রযুক্তি। ভারতের সমৃদ্ধ ভাষাগত বৈচিত্র্যে অনেক ভাষার জন্য বড় ডিজিটাল ডেটাসেটের অভাব একটি বৃহৎ চ্যালেঞ্জ। প্রজেক্ট বাণী একটি অগ্রণী ভাষা ডেটা সংগ্রহ প্রকল্প, যা দেশব্যাপী ভাষা ও উপভাষার বহুমাত্রিক ডেটা সংগ্রহে ভূ-কেন্দ্রিক কৌশল অবলম্বন করেছে। এই সহযোগিতার ফলশ্রুতিতে সৃষ্টি হয়েছে শ্রাবণী, একটি উন্নত বহুভাষিক স্বয়ংক্রিয় স্পিচ রিকগনিশন (ASR) মডেল, যা বাস্তব কথোপকথন ডেটা একীভূত করে বিভিন্ন ভাষা ও উপভাষায় শনাক্তকরণের নির্ভুলতা বাড়িয়েছে।
পরীক্ষার জন্য এর গুরুত্ব / প্রাসঙ্গিকতা
শ্রাবণীর মুক্তি ভারতের AI এবং প্রযুক্তি ক্ষেত্রে একটি গুরুত্বপূর্ণ অগ্রগতি, যা সাম্প্রতিক ঘটনার, প্রযুক্তির এবং ভাষাগত বৈচিত্র্যের ওপর কেন্দ্র করে প্রতিযোগিতামূলক পরীক্ষাগুলোর জন্য প্রাসঙ্গিক। এর অন্তর্ভুক্ত বিষয়সমূহ হল আইআইএসসি বেঙ্গালুরু ও সরকারি উদ্যোগের ভূমিকা, ভাষাসংখ্যালঘুতা ও বিস্তার, প্রজেক্ট বাণীর জেলা ভিত্তিক কথন তথ্যের অন্তর্ভুক্তি, এবং উদ্ভাবন বৃদ্ধিতে ওপেন-সোর্স লাইসেন্সিংয়ের গুরুত্ব। এসব বিষয় ডিজিটাল অন্তর্ভুক্তি, সীমিত সম্পদের ভাষাগুলোর প্রযুক্তিগত ক্ষমতায়ন ও ভারতের বহুভাষিক AI মডেল তৈরির নেতৃত্বের দিক নির্দেশ করে।
মনে রাখার বিষয়সমূহ
- শ্রাবণী ১৩ আগস্ট ২০২৬ এ আইআইএসসি বেঙ্গালুরুর SPIRE ল্যাব, ARTPARK এবং গুগলের সহযোগিতায় উদ্বোধন করা হয়।
- মডেলটি মোট ৬৫টি ভারতীয় ভাষা ও উপভাষা সমর্থন করে, যার মধ্যে ২০টি তফসিলি এবং ৪৫টি আঞ্চলিক ভাষা অন্তর্ভুক্ত।
- এটি ১০টি লিপি সমর্থন করে এবং স্বয়ংক্রিয় ভাষা শনাক্তকরণ ব্যবস্থার মাধ্যমে ব্যবহার সুলভ করেছে।
- প্রজেক্ট বাণী থেকে সংগৃহীত ৩১,০০০ ঘণ্টারও বেশি বাস্তব কথোপকথনের ডেটার ওপর প্রশিক্ষণপ্রাপ্ত।
- শ্রাবণী MIT লাইসেন্সের অধীনে ওপেন-সোর্স যা Hugging Face প্ল্যাটফর্মে উপলব্ধ।
- গারো ভাষায় মাত্র ৯.৫% শব্দ ত্রুটির হার, যা সীমিত সম্পদের ভাষাগুলোর জন্য উচ্চতর কর্মদক্ষতার প্রমাণ।
- প্রজেক্ট বাণীর ভূ-কেন্দ্রিক কৌশল শুধু নামকরা নয়, বরং বৈচিত্র্যময় উপভাষা ও সমাজভাষাতাত্ত্বিক প্রতিনিধিত্ব নিশ্চিত করে।
- এই উদ্যোগ বহুভাষিক এবং কম পরিচিত ভারতীয় ভাষার জন্য বিস্তৃত AI গবেষণা এবং সহায়ক প্রযুক্তি উন্নয়নে সমর্থন প্রদান করে।