দীর্ঘ কোনো বৈঠক বা আলোচনায় একসাথে একাধিক ব্যক্তি কথা বললে এবং কথোপকথনে বিভিন্ন ভাষার মিশেল থাকলে, পরে অডিও রেকর্ডিং থেকে কে কী বলেছেন তা আলাদা করে শনাক্ত করা বেশ জটিল কাজ। ঠিক এই সমস্যা সমাধানের লক্ষ্য নিয়েই নতুন একটি এআই মডেল উন্মোচন করেছে মেটা, যার নাম ‘মিউজ ভয়েস ট্রান্সক্রাইব’।
মঙ্গলবার (১ সেপ্টেম্বর) মেটার সুপারইন্টেলিজেন্স ল্যাবস এই মডেলটি চালু করে। প্রতিষ্ঠানটির ভাষ্যমতে, এটিই তাদের তৈরি প্রথম ‘রিয়েল-টাইম অডিও পারসেপশন মডেল’।
মডেলটি একইসাথে স্ট্রিমিং স্পিচ রিকগনিশন (কথাকে সাথে সাথে লেখায় রূপান্তর), স্পিকার ডায়ারাইজেশন (কে কথা বলছেন তা শনাক্তকরণ) এবং এন্ডপয়েন্টিং (একজন বক্তার কথা কখন শেষ হলো তা বোঝা)- এই তিনটি কাজ একসাথে সম্পন্ন করতে পারে, যেখানে সাধারণত এসব কাজের জন্য আলাদা আলাদা তিনটি সিস্টেম ব্যবহার করা হয়। মেটার দাবি, একটি রেকর্ডিংয়ে ২০ জনের বেশি ভিন্ন বক্তার কথাও এটি আলাদাভাবে চিহ্নিত করতে সক্ষম।
মডেলটির কার্যকারিতার একটি বড় দিক হলো, এটি অডিওকে ৮০ মিলিসেকেন্ডের ছোট ছোট অংশে (প্রতি সেকেন্ডে সাড়ে ১২টি অংশ) ভাগ করে প্রক্রিয়া করে এবং প্রতিটি অংশ শোনার পর সিদ্ধান্ত নেয়- আরও একটু শোনা দরকার, নাকি এখনই পরের শব্দটি লিখে ফেলা যায়।
কোনো শব্দ স্পষ্ট হলে মডেলটি দ্রুত সেটিকে লেখায় রূপান্তর করে, আবার উচ্চারণ অস্পষ্ট হলে বা পরের শব্দ না শুনে অর্থ নির্ধারণ কঠিন হলে কিছুটা বেশি সময় নিয়ে বিশ্লেষণ করে। রিইনফোর্সমেন্ট লার্নিং ব্যবহার করে মেটা এমনভাবে মডেলটি প্রশিক্ষণ দিয়েছে, যাতে নির্ভুলতা ও দ্রুততা- দুটোরই ভারসাম্য বজায় থাকে, এবং কেবল কঠিন শব্দের ক্ষেত্রেই মডেলটি বাড়তি সময় নেয়।
ভাষাগত সক্ষমতার দিক থেকে, মডেলটি ৭০টির বেশি ভাষার তথ্য দিয়ে প্রশিক্ষিত হয়েছে এবং লঞ্চের সময় ২৫টির বেশি ভাষায় এর কার্যকারিতা যাচাই করা হয়েছে। এতে ‘কোড-সুইচিং’ শনাক্তের সক্ষমতাও রয়েছে- অর্থাৎ একজন বক্তা কথার মাঝপথে এক ভাষা থেকে অন্য ভাষায় চলে গেলেও মডেলটি তা সঠিকভাবে ধরতে পারে।
পাশাপাশি এটি এক ঘণ্টার বেশি দৈর্ঘ্যের অডিওও প্রক্রিয়া করতে সক্ষম, এবং নির্দিষ্ট শব্দ, ভাষা বা প্রসঙ্গ আগে থেকে জানিয়ে দিলে নির্ভুলতা আরও বাড়ানো যায়।
মেটা জানিয়েছে, স্ট্রিমিং স্পিচ-টু-টেক্সট বিষয়ক আর্টিফিশিয়াল অ্যানালাইসিস বেঞ্চমার্কে এবং পাবলিক ডায়ারাইজেশন বেঞ্চমার্কেও এই মুহূর্তে শীর্ষে রয়েছে মিউজ ভয়েস ট্রান্সক্রাইব। তবে উল্লেখযোগ্য বিষয় হলো, এখনো এর সম্পর্কে কোনো সম্পূর্ণ স্বতন্ত্র (থার্ড-পার্টি) বেঞ্চমার্ক প্রকাশিত হয়নি, যা দিয়ে লিব্রিস্পিচ বা আর্নিংস-কল ট্রান্সক্রিপশনের মতো প্রচলিত মানদণ্ডের সঙ্গে সরাসরি তুলনা করা যায়।
মিউজ ভয়েস ট্রান্সক্রাইব বর্তমানে মেটার মডেল এপিআইয়ের মাধ্যমে ‘muse-voice-transcribe-1.0’ নামে ব্যবহার করা যাচ্ছে, এবং এতে জিরো ডেটা রিটেনশন সুবিধাও রয়েছে। প্রতি হাজার মিনিট অডিওর জন্য এর মূল্য ৩ ডলার, যা ঘণ্টাপ্রতি হিসাবে দাঁড়ায় প্রায় ০.১৮ ডলার।
মডেলটি ইতিমধ্যে ম্যাকের জন্য তৈরি মেটা এআই অ্যাপের ডিকটেশন সুবিধায় সক্রিয় রয়েছে- ব্যবহারকারীরা Fn কি চেপে ধরে যেকোনো অ্যাপ্লিকেশনে সরাসরি কথা বলে লেখা তৈরি করতে পারছেন। এ ছাড়া মেটার কোডিং সহায়ক টুল মিউজ কোডেও এটি ব্যবহার করা হচ্ছে, যা দিয়ে ডেভেলপাররা ভয়েস কমান্ডে কোডিং-সংক্রান্ত কাজ করতে পারবেন।
বিশ্লেষকদের মতে, অনলাইন বৈঠক, সংবাদ সাক্ষাৎকার, শিক্ষা, গ্রাহকসেবা ও ভয়েসভিত্তিক এআই ব্যবস্থায় এই প্রযুক্তির ব্যবহার দ্রুত বাড়তে পারে, বিশেষ করে একাধিক বক্তা ও ভাষার দীর্ঘ কথোপকথন দ্রুত ও নির্ভুলভাবে লিখিত রূপে সংরক্ষণের ক্ষেত্রে।



