...|...|...

তথ্যপ্রযুক্তি

একাধিক ভাষার কথোপকথন লাইভ টেক্সটে বদলাবে মেটার নতুন এআই

টাইমস টুুডে ডেস্ক
প্রকাশ: ৩ সেপ্টেম্বর ২০২৬, বিকেল ৩:০৪ | আপডেট: ৬ সেপ্টেম্বর ২০২৬, সকাল ১১:৪০
Shares
একাধিক ভাষার কথোপকথন লাইভ টেক্সটে বদলাবে মেটার নতুন এআই

ছবি: এআই জেনারেটেড

দীর্ঘ কোনো বৈঠক বা আলোচনায় একসাথে একাধিক ব্যক্তি কথা বললে এবং কথোপকথনে বিভিন্ন ভাষার মিশেল থাকলে, পরে অডিও রেকর্ডিং থেকে কে কী বলেছেন তা আলাদা করে শনাক্ত করা বেশ জটিল কাজ। ঠিক এই সমস্যা সমাধানের লক্ষ্য নিয়েই নতুন একটি এআই মডেল উন্মোচন করেছে মেটা, যার নাম ‘মিউজ ভয়েস ট্রান্সক্রাইব’।

মঙ্গলবার (১ সেপ্টেম্বর) মেটার সুপারইন্টেলিজেন্স ল্যাবস এই মডেলটি চালু করে। প্রতিষ্ঠানটির ভাষ্যমতে, এটিই তাদের তৈরি প্রথম ‘রিয়েল-টাইম অডিও পারসেপশন মডেল’। 

মডেলটি একইসাথে স্ট্রিমিং স্পিচ রিকগনিশন (কথাকে সাথে সাথে লেখায় রূপান্তর), স্পিকার ডায়ারাইজেশন (কে কথা বলছেন তা শনাক্তকরণ) এবং এন্ডপয়েন্টিং (একজন বক্তার কথা কখন শেষ হলো তা বোঝা)- এই তিনটি কাজ একসাথে সম্পন্ন করতে পারে, যেখানে সাধারণত এসব কাজের জন্য আলাদা আলাদা তিনটি সিস্টেম ব্যবহার করা হয়। মেটার দাবি, একটি রেকর্ডিংয়ে ২০ জনের বেশি ভিন্ন বক্তার কথাও এটি আলাদাভাবে চিহ্নিত করতে সক্ষম।

মডেলটির কার্যকারিতার একটি বড় দিক হলো, এটি অডিওকে ৮০ মিলিসেকেন্ডের ছোট ছোট অংশে (প্রতি সেকেন্ডে সাড়ে ১২টি অংশ) ভাগ করে প্রক্রিয়া করে এবং প্রতিটি অংশ শোনার পর সিদ্ধান্ত নেয়- আরও একটু শোনা দরকার, নাকি এখনই পরের শব্দটি লিখে ফেলা যায়।

কোনো শব্দ স্পষ্ট হলে মডেলটি দ্রুত সেটিকে লেখায় রূপান্তর করে, আবার উচ্চারণ অস্পষ্ট হলে বা পরের শব্দ না শুনে অর্থ নির্ধারণ কঠিন হলে কিছুটা বেশি সময় নিয়ে বিশ্লেষণ করে। রিইনফোর্সমেন্ট লার্নিং ব্যবহার করে মেটা এমনভাবে মডেলটি প্রশিক্ষণ দিয়েছে, যাতে নির্ভুলতা ও দ্রুততা- দুটোরই ভারসাম্য বজায় থাকে, এবং কেবল কঠিন শব্দের ক্ষেত্রেই মডেলটি বাড়তি সময় নেয়।

ভাষাগত সক্ষমতার দিক থেকে, মডেলটি ৭০টির বেশি ভাষার তথ্য দিয়ে প্রশিক্ষিত হয়েছে এবং লঞ্চের সময় ২৫টির বেশি ভাষায় এর কার্যকারিতা যাচাই করা হয়েছে। এতে ‘কোড-সুইচিং’ শনাক্তের সক্ষমতাও রয়েছে- অর্থাৎ একজন বক্তা কথার মাঝপথে এক ভাষা থেকে অন্য ভাষায় চলে গেলেও মডেলটি তা সঠিকভাবে ধরতে পারে।

পাশাপাশি এটি এক ঘণ্টার বেশি দৈর্ঘ্যের অডিওও প্রক্রিয়া করতে সক্ষম, এবং নির্দিষ্ট শব্দ, ভাষা বা প্রসঙ্গ আগে থেকে জানিয়ে দিলে নির্ভুলতা আরও বাড়ানো যায়।

মেটা জানিয়েছে, স্ট্রিমিং স্পিচ-টু-টেক্সট বিষয়ক আর্টিফিশিয়াল অ্যানালাইসিস বেঞ্চমার্কে এবং পাবলিক ডায়ারাইজেশন বেঞ্চমার্কেও এই মুহূর্তে শীর্ষে রয়েছে মিউজ ভয়েস ট্রান্সক্রাইব। তবে উল্লেখযোগ্য বিষয় হলো, এখনো এর সম্পর্কে কোনো সম্পূর্ণ স্বতন্ত্র (থার্ড-পার্টি) বেঞ্চমার্ক প্রকাশিত হয়নি, যা দিয়ে লিব্রিস্পিচ বা আর্নিংস-কল ট্রান্সক্রিপশনের মতো প্রচলিত মানদণ্ডের সঙ্গে সরাসরি তুলনা করা যায়।

মিউজ ভয়েস ট্রান্সক্রাইব বর্তমানে মেটার মডেল এপিআইয়ের মাধ্যমে ‘muse-voice-transcribe-1.0’ নামে ব্যবহার করা যাচ্ছে, এবং এতে জিরো ডেটা রিটেনশন সুবিধাও রয়েছে। প্রতি হাজার মিনিট অডিওর জন্য এর মূল্য ৩ ডলার, যা ঘণ্টাপ্রতি হিসাবে দাঁড়ায় প্রায় ০.১৮ ডলার।

মডেলটি ইতিমধ্যে ম্যাকের জন্য তৈরি মেটা এআই অ্যাপের ডিকটেশন সুবিধায় সক্রিয় রয়েছে- ব্যবহারকারীরা Fn কি চেপে ধরে যেকোনো অ্যাপ্লিকেশনে সরাসরি কথা বলে লেখা তৈরি করতে পারছেন। এ ছাড়া মেটার কোডিং সহায়ক টুল মিউজ কোডেও এটি ব্যবহার করা হচ্ছে, যা দিয়ে ডেভেলপাররা ভয়েস কমান্ডে কোডিং-সংক্রান্ত কাজ করতে পারবেন।

বিশ্লেষকদের মতে, অনলাইন বৈঠক, সংবাদ সাক্ষাৎকার, শিক্ষা, গ্রাহকসেবা ও ভয়েসভিত্তিক এআই ব্যবস্থায় এই প্রযুক্তির ব্যবহার দ্রুত বাড়তে পারে, বিশেষ করে একাধিক বক্তা ও ভাষার দীর্ঘ কথোপকথন দ্রুত ও নির্ভুলভাবে লিখিত রূপে সংরক্ষণের ক্ষেত্রে।