এই বছরের জুনে অ্যাপল তাদের বাৎসরিক ডেভেলপার সম্মেলনে নতুন সিরি দেখাল। পুরাপুরি নতুন করে বানানো, চ্যাটজিপিটি ঘরানার একটা ভাষা-মডেল বসানো হয়েছে।
সঙ্গে প্রতিশ্রুতি, সিরি এখন আগের কনভারসেশন মনে রাখবে, ফোনের ভেতরের কাজ নিজে করে দিবে, মানুষের মতো কথা বলবে।
ঘোষণার শেষে ভাষার তালিকা আসল। ইংরেজি, ফরাসি, জার্মান, স্প্যানিশ, জাপানি, কোরীয়, চীনা।
বাংলা ভাষা সেই তালিকায় নাই। হিন্দিও নাই, তামিল-তেলুগু-মারাঠিও নাই। পৃথিবীর প্রতি চারজনে একজন মানুষ যে উপমহাদেশে থাকে, তার একটা ভাষাও সেখানে ঢোকে নাই।
কবে ঢুকবে সেই তারিখও অ্যাপল প্রকাশ করেনি।
অথচ অ্যাপেলের ফোন এই অঞ্চলে ঢালাও বিক্রি হয়, ওই ফোনে কোটি কোটি মানুষ প্রতিদিন বাংলায় লেখে।
➖
তবে অ্যাপলের তালিকা দিয়ে পুরা ছবিটা বোঝা যায় না।
এআই বাংলা একেবারে পারে না, এই কথা সত্য না। আজকের সবচেয়ে বড় মডেলগুলিকে বহুভাষিক পরীক্ষায় বসানো হলে তারা বাংলায় একশোতে বিরানব্বইয়ের কাছাকাছি পায়। জ্ঞানের প্রশ্ন, অঙ্ক, যুক্তি ইত্যাদি সবই বোঝে, উত্তরও দেয়।
সমস্যা তিন জায়গায়, এবং তিনটা তিন ধরনের সমস্যা।
প্রথম সমস্যা মালিকানার। ভালো বাংলা পারে যে মডেলগুলি, তার সবগুলিই কয়েকটা মার্কিন কোম্পানির সার্ভারে তালাবন্ধ, সাবস্ক্রিপশন চার্জ গুনে সেগুলি ব্যবহার করতে হয়।
আর যেগুলি উন্মুক্ত, অর্থাৎ যে কেউ নামিয়ে নিজের কম্পিউটারে চালাতে পারে, নিজের দরকার অনুযায়ী বদলাতে পারে, সেগুলি বাংলার ক্ষেত্রে ধসে পড়ে। এক পরীক্ষায় মেটার একটা উন্মুক্ত মডেল বাংলা প্রশ্নে পেয়েছে একশোতে বাইশ।
বাংলা যাদের শেখানো হয়েছে, শেখানো হয়েছে কেবল সেই মডেলগুলিকে, যেগুলির এক্সেস অন্যের কাছে।
দ্বিতীয়টা দামের সমস্যা। সাবস্ক্রিপশন চার্জ পৃথিবীর সব দেশে এক, ঢাকায় যে সাবস্ক্রিপশনের দাম বিশ ডলার, ক্যালিফোর্নিয়াতেও তা-ই। কিন্তু ব্যবহারকারীদের আয় কি এক?
মাথাপিছু আয়ের হিসাবে একজন মার্কিন নাগরিকের মাসিক আয়ের যেটা শতকরা এক ভাগেরও কম, একজন বাংলাদেশির জন্য সেটা প্রায় নয় ভাগ। তার ওপরে বসে টোকেনের বাড়তি খরচ। একই কাজ বাংলায় করাতে আমাদের টোকেন খরচ বেশি হয়।
ফলে চার্জও সেই অনুপাতে বাড়তে থাকে।
তৃতীয় সমস্যাটা হলো, এআই আসলে কোন বাংলাটা শিখছে। এইটা সবচেয়ে গভীর, এবং এইটাই এই লেখার প্রধান বিষয়।
➖
খরচের হিসাবটা শুরু হয় মডেল লেখা পড়ে কীভাবে, তার ভেতরে।
মডেল আমাদের মতো অক্ষর ধরে পড়ে না। সে লেখাটাকে আগে টুকরা করে নেয়, তারপর টুকরাগুলি নিয়ে কাজ করে। এই টুকরাগুলির নাম টোকেন।
কোন টুকরাগুলি চলবে, সেটা মডেল বানানোর সময়েই ঠিক করা হয়। কয়েক লাখ টুকরার একটা স্থায়ী তালিকা, বানানো হয় ইন্টারনেটের লেখা ঘেঁটে। যে অক্ষরজোট বারবার আসে, সেটা আস্ত টুকরা হিসাবে তালিকায় ঢুকে যায়।
ইন্টারনেটের লেখার সিংহভাগ ইংরেজি, ফলে তালিকাটাও ইংরেজির দখলে। চালু ইংরেজি শব্দ প্রায় সবই আস্ত আছে, ফলে ইংরেজিতে Bangladesh লিখলে মডেল এক-দুই টুকরায় কাজ সেরে ফেলে।
বাংলা ভাষা ওই তালিকায় প্রায় ঢোকেই নাই। যা তালিকায় নাই, মডেল তাকে ভাঙতে ভাঙতে কম্পিউটারের সবচেয়ে ছোট এককে নামিয়ে আনে। সেই এককের নাম বাইট।
এইবার দ্বিতীয় ধাক্কাটা আসে। ইংরেজির একটা অক্ষরে লাগে এক বাইট, বাংলার একটা অক্ষরে তিন। কারণ পৃথিবীর সব লিপিকে এক ব্যবস্থায় ধরার আন্তর্জাতিক নিয়ম বানানোর সময় লাতিন হরফ বসেছিল সামনের সারিতে, বাকিরা পেছনে।
ফলে ইংরেজিতে Bangladesh দশ অক্ষর, দশ বাইট। বাংলায় ‘বাংলাদেশ’ আট অক্ষর, চব্বিশ বাইট। যুক্তাক্ষরের হিসাবে গেলে সেটা আরও বাড়তে থাকে। ‘ক্ষ’ চোখে এক অক্ষর, কম্পিউটারের খাতায় তিন চিহ্ন, নয় বাইট।
যেমন আমাদের ‘ব্রডশিট’ চোখে চার অক্ষর, মডেলের হিসাবে এইটা একুশ বাইট। আর ‘Broadsheet’ চোখে দশ অক্ষর, মডেলের হিসাবেও দশ।
দুই ধাক্কা মিলে যেটা দাঁড়ায়, এই বছরের জুলাইয়ে ছয়টা টোকেনাইজার পরীক্ষা করে তার হিসাব বের করা হয়েছে। চ্যাটজিপিটির পুরানো টোকেনাইজারে একই কথা বাংলায় লিখলে ইংরেজির চেয়ে সাড়ে ছয় গুণ বেশি টোকেন লাগে।
কতটুকু লেখা ঢোকানো যাবে, কত লম্বা উত্তর মিলবে, সবই মাপা হয় এই টোকেনে। একই সীমায় একজন বাংলাভাষী ব্যবহার করতে পারেন ইংরেজিভাষীর ছয় ভাগের এক ভাগ। বিলটাও ওই একই অনুপাতে বড়।
➖
ছয় গুণের ব্যাপারটা মূলত মডেলের ঘাটতি, এবং ঘাটতি শোধরানো যায়। শোধরাচ্ছেও। কিন্তু ঘাটতিটা কেন হল, সেই উত্তর আসলে সরল। এবং সরল বলেই অস্বস্তিকর।
মডেল ট্রেইনড হয় লেখা পড়ে পড়ে। যেই ভাষায় লেখা বেশি, সেই ভাষা মডেল ভালো শেখে।
বাংলাভাষী প্রায় আটাশ কোটি, মাতৃভাষার হিসাবে পৃথিবীতে ছয়-সাত নম্বরে। কিন্তু ইন্টারনেটের মোট লেখায় বাংলার ভাগ আধা শতাংশেরও কম। মডেলকে সরাসরি যা খাওয়ানো হয়, সেই ভাণ্ডারগুলিতে ইংরেজি আর বাংলার অনুপাত সাতষট্টিতে এক।
কম লেখার কারণ খুঁজতে দূরে যেতে হয় না। কম্পিউটার আছে নয় শতাংশ পরিবারে। গ্রামে ইন্টারনেট ব্যবহার করেন ছত্রিশ শতাংশ মানুষ।
আর ইন্টারনেট প্যাকেজের ওপর সম্পূরক শুল্ক ষোলো সালের তিন শতাংশ থেকে বেড়ে চব্বিশ সালে উঠেছে তেইশ শতাংশে।
শুল্ক বসলে মানুষ অনলাইনে কম আসে, ফলে কম লেখে। কম লিখলে পরের মডেলে ভাষাটা আরও কম ঢোকে। মডেল ভাষাটা খারাপ পারলে মানুষ ওই ভাষায় আরও কম লেখে।
প্রতি চক্করে ফাঁকটা একটু বাড়ে, আর কারও নজরে পড়ার আগেই সেটা অভ্যাসে দাঁড়িয়ে যায়।
➖
সাতাশি সালের বাংলা ভাষা প্রচলন আইনের তিন ধারায় লেখা, বিদেশের সঙ্গে যোগাযোগ ছাড়া সরকারি দপ্তর আর আদালতের সব কাজ চলবে বাংলায়। অথচ উচ্চ আদালতের রায় আজও প্রায় পুরাটা ইংরেজিতে লেখা হয়।
এর কারণ বিচারকরা নিজেরাই বহুবার বলেছেন, আইনের বহু পরিভাষার চালু বাংলা প্রতিশব্দ তৈরি হয়নি।
একুশ সালের আঠারোই ফেব্রুয়ারি এর একটা প্রযুক্তি-সমাধান উদ্বোধন হল। নাম ‘আমার ভাষা’, কৃত্রিম বুদ্ধিমত্তায় চলা অনুবাদ সফটওয়্যার, ইংরেজি রায় বাংলায় নামিয়ে দিবে।
সফটওয়্যারটা ভারতে বানানো। ভারতের সুপ্রিম কোর্ট উনিশ সাল থেকে ওইটা দিয়েই নিজেদের রায় আঞ্চলিক ভাষায় অনুবাদ করাচ্ছিল, সেখানে এই সফটওয়্যারের নাম সুবাস। বাংলাদেশে জিনিসটা এসেছে ভারতীয় হাইকমিশনের উপহার হিসাবে।
উদ্বোধনী অনুষ্ঠানে তৎকালীন হাইকমিশনার বিক্রম দোরাইস্বামী বলেছিলেন, এই সহযোগিতা কেবল ভারত আর বাংলাদেশের মধ্যেই সম্ভব, কারণ বাংলা ভারতেরও স্বীকৃত ভাষা।
দিনটা ছিল একুশে ফেব্রুয়ারির তিন দিন আগে, স্বাধীনতার পঞ্চাশতম বছরে।
➖
যেকোনো এআইকে বাংলায় সকালের খাবার নিয়ে কিছু কথা লিখতে দিলে বেশিরভাগ সময় বের হয় ‘জলখাবার’, কিন্তু ‘নাশতা’ না।
তৃষ্ণার উত্তরে আসে ‘জল’, ‘পানি’ না। মায়ের বোন ‘মাসি’, বাবার ছোট ভাই ‘কাকা’, সকালের কাজটা ‘স্নান’, আর দাওয়াতটা ‘নিমন্ত্রণ’।
উত্তরগুলি একটা দিকে হেলে থাকে, সেটা ঢাকা না, কলকাতা।
কারণ বাংলা বলে মডেল যা পড়েছে, তার বড় অংশ এই দেশের লেখা না।
দোষটা অবশ্য প্রায়ই ভুলভাবে ব্যাখ্যা করা হয়। বাংলা উইকিপিডিয়া আমাদেরই জিনিস। দুই হাজার তিন সালে ম্যাকগিলে পড়া এক বাংলাদেশি ছাত্রের চিঠিতে এর শুরু, ছয় সালে বাংলাদেশ ওপেন সোর্স নেটওয়ার্কের একটা দল ধরে এর ছড়ানো, আর আজকের প্রায় এক লাখ নব্বই হাজার নিবন্ধের বেশিরভাগ কন্ট্রিবিউটর বাংলাদেশে বসা।
কিন্তু মডেল যা পড়ে, উইকিপিডিয়া তার খুব ছোট একটা অংশ।
বাকিটা আসে অন্য জায়গা থেকে। ইন্টারনেটে ছড়ানো বাংলা সাহিত্যের ডিজিটাল সংগ্রহ, যার প্রায় পুরাটা সাতচল্লিশের আগের বা কলকাতার। পুরানো বইয়ের স্ক্যান। ভাষা-প্রযুক্তির গবেষণার জন্য বানানো বড় বাংলা করপাসগুলি, যার প্রায় সবগুলি ভারতীয় প্রতিষ্ঠানের তৈরি, কাঁচামাল ভারতীয় সংবাদপত্র।
আর সবচেয়ে বড় অংশটা ওয়েব থেকে টেনে ওঠানো সাধারণ বাংলা লেখা, যেখানে পশ্চিমবঙ্গের পোর্টাল আর কাগজের পরিমাণ আমাদের চেয়ে বেশি।
➖
এই তফাত কয়েক শব্দে থেমে থাকে না।
একটা ভাষার লিখিত মান কে ঠিক করে, এই প্রশ্নের উত্তর দুই বাংলায় দুই রকম। ঢাকার বাংলা একাডেমির বানানরীতি আর কলকাতার আকাদেমির বানানরীতি এক না, কোথাও কোথাও এক শব্দেরই দুই চেহারা। উচ্চারণেও তাই।
এআইয়ের মুখে বাংলা শুনলে অনেক সময় কণ্ঠটা এই শহরের না।
আর এই সফটওয়্যারগুলি এখন আর কেবল প্রশ্নের উত্তর দেওয়ার খেলনা না। এইগুলিই হয়ে উঠছে বানান পরীক্ষক, অনুবাদক, ভয়েস টাইপিং, স্কুলের পড়ার সহায়ক, অফিসের খসড়া লেখার সহকারী, আদালতের অনুবাদক।
এবং সামনের দিনে পাঠ্যবই বানানোর কারখানা।
একটা প্রজন্ম বড় হচ্ছে, যাদের কাছে বানান আর বাক্যের প্রথম রেফারেন্স এই মডেলগুলির লেখা। মডেল যেটা বারবার লেখে, তাদের কাছে সেটাই একসময় শুদ্ধ।
আঠারো কোটি মানুষের একটা রাষ্ট্রের বানান আর উচ্চারণের চেয়ে পাশের দেশের একটা রাজ্যের ভাষারীতি মডেলের ভেতরে আগে জায়গা পাচ্ছে, কারণ ওই রাজ্যের লেখা ইন্টারনেটে বেশি ছিল।
কে খাঁটি বাংলা বলে, সেই পুরানো ঝগড়াটা এখানে অবান্তর। দুইটাই বাংলা, দুইটারই থাকার অধিকার আছে। মুশকিল হল, মডেল দুইটাকে পাশাপাশি রাখে না। একটাকে ডিফল্ট বানায়, আর অন্যটা ধীরে ধীরে ব্যতিক্রম হয়ে যায়।
➖
সীমান্তের ওইপারের বাঙালিরা এই ঘাটতি পূরণ করে দেবেন, এই ভরসাটা এখন আর নাই।
গত বছরের মাঝামাঝি থেকে ওড়িশা, ছত্তিশগড়, মহারাষ্ট্র, দিল্লি, গুজরাট আর মধ্যপ্রদেশে বাংলাভাষী শ্রমিকদের ধরপাকড় চলেছে। এদের বেশিরভাগ ভারতীয় নাগরিক, অনেকের হাতে বৈধ কাগজও ছিল, তবু কাউকে কাউকে বাংলাদেশে ঠেলে দেওয়া হয়েছে।
পশ্চিমবঙ্গ সরকারের হিসাবে আটক মানুষ হাজারখানেক।
কলকাতা হাইকোর্ট কেন্দ্র আর রাজ্য দুই পক্ষকেই হলফনামা দিতে বলেছে, এবং মন্তব্য করেছে, কেবল ভাষা বা চেহারা দেখে মানুষ ধরলে বিপজ্জনক বার্তা যায়।
এরই মধ্যে দিল্লি পুলিশের একটা নথিতে বাংলাকে লেখা হয়েছে ‘বাংলাদেশের ভাষা’। মমতা বন্দ্যোপাধ্যায় বোলপুর থেকে যে প্রতিবাদ কর্মসূচি শুরু করেছেন, তার নাম রেখেছেন ভাষা আন্দোলন।
ওইপারে বাংলা বলাটাই এখন সন্দেহের কারণ। যাদের নিজের দেশে নিজের ভাষার নাগরিকত্ব প্রমাণ করতে হচ্ছে, মডেলের ভেতরে ওই ভাষার জায়গা আদায়ের কাজটা তাদের কাছ থেকে আশা করা যায় না।
ফলে কাজটা একান্তই আমাদের।
➖
বায়ান্ন সালে এই ঢাকা শহরে ছাত্ররা গুলি খেয়েছিল একটাই দাবিতে, বাংলা রাষ্ট্রভাষা হোক। একাত্তরে যে রাষ্ট্র জন্ম নিল, তার জন্মের মূলে বাংলার নাম লেখা আছে।
সেই রাষ্ট্র কিছু করেছে, সেটাও লেখা থাকা দরকার। পঞ্চান্ন সালে বাংলা একাডেমি হয়েছে। অভিধান হয়েছে, বানানের নিয়ম হয়েছে, একুশের বইমেলা পৃথিবীর বড় বইমেলাগুলির একটা। সাতাশি সালে ভাষা প্রচলন আইন হয়েছে।
চোদ্দ সালে হাইকোর্ট নির্দেশ দিয়েছে, দেশের সব সাইনবোর্ড, নামফলক আর নম্বরপ্লেট বাংলায় লিখতে হবে, যদিও এক যুগ পরেও ঢাকার বহু সাইনবোর্ড ইংরেজিতেই ঝুলছে।
এই তালিকার একটা ধরন আছে। সাইনবোর্ড, নামফলক, নম্বরপ্লেট, নথির ভাষা, অভিধান, বানানের নিয়ম, পদক, বইমেলা। সবগুলি ভাষাটাকে দেখানোর আয়োজন, পতাকার মতো টাঙিয়ে রাখার। ভাষাকে কাঁচামাল হিসাবে সরবরাহ করার আয়োজন একটাও না।
আমরা ঠিক করেছি বাংলা কোথায় লেখা থাকবে, কোন বানানটা শুদ্ধ। প্রতি ফেব্রুয়ারিতে খালি পায়ে হেঁটেছি। শুধু বাংলাটা লিখে, স্ক্যান করে, মেশিনের নাগালে রাখার কাজটা কারও দায়িত্বে পড়ে নাই।
সত্তর বছরের সংবাদপত্র স্ক্যান হয় নাই। আদালতের রায় খোলা ভাণ্ডারে ওঠে নাই। একাডেমির অভিধান উন্মুক্ত শর্তে ছাড়া হয় নাই। আঞ্চলিক ভাষার কণ্ঠ রেকর্ড হয় নাই। একাত্তরের যে সাক্ষ্য টেপে আছে, তার প্রতিলিপি হয় নাই।
ভাষার প্রতিষ্ঠান এক মন্ত্রণালয়ে, ভাষার প্রযুক্তি আরেক মন্ত্রণালয়ে, এর মাঝখানের সেতুটা কেউ বানায় নাই।
পঞ্চাশ বছর ধরে রাষ্ট্র বাংলা ভাষাকে পাহারা দেওয়ার সব আয়োজন করেছে, সরবরাহের কাজটা করে নাই।
➖
মিলান কুন্ডেরা লিখেছিলেন, ক্ষমতার বিরুদ্ধে মানুষের সংগ্রাম আসলে বিস্মৃতির বিরুদ্ধে স্মৃতির সংগ্রাম। তার কথাটা ছিল রাষ্ট্রের হাতে ইতিহাস মুছে যাওয়া নিয়ে, ছবি থেকে মানুষ মুছে ফেলা, বই থেকে নাম তুলে নেওয়া।
এখানের বিস্মৃতিটা অন্য কায়দার। কেউ কিছু মুছছে না, কোনো ফরমানও নাই। যা কখনো ডিজিটাল হয় নাই, মডেলের কাছে তা কখনো ছিলই না। মানুষ ভোলে, মনে করানো যায়। মেশিন যা শেখে না, তাকে মনে করানোর কিছু নাই।
সত্তর বছরের সংবাদপত্র, আদালতের রায়, সরকারি নথি, লোককথা, আঞ্চলিক বুলি, একাত্তরের সাক্ষ্য। এগুলির যতটুকু কাগজে আর টেপে আটকে আছে, মডেলের কাছে ততটুকু নাই। আর মডেলই যখন আগামী প্রজন্মের প্রথম রেফারেন্স, তখন মডেলের কাছে না থাকা মানে অনেকখানি না থাকা।
কেউ এসে ভাষা কেড়ে নিবে না। আমরা শুধু নিজেদের সংস্করণ হারাতে থাকব, এত ধীরে যে টের পেতে পেতে দেরি হয়ে যাবে।
➖
এই অন্ধত্বের আরেকটা দিকে মানুষ প্রাণ হারায়।
ফেসবুকে দিনে কোটি কোটি পোস্ট হয়। কোনটা ঘৃণা, কোনটা উস্কানি, কোনটা নিরীহ, এই বাছাই মানুষ বসে বসে শেষ করতে পারে না, ফলে প্রথম ফিল্টারিং চালায় সফটওয়্যার।
সেটাও একধরনের ভাষা-মডেল, একই কায়দায় সেটা বানানো। যে ভাষায় তাকে কম শেখানো হয়েছে, সে ভাষায় সে কম ধরে।
অ্যামনেস্টির হিসাবে, দুই হাজার চোদ্দ সালের মাঝামাঝি মিয়ানমারের বারো লাখ ফেসবুক ব্যবহারকারীর পোস্ট দেখতেন বার্মিজ-জানা একজন কর্মী, বসতেন ডাবলিনে। পনেরো সালের শুরুতে সংখ্যাটা দুই, বছরের শেষে চার। রোহিঙ্গা গণহত্যার পরে, আঠারো সালে, সংখ্যাটা একশো।
কোম্পানির নিজের অভ্যন্তরীণ নথি বলছে, প্ল্যাটফর্মের ঘৃণাসূচক কনটেন্টের মাত্র দুই শতাংশ তারা ধরতে পারছিল। জাতিসংঘের তদন্ত দল লিখেছিল, রোহিঙ্গাদের বিরুদ্ধে ঘৃণা ছড়ানোয় ফেসবুক ছিল কার্যকর হাতিয়ার, কারণ ওই দেশে বেশিরভাগ মানুষের কাছে ফেসবুকই ইন্টারনেট।
বাংলাদেশ কোন অবস্থায়, সেটাও ফাঁস হওয়া কাগজে আছে। একুশ সালের ফেসবুক পেপারসে দেখা যায়, কোম্পানি ঝুঁকির দেশগুলিকে স্তরে ভাগ করে রেখেছে, এবং কোন ভাষায় ঘৃণা ধরার ফিল্টার বানানো হবে সেটা ওই স্তর দিয়ে ঠিক হয়।
এক নোটে কর্মীরা লিখছেন, গত কয়েক মাসে তাদের আগুন নেভাতে হয়েছে ভারতের নির্বাচনে, বাংলাদেশের সহিংস সংঘর্ষে আর পাকিস্তানের বিক্ষোভে। তার পরেই নিয়মটা, অগ্রাধিকার পাবে সেইসব দেশ যেখানে সহিংসতা চলমান, যেখানে সাময়িক সেখানে না।
আরও লেখা, অগ্রাধিকার পাওয়ার পরেও ফিল্টারিং অবকাঠামো দাঁড় করাতে বছরখানেক লাগে।
আমাদের সহিংসতা তাদের খাতায় পড়েছে সাময়িকের ঘরে।
দুই হাজার বারো সালের উনত্রিশে সেপ্টেম্বর রামুতে একটা ফেসবুক পোস্টের কারণে তেরোটা বৌদ্ধবিহার আর ত্রিশটা বসতবাড়ি পুড়েছিল। মামলা হয়েছিল উনিশটা, অভিযোগপত্র নয়শো তিরানব্বইজনের বিরুদ্ধে।
বারো বছর পরেও একটা মামলারও বিচার শেষ হয় নাই, কেউ সাজা পায় নাই।
➖
এই বছরের বারোই ফেব্রুয়ারির নির্বাচনের হিসাব এখন হাতে আছে।
রিউমার স্ক্যানারের গণনায় শুধু ভোটের দিনেই শনাক্ত হয়েছে একশো চারটা অপতথ্য, আর পঁচিশের জানুয়ারি থেকে ছাব্বিশের তেরোই ফেব্রুয়ারি পর্যন্ত এক হাজার চব্বিশটা।
সবচেয়ে বেশি লক্ষ্যবস্তু বিএনপি, বাহান্নটা, যার আটাশি শতাংশ নেতিবাচক। জামায়াত একুশটা, এনসিপি দশটা, নিরাপত্তা বাহিনী নিয়ে সতেরোটা। মাধ্যমের হিসাবে ভুয়া ফটোকার্ড উনচল্লিশটা, বানানো বক্তব্য আঠারোটা।
আর এআই দিয়ে বানানো কনটেন্ট সাতটা। তালিকার সবচেয়ে ছোট সংখ্যা, এবং একমাত্র সংখ্যা, যেটা পরেরবার বাড়বে তা নিশ্চিত।
গত মার্চে অ্যামনেস্টি ইন্টারন্যাশনালের প্রতিবেদন বলছে, ভোটের আগের মাসগুলিতে ক্ষতিকর অনলাইন কনটেন্ট বেড়েছে, রাজনৈতিক দল আর সংখ্যালঘুদের নিয়ে উস্কানিমূলক প্রচার ছড়িয়েছে। আর সীমান্ত পার হয়ে আসা ক্ষতিকর কনটেন্টের বেশিরভাগ এসেছে ভারত থেকে।
➖
দুই হাজার ষোলো সালে ‘গবেষণা ও উন্নয়নের মাধ্যমে তথ্য প্রযুক্তিতে বাংলা ভাষা সমৃদ্ধকরণ’ নামে একটা প্রকল্প নেওয়া হয়েছিল।
বরাদ্দ একশো উনষাট কোটি টাকা, বাস্তবায়নে বাংলাদেশ কম্পিউটার কাউন্সিল। বানানোর কথা ছিল ষোলোটা জিনিস, ওসিআর, অনুবাদক, বানান পরীক্ষক, কথা থেকে লেখা, অন্ধদের স্ক্রিন রিডার, ক্ষুদ্র নৃগোষ্ঠীর ভাষার কিবোর্ড।
তালিকার এক নম্বরে ছিল একটা পূর্ণাঙ্গ বাংলা করপাস।
অভিধান বলে দেয় শব্দের মানে কী হওয়া উচিত। করপাস হল কোনো ভাষার প্রকৃত লেখার বিশাল সংগ্রহ, যা দেখায় শব্দটা মানুষ আসলে কীভাবে ব্যবহার করে, কোন শব্দের পাশে কোন শব্দ বসে, কোন বানান কে লেখে।
অভিধান ভাষার নিয়মের বই, করপাস ভাষার অভ্যাসের গুদাম। মডেল শেখে অভ্যাস থেকে।
প্রকল্প শেষ হওয়ার কথা ছিল উনিশ সালে। মেয়াদ বেড়েছে দুইবার। বাইশ সালের ফেব্রুয়ারিতে, শুরুর ছয় বছর পরে, ষোলোটার মধ্যে হয়েছিল একটা, আর্থিক অগ্রগতি দশ শতাংশ।
সফটওয়্যার বানানোর বরাদ্দ একশো আটচল্লিশ কোটি থেকে কমিয়ে একশো উনিশ কোটি করা হয়েছিল। এই কমানো টাকা গেছে বেতনে, ক্লাউড ভাড়ায়, আর প্রচারে। যে জিনিসগুলি তৈরিই হয় নাই, তাদের প্রচারের জন্য বাজেট ছিল।
আজকে সরকারের একটা করপাস-ওয়েবসাইট আছে, নাম বাংলাদেশ ন্যাশনাল করপাস। কিন্তু ভাণ্ডার থাকা আর ভাণ্ডার কাজে লাগা এক জিনিস না। কত বড়, কোথাকার লেখা দিয়ে বানানো, ডাউনলোড করা যায় কি না, কোন শর্তে, কেউ কি এটা দিয়ে সত্যি একটা মডেল বানাতে পেরেছেন।
উন্মুক্ত শর্ত মানে যে কেউ, অনুমতির চিঠি না লিখে, বিনা খরচে, ব্যবসার কাজেও ভাণ্ডারটা ব্যবহার করতে পারবে। এটুকু না থাকলে ভাণ্ডারটা না থাকারই সমান, কারণ যার সামনে পুরা ইন্টারনেট খোলা পড়ে আছে, সে আইনি ঝামেলার জিনিস স্পর্শ করে দেখে না।
এই কাজটা বাজার করে না, কারণ এতে মুনাফা নাই। একা কোনো মানুষও পারে না, কারণ এই কাগজপত্র কারও ব্যক্তিগত সম্পত্তি না। পৃথিবীর প্রায় সব দেশে করপাস বানানো রাষ্ট্রের কাজ।
➖
আইসল্যান্ডীয় ভাষায় কথা বলেন সাড়ে তিন লাখ মানুষ, আমাদের একটা উপজেলার সমান। ভাষাটা ডিজিটাল দুনিয়ায় হারিয়ে যাচ্ছে দেখে তারা উনিশ থেকে তেইশ সালের জন্য একটা জাতীয় ভাষা-প্রযুক্তি কর্মসূচি নেয়।
খরচ প্রায় চোদ্দ মিলিয়ন ডলার, কাজ করেছেন ষাটজনের বেশি বিশেষজ্ঞ।
কী বানানো হয়েছিল, সেই তালিকা আমাদের ষোলো দফার সঙ্গে প্রায় মিলে যায়। তফাত একটা শর্তে, কর্মসূচির নথিতেই লেখা ছিল, সব ফল প্রকাশ হবে উন্মুক্ত লাইসেন্সে।
বাইশ সালের মাঝামাঝিতে আইসল্যান্ডের প্রেসিডেন্ট আর মন্ত্রীরা চ্যাটজিপিটির মালিক প্রতিষ্ঠান ওপেন এআই-এর সিইও স্যাম অল্টম্যানের সঙ্গে দেখা করলেন।
তেইশের মার্চে জিপিটি-ফোর যখন বের হল, ইংরেজির পরে যে ভাষাটা আলাদা যত্নে ঢোকানো হয়েছিল সেটা আইসল্যান্ডীয়, আর মিদেইন্দ নামের এক স্থানীয় কোম্পানির চল্লিশজন স্বেচ্ছাসেবী মডেলকে ভাষাটা বিশেষভাবে শিখিয়েছিলেন।
তখনকার সংস্কৃতিমন্ত্রী বললেন, পাঁচ বছর ধরে ভিতটা এই দিনের জন্যই বানানো হয়েছে, একদিন এই জিনিস হাতে নিয়ে এআই কোম্পানির টেবিলে গিয়ে বসা যাবে।
ডলারে হিসাব করলে আমাদের একশো উনষাট কোটির বরাদ্দ আইসল্যান্ডের চেয়ে কম ছিল না। তারা টেবিলে বসার জিনিস বানিয়েছে, আমরা প্রচারের বাজেট খরচ করেছি।
➖
এই খাতে যা কিছু আসলে কাজে লেগেছে, তার প্রায় সবটাই রাষ্ট্রের বাইরে থেকে এসেছে।
দুই হাজার তিন সালের ছাব্বিশে মার্চ ময়মনসিংহ মেডিকেল কলেজের প্রথম বর্ষের ছাত্র মেহেদী হাসান খান অভ্র কিবোর্ড ছেড়েছিলেন, বিনামূল্যে, ‘ভাষা হোক উন্মুক্ত’ স্লোগানে।
তার কয়েক বছর পরে নির্বাচন কমিশন ছবিসহ ভোটার তালিকা বানাতে বসলে প্রথম পছন্দ ছিল বাণিজ্যিক সফটওয়্যার বিজয়।
নথি বলছে, মালিক কোম্পানি প্রতিটা কম্পিউটারের জন্য পাঁচ হাজার টাকা লাইসেন্স ফি চেয়েছিল। নির্বাচন কমিশন অভ্র নিল, আর দেশের কোটি কোটি ভোটারের তালিকা লেখা হল এক ছাত্রের বানানো বিনামূল্যের সফটওয়্যারে।
অভ্রর দ্বিতীয় বিষয়টা কম আলোচিত। সেখান থেকে আরেকজনের নাম আসে।
পাঁচ সালের ডিসেম্বরে সামহোয়্যার ইন ব্লগ চালু হয়, সাইটের প্রোগ্রামার হাসিন হায়দার এমন একটা ফোনেটিক স্ক্রিপ্ট লেখেন, যাতে কোন সফটওয়্যার ছাড়াই ইংরেজি কিবোর্ড থেকে সরাসরি ওয়েবসাইটে বাংলা লেখা যায়।
কম্পিউটারের কিবোর্ড আর ব্রাউজারের ওই স্ক্রিপ্ট, দুইটা মিলে ছয় সাল থেকে বাংলা ব্লগ আর বাংলা উইকিপিডিয়া দাঁড়াতে শুরু করে। ইন্টারনেটে আজ যতটুকু বাংলাদেশি বাংলা আছে, তার বড় অংশের ভিত্তি এই দুইটা জিনিস।
ধারাটা থামে নাই। বেঙ্গলি এআই নামের এক স্বেচ্ছাসেবী দল অনলাইনে প্রচার চালিয়ে বাইশ হাজারের বেশি মানুষের কাছ থেকে প্রায় এগারোশো ঘণ্টার কণ্ঠ জোগাড় করেছে, আজ পর্যন্ত সবচেয়ে বড় উন্মুক্ত বাংলা কণ্ঠভাণ্ডারগুলির একটা।
পরীক্ষার জন্য তারা আলাদা করে তুলেছেন নাটক, অডিওবুক, টক শো, অনলাইন ক্লাস আর ওয়াজের রেকর্ড, কারণ ওয়াজের টানে বলা বাংলা আর টক শোর বাংলা মেশিনের কানে এক জিনিস না।
‘হিসাব’ নামের একটা কোম্পানি এনেছে টিটিউএলএম, বাংলার জন্য গোড়া থেকে প্রশিক্ষিত প্রথম মডেল-পরিবার।
শেখানো হয়েছে সাঁইত্রিশ বিলিয়ন টোকেন দিয়ে, আর টোকেনাইজারে বাংলার জন্য আলাদা বিয়াল্লিশ হাজার টুকরা জুড়ে দেওয়া হয়েছে, যাতে সেই পুরানো খরচটা কমে। মডেল আর যাচাইয়ের ডেটাসেট, দুইটাই তারা খুলে দিয়েছে।
তবে তাদের নিজেদের নথিতেই লেখা আছে, ভাণ্ডারের সবচেয়ে বড় অংশ এসেছে ওয়েব থেকে টেনে ওঠানো লেখা দিয়ে। যে জাতীয় আর্কাইভ থেকে নেওয়ার কথা ছিল, সেটা কেউ বানিয়ে রাখে নাই। সাঁইত্রিশ বিলিয়ন যেখানে আমাদের সম্বল, আজকের বড় মডেলগুলি শেখে কয়েক ট্রিলিয়ন টোকেন পড়ে।
অভ্র সম্ভব হয়েছিল কারণ কিবোর্ড এমন জিনিস, একজন ছাত্র হোস্টেলের ঘরে বসে সেটা লিখে ফেলতে পারে। জাতীয় করপাস, হাজার ঘণ্টার রেকর্ড, সত্তর বছরের সংবাদপত্রের স্ক্যান, এই কাজগুলি একজন মানুষের সক্ষমতায় ধরে না।
➖
এই বছরের ফেব্রুয়ারিতে আইসিটি বিভাগ জাতীয় এআই নীতিমালার খসড়া প্রকাশ করেছে, ছাব্বিশ থেকে ত্রিশ সালের জন্য। তাতে লেখা আছে, প্রথম প্রকল্প হিসাবে সরকারি উদ্যোগে জাতীয় বাংলা ভাষা-মডেল বানানো হবে, আর ইতিহাস ও সাহিত্যের আর্কাইভ ডিজিটাল করা হবে।
কথাগুলি ঠিক। এতদিনে এই প্রথম কাগজে-কলমে ঠিক জায়গায় হাত পড়েছে।
দায়িত্ব দেওয়া হয়েছে বাংলাদেশ কম্পিউটার কাউন্সিলকে, একশো উনষাট কোটির সেই প্রকল্পের সেই প্রতিষ্ঠানকে।
খসড়ায় বাজেট নাই, সময়সীমা নাই, পরিমাপের লক্ষ্য নাই, কোন লাইসেন্সে ছাড়া হবে সেই কথাটাও নাই। যে চারটার অভাবে আগেরবার দশ শতাংশ কাজ হয়েছিল, নতুন দলিলে সেই চারটাই আবার নাই।
➖
বাকি হিসাবটাও লেখা থাকা দরকার।
অবস্থা বদলাচ্ছে, দ্রুতই। নতুন টোকেনাইজারগুলিতে বাংলার সেই খরচ সাড়ে ছয় গুণ থেকে নেমে দুই গুণের নিচে এসেছে।
বাংলা যে টোকেনাইজারে বেশি জায়গা নিত, সেটা ভাষার দোষ ছিল না। তালিকা বানানোর সময় বাংলার জন্য জায়গা রাখা হয় নাই, এখন রাখা হচ্ছে। দেশে-বিদেশে বাঙালি গবেষকরা বাংলা মডেল আর ভাণ্ডার নিয়ে কাজ করছেন, অনেকে নিজের খরচে, কেউ কেউ ভালো ফলও পাচ্ছেন।
অন্যদিকে গুজব আর সহিংসতার পুরা দায়ও মেশিনের ঘাড়ে চাপানো ঠিক হবে না। যে সমাজে গুজব ছড়ানোর লোক আছে আর বিচার নাই, সেখানে পৃথিবীর সেরা ফিল্টার বসালেও শেষ রক্ষা হবে না। রামুর মামলা বারো বছরে শেষ না হওয়ার দায় ফেসবুকের না।
আর, কোনো কোম্পানি বাংলাকে ইচ্ছা করে বাদ দেয় নাই। কোথাও কোনো ফরমান নাই, নিষেধাজ্ঞা নাই। যা লেখা ছিল মডেল তা-ই পড়েছে, আর যা লেখা হয় নাই সেই ফাঁকটুকুই আজকের ফলাফল।
➖
সিরির তালিকায় বাংলা একদিন উঠবে, দেরিতে হলেও। মডেলগুলি বাংলা আরও ভালো শিখবে, টোকেনের খরচও কমতে কমতে একসময় চোখে পড়বে না।
কিন্তু ওই দিন মডেলের মুখের বাংলাটা কেমন হবে, কার বানান আর কার উচ্চারণ, সেটা ঠিক হয়ে যাচ্ছে এখনই। ঠিক হচ্ছে কোন লাইব্রেরির স্ক্যানারে কী উঠল, কোন প্রকল্পের লাইসেন্সের পাতায় কী লেখা হল, কোন সার্ভারে কার লেখা কতটা ওঠানো থাকল, এইসব হিসাবে।
ওই হিসাবে আমরা এখনো প্রায় নাই।