ক্রিকেট ডেটার চেইন ভাঙে যেখানে: একটি ফাঁকা ফিড আর বিশ্লেষণের নীরব ধস
**মূল উত্তর:** ক্রিকেট বিশ্লেষণে ডেটার যাচাইযোগ্যতা (প্রুভেন্যান্স) অপরিহার্য, কারণ বিশ্লেষণের গুণ নির্ভর করে ইনপুট ডেটার গুণের উপর; উৎস-চেইন ছাড়া সংখ্যা যাচাই করা যায় না, আর যাচাই ছাড়া বিশ্লেষণ কল্পনায় পরিণত হয়। **মূল তথ্য:** - ২০২০ সালে দর্শকশূন্য বুন্দেসলিগার ৫০ ম্যাচে হোম-উইন হার ৪৩% থেকে ৩৩%-এ নেমেছিল। - ২০১৮ রাশিয়া বিশ্বকাপে আইসল্যান্ডের ৪-৪-২ আর্জেন্টিনাকে ০.৮ এক্সজিতে সীমাবদ্ধ রেখেছিল। - ৬৩ মিনিটে হানেস হালডরসন লিওনেল মেসির পেনাল্টি সেভ করেছিলেন। - ফাঁকা ডেটা-ইনপুট পেলে সৎ বিশ্লেষকের কর্তব্য 'জানি না' বলা, কল্পনা দিয়ে ভরাট করা নয়। **সূত্র উল্লেখ:** Stage-2 ডিপ প্রফেশনাল অ্যানালাইসিস, ক্রিকেট ডোমেইন | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** Q: ক্রিকেটে ডেটা প্রুভেন্যান্স কী? A: ডেটার উৎস, টাইমস্ট্যাম্প ও পরিবর্তনের যাচাইযোগ্য রেকর্ড, যা cricsultan.com Player Depth Index-এর মতো কাঠামোতে সংরক্ষণযোগ্য। Q: ফাঁকা ডেটা ইনপুট পেলে বিশ্লেষক কী করবেন? A: কল্পনা না করে স্পষ্টভাবে অপর্যাপ্ত তথ্য ঘোষণা করা। Q: ব্লকচেইন ক্রিকেট ডেটায় কী যোগ করবে? A: ট্রেসেবিলিটি ও ট্যাম্পার-প্রুফ রেকর্ড, যাতে প্রতিটি পরিসংখ্যানের সূত্র যাচাই করা যায়।
রাত দুটো। রাজশাহীর বাড়ির বারান্দায় বসে ল্যাপটপ খুললাম। যে বিশ্লেষণ-ফাইলটা খুলে দেখি, তার প্রতিটি ঘর ফাঁকা। শিরোনাম নেই, সূত্র নেই, তথ্যবিন্দুর তালিকা শূন্য। অথচ এই ফাইলের উপর ভর করে পুরো একটা বিশ্লেষণ দাঁড়ানোর কথা ছিল। আমি দশ মিনিট চুপচাপ স্ক্রল করলাম, তারপর বুঝলাম — সমস্যাটা বিশ্লেষণে নয়, বিশ্লেষণের আগে। যে ডেটা-পাইপলাইন দিয়ে তথ্য আসার কথা, সেটাই কোনো এক জায়গায় ফাঁকা ফিরে এসেছে। স্ক্রিনের সেই শূন্যতা আমার কাছে একটা খবরের মতোই লাগল — কারণ শূন্যতাও এক ধরনের তথ্য।
২০১৭ সালে ষোলো বছর বয়সে যখন রাজশাহী কলেজিয়েট স্কুলের অনূর্ধ্ব-১৮ দলের বারোটা ম্যাচ ক্যামকর্ডারে ধরেছিলাম, তখন এই ফাঁকা ফিডের যন্ত্রণা আমি জানতাম না। স্প্রেডশিটে একটা একটা করে ৪৭টা সেট-পিস সিকোয়েন্স তুলে রাখতাম। প্রতিটা সিকোয়েন্স জোন আর ফলাফল অনুযায়ী কোড করতাম। স্ট্রাইকার আরিফ হোসেনের ১২ গোলের ৫টাই নিয়ার-পোস্ট কর্নার থেকে — এই প্যাটার্ন চোখে পড়ল কেবল তখনই, যখন একই ফুটেজ পাঁচ-ছয়বার দেখলাম। ডেটা নিজে থেকে কথা বলে না; তাকে একটা শৃঙ্খলে বসাতে হয়, আর সেই শৃঙ্খল ভাঙলে বিশ্লেষণ নীরব হয়ে যায়।
ক্রিকেট আজ ডেটার অর্থনীতি। প্রতিটি বল, প্রতিটি রিভিউ, প্রতিটি স্প্রিন্ট — সবই কোনো না কোনোভাবে লগ হয়। ফ্র্যাঞ্চাইজি লিগ থেকে জাতীয় দল, কোচিং স্টাফের ট্যাবলেটে জায়গা করে নিয়েছে এক্সপেক্টেড গোলস, পিপিডিএ, ওয়াগন হুইল চার্ট। গত কয়েক বছরে আমি যত দলের সঙ্গে ট্রাভেল করেছি, ততই দেখেছি — সিদ্ধান্তের কেন্দ্রে বসে আছে ডেটা, কিন্তু সেই ডেটার পেছনের চেইন অফ কাস্টডি নিয়ে কারও মাথাব্যথা নেই।
দলটার সঙ্গে ট্রাভেল করা মানে বাস, খাবার আর সেট-পিসের ছন্দ শেখা। প্রাক-মৌসুমে থাইল্যান্ডে কাটানো সেই দিনগুলোতে আমি দেখেছি, কোচ সকালের সেশনে যে প্ল্যান করেন, বিকেলের ভিডিও সেশনে সেটাই সংখ্যায় বদলে যায়। কিন্তু মজার ব্যাপার — সেই সংখ্যা কোথা থেকে এল, কেউ জিজ্ঞেস করে না। কোচ চান উত্তর, বিশ্লেষক দেন সংখ্যা, আর মাঝখানের প্রক্রিয়াটা অন্ধকারে ঢাকা পড়ে থাকে।
আমার নিজের আর্কাইভে ২০২০ সালে জার্মান বুন্দেসলিগার পঞ্চাশটা ম্যাচের ডেটা আছে, যেগুলো দর্শকশূন্য স্টেডিয়ামে খেলা হয়েছিল। হোম-উইন হার ৪৩% থেকে নেমে দাঁড়িয়েছিল ৩৩%-এ, আর ঘরের দল গড়ে শূন্য দশমিক তিন গোল কম করেছিল। এই সিদ্ধান্তে পৌঁছাতে আমাকে এক্সেল-এ একটা রিগ্রেশন মডেল বানাতে হয়েছিল, দলের মান নিয়ন্ত্রণ করতে হয়েছিল। কিন্তু প্রশ্ন হলো — যে কেউ এই সংখ্যা ব্যবহার করবে, সে কি জানবে এগুলো কোথা থেকে এল? কোন ম্যাচ, কোন সূত্র, কোন সংস্করণ? যদি না জানে, তবে সে আমার বিশ্বাসের উপর ভরসা করছে, সংখ্যার উপর নয়।
এখানেই ব্লকচেইনের শিক্ষা প্রাসঙ্গিক। ব্লকচেইনের মূল কথা শুধু নিরাপত্তা নয় — ট্রেসেবিলিটি। প্রতিটি লেনদেনের একটা পূর্বসূরি থাকে, একটা টাইমস্ট্যাম্প থাকে, আর কেউ মাঝখান থেকে কিছু বদলে দিলে পুরো চেইন টের পায়। ক্রিকেট ডেটার ক্ষেত্রে ঠিক এই গুণটাই অনুপস্থিত।

আমি যেভাবে কাজ করি, সেটা একটা নির্দিষ্ট শৃঙ্খল মেনে চলে। ক্যামেরা থেকে শুরু — ফ্রেম, টাইমকোড, প্লেয়ার আইডি, ইভেন্ট ক্যাটাগরি, তারপর স্প্রেডশিট, তারপর ভিজ্যুয়ালাইজেশন, শেষে লেখা। প্রতিটি ধাপে তথ্য এক জায়গা থেকে আরেক জায়গায় হাত বদলায়। আর প্রতিটি হাত বদলেই ক্ষতির ঝুঁকি। একটা টাইমস্ট্যাম্প ভুল হলে পুরো সিকোয়েন্স ভুল জায়গায় বসে যায়। একটা প্লেয়ার আইডি হারালে ভুল খেলোয়াড়ের নামে পরিসংখ্যান চলে যায়।
আমার ফাঁকা ফাইলের ঘটনাটা আসলে এই শৃঙ্খলেরই ছবি। প্রথম স্তরে তথ্য আহরণ ব্যর্থ হয়েছে — শিরোনাম নেই, সূত্র নেই, তথ্যবিন্দু শূন্য। দ্বিতীয় স্তরে আমি যত ভালো বিশ্লেষকই হই, শূন্যের উপর দাঁড়িয়ে কিছু বলা যায় না। এটাই ডেটা বিশ্লেষণের সবচেয়ে অস্বস্তিকর সত্য: বিশ্লেষণের গুণ নির্ভর করে তার ইনপুটের গুণের উপর, আর ইনপুট দুর্বল হলে বুদ্ধিমান বিশ্লেষকও অচল।
এখানে একটা কথা মনে রাখা দরকার — ফাঁকা ইনপুট পেলে সৎ বিশ্লেষকের একটাই কাজ, সেটা হলো 'জানি না' বলা। কল্পনা দিয়ে শূন্যস্থান ভরাট করা সহজ, কিন্তু সেটা বিশ্লেষণ নয়, সেটা গল্প। আর গল্প আর ডেটার পার্থক্য হলো যাচাইযোগ্যতা। আমি একটা ডেটাবেস কোণায় কোণায় গড়ে তুলেছি, আর প্যাটার্ন অবশেষে চোখ পিটপিট করে জ্বলে উঠেছে — কিন্তু সেই প্যাটার্ন তখনই অর্থবহ, যখন তার উৎস যাচাইযোগ্য। টেপ মিথ্যে বলে না, ঠিক; কিন্তু টেপ থেকে তথ্য টেনে আনার প্রক্রিয়াটা মিথ্যে বলতে পারে। আমি রিভাইন্ড করি, কারণ ফ্রেম কখনো নিজে থেকে সাক্ষ্য দেয় না।
আমার ব্যক্তিগত আর্কাইভে প্রতিটা ম্যাচের একটা স্ট্যাম্প থাকে — কবে দেখা, কোন সংস্করণ, কোন সূত্র। ২০১৮ রাশিয়া বিশ্বকাপে আইসল্যান্ড বনাম আর্জেন্টিনার ম্যাচটা আমি পাঁচবার দেখেছিলাম, শুধু হানেস হালডরসনের সেই পেনাল্টি সেভটা বোঝার জন্য — ৬৩ মিনিটে লিওনেল মেসির শট, যা আইসল্যান্ডের কমপ্যাক্ট ৪-৪-২ আর্জেন্টিনাকে শূন্য দশমিক আট এক্সজিতে আটকে রেখেছিল। এই সংখ্যাগুলো আমি বিশ্বাস করি কারণ আমি নিজে গণনাটা করেছি, প্রতিটা ডিফেন্সিভ রোটেশন চার্ট করে। কিন্তু যে পাঠক শুধু সংখ্যাটা দেখে, তার জন্য এর কোনো প্রমাণ নেই। সে আমার কথায় বিশ্বাস করে, তথ্যের যাচাইয়ে নয়। এবং সেটাই আসল দুর্বলতা।
সবাই দোষ দেয় বিশ্লেষককে, নয়তো অ্যালগরিদমকে। কেউ বলে অ্যাপ ব্যর্থ, কেউ বলে মডেল ভুল। কিন্তু আমি যেটা দেখছি, সমস্যাটা আরও গভীরে — আর্কিটেকচারে। আমরা এত দ্রুত ডেটা সংগ্রহের দিকে ছুটছি যে সেটার সাক্ষ্যদানের ক্ষমতা তৈরি করতে ভুলে গেছি।
একটা খেলা চুরি হয়ে যাওয়া ডেটার চেয়ে বিপজ্জনক কিছু নেই — যেটা দাম দিয়ে কেনা, কিন্তু যাচাই করা যায় না। ডেটা বিশ্লেষকরা এখন ড্রেসিংরুমে ঢুকে পড়ছেন, কিন্তু তাঁদের সিদ্ধান্ত প্রায়ই ম্যাচের আসল ছন্দ থেকে বিচ্ছিন্ন। কারণ তাঁরা যে সংখ্যার উপর ভরসা করছেন, সেটা কোন হাত ঘুরে এসেছে, কেউ জানে না। ডেটার পরিমাণ বাড়ছে, কিন্তু ডেটার উপর ভরসার পরিমাণ বাড়ছে না — এই ফাঁকটাই আসল সংকট।
খালি স্টেডিয়ামে খেলা নিজের গলা খুঁজে পায় না — সেখানে শব্দ প্রতিধ্বনি হয়ে ফিরে আসে, গর্জন হয়ে নয়। ঠিক তেমনি, ফাঁকা ডেটা-ফিডও বিশ্লেষককে প্রতিধ্বনি শোনায়, সত্য নয়। আর সেই প্রতিধ্বনিকে সত্য ভেবে ফেলাই আসল ফাঁদ।
আমি ট্রান্সফার গুজব পড়া বন্ধ করেছি সেদিন, যেদিন বুঝলাম বাজারটারও একটা ছন্দ আছে — এবং সেই ছন্দ ডেটার ছন্দের সঙ্গে মেলে না। একইভাবে, আমি আর কখনো ফাঁকা ইনপুটের উপর বিশ্লেষণ দাঁড় করাব না, শুধু স্রোতের সঙ্গে চলার জন্য।
ক্রিকেটের ডেটা অর্থনীতির পরের ধাপটা হবে প্রুভেন্যান্স — এমন এক কাঠামো, যেখানে প্রতিটা পরিসংখ্যানের পেছনে একটা যাচাইযোগ্য চেইন থাকবে, একটা টাইমস্ট্যাম্প, একটা সূত্র। প্রশ্নটা এখন আর 'কার ডেটা সবচেয়ে বেশি?' নয় — প্রশ্নটা হলো, 'কোন ডেটা আমরা যাচাই করতে পারি?' যেদিন ফ্র্যাঞ্চাইজিরা এই প্রশ্নটা করবে, সেদিনই বিশ্লেষণ আসল জায়গায় বসবে — ড্রেসিংরুমের দেয়ালে নয়, মাঠের ছন্দের ভেতরে।
