নয়েজ ঠিক করুন: টেস্ট বৈধতা ও নির্ভরযোগ্যতার জন্য মূল্যায়নকারীদের ৯টি ধাপ

বৈধতা (Validity) জিজ্ঞেস করে যে একটি স্কোর আসলে আপনি যা বোঝাতে চান তা বোঝায় কিনা। নির্ভরযোগ্যতা (Reliability) জিজ্ঞেস করে যে আপনি যদি আগামীকাল একই ব্যক্তিকে পরিমাপ করেন তাহলে সেই স্কোরটি আবার উঠে আসবে কিনা। দুটি সম্পর্কিত কিন্তু পরস্পর বিনিময়যোগ্য নয়: নির্ভরযোগ্যতা বৈধতার জন্য প্রয়োজনীয় কিন্তু যথেষ্ট নয়, কারণ একটি পরীক্ষা অত্যন্ত সামঞ্জস্যপূর্ণ স্কোর তৈরি করতে পারে যা সম্পূর্ণ ভুল জিনিস পরিমাপ করে। নিচে বিভিন্ন ধরনের প্রমাণ, প্রতিটি অনুমান করতে ব্যবহৃত পরিসংখ্যান এবং এমন একটি মূল্যায়ন তৈরির ব্যবহারিক পদক্ষেপগুলি ভেঙে দেখানো হয়েছে যা উভয়ের অধীনে টিকে থাকে।
সংক্ষেপে (TL;DR):
- উচ্চ নির্ভরযোগ্যতা প্রথমে অপরিহার্য, কারণ অসামঞ্জস্যপূর্ণ স্কোর একটি বৈধ মূল্যায়নকে সমর্থন করতে পারে না, বিশেষত যখন এমন বৈশিষ্ট্য পরিমাপ করা হয় যা সময়ের সাথে স্থির থাকার কথা।
- বৈধতা নির্ভর করে পরীক্ষার স্কোরগুলি কতটা সঠিকভাবে উদ্দিষ্ট ফলাফল পূর্বাভাস দেয় তার উপর, যেখানে বিষয়বস্তু, অভ্যন্তরীণ কাঠামো, চলকের সাথে সম্পর্ক, প্রতিক্রিয়া প্রক্রিয়া এবং পরিণতি মূল প্রমাণ উৎস হিসেবে কাজ করে।
- শক্তিশালী বৈধতার প্রমাণ সংগ্রহের জন্য একটি স্পষ্ট উদ্দেশ্য সংজ্ঞায়িত করা, একটি বিষয়বস্তু ব্লুপ্রিন্ট তৈরি করা, প্রতিনিধিত্বমূলক নমুনা দিয়ে পাইলট করা এবং নির্মাণ ও মানদণ্ড সম্পর্ক বিশ্লেষণ করা প্রয়োজন।
- বেশিরভাগ মূল্যায়নের সমস্যা দুর্বল পরিমাপ গোলমাল থেকে উদ্ভূত হয়, যা শুধু বিষয়বস্তু পর্যালোচনা নয়, লক্ষ্যভিত্তিক আইটেম ডিজাইন এবং মানসম্পন্ন প্রশাসনের মাধ্যমে সমাধান করা যায়।
- ভূমিকা-নির্দিষ্ট আইটেম তৈরি এবং অন্তর্নির্মিত অ্যান্টি-চিট সরঞ্জাম ব্যবহার বৈধকরণকে সহজ করে, অতিরিক্ত ম্যানুয়াল কাজ ছাড়াই ক্রমাগত প্রমাণ সরবরাহ করে, বিশেষত ভূমিকা-ভিত্তিক মূল্যায়নের জন্য।
সূচিপত্র
- পরীক্ষার বৈধতা বোঝা: এর আসল অর্থ কী
- পরীক্ষার নির্ভরযোগ্যতা বোঝা: নির্ভুলতার চেয়ে সামঞ্জস্যতা
- টেস্ট-রিটেস্ট, অভ্যন্তরীণ সামঞ্জস্যতা এবং ইন্টাররেটার নির্ভরযোগ্যতার ব্যাখ্যা
- নির্ভরযোগ্য কিন্তু ভুল, অথবা বৈধ কিন্তু গোলমেলে: বিভ্রান্তি দূর করা
- বৈধতা ও নির্ভরযোগ্যতার প্রমাণ সংগ্রহের ধাপে ধাপে পরিকল্পনা
- শক্তিশালী মূল্যায়নের জন্য একটি ব্যবহারিক চেকলিস্ট
- মূল্যায়ন প্ল্যাটফর্মগুলি ব্যবহারিকভাবে কীভাবে বৈধতা নথিভুক্ত করে
- গবেষণা আসলে আপনাকে কী অগ্রাধিকার দিতে বলে
- ম্যানুয়াল প্রমাণ-ট্রেইল ছাড়াই বৈধ মূল্যায়ন তৈরি করুন
- উৎস
- সচরাচর জিজ্ঞাসা (FAQ)
পরীক্ষার বৈধতা বোঝা: এর আসল অর্থ কী
বৈধতা কোনো সার্টিফিকেশন স্টিকারের মতো একটি পরীক্ষার সাথে বহন করা সম্পত্তি নয়। এটি একটি যুক্তি, প্রমাণ থেকে তৈরি, যা এই বিষয়ে যে স্কোরের ব্যাখ্যাগুলি একটি নির্দিষ্ট উদ্দিষ্ট ব্যবহারকে সমর্থন করে কিনা। একটি কোডিং মূল্যায়ন কাজে ডিবাগিং পারফরম্যান্স পূর্বাভাস দেওয়ার জন্য অত্যন্ত বৈধ হতে পারে এবং নেতৃত্বের সম্ভাবনা পূর্বাভাস দেওয়ার জন্য সম্পূর্ণ অবৈধ হতে পারে, যদিও এটি হুবহু একই পরীক্ষা। স্কোর পরিবর্তন হয়নি। স্কোর সম্পর্কে আপনি যে দাবি করছেন তা পরিবর্তন হয়েছে।
এখানেই অনেক বিভ্রান্তি শুরু হয়। মানুষ জিজ্ঞেস করে "এই পরীক্ষাটি কি বৈধ?" যেন বৈধতা দ্বিমাত্রিক, কিন্তু শিক্ষাগত ও মনোবৈজ্ঞানিক পরীক্ষার মানদণ্ড এটিকে একটি একীভূত বৈধতা যুক্তি হিসেবে উপস্থাপন করে, আলাদা "ধরনের" চেকলিস্টের পরিবর্তে পাঁচটি প্রমাণ উৎস থেকে তৈরি। সেই পাঁচটি উৎস হলো:
- বিষয়বস্তুর প্রমাণ — পরীক্ষার আইটেমগুলি কি আসলে প্রশ্নে থাকা ডোমেন বা দক্ষতার প্রতিনিধিত্ব করে?
- অভ্যন্তরীণ কাঠামোর প্রমাণ — একসাথে গোষ্ঠীভুক্ত আইটেমগুলি কি পরিসংখ্যানগতভাবে সেই নির্মাণের সাথে মিলে যেগুলি পরিমাপ করার কথা?
- অন্যান্য চলকের সাথে সম্পর্ক — স্কোরটি কি তত্ত্ব যেভাবে পূর্বাভাস দেয় সেভাবে বাইরের পরিমাপের সাথে সম্পর্কযুক্ত (এটি পুরনো পাঠ্যপুস্তকগুলি যেটিকে কনভার্জেন্ট, ডিসক্রিমিন্যান্ট এবং ক্রাইটেরিয়ন বৈধতা বলেছিল তা অন্তর্ভুক্ত করে)?
- প্রতিক্রিয়া প্রক্রিয়ার প্রমাণ — পরীক্ষার্থীরা কি আসলে আপনি পরিমাপ করতে চান সেই দক্ষতা ব্যবহার করছে, নাকি ফরম্যাট নিয়ে কৌশল খেলছে?
- পরিণতির প্রমাণ — পরীক্ষাটি ব্যবহার করলে কি ন্যায্য, উদ্দিষ্ট ফলাফল হয়, নাকি নির্দিষ্ট গোষ্ঠীর অনিচ্ছাকৃত ক্ষতি হয়?
উদ্দেশ্য নির্ধারণ করে কোন প্রমাণ আপনার সবচেয়ে বেশি প্রয়োজন। একটি প্রি-এমপ্লয়মেন্ট কোডিং টেস্ট বিষয়বস্তু এবং মানদণ্ডের প্রমাণের উপর জোরালোভাবে নির্ভর করে। দলীয় নিয়োগের জন্য ব্যবহৃত একটি ব্যক্তিত্ব তালিকা অভ্যন্তরীণ কাঠামো এবং সম্পর্কের প্রমাণের উপর নির্ভর করে। বৈধতা শেষ পর্যন্ত নির্ভর করে পরীক্ষাটি যে ফলাফল দাবি করে তা পূর্বাভাস দেয় কিনা তার উপর, আইটেমগুলি চকচকে দেখায় কিনা তার উপর নয়।
পরীক্ষার নির্ভরযোগ্যতা বোঝা: নির্ভুলতার চেয়ে সামঞ্জস্যতা
নির্ভরযোগ্যতা পরিমাপ করে যে একটি পরীক্ষা একই পরিস্থিতিতে বারবার একই ফলাফল দেয় কিনা। ফলাফলটি সঠিক কিনা তার সাথে এর কোনো সম্পর্ক নেই। একটি রান্নাঘরের দাঁড়িপাল্লা যেটি আপনি যতবারই এক পাউন্ড ওজন রাখুন প্রতিবার ১৪ আউন্স দেখায় সেটি নিখুঁতভাবে নির্ভরযোগ্য এবং ধারাবাহিকভাবে দুই আউন্স ভুল।
নির্ভরযোগ্যতা হলো একটি পরিমাপের সামঞ্জস্যতা ও পুনরুৎপাদনযোগ্যতা, যা বারবার পরীক্ষায় ফলাফলগুলি কতটা নির্ভরযোগ্য তা নির্দেশ করে, যখন বৈধতা হলো নির্ভুলতা ও অর্থের আলাদা প্রশ্ন। প্রতিটি পরিমাপে কিছু পরিমাণ ত্রুটি থাকে — ক্লান্তি, বিক্ষিপ্ততা, অস্পষ্ট ভাষা, বা একজন অসামঞ্জস্যপূর্ণ গ্রেডার থেকে এলোমেলো গোলমাল যা একটি পর্যবেক্ষণকৃত স্কোরকে একজন ব্যক্তির "সত্যিকারের" স্কোর থেকে সরিয়ে দেয়। নির্ভরযোগ্যতা আসলে সেই গোলমাল কতটুকু আছে তার একটি অনুমান।
- কম নির্ভরযোগ্যতা মানে স্কোরগুলি প্রচেষ্টা, সেশন বা রেটারের মধ্যে অপ্রত্যাশিতভাবে ওঠানামা করে।
- উচ্চ নির্ভরযোগ্যতা মানে ব্যক্তির সম্পর্কে কোনো অর্থপূর্ণ পরিবর্তন না হলে স্কোরগুলি স্থিতিশীল থাকে।
- নির্ভরযোগ্যতা বৈধতার একটি সর্বোচ্চ সীমা নির্ধারণ করে: একটি মারাত্মক গোলমেলে পরিমাপ যেকোনো কিছুর সাথে, এমনকি যে ফলাফলটি পূর্বাভাস দেওয়ার কথা তার সাথেও, শক্তিশালীভাবে সম্পর্কযুক্ত হতে পারে না।
শেষ বিষয়টি জোর দেওয়ার যোগ্য, কারণ এটি দুটি ধারণার মধ্যে যান্ত্রিক সংযোগ। যেকোনো পরিমাপে কম নির্ভরযোগ্যতা তাদের মধ্যে সর্বোচ্চ পর্যবেক্ষণযোগ্য সম্পর্ককে সীমিত করে দেয়, যা অ্যাটেনুয়েশন নামে একটি প্রভাব। নির্ভরযোগ্যতার তিনটি সাধারণ রূপ — টেস্ট-রিটেস্ট, অভ্যন্তরীণ সামঞ্জস্যতা এবং ইন্টাররেটার চুক্তি — প্রতিটি সেই গোলমালের আলাদা উৎস ধারণ করে।
টেস্ট-রিটেস্ট, অভ্যন্তরীণ সামঞ্জস্যতা এবং ইন্টাররেটার নির্ভরযোগ্যতার ব্যাখ্যা
টেস্ট-রিটেস্ট নির্ভরযোগ্যতা সময়ের সাথে স্থিতিশীলতা পরিমাপ করে। আপনি একই পরীক্ষা একই মানুষদের দুইবার দেন, সাধারণত দুই থেকে চার সপ্তাহ আলাদা, এবং দুটি স্কোরের সেটের সম্পর্ক নির্ণয় করেন। এটি স্থিতিশীল বৈশিষ্ট্যের জন্য উপযুক্ত, যেমন সাধারণ জ্ঞানীয় ক্ষমতা বা ব্যক্তিত্বের মাত্রা, এমন নির্মাণের জন্য খারাপভাবে উপযুক্ত যেগুলি দ্রুত পরিবর্তন হওয়ার কথা, যেমন মেজাজ বা স্বল্পমেয়াদী চাপ।
অভ্যন্তরীণ সামঞ্জস্যতা পরিমাপ করে যে একটি পরীক্ষার আইটেমগুলি একে অপরের সাথে একমত কিনা, সাধারণত Cronbach's alpha এর মাধ্যমে। এটি চালানোর সবচেয়ে দ্রুত নির্ভরযোগ্যতা পরীক্ষা কারণ এটির জন্য মাত্র একটি প্রশাসন প্রয়োজন, যে কারণে এটি অতিরিক্ত ব্যবহার হয়। Alpha একটি পরীক্ষার আইটেমের সংখ্যার প্রতি সংবেদনশীল, তাই একটি দীর্ঘ পরীক্ষা স্বতন্ত্র আইটেমগুলি মাঝারি মানের হলেও একটি স্ফীত alpha তৈরি করতে পারে। Omega সহগাঙ্ক অসমান আইটেম মানের পরীক্ষার জন্য এটি আরও ভালোভাবে পরিচালনা করে, যদিও alpha শিল্পের ডিফল্ট হয়ে আছে।
ইন্টাররেটার নির্ভরযোগ্যতা গুরুত্বপূর্ণ যখনই কোনো মানুষ বিষয়গত কিছু স্কোর করে — একটি লেখার নমুনা, একটি কাঠামোগত সাক্ষাৎকার, একটি ভিডিও-ভিত্তিক কাজ। Cohen's kappa বা একটি ইন্ট্রাক্লাস কোরিলেশন কোয়েফিশিয়েন্ট (ICC) রেটারদের মধ্যে চুক্তির পরিমাণ নির্ধারণ করে, সুযোগ দ্বারাই প্রত্যাশিত চুক্তির জন্য সংশোধন করে।
প্রো টিপ: একটি যুক্তিসংগত উচ্চ স্তরে একটি টেস্ট-রিটেস্ট সম্পর্ক (প্রায়শই +.৮০ বা তার বেশির কাছাকাছি) স্থিতিশীল বৈশিষ্ট্যের জন্য একটি ব্যবহারিক মানদণ্ড হিসেবে বিবেচিত হয়। এমন কোনো বৈশিষ্ট্যে যা সপ্তাহ থেকে সপ্তাহে পরিবর্তন হওয়ার কথা নয় তাতে এর চেয়ে উল্লেখযোগ্যভাবে কম যেকোনো কিছু একটি ডিজাইন সমস্যার সংকেত দেয় যা আপনি তার উপর যেকোনো বৈধতার মামলা তৈরি করার আগে তদন্ত করার মূল্য রাখে।
প্রসঙ্গ নির্ধারণ করে কোন রূপটি সবচেয়ে বেশি গুরুত্বপূর্ণ। একটি স্বয়ংক্রিয়ভাবে স্কোর করা দক্ষতা পরীক্ষার জন্য শক্তিশালী অভ্যন্তরীণ সামঞ্জস্যতা প্রয়োজন কিন্তু কোনো ইন্টাররেটার পরীক্ষার প্রয়োজন নেই। একটি কাঠামোগত সাক্ষাৎকারের জন্য প্রায় সবকিছুর উপরে ইন্টাররেটার চুক্তি প্রয়োজন।
নির্ভরযোগ্য কিন্তু ভুল, অথবা বৈধ কিন্তু গোলমেলে: বিভ্রান্তি দূর করা
পরীক্ষার বৈধতা বনাম নির্ভরযোগ্যতার পার্থক্য দেখার সবচেয়ে পরিষ্কার উপায় হলো দুটি ব্যর্থতার ধরনের মাধ্যমে যা দেখতে মোটেই একরকম নয় কিন্তু উভয়ই একটি মূল্যায়ন নষ্ট করে।
- নির্ভরযোগ্য কিন্তু অবৈধ: একটি পক্ষপাতদুষ্ট থার্মোমিটার যা প্রতিবার দুই ডিগ্রি বেশি দেখায়। এটি নিখুঁতভাবে সামঞ্জস্যপূর্ণ, যা এটিকে নির্ভরযোগ্য করে, কিন্তু প্রতিটি পাঠ ভুল, যা এটিকে অবৈধ করে।
- বৈধ কিন্তু অনির্ভরযোগ্য: একটি বৃহত্তর দক্ষতা কভার করে মাত্র তিনটি আইটেম সহ একটি দক্ষতা পরীক্ষা। গড়ে অনেক পরীক্ষার্থী জুড়ে এটি চাকরির পারফরম্যান্সের সাথে যুক্তিসংগতভাবে সম্পর্কযুক্ত হতে পারে, কিন্তু যেকোনো একজন ব্যক্তির স্কোর প্রচেষ্টার মধ্যে এত বেশি ওঠানামা করে যে ব্যক্তিগতভাবে বিশ্বাস করা যায় না।
এই উদাহরণগুলি মানুষ সবচেয়ে বেশি যে দুটি প্রশ্ন খোঁজে তার উত্তর দেয়। কোনটি আগে আসে? নির্ভরযোগ্যতা, কার্যত, কারণ আপনি অসামঞ্জস্যপূর্ণ স্কোরের উপর একটি রক্ষণযোগ্য বৈধতা যুক্তি তৈরি করতে পারবেন না। একটি পরীক্ষা কি বৈধ না হয়েও নির্ভরযোগ্য হতে পারে? হ্যাঁ, সহজেই, এবং এটি ক্রমাগত এমন পরীক্ষাগুলির সাথে ঘটে যা অভ্যন্তরীণভাবে সামঞ্জস্যপূর্ণ কিন্তু কেবল উদ্দিষ্ট ব্যবহারের জন্য ভুল নির্মাণ পরিমাপ করে।
যদি আপনার নির্ভরযোগ্যতা শক্তিশালী হয় কিন্তু বৈধতার প্রমাণ পাতলা হয়, তাহলে সমাধান সাধারণত বিষয়বস্তু: বিষয় বিশেষজ্ঞদের নিয়ে আসুন এবং পরীক্ষা করুন আইটেমগুলি আসলে চাকরি বা বৈশিষ্ট্যের প্রতিনিধিত্ব করে কিনা। যদি নির্ভরযোগ্যতা নিজেই দুর্বল হয়, তাহলে বৈধতার প্রমাণের পরিমাণ পরীক্ষাটি বাঁচাবে না। আপনাকে প্রথমে পরিমাপ গোলমাল ঠিক করতে হবে — সাধারণত ভালোভাবে লক্ষ্যভিত্তিক আইটেম যোগ করে বা স্কোরিং নিয়ম শক্ত করে — বৈধতার প্রশ্নটি উত্তরযোগ্য হওয়ার আগেই।
বৈধতা ও নির্ভরযোগ্যতার প্রমাণ সংগ্রহের ধাপে ধাপে পরিকল্পনা
একটি রক্ষণযোগ্য বৈধতা যুক্তি তৈরি করা একটি ক্রম, একটি একক অধ্যয়ন নয়। এখানে সেই ক্রম রয়েছে যা প্রমাণ তৈরি করে যার পেছনে আপনি সত্যিকার অর্থে দাঁড়াতে পারবেন।
- একটি বাক্যে উদ্দিষ্ট ব্যবহার সংজ্ঞায়িত করুন। "এই মূল্যায়নটি একটি গ্রাহক সহায়তা ভূমিকার জন্য প্রথম-৯০-দিনের পারফরম্যান্স পূর্বাভাস দেয়" এরপর প্রতিটি সিদ্ধান্ত নির্দেশনা দেওয়ার জন্য যথেষ্ট নির্দিষ্ট।
- একটি বিষয়বস্তু ব্লুপ্রিন্ট তৈরি করুন। একটি আইটেম লেখার আগে উদ্দিষ্ট ব্যবহারের প্রয়োজনীয় দক্ষতা বা জ্ঞান ডোমেনগুলি তালিকাভুক্ত করুন, গুরুত্ব দ্বারা ওজনযুক্ত।
- একটি বিশেষজ্ঞ বিষয়বস্তু পর্যালোচনা পরিচালনা করুন। দুই বা তিনজন বিষয়-বিশেষজ্ঞকে স্বাধীনভাবে মূল্যায়ন করতে দিন যে প্রতিটি আইটেম ব্লুপ্রিন্টের সাথে মিলে কিনা এবং যেকোনো অপ্রাসঙ্গিক জিনিস চিহ্নিত করুন।
- একটি প্রতিনিধিত্বমূলক নমুনায় পরীক্ষাটি পাইলট করুন। এমনকি ৪০ থেকে ৮০টি প্রতিক্রিয়াও আইটেম-স্তরের সমস্যা প্রকাশ করে — বিভ্রান্তিকর ভাষা, সিলিং প্রভাব, কেউ ভুল করে না এমন আইটেম।
- অভ্যন্তরীণ কাঠামো বিশ্লেষণ চালান। এক্সপ্লোরেটরি বা কনফার্মেটরি ফ্যাক্টর বিশ্লেষণ ব্যবহার করে পরীক্ষা করুন আইটেমগুলি আপনার ব্লুপ্রিন্টের পূর্বাভাস অনুযায়ী ক্লাস্টার করে কিনা, এবং প্রতিটি সাবস্কেলের জন্য Cronbach's alpha বা omega গণনা করুন।
- কনভার্জেন্ট এবং ডিসক্রিমিন্যান্ট সম্পর্ক পরীক্ষা করুন। একই নির্মাণের একটি প্রতিষ্ঠিত পরিমাপের বিপরীতে এবং একটি সম্পর্কহীন পরিমাপের বিপরীতে স্কোরগুলির সম্পর্ক নির্ণয় করুন যা নিশ্চিত করতে পরীক্ষাটি যা দাবি করে তা পরিমাপ করে।
- সম্ভব হলে মানদণ্ড ডেটা সংগ্রহ করুন। প্রকৃত ফলাফল ট্র্যাক করুন — চাকরির পারফরম্যান্স রেটিং, পদোন্নতির হার, ত্রুটির হার — এবং মূল স্কোরের বিপরীতে সেগুলির সম্পর্ক নির্ণয় করুন।
- নমুনার আকার, প্রসঙ্গ এবং আস্থার ব্যবধান রিপোর্ট করুন। একটি অফিসে ৩০ জন লোক থেকে একটি নির্ভরযোগ্যতা সহগাঙ্ক পাঁচটি দেশে ২,০০০ জনের উপর ভিত্তি করে একটি থেকে আলাদা অর্থ বহন করে।
- পুরো যুক্তিটি নথিভুক্ত করুন। লিখুন কী প্রমাণ সংগ্রহ করা হয়েছিল, কেন, এবং এটি কীভাবে প্রথম ধাপে সংজ্ঞায়িত নির্দিষ্ট উদ্দিষ্ট ব্যবহারকে সমর্থন করে।
প্রো টিপ: প্রথম ধাপটি এড়িয়ে গেলে পরবর্তী সবকিছু পরে রক্ষা করা কঠিন হয়ে পড়ে। পর্যালোচকরা, নিরীক্ষকরা এবং এমনকি আপনার নিজের দলও ক্রমাগত জিজ্ঞেস করতে থাকবে "কীসের জন্য বৈধ?" যদি উদ্দিষ্ট ব্যবহার প্রথম স্থানে কখনো লেখা না হয়।
ভূমিকা-নির্দিষ্ট স্ক্রিনিং পরীক্ষা তৈরি করা দলগুলি প্রায়ই সরাসরি পাইলটিংয়ে চলে যায় এবং ব্লুপ্রিন্ট ধাপটি এড়িয়ে যায়, যা ঠিক বিপরীত। ব্লুপ্রিন্টই পরবর্তী প্রতিটি ধাপকে ব্যাখ্যাযোগ্য করে তোলে।
শক্তিশালী মূল্যায়নের জন্য একটি ব্যবহারিক চেকলিস্ট
বেশিরভাগ বৈধতা এবং নির্ভরযোগ্যতার সমস্যা মুষ্টিমেয় সংশোধনযোগ্য ডিজাইন পছন্দ থেকে উদ্ভূত হয়। একটি মূল্যায়ন পাঠানো বা সংশোধন করার আগে, এগুলি পরীক্ষা করুন:
- প্রতিটি আইটেমকে আপনার বিষয়বস্তু ব্লুপ্রিন্টের একটি নির্দিষ্ট লাইনে ম্যাপ করতে হবে; যে কিছু তার জায়গা অর্জন করে না তা কেটে ফেলুন।
- সাধারণভাবে আরও ভালোভাবে লক্ষ্যভিত্তিক আইটেমগুলি কম বিস্তৃত আইটেমগুলিকে হারায়, কারণ অতিরিক্ত আইটেমগুলি পরিমাপ গোলমাল কমায় এবং অভ্যন্তরীণ সামঞ্জস্যতা বাড়ায়।
- প্রশাসনের পরিস্থিতি মানসম্পন্ন করুন — সময়সীমা, নির্দেশাবলী, পরিবেশ — যাতে স্কোরের পরিবর্তন ব্যক্তিকে প্রতিফলিত করে, সেটিং নয়।
- রেটারদের একটি ভাগ করা রুব্রিকে প্রশিক্ষণ দিন এবং যেকোনো একজন গ্রেডারের বিচারকে বিশ্বাস করার আগে ইন্টাররেটার চুক্তি পরীক্ষা করুন।
- পূর্ণ রোলআউটের আগে পাইলট করুন, এবং প্রথম সংস্করণকে এমন একটি খসড়া হিসেবে বিবেচনা করুন যার সংশোধন দরকার হবে।
- যখনই পারেন মানদণ্ড বা কনভার্জেন্ট ডেটা সংগ্রহ করুন, এমনকি অনানুষ্ঠানিকভাবেও, এবং এটি বাকি প্রমাণের পাশে লগ করুন।
প্রো টিপ: নিরীক্ষা-প্রস্তুত দক্ষতা পরীক্ষা তৈরিকারী নিয়োগকর্তারা প্রায়ই দেখেন যে সবচেয়ে বড় নির্ভরযোগ্যতা লাভ আসে স্কোরিং মানসম্পন্ন করা থেকে, প্রশ্ন যোগ করা থেকে নয়। একটি অস্পষ্ট রুব্রিক প্রতিবার একটি সুনির্মিত আইটেম ব্যাংকের সুবিধা বাতিল করে দেবে।
একটি জেনেরিক দক্ষতা লেবেলের পরিবর্তে একটি প্রকৃত চাকরির বিবরণে আইটেমগুলি ম্যাপ করাও বিষয়বস্তুর প্রমাণ উল্লেখযোগ্যভাবে শক্ত করে, কারণ জেনেরিক লেবেলগুলি জেনেরিক, কম-প্রাসঙ্গিক আইটেমগুলিকে আমন্ত্রণ জানায়।
মূল্যায়ন প্ল্যাটফর্মগুলি ব্যবহারিকভাবে কীভাবে বৈধতা নথিভুক্ত করে
এই প্রমাণ হাতে সংগ্রহ করা — আইটেম পরিসংখ্যানের স্প্রেডশিট, আলাদা রেটার নোট, পাইলট ডেটার একটি ফোল্ডার — ঠিক সেই কারণেই বেশিরভাগ দল একটি বিষয়বস্তু পর্যালোচনায় থামে এবং সম্পন্ন বলে ডাকে। কাঠামোগত, ভূমিকা-নির্দিষ্ট পরীক্ষার চারপাশে নির্মিত একটি প্ল্যাটফর্ম কঠোরতা বাদ দেওয়ার পরিবর্তে সেই চক্রটি সংকুচিত করতে পারে।
একটি চাকরির বিবরণ বা দক্ষতার তালিকা থেকে সরাসরি আইটেম তৈরি করা আপনাকে প্রথম খসড়া থেকেই একটি বিষয়বস্তু ব্লুপ্রিন্ট দেয়, আইটেমগুলি ইতিমধ্যে বিদ্যমান থাকার পরে একটি রিভার্স-ইঞ্জিনিয়ার করার পরিবর্তে। র্যান্ডমাইজড আইটেম ডেলিভারি এবং অ্যান্টি-চিট মনিটরিং — স্ক্রিন এবং ওয়েবক্যাম চেক সহ — প্রতিক্রিয়া-প্রক্রিয়া এবং পরিণতির প্রমাণকে শক্তিশালী করে স্কোর দক্ষতার পরিবর্তে প্রতারণা প্রতিফলিত করার সম্ভাবনা কমিয়ে। এক্সপোর্টযোগ্য আইটেম পরিসংখ্যান, সেশন রিপ্লে এবং পারফরম্যান্স সারাংশ যা একসময় একটি বিক্ষিপ্ত বৈধকরণ ফোল্ডার ছিল তাকে একটি চলমান রেকর্ডের কাছাকাছি কিছুতে পরিণত করে।
প্ল্যাটফর্মের পদ্ধতি প্রতিটি সম্পন্ন মূল্যায়নকে একটি চলমান বৈধতা যুক্তিতে একটি ডেটা পয়েন্ট হিসেবে বিবেচনা করে, শুধু একটি নিয়োগের সিদ্ধান্ত নয় — যা একটি রক্ষণযোগ্য পরীক্ষার প্রোগ্রামকে একটি অন্তর্দৃষ্টিভিত্তিক প্রোগ্রাম থেকে আলাদা করে।
গবেষণা আসলে আপনাকে কী অগ্রাধিকার দিতে বলে
প্রচলিত পরামর্শ এবং প্রমাণ যা সমর্থন করে তার মধ্যে সবচেয়ে বড় ব্যবধান হলো ক্রমবিন্যাস। বেশিরভাগ নির্দেশনা বৈধতা এবং নির্ভরযোগ্যতাকে সমান্তরাল চেকলিস্ট হিসেবে বিবেচনা করে যা একবার চালিয়ে দিতে হয়। সেগুলি সমান্তরাল নয়। নির্ভরযোগ্যতা হলো মেঝে; বৈধতা হলো আপনি তার উপরে যা তৈরি করেন, এবং যেকোনো পরিমাণ বিশেষজ্ঞ বিষয়বস্তু পর্যালোচনা এমন একটি পরীক্ষাকে উদ্ধার করতে পারবে না যার স্কোরগুলি এক বসা থেকে পরের বসায় ওঠানামা করে।

দ্বিতীয় ব্যবধানটি আরও অস্বস্তিকর: দলগুলি বিষয়বস্তুর প্রমাণ পছন্দ করে কারণ এটি সস্তা এবং দ্রুত — তিনজন বিশেষজ্ঞ, এক বিকেল, সম্পন্ন। মানদণ্ডের প্রমাণ — আসলে পরীক্ষা করা যে স্কোরগুলি আপনি দাবি করেন সেই ফলাফল পূর্বাভাস দেয় কিনা — একাডেমিক গবেষণার বাইরে প্রায় সর্বত্র এড়িয়ে যাওয়া হয়, কারণ এর জন্য ধৈর্য এবং ফলাফলের ডেটা প্রয়োজন যা বেশিরভাগ নিয়োগ দল কখনো সংগ্রহ করে না।
যদি আপনি এখান থেকে একটি জিনিস নেন, এটি নিন: একটি আইটেম লেখার আগে একটি একক বাক্যে আপনার উদ্দিষ্ট ব্যবহার লিখুন। অন্য সব কিছু — ব্লুপ্রিন্ট, পরিসংখ্যান, রেটার প্রশিক্ষণ — শুধুমাত্র কাজ করে যদি সেই বাক্যটি সুনির্দিষ্ট হয়। অস্পষ্ট উদ্দিষ্ট ব্যবহার অস্পষ্ট প্রমাণ তৈরি করে, ফ্যাক্টর বিশ্লেষণটি যতই পরিশীলিত দেখাক না কেন।
— Jimmie
ম্যানুয়াল প্রমাণ-ট্রেইল ছাড়াই বৈধ মূল্যায়ন তৈরি করুন
হাতে একটি বৈধতা যুক্তি নথিভুক্ত করা — এক স্প্রেডশিটে আইটেম পরিসংখ্যান ট্র্যাক করা, অন্যটিতে রেটার নোট, অন্য কোথাও পাইলট ডেটা — ঠিক সেই ধরনের কাজ যা ডেডলাইনের চাপে চুপচাপ এড়িয়ে যাওয়া হয়। একটি সরঞ্জাম একটি চাকরির বিবরণ থেকে সরাসরি ভূমিকা-নির্দিষ্ট আইটেম তৈরি করে, আপনি একটি প্রশ্ন লেখার আগেই আপনাকে একটি বিষয়বস্তু ব্লুপ্রিন্ট দেয়, যখন অন্তর্নির্মিত অ্যান্টি-চিট মনিটরিং এবং সেশন রিপ্লে প্রতিক্রিয়া-প্রক্রিয়ার প্রমাণ যোগ করে যা বেশিরভাগ দল কখনো সংগ্রহ করে না।

কোনো সাবস্ক্রিপশনে প্রতিশ্রুতিবদ্ধ হতে হবে না। আপনি প্রতি সম্পন্ন প্রার্থীর জন্য অর্থ প্রদান করেন, তাই খরচ আপনি আসলে যে নিয়োগ করছেন তার সাথে স্কেল করে, একটি ফ্ল্যাট লাইসেন্স ফি নয়। আপনি যদি একটি নির্দিষ্ট ভূমিকার জন্য দক্ষতা মূল্যায়ন করছেন এবং নির্ভরযোগ্যতা এবং বৈধতার প্রমাণ প্রক্রিয়ায় অন্তর্নির্মিত চান, ঘটনার পরে একসাথে জড়ো করা নয়, প্ল্যাটফর্মটি দেখুন এবং দেখুন কীভাবে একটি চাকরির বিবরণ মিনিটের মধ্যে একটি পরীক্ষাযোগ্য, রক্ষণযোগ্য মূল্যায়নে পরিণত হয়।
উৎস
ক্লাসিক পাঠ্যপুস্তকগুলি এখনও বিষয়বস্তু, নির্মাণ এবং মানদণ্ড বৈধতাকে তিনটি আলাদা বাক্স হিসেবে শেখায় যা পরীক্ষা করতে হবে। আধুনিক সাইকোমেট্রিক্স সেগুলিকে একটি যুক্তির দিক হিসেবে বিবেচনা করে, এবং কিছু বিশেষজ্ঞ স্পষ্টভাবে সেগুলিকে আলাদা করার বিরুদ্ধে যুক্তি দেন কারণ একটি পরীক্ষা এক দিকে ভালো দেখাতে পারে এবং অন্যটিতে ব্যাপকভাবে ব্যর্থ হতে পারে। এখানে প্রমাণ আসলে কখন এবং কীভাবে সংগ্রহ করা হয় তার দ্বারা ভেঙে পড়ে:
- গবেষণায় নির্ভরযোগ্যতা বনাম বৈধতা
- শিক্ষাগত ও মনোবৈজ্ঞানিক পরীক্ষায় বৈধতার একটি ভূমিকা
- মূল্যায়নের জন্য বৈধতা
- পরিমাপের নির্ভরযোগ্যতা এবং বৈধতা (LibreTexts)
ডেটা-পূর্ব বিশেষজ্ঞ রায় এবং ডেটা-পরবর্তী পরিসংখ্যানগত পরীক্ষার মধ্যে পার্থক্য করা গুরুত্বপূর্ণ কারণ দলগুলি প্রায়ই প্রথম ধাপে থামে। তিনজন বিষয় বিশেষজ্ঞের কাছ থেকে একটি বিষয়বস্তু পর্যালোচনা পুঙ্খানুপুঙ্খ মনে হয়, কিন্তু এটি এই বিষয়ে কিছুই বলে না যে পরীক্ষাটি বাস্তবে কিছু পূর্বাভাস দেয় কিনা।
সচরাচর জিজ্ঞাসা (FAQ)
বৈধতা না নির্ভরযোগ্যতা, কোনটি আগে আসে?
নির্ভরযোগ্যতা কার্যত আগে আসে। আপনি এমন স্কোরের উপর একটি বিশ্বাসযোগ্য বৈধতা যুক্তি তৈরি করতে পারবেন না যা সামঞ্জস্যপূর্ণ নয়, যদিও একা নির্ভরযোগ্যতা কখনো প্রমাণ করে না যে একটি পরীক্ষা বৈধ।
একটি পরীক্ষা কি বৈধতা ছাড়া নির্ভরযোগ্যতা রাখতে পারে?
হ্যাঁ। একটি পরীক্ষা অত্যন্ত সামঞ্জস্যপূর্ণ স্কোর তৈরি করতে পারে যা তবুও সম্পূর্ণ ভুল নির্মাণ পরিমাপ করে — ক্লাসিক উদাহরণ হলো একটি দাঁড়িপাল্লা যা প্রতিবার একই ভুল ওজন দেখায়।
নির্ভরযোগ্যতা এবং বৈধতার মধ্যে প্রধান পার্থক্য কী?
নির্ভরযোগ্যতা জিজ্ঞেস করে একটি পরিমাপ সামঞ্জস্যপূর্ণ কিনা; বৈধতা জিজ্ঞেস করে সেই পরিমাপ একটি নির্দিষ্ট উদ্দিষ্ট ব্যবহারের জন্য আসলে যা দাবি করে তা ধারণ করে কিনা।
বৈধতা এবং নির্ভরযোগ্যতার কিছু উদাহরণ কী?
একটি পক্ষপাতদুষ্ট থার্মোমিটার যা সবসময় দুই ডিগ্রি বেশি দেখায় নির্ভরযোগ্য কিন্তু অবৈধ; একটি তিন-আইটেম পরীক্ষা যা গড়ে চাকরির পারফরম্যান্স পূর্বাভাস দেয় কিন্তু ব্যক্তিদের জন্য ব্যাপকভাবে দুলে সেটি বৈধ কিন্তু অনির্ভরযোগ্য।
আপনি পরীক্ষার নির্ভরযোগ্যতা কীভাবে পরিমাপ করবেন?
তিনটি সবচেয়ে সাধারণ পদ্ধতি হলো টেস্ট-রিটেস্ট সম্পর্ক, Cronbach's alpha এর মতো অভ্যন্তরীণ সামঞ্জস্যতার পরিমাপ, এবং kappa বা ICC এর মতো ইন্টাররেটার চুক্তির পরিসংখ্যান — পরীক্ষাটি পুনরাবৃত্তি করা হয়, আইটেম দ্বারা স্কোর করা, বা মানব রেটার দ্বারা স্কোর করা কিনা তার উপর ভিত্তি করে বেছে নেওয়া হয়।