Развёртывание тестов с рандомизацией вопросов за несколько минут для педагогов

Развёртывание тестов с рандомизацией вопросов за несколько минут для педагогов

Рандомизация вопросов предполагает, что каждый студент получает вопросы в разном порядке, с разной последовательностью ответов или из разного набора заданий, что делает бесполезным копирование ключей с ответами или подглядывание в экран соседа. Главное преимущество — меньше возможностей для несанкционированного обмена информацией, однако метод остаётся справедливым только при условии, что исходные банки вопросов сформированы с одинаковым уровнем сложности и достаточной глубиной, чтобы исключить повторения.


Кратко:

  • Рандомизация работает лучше всего, когда банки вопросов глубокие и хорошо сбалансированные — не менее 100–200 заданий на каждые 10 вопросов для минимизации пересечений.
  • Сочетание нескольких техник рандомизации значительно усложняет списывание, особенно когда одновременно варьируются вопросы, варианты ответов и способ подачи материала.
  • Правильная настройка предполагает маркировку вопросов по результатам обучения и уровню сложности, предварительный просмотр с использованием сид-значений и ведение подробных записей о том, какую версию получил каждый студент.
  • Использование множества небольших подпулов с низким соотношением вопросов к пулу доказанно снижает количество совпадений и последовательных повторений в больших группах.
  • Автоматизированные инструменты оценки, такие как Talent Approved, упрощают рандомизацию и антимошеннические меры, заметно сокращая время настройки при сохранении справедливости и безопасности.

Содержание

Что такое рандомизация вопросов и почему это важно

Рандомизация вопросов включает два связанных подхода: перемешивание порядка, в котором появляются задания, и выборку вопросов из более широкого пула, так что разные студенты видят совершенно разные наборы. Первый подход защищает от ситуации, когда кто-то смотрит в экран соседа и сопоставляет позиции ответов. Второй, который часто называют экзаменами со случайным выбором вопросов (RSQE), защищает от случаев, когда студент, сдавший тест вчера, отправляет ответы другу, который сдаёт его сегодня.

Учебные заведения прибегают к этому методу по трём практическим причинам:

  • Дистанционное и онлайн-тестирование лишило преподавателей физического контроля над аудиторией.
  • Системы автоматической проверки требуют структурированных заданий, поэтому рандомизация масштабируется без дополнительной ручной работы.
  • Большие учебные группы повторно используют один и тот же банк заданий на разных сессиях, и рандомизация не позволяет этому повторному использованию превратиться в утечку.

Рандомизация не заменяет прокторинг или обнаружение плагиата. Это структурный уровень защиты, который делает другие инструменты более эффективными, изначально снижая выгоду от мошенничества.

Виды и техники рандомизации вопросов

Четыре техники охватывают большинство потребностей преподавателей, и они могут применяться совместно.

  1. Перемешивание порядка вопросов. Один и тот же набор заданий появляется в разной последовательности для каждого студента, что исключает простое мошенничество по принципу «сравни позиции ответов».
  2. Перемешивание вариантов ответов. Внутри задания с несколькими вариантами выбора сами варианты чередуются, поэтому фраза «ответ — C» перестаёт быть полезной информацией для обмена.
  3. Случайная выборка из подпулов. Вместо того чтобы каждый студент получал одинаковые 40 вопросов, каждый студент выбирает несколько заданий из десятков эквивалентных подпулов, так что никакие два теста не выглядят одинаково.
  4. Поочерёдная подача вопросов. Студенты видят и отвечают на одно задание, прежде чем появится следующее, что не позволяет просмотреть весь экзамен целиком и координировать ответы в режиме реального времени.

Сочетание всех четырёх техник резко повышает стоимость мошенничества, поскольку студенту пришлось бы согласовывать с кем-то не только ответы, но и их позиции, формулировки и темп — при том что этот кто-то сдаёт принципиально другой тест. Одна оговорка: некоторые задания не следует перемешивать. Если вариант вроде «Ни один из перечисленных» всегда стоит последним, фиксирование этой позиции при перемешивании остальных сохраняет логическую корректность задания.

Совет профессионала: Перед публикацией запустите тест с перемешиванием в режиме предварительного просмотра. Фиксированные варианты ответов, случайно перемешанные, — это самая распространённая ошибка рандомизации, о которой преподаватели сообщают после запуска.

Как настроить рандомизацию в LMS или рабочем процессе оценивания

В большинстве систем управления обучением и платформах для опросов уже есть необходимые элементы управления. Работа состоит не столько в поиске скрытой настройки, сколько в организации контента таким образом, чтобы эти настройки работали предсказуемо.

  • Создайте размеченные банки заданий. Группируйте вопросы по теме и уровню сложности и присваивайте каждому тег результата обучения, который он измеряет, чтобы случайная выборка по-прежнему охватывала нужный материал.
  • Задайте правила выборки. Настройте параметр «выбрать X вопросов из этого пула» для каждого раздела, а не извлекать вопросы из одного большого банка, и включите перемешивание вариантов ответов там, где это уместно.
  • Выполните предварительный просмотр с сид-значением. Такие платформы, как Qualtrics, документируют возможности рандомизации блоков, позволяющие сформировать тестовую выборку и проверить результат до того, как студенты увидят тест.
  • Зафиксируйте то, что должно быть фиксированным. Варианты ответов с фиксированной позицией и любые настройки, связанные с особыми условиями (дополнительное время, программы экранного доступа), должны сохраняться в неизменном виде после перемешивания.
  • Экспортируйте карту соответствий. Ведите запись о том, какое сид-значение или выборка породили ту или иную версию, чтобы при проверке работ и апелляциях можно было сослаться на точный вариант теста, который прошёл студент.

Банки заданий в Canvas и аналогичных системах разработаны именно для такого рабочего процесса: они генерируют уникальный набор вопросов для каждого студента из одного общего банка. Исследование методом Монте-Карло по проектированию RSQE показало, что количество подпулов и коэффициент выборки напрямую определяют, как часто два студента получают пересекающиеся вопросы, именно поэтому следующий раздел подробно рассматривает глубину пулов.

Лучшие практики проектирования для обеспечения справедливости рандомизированных тестов

Рандомизация работает только в том случае, если пулы, из которых она черпает вопросы, хорошо сформированы. Поверхностный пул с пятью заданиями на подпул будет постоянно повторять вопросы в большой группе, каким бы хорошим ни был алгоритм перемешивания.

Схема рандомизации пула вопросов и повторений

Наиболее убедительные данные по этому вопросу получены в ходе анализа методом Монте-Карло 2022 года, охватившего 600 экзаменов со случайным выбором вопросов. Было установлено, что использование большого числа подпулов с низким коэффициентом выборки вопросов — в диапазоне от 5 до 10 процентов — резко сокращает количество повторяющихся и последовательно пересекающихся вопросов между студентами. На практике это означает, что экзамен из 10 вопросов лучше работает при выборке из 100–200 заданий подпула, чем из 40.

Одной только глубины недостаточно. Ряд других правил не менее важен:

  • Каждое задание в подпуле должно проверять один и тот же результат обучения примерно на одинаковом уровне сложности, чтобы ни один студент случайно не получил более лёгкий или более сложный вариант.
  • Выводите задания из употребления и пополняйте пулы после каждой сессии тестирования, особенно на курсах с большой аудиторией, где один и тот же экзамен проводится в нескольких группах или семестрах.
  • Если вы создаёте задания по шаблонам, прежде чем добавлять новое задание в действующий пул, выполните проверку сложности — на основе исторических данных об успеваемости или смоделированной выборки теории ответа на задание (IRT).

Исторические эксперименты с рандомизированными тестами с множественным выбором в целом показали отсутствие измеримого снижения средних результатов при правильной калибровке заданий по сложности. Этот вывод полностью зависит от предварительного выполнения работы по калибровке.

Чек-лист внедрения: настройки, метаданные и проверки в день проведения

Рассматривайте развёртывание как три этапа, а не одну большую сессию настройки.

  1. До экзамена: присвойте каждому заданию теги темы, уровня сложности и результата обучения. Создайте подпулы с низким коэффициентом выборки. Проведите пилотный предварительный просмотр и убедитесь, что фиксированные позиции ответов сохраняются после перемешивания.
  2. Во время экзамена: следите за журналами сессий по мере того, как студенты выполняют тест, и убедитесь, что настройки специальных условий — дополнительное время, совместимость с программами экранного доступа — сохранились в настройках рандомизации и не были переопределены.
  3. После экзамена: экспортируйте полную карту соответствий «сид — студент», чтобы можно было точно восстановить, какую версию получил каждый студент. Выполните базовое сканирование паттернов ответов по всем работам и зафиксируйте показатели справедливости для проверки.

Совет профессионала: Сохраняйте карту соответствий «сид — студент» в тот же день, когда проводите экзамен, а не тогда, когда через три недели поступит запрос о пересмотре оценки. Чем дольше вы ждёте, тем сложнее восстановить, какой вариант теста получил студент.

Команды, работающие с большими группами, нередко включают этот чек-лист в более широкий рабочий процесс масштабного оценивания, чтобы действия в день проведения стали рутиной, а не разовой суетой в каждый цикл тестирования.

Ограничения рандомизации и дополнительные инструменты обеспечения честности

Рандомизация сужает возможности для мошенничества. Она не выявляет его постфактум и не гарантирует, что все варианты теста одинаково сложны.

  • Статистическое обнаружение по-прежнему важно. Тест на рандомизацию по p-значению может выявить подозрительно схожие паттерны ответов между студентами даже тогда, когда сами вопросы были перемешаны или взяты из разных подпулов.
  • Сочетайте с прокторингом и журналами. Записи сессий и журналы активности с временными метками фиксируют поведение, которое рандомизация сама по себе не может отследить, — например, переключение вкладки браузера в середине экзамена.
  • Проверяйте справедливость с помощью IRT. Анализ Иллинойского университета с использованием симуляций теории ответа на задание по 100 перестановкам и 500 прогонам на студента показал, что большинство экзаменов с рандомизированным пулом были достаточно справедливыми; для выявления случаев, когда конкретная выборка из пула оказывалась слишком лёгкой или слишком сложной, использовались такие метрики, как среднее абсолютное отклонение.

Когда проверка справедливости выявляет проблему, решение обычно состоит в переработке подпула, а не в полном отказе от рандомизации.

Создавайте рандомизированные тесты под конкретные роли без ручной настройки

Всё описанное выше — маркировка заданий, формирование подпулов, фиксирование ответов, отслеживание того, какую версию получил каждый, — требует реальных часов ручной настройки. Talent Approved сокращает эту настройку до нескольких минут. Функция Magic Create создаёт оценку навыков под конкретную роль прямо на основе описания вакансии или перечня компетенций, а затем использует многократно применяемые библиотеки вопросов, чтобы вам не приходилось начинать с пустого пула каждый раз, когда вы нанимаете сотрудника.

Talent Approved

Антимошеннический уровень платформы — мониторинг экрана и веб-камеры, воспроизведение сессий и полная карта сид-значений — автоматически берёт на себя операционную часть чек-листа, а сводки, сгенерированные ИИ, избавляют от необходимости вручную просматривать каждый необработанный ответ кандидата для оценки справедливости или выявления аномалий. Поскольку Talent Approved взимает 5 долларов за каждую завершённую оценку кандидата без подписки, команды, проводящие масштабный найм, получают ту же рандомизированную защищённую инфраструктуру тестирования, описанную в этом руководстве, не платя за программное обеспечение, которым пользуются дважды в год. Начните создавать оценку и посмотрите, как быстро описание вакансии превращается в живой, защищённый от взлома тест.

Мнение автора: что действительно имеет значение

Большинство команд слишком много вкладывают в настройку перемешивания и слишком мало — в глубину пула. Широкий подпул с низким коэффициентом выборки делает больше для справедливости, чем любой переключатель перемешивания. Начинайте ответственные оценки с большим количеством подпулов, чем кажется необходимым, тестируйте их в пилотном режиме и позвольте данным о справедливости после экзамена — а не интуиции — указывать на места, где пулы слишком тонкие.

— Jimmie

Источники

FAQ

Что такое тест с рандомизацией?

В контексте разработки оценочных инструментов тест с рандомизацией предполагает представление каждому испытуемому вопросов в разном порядке, с разной последовательностью ответов или из разного набора заданий — зачастую в сочетании со статистическим тестом рандомизации по p-значению, который применяется впоследствии для выявления подозрительного сходства паттернов ответов между студентами.

Что означает рандомизированный вопрос?

Рандомизированный вопрос либо появляется на разной позиции у каждого испытуемого, либо имеет перемешанные варианты ответов, либо выбирается из пула эквивалентных заданий — так что разные студенты могут вообще не видеть одного и того же вопроса.

Какие пять типов тестовых вопросов рандомизируются чаще всего?

Задания с множественным выбором, верно/неверно, на соответствие, на заполнение пропусков и задания с кратким ответом — все они широко рандомизируются, хотя наиболее сложная обработка применяется к вопросам с множественным выбором, поскольку там можно независимо перемешивать и порядок вопросов, и порядок вариантов ответов.

Как рандомизировать вопросы, не нарушая справедливости теста?

Используйте множество подпулов с низким коэффициентом выборки — как правило, от 5 до 10 процентов — и убедитесь, что каждое задание в подпуле проверяет один и тот же результат обучения на одинаковом уровне сложности, прежде чем оно появится в реальном тесте.

Может ли Talent Approved автоматически рандомизировать вопросы оценки?

Да. Многократно используемые библиотеки вопросов и функция Magic Create в Talent Approved позволяют рекрутерам создавать оценки под конкретные роли с рандомизированным выбором заданий и встроенным антимошенническим мониторингом — без ручной настройки пулов с нуля.