3 формулы для таблиц: частичный кредит и модель Раша

Частичное кредитование при оценивании назначает баллы в диапазоне значений, а не по принципу «всё или ничего», вознаграждая испытуемого за ту часть ответа, которая является правильной. Педагоги используют его, поскольку оно измеряет частичные знания, которые дихотомическое оценивание «правильно/неправильно» отбрасывает; кроме того, грамотно выстроенные функции частичного кредитования снижают выгоду от случайного угадывания. Этот подход лучше всего подходит для многосоставных заданий, вопросов с несколькими вариантами ответа и развёрнутых ответов, оцениваемых по рубрике, — особенно когда вам нужна более детальная диагностическая информация, чем та, которую даёт простая оценка «зачёт/незачёт».
Коротко о главном:
- Частичное кредитование при оценивании лучше отражает знания учащихся по многосоставным вопросам, вопросам с несколькими вариантами ответа и вопросам с развёрнутым ответом, чем простой подход «правильно/неправильно».
- Такие методы, как выбор подмножества и линейный штраф, сдерживают угадывание, однако требуют чётких инструкций и могут усложнять оценивание и подготовку экзаменаторов.
- Эмпирические исследования показывают, что частичное кредитование повышает надёжность и дискриминативность заданий — особенно при массовом тестировании или при использовании вопросов с несколькими вариантами ответа, склонных к угадыванию.
- Большинству классных контрольных работ не нужны сложные модели, такие как модель частичного кредитования Раша, которые зарезервированы для крупномасштабных программ тестирования и квалификационных экзаменов.
- Использование специализированных инструментов, автоматизирующих применение рубрики, согласованность экзаменаторов и прозрачность оценивания, упрощает внедрение и обеспечивает справедливую и последовательную оценку с частичным кредитованием.
Содержание
- Что означает частичное кредитование при оценивании и когда его использовать
- Распространённые методы частичного кредитования
- Как рассчитать частичное кредитование: разобранные примеры
- Статистические модели и IRT: модель частичного кредитования Раша
- Лучшие практики внедрения: разработка, настройка и отчётность
- Надёжность, валидность и подавление угадывания
- Шаблоны оценивания для заданий с несколькими вариантами ответа
- Контрольный список управления для практиков перед масштабированием
- Когда частичное кредитование оправдывает свою сложность
- Создавайте оценки с частичным кредитованием, не выстраивая инфраструктуру самостоятельно
- Источники
- FAQ
Что означает частичное кредитование при оценивании и когда его использовать
Дихотомическое оценивание рассматривает ответ как полностью правильный или полностью неправильный — один балл или ноль. Частичное кредитование разрушает эту бинарность. Учащийся, выбравший три из четырёх правильных вариантов в задании с несколькими ответами, или безупречно выполнивший постановку многошаговой задачи, но допустивший ошибку в финальных вычислениях, получает кредит пропорционально тому, что он фактически продемонстрировал.
Аргументы в пользу частичного кредитования опираются на три практических результата. Во-первых, оно фиксирует частичные знания, которые строгое правило «правильно/неправильно» стирает, — это особенно важно для заданий с несколькими обоснованными подответами. Во-вторых, правильно выстроенные функции оценивания способны сделать ожидаемую ценность случайного угадывания отрицательной, так что угадывание перестаёт быть рациональной стратегией — этот эффект формально смоделирован в исследованиях функций оценивания. В-третьих, эмпирические сравнения на заданиях с несколькими вариантами ответа показали, что методы частичного кредитования повысили как надёжность, так и дискриминативность заданий по сравнению с дихотомическим оцениванием.
Частичное кредитование не нужно применять повсеместно. Словарный диктант с единственным правильным ответом ничего от него не выиграет и лишь добавит сложности в оценивание. Обращайтесь к частичному кредитованию, когда задания действительно многосоставные, когда вопросы с несколькими вариантами ответа предполагают более двух правдоподобных выборов, или когда развёрнутый ответ можно разложить на рубрику с отдельными, оцениваемыми компонентами.
Распространённые методы частичного кредитования
Ни одна формула не является универсально лучшей для всех контекстов. Классические обзоры этой области описывают целый ряд методов и последовательно обнаруживают компромиссы, а не универсального победителя, поэтому правильный выбор зависит от формата задания и от того, от чего вы хотите защититься — будь то угадывание, непоследовательность экзаменаторов или сама сложность оценивания.
- Пропорциональное оценивание (по числу правильных ответов). Баллы равны доле правильно выбранных вариантов от общего числа возможных. Просто в расчёте, легко объяснить учащимся, однако уязвимо для манипуляций в заданиях с несколькими вариантами ответа, где выбор всех вариантов гарантирует базовый балл.
- Оценивание по выбору подмножества (SS-оценивание). Полный балл начисляется только при выборе точно правильного подмножества; частичный балл присваивается за подмножества, правильно совпадающие с ключом, с вычетом штрафов за включённые дистракторы. Обеспечивает лучший контроль угадывания, чем чисто пропорциональное оценивание, ценой несколько более сложного правила для объяснения.
- Модифицированные функции в стиле Зепечельнюка. Используют математически выведенную структуру штрафов, разработанную так, чтобы ожидаемая ценность слепого угадывания становилась отрицательной, — это напрямую решает проблему угадывания, а не просто мирится с ней.
- Линейные модели со штрафом. Балл равен числу правильно выбранных вариантов минус взвешенное количество неправильно выбранных. Настраивается путём изменения веса штрафа, что позволяет регулировать, насколько агрессивно вы хотите препятствовать чрезмерному выбору вариантов.
- Дробное оценивание на основе рубрики. Развёрнутые ответы оцениваются по упорядоченной рубрике (например, от 0 до 4), а затем переводятся в долю от общего числа баллов за задание. Это стандартный подход для эссе, многошаговых математических задач и лабораторных отчётов.
Пропорциональное оценивание подходит для заданий с несколькими выборами и множественными пропусками, где формат прост и риск угадывания невысок. Методы выбора подмножества и линейного штрафа подходят для заданий с несколькими вариантами ответа, в которых дистракторы достаточно привлекательны, чтобы случайный выбор мог завысить баллы. Дробное оценивание на основе рубрики — по сути единственный разумный вариант для открытых развёрнутых ответов, поскольку здесь нет дискретного «числа правильных», на которое можно делить.
Паттерн компромиссов одинаков для всех методов: более простые формулы (пропорциональное оценивание) легче всего понять учащимся и преподавателям, но наименее эффективны против угадывания; штрафные методы и методы подмножеств лучше контролируют угадывание, но требуют более чётких инструкций, чтобы учащиеся понимали, как взвешиваются их выборы. Оценивание на основе рубрики несёт совершенно иной риск: непоследовательность экзаменаторов, которую никакая формула сама по себе не устранит.
Как рассчитать частичное кредитование: разобранные примеры
Приведённые выше формулы бесполезны, пока вы не сможете провести вычисления самостоятельно. Ниже три разобранных примера, которые можно перенести непосредственно в таблицу.
1. Пропорциональное оценивание для задания с несколькими вариантами ответа из четырёх опций.
Предположим, в задании четыре правильных варианта из шести возможных, стоимость — 4 балла. Учащийся выбирает 3 из 4 правильных вариантов и 0 дистракторов.
Балл = (количество правильно выбранных / общее число правильных) × баллы за задание Балл = (3 / 4) × 4 = 3,0 балла
2. Выбор подмножества со штрафом за дистрактор.
То же задание: 4 правильных варианта, 2 дистрактора, итого 4 балла. На этот раз учащийся выбирает 3 правильных варианта и 1 дистрактор.
Балл = [(правильно выбрано / всего правильных) − (выбрано дистракторов / всего дистракторов)] × баллы за задание, но не менее нуля Балл = [(3/4) − (1/2)] × 4 = [0,75 − 0,5] × 4 = 1,0 балл
Сравните с чисто пропорциональным методом: он бы полностью проигнорировал дистрактор и присудил 3,0 балла за идентичный ответ. Этот разрыв и есть весь аргумент в пользу штрафных методов для заданий, в которых дистракторы действительно привлекательны.

3. Перевод рубрики в дробный балл для вопроса на 20 баллов.
Многошаговая математическая задача оценивается по рубрике от 0 до 4: 0 (нет обоснованного подхода), 1 (только правильная постановка), 2 (правильный метод, грубая ошибка), 3 (правильный метод, незначительная ошибка), 4 (полностью правильно). Вопрос стоит 20 баллов.
Дробный балл = (баллы по рубрике / максимальные баллы по рубрике) × баллы за задание Учащийся, получивший 3 по рубрике, получает: (3/4) × 20 = 15 баллов
Проведите это преобразование по всему списку класса — и вы получите распределение, совершенно непохожее на простую гистограмму процента правильных ответов: баллы группируются вокруг уровней рубрики (0, 5, 10, 15, 20), а не распределяются непрерывно. Это стоит знать до того, как вы будете строить кривую оценок на её основе.
Совет профессионала: Запишите эти три формулы как именованные функции в общий шаблон таблицы до открытия экзаменационного окна. Именно адаптация формулы оценивания после того, как учащиеся уже сдали ответы, — главная причина большинства споров по оценкам.
Статистические модели и IRT: модель частичного кредитования Раша
Формулы дробного оценивания отвечают на вопрос «сколько баллов заработал этот ответ». Теория ответа на задание (IRT) отвечает на иной вопрос: «какой уровень способностей в действительности демонстрирует этот ответ, с учётом того, насколько сложно достичь каждой категории ответа». Это различие приобретает значение, как только вы переходите от оценивания в отдельном классе к любому контексту, где баллы нужно сравнивать между формами, группами или годами.
Модель частичного кредитования Раша, разработанная Джеффом Мастерсом, расширяет стандартную дихотомическую модель Раша на задания с упорядоченными категориями ответа. Вместо того чтобы рассматривать «шаг 2 из 4» как просто половину от «шага 4 из 4», модель частичного кредитования Раша оценивает отдельный параметр порога для перехода между каждой парой соседних категорий. Переход от балла 1 к 2 по рубрике может потребовать значительно более высокого продемонстрированного уровня способностей, чем переход от 2 к 3, и модель фиксирует это, а не предполагает равные шаги.

Практическая выгода — разделимость параметров: оценочный уровень способностей испытуемого и пороговые значения категорий задания могут оцениваться независимо друг от друга, что и делает межформные сравнения статистически обоснованными.
Когда дополнительная сложность себя оправдывает?
- Крупномасштабные программы тестирования, где тысячи ответов требуют последовательной интерпретации в рамках нескольких форм экзамена.
- Связывание и выравнивание, когда разные группы учащихся выполняют разные версии теста и баллы должны означать одно и то же в каждой из них.
- Точная калибровка заданий, когда нужно знать точно, сколько способностей разделяет «2» и «3» по рубрике, а не предполагать равные интервалы.
- Проверка дифференциального функционирования заданий, когда нужно убедиться, что шаги частичного кредитования задания ведут себя последовательно в разных демографических группах, прежде чем доверять агрегированному баллу.
Одиночный классный тест почти никогда не требует калибровки по Рашу. Квалификационный экзамен, проводимый на национальном уровне, повторно используемый в разных экзаменационных сессиях и лежащий в основе решений о зачёте/незачёте с реальными последствиями, — почти всегда требует. Граница между «используй формулу в таблице» и «используй программное обеспечение IRT» — это на самом деле граница ставок и масштаба, а не формата задания.
Лучшие практики внедрения: разработка, настройка и отчётность
Правильное применение частичного кредитования начинается задолго до того, как учащийся увидит задание, и не заканчивается с выставлением баллов. Трёх этапов заслуживают осознанного внимания: разработка, настройка платформы и отчётность.
Контрольный список разработки. Прежде чем написать хотя бы одно задание, определитесь с правилом оценивания — не после того, как пилотирование выявит несоответствия.
- Пишите рубрику или правило распределения баллов одновременно с заданием, а не после.
- Используйте согласованную шкалу баллов для однотипных заданий, чтобы учащиеся могли предсказать распределение частичного кредитования.
- Опробуйте новые рубрики на небольшой выборке реальных или тренировочных ответов перед внедрением в масштабе и скорректируйте описания якорей там, где два экзаменатора расходятся.
- Определите от 3 до 5 якорных ответов для каждого диапазона баллов рубрики развёрнутых ответов — эта практика поддерживается исследованиями по оцениванию с частичным кредитованием на основе рубрик, которые рекомендуют обучать экзаменаторов на примерах эталонных ответов для достижения приемлемого межэкспертного согласия.
Настройка LMS и платформы. Большинство систем управления обучением скрывают настройки частичного кредитования в параметрах на уровне отдельного задания, а не на уровне экзамена в целом, поэтому проверяйте каждый тип вопроса отдельно, а не рассчитывайте на то, что глобальный переключатель охватит всё. Проверьте, отображает ли обратная связь для учащихся дробный балл, уровень рубрики или оба показателя: показ только округлённого итога может скрыть, где именно были потеряны баллы. По возможности экспортируйте сырые, неокруглённые данные оценивания. Раннее округление с последующим пересчётом — один из самых быстрых способов внести незаметные ошибки в оценки по всему большому списку учащихся.
Отчётность. Указывайте как сырой дробный балл, так и округлённый итог, и прямо говорите об этом в любом отчёте о баллах, который получает учащийся. Учащийся, видящий «15/20» без контекста, не имеет возможности понять, потерял ли он 5 баллов из-за одной большой ошибки или нескольких маленьких. Однострочное объяснение способа расчёта частичного кредитования, приложенное к отчёту о баллах, разрешает большинство споров ещё до их возникновения. Команды, разрабатывающие рубрики оценивания для структурированных оценок, могут найти дополнительные руководство по разработке рубрик и шаблоны, которые хорошо сочетаются с подходами дробного оценивания.
Надёжность, валидность и подавление угадывания
Надёжность — это вопрос, от которого зависит, оправдало ли частичное кредитование добавленную сложность. Если изменение в оценивании не улучшает измеримо согласованность вашей оценки, дополнительные расходы на подготовку экзаменаторов и вычисления трудно оправдать.
Эмпирические данные здесь склоняются в пользу этого подхода. Сравнительные исследования методов оценивания заданий с несколькими вариантами ответа показали, что подходы с частичным кредитованием улучшали надёжность и дискриминативность по сравнению с простым дихотомическим оцениванием, особенно для заданий с более чем двумя вариантами ответа, где разделение «правильно/неправильно» отбрасывает значимые различия. Отдельно теоретические работы по функциям оценивания, разработанным с расчётом на отрицательную ожидаемую ценность угадывания, показали, что такие функции улучшают как надёжность, так и дискриминативность по сравнению с простым оцениванием «правильно/неправильно», особенно после введения штрафа за угадывание.
Три практические проверки покажут, окупается ли переход в ваших собственных данных:
Корреляция задания с общим баллом. Пересчитайте её после перехода на частичное кредитование. Задание, корреляция которого с общим баллом улучшилась, теперь лучше разделяет сильных и слабых исполнителей по новому правилу оценивания.
Альфа Кронбаха до и после. Прогоните один и тот же набор тестовых данных по обоим правилам оценивания и напрямую сравните значения альфа. Значимый рост — убедительный сигнал того, что частичное кредитование уловило информацию, которую бинарная версия отбросила.
Статистики подгонки IRT — там, где уже используется модель Раша или другая IRT-модель. Разупорядоченные пороговые значения категорий, то есть когда более высокий балл по рубрике не соответствует более высокому расчётному уровню способностей, указывают на рубрику, требующую пересмотра, независимо от того, что говорят сырые показатели надёжности.
Ничто из этого не даётся бесплатно. Сложность оценивания возрастает с каждым добавленным вариантом формулы, изменчивость экзаменаторов становится реальной проблемой, как только вводится какой-либо компонент на основе рубрики, а административные расходы растут, когда нужно программное обеспечение или инфраструктура таблиц помимо простого ключа ответов. Сопоставьте эти затраты с реальными ставками. Еженедельный тест редко оправдывает накладные расходы; квалификационный экзамен — почти всегда.
Шаблоны оценивания для заданий с несколькими вариантами ответа
Задания с несколькими вариантами ответа, в которых учащийся выбирает несколько опций из длинного списка, — это именно то место, где угадывание наносит наибольший ущерб валидности теста. Учащийся, который выбирает все варианты в задании «выберите все подходящие» с четырьмя правильными ответами из шести, при наивном пропорциональном оценивании всегда получит частичный балл — независимо от того, знает ли он что-нибудь или нет.
Решение — шаблон оценивания, построенный на ожидаемой ценности. Распространённая структура: начислять p1 баллов, когда учащийся выбирает ровно ключ (полный правильный набор) или, в некоторых формулировках, когда каждый дистрактор правильно исключён; в противном случае применять формулу pc − m, где pc — доля правильно выбранных вариантов, а m — штраф, масштабированный по числу выборов за пределами ключа. Цель, как излагают формальные исследования функций оценивания, состоит в том, чтобы сама математика препятствовала небрежному чрезмерному выбору вариантов.
- Устанавливайте штраф (m) так, чтобы ожидаемая ценность выбора всех вариантов или случайного выбора оказывалась отрицательной или в крайнем случае равной нулю.
- Перед внедрением задания проверьте штраф на ответе «выбрать всё». Если такой ответ набирает выше нуля, штраф слишком мал.
- Проверьте его также на действительно честном ответе, отражающем частичное знание. Если учащийся правильно определил 3 из 4 правильных вариантов и исключил оба дистрактора, но набрал меньше, чем тот, кто угадывал широко, — штраф слишком велик.
Формулировка задания так же важна, как и стоящая за ним формула. Инструкция «выберите все правильные ответы» без каких-либо указаний на штрафы подталкивает учащихся к угадыванию, поскольку в самой формулировке нет никакого сигнала о негативных последствиях. Добавьте короткую фразу о том, что неправильный выбор снижает балл, — и вы получите более честное отражение частичных знаний, потому что у учащихся больше нет стимула выбирать варианты, в которых они не уверены, только для подстраховки.
Контрольный список управления для практиков перед масштабированием
Перед тем как распространить частичное кредитование за пределы пилотной группы, выполните четыре проверки:
- Чёткость рубрики. Убедитесь, что каждый уровень рубрики имеет чёткое, наблюдаемое якорное описание, а не просто расплывчатый ярлык вроде «в основном правильно».
- Межэкспертная надёжность. Попросите двух экзаменаторов независимо оценить одни и те же 20–30 образцов ответов и проверьте согласованность перед тем, как доверять оценкам одного экзаменатора в масштабе.
- Пилотное сравнение. Оцените один и тот же набор ответов по старому правилу оценивания и по новому правилу частичного кредитования и сравните надёжность и распределение оценок.
- Анализ чувствительности. Немного скорректируйте веса штрафов или распределение баллов и повторите анализ. Руководство по моделям оценивания рекомендует этот шаг, потому что небольшие изменения весов могут изменить результаты надёжности или полностью переупорядочить рейтинги кандидатов.
Документируйте каждое решение по оцениванию, включая обоснование выбора конкретной формулы или размера штрафа, в формате, доступном для последующей проверки заинтересованными сторонами. Именно эта документация превращает обоснованный пилот в обоснованную политику.
Когда частичное кредитование оправдывает свою сложность
Частичное кредитование — это измерительное улучшение с реальной административной ценой, и притворяться иначе значит оказывать медвежью услугу тем, кто применяет его впервые. Прирост в надёжности и дискриминативности хорошо задокументирован, но так же хорошо задокументированы и дополнительные издержки: более интенсивная подготовка экзаменаторов, более сложные формулы, больше поводов для разногласий относительно того, что «частичное» означает применительно к конкретному заданию.
Моё честное прочтение исследований таково: большинство оценок на уровне отдельного класса не нуждаются в калибровке по Рашу, штрафах за выбор подмножества или каком-либо другом более сложном инструментарии, рассмотренном выше. Чёткая рубрика и пропорциональное дробное оценивание покрывают большинство реальных потребностей классного оценивания. Частичное кредитование оправдывает свою сложность в масштабе: квалификационные экзамены, многоформные программы тестирования и любая оценка, где ошибочное допущение об оценивании умножается на тысячи испытуемых, а не на тридцать.
Операционная нагрузка — это именно то место, где хорошие платформенные инструменты меняют расчёт, особенно если вы хотите автоматизировать глобальный найм и снизить риски соответствия требованиям. Инструмент, автоматизирующий применение рубрики, отслеживающий согласованность экзаменаторов и фиксирующий решения об оценивании, устраняет большую часть трений, которые не дают педагогам даже попробовать внедрить частичное кредитование. Сначала проведите пилот, оцените прирост надёжности относительно добавленных затрат и масштабируйте подход лишь тогда, когда цифры действительно это оправдывают.
— Jimmie
Создавайте оценки с частичным кредитованием, не выстраивая инфраструктуру самостоятельно
Большая часть трудностей при оценивании с частичным кредитованием — не в математике. Она в инфраструктуре: написание последовательных рубрик, согласование экзаменаторов и уверенность в том, что тест не был скомпрометирован. Talent Approved построен на модели оплаты по факту без подписки, поэтому вы платите только за завершённую оценку кандидата и избавляетесь от накладных расходов на лицензирование программного обеспечения для оценивания, которое может потребоваться лишь от случая к случаю.

Функция Magic Create на платформе создаёт ориентированную на конкретную роль, готовую к работе с рубрикой оценку прямо из описания вакансии или списка навыков, полностью исключая этап ручного написания заданий. Встроенные инструменты защиты от мошенничества, включая мониторинг экрана и веб-камеры с записью сессий, защищают целостность результатов частичного кредитования так же, как обучение экзаменаторов защищает рубрику развёрнутых ответов. Сгенерированные ИИ сводки результатов превращают дробные баллы в читаемые рейтинги кандидатов, не заставляя вашу команду вручную интерпретировать сырую математику рубрик.
Если вы оцениваете навыки, а не выставляете учебные оценки, и хотите оценивание в стиле частичного кредитования без владения инфраструктурой оценивания, проверьте страницу с ценами на оценки навыков и посмотрите, во сколько обойдётся пилотная оценка для вашего следующего раунда найма.
Источники
- Оценка различных методов оценивания для заданий с несколькими вариантами ответа, предусматривающих частичное кредитование
- Теоретическая оценка оценивания с частичным кредитованием для заданий с выбором ответа
- Методы оценивания с частичным кредитованием для тестов с множественным выбором. — ERIC
FAQ
Как рассчитать частичное кредитование?
Разделите заработанные баллы (правильно выбранные варианты, уровень рубрики или совпадение подмножества) на максимально возможные баллы за это задание, а затем умножьте на общую стоимость задания в баллах. Методы выбора подмножества и линейного штрафа вычитают взвешенный штраф за неправильно выбранные варианты перед этим финальным умножением.
Каковы три основных типа подходов к оцениванию?
В разработке оценочных инструментов три широких подхода: дихотомическое оценивание (правильно/неправильно), оценивание с частичным кредитованием (пропорциональные, основанные на выборе подмножества или штрафных формулах) и дробное оценивание на основе рубрики для развёрнутых ответов. Каждый подходит для разных форматов заданий, и ни один не является превосходящим во всех контекстах.
Что чаще всего подрывает систему оценивания с частичным кредитованием?
Нечёткие якоря рубрики и непоследовательная подготовка экзаменаторов — наиболее распространённые точки отказа, поскольку они вносят разногласия между оценщиками, которые никакая формула не может исправить постфактум. Вторая по частоте проблема — слишком маленький штрафной коэффициент, из-за которого случайное угадывание остаётся статистически выгодным, а не подавляется.
Действительно ли частичное кредитование улучшает надёжность теста?
Эмпирические сравнения заданий с несколькими вариантами ответа показали, что оценивание с частичным кредитованием улучшало как надёжность, так и дискриминативность по сравнению с дихотомическим оцениванием, особенно когда функция оценивания штрафует за неправильно выбранные варианты. Улучшение не происходит автоматически. Оно зависит от чёткости рубрики и размера штрафа.
Может ли платформа обрабатывать оценивание с частичным кредитованием для оценок навыков?
Да. Talent Approved поддерживает оценивание на основе рубрик наряду с конструктором оценок Magic Create и мониторингом защиты от мошенничества, позволяя командам по найму применять логику дробного оценивания без самостоятельного построения инфраструктуры расчётов. Актуальные цены указаны на странице оценок навыков.