Калибровка жюри хакатона: два учебных проекта до первого питча
Как согласовать признаки баллов, проверить два учебных проекта и записать факты, самоотводы и недостающие данные. Три CSV-шаблона для жюри.
·6 мин чтения
Что вы узнаете
Оцените два учебных проекта независимо, затем обсуждайте расхождения по фактам и опубликованным признакам баллов.
Разделяйте наблюдаемый факт, его интерпретацию и балл; калибровка не меняет критерии, веса или правила разрешения ничьей.
Оставляйте балл пустым при недостающих данных или самоотводе и фиксируйте статус по заранее установленному порядку.
Судья ставит три балла за работающий прототип. Его коллега ставит один: демонстрацию он видел, но повторить сценарий не смог. Если обсудить это только после финала, команды получат оценки по разным шкалам. До первого питча проведите пробный просмотр двух учебных проектов и выясните, какие наблюдения каждый судья считает достаточными.
Ниже рабочий сценарий такой встречи. Все проекты, записи и баллы в примерах вымышлены для обучения. Они не описывают клиентов, участников или результаты событий Stavleak.
Зафиксируйте правила и доступные материалы
Положите перед жюри опубликованный регламент, критерии, условия допуска и комплект сдачи. Укажите версии документов и момент закрытия оценки. Судья должен понимать, можно ли запускать код, пользоваться резервной записью демо и задавать уточняющие вопросы. Проверьте доступ к этим материалам заранее.
Веса, способ объединения оценок и tie-break организатор определяет до конкурсной работы. Калибровка перед питчами уточняет применение опубликованных правил. Она не разрешает добавить новый критерий, изменить вес или задним числом потребовать исследование пользователей. Если существенной процедуры в правилах нет, передайте вопрос ответственному организатору и зафиксируйте решение через предусмотренный порядок.
Отдельно назначьте человека, который проверяет комплектность и допуск. Отсутствующая обязательная ссылка требует решения по регламенту, а не произвольного штрафа за качество реализации. Согласуйте этот процесс с гайдом по критериям и правилами хакатона.
Опишите наблюдаемые признаки шкалы 0-4
Для упражнения используем три критерия: соответствие задаче C1, воспроизводимость основного сценария C2, проверка и ограничения C3. Это примерная шкала. Подходящую вашему треку матрицу организатор готовит и публикует заранее.
0: В разрешённых условиях проверки основной сценарий явно не работает, доступный резервный способ также не даёт заявленного результата.
1: Работает отдельная часть; переход к результату выполняется вручную и это показано.
2: Основной путь проходит на предоставленных данных, шаги запуска и ограничения записаны.
3: Другой человек повторяет путь с чистого запуска; один названный ошибочный ввод обработан.
4: Независимый повтор и несколько отрицательных сценариев описаны с ожидаемыми и фактическими результатами.
Ноль здесь означает установленный результат проверки. Если ссылка не открылась и разрешённый альтернативный материал ещё не просмотрен, балл пока не определён. Уровень четыре также не означает готовность к промышленной эксплуатации.
В RUBRIC.csv есть признаки всех пяти уровней для каждого критерия. У C1 проверяем связь с задачей, у C2 выполнение, у C3 основание выводов. Один удачный тест не должен автоматически принести максимум во всех трёх колонках.
Дайте жюри два явно учебных проекта
Учебная задача: распределить ограниченные слоты менторов между командами, не назначая одному ментору две встречи одновременно. Все входные заявки синтетические. Реальных пользователей и клиентских данных в упражнении нет.
Проект A, «Слоты», принимает шесть заявок. Судья по инструкции запускает его заново и получает расписание без пересечений. Повторное бронирование одного слота отклоняется с сообщением. Команда приложила журнал этого прогона и описала ограничения, но не сравнивала решение с альтернативой. Для учебной матрицы опорные оценки: C1 = 2, C2 = 3, C3 = 2.
Проект B, «Панель», показывает форму заявки и красивое расписание. Форму можно заполнить; дальше оператор вручную переставляет встречи. В сохранённом учебном расписании один ментор назначен дважды на одно время. Заявлена проверка удобства, но записи наблюдений отсутствуют. Опорные оценки: C1 = 0 из-за показанного нарушения основной задачи, C2 = 1 за работающую часть сценария. C3 оставляем без балла до уточнения по правилам.
Эти оценки относятся только к описанным материалам и признакам учебной рубрики. Для другого трека или разрешённого способа проверки результат может отличаться. Не используйте узнаваемый проект действующего участника как тайный эталон.
Разделите факт, интерпретацию и балл
В score sheet судья заполняет три отдельные записи. Факт: что произошло и где это проверить. Интерпретация: какой признак критерия подтверждён. Балл: значение, соответствующее этому признаку. Добавьте ссылку или идентификатор материала, а для записи демо укажите нужный момент.
Для A можно записать: «Повторный запрос на занятый слот отклонён в учебном прогоне A-NEG-1». Интерпретация: основной путь воспроизведён и один ошибочный ввод обработан. Балл по C2: 3. Такая запись позволяет другому судье проверить основание.
Для B фраза «понятный интерфейс» не заменяет протокол проверки удобства. Запишите, что журнал не предоставлен, поставьте статус needs_clarification и сформулируйте вопрос. Поле балла остаётся пустым. Судья не достраивает исследование по уверенной речи команды и не переносит впечатление от дизайна в технический критерий.
Сначала соберите индивидуальные оценки
Ведущий выдаёт одинаковые материалы и просит каждого судью заполнить форму самостоятельно. Первые значения сохраняются до обсуждения. Участники не видят оценку председателя и не обязаны выбирать самое популярное число.
Затем сравните строки по критериям. Если у A по C2 появились 2 и 3, спросите, что именно удалось повторить и какой признак уровня три проверен. Один судья мог пропустить отрицательный тест, другой принять запись команды за независимый запуск. Исправьте доступ или поясните уже опубликованный способ проверки; сохраните первоначальные оценки и основание уточнения.
Разберите B тем же способом. Согласие, что данных для C3 недостаточно, является полезным результатом встречи. Оно не требует общего числового балла. В calibration record запишите обнаруженную неоднозначность, ссылку на правило, ответственное лицо и следующий шаг.
Продолжайте только когда судьи могут объяснить границы уровней и одинаково выполнить процедуру. При нехватке времени уменьшите объём пробного материала, сохранив самостоятельный просмотр и разбор одного спорного случая.
Обработайте пропуски и конфликт интересов
Опишите статусы до первого проекта. scored означает, что балл есть и обоснован. needs_clarification фиксирует недостающую информацию. recused означает самоотвод. not_applicable допустим только если правила действительно предусматривают неприменимость критерия. Обычная пустая ячейка означает pending, а не ноль.
Если судья консультировал команду, работает с её участником или имеет личную заинтересованность, он сообщает связь организатору через согласованный канал. Самоотвод обрабатывают по опубликованной процедуре: назначают замену или применяют предусмотренный порядок независимых оценок. Не включайте пустую оценку такого судьи в среднее как нулевую.
Для недостающих данных назначьте владельца запроса и срок. Уточнение не должно превращаться в разрешение доработать проект после дедлайна. Сохраняйте сданную версию и объяснение решения. В общий протокол включайте необходимое описание связи; личные подробности не нужны для участника, который получает обратную связь.
Проверьте итог и используйте три шаблона
Перед объявлением проверьте, что предусмотренные оценки получены, самоотводы обработаны, формула использует опубликованные веса и выполнен установленный tie-break. При неразрешённом пропуске результат не считайте завершённым. Исправление ошибки ввода сохраните отдельной записью с причиной и ответственным.
Скачайте RUBRIC.csv, score-sheet.csv и calibration-record.csv. В файлах есть помеченные учебные строки A/B; перед реальной оценкой скопируйте структуру и уберите эти примеры. Веса и ссылка на опубликованные правила оставлены для организатора. CSV не рассчитывают итог автоматически.
Сверьте свою матрицу с тулкитом критериев. В тулките есть отдельный 100-балльный шаблон; для события заранее опубликуйте одну согласованную систему оценки. Сохраните утверждённые версии рубрики, индивидуальных оценок и протокола калибровки вместе с финальным решением по правилам события.