SABSUS

ВОСПРОИЗВОДИМОСТЬ КРИТЕРИЯ КАЧЕСТВА

Два проверяющих качества: совпадение оценок и коэффициент κ

Два руководителя прослушали одинаковые звонки и совпали в 90% оценок. Можно ли считать критерий понятным и достоверным? Совпадение показывает воспроизводимость суждений, но не доказывает их правильность. Перед регулярным использованием оценок проверьте состав выборки, виды расхождений и смысл выбранного показателя.

Редакция SABSUS · · Источники проверены 9 октября

Решение: готов ли один критерий к общему применению

Выберите конкретный вопрос, например «подтвердил ли сотрудник согласованную дату визита». Для начала нужен один критерий с двумя понятными исходами, а не общий балл разговора из несопоставимых пунктов. Определите, какое наблюдение подтверждает «да», какое — «нет» и когда данных недостаточно.

Задача проверки — выяснить, способны ли разные люди применить одинаковое правило к одинаковым материалам. Она не предназначена для автоматического ранжирования сотрудников, назначения наказаний или доказательства качества всего обслуживания. Содержание разговора и его фактический результат остаются отдельными предметами проверки.

Общий порядок работы с аудио, цитатами и спорными замечаниями уже описан в руководстве по качеству звонков. Здесь рассматривается количественная согласованность двух проверяющих до использования общей оценки.

Сначала получите независимые парные оценки

Оба человека получают одинаковую версию критерия и один набор разрешённых материалов. Каждый выставляет исход без просмотра ответа другого. Обсуждение проводится после сохранения первоначальных решений. Иначе измеряется результат переговоров, а не независимое применение правила.

У каждой пары нужны идентификатор случая, версия материала, критерий, ответы двух проверяющих и основания. Не заменяйте первоначальные ответы согласованным решением в той же колонке. Результат последующего разбора хранится отдельно и помогает уточнить критерий.

Отсутствие аудио, неприменимость вопроса и пропущенная проверка — разные состояния. Не превращайте их автоматически в «нет» или несовпадение. Для выбранной метрики укажите, какие пары вошли в расчёт, а какие исключены с причиной. Показывайте также количество неполных пар: высокая согласованность оставшихся не объясняет пропуски.

Простая доля совпадений отвечает на первый вопрос

Для бинарного критерия возможны четыре сочетания: оба ответили «да»; первый «да», второй «нет»; первый «нет», второй «да»; оба «нет». Их количества должны давать число полных пар. Совпадениями являются первое и последнее сочетания.

Доля совпадений равна числу одинаковых ответов, делённому на число полных пар. Она проста для объяснения, но зависит от распространённости категорий. Если почти все случаи получают один исход, большой процент совпадений может возникнуть без столь же убедительного согласования редкой категории.

Для дополнительной оценки используют коэффициент каппа Коэна, κ. Документация scikit-learn определяет его как показатель согласованности двух разметчиков: κ = (pₒ − pₑ) / (1 − pₑ), где pₒ — наблюдаемое совпадение, а pₑ рассчитывается из частот категорий у каждого проверяющего. scikit-learn: cohen_kappa_score.

Учебный набор A: одинаковые частоты ответов

Все числа вымышлены. Сто случаев имеют полные независимые бинарные оценки, неизвестных исходов нет. Оба проверяющих ответили «да» в 45 случаях, только первый — в пяти, только второй — в пяти. Ещё в 45 случаях оба ответили «нет».

Баланс: 45 + 5 + 5 + 45 = 100. Совпадений 45 + 45 = 90, поэтому pₒ = 0,90. Первый использовал «да» 50 раз и «нет» 50 раз; у второго такие же частоты.

Ожидаемая доля совпадений при независимом случайном назначении меток с этими частотами составляет pₑ = 0,50 × 0,50 + 0,50 × 0,50 = 0,50. Тогда κ = (0,90 − 0,50) / (1 − 0,50) = 0,80.

Это расчёт конкретного набора. Значение 0,80 не получает здесь универсальной оценки «достаточно хорошо». Решение о применимости критерия учитывает последствия ошибки, объём проверки, виды расхождений и требования процесса.

Учебный набор B: то же совпадение, другое распределение

Возьмём другой независимый набор из ста случаев. Оба ответили «да» в 85, только первый — в пяти, только второй — в пяти, оба «нет» — в пяти. Сумма снова 100, совпадений снова 90.

Теперь каждый использовал «да» в 90 случаях и «нет» в десяти. Поэтому pₑ = 0,90 × 0,90 + 0,10 × 0,10 = 0,82. Коэффициент κ = (0,90 − 0,82) / (1 − 0,82) = 0,08 / 0,18 ≈ 0,444.

Одинаковые 90% совпадений дали 0,80 и примерно 0,444 из-за разных частот категорий. Это не доказывает ухудшение проверяющих между периодами: наборы имеют разный состав. Сравнивать индексы без распределения исходов и условий отбора нельзя.

Откройте десять несовпадений каждого набора. Важны конкретные причины: неясное условие, различное понимание нужного подтверждения, недостаточная запись или ошибка чтения. Один коэффициент не объясняет, какое изменение инструкции поможет.

Согласованность не равна точности

Оба проверяющих могут одинаково ошибаться. Например, они принимают произнесённое обещание за подтверждённую запись в системе. Согласованность будет высокой, хотя применённый критерий не проверяет нужный результат.

Для оценки правильности нужен отдельно обоснованный эталон: проверка источника, установленное правило и разбор компетентным ответственным. Его происхождение и неопределённость также сохраняются. Голосование двух людей не создаёт истину автоматически.

В руководстве scikit-learn κ рассматривается как сравнение разметок, а не замена оценки предсказаний относительно эталона. scikit-learn: model evaluation. Поэтому не переименовывайте результат κ в «точность 80%»: это иная величина с иной формулой.

Пограничные случаи и ограничения

Если оба человека дали один и тот же единственный ответ всем случаям, pₒ = 1 и pₑ = 1. Формула превращается в 0 / 0 и не определяет обычное значение κ. Покажите это ограничение вместе со стопроцентным наблюдаемым совпадением; не подставляйте единицу по умолчанию.

Маленькая выборка делает результат чувствительным к нескольким решениям. Набор только из простых разговоров не проверяет применение критерия в шуме или при изменении цели звонка. При намеренном отборе сложных случаев результат описывает этот набор, а не автоматически весь рабочий поток.

Для порядковых оценок, нескольких категорий или более двух проверяющих нужна подходящая методика. Нельзя без объяснения перенести бинарную формулу на средний балл команды. Взвешенные варианты κ существуют, но выбор весов меняет смысл результата и требует отдельного согласования.

Как превратить расхождения в улучшение критерия

Сгруппируйте несовпадения по причинам и откройте исходные фрагменты. Если формулировка допускает два разумных прочтения, уточните условие и примеры. Если проблема в отсутствии источника, измените сбор подтверждений, а не заставляйте проверяющих угадывать одинаково.

После правки подготовьте новый независимый набор. Повторное обсуждение уже разобранных случаев полезно для обучения, но не является независимой проверкой новой версии. Сохраняйте связь версий критерия и сравнивайте сопоставимые типы разговоров.

Не повышайте коэффициент удалением неудобных пар без причины. Не заставляйте одного проверяющего копировать ответы другого. Цель — воспроизводимое применение осмысленного правила, а не максимальный показатель любой ценой.

Данные и приёмочный чек-лист

В отчёте нужны период, область отбора, число предложенных и полных пар, исключения, версия критерия и четыре количества сочетаний. Покажите pₒ, частоты каждого проверяющего, pₑ и κ рядом с разбором расхождений.

  1. Оценки получены независимо до обсуждения.
  2. Четыре количества дают ровно сто полных пар в каждом примере.
  3. Оба набора показывают 90% совпадений.
  4. Набор A даёт pₑ 0,50 и κ 0,80.
  5. Набор B даёт pₑ 0,82 и κ около 0,444.
  6. Неизвестный исход и неприменимый критерий не превращаются в «нет» автоматически.
  7. Единственная общая категория показывает неопределённость формулы.
  8. Согласованный после обсуждения ответ не стирает первоначальные оценки.
  9. Новая версия проходит независимую проверку на новом наборе.
  10. κ не называется accuracy и не запускает автоматические кадровые решения.

Для SABSUS обсудите данные через записи звонков, обучение и отчёты. Парную разметку, хранение оснований и расчёт показателей нужно подтвердить в конфигурации.

Частые вопросы

90% совпадений достаточно для запуска?

Универсального порога нет. Проверьте частоты категорий, тяжесть ошибок, неопределённость и смысл критерия.

κ показывает, кто из двух прав?

Нет. Он измеряет согласованность разметок. Правильность конкретного ответа требует отдельной проверки источника и основания.

Можно сначала обсудить спорные случаи, а потом считать κ?

Такой результат опишет согласованные ответы. Для независимой воспроизводимости сохраняйте исходные оценки до обсуждения.

Источники

Проверено 9 октября 2026 года. Два набора и расчёты учебные.