Введение
Матрица неточностей, также известная как матрица ошибок, представляет собой специфическую таблицу, используемую для визуализации производительности алгоритма, как правило, алгоритма с обучением с учителем; в обучении без учителя она обычно называется матрицей соответствий. Каждая строка матрицы представляет экземпляры фактического класса, а каждый столбец – экземпляры предсказанного класса, или наоборот – оба варианта встречаются в литературе. Название обусловлено тем, что она позволяет легко определить, путает ли система два класса (то есть часто ли неправильно классифицирует один класс как другой). Это особый вид таблицы сопряженности, имеющая два измерения ("фактическое" и "предсказанное") и идентичные наборы "классов" по обоим измерениям (каждая комбинация измерения и класса является переменной в таблице сопряженности). СОД.
In the field of machine learning and specifically the problem of statistical classification, a confusion matrix, also known as error matrix, is a specific table layout that allows visualization of the performance of an algorithm, typically a supervised learning one; in unsupervised learning it is usually called a matching matrix. Each row of the matrix represents the instances in an actual class while each column represents the instances in a predicted class, or vice versa – both variants are found in the literature. The name stems from the fact that it makes it easy to see whether the system is confusing two classes (i. e. commonly mislabeling one as another). It is a special kind of contingency table, with two dimensions ("actual" and "predicted"), and identical sets of "classes" in both dimensions (each combination of dimension and class is a variable in the contingency table). TOC
Таблица смешения
В прогностической аналитике таблица ошибок (иногда также называемая матрицей ошибок) представляет собой таблицу с двумя строками и двумя столбцами, которая показывает количество истинно положительных, ложно отрицательных, ложно положительных и истинно отрицательных результатов. Это позволяет провести более детальный анализ, чем простое наблюдение за долей правильных классификаций (точность). Точность может давать вводящие в заблуждение результаты, если набор данных несбалансирован, то есть когда количество наблюдений в разных классах значительно различается. Например, если в данных содержится 95 образцов с раком и только 5 без рака, определенный классификатор может классифицировать все наблюдения как положительные на рак. Общая точность в этом случае составит 95%, но при более детальном рассмотрении окажется, что классификатор имеет 100% чувствительность (долю правильно распознанных больных) для класса рака, но 0% чувствительность для класса без рака. F1-мера в таких случаях еще более ненадежна и может показать результат более 97,4%, в то время как показатель информированности устраняет эту предвзятость и дает 0 как вероятность принятия обоснованного решения при любой форме угадывания (в данном случае – всегда угадывания рака). Согласно Давиде Чикко и Джузеппе Юрману, наиболее информативной метрикой для оценки матрицы ошибок является коэффициент корреляции Мэтьюса (MCC). В матрицу ошибок могут быть включены и другие метрики, каждая из которых имеет свою значимость и область применения.