Введение

Данные, чей элемент может принимать только два возможных состояния. Бинарные данные – это данные, чей элемент может принимать только два возможных состояния. Эти состояния часто обозначаются как 0 и 1 в соответствии с двоичной системой счисления и булевой алгеброй. Бинарные данные встречаются в различных технических и научных областях, где они могут называться по-разному, включая бит (бинарная цифра) в информатике, логическое значение в математической логике и смежных областях, а также бинарная переменная в статистике.

Математические и комбинаторные основы

Дискретная переменная, которая может принимать только одно состояние, не содержит никакой информации и является следующим натуральным числом после 1. Именно поэтому бит, переменная с двумя возможными значениями, является стандартной основной единицей информации. Набор из n битов может иметь 2 в степени n состояний: подробности см. в статье о двоичной системе счисления. Количество состояний набора дискретных переменных зависит экспоненциально от количества переменных и лишь степенно от количества состояний каждой переменной. Десять битов имеют больше состояний, чем три десятичные цифры, а 10k битов более чем достаточно для представления информации (числа или чего-либо другого), которая требует 3k десятичных цифр. Таким образом, информация, содержащаяся в дискретных переменных с 3, 4, 5, 6, 7, 8, 9, 10 состояниями, всегда может быть представлена, выделив в два, три или четыре раза больше битов. Следовательно, использование любого другого малого числа, кроме 2, не дает преимуществ. Более того, булева алгебра предоставляет удобную математическую структуру для набора битов, с семантикой набора пропозициональных переменных. Операции булевой алгебры известны как "побитовые операции" в информатике. Булевы функции также хорошо изучены теоретически и легко реализуются либо с помощью компьютерных программ, либо с помощью так называемых логических элементов в цифровой электронике. Это способствует использованию битов для представления различных данных, даже тех, которые изначально не являются двоичными.

Бинарные переменные

Бинарная переменная — это случайная переменная бинарного типа, то есть принимающая два возможных значения. Независимые и одинаково распределённые (i.i.d.) бинарные переменные подчиняются распределению Бернулли, но в общем случае бинарные данные не обязательно происходят из i.i.d. переменных. Суммарное количество i.i.d. бинарных переменных (эквивалентно, суммы i.i.d. бинарных переменных, закодированных как 1 или 0) подчиняется биномиальному распределению, но если бинарные переменные не являются i.i.d., распределение не обязательно будет биномиальным.

Подсчет

Как и категориальные данные, бинарные данные можно преобразовать в вектор данных о количестве, записывая одну координату для каждого возможного значения и подсчитывая 1 для значения, которое встречается, и 0 для значения, которое не встречается. Например, если значениями являются A и B, то набор данных A, A, B можно представить в виде количества (1, 0), (1, 0), (0, 1). После преобразования в количество, бинарные данные можно сгруппировать и сложить полученные количества. Например, если набор A, A, B сгруппирован, то общее количество будет (2, 1): 2 A и 1 B (из 3 попыток). Поскольку существует только два возможных значения, это можно упростить до одного количества (скалярного значения), рассматривая одно значение как "успех", а другое как "неудача", кодируя значение успеха как 1, а неудачи как 0 (используя только координату для значения "успех", а не координату для значения "неудача"). Например, если значение A считается "успехом" (и, следовательно, B считается "неудачей"), набор данных A, A, B будет представлен как 1, 1, 0. При группировке значения складываются, а общее количество попыток обычно отслеживается неявно. Например, A, A, B будет сгруппировано как 1 + 1 + 0 = 2 успеха (из общего числа попыток). В обратном направлении, данные о количестве с двумя возможными значениями являются бинарными данными, где два класса – 0 (неудача) или 1 (успех). Количество независимых и одинаково распределенных (i.i.d.) бинарных переменных следует биномиальному распределению, где n – общее количество попыток (точек в сгруппированных данных).

Регрессия

Анализ регрессии для прогнозируемых результатов, представленных бинарными переменными, известен как бинарная регрессия; если бинарные данные преобразуются в данные о количестве случаев и моделируются как независимые и одинаково распределённые (i. i. d.) переменные (то есть имеют биномиальное распределение), то можно использовать биномиальную регрессию. Наиболее распространёнными методами регрессии для бинарных данных являются логистическая регрессия, пробитная регрессия или связанные с ними типы моделей бинарного выбора. Аналогично, количество независимых и одинаково распределённых категориальных переменных с более чем двумя категориями можно смоделировать с помощью мультиномиальной регрессии. Количество зависимых бинарных данных можно смоделировать более сложными распределениями, такими как бета-биномиальное распределение (составное распределение). В качестве альтернативы, взаимосвязь можно смоделировать без явного моделирования распределения выходной переменной, используя методы обобщённых линейных моделей, такие как квазиправдоподобие и квазибиномиальная модель; см.

В информатике

В современных компьютерах бинарные данные – это любые данные, представленные в двоичной форме, а не интерпретируемые на более высоком уровне или преобразованные в другую форму. На самом низком уровне биты хранятся в бистабильном устройстве, таком как триггер. Хотя большинство бинарных данных имеют символическое значение (за исключением "неважно"), не все бинарные данные являются числовыми. Некоторые бинарные данные соответствуют компьютерным инструкциям, например, данные в регистрах процессора, декодируемые блоком управления в цикле выборки-декодирования-исполнения. Компьютеры редко изменяют отдельные биты из соображений производительности. Вместо этого данные выравниваются в группы фиксированного числа битов, обычно 1 байт (8 битов). Таким образом, "бинарные данные" в компьютерах фактически представляют собой последовательности байтов. На более высоком уровне данные доступны группами по 1 слову (4 байта) для 32-битных систем и 2 слова для 64-битных систем. В прикладной информатике и в области информационных технологий термин "бинарные данные" часто специально противопоставляется "текстовым данным", относясь к любым данным, которые нельзя интерпретировать как текст. Различие между "текстом" и "бинарными данными" иногда может относиться к семантическому содержанию файла (например, текстовый документ и цифровое изображение). Однако часто оно относится конкретно к тому, могут ли отдельные байты файла интерпретироваться как текст (см. кодировку символов) или нет. Когда подразумевается именно это значение, иногда используются более конкретные термины "двоичный формат" и "текстовый формат". Семантически текстовые данные могут быть представлены в двоичном формате (например, при сжатии или в определенных форматах, которые смешивают различные виды кодов форматирования, как в формате .doc, используемом Microsoft Word). И наоборот, данные изображений иногда представляются в текстовом формате (например, формат изображения X PixMap, используемый в X Window System). 1 и 0 – это всего лишь два разных уровня напряжения. Можно научить компьютер интерпретировать 1 как более высокое напряжение, а 0 – как более низкое. Существует множество различных способов хранения двух уровней напряжения. Если вы видели дискету, то вы обнаружите магнитную ленту с покрытием из ферромагнитного материала – типа парамагнитного материала, имеющего домены, выровненные в определенном направлении, чтобы создавать остаточное магнитное поле даже после прекращения подачи тока через материал или магнитного поля. При записи данных на магнитную ленту магнитное поле направляется в одном направлении, чтобы задать сохраненную ориентацию домена как 1, а при направлении магнитного поля в другом направлении сохраненная ориентация домена устанавливается как 0. Таким образом, данные 1 и 0 обычно хранятся именно таким образом.