Введение

Пакет статистического программного обеспечения Stata (произносится /ˈsteɪtə/, STAYta, также /ˈstætə/, иногда стилизуется как STATA) – это пакет статистического программного обеспечения общего назначения, разработанный компанией StataCorp для обработки данных, визуализации, статистического анализа и автоматизированного создания отчетов. Он используется исследователями в различных областях, включая биомедицину, экономику, эпидемиологию и социологию. Stata был первоначально разработан в Computing Resource Center в Калифорнии, а первая версия была выпущена в 1985 году. В 1993 году компания переехала в Колледж-Стейшн, штат Техас, и была переименована в Stata Corporation, ныне известную как StataCorp. Текущая версия – Stata 18, выпущенная в апреле 2023 года.

Пользовательский интерфейс

С момента своего создания Stata всегда использовала интегрированный интерфейс командной строки. Начиная с версии 8.0, Stata включает графический пользовательский интерфейс, который использует меню и диалоговые окна для доступа ко многим встроенным командам. Набор данных можно просматривать или редактировать в формате таблицы. Начиная с версии 11, другие команды могут выполняться одновременно с открытым браузером или редактором данных.

Структура и хранение данных

До выпуска версии 16 программа Stata могла открывать только один набор данных одновременно. Stata предоставляет гибкие возможности для определения типов данных. Команда compress автоматически переназначает данные типам, занимающим меньше памяти, без потери информации. Stata использует целочисленные типы хранения, которые занимают всего один или два байта вместо четырех, а одинарная точность (4 байта) вместо двойной точности (8 байт) является значением по умолчанию для чисел с плавающей точкой. Формат данных Stata всегда табличный. В Stata столбцы табличных данных называются переменными.

Совместимость формата данных

Stata может импортировать данные в различных форматах. Это включает форматы данных ASCII (такие как CSV или форматы баз данных) и форматы электронных таблиц (включая различные форматы Excel). Собственные форматы файлов Stata менялись со временем, хотя не в каждой версии Stata появляется новый формат набора данных. Каждая версия Stata может читать все предыдущие форматы наборов данных и может сохранять как текущий, так и последний предыдущий формат набора данных, используя команду saveold. Таким образом, текущая версия Stata всегда может открывать наборы данных, созданные в более ранних версиях, но более ранние версии не могут читать наборы данных в новых форматах. Stata может читать и записывать наборы данных формата SAS XPORT непосредственно с помощью команд fdause и fdasave. Некоторые другие эконометрические программы, включая gretl, могут напрямую импортировать форматы файлов Stata.

Происхождение

Разработка Stata началась в 1984 году, первоначально благодаря Уильяму (Биллу) Гоулду, а затем Шону Бекетти. Программа изначально создавалась как конкурент статистическим пакетам для персональных компьютеров, таким как SYSTAT и MicroTSP. Определенные разработки оказались особенно важными и продолжают определять пользовательский опыт и сегодня, включая расширяемость, платформенную независимость и активное сообщество пользователей. В Stata 2.1 появились ado-файлы, позволяющие автоматически загружать пользовательские программы в память. Многие пользовательские ado-файлы публикуются в Архиве статистических компонентов программного обеспечения, размещенном Бостонским колледжем. Компания StataCorp добавила команду ssc, позволяющую устанавливать программы, разработанные сообществом, непосредственно в Stata. В более поздних версиях Stata пользователи могут вызывать скрипты Python с помощью команд, а также импортировать команды Stata в Python IDE, такие как Jupyter Notebooks. Хотя Stata не имеет встроенной поддержки R, существуют пользовательские расширения для использования R-скриптов в Stata.

Сообщество пользователей

Ряд важных разработок был инициирован активным сообществом пользователей Stata. В то время как Stata/MP обеспечивает встроенную параллельную обработку определенных команд, Stata/SE и Stata/BE имеют ограничения и используют только одно ядро процессора. Stata/MP выполняет определенные команды примерно в 2,4 раза быстрее, достигая примерно 60% от теоретического максимума эффективности, при параллельной обработке на четырех ядрах по сравнению с версиями SE или BE.