Ғылыми зерттеулердің қайталанатындығы: маңыздылығы мен дағдарысы
Reproducibility
Ғылыми зерттеулердің қайталанатындығы – ғылыми әдістің маңызды қағидасы. Нәтижелерді тәуелсіз зерттеушілер қайталай алуы керек. Деректер мен код ашық болуы тиіс.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Ғылыми зерттеулердің аспектісі – ғылыми зерттеу нәтижелерінің қайталануы
Aspect of scientific research
the reproducibility of scientific research results
Қайталану, қайта көшіруге және қайталана беруге тікелей байланысты, ғылыми әдістің негізгі қағидасы болып табылады. Зерттеу нәтижелерінің қайталанатыны дегеніміз, экспериментте, байқау зерттеуінде немесе деректер жинағының статистикалық талдауында алынған нәтижелер зерттеу қайталанғанда жоғары дәлдікпен қайта қол жеткізілуі керек. Репликацияның түрлі түрлері бар, бірақ көбінесе репликациялық зерттеулерде әртүрлі зерттеушілер бірдей әдістеме қолданады. Тек бір немесе бірнеше рет осындай сәтті репликациядан кейін ғана нәтиже ғылыми білім ретінде мойындалуы тиіс. Есептеу ғылымдарында қайталану, тар ауқымда, келесідей сапаға ие болу ретінде анықталады: нәтижелер барлық деректер мен кодты есептеулерді бірдей нәтижелермен қайта орындауға мүмкіндік беретіндей етіп құжатталуы керек. Соңғы онжылдықтарда жарияланған көптеген ғылыми нәтижелердің қайталану тестінен өтпейтініне қатысты алаңдаушылық күшейді, бұл қайталану немесе репликация дағдарысына әкеп соқты.
Reproducibility, closely related to replicability and repeatability, is a major principle underpinning the scientific method. For the findings of a study to be reproducible means that results obtained by an experiment or an observational study or in a statistical analysis of a data set should be achieved again with a high degree of reliability when the study is replicated. There are different kinds of replication but typically replication studies involve different researchers using the same methodology. Only after one or several such successful replications should a result be recognized as scientific knowledge. With a narrower scope, reproducibility has been defined in computational sciences as having the following quality: the results should be documented by making all data and code available in such a way that the computations can be executed again with identical results. In recent decades, there has been a rising concern that many published scientific results fail the test of reproducibility, evoking a reproducibility or replication crisis.
Тарих
Ғылымда қайталанудың маңыздылығын ең алғаш атап өткен 17 ғасырда Англияда өмір сүрген ағылшын-ирланд химигі Роберт Бойль болды. Бойльдің ауа сорғысы вакуумды жасау және зерттеу үшін құрастырылған, ол кезде бұл өте даулы концепция болатын. Шын мәнінде, Рене Декарт және Томас Гоббс сияқты көрнекті философтар вакуумның болу мүмкіндігін жоққа шығарды. Ғылым тарихшылары Стивен Шапин мен Саймон Шаффер 1985 жылғы «Левиафан және ауа сорғысы» кітабында Бойль мен Гоббс арасындағы пікірталасты, формальды түрде вакуумның мәні туралы дау ретінде, бірақ негізінен пайдалы білімді қалай алуға болады деген мәселе ретінде сипаттайды. Эксперименттік әдістің пионері Бойль, білімнің негізі тәжірибелік фактілерден тұруы керек деп санды, оларды ғылыми қауым қайталану арқылы мойындауы мүмкін. Бойльдің сөзіне сүйенсек, бір экспериментті қайта-қайта жүргізу арқылы нақты фактінің анықтығы пайда болады. 17 ғасырда құру үшін күрделі және қымбат құрал болған ауа сорғысы, сонымен қатар, белгілі бір ғылыми құбылыстың қайталануына байланысты алғашқы жазбаға алынған даулардың біріне әкелді. 1660 жылдары голланд ғалымы Христиан Гюйгенс Амстердамда өзінің ауа сорғысын жасады, бұл Бойль мен оның сол кездегі ассистенті Роберт Гуктың тікелей бақылауынан тыс алғашқы құрылғы болды. Гюйгенс «аномальды тоқтап тұру» деп атаған эффектті хабарлады, онда су оның ауа сорғысының ішіндегі шыны ыдыста (іс жүзінде ауа көпіршігінің үстінде) көтеріліп тұрғандай көрінді, бірақ Бойль мен Гук бұл құбылысты өздерінің сорғыларында қайталай алмады. Шапин мен Шаффердің сөзіне сәйкес, «егер бұл құбылысты Англияда екі сорғының бірімен жасау мүмкін болмаса, онда Англияда ешкім Гюйгенстің мәлімдемелерін немесе сорғыны пайдаланудағы шеберлігін қабылдамайды». 1663 жылы Гюйгенс Англияға шақырылды, және оның жетекшілігімен Гук судың аномальды тоқтап тұруын қайталай алды. Осыдан кейін Гюйгенс Корольдік қоғамның шетелдік мүшесі болып сайланды. Дегенмен, Шапин мен Шаффер сондай-ақ «көшірудің сәттілігі кездейсоқ шешімдерге байланысты болды. Көшіру жасалғанда немесе жасалмағанда, оны анықтайтын формуланы жазу мүмкін емес» деп атап көрсетеді. Ғылым философы Карл Поппер өзінің 1934 жылғы «Ғылыми ашылымдардың логикасы» атты танымал кітабында «қайта жасалмайтын жекелеген оқиғалар ғылым үшін маңызсыз» деп қысқаша айтты. Статистик Рональд Фишер 1935 жылғы «Эксперименттерді жоспарлау» кітабында, қазіргі заманғы ғылыми тәжірибедегі гипотезаны тексеру және статистикалық маңыздылықтың негізін қалады, «экспериментті қалай жүргізуді білсек, онда бізге статистикалық маңызды нәтижелерді сирек бермейтін құбылыс эксперименттік жолмен дәлелденген деп айтуға болады» деп жазды. Мұндай мәлімдемелер қазіргі заманғы ғылымдағы жалпы қағиданы білдіреді, яғни қайталану ғылыми фактіні орнату үшін қажетті шарт (бірақ міндетті түрде жеткілікті емес) және практикада кез келген білім саласында ғылыми авторитетті орнату үшін қажет. Алайда, Шапин мен Шаффердің жоғарыда атап өткеніндей, бұл қағида сандық тұрғыдан дұрыс тұжырымдалмаған, мысалы, статистикалық маңыздылық сияқты, сондықтан фактінің қайталануы үшін қанша рет қайталанғаны нақты белгіленбеген.
The first to stress the importance of reproducibility in science was the Anglo Irish chemist Robert Boyle, in England in the 17th century. Boyle's air pump was designed to generate and study vacuum, which at the time was a very controversial concept. Indeed, distinguished philosophers such as René Descartes and Thomas Hobbes denied the very possibility of vacuum existence. Historians of science Steven Shapin and Simon Schaffer, in their 1985 book Leviathan and the Air Pump, describe the debate between Boyle and Hobbes, ostensibly over the nature of vacuum, as fundamentally an argument about how useful knowledge should be gained. Boyle, a pioneer of the experimental method, maintained that the foundations of knowledge should be constituted by experimentally produced facts, which can be made believable to a scientific community by their reproducibility. By repeating the same experiment over and over again, Boyle argued, the certainty of fact will emerge. The air pump, which in the 17th century was a complicated and expensive apparatus to build, also led to one of the first documented disputes over the reproducibility of a particular scientific phenomenon. In the 1660s, the Dutch scientist Christiaan Huygens built his own air pump in Amsterdam, the first one outside the direct management of Boyle and his assistant at the time Robert Hooke. Huygens reported an effect he termed "anomalous suspension", in which water appeared to levitate in a glass jar inside his air pump (in fact suspended over an air bubble), but Boyle and Hooke could not replicate this phenomenon in their own pumps. As Shapin and Schaffer describe, "it became clear that unless the phenomenon could be produced in England with one of the two pumps available, then no one in England would accept the claims Huygens had made, or his competence in working the pump". Huygens was finally invited to England in 1663, and under his personal guidance Hooke was able to replicate anomalous suspension of water. Following this Huygens was elected a Foreign Member of the Royal Society. However, Shapin and Schaffer also note that "the accomplishment of replication was dependent on contingent acts of judgment. One cannot write down a formula saying when replication was or was not achieved". The philosopher of science Karl Popper noted briefly in his famous 1934 book The Logic of Scientific Discovery that "non reproducible single occurrences are of no significance to science". The statistician Ronald Fisher wrote in his 1935 book The Design of Experiments, which set the foundations for the modern scientific practice of hypothesis testing and statistical significance, that "we may say that a phenomenon is experimentally demonstrable when we know how to conduct an experiment which will rarely fail to give us statistically significant results". Such assertions express a common dogma in modern science that reproducibility is a necessary condition (although not necessarily sufficient) for establishing a scientific fact, and in practice for establishing scientific authority in any field of knowledge. However, as noted above by Shapin and Schaffer, this dogma is not well formulated quantitatively, such as statistical significance for instance, and therefore it is not explicitly established how many times must a fact be replicated to be considered reproducible.
Қайталану және қайталану мүмкіндіктерін өлшеу
Химияда қайталану және көшірілу терминдері нақты сандық мағынада қолданылады. Зертханалар аралық тәжірибелерде химиялық заттың концентрациясы немесе басқа шамасы әртүрлі зертханаларда өлшемдердің өзгеруін бағалау үшін бірнеше рет өлшенеді. Содан кейін, бір зертханада алынған екі мәннің арасындағы айырманың стандартты қатесі қайталану деп аталады. Әртүрлі зертханаларда алынған екі өлшем арасындағы айырманың стандартты қатесі көшірілу деп аталады. Бұл өлшемдер метрологиядағы дисперсия компоненттерінің жалпы түсінігімен байланысты.
In chemistry, the terms reproducibility and repeatability are used with a specific quantitative meaning. In inter laboratory experiments, a concentration or other quantity of a chemical substance is measured repeatedly in different laboratories to assess the variability of the measurements. Then, the standard deviation of the difference between two values obtained within the same laboratory is called repeatability. The standard deviation for the difference between two measurement from different laboratories is called reproducibility. These measures are related to the more general concept of variance components in metrology.
Қайталанатын зерттеулер тәжірибеде
Психология қайталана алмайтын нәтижелер туралы ішкі алаңдаушылықтың жаңаруын көрді (көшірмелердің сәттілік деңгейі туралы эмпирикалық нәтижелер үшін қайталану дағдарысы туралы жазбаны қараңыз). Зерттеушілер 2006 жылғы зерттеуде Америка Психологиялық қауымдастығының (АПА) эмпирикалық мақалаларының 141 авторының 103-інің (73%) алты ай ішінде өз деректерімен жауап бермегенін көрсетті. 2015 жылы жарияланған зерттеуде АПА журналдарында жарияланған 394 мақаланың 246 авторы (62%) сұралғанда өз деректерін бөліспегені анықталды. 2012 жылғы бір мақалада зерттеушілердің өз жұмыстарымен бірге деректерді де жариялауы керек екені айтылды және демонстрация ретінде деректер жиынтығы жарияланды. 2017 жылы Scientific Data журналында жарияланған мақалада бұл жеткіліксіз болуы мүмкін екені және талдаудың барлық контексі ашылуы керек екені көрсетілді. Экономикада жарияланған зерттеулердің сенімділігі мен дұрыстығына қатысты алаңдаушылықтар туындады. Басқа ғылымдарда қайта жаңғыртушылық негізгі принцип саналады және зерттеулердің жариялануының алғышарты болып табылады, бірақ экономикалық ғылымдарда ол ең маңызды басымдық ретінде қарастырылмайды. Көптеген сарапшылармен тексерілген экономикалық журналдар жарияланған нәтижелердің қайта жаңғыртылуын қамтамасыз ету үшін ешқандай маңызды шаралар қолданбайды, бірақ жетекші экономика журналдары міндетті деректер мен код архивтерін қабылдауға көшті. Зерттеушілерді деректерін бөлісуге ынталандыру төмен немесе мүлдем жоқ, ал авторлар деректерді қайта пайдалануға болатын форматқа жинау үшін шығындарды көтеруі керек. Экономикалық зерттеулер көбінесе қайта жаңғыртылмайды, себебі журналдардың тек бір бөлігінде деректер жиынтығы мен бағдарламалық код үшін жеткілікті ақпарат ашу саясаты бар, тіпті болса да авторлар оған жиі сәйкес келмейді немесе баспагер оны орындамайды. 37 сарапшылармен тексерілген журналдарда жарияланған 599 мақаланы зерттеу нәтижесінде кейбір журналдар маңызды сәйкестік деңгейіне жеткені анықталды, бірақ олардың көп бөлігі толыққанды сәйкес келмеген немесе мүлдем сәйкес келмеген. Мақалалар деңгейінде орташа сәйкестік деңгейі 47,5% құрады, ал журналдар деңгейінде орташа сәйкестік деңгейі 38% құрады, ол 13% -дан 99% -ға дейін ауыспайды. 2018 жылы PLOS ONE журналында жарияланған зерттеуде денсаулық сақтау статистикасы зерттеушілерінің 14,4% өз деректерін немесе кодын немесе екеуін де бөліскені анықталды. Медициналық әдебиетте есеп беруді және осылайша қайта жаңғыртуды жақсартуға бағытталған бастамалар көптеген жылдар бойы жүргізіліп келеді, ол CONSORT бастамасымен басталды, қазір ол кеңейтілген EQUATOR желісінің бөлігі. Бұл топ жақында зерттеулердегі, әсіресе биомедициналық зерттеулердегі қателерді азайту үшін жақсырақ есеп беру қалай көмектесе алатынына назар аударды. Қайта жаңғыртылатын зерттеулер фармакологиядағы жаңа жаңалықтардың кілті болып табылады. Бірінші кезеңдегі зерттеулер екінші кезеңдегі қайта жаңғыртудан кейін жүргізіледі, өйткені дәрі-дәрмектер коммерциялық өндіріске қарай дамиды. Соңғы онжылдықта екінші кезеңнің табыстылығы 28% -дан 18% -ға дейін төмендеді. 2011 жылғы зерттеуде медициналық зерттеулердің 65% қайта тексерілгенде сәйкес келмейтіні, ал тек 6% толыққанды қайта жаңғыртылатыны көрсетілді.
Psychology has seen a renewal of internal concerns about irreproducible results (see the entry on replicability crisis for empirical results on success rates of replications). Researchers showed in a 2006 study that, of 141 authors of a publication from the American Psychological Association (APA) empirical articles, 103 (73%) did not respond with their data over a six month period. In a follow up study published in 2015, it was found that 246 out of 394 contacted authors of papers in APA journals did not share their data upon request (62%). In a 2012 paper, it was suggested that researchers should publish data along with their works, and a dataset was released alongside as a demonstration. In 2017, an article published in Scientific Data suggested that this may not be sufficient and that the whole analysis context should be disclosed. In economics, concerns have been raised in relation to the credibility and reliability of published research. In other sciences, reproducibility is regarded as fundamental and is often a prerequisite to research being published, however in economic sciences it is not seen as a priority of the greatest importance. Most peer reviewed economic journals do not take any substantive measures to ensure that published results are reproducible, however, the top economics journals have been moving to adopt mandatory data and code archives. There is low or no incentives for researchers to share their data, and authors would have to bear the costs of compiling data into reusable forms. Economic research is often not reproducible as only a portion of journals have adequate disclosure policies for datasets and program code, and even if they do, authors frequently do not comply with them or they are not enforced by the publisher. A Study of 599 articles published in 37 peer reviewed journals revealed that while some journals have achieved significant compliance rates, significant portion have only partially complied, or not complied at all. On an article level, the average compliance rate was 47.5%; and on a journal level, the average compliance rate was 38%, ranging from 13% to 99%. A 2018 study published in the journal PLOS ONE found that 14.4% of a sample of public health statistics researchers had shared their data or code or both. There have been initiatives to improve reporting and hence reproducibility in the medical literature for many years, beginning with the CONSORT initiative, which is now part of a wider initiative, the EQUATOR Network. This group has recently turned its attention to how better reporting might reduce waste in research, especially biomedical research. Reproducible research is key to new discoveries in pharmacology. A Phase I discovery will be followed by Phase II reproductions as a drug develops towards commercial production. In recent decades Phase II success has fallen from 28% to 18%. A 2011 study found that 65% of medical studies were inconsistent when re tested, and only 6% were completely reproducible.