Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Классикалық тест теориясы (КТТ) – психологиялық тестілеу нәтижелерін, мысалы, сұрақтардың қиындық деңгейін немесе тестіленіп отырған адамдардың қабілетін болжауға мүмкіндік беретін психометриялық теориялардың жиынтығы. Бұл теория адамның тесттен алған нақты ұпайының, шынайы ұпайдың (қатесіз ұпай) және қателік ұпайының қосындысы екенін қабылдайды. Жалпы айтқанда, классикалық тест теориясының мақсаты психологиялық тесттердің сенімділігін түсіну және арттыру болып табылады. Классикалық тест теориясы шын ұпай теориясымен шамалас ұғым ретінде қарастырылуы мүмкін. "Классикалық" термині осы модельдердің тарихына ғана емес, сонымен қатар, көбінесе "заманауи жасырын белгілер теориясы" деп аталатын, жалпы элемент-жауап теориясы сияқты, қазіргі психометриялық теориялармен салыстырылады, олар кейде "заманауи" деп те аталады. Классикалық тест теориясы бүгінгі танылған түрінде Новик (1966) жұмысы арқылы жүйелендірілді және Лорд пен Новик (1968) және Аллен мен Йен (1979/2002) сияқты классикалық еңбектерде сипатталды. Төмендегі классикалық тест теориясының сипаттамасы осы маңызды жарияланымдарға негізделген.
Classical test theory (CTT) is a body of related psychometric theory that predicts outcomes of psychological testing such as the difficulty of items or the ability of test takers. It is a theory of testing based on the idea that a person's observed or obtained score on a test is the sum of a true score (error free score) and an error score. Generally speaking, the aim of classical test theory is to understand and improve the reliability of psychological tests. Classical test theory may be regarded as roughly synonymous with true score theory. The term "classical" refers not only to the chronology of these models but also contrasts with the more recent psychometric theories, generally referred to collectively as item response theory, which sometimes bear the appellation "modern" as in "modern latent trait theory". Classical test theory as we know it today was codified by Novick (1966) and described in classic texts such as Lord & Novick (1968) and Allen & Yen (1979/2002). The description of classical test theory below follows these seminal publications.
Бағалау элементтері: P және элемент-жалпы өзара байланыстар
Сенімділік – сынақ сапасының бір ғана санмен берілетін ыңғайлы көрсеткіші. Дегенмен, ол жеке сұрақтарды бағалау үшін ешқандай ақпаратты ұсынбас еді. Классикалық тәсілдегі сұрақтарды талдау көбінесе екі статистикаға сүйенеді: P мәні (пропорция) және сұрақтың барлық сынақпен корреляциясы (нүктелі-бисериалдық корреляция коэффициенті). P мәні – сынақтан өткендердің дұрыс жауапқа бағытталған жауап беру пропорциясын көрсетеді және әдетте сұрақтың қиындық деңгейі деп аталады. Сұрақтың барлық сынақпен корреляциясы сұрақтың ажырату қабілетін немесе ерекшелеу күшін көрсетеді және әдетте сұрақтың ажырату қабілеті деп аталады. Бұған қоса, бұл статистикалар жиі қолданылатын көп таңдаулы сұрақтардың әрбір жауабы үшін есептеледі, олар сұрақтарды бағалау және олармен байланысты мәселелерді анықтау үшін қолданылады, мысалы, шатастыратын дұрыс емес жауаптар. Мұндай құнды талдауды арнайы психометриялық бағдарламалық құралдар қамтамасыз етеді.
Reliability provides a convenient index of test quality in a single number, reliability. However, it does not provide any information for evaluating single items. Item analysis within the classical approach often relies on two statistics: the P value (proportion) and the item total correlation (point biserial correlation coefficient). The P value represents the proportion of examinees responding in the keyed direction, and is typically referred to as item difficulty. The item total correlation provides an index of the discrimination or differentiating power of the item, and is typically referred to as item discrimination. In addition, these statistics are calculated for each response of the oft used multiple choice item, which are used to evaluate items and diagnose possible issues, such as a confusing distractor. Such valuable analysis is provided by specially designed psychometric software.
Баламалар
Классикалық тест теориясы – әлеуметтік ғылымдарда тест нәтижелерінің ықпалды теориясы. Психометрияда бұл теория элементтік жауап теориясы (IRT) және жалпылану теориясы (G теориясы) арқылы одан да күрделі модельдермен ығыстырылды. Дегенмен, IRT SPSS сияқты стандартты статистикалық пакеттерге енгізілмеген, бірақ SAS PROC IRT және PROC MCMC арқылы IRT модельдерін есептеуге мүмкіндік береді, сондай-ақ ашық кодты статистикалық R бағдарламалау тілі үшін IRT пакеттері бар (мысалы, CTT). Кәсіби пакеттер Кронбахтың коэффициентін жүйелі түрде есептесе, IRT немесе G теориясы үшін арнайы психометриялық бағдарламалық жасақтама тиімдірек болуы мүмкін. Алайда, жалпы статистикалық пакеттер көбінесе классикалық талдаудың толық көлемін қамтамасыз етпейді (Кронбахтың коэффициенті – көптеген маңызды статистикалық көрсеткіштердің бірі ғана), сондықтан көп жағдайда классикалық талдау үшін арнайы бағдарламалық қамтамасыз ету де қажет.
Classical test theory is an influential theory of test scores in the social sciences. In psychometrics, the theory has been superseded by the more sophisticated models in item response theory (IRT) and generalizability theory (G theory). However, IRT is not included in standard statistical packages like SPSS, but SAS can estimate IRT models via PROC IRT and PROC MCMC and there are IRT packages for the open source statistical programming language R (e. g., CTT). While commercial packages routinely provide estimates of Cronbach's , specialized psychometric software may be preferred for IRT or G theory. However, general statistical packages often do not provide a complete classical analysis (Cronbach's is only one of many important statistics), and in many cases, specialized software for classical analysis is also necessary.
Кемшіліктер
Классикалық тест теориясының ең маңызды немесе белгілі кемшіліктерінің бірі – емтихан тапсырушының және тесттің сипаттамаларын бөліп қарау мүмкін емес: олардың әрқайсысы тек біріншісінің контекстінде ғана түсіндіріледі. Тағы бір кемшілік – классикалық тест теориясындағы сенімділік анықтамасында, онда сенімділік – «тесттің параллель формаларындағы тест нәтижелері арасындағы корреляция» деп айтылған. Мұндағы мәселе – параллель тесттер дегеніміз не екеніне қатысты түрлі пікірлердің болуы. Әртүрлі сенімділік коэффициенттері сенімділіктің төменгі шегін бағалауды немесе белгісіз бұрмалаулармен сенімділік бағалауын ұсынады. Үшінші кемшілік – өлшеудің стандартты қателігі. Мұндағы мәселе – классикалық тест теориясына сәйкес, өлшеудің стандартты қателігі барлық емтихан тапсырушылар үшін бірдей деп есептеледі. Алайда, Хамблтон өз кітабында түсіндіргендей, кез келген тест бойынша алынған нәтижелер әртүрлі біліктілік деңгейіндегі емтихан тапсырушылар үшін әр түрлі дәлдікте болады, сондықтан барлық емтихан тапсырушылар үшін қателіктердің тең болуы туралы болжам сенімсіз (Хамблтон, Сваминатан, Роджерс, 1991, 4 б.). Төртінші және соңғы кемшілік – классикалық тест теориясы тестке бағдарланған, ал емес элементке. Яғни, классикалық тест теориясы жеке адамның немесе тіпті емтихан тапсырушылар тобының тест сұрағына қаншалықты жақсы жауап бере алатынын болжауға көмектесе алмайды.
One of the most important or well known shortcomings of classical test theory is that examinee characteristics and test characteristics cannot be separated: each can only be interpreted in the context of the other. Another shortcoming lies in the definition of reliability that exists in classical test theory, which states that reliability is "the correlation between test scores on parallel forms of a test". The problem with this is that there are differing opinions of what parallel tests are. Various reliability coefficients provide either lower bound estimates of reliability or reliability estimates with unknown biases. A third shortcoming involves the standard error of measurement. The problem here is that, according to classical test theory, the standard error of measurement is assumed to be the same for all examinees. However, as Hambleton explains in his book, scores on any test are unequally precise measures for examinees of different ability, thus making the assumption of equal errors of measurement for all examinees implausible (Hambleton, Swaminathan, Rogers, 1991, p. 4). A fourth, and final shortcoming of the classical test theory is that it is test oriented, rather than item oriented. In other words, classical test theory cannot help us make predictions of how well an individual or even a group of examinees might do on a test item.