Jak hodnotíme
Stejná odpověď, stejné body. U každého a pokaždé.
Nehodnotí vás komise ani umělá inteligence. Odborná rada rozhodne předem, co je správně a kde leží hranice úrovní, a výsledek pak spočítá pravidlo, které je stejné pro všechny. Proč to je férovější než ústní zkouška, podle jakých světových standardů test stavíme a kde má hranice.
- AI v hodnocení
- 0pevný výpočet, žádný model
- Shoda na klíči
- 80 %z aspoň 6 odborníků, naslepo
- Kontrola otázky
- 100odpovědí, pak statistika
- Cíl spolehlivosti
- 0,90měříme od pilotu
- Odvolání
- 30 dnírozhoduje člověk
V kostce
Zkoušející je měřidlo s chybou. Stejný výkon dostane jinou známku podle toho, kdo zkouší a kdo šel před vámi.
PodrobněVýzkum mluví jasně: o férovosti a spolehlivosti rozhoduje struktura a pevná pravidla, ne osobní dojem.
PodrobněČlověk u nás rozhoduje předem: rada schvaluje otázky, klíč i hranice úrovní. Body pak počítá pravidlo, stejně pro všechny.
PodrobněStavíme podle světových standardů pro zkoušky a certifikaci osob a u každého kroku říkáme, co už platí a co přijde po pilotu. Umělá inteligence o vás nerozhoduje.
Podrobně
Část I
Kde lidské zkoušení chybuje
Nejde o to, že by zkoušející byli špatní. Lidský úsudek je měřidlo, které kolísá.
01
Zkoušející si zkreslení většinou neuvědomují. Ve výzkumu věřili svému úsudku stejně, ať byl zkreslený, nebo ne.
Stejný výkon, jiná známka
U ústní a praktické zkoušky závisí výsledek nejen na uchazeči, ale i na tom, kdo zkouší a v jakém pořadí. Tři dobře doložené efekty:
Přísný a mírný zkoušející
V britské lékařské zkoušce MRCP PACES (přes 10 000 kandidátů, 1 259 zkoušejících) připadalo 12 % rozptylu známek na přísnost nebo shovívavost zkoušejícího. Po korekci by se výsledek změnil zhruba u 4 % kandidátů.
McManus, Thompson, Mollon 2006, BMC Medical Education 6:42
Kdo šel před vámi
Stejný dobrý výkon dostal po slabém uchazeči 5,01 bodu, bez něj 4,36. Hraniční výkon po dobrém uchazeči 2,96, bez něj 3,55. Rozhodovalo pořadí, ne výkon.
Yeates, Cardell, Byrne, Eva 2015, Medical Education
Volná ústní zkouška je nespolehlivá
Metaanalýza ústních zkoušek: tradiční volná rozprava měla spolehlivost 0,50, strukturovaná s pevnými otázkami a schématem 0,75 až 0,80. Polovina rozdílů mezi známkami u volné zkoušky je šum.
Abuzied, Nabag 2023, BMC Medical Education 23
Dojem se míchá s obsahem
Zkoušející vidí vystupování, jistotu v hlase, věk i přízvuk. U bezpečáka hodnotíme úsudek, ne rétoriku. Test tyhle signály vůbec nevidí.
Obecný poznatek o hodnoticích chybách (halo efekt)
02
Uvádíme i číslo, které nám nehraje: strukturovaný pohovor vychází nejlépe. Ukazuje ale totéž, co říkáme my.
Rozhoduje struktura, ne to, jestli hodnotí člověk
Největší přehled toho, co předpovídá pracovní výkon, přepočítal v roce 2022 tým Paula Sacketta. Volný pohovor vyšel nejhůř, test odborných znalostí zhruba dvakrát lépe.
| Metoda výběru | Schmidt, Hunter 1998 | Sackett a kol. 2022 |
|---|---|---|
| Strukturovaný pohovor (pevné otázky a hodnoticí schéma) | 0,51 | 0,42 |
| Test odborných znalostí | 0,48 | 0,40 |
| Pracovní vzorek | 0,54 | 0,33 |
| Situační úsudkový test (SJT) | neuvádí | 0,26 |
| Nestrukturovaný pohovor (volná rozprava) | 0,38 | 0,19 |
Operační validita, tedy jak dobře metoda předpovídá pracovní výkon. Journal of Applied Psychology 107 (2022), tab. 3.
- Co z toho plyne. Člověk hodnotí dobře, jen když má pevné otázky a schéma. Čím víc volnosti, tím víc šumu.
- My jdeme o krok dál. Pevné otázky, pevné schéma a navíc nulový rozdíl mezi hodnotiteli, protože schéma uplatňuje výpočet.
- Poctivě: čísla se týkají výběru zaměstnanců, ne certifikací. Jako důkaz, že struktura poráží dojem, ale platí.
03
Zkušenost posuzovatele na výsledku nic neměnila.
Pravidlo, nebo dojem: sedmdesát let výzkumu
Už v roce 1954 ukázal psycholog Paul Meehl, že pevné pravidlo předpovídá lépe než úsudek odborníka. Pozdější metaanalýzy to potvrdily.
- Grove a kol. 2000: mechanické pravidlo bylo v průměru asi o 10 % přesnější. Podstatně lépe dopadlo ve 33 až 47 % studií, lidský úsudek jen v 6 až 16 %. Platilo to bez ohledu na typ úlohy i zkušenost posuzovatelů.
- Zajímavost pro ústní zkoušky: lidský úsudek dopadl hůř tehdy, když měl posuzovatel k dispozici rozhovor. Osobní kontakt přidává dojem, ne přesnost.
- Ægisdóttir a kol. 2006: v nejpřísněji vybraných studiích byla statistická předpověď o 13 % přesnější.
Část II
Jak stavíme špičkový test
Podle standardů, podle kterých se staví lékařské a profesní licenční zkoušky ve světě. U každého prvku říkáme, jestli už platí.
04
Obsah testu má vycházet z toho, co bezpečáci skutečně dělají, ne z toho, co se dobře zkouší.
Co test měří
Analýza práce
CílCo test měří, určí průzkum mezi bezpečáky: jaké úkoly skutečně dělají a jak jsou důležité. Z něj vznikne veřejný plán zkoušky, který se reviduje nejpozději po pěti letech.
NCCA Standards, Std 14; AERA/APA/NCME Standards 2014, 11.3
Situace místo citací
V systémuVětšina otázek popisuje situaci z provozu a ptá se, co je správné udělat. Znalostní instrukce „co je správně“ měří úsudek lépe než „co byste udělali“.
McDaniel a kol. 2007, Personnel Psychology 60
Tři volby u znalostních otázek
Po pilotuMetaanalýza osmdesáti let výzkumu: tři dobře napsané volby dávají stejně spolehlivý test jako čtyři nebo pět. Volbu, kterou skoro nikdo nevolí, po pilotu vyřadíme podle dat.
Rodriguez 2005, Educational Measurement: Issues and Practice 24(2)
Hlubší formáty
CílRozvíjející se případ o šesti krocích, hledání chyb v dokumentu a sestavení hodnocení rizik. Stále automaticky hodnocené podle schémat schválených radou.
NCLEX Test Plan 2026 (případové studie); Lubarsky a kol. 2013
05
Rozdíl proti komisi: rada rozhoduje v klidu, nad každou otázkou zvlášť a dřív, než kohokoli uvidí.
Kdo rozhoduje o správnosti a hranicích
Otázky schvaluje rada naslepo
V systémuKaždou otázku hodnotí aspoň šest odborníků, kteří nevidí verdikty ostatních dřív než svůj a neznají autora.
NCCA Standards, Std 13
Klíč platí jen při shodě
V systémuNejlepší volbu musí stejně označit aspoň 80 % hodnotitelů. Jinak se otázka přepisuje a do testu nejde.
NCCA Standards, Std 16
Hranice úrovní ve dvou kolech
Po pilotuAngoffovou metodou: odborníci u každé otázky odhadnou, jak často ji zvládne bezpečák na hranici bronzu, stříbra a zlata. Druhé kolo proběhne s daty z pilotu a výsledek zkontroluje Hofsteeho metoda. Panel doporučuje, rozhoduje rada.
Cizek, Bunch 2007; NCCA Standards, Std 17; Standards 2014, 5.21 až 5.23
Panel deset až patnáct lidí
Po pilotuNa datech z osmi profesních licenčních zkoušek vychází 10 až 15 hodnotitelů jako rozsah, kdy se hranice ustálí. Dnes je minimum šest.
Hurtz, Hertz 1999, Educational and Psychological Measurement 59
Hodnotitel nezkouší sám sebe
V systémuKdo hodnotí otázky, nesmí 12 měsíců test sám skládat.
ISO/IEC 17024, nestrannost
06
Každé měření má nejistotu. Poctivý test ji zná a říká ji.
Délka testu a přesnost výsledku
Cíl spolehlivosti 0,90
Po pilotuPro rozhodnutí o jednotlivci se doporučuje spolehlivost aspoň 0,90. Po pilotu ji spočítáme a zveřejníme i nejistotu skóre u každé hranice.
Nunnally, Bernstein 1994; Standards 2014, 2.14, 2.16, 11.14
Délka testu podle dat
Po pilotuKolik otázek je potřeba, určí spolehlivost naměřená v pilotu, ne pohodlí. Podle výzkumu to pro tři úrovně bývá sto a víc otázek; počet upravíme podle výsledku.
Spearman-Brown; USMLE Step 1 až 280, NCLEX 85 až 150, CFA Level I 180 otázek
Jak jisté je zařazení
Po pilotuPro obě hranice (bronz a stříbro, stříbro a zlato) spočítáme, jak často by stejný člověk při opakování dostal stejnou úroveň.
Livingston, Lewis 1995, Journal of Educational Measurement 32(2)
Oblasti jen tam, kde jsou spolehlivé
Po pilotuVýsledek po oblastech má smysl jen s aspoň dvaceti otázkami v oblasti. Tam, kde jich je méně, oblast neukážeme, aby nikoho nemátla.
Sinharay 2010; Haberman 2008; NCCA Standards, Std 19
07
Náhodný výběr otázek chrání banku. Statistika musí zajistit, že je výběr pro všechny stejně těžký.
Srovnatelné verze testu
Zkušební otázky v každém testu
V systémuNové otázky se nejdřív objeví jako nezapočítávané. Dnes jsou v testu čtyři, cílem je 15 až 25, k nerozeznání od ostrých.
NCLEX Test Plan 2026 (15 nezapočítávaných); ITC/ATP 2022
Kalibrace každé otázky
Po pilotuObtížnost otázky se ustálí po 100 až 150 odpovědích. Teprve pak může rozhodovat o výsledku.
Linacre 1994, Rasch Measurement Transactions 7(4)
Ekvivalizace verzí
CílKaždý dostane jiný výběr otázek. Statistické vyrovnání obtížnosti zajistí, že lehčí výběr nikoho nezvýhodní.
Kolen, Brennan 2014; NCCA Standards, Std 17
Adaptivní test
CílAž bude banka šesti až osminásobkem délky testu, může další otázka záviset na předchozích odpovědích. Stejná přesnost s méně otázkami.
Stocking 1994, ETS RR-94-05; NCLEX
08
Každý krok je pevné pravidlo. Stejné vstupy dají vždy stejný výsledek.
Algoritmus, který si můžete přečíst. Bez umělé inteligence.
- Výběr otázek
Otázky se vyberou ze schválené banky podle pevného plánu zkoušky: kolik z které oblasti a vrstvy. Každý dostane srovnatelný test, k němu nezapočítávané zkušební otázky.
- Pořadí
Pořadí otázek i voleb se u každého náhodně zamíchá. Soused ani opakovaný pokus nevidí totéž ve stejném pořadí.
- Čas
Čas na otázku je pevný podle typu otázky. Kdo má doložené potíže se čtením, dostane prodloužení. Pravidlo je stejné pro všechny ve stejné situaci.
- Body
Nejlepší volba dostane bod. Kde to rada výslovně schválí, může druhá nejlepší dostat část bodu podle pořadí, které určil panel. Jinak nula.
- Výsledek
Skóre se porovná s hranicemi úrovní, které rada stanovila předem. Výsledek ukáže úroveň a oblasti, u kterých je dost otázek na spolehlivý údaj.
- Záznam
Každá odpověď, čas a verze otázky se uloží. Výsledek jde kdykoli přepočítat a přezkoumat, nic nestojí na vzpomínce zkoušejícího.
Žádný model, žádné „hodnocení odpovědi“ strojem. Nepoužíváme volné texty hodnocené umělou inteligencí ani strojové posuzování kamery. Výsledek je součet bodů podle klíče, který schválili lidé. Nová norma pro certifikaci osob ISO/IEC 17024:2026 klade na použití umělé inteligence zvláštní požadavky; my ji do hodnocení nepouštíme vůbec.
09
Studie z lékařských zkoušek našla vady ve 36 až 65 % otázek. Proto kontrolujeme každou.
Statistika a férovost
Kontrola každé otázky
V systémuPo 100 odpovědích jde otázka ven, když ji zvládne méně než 20 % nebo víc než 95 % uchazečů, nebo když neodlišuje silné od slabých. Zjevné vady se hledají už po 30 odpovědích.
Standards 2014, 4.8 a 4.10
Férovost pro skupiny
CílOtázka nesmí být těžší pro někoho jen kvůli věku, pohlaví nebo oboru. Rozbor je možný od 200 odpovědí v menší skupině a 500 celkem; do té doby to uvádíme jako omezení.
Zwick 2012, ETS RR-12-08 (Mantel-Haenszel)
Nahlášení otázky a přepočet
Po pilotuUchazeč otázku nahlásí z výsledku. Když rada uzná chybu, výsledek se přepočítá všem. Přepočet už systém umí.
ISO/IEC 17024, čl. 9.8
Odvolání do 30 dní
V systémuO odvolání rozhoduje člověk a výsledek jde doložit z uložených odpovědí.
ISO/IEC 17024, čl. 9.8
10
Člověk kontroluje, jestli pokus proběhl poctivě. Body nemění.
Bezpečnost a dohled
Dvě varianty podle toho, co potřebujete
V systémuMetaanalýza 49 studií: bez dohledu vycházejí skóre průměrně o pětinu směrodatné odchylky vyšší. Proto Znalostní test nese na certifikátu „bez dohledu“ a Ověřený má doklad, kameru a kontrolu člověkem.
Steger, Schroeders, Gnambs 2020, European Journal of Psychological Assessment 36(1)
Kontroluje člověk, ne software
V systémuRozpoznávání obličeje ani automatické „odhalování podvodů“ nepoužíváme. V nezávislém experimentu takový software nenašel žádného ze šesti podvádějících, člověk jednoho.
ITC/ATP 2022, 3.16; Bergmans a kol. 2021
Rozbor vzorců odpovědí
Po pilotuPodezřele rychlé odpovědi, nápadně shodné odpovědi různých lidí a výsledky, které nesedí k ostatním odpovědím téhož člověka. Podezření vždy posoudí člověk.
ITC/ATP 2022, kap. 8; Cizek, Wollack 2017
Ochrana banky
CílSledování úniků otázek, jejich stahování z internetu a obměna banky. Každý incident se zapisuje.
ITC/ATP 2022, kap. 8
Část III
Proč je to férovější
Stejné podmínky pro všechny, výsledek bez náhody a s možností přezkumu.
11
V tom, co měříme, je pravidlo přesnější a férovější než komise. Neznamená to, že je lepší ve všem, viz oddíl 14.
Ústní komise a ORSEB vedle sebe
| Hledisko | Ústní komise | Hodnocení ORSEB |
|---|---|---|
| Kdo určuje, co je správně | zkoušející při zkoušce, podle svého úsudku | rada předem: aspoň 6 hodnotitelů, shoda aspoň 80 % |
| Na čem výsledek závisí | na odpovědích, ale i na přísnosti zkoušejícího, pořadí uchazečů a dojmu | jen na odpovědích |
| Srovnatelnost | jiné otázky, jiný zkoušející, jiný den | srovnatelný test podle kvót, stejné bodování |
| Hranice úspěchu | v hlavě zkoušejícího | stanovená předem Angoffovou metodou a zveřejněná jako princip |
| Záznam a přezkum | protokol, často jen známka | každá odpověď a čas, přepočet a odvolání |
| Kvalita otázek | nesleduje se | statistika každé otázky, slabé se vyřazují |
| Co se dozvíte | vyhověl, nebo nevyhověl | úroveň, vrstvy a témata |
| Kdy a kde | termín, cesta, komise | kdykoli, z domova nebo z kanceláře |
12
Uvádíme i příklady, kde hodnotí lidé. Obraz má být úplný.
Jak to dělají jinde
- Americká lékařská licence (USMLE Step 1): jednodenní počítačový test s výběrem odpovědi, výsledek prospěl, nebo neprospěl. Praktickou zkoušku klinických dovedností se standardizovanými pacienty (Step 2 CS) USMLE v lednu 2021 zrušila. Důvodem nebyla nespolehlivost, ale vývoj oboru; část ověřování přesunula do počítačových simulací.
- Licence zdravotních sester v USA (NCLEX): počítačový adaptivní test, o úspěchu rozhoduje bodovací algoritmus.
- Certified Safety Professional (BCSP): nejrozšířenější certifikace bezpečáků v USA je počítačová zkouška v testovacím centru, výsledek uchazeč vidí hned.
- Kde hodnotí lidé: britský NEBOSH IGC stojí na písemném rozboru scénáře s pohovorem a praktickém hodnocení rizik, obojí hodnotí examinátoři. Vyšší stupně CFA mají eseje hodnocené lidmi. Je to jiný model, pomalejší a dražší, s výsledkem za týdny.
- Norma pro certifikaci osob: ISO/IEC 17024 ústní ani praktickou zkoušku nepředepisuje. Vyžaduje zkoušku, která je spolehlivá, objektivní a férová, a pravidelné potvrzení validity například statistikou. Akreditovaní nejsme, principy normy ale přebíráme.
Část IV
Poctivě o hranicích
Test něco měří velmi dobře a něco neměří vůbec. Obojí říkáme.
13
Pilot je první ostrá zkouška. Bez jeho dat nejde spolehlivost ani hranice poctivě spočítat.
Kde jsme dnes
Systém, který běží, je první verze. Standard popsaný výše je cíl, ke kterému míříme, a kroky označené „Po pilotu“ zavedeme, jakmile budeme mít data. Každou změnu zapíšeme do metodiky.
V systému
- Situace místo citací
- Otázky schvaluje rada naslepo
- Klíč platí jen při shodě
- Hodnotitel nezkouší sám sebe
- Zkušební otázky v každém testu
- Kontrola každé otázky
- Odvolání do 30 dní
- Dvě varianty podle toho, co potřebujete
- Kontroluje člověk, ne software
Po pilotu
- Tři volby u znalostních otázek
- Hranice úrovní ve dvou kolech
- Panel deset až patnáct lidí
- Cíl spolehlivosti 0,90
- Délka testu podle dat
- Jak jisté je zařazení
- Oblasti jen tam, kde jsou spolehlivé
- Kalibrace každé otázky
- Nahlášení otázky a přepočet
- Rozbor vzorců odpovědí
Cíl
- Analýza práce
- Hlubší formáty
- Ekvivalizace verzí
- Adaptivní test
- Férovost pro skupiny
- Ochrana banky
14
Certifikát tvrdí jen to, co opravdu měří: úsudek v situacích z praxe.
Co test neověří
Ruční dovednost a jednání s lidmi
Jak vedete školení, jak přesvědčíte ředitele, jak zvládnete konflikt v dílně. Tohle test neměří a netvrdíme, že ano.
Šikovnost na testy
Někdo umí body získat z formy otázky. Proto volby vyrovnáváme délkou i slovníkem a hlídáme to statistikou.
Kvalita stojí na otázkách
Automatický test je tak dobrý, jak dobré má otázky. Proto rada, zkušební otázky, kontrola po 100 odpovědích a přepočet.
Co s tím uděláme
Hlubší formáty z oddílu 04 posunou test blíž k práci v terénu. Ruční dovednost ani jednání s lidmi ale online test nikdy plně nenahradí.
Co to není. Ověření nenahrazuje odbornou způsobilost podle zákona č. 309/2006 Sb. a není to akreditovaná certifikace osob podle ISO/IEC 17024.
15
Pokud tu vaše chybí, napište nám.
Časté námitky
Nepozná zkušený zkoušející z rozhovoru víc než test?
Pozná jiné věci: jak mluvíte, jak se tváříte, jak reagujete na tlak. Jenže právě tyhle dojmy výsledek zkreslují. Metaanalýzy ukazují, že volný rozhovor předpovídá pracovní výkon zhruba poloviční měrou než test odborných znalostí. Když už člověk, pak s pevnými otázkami a hodnoticím schématem, a to je v podstatě to, co děláme my, jen bez rozdílů mezi zkoušejícími.
Rozhoduje o mně umělá inteligence?
Ne. Body počítá pevně daný výpočet: vybraná volba se porovná s klíčem, který schválila rada, a sečte se. Snímky z kamery nikdo strojově nevyhodnocuje a rozpoznávání obličeje nepoužíváme. Pokus ve variantě Ověřený kontroluje člověk.
Nedá se test naučit nazpaměť nebo uhodnout?
Banka se nezveřejňuje, otázky i volby se míchají a většina otázek jsou situace, kde rozhoduje úsudek, ne zapamatovaný údaj. Volby jsou psané tak, aby správná nebyla nejdelší ani nejodbornější. Náhodným tipováním se na žádnou úroveň dostat nedá.
Co když je otázka špatně?
Po pilotu půjde otázku nahlásit přímo z výsledku; když rada uzná chybu, výsledek se všem přepočítá. Statistika už dnes sama upozorní na otázku, kterou volí slabší uchazeči častěji než silní, nebo kde je chybná volba oblíbenější než správná.
Kdo hlídá radu a algoritmus?
Pravidla výpočtu popisujeme na této stránce a v metodice, klíč vyžaduje shodu několika hodnotitelů, kteří o sobě navzájem nevědí, a hodnotitelé nesmějí 12 měsíců test sami skládat. Proti výsledku se můžete odvolat do 30 dní.
16
Čísla bez zdroje neuvádíme.
Zdroje
- McManus I. C., Thompson M., Mollon J. (2006). Assessment of examiner leniency and stringency („hawk-dove effect“) in the MRCP(UK) clinical examination (PACES). BMC Medical Education 6:42. doi:10.1186/1472-6920-6-42.
- Yeates P., Cardell J., Byrne G., Eva K. W. (2015). Relatively speaking: contrast effects influence assessors’ scores and narrative feedback. Medical Education. doi:10.1111/medu.12777.
- Abuzied A. I. H., Nabag W. O. M. (2023). Structured viva validity, reliability, and acceptability as an assessment tool in health professions education. BMC Medical Education 23. doi:10.1186/s12909-023-04524-6.
- Schmidt F. L., Hunter J. E. (1998). Psychological Bulletin 124(2):262–274; Sackett P. R., Zhang C., Berry C. M., Lievens F. (2022). Journal of Applied Psychology 107(11):2040–2068. doi:10.1037/apl0000994.
- McDaniel M. A. a kol. (2001). Journal of Applied Psychology 86(4):730–740; McDaniel M. A. a kol. (2007). Personnel Psychology 60(1):63–91.
- Meehl P. E. (1954). Clinical versus Statistical Prediction. University of Minnesota Press; Grove W. M. a kol. (2000). Psychological Assessment 12(1):19–30; Ægisdóttir S. a kol. (2006). The Counseling Psychologist 34(3):341–382.
- Downing S. M. (2005). The effects of violating standard item writing principles on tests and students. Advances in Health Sciences Education 10(2):133–143.
- Bergmans L., Bouali N., Luttikhuis M., Rensink A. (2021). On the efficacy of online proctoring using Proctorio. CSEDU 2021.
- Millman J., Bishop C. H., Ebel R. (1965). An analysis of test-wiseness. Educational and Psychological Measurement 25(3):707–726.
- USMLE: Step 1 (usmle.org) a oznámení o ukončení Step 2 CS, 26. 1. 2021; NCSBN, NCLEX (nclex.com); BCSP, CSP (bcsp.org); NEBOSH, International General Certificate (nebosh.org.uk).
- ISO/IEC 17024 Posuzování shody: Všeobecné požadavky na orgány pro certifikaci osob, vydání 2012 (čl. 9.3) a 2026 (čl. 6.5 umělá inteligence, 9.3 zkouška, 9.8 odvolání).
- AERA, APA, NCME (2014). Standards for Educational and Psychological Testing. Washington, DC: AERA.
- ITC, ATP (2022). Guidelines for Technology-Based Assessment. International Test Commission a Association of Test Publishers.
- Institute for Credentialing Excellence, NCCA Standards for the Accreditation of Certification Programs (platné od 2023).
- Rodriguez M. C. (2005). Three options are optimal for multiple-choice items. Educational Measurement: Issues and Practice 24(2):3–13.
- Livingston S. A., Lewis C. (1995). Estimating the consistency and accuracy of classifications based on test scores. Journal of Educational Measurement 32(2):179–197.
- Sinharay S. (2010). How often do subscores have added value? Journal of Educational Measurement 47(2):150–174; Haberman S. J. (2008). JEBS 33:204–229.
- Hurtz G. M., Hertz N. R. (1999). How many raters should be used for establishing cutoff scores with the Angoff method? Educational and Psychological Measurement 59:885–897; Cizek G. J., Bunch M. B. (2007). Standard Setting. SAGE.
- Linacre J. M. (1994). Sample size and item calibration stability. Rasch Measurement Transactions 7(4):328; Kolen M. J., Brennan R. L. (2014). Test Equating, Scaling, and Linking. Springer; Stocking M. L. (1994). ETS RR-94-05.
- Zwick R. (2012). A review of ETS differential item functioning assessment procedures. ETS RR-12-08.
- Steger D., Schroeders U., Gnambs T. (2020). A meta-analysis of test scores in proctored and unproctored ability assessments. European Journal of Psychological Assessment 36(1):174–184; Cizek G. J., Wollack J. A. (2017). Handbook of Quantitative Methods for Detecting Cheating on Tests. Routledge.
- NCLEX-RN Test Plan 2026 (nclex.com); CFA Institute, Level I exam; Lubarsky S. a kol. (2013). Script concordance testing, AMEE Guide 75. Medical Teacher 35(3).
- Angoff W. H. (1971). Scales, norms, and equivalent scores. In Thorndike R. L. (ed.), Educational Measurement, 2. vyd., s. 508–600.