ORSEBZkušební rada

Jak hodnotíme

Stejná odpověď, stejné body. U každého a pokaždé.

Nehodnotí vás komise ani umělá inteligence. Odborná rada rozhodne předem, co je správně a kde leží hranice úrovní, a výsledek pak spočítá pravidlo, které je stejné pro všechny. Proč to je férovější než ústní zkouška, podle jakých světových standardů test stavíme a kde má hranice.

AI v hodnocení
0pevný výpočet, žádný model
Shoda na klíči
80 %z aspoň 6 odborníků, naslepo
Kontrola otázky
100odpovědí, pak statistika
Cíl spolehlivosti
0,90měříme od pilotu
Odvolání
30 dnírozhoduje člověk

V kostce

  1. Zkoušející je měřidlo s chybou. Stejný výkon dostane jinou známku podle toho, kdo zkouší a kdo šel před vámi.

    Podrobně
  2. Výzkum mluví jasně: o férovosti a spolehlivosti rozhoduje struktura a pevná pravidla, ne osobní dojem.

    Podrobně
  3. Člověk u nás rozhoduje předem: rada schvaluje otázky, klíč i hranice úrovní. Body pak počítá pravidlo, stejně pro všechny.

    Podrobně
  4. Stavíme podle světových standardů pro zkoušky a certifikaci osob a u každého kroku říkáme, co už platí a co přijde po pilotu. Umělá inteligence o vás nerozhoduje.

    Podrobně

Část I

Kde lidské zkoušení chybuje

Nejde o to, že by zkoušející byli špatní. Lidský úsudek je měřidlo, které kolísá.

01

Zkoušející si zkreslení většinou neuvědomují. Ve výzkumu věřili svému úsudku stejně, ať byl zkreslený, nebo ne.

Stejný výkon, jiná známka

U ústní a praktické zkoušky závisí výsledek nejen na uchazeči, ale i na tom, kdo zkouší a v jakém pořadí. Tři dobře doložené efekty:

  1. Přísný a mírný zkoušející

    V britské lékařské zkoušce MRCP PACES (přes 10 000 kandidátů, 1 259 zkoušejících) připadalo 12 % rozptylu známek na přísnost nebo shovívavost zkoušejícího. Po korekci by se výsledek změnil zhruba u 4 % kandidátů.

    McManus, Thompson, Mollon 2006, BMC Medical Education 6:42

  2. Kdo šel před vámi

    Stejný dobrý výkon dostal po slabém uchazeči 5,01 bodu, bez něj 4,36. Hraniční výkon po dobrém uchazeči 2,96, bez něj 3,55. Rozhodovalo pořadí, ne výkon.

    Yeates, Cardell, Byrne, Eva 2015, Medical Education

  3. Volná ústní zkouška je nespolehlivá

    Metaanalýza ústních zkoušek: tradiční volná rozprava měla spolehlivost 0,50, strukturovaná s pevnými otázkami a schématem 0,75 až 0,80. Polovina rozdílů mezi známkami u volné zkoušky je šum.

    Abuzied, Nabag 2023, BMC Medical Education 23

  4. Dojem se míchá s obsahem

    Zkoušející vidí vystupování, jistotu v hlase, věk i přízvuk. U bezpečáka hodnotíme úsudek, ne rétoriku. Test tyhle signály vůbec nevidí.

    Obecný poznatek o hodnoticích chybách (halo efekt)

02

Uvádíme i číslo, které nám nehraje: strukturovaný pohovor vychází nejlépe. Ukazuje ale totéž, co říkáme my.

Rozhoduje struktura, ne to, jestli hodnotí člověk

Největší přehled toho, co předpovídá pracovní výkon, přepočítal v roce 2022 tým Paula Sacketta. Volný pohovor vyšel nejhůř, test odborných znalostí zhruba dvakrát lépe.

Metoda výběruSchmidt, Hunter 1998Sackett a kol. 2022
Strukturovaný pohovor (pevné otázky a hodnoticí schéma)0,510,42
Test odborných znalostí0,480,40
Pracovní vzorek0,540,33
Situační úsudkový test (SJT)neuvádí0,26
Nestrukturovaný pohovor (volná rozprava)0,380,19

Operační validita, tedy jak dobře metoda předpovídá pracovní výkon. Journal of Applied Psychology 107 (2022), tab. 3.

  • Co z toho plyne. Člověk hodnotí dobře, jen když má pevné otázky a schéma. Čím víc volnosti, tím víc šumu.
  • My jdeme o krok dál. Pevné otázky, pevné schéma a navíc nulový rozdíl mezi hodnotiteli, protože schéma uplatňuje výpočet.
  • Poctivě: čísla se týkají výběru zaměstnanců, ne certifikací. Jako důkaz, že struktura poráží dojem, ale platí.

03

Zkušenost posuzovatele na výsledku nic neměnila.

Pravidlo, nebo dojem: sedmdesát let výzkumu

Už v roce 1954 ukázal psycholog Paul Meehl, že pevné pravidlo předpovídá lépe než úsudek odborníka. Pozdější metaanalýzy to potvrdily.

  • Grove a kol. 2000: mechanické pravidlo bylo v průměru asi o 10 % přesnější. Podstatně lépe dopadlo ve 33 až 47 % studií, lidský úsudek jen v 6 až 16 %. Platilo to bez ohledu na typ úlohy i zkušenost posuzovatelů.
  • Zajímavost pro ústní zkoušky: lidský úsudek dopadl hůř tehdy, když měl posuzovatel k dispozici rozhovor. Osobní kontakt přidává dojem, ne přesnost.
  • Ægisdóttir a kol. 2006: v nejpřísněji vybraných studiích byla statistická předpověď o 13 % přesnější.

Část II

Jak stavíme špičkový test

Podle standardů, podle kterých se staví lékařské a profesní licenční zkoušky ve světě. U každého prvku říkáme, jestli už platí.

V systému funguje už teďPo pilotu zavedeme s daty z pilotuCíl kam míříme, až bude dost uchazečů

04

Obsah testu má vycházet z toho, co bezpečáci skutečně dělají, ne z toho, co se dobře zkouší.

Co test měří

  • Analýza práce

    Cíl

    Co test měří, určí průzkum mezi bezpečáky: jaké úkoly skutečně dělají a jak jsou důležité. Z něj vznikne veřejný plán zkoušky, který se reviduje nejpozději po pěti letech.

    NCCA Standards, Std 14; AERA/APA/NCME Standards 2014, 11.3

  • Situace místo citací

    V systému

    Většina otázek popisuje situaci z provozu a ptá se, co je správné udělat. Znalostní instrukce „co je správně“ měří úsudek lépe než „co byste udělali“.

    McDaniel a kol. 2007, Personnel Psychology 60

  • Tři volby u znalostních otázek

    Po pilotu

    Metaanalýza osmdesáti let výzkumu: tři dobře napsané volby dávají stejně spolehlivý test jako čtyři nebo pět. Volbu, kterou skoro nikdo nevolí, po pilotu vyřadíme podle dat.

    Rodriguez 2005, Educational Measurement: Issues and Practice 24(2)

  • Hlubší formáty

    Cíl

    Rozvíjející se případ o šesti krocích, hledání chyb v dokumentu a sestavení hodnocení rizik. Stále automaticky hodnocené podle schémat schválených radou.

    NCLEX Test Plan 2026 (případové studie); Lubarsky a kol. 2013

05

Rozdíl proti komisi: rada rozhoduje v klidu, nad každou otázkou zvlášť a dřív, než kohokoli uvidí.

Kdo rozhoduje o správnosti a hranicích

  • Otázky schvaluje rada naslepo

    V systému

    Každou otázku hodnotí aspoň šest odborníků, kteří nevidí verdikty ostatních dřív než svůj a neznají autora.

    NCCA Standards, Std 13

  • Klíč platí jen při shodě

    V systému

    Nejlepší volbu musí stejně označit aspoň 80 % hodnotitelů. Jinak se otázka přepisuje a do testu nejde.

    NCCA Standards, Std 16

  • Hranice úrovní ve dvou kolech

    Po pilotu

    Angoffovou metodou: odborníci u každé otázky odhadnou, jak často ji zvládne bezpečák na hranici bronzu, stříbra a zlata. Druhé kolo proběhne s daty z pilotu a výsledek zkontroluje Hofsteeho metoda. Panel doporučuje, rozhoduje rada.

    Cizek, Bunch 2007; NCCA Standards, Std 17; Standards 2014, 5.21 až 5.23

  • Panel deset až patnáct lidí

    Po pilotu

    Na datech z osmi profesních licenčních zkoušek vychází 10 až 15 hodnotitelů jako rozsah, kdy se hranice ustálí. Dnes je minimum šest.

    Hurtz, Hertz 1999, Educational and Psychological Measurement 59

  • Hodnotitel nezkouší sám sebe

    V systému

    Kdo hodnotí otázky, nesmí 12 měsíců test sám skládat.

    ISO/IEC 17024, nestrannost

06

Každé měření má nejistotu. Poctivý test ji zná a říká ji.

Délka testu a přesnost výsledku

  • Cíl spolehlivosti 0,90

    Po pilotu

    Pro rozhodnutí o jednotlivci se doporučuje spolehlivost aspoň 0,90. Po pilotu ji spočítáme a zveřejníme i nejistotu skóre u každé hranice.

    Nunnally, Bernstein 1994; Standards 2014, 2.14, 2.16, 11.14

  • Délka testu podle dat

    Po pilotu

    Kolik otázek je potřeba, určí spolehlivost naměřená v pilotu, ne pohodlí. Podle výzkumu to pro tři úrovně bývá sto a víc otázek; počet upravíme podle výsledku.

    Spearman-Brown; USMLE Step 1 až 280, NCLEX 85 až 150, CFA Level I 180 otázek

  • Jak jisté je zařazení

    Po pilotu

    Pro obě hranice (bronz a stříbro, stříbro a zlato) spočítáme, jak často by stejný člověk při opakování dostal stejnou úroveň.

    Livingston, Lewis 1995, Journal of Educational Measurement 32(2)

  • Oblasti jen tam, kde jsou spolehlivé

    Po pilotu

    Výsledek po oblastech má smysl jen s aspoň dvaceti otázkami v oblasti. Tam, kde jich je méně, oblast neukážeme, aby nikoho nemátla.

    Sinharay 2010; Haberman 2008; NCCA Standards, Std 19

07

Náhodný výběr otázek chrání banku. Statistika musí zajistit, že je výběr pro všechny stejně těžký.

Srovnatelné verze testu

  • Zkušební otázky v každém testu

    V systému

    Nové otázky se nejdřív objeví jako nezapočítávané. Dnes jsou v testu čtyři, cílem je 15 až 25, k nerozeznání od ostrých.

    NCLEX Test Plan 2026 (15 nezapočítávaných); ITC/ATP 2022

  • Kalibrace každé otázky

    Po pilotu

    Obtížnost otázky se ustálí po 100 až 150 odpovědích. Teprve pak může rozhodovat o výsledku.

    Linacre 1994, Rasch Measurement Transactions 7(4)

  • Ekvivalizace verzí

    Cíl

    Každý dostane jiný výběr otázek. Statistické vyrovnání obtížnosti zajistí, že lehčí výběr nikoho nezvýhodní.

    Kolen, Brennan 2014; NCCA Standards, Std 17

  • Adaptivní test

    Cíl

    Až bude banka šesti až osminásobkem délky testu, může další otázka záviset na předchozích odpovědích. Stejná přesnost s méně otázkami.

    Stocking 1994, ETS RR-94-05; NCLEX

08

Každý krok je pevné pravidlo. Stejné vstupy dají vždy stejný výsledek.

Algoritmus, který si můžete přečíst. Bez umělé inteligence.

  1. Výběr otázek

    Otázky se vyberou ze schválené banky podle pevného plánu zkoušky: kolik z které oblasti a vrstvy. Každý dostane srovnatelný test, k němu nezapočítávané zkušební otázky.

  2. Pořadí

    Pořadí otázek i voleb se u každého náhodně zamíchá. Soused ani opakovaný pokus nevidí totéž ve stejném pořadí.

  3. Čas

    Čas na otázku je pevný podle typu otázky. Kdo má doložené potíže se čtením, dostane prodloužení. Pravidlo je stejné pro všechny ve stejné situaci.

  4. Body

    Nejlepší volba dostane bod. Kde to rada výslovně schválí, může druhá nejlepší dostat část bodu podle pořadí, které určil panel. Jinak nula.

  5. Výsledek

    Skóre se porovná s hranicemi úrovní, které rada stanovila předem. Výsledek ukáže úroveň a oblasti, u kterých je dost otázek na spolehlivý údaj.

  6. Záznam

    Každá odpověď, čas a verze otázky se uloží. Výsledek jde kdykoli přepočítat a přezkoumat, nic nestojí na vzpomínce zkoušejícího.

Žádný model, žádné „hodnocení odpovědi“ strojem. Nepoužíváme volné texty hodnocené umělou inteligencí ani strojové posuzování kamery. Výsledek je součet bodů podle klíče, který schválili lidé. Nová norma pro certifikaci osob ISO/IEC 17024:2026 klade na použití umělé inteligence zvláštní požadavky; my ji do hodnocení nepouštíme vůbec.

09

Studie z lékařských zkoušek našla vady ve 36 až 65 % otázek. Proto kontrolujeme každou.

Statistika a férovost

  • Kontrola každé otázky

    V systému

    Po 100 odpovědích jde otázka ven, když ji zvládne méně než 20 % nebo víc než 95 % uchazečů, nebo když neodlišuje silné od slabých. Zjevné vady se hledají už po 30 odpovědích.

    Standards 2014, 4.8 a 4.10

  • Férovost pro skupiny

    Cíl

    Otázka nesmí být těžší pro někoho jen kvůli věku, pohlaví nebo oboru. Rozbor je možný od 200 odpovědí v menší skupině a 500 celkem; do té doby to uvádíme jako omezení.

    Zwick 2012, ETS RR-12-08 (Mantel-Haenszel)

  • Nahlášení otázky a přepočet

    Po pilotu

    Uchazeč otázku nahlásí z výsledku. Když rada uzná chybu, výsledek se přepočítá všem. Přepočet už systém umí.

    ISO/IEC 17024, čl. 9.8

  • Odvolání do 30 dní

    V systému

    O odvolání rozhoduje člověk a výsledek jde doložit z uložených odpovědí.

    ISO/IEC 17024, čl. 9.8

10

Člověk kontroluje, jestli pokus proběhl poctivě. Body nemění.

Bezpečnost a dohled

  • Dvě varianty podle toho, co potřebujete

    V systému

    Metaanalýza 49 studií: bez dohledu vycházejí skóre průměrně o pětinu směrodatné odchylky vyšší. Proto Znalostní test nese na certifikátu „bez dohledu“ a Ověřený má doklad, kameru a kontrolu člověkem.

    Steger, Schroeders, Gnambs 2020, European Journal of Psychological Assessment 36(1)

  • Kontroluje člověk, ne software

    V systému

    Rozpoznávání obličeje ani automatické „odhalování podvodů“ nepoužíváme. V nezávislém experimentu takový software nenašel žádného ze šesti podvádějících, člověk jednoho.

    ITC/ATP 2022, 3.16; Bergmans a kol. 2021

  • Rozbor vzorců odpovědí

    Po pilotu

    Podezřele rychlé odpovědi, nápadně shodné odpovědi různých lidí a výsledky, které nesedí k ostatním odpovědím téhož člověka. Podezření vždy posoudí člověk.

    ITC/ATP 2022, kap. 8; Cizek, Wollack 2017

  • Ochrana banky

    Cíl

    Sledování úniků otázek, jejich stahování z internetu a obměna banky. Každý incident se zapisuje.

    ITC/ATP 2022, kap. 8

Část III

Proč je to férovější

Stejné podmínky pro všechny, výsledek bez náhody a s možností přezkumu.

11

V tom, co měříme, je pravidlo přesnější a férovější než komise. Neznamená to, že je lepší ve všem, viz oddíl 14.

Ústní komise a ORSEB vedle sebe

HlediskoÚstní komiseHodnocení ORSEB
Kdo určuje, co je správnězkoušející při zkoušce, podle svého úsudkurada předem: aspoň 6 hodnotitelů, shoda aspoň 80 %
Na čem výsledek závisína odpovědích, ale i na přísnosti zkoušejícího, pořadí uchazečů a dojmujen na odpovědích
Srovnatelnostjiné otázky, jiný zkoušející, jiný densrovnatelný test podle kvót, stejné bodování
Hranice úspěchuv hlavě zkoušejícíhostanovená předem Angoffovou metodou a zveřejněná jako princip
Záznam a přezkumprotokol, často jen známkakaždá odpověď a čas, přepočet a odvolání
Kvalita otázeknesleduje sestatistika každé otázky, slabé se vyřazují
Co se dozvítevyhověl, nebo nevyhovělúroveň, vrstvy a témata
Kdy a kdetermín, cesta, komisekdykoli, z domova nebo z kanceláře

12

Uvádíme i příklady, kde hodnotí lidé. Obraz má být úplný.

Jak to dělají jinde

  • Americká lékařská licence (USMLE Step 1): jednodenní počítačový test s výběrem odpovědi, výsledek prospěl, nebo neprospěl. Praktickou zkoušku klinických dovedností se standardizovanými pacienty (Step 2 CS) USMLE v lednu 2021 zrušila. Důvodem nebyla nespolehlivost, ale vývoj oboru; část ověřování přesunula do počítačových simulací.
  • Licence zdravotních sester v USA (NCLEX): počítačový adaptivní test, o úspěchu rozhoduje bodovací algoritmus.
  • Certified Safety Professional (BCSP): nejrozšířenější certifikace bezpečáků v USA je počítačová zkouška v testovacím centru, výsledek uchazeč vidí hned.
  • Kde hodnotí lidé: britský NEBOSH IGC stojí na písemném rozboru scénáře s pohovorem a praktickém hodnocení rizik, obojí hodnotí examinátoři. Vyšší stupně CFA mají eseje hodnocené lidmi. Je to jiný model, pomalejší a dražší, s výsledkem za týdny.
  • Norma pro certifikaci osob: ISO/IEC 17024 ústní ani praktickou zkoušku nepředepisuje. Vyžaduje zkoušku, která je spolehlivá, objektivní a férová, a pravidelné potvrzení validity například statistikou. Akreditovaní nejsme, principy normy ale přebíráme.

Část IV

Poctivě o hranicích

Test něco měří velmi dobře a něco neměří vůbec. Obojí říkáme.

13

Pilot je první ostrá zkouška. Bez jeho dat nejde spolehlivost ani hranice poctivě spočítat.

Kde jsme dnes

Systém, který běží, je první verze. Standard popsaný výše je cíl, ke kterému míříme, a kroky označené „Po pilotu“ zavedeme, jakmile budeme mít data. Každou změnu zapíšeme do metodiky.

V systému

  • Situace místo citací
  • Otázky schvaluje rada naslepo
  • Klíč platí jen při shodě
  • Hodnotitel nezkouší sám sebe
  • Zkušební otázky v každém testu
  • Kontrola každé otázky
  • Odvolání do 30 dní
  • Dvě varianty podle toho, co potřebujete
  • Kontroluje člověk, ne software

Po pilotu

  • Tři volby u znalostních otázek
  • Hranice úrovní ve dvou kolech
  • Panel deset až patnáct lidí
  • Cíl spolehlivosti 0,90
  • Délka testu podle dat
  • Jak jisté je zařazení
  • Oblasti jen tam, kde jsou spolehlivé
  • Kalibrace každé otázky
  • Nahlášení otázky a přepočet
  • Rozbor vzorců odpovědí

Cíl

  • Analýza práce
  • Hlubší formáty
  • Ekvivalizace verzí
  • Adaptivní test
  • Férovost pro skupiny
  • Ochrana banky

14

Certifikát tvrdí jen to, co opravdu měří: úsudek v situacích z praxe.

Co test neověří

  1. Ruční dovednost a jednání s lidmi

    Jak vedete školení, jak přesvědčíte ředitele, jak zvládnete konflikt v dílně. Tohle test neměří a netvrdíme, že ano.

  2. Šikovnost na testy

    Někdo umí body získat z formy otázky. Proto volby vyrovnáváme délkou i slovníkem a hlídáme to statistikou.

  3. Kvalita stojí na otázkách

    Automatický test je tak dobrý, jak dobré má otázky. Proto rada, zkušební otázky, kontrola po 100 odpovědích a přepočet.

  4. Co s tím uděláme

    Hlubší formáty z oddílu 04 posunou test blíž k práci v terénu. Ruční dovednost ani jednání s lidmi ale online test nikdy plně nenahradí.

Co to není. Ověření nenahrazuje odbornou způsobilost podle zákona č. 309/2006 Sb. a není to akreditovaná certifikace osob podle ISO/IEC 17024.

15

Pokud tu vaše chybí, napište nám.

Časté námitky

Nepozná zkušený zkoušející z rozhovoru víc než test?

Pozná jiné věci: jak mluvíte, jak se tváříte, jak reagujete na tlak. Jenže právě tyhle dojmy výsledek zkreslují. Metaanalýzy ukazují, že volný rozhovor předpovídá pracovní výkon zhruba poloviční měrou než test odborných znalostí. Když už člověk, pak s pevnými otázkami a hodnoticím schématem, a to je v podstatě to, co děláme my, jen bez rozdílů mezi zkoušejícími.

Rozhoduje o mně umělá inteligence?

Ne. Body počítá pevně daný výpočet: vybraná volba se porovná s klíčem, který schválila rada, a sečte se. Snímky z kamery nikdo strojově nevyhodnocuje a rozpoznávání obličeje nepoužíváme. Pokus ve variantě Ověřený kontroluje člověk.

Nedá se test naučit nazpaměť nebo uhodnout?

Banka se nezveřejňuje, otázky i volby se míchají a většina otázek jsou situace, kde rozhoduje úsudek, ne zapamatovaný údaj. Volby jsou psané tak, aby správná nebyla nejdelší ani nejodbornější. Náhodným tipováním se na žádnou úroveň dostat nedá.

Co když je otázka špatně?

Po pilotu půjde otázku nahlásit přímo z výsledku; když rada uzná chybu, výsledek se všem přepočítá. Statistika už dnes sama upozorní na otázku, kterou volí slabší uchazeči častěji než silní, nebo kde je chybná volba oblíbenější než správná.

Kdo hlídá radu a algoritmus?

Pravidla výpočtu popisujeme na této stránce a v metodice, klíč vyžaduje shodu několika hodnotitelů, kteří o sobě navzájem nevědí, a hodnotitelé nesmějí 12 měsíců test sami skládat. Proti výsledku se můžete odvolat do 30 dní.

16

Čísla bez zdroje neuvádíme.

Zdroje

  1. McManus I. C., Thompson M., Mollon J. (2006). Assessment of examiner leniency and stringency („hawk-dove effect“) in the MRCP(UK) clinical examination (PACES). BMC Medical Education 6:42. doi:10.1186/1472-6920-6-42.
  2. Yeates P., Cardell J., Byrne G., Eva K. W. (2015). Relatively speaking: contrast effects influence assessors’ scores and narrative feedback. Medical Education. doi:10.1111/medu.12777.
  3. Abuzied A. I. H., Nabag W. O. M. (2023). Structured viva validity, reliability, and acceptability as an assessment tool in health professions education. BMC Medical Education 23. doi:10.1186/s12909-023-04524-6.
  4. Schmidt F. L., Hunter J. E. (1998). Psychological Bulletin 124(2):262–274; Sackett P. R., Zhang C., Berry C. M., Lievens F. (2022). Journal of Applied Psychology 107(11):2040–2068. doi:10.1037/apl0000994.
  5. McDaniel M. A. a kol. (2001). Journal of Applied Psychology 86(4):730–740; McDaniel M. A. a kol. (2007). Personnel Psychology 60(1):63–91.
  6. Meehl P. E. (1954). Clinical versus Statistical Prediction. University of Minnesota Press; Grove W. M. a kol. (2000). Psychological Assessment 12(1):19–30; Ægisdóttir S. a kol. (2006). The Counseling Psychologist 34(3):341–382.
  7. Downing S. M. (2005). The effects of violating standard item writing principles on tests and students. Advances in Health Sciences Education 10(2):133–143.
  8. Bergmans L., Bouali N., Luttikhuis M., Rensink A. (2021). On the efficacy of online proctoring using Proctorio. CSEDU 2021.
  9. Millman J., Bishop C. H., Ebel R. (1965). An analysis of test-wiseness. Educational and Psychological Measurement 25(3):707–726.
  10. USMLE: Step 1 (usmle.org) a oznámení o ukončení Step 2 CS, 26. 1. 2021; NCSBN, NCLEX (nclex.com); BCSP, CSP (bcsp.org); NEBOSH, International General Certificate (nebosh.org.uk).
  11. ISO/IEC 17024 Posuzování shody: Všeobecné požadavky na orgány pro certifikaci osob, vydání 2012 (čl. 9.3) a 2026 (čl. 6.5 umělá inteligence, 9.3 zkouška, 9.8 odvolání).
  12. AERA, APA, NCME (2014). Standards for Educational and Psychological Testing. Washington, DC: AERA.
  13. ITC, ATP (2022). Guidelines for Technology-Based Assessment. International Test Commission a Association of Test Publishers.
  14. Institute for Credentialing Excellence, NCCA Standards for the Accreditation of Certification Programs (platné od 2023).
  15. Rodriguez M. C. (2005). Three options are optimal for multiple-choice items. Educational Measurement: Issues and Practice 24(2):3–13.
  16. Livingston S. A., Lewis C. (1995). Estimating the consistency and accuracy of classifications based on test scores. Journal of Educational Measurement 32(2):179–197.
  17. Sinharay S. (2010). How often do subscores have added value? Journal of Educational Measurement 47(2):150–174; Haberman S. J. (2008). JEBS 33:204–229.
  18. Hurtz G. M., Hertz N. R. (1999). How many raters should be used for establishing cutoff scores with the Angoff method? Educational and Psychological Measurement 59:885–897; Cizek G. J., Bunch M. B. (2007). Standard Setting. SAGE.
  19. Linacre J. M. (1994). Sample size and item calibration stability. Rasch Measurement Transactions 7(4):328; Kolen M. J., Brennan R. L. (2014). Test Equating, Scaling, and Linking. Springer; Stocking M. L. (1994). ETS RR-94-05.
  20. Zwick R. (2012). A review of ETS differential item functioning assessment procedures. ETS RR-12-08.
  21. Steger D., Schroeders U., Gnambs T. (2020). A meta-analysis of test scores in proctored and unproctored ability assessments. European Journal of Psychological Assessment 36(1):174–184; Cizek G. J., Wollack J. A. (2017). Handbook of Quantitative Methods for Detecting Cheating on Tests. Routledge.
  22. NCLEX-RN Test Plan 2026 (nclex.com); CFA Institute, Level I exam; Lubarsky S. a kol. (2013). Script concordance testing, AMEE Guide 75. Medical Teacher 35(3).
  23. Angoff W. H. (1971). Scales, norms, and equivalent scores. In Thorndike R. L. (ed.), Educational Measurement, 2. vyd., s. 508–600.