Optimal compliance, ikke perfekt

Den ikke-intuitive pointe: Jo hårdere man går efter perfekt compliance, jo mindre compliance får man.

Figur: en kurve formet som et omvendt U. Efterlevelsen stiger med regelsættets fuldstændighed til et punkt kaldet Optimal og falder derefter mod et lavt punkt kaldet Perfekt
  • Hvorfor det komplette regelsæt er dét, der får den vigtigste regel til at tabe
  • Hvorfor mere information giver mindre indlæring, ikke mere
  • Hvorfor det ikke hjælper at gentage informationen en gang til
  • Hvorfor en sikkerhedsorganisation har indset at det giver mere compliance at gå efter optimal, ikke perfekt, compliance

Den mest almindelige reaktion på en regel, ingen følger, er at gøre regelsættet mere komplet. Give mere information. Flere tests. Mere e-læring. Mere tvang. Men hvad hvis det faktisk skader mere end det gavner? Og hvad kan man gøre i stedet.

Den præmis, det hele hviler på

Jeg tror, mennesker faktisk gerne vil gøre det rigtige. Når de ikke gør det, handler det sjældent om modvilje. Det handler om friktion: alt det, der gør det svært, utrygt eller meningsløst at handle rigtigt. Det har jeg skrevet en del om i Den længste vej til adfærd.

Men prøv at bevise det på et menneske. Din kollega fulgte ikke reglen — hvorfor ikke? Havde han travlt? Gad han ikke? Var han træt, var han uenig, eller havde han slet ikke forstået den? Fem forklaringer er i spil på én gang, og du kan ikke skille dem ad. Det er derfor, diskussionen om compliance kører i ring og standardløsningerne bliver gentaget. Det kan altid forklares som en, der ikke tog sig sammen eller ikke vidste nok. Altså mangler på viden eller motivation.

Så jeg gjorde noget andet. Jeg brugte en sprogmodel på samme måde, som biologer bruger en bananflue. Ikke fordi fluen er et menneske, men fordi man kan se mekanismen arbejde i den.

Det handler ikke om, at maskinen ligner os. Det handler om, at på præcis de krav et regelsæt stiller — læs hver enkelt regel, bliv aldrig træt, hav ingen modvilje mod reglen, hold hele manualen i hovedet på én gang — er en sprogmodel bedre stillet end noget menneske. Den skimmer ikke. Den bliver ikke fornærmet over at blive sendt på kursus. Den har ikke travlt med sit rigtige arbejde. Hvis metoden skulle virke nogen steder, skulle den virke der.

Hvad der skete

Opgaven var én regel, valgt tilfældigt og let at tjekke: slør alle personnavne i en tekst. To betingelser.

I den første stod reglen alene, som en kort, positiv opskrift: gør dette. Modellerne løste den omkring 100 % af gangene.

I den anden stod præcis samme regel begravet blandt fjorten andre regler — et realistisk uddrag af en manual, hvor de øvrige regler var lige så gyldige og lige så pligtige. Reglen var der stadig, og hvert ord stod der.

Den svageste model faldt fra 100 % til 0. En mellemstor lå på 60 til 88 %. Den stærkeste af de testede holdt 100 % — den havde kapacitet nok til fjorten.

Hvad målingen viser, og hvad den ikke viser

Betyder det, at mennesker fejler på samme måde? Nej. Målingerne er lavet på sprogmodeller, og det er ikke det samme som at have målt på mennesker.

Det, målingen viser, er noget snævrere og efter min mening mere brugbart: man behøver ikke et menneskes træthed, travlhed eller modvilje for at få et regelsæt til at fejle. Kollapset opstod i et substrat, hvor ingen af de tre findes. En strukturel årsag — for mange krav om for lidt kapacitet — er altså nok i sig selv. Og så holder “medarbejderen skulle bare have taget sig sammen” op med at være en tilstrækkelig diagnose.

At mennesker også fejler over for komplette regelsæt, er ikke min opdagelse. Erik Hollnagels skel mellem work-as-imagined og work-as-done siger det direkte (Hollnagel, 2014). I klinisk beslutningsstøtte er alert fatigue målt som en dosis-respons: jo flere påmindelser ved beslutningspunktet, jo lavere accept af hver, drevet af overbelastning og ikke af manglende vilje (Ancker m.fl., 2017). Sikkerhedsforskningen har sit eget navn for det: komplette top-down-regelsæt fejler over for rigtige operatører (Hale & Borys, 2013). Og den generelle form — præstationen stiger med information til et punkt og falder derefter — har været beskrevet i fyrre år (Eppler & Mengis, 2004).

Det, min måling tilføjer, er ikke at det sker, men et bud på hvorfor, og et sted hvor mekanismen kan tælles.

Om mennesker og maskiner fejler gennem samme mekanisme, er en hypotese. Jeg har skrevet den, så du kan skyde den ned: find en gruppe, hvis efterlevelse stiger jævnt, jo mere komplet regelsættet bliver, på en opgave med rigtige konkurrerende regler og uden mulighed for at slå op. Så er påstanden forkert. Jeg tror ikke, den gruppe findes, men det er et bud og ikke et resultat.

Måske tænker du, at der er noget, maskinen ikke har, og den indvending holder jeg selv mest af. På ét punkt er maskinen nemlig dårligere stillet end os: den har ingen mening med noget. Et menneske, der oplever en regel som sin egen — tænk på en kirurg og steril teknik — kan presse den igennem en overbelastning, som maskinen ikke kan. Det er rigtigt. Men den ressource findes kun for de regler, man i forvejen synes er ens egne, og et regelsæt består mest af de andre. En klausul om konkurrenceret har ingen plads i en social- og sundhedsassistents eget formål. For netop de regler er der ingen mening at trække på, og mennesket har træthed og modvilje oveni.

Fejlen sker allerede ét skridt før

Før en regel kan tabe et kapløb i en presset situation, skal den først læres. Og læring er ikke gratis. Forbi en grænse giver mere information mindre indlæring, ikke mere. Det er cognitive load og redundansvirkningen, målt på mennesker for snart tredive år siden (Sweller, van Merriënboer & Paas, 1998), og grænsen selv er endnu ældre (Miller, 1956).

Det vender refleksen på hovedet. Vi har behandlet compliance som en mængde: få hver eneste regel foran den enkelte. Men jo mere man sender, jo mindre bliver lært — og adfærden hænger på det, der blev lært. Det komplette regelsæt er dét, der har den dårligste chance for at sætte sig.

Så skal man bare sige det oftere? Nej, og det er værd at dvæle ved. At terpe den samme besked bygger ikke ruten. Spredt, varieret øvelse gør, og det at hente svaret frem selv gør, og det er blandt de mest replikerede fund, der findes (Cepeda m.fl., 2006; Roediger & Karpicke, 2006). Terpning har oven i købet en pris, folk sjældent regner med: den bygger en stiv rute, som udløses mekanisk, men ikke kan afvige, når situationen kræver det. Det ser bedre ud i målingen lige efter kurset og dårligere, den dag det gælder (Soderstrom & Bjork, 2015). Hvis du vil se den forskel på et konkret eksempel, står den i Viden er ikke færdighed.

Derfor er målet ikke hundrede procent

Det, refleksen i virkeligheden jager, er perfekt efterlevelse. Fuldstændigheden er kun midlet.

Men perfekt efterlevelse er umulig i princippet, og ikke bare svær. Og ironien er, at jo hårdere man presser på for den, jo mindre compliant adfærd får man.

Optimal ligger i toppen. Perfekt ligger for langt til højre.

Mere fuldstændighed hjælper, indtil den holder op med at hjælpe X-aksen viser, hvor fuldstændigt regelsættet er. Y-aksen viser, hvor meget af adfærden der faktisk bliver installeret. Kurven starter lavt, hvor intet er skrevet ned, stiger til et højdepunkt markeret Optimal, og falder derefter til et lavt punkt yderst til højre markeret Perfekt. Optimal Perfekt Intet skrevet ned Mere med, mindre installeret Hvor fuldstændigt regelsættet er Adfærd, der bliver installeret Mere fuldstændighed hjælper, indtil den holder op med at hjælpe X-aksen viser, hvor fuldstændigt regelsættet er. Y-aksen viser, hvor meget af adfærden der faktisk bliver installeret. Kurven stiger til et højdepunkt markeret Optimal og falder derefter til et lavt punkt markeret Perfekt. Optimal Perfekt Fuldstændighed Installeret adfærd
Figur 1. Mere fuldstændighed hjælper, indtil den holder op med at hjælpe. Optimal ligger i toppen; perfekt ligger for langt til højre.

Kurven vender. X-aksen er, hvor fuldstændigt regelsættet er. Y-aksen er, hvor meget af adfærden der faktisk bliver installeret. Til venstre er der for lidt: reglen står ingen steder, og så er der ikke noget at efterleve. Så stiger det, som man ville forvente. Og så er der et punkt, hvor det holder op med at stige — og hvor det, man lægger til for at være dækket, begynder at tage fra det, der skulle installeres.

Optimal ligger i toppen. Perfekt ligger for langt til højre.

Det er ikke kun en pointe om compliance. Jeg har bygget den samme skelnen ind i en arkitektur for regelstyrede rådgivningssystemer, hvor den bærer titlen direkte: Optimal, Not Perfect.

Hvor ligger toppen så for dine medarbejdere og kollegaer? Det afhænger af, hvem der skal bruge reglerne. En specialist, der kender sit felt, har en top længere ude end en, der læser reglen ved siden af sit rigtige arbejde. Toppen flytter sig. Den forsvinder ikke.

Dokumentationen og adfærden er to forskellige ting

Her er den pointe, jeg tror er den vigtigste i hele paperet, og den handler ikke om at dokumentere mindre.

Dit komplette regelsæt skal være komplet. Auditor skal kunne se, at kravet er beskrevet, hvornår det blev opdateret, og hvem der har kvitteret. Det er et rigtigt krav, og det skal indfries.

Men det, I kan lægge frem, og det, folk rent faktisk gør, er to forskellige ting — og vi bruger det samme dokument til begge. Antagelsen er, at jo bedre noget er beskrevet, jo bedre bliver det gjort. Målingen siger, at det holder et stykke ad vejen og derefter vender om. Det er der, det bliver et paradoks og ikke bare en irritation: går man efter perfekt compliance, får man suboptimal adfærd. Hundrede procent gennemførelse er lettest at opnå ved at gøre kurset let at klikke sig igennem — og så er der ingen adfærd tilbage at måle på.

Bemærk, at det er to forskellige spørgsmål. Hvad skal auditor kunne se? Og hvad skal din kollega faktisk gøre på tirsdag klokken ti? Det første er et dokumentationsspørgsmål, det andet er et adfærdsspørgsmål, og det er kun det første, et komplet regelsæt kan svare på.

Så del de to ting op, og revidér dem efter hver sin målestok:

  • Arkivet — det, I kan lægge frem, hvis nogen spørger — bærer fuldstændigheden. Politikken, hele regelsættet, versionerne, kvitteringerne. Det skal være komplet, og det skal være til at slå op i.
  • Adfærdsproduktet – kurset, diagrammet o.lign. – bærer efterlevelsen. Kort. Positivt formuleret. Det handler om de få ting, folk faktisk skal gøre anderledes, og det bliver øvet, ikke bare vist.
  • Til resten anvendes performancesupport, eks. tjeklister eller cues, der passer til den enkelte situation. Ved hvert beslutningspunkt: hent den ene relevante regel frem.

Man kan læse det som et forslag om at slække på kravene. Men det er faktisk det modsatte: det er at holde op med at bruge ét dokument til to opgaver, hvor det kun kan løse den ene.

Det er sket før, og det virkede

Hvis du nu tænker, at ingen myndighed ville gå med til det, så lad mig fortælle om en, der gjorde.

Passwordpolitikker plejede at kræve store bogstaver, tal, tegn og et nyt password hvert kvartal. For de fleste mennesker er det krav umuligt. Så hvad gjorde folk? Det eneste, der kunne gøres — genbrugte password, de kunne huske som blev ændret når de blev bedt om det. Typisk et ”skrammelpassword” der bruges til alle mulige sites, eks. MitPassword1!, MitPassword2! osv, og et mere sikkert password der bruges både på arbejdet andre steder hvor der kræves mere sikkerhed (MereSikk3rtPassword1!, MereSikk3rtPassword2!). Det skyldes ikke manglende vilje, for folk vil gerne være sikre.

Og pointen er, at det at presse reglen hårdere skubbede adfærden ind i en værre tilstand, ikke mod idealet: mere forudsigelige varianter, mere genbrug.

NIST vendte deres egen vejledning og holdt op med at kræve store bogstaver, tal og tegn, og holdt op med at kræve et nyt password hvert kvartal, når der ikke er tegn på, at nogen er brudt ind. I stedet: gør dem længere, og tjek dem mod listerne over passwords, der allerede er lækket (Grassi, Garcia & Fenton, 2017; videreført i Revision 4). En sikkerhedsstandard holdt altså op med at maksimere reglen, fordi maksimering gav mindre af den adfærd, den ville have.

Det er samme figur som ovenfor. De fandt toppen i stedet for at gå efter yderpunktet.

Det, du kan gøre på mandag

Ikke bygge alt om. Én ting.

Tag det regelsæt, du sidst sendte ud, og skriv ned, hvad du vil have folk til at gøre anderledes. Ikke vide. Gøre. Hvor mange ting står der på din liste? Sandsynligvis mellem tre og fem — og står der tredive, har du svaret på, hvorfor det ikke bliver gjort.

Så skiller du de tre ud fra resten. De tre bliver til det, du kommunikerer. Det, der bliver øvet, helst som en situation, hvor man selv skal vælge, og ikke som en gennemgang. Resten bliver til noget, man kan slå op, dér hvor beslutningen træffes, og til dokumentationen i arkivet.

Og lad mig give dig én detalje, der er billigere, end den ser ud: skriv det, folk skal gøre, frem for det, de ikke må. Et forbud gør den forbudte handling mere nærværende, ikke mindre, og det gælder også for en sprogmodel. En positiv opskrift slår forbudslisten.

Spørgsmålet, jeg altid ender med at stille, er dette: gør det her det lettere at handle rigtigt — eller sværere at handle forkert? Er svaret ikke tydeligt, skal det skæres væk.

Hvor det står, hvis du vil se det selv

Målingerne, kontrollerne, kapacitetstrappen og den fulde redegørelse for, hvad der er målt og hvad der kun er hypotese, står i paperet: Governance Irony: Why Information-Heavy Compliance Directives Mechanically Fail in Large Language Models (Lund, 2026, CC BY 4.0).

Den teori, mekanismen kommer fra, ligger på frictiontheory.org.