Hvorfor afviser systemet under τ? Tærsklen er ikke gættet — den er kalibreret på et guldsæt, fejl-lukket: hellere en for forsigtig afvisning end et selvsikkert forkert svar. Nyt nedenfor: træk i τ, skift retrieval-stak, og benchmark modeller — alt genberegnes live.
Samme guldsæt, alle modeller. τ/ablation ovenfor måler retrieval-halvdelen — det her måler generations-halvdelen: kvalitet mod pris, tokens og tid.
Faithfulhed = andel af svarets påstande, der er fuldt dækket af de citerede passager, bedømt af en fast verifikator (gpt-4o-mini — selv en deltager). 5 pp spænd ligger nær støj; pointen er at kvaliteten er høj OG ikke følger prisen.
Produktions-modellen (openai/gpt-4o-mini) på de hårde traps: rå dækning vs. effektiv tillid efter to sikkerhedsnet — tribunalet (overdrivelse vs. citeret kilde) og completeness-tjekket (citerede den ikke den top-rangerede HENTEDE artikel?). En sag er »sikker« hvis modellen rammer rigtigt ELLER et net fyrer.
Af 3 misser fanger nettene 3: tribunalet 2 (overdrivelse), completeness-tjekket 1 (ignoreret evidens — den top-hentede artikel blev ikke citeret).
To net med forskellig karakter: completeness-tjekket er deterministisk (flagger når den højest-rangerede HENTEDE artikel ikke citeres — 0 falske flag på de korrekte svar her), mens tribunalet er LLM-baseret og dermed et probabilistisk lag — det fanger overdrivelse mod den CITEREDE kilde, men er ingen garanti. De to nær-misser her er reelt en retrieval-rangering (en beslægtet artikel kom øverst); det robuste gulv er derfor det altid synlige citat + fail-closed.