PREPRINT
Clinical Information Fidelity (CIF): dincolo de Word Error Rate
Un framework task-defined pentru evaluarea modului în care informația clinică necesară este păstrată în cursul transformărilor automate.
- Autor
- Daniel Barcan
- Publicație
- Preprint · Zenodo
- Versiune
- Version 1.0
- Publicat
- Limba
- Română
- Status
- Conceptual framework
Cuprins
De la eroarea textuală la informația care trebuie păstrată
Clinical Information Fidelity (CIF) a pornit dintr-o problemă practică: evaluarea sistemelor de recunoaștere vocală medicală. Două transcripturi pot avea valori WER apropiate, dar erorile lor pot avea semnificații clinice foarte diferite.
O schimbare textuală mică poate inversa o negație, poate modifica o doză, lateralitatea, o măsurătoare sau evoluția în timp. Invers, o reformulare amplă poate păstra integral informația clinică.
Literatura despre recunoașterea vocală clinică descrie practici eterogene de evaluare, rate de eroare, efort de corectare și efecte asupra workflow-ului [1][2].
CIF mută întrebarea de la „cât de asemănător este output-ul cu input-ul?” la „ce informație clinică avea obligația să supraviețuiască transformării?”
De ce asemănarea textului nu este suficientă
Negation
- Source
- No pulmonary embolism is identified.
- Output
- Pulmonary embolism is identified.
Diferența lexicală este mică, dar negația care trebuia păstrată nu a supraviețuit.
Medication dose
- Source
- Apixaban 5 mg twice daily.
- Output
- Apixaban 2.5 mg twice daily.
Textul este aproape identic, dar cerința referitoare la doză nu a fost satisfăcută.
Meaning-preserving paraphrase
- Source
- No acute intracranial hemorrhage is identified.
- Output
- There is no evidence of acute intracranial bleeding.
Formularea diferă, dar informația clinică relevantă poate fi considerată păstrată.
Preservation specification
Pentru o sursă X și o transformare T, trebuie definit înaintea evaluării setul informațiilor clinice pe care transformarea are obligația să le conserve.
Acest set poate include, în funcție de task, o negație, o doză, o măsurătoare, o relație temporală sau alte unități clinice. O unitate poate fi reprezentată generic ca uᵢ = (aᵢ, Qᵢ): o ancoră clinică și condițiile necesare pentru ca sensul ei să fie considerat păstrat.
Specificația și regulile de scor trebuie stabilite independent de output-ul candidat. Protocolul trebuie să precizeze task-ul, domeniul, descompunerea unităților, echivalențele semantice, toleranțele numerice și tratarea negației, incertitudinii și criticității.
Pentru output-ul Y, fiecare unitate uᵢ este evaluată separat:
P(uᵢ,Y) = 1 dacă cerința este satisfăcută · P(uᵢ,Y) = 0 dacă nu este satisfăcută
Formula baseline CIF
Formula numără cerințele de conservare satisfăcute și le raportează la numărul total al cerințelor definite pentru task. Dacă toate unitățile obligatorii sunt păstrate, CIF este 1. Dacă 80 din 100 sunt păstrate, CIF este 0,80.
Baseline CIF este, matematic, un strict preservation recall asupra setului prestabilit. Un scor de 0,80 nu înseamnă că documentul este 80% corect, complet, sigur sau de bună calitate.
Formula baseline folosește evaluare binară. Scorurile graduale rămân o posibilă extensie, dar necesită reguli de adnotare validate. Și granularitatea contează: aceeași propoziție poate fi o cerință compozită, mai multe unități sau un graf. Valorile CIF sunt direct comparabile doar când specificațiile și regulile de descompunere sunt aceleași.
Fidelitatea este relativă la transformare
Fidelity = F(Y | X, T, CT)
Fidelitatea depinde simultan de sursă, task, preservation specification și output. Același output poate fi nepotrivit pentru o transcriere fidelă, dar potrivit pentru un sumar dacă sumarizarea cere conservarea unui subset diferit al informației.
De aceea CIF nu poate fi interpretat independent de transformarea evaluată.
Specification layer și assessment layer
Specification layer
Definește ce informație trebuie să supraviețuiască transformării. Cerințele aparțin task-ului și sunt stabilite independent de output.
Assessment layer
Determină dacă fiecare cerință a fost satisfăcută. Evaluarea poate folosi clinicieni, reguli, algoritmi, clinical NLP, evaluatoare semantice sau alte mecanisme.
Ce măsoară CIF — și ce nu măsoară
CIF măsoară o singură dimensiune: conservarea informației clinice pe care transformarea trebuia să o păstreze.
- nu este un nou algoritm de semantic similarity;
- nu înlocuiește WER;
- nu este un hallucination score;
- nu măsoară independent correctness, completeness, consistency, utility sau safety;
- nu reprezintă o măsură completă a calității documentului.
Fidelity ≠ Correctness
Dacă sursa este greșită, iar output-ul reproduce fidel informația greșită, CIF poate rămâne mare.
Fidelity ≠ Completeness
Dacă sursa este incompletă, CIF nu poate identifica automat informația care nu a existat în preservation specification.
Fidelity ≠ Consistency
Output-ul poate păstra cerințele individuale și totuși poate introduce contradicții în alte fragmente. Consistența internă trebuie evaluată separat.
Informația nesusținută necesită o evaluare separată
CIF poate fi 1, iar output-ul poate conține o afirmație nouă
- Source
- No pleural effusion.
- Output
- No pleural effusion. A 3 cm pulmonary mass is present.
Cerința obligatorie privind revărsatul pleural este păstrată, dar masa pulmonară este o informație nouă, nesusținută de sursă.
Acest exemplu arată de ce CIF nu este o metrică pentru halucinații. Conservarea și introducerea informației nesusținute sunt dimensiuni diferite.
Exemple de preservation requirements în mai multe specialități
Radiologie
Leziune, localizare, dimensiune, evoluție.
Cardiologie
Fracție de ejecție, severitatea unei valvulopatii, ritm.
Oncologie
Stadiu, biomarker, tratament, răspuns.
Anatomie patologică
Diagnostic, grad, margini, biomarkeri.
Medicină internă
Diagnostic, alergie, medicament, doză, follow-up.
Chirurgie și urgență
Procedură, sediu, lateralitate, complicații, alergii și dispoziție.
Aplicabilitatea între specialități este deocamdată conceptuală. Generalitatea propusă privește formalismul de conservare, nu existența unei ontologii sau specificații universale pentru medicină.
Relația cu WER și metricile existente
WER măsoară eroarea lexicală. CIF măsoară dacă informația pe care task-ul trebuia să o păstreze a supraviețuit. Ele descriu constructe diferite și pot fi raportate complementar; CIF nu este prezentat ca fiind superior WER.
Există deja evaluări sensibile la concepte medicale [3] și evaluatoare orientate clinic pentru radiologie [4][5]. Conservarea conținutului și constrângerile semantice sunt studiate și în NLP general și în informatica medicală [6][7][8]. CIF nu revendică aceste idei ca noutăți.
CIF propune un framework în care cerințele de conservare sunt definite independent de output, ca parte a task-ului de transformare, apoi sunt evaluate separat de mecanismul folosit pentru a decide dacă au fost satisfăcute.
Un scor agregat mare nu exclude o eroare critică
Dacă 99 din 100 de cerințe sunt păstrate, CIF = 0.99. Singurul eșec poate privi însă o alergie, o doză sau o negație critică.
Studiile viitoare trebuie să raporteze separat eșecurile dintr-un subset critic prestabilit. CIF nu trebuie transformat într-un compozit ponderat după severitate înainte ca ponderarea să fie justificată empiric.
Validare și pași următori
CIF este un framework conceptual, nevalidat empiric sau clinic. Validarea trebuie să testeze dacă preservation specifications pot fi definite reproductibil și evaluate consecvent.
- controlled perturbation testing pentru negație, lateralitate, măsurătoare, doză, schimbare temporală și omisiune;
- exemple de meaning-preserving paraphrases;
- inter-rater reliability între clinicieni;
- comparația cu WER și metricile existente;
- evaluarea mai multor tipuri de transformări și specialități.
Framework-ul trebuie modificat sau respins dacă specificațiile nu pot fi definite consecvent, descompunerea este instabilă, acordul dintre clinicieni este slab, subiectivitatea devine inacceptabilă sau CIF nu oferă informație utilă peste metode mai simple.
Concluzie
Evaluarea unei transformări clinice începe prin definirea informației care trebuie să supraviețuiască. CIF oferă un mod explicit de a formula această obligație și de a calcula proporția cerințelor satisfăcute.
Interpretarea rămâne limitată la fidelity. Corectitudinea sursei, completitudinea, informația nesusținută, consistența, utilitatea, siguranța și calitatea generală necesită evaluări suplimentare.
Referințe
- Blackley SV, Huynh J, Wang L, Korach Z, Zhou L. Speech recognition for clinical documentation from 1990 to 2018: a systematic review. Journal of the American Medical Informatics Association. 26(4):324–338. 2019.DOI: 10.1093/jamia/ocy179Sursa originală ↗
- Hodgson T, Coiera E. Risks and benefits of speech recognition for clinical documentation: a systematic review. Journal of the American Medical Informatics Association. 23(e1):e169–e179. 2016.DOI: 10.1093/jamia/ocv152
- Liu F, Tur G, Hakkani-Tur D, Yu H. Towards spoken clinical-question answering: evaluating and adapting automatic speech-recognition systems for spoken clinical questions. Journal of the American Medical Informatics Association. 18(5):625–630. 2011.DOI: 10.1136/amiajnl-2010-000071
- Yu F, Endo M, Krishnan R, Pan I, Tsai A, Reis EP, et al. Evaluating progress in automatic chest X-ray radiology report generation. Patterns. 4(9):100802. 2023.DOI: 10.1016/j.patter.2023.100802
- Ostmeier S, Xu J, Chen Z, Varma M, Blankemeier L, Bluethgen C, et al. GREEN: Generative Radiology Report Evaluation and Error Notation. Findings of the Association for Computational Linguistics: EMNLP 2024. 374–390. 2024.DOI: 10.18653/v1/2024.findings-emnlp.21
- Fu Z, Tan X, Peng N, Zhao D, Yan R. Style Transfer in Text: Exploration and Evaluation. Proceedings of the AAAI Conference on Artificial Intelligence. 32(1). 2018.DOI: 10.1609/aaai.v32i1.11330
- Raha T, Christophe C, Saadi N, Javed HA, Pimentel MAF, Rajan R, Kanithi P. Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation. arXiv:2601.19350. Preprint. 2026.Sursa originală ↗
- Hussain S, Hussain M, Afzal M, Hussain J, Seung H, Bang J, Lee S. Semantic preservation of standardized healthcare documents in big data. International Journal of Medical Informatics. 129:133–145. 2019.DOI: 10.1016/j.ijmedinf.2019.05.024
Version history
- v1.020 august 2026
Framework task-defined pentru evaluarea conservării informației clinice, publicat ca preprint pe Zenodo.
- v0.110 august 2026
Conceptual exploration: versiunea inițială a explorat un model mai larg care includea CIF, Critical Clinical Error Rate (CCER) și Clinical Correction Burden (CCB). După analiza literaturii și rafinarea conceptuală, CIF v1.0 a fost restrâns la conservarea informației clinice în raport cu cerințele unei transformări definite.
Preprint · Zenodo · Version 1.0 · 2026
DOI: 10.5281/zenodo.22030256