NOVITÀ PEER-REVIEWED — SICUREZZA DELL’IA CLINICA
Il 23 settembre 2026 il Journal of Medical Systems ha pubblicato uno studio che propone di valutare i modelli linguistici non soltanto mediante l’accuratezza media, ma contando le raccomandazioni potenzialmente pericolose e verificando se la risposta rimane stabile quando lo stesso caso viene ripetuto.
Fonte primaria: Liu F, Liu Z, Fei X, et al. Development of a Framework for Evaluating Large Language Model Safety and Reliability: a Proof-of-Concept Evaluation. Journal of Medical Systems. 2026;50:136. Leggi lo studio originale.
CHE COSA È EMERSO
Sono stati esaminati sei modelli su 54 casi difficili di emergenza, non pubblicati online. Ogni caso è stato ripetuto tre volte, generando 972 risposte valutate da medici.
- Le raccomandazioni classificate come potenzialmente catastrofiche variavano dall’1,2% al 7,4% secondo il modello.
- I due modelli risultati più sicuri insieme presentavano l’1,5% di risposte pericolose, contro il 6% degli altri quattro.
- In 31 delle 34 combinazioni caso-modello associate a un errore grave, il problema era intermittente: ripetendo lo stesso caso, il modello poteva fornire una risposta clinicamente diversa e pericolosa.
- La vulnerabilità all’ancoraggio diagnostico variava dal 6,9% al 26,4%; il mancato riconoscimento delle malattie rare dal 6,1% al 37,9%.
PERCHÉ CONTA IN PRONTO SOCCORSO E NEL 118
Una buona prestazione media non garantisce affidabilità sul singolo paziente. Il problema riguarda soprattutto assistenti usati per diagnosi differenziale, terapia, dimissione, triage o compilazione automatica: riformulare o ripetere lo stesso caso può produrre una raccomandazione differente.
Per valutare un sistema non bastano percentuali generiche o risultati su quiz medici. Occorre verificare:
- frequenza degli errori potenzialmente dannosi;
- stabilità su interrogazioni ripetute;
- prestazioni nei casi complessi, rari e ad alto rischio;
- test nella lingua e nel contesto in cui verrà realmente utilizzato;
- registrazione degli output e procedure per intercettare le raccomandazioni errate.
SOLIDITÀ E LIMITI DELL’EVIDENZA
È uno studio peer-reviewed, ma rimane una prova di concetto monocentrica: soltanto 54 casi, in lingua cinese, senza impiego prospettico sui pazienti né misurazione degli esiti clinici. I modelli furono interrogati tra agosto e dicembre 2025: i risultati descrivono quelle specifiche versioni e non possono essere trasferiti automaticamente alle versioni attuali o a prodotti clinici dedicati.
DISPONIBILITÀ IN ITALIA E UNIONE EUROPEA
Lo studio propone un metodo di valutazione, non un dispositivo disponibile sul mercato: non possiede quindi marcatura CE né costituisce autorizzazione all’impiego clinico. Un assistente destinato a influenzare diagnosi o terapia deve essere valutato per destinazione d’uso, classificazione secondo il Regolamento sui dispositivi medici, AI Act, protezione dei dati e supervisione umana.
Non inserire dati sanitari identificabili in chatbot consumer. L’output deve restare verificabile, correggibile e subordinato al giudizio clinico.
CHE COSA APPROFONDIRE PRIMA DELL’ADOZIONE
- test indipendenti sui casi reali dell’azienda sanitaria;
- versione esatta del modello e comportamento dopo gli aggiornamenti;
- audit degli errori gravi e stabilità delle risposte;
- possibilità di disattivare qualsiasi azione automatica su prescrizioni, esami o dimissioni;
- valutazione GDPR, tracciabilità e supervisione umana obbligatoria.
Nota clinica: contenuto informativo ed educativo. L’intelligenza artificiale non sostituisce la valutazione del paziente, il giudizio professionale, i protocolli locali o le linee guida ufficiali aggiornate.
