IA IN EMERGENZA: GLI LLM POSSONO PRODURRE ERRORI GRAVI E IMPREVEDIBILI

NOVITÀ PEER-REVIEWED — SICUREZZA DELL’IA CLINICA

Il 23 settembre 2026 il Journal of Medical Systems ha pubblicato uno studio che propone di valutare i modelli linguistici non soltanto mediante l’accuratezza media, ma contando le raccomandazioni potenzialmente pericolose e verificando se la risposta rimane stabile quando lo stesso caso viene ripetuto.

Fonte primaria: Liu F, Liu Z, Fei X, et al. Development of a Framework for Evaluating Large Language Model Safety and Reliability: a Proof-of-Concept Evaluation. Journal of Medical Systems. 2026;50:136. Leggi lo studio originale.

CHE COSA È EMERSO

Sono stati esaminati sei modelli su 54 casi difficili di emergenza, non pubblicati online. Ogni caso è stato ripetuto tre volte, generando 972 risposte valutate da medici.

  • Le raccomandazioni classificate come potenzialmente catastrofiche variavano dall’1,2% al 7,4% secondo il modello.
  • I due modelli risultati più sicuri insieme presentavano l’1,5% di risposte pericolose, contro il 6% degli altri quattro.
  • In 31 delle 34 combinazioni caso-modello associate a un errore grave, il problema era intermittente: ripetendo lo stesso caso, il modello poteva fornire una risposta clinicamente diversa e pericolosa.
  • La vulnerabilità all’ancoraggio diagnostico variava dal 6,9% al 26,4%; il mancato riconoscimento delle malattie rare dal 6,1% al 37,9%.

PERCHÉ CONTA IN PRONTO SOCCORSO E NEL 118

Una buona prestazione media non garantisce affidabilità sul singolo paziente. Il problema riguarda soprattutto assistenti usati per diagnosi differenziale, terapia, dimissione, triage o compilazione automatica: riformulare o ripetere lo stesso caso può produrre una raccomandazione differente.

Per valutare un sistema non bastano percentuali generiche o risultati su quiz medici. Occorre verificare:

  • frequenza degli errori potenzialmente dannosi;
  • stabilità su interrogazioni ripetute;
  • prestazioni nei casi complessi, rari e ad alto rischio;
  • test nella lingua e nel contesto in cui verrà realmente utilizzato;
  • registrazione degli output e procedure per intercettare le raccomandazioni errate.

SOLIDITÀ E LIMITI DELL’EVIDENZA

È uno studio peer-reviewed, ma rimane una prova di concetto monocentrica: soltanto 54 casi, in lingua cinese, senza impiego prospettico sui pazienti né misurazione degli esiti clinici. I modelli furono interrogati tra agosto e dicembre 2025: i risultati descrivono quelle specifiche versioni e non possono essere trasferiti automaticamente alle versioni attuali o a prodotti clinici dedicati.

DISPONIBILITÀ IN ITALIA E UNIONE EUROPEA

Lo studio propone un metodo di valutazione, non un dispositivo disponibile sul mercato: non possiede quindi marcatura CE né costituisce autorizzazione all’impiego clinico. Un assistente destinato a influenzare diagnosi o terapia deve essere valutato per destinazione d’uso, classificazione secondo il Regolamento sui dispositivi medici, AI Act, protezione dei dati e supervisione umana.

Non inserire dati sanitari identificabili in chatbot consumer. L’output deve restare verificabile, correggibile e subordinato al giudizio clinico.

CHE COSA APPROFONDIRE PRIMA DELL’ADOZIONE

  • test indipendenti sui casi reali dell’azienda sanitaria;
  • versione esatta del modello e comportamento dopo gli aggiornamenti;
  • audit degli errori gravi e stabilità delle risposte;
  • possibilità di disattivare qualsiasi azione automatica su prescrizioni, esami o dimissioni;
  • valutazione GDPR, tracciabilità e supervisione umana obbligatoria.

Nota clinica: contenuto informativo ed educativo. L’intelligenza artificiale non sostituisce la valutazione del paziente, il giudizio professionale, i protocolli locali o le linee guida ufficiali aggiornate.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *