Salta al contenuto
22 Settembre 2026

Il nuovo modello a quattro livelli per testare l’AI umanitaria

Scopri il percorso in quattro tappe che trasforma le promesse AI in risultati concreti per le missioni umanitarie.

Il nuovo modello a quattro livelli per testare l'AI umanitaria

Negli ultimi anni le organizzazioni umanitarie hanno investito risorse ingenti in soluzioni basate sull’intelligenza artificiale convinte che tali strumenti potessero accelerare l’assistenza ai bisognosi. Tuttavia, molte iniziative terminano in fallimento perché la valutazione avviene in maniera invertita: si passa subito a misurare l’impatto finale senza aver provato che l’algoritmo funzioni correttamente.

Progetti come i modelli di previsione degli sfollamenti del Danish Refugee Council, il Project Jetson dell’UNHCR in Somalia o il AI Sandbox del WFP dimostrano il potenziale tecnico dell’AI. Il punto debole resta la mancanza di un percorso strutturato di verifica, che porta a sperimentazioni costose e a perdita di fiducia da parte delle comunità.

Il problema delle valutazioni premature nell’AI umanitaria

Quando le agenzie chiedono subito “questo chatbot riduce la mortalità infantile?” senza prima accertarsi che le risposte siano medicamente corrette si crea una situazione di malpractice professionale. La fretta di avviare trial randomizzati su sistemi non ancora testati a livello tecnico è la causa principale del fallimento di numerosi piloti.

Conseguenze di una valutazione errata

Un algoritmo non validato può produrre consigli pericolosi, generare discriminazioni o semplicemente essere ignorato dagli utenti. Oltre allo spreco di denaro, si rischia di erodere la fiducia delle popolazioni vulnerabili e di ritardare l’adozione di tecnologie efficaci in futuro.

Il quadro a quattro livelli proposto dal Center for Global Development

Per superare queste criticità, è stato ideato un modello sequenziale suddiviso in quattro fasi, ciascuna costruita su evidenze solide. Solo completando ogni step si può procedere al successivo, riducendo così i rischi e ottimizzando le risorse.

Livello 1 – Valutazione del modello: verifica della correttezza

Prima di qualsiasi distribuzione, è indispensabile confrontare le uscite dell’AI con un dataset di riferimento compilato da esperti. Per i chatbot medici destinati ai rifugiati, ad esempio, i professionisti sanitari forniscono le risposte ideali a quesiti frequenti; l’algoritmo viene poi misurato in termini di accuratezza, empatia e adeguatezza. Grazie alla rapidità di modifiche tipica dell’AI, si possono effettuare più cicli di test finché i risultati non soddisfano gli standard richiesti.

Livello 2 – Valutazione del prodotto: adozione reale

Un sistema perfetto dal punto di vista tecnico è inutile se nessuno lo usa. In questa fase si analizzano metriche di engagement – tempo medio di interazione, frequenza di ritorno, differenze tra gruppi demografici – mediante piattaforme come Experiments Engine di IDinsight o Evidential di Agency Fund. I risultati rivelano ostacoli pratici, come preferenze linguistiche o norme culturali, che altrimenti rimarrebbero invisibili.

Livello 3 – Valutazione dell’utente: cambiamento di comportamento

Una volta confermata l’adozione, è necessario capire se l’interazione produce cambiamenti cognitivi o comportamentali. Nei programmi di educazione sanitaria, ad esempio, si somministrano sondaggi e interviste per verificare l’acquisizione di conoscenze, la fiducia nelle decisioni e l’adozione di pratiche preventive. Questi indicatori intermedi sono più rapidi ed economici da misurare rispetto a esiti sanitari a lungo termine, ma indicano già la direzione dell’impatto finale.

Livello 4 – Valutazione d’impatto indipendente: risultati concreti

L’ultimo step prevede studi randomizzati o quasi-randomizzati condotti da ricercatori indipendenti. Solo allora si può affermare se l’AI migliora risultati come la riduzione della mortalità infantile, l’efficienza della distribuzione di aiuti o il rendimento scolastico. Il caso dello stato di Espírito Santo, che ha testato la piattaforma Letrus con il supporto di J-PAL, dimostra come l’analisi a quattro livelli abbia portato a un’espansione basata su evidenze concrete.

Benefici tangibili del metodo sequenziale

Seguire questa progressione evita gli errori più costosi: senza il Livello 1 si rischia di distribuire algoritmi faziosi; senza il Livello 2 i prodotti rimangono inutilizzati; senza il Livello 3 le soluzioni non generano il cambiamento sperato.

Autore

Susanna Riva

Susanna Riva osserva Bologna dalla finestra dell’Archivio di Stato dove una volta ha passato una settimana a consultare faldoni sulle cooperative cittadine: quel documento segnò la scelta editoriale di approfondire responsabilità istituzionali. Tiene linea critica nella redazione, amante del caffè lungo e del taccuino sempre pieno.