7 min to read

Ricerca affidabile su larga scala con AWS e SoftwareOne

Maarten Bruntink
Maarten BruntinkGlobal AWS Solutions Director
A group of people sitting around a table

Nel primo articolo del blog, appartenente a questa serie, abbiamo analizzato i rischi concreti derivanti da una protezione inadeguata dei dati di ricerca. Dai flussi di dati non controllati e dalle esportazioni non governate alla collaborazione eccessivamente permissiva e alla frammentazione delle attività di audit, il messaggio era chiaro: le organizzazioni che svolgono attività di ricerca hanno bisogno di un approccio migliore per proteggere i dati sensibili senza rallentare l'innovazione.

È qui che entrano in gioco i Trusted Research Environment (TRE).

Un TRE fornisce un ambiente sicuro e governato in cui i ricercatori autorizzati possono analizzare dati sensibili senza che tali dati vengano copiati, scaricati o distribuiti in posizioni non controllate. Invece di portare i dati ai ricercatori, questo modello porta i ricercatori ai dati. Gli accessi sono controllati, le attività vengono registrate, gli spostamenti dei dati sono limitati e solo gli output approvati possono essere esportati dopo un processo di revisione.

Questo articolo esamina come questo modello possa essere implementato su AWS. Spiega in che modo una solida base cloud supporti la ricerca affidabile, come le piattaforme dati governate e gli ambienti di ricerca interagiscano tra loro e come il trasferimento controllato dei dati e la revisione degli output consentano alle istituzioni di utilizzare dati sensibili mantenendo fiducia, conformità e responsabilità.

Le fondamenta: Secure Research Environment

Prima che un Trusted Research Environment possa operare in modo efficace, l'ambiente cloud sottostante deve essere sicuro, governato e ripetibile. Questo è il ruolo del Secure Research Environment, o SRE.

Un SRE funge da landing zone per i workload di ricerca che trattano dati sensibili. Fornisce le fondamenta AWS su cui costruire le funzionalità di trusted research, offrendo alle istituzioni una base coerente in termini di sicurezza, conformità e controllo operativo.

In pratica, questo significa disporre di un'architettura AWS multi-account con gestione centralizzata di identità e accessi, provisioning controllato degli account, segmentazione della rete, crittografia, logging centralizzato, monitoraggio della sicurezza, backup, policy di controllo e gestione automatizzata dell'infrastruttura. Invece di creare un ambiente isolato da zero per ogni progetto di ricerca, i workload vengono inseriti in una struttura governata in cui i controlli fondamentali vengono ereditati automaticamente.

L'SRE può essere implementato utilizzando i tradizionali modelli AWS Landing Zone, che integrano funzionalità quali:

Capacità Finalità
Struttura multi-account Separa workload, ambienti, servizi condivisi, logging, sicurezza e confini operativi.
Provisioning controllato degli account Consente di creare nuovi account o ambienti di ricerca attraverso modelli ripetibili, riducendo le configurazioni manuali e le deviazioni dagli standard previsti.
Gestione centralizzata di identità e accessi Abilita accesso federato, MFA, controllo degli accessi basato sui ruoli, gestione degli accessi privilegiati e governance coerente degli utenti.
Segmentazione della rete Controlla la connettività tra workload di ricerca, servizi condivisi, ambienti dati, infrastrutture on-premises ed endpoint esterni.
Connettività privata Utilizza percorsi di rete privati e VPC Endpoint dove appropriato per ridurre l'esposizione e limitare l'accesso ai servizi.
Logging e monitoraggio centralizzati Forniscono audit trail, visibilità operativa, raccolta degli eventi di sicurezza e una base coerente di evidenze.
Crittografia e gestione delle chiavi Proteggono i dati sia a riposo sia in transito, compreso l'utilizzo di chiavi gestite dal cliente quando richiesto.
Guardrail e policy Applicano controlli preventivi e investigativi a livello di account e unità organizzative.
Backup e ripristino Definiscono strategie di backup, conservazione, ripristino e resilienza per workload regolamentati.
Continuous assurance Supporta il monitoraggio continuo, i controlli di configurazione, la gestione della postura di sicurezza e la raccolta delle evidenze.

Quando queste funzionalità vengono combinate, l'SRE fornisce una solida base tecnica per workload di ricerca che devono allinearsi a framework di conformità quali ISO 27001, NIST 800-171, HIPAA, CMMC, GDPR e altri requisiti specifici di settore o geografici.

Dalle fondamenta sicure alla ricerca affidabile


Una volta predisposte le fondamenta, la sfida successiva consiste nel consentire ai ricercatori di lavorare con dati sensibili senza distribuirli in ambienti non governati.

La scala e la complessità della ricerca collaborativa moderna rendono insostenibile il modello tradizionale basato sul trasferimento dei dati sensibili. I Trusted Research Environment offrono un'alternativa sicura, portando i ricercatori ai dati e consentendo loro di svolgere le analisi all'interno di una piattaforma governata, dalla quale possono essere esportati soltanto output approvati.

Come spiegato nel primo articolo della serie, il TRE rende possibile questo approccio attraverso tre componenti: un ambiente dati governato, controlli sul trasferimento dei dati e un Virtual Research Environment controllato.

Caso di studio 

SoftwareOne ha supportato un think tank sanitario no-profit del Regno Unito nella realizzazione di un Trusted Research Environment (TRE) sicuro su AWS, consentendo il passaggio da infrastrutture on-premises limitate a una piattaforma cloud per i dati di ricerca conforme ai rigorosi requisiti di governance dell'NHS. Realizzato utilizzando AWS Landing Zone e le competenze AWS di SoftwareOne, il TRE consente ai ricercatori di analizzare in sicurezza dati anonimizzati dei pazienti NHS, combinare fonti dati differenti, migliorare la qualità dei dati e generare insight su larga scala, preservando al tempo stesso privacy, conformità e controllo degli accessi.

Trasferimento controllato dei dati e revisione degli output

Il Data Review and Transfer Component, o DRTC, è una soluzione sviluppata da AWS per revisionare, approvare, automatizzare e tracciare le richieste di trasferimento di dati sensibili in entrata e in uscita da ambienti sicuri come i Trusted Research Environment. È progettato per aiutare le organizzazioni a controllare il trasferimento di dati, codice, risultati e altri artefatti di ricerca oltre il perimetro del TRE. Questa funzionalità sta diventando sempre più importante con la maturazione dei modelli di trusted research.

Nella pratica, il DRTC trasforma il trasferimento dei dati in un processo governato. I dataset in ingresso possono essere collocati in un'area di staging o quarantena, dove vengono sottoposti a controlli automatici e/o revisioni manuali prima di essere trasferiti nella piattaforma dati. I risultati in uscita seguono un processo analogo, con revisione e approvazione degli output prima della pubblicazione.

L'intero processo è gestito tramite un portale web dal quale gli amministratori possono configurare i flussi di revisione per ogni area di archiviazione. Il DRTC supporta un workflow di approvazione a due fasi con un revisore iniziale e revisori aggiuntivi opzionali. I revisori possono essere singoli utenti o gruppi, ad esempio un comitato di governance dei dati, esperti di dominio o un gruppo indipendente di revisione per garantire la segregazione delle responsabilità.

La piattaforma dati governata

Dietro il confine di trasferimento si trova la piattaforma dati governata. È qui che i dataset sensibili vengono archiviati, curati, catalogati, preparati e resi disponibili ai progetti di ricerca autorizzati.

Questo livello non dovrebbe essere considerato un semplice repository di archiviazione. È una delle aree progettuali più importanti del TRE perché determina quanto l'ambiente di ricerca sarà utilizzabile, riutilizzabile, governabile e scalabile.

La progettazione corretta dipende fortemente dal dominio di ricerca, dalle tipologie di dati, dal contesto normativo, dai metodi analitici e dal modello collaborativo adottato. Una piattaforma genomica, un ambiente di ricerca clinica, un dataset per la ricerca nel settore della difesa, un ambiente R&D industriale o una piattaforma per le scienze sociali non hanno le stesse esigenze.

Per questo motivo, questo livello dovrebbe generalmente partire da una valutazione della piattaforma dati.

La valutazione dovrebbe chiarire:

Assessment Table
Area di valutazione Domande a cui rispondere
Fonti dati Da dove provengono i dati, chi ne è proprietario e come vengono acquisiti?
Sensibilità dei dati Quali classificazioni si applicano e quali restrizioni ne derivano? 
Struttura dei dati I dati sono tabellari, immagini, dati genomici, dati provenienti da sensori, dati non strutturati o multimodali?
Preparazione dei dati Quali attività di validazione, trasformazione, pseudonimizzazione, de-identificazione o data curation sono necessarie?
Modello di accesso Quali progetti, ruoli e utenti devono accedere a quali dataset?
Metadata e discovery Come potranno i ricercatori trovare i dati approvati senza esporre eccessivamente gli asset sensibili?
Lineage e riproducibilità Come verranno tracciati dataset, trasformazioni, query e output?
Ciclo di vita e conservazione Per quanto tempo i dati devono essere conservati, archiviati o eliminati?
Esigenze analitiche I ricercatori utilizzano SQL, notebook, HPC, machine learning, AI generativa, strumenti statistici o applicazioni specialistiche?

Sulla base di questa valutazione, l'architettura può essere adattata al dominio di ricerca, al modello di governance e alle esigenze analitiche.

In alcuni casi, ad esempio, Amazon SageMaker Unified Studio può fornire un ambiente governato per dati e AI, integrando Amazon EMR, AWS Glue, Amazon Athena, Amazon Redshift, Amazon Bedrock e SageMaker AI.

I ricercatori possono lavorare con notebook, SQL, Python, workflow di machine learning e query in linguaggio naturale, collegandosi ai dati archiviati in Amazon S3, AWS Glue Data Catalog, Amazon Athena e Amazon Redshift. Amazon S3 fornisce le fondamenta di archiviazione, mentre architetture lakehouse, catalogazione dei dati, controllo degli accessi, ownership dei data product e capacità di elaborazione scalabili vengono aggiunte secondo necessità.

Ambienti di ricerca sicuri con RES

I ricercatori interagiscono con il TRE attraverso il Virtual Research Environment. È l'ambiente in cui gli utenti autorizzati accedono a capacità di calcolo, software e dati di progetto all'interno di confini definiti. L'obiettivo è fornire un ambiente di lavoro pratico mantenendo i dati sensibili all'interno dell'architettura controllata del TRE.

Research and Engineering Studio on AWS, o RES, può supportare questo livello. RES è una soluzione open source supportata da AWS che fornisce un portale web attraverso cui scienziati e ingegneri possono eseguire workload di calcolo su AWS. Gli utenti possono avviare desktop virtuali Windows o Linux sicuri, utilizzare le credenziali aziendali esistenti e lavorare individualmente o in modalità collaborativa.

Gli amministratori possono definire spazi di progetto, assegnare stack software, collegare file system condivisi, monitorare l'utilizzo e impostare budget di progetto per controllare i consumi.

RES include inoltre ulteriori controlli particolarmente utili negli scenari di trusted research, come l'integrazione delle identità tramite SAML 2.0 o OIDC, profili di condivisione dei desktop, accessi limitati al file browser, accessi SSH controllati, profili personalizzati di autorizzazione e modelli di deployment privati basati su VPC e VPC Endpoint.

Questi controlli contribuiscono a limitare il trasferimento dei dati e a ridurre il rischio che informazioni sensibili escano dal perimetro di ricerca.

Conclusioni: un percorso consolidato verso protezione e progresso


Le organizzazioni che desiderano realizzare un Trusted Research Environment su AWS non devono partire da zero. AWS mette a disposizione un insieme integrato di infrastrutture cloud scalabili, servizi maturi di sicurezza e governance, soluzioni specifiche per la ricerca e acceleratori pensati per supportare l'intero ciclo di vita della ricerca in ambienti affidabili.

Combinando servizi e acceleratori come SRE, DRTC, SageMaker Unified Studio e RES, le organizzazioni possono partire da una base solida. Possono costruire su modelli già collaudati, adattare l'architettura alle proprie esigenze in termini di dati, conformità e ricerca e concentrare gli sforzi di implementazione dove contano davvero: governance, integrazione, esperienza dei ricercatori e maturità operativa.

SoftwareOne aiuta le organizzazioni a trasformare questo vantaggio iniziale in una soluzione concreta. Collaboriamo a stretto contatto con AWS per progettare, implementare e rendere operative piattaforme di ricerca sicure, allineate agli obiettivi istituzionali, ai requisiti di conformità e alle esigenze dei ricercatori. SoftwareOne è inoltre un fornitore ufficiale, selezionato più volte nell'ambito del programma OCRE, che offre agli enti europei della ricerca e dell'istruzione un accesso affidabile, semplificato e accelerato ai servizi cloud.

L'adozione efficace dei Trusted Research Environment consente alle istituzioni di dotarsi di un modello che favorisce al tempo stesso protezione e progresso. I dati sensibili rimangono governati e protetti, i ricercatori possono accedere agli ambienti e agli strumenti di cui hanno bisogno e le organizzazioni possono dimostrare che i dati di ricerca vengono utilizzati in modo responsabile.

Questa è la nuova base di partenza per l'IT della ricerca moderna: una piattaforma in cui la fiducia è progettata fin dall'origine, consentendo ai ricercatori di lavorare più velocemente, collaborare in sicurezza e utilizzare dati sensibili con la massima affidabilità.
A 3d model of a white object on a white background.

Trusted Research Environments: Get the essential guide

Learn more about how to improve reseach outcomes and data protection. Our new eBook includes guidence on accelerated design and implementation, as well as real world case studies.

Trusted Research Environments: Get the essential guide

Learn more about how to improve reseach outcomes and data protection. Our new eBook includes guidence on accelerated design and implementation, as well as real world case studies.

Autore

Maarten Bruntink

Maarten Bruntink
Global AWS Solutions Director