Trasferimento controllato dei dati e revisione degli output
Il Data Review and Transfer Component, o DRTC, è una soluzione sviluppata da AWS per revisionare, approvare, automatizzare e tracciare le richieste di trasferimento di dati sensibili in entrata e in uscita da ambienti sicuri come i Trusted Research Environment. È progettato per aiutare le organizzazioni a controllare il trasferimento di dati, codice, risultati e altri artefatti di ricerca oltre il perimetro del TRE. Questa funzionalità sta diventando sempre più importante con la maturazione dei modelli di trusted research.
Nella pratica, il DRTC trasforma il trasferimento dei dati in un processo governato. I dataset in ingresso possono essere collocati in un'area di staging o quarantena, dove vengono sottoposti a controlli automatici e/o revisioni manuali prima di essere trasferiti nella piattaforma dati. I risultati in uscita seguono un processo analogo, con revisione e approvazione degli output prima della pubblicazione.
L'intero processo è gestito tramite un portale web dal quale gli amministratori possono configurare i flussi di revisione per ogni area di archiviazione. Il DRTC supporta un workflow di approvazione a due fasi con un revisore iniziale e revisori aggiuntivi opzionali. I revisori possono essere singoli utenti o gruppi, ad esempio un comitato di governance dei dati, esperti di dominio o un gruppo indipendente di revisione per garantire la segregazione delle responsabilità.
La piattaforma dati governata
Dietro il confine di trasferimento si trova la piattaforma dati governata. È qui che i dataset sensibili vengono archiviati, curati, catalogati, preparati e resi disponibili ai progetti di ricerca autorizzati.
Questo livello non dovrebbe essere considerato un semplice repository di archiviazione. È una delle aree progettuali più importanti del TRE perché determina quanto l'ambiente di ricerca sarà utilizzabile, riutilizzabile, governabile e scalabile.
La progettazione corretta dipende fortemente dal dominio di ricerca, dalle tipologie di dati, dal contesto normativo, dai metodi analitici e dal modello collaborativo adottato. Una piattaforma genomica, un ambiente di ricerca clinica, un dataset per la ricerca nel settore della difesa, un ambiente R&D industriale o una piattaforma per le scienze sociali non hanno le stesse esigenze.
Per questo motivo, questo livello dovrebbe generalmente partire da una valutazione della piattaforma dati.
La valutazione dovrebbe chiarire:
Assessment Table
| Area di valutazione |
Domande a cui rispondere |
| Fonti dati |
Da dove provengono i dati, chi ne è proprietario e come vengono acquisiti? |
| Sensibilità dei dati |
Quali classificazioni si applicano e quali restrizioni ne derivano? |
| Struttura dei dati |
I dati sono tabellari, immagini, dati genomici, dati provenienti da sensori, dati non strutturati o multimodali? |
| Preparazione dei dati |
Quali attività di validazione, trasformazione, pseudonimizzazione, de-identificazione o data curation sono necessarie? |
| Modello di accesso |
Quali progetti, ruoli e utenti devono accedere a quali dataset?
|
| Metadata e discovery |
Come potranno i ricercatori trovare i dati approvati senza esporre eccessivamente gli asset sensibili?
|
| Lineage e riproducibilità |
Come verranno tracciati dataset, trasformazioni, query e output?
|
| Ciclo di vita e conservazione |
Per quanto tempo i dati devono essere conservati, archiviati o eliminati?
|
| Esigenze analitiche |
I ricercatori utilizzano SQL, notebook, HPC, machine learning, AI generativa, strumenti statistici o applicazioni specialistiche? |
Sulla base di questa valutazione, l'architettura può essere adattata al dominio di ricerca, al modello di governance e alle esigenze analitiche.
In alcuni casi, ad esempio, Amazon SageMaker Unified Studio può fornire un ambiente governato per dati e AI, integrando Amazon EMR, AWS Glue, Amazon Athena, Amazon Redshift, Amazon Bedrock e SageMaker AI.
I ricercatori possono lavorare con notebook, SQL, Python, workflow di machine learning e query in linguaggio naturale, collegandosi ai dati archiviati in Amazon S3, AWS Glue Data Catalog, Amazon Athena e Amazon Redshift. Amazon S3 fornisce le fondamenta di archiviazione, mentre architetture lakehouse, catalogazione dei dati, controllo degli accessi, ownership dei data product e capacità di elaborazione scalabili vengono aggiunte secondo necessità.
Ambienti di ricerca sicuri con RES
I ricercatori interagiscono con il TRE attraverso il Virtual Research Environment. È l'ambiente in cui gli utenti autorizzati accedono a capacità di calcolo, software e dati di progetto all'interno di confini definiti. L'obiettivo è fornire un ambiente di lavoro pratico mantenendo i dati sensibili all'interno dell'architettura controllata del TRE.
Research and Engineering Studio on AWS, o RES, può supportare questo livello. RES è una soluzione open source supportata da AWS che fornisce un portale web attraverso cui scienziati e ingegneri possono eseguire workload di calcolo su AWS. Gli utenti possono avviare desktop virtuali Windows o Linux sicuri, utilizzare le credenziali aziendali esistenti e lavorare individualmente o in modalità collaborativa.
Gli amministratori possono definire spazi di progetto, assegnare stack software, collegare file system condivisi, monitorare l'utilizzo e impostare budget di progetto per controllare i consumi.
RES include inoltre ulteriori controlli particolarmente utili negli scenari di trusted research, come l'integrazione delle identità tramite SAML 2.0 o OIDC, profili di condivisione dei desktop, accessi limitati al file browser, accessi SSH controllati, profili personalizzati di autorizzazione e modelli di deployment privati basati su VPC e VPC Endpoint.
Questi controlli contribuiscono a limitare il trasferimento dei dati e a ridurre il rischio che informazioni sensibili escano dal perimetro di ricerca.