Fondamenti di IA
Che cos’è il controllo delle capacità dell’IA e perché è importante?
Il controllo delle capacità dell’IA è l’insieme di misure tecniche e organizzative che limitano ciò a cui un sistema di IA può accedere, tentare o provocare. Il termine è più utile quando è collegato a un’implementazione concreta: dati, strumenti, autorizzazioni, autonomia, velocità, capacità di calcolo, utenti e ambiente operativo.
Un modello capace all’interno di un sandbox a sola lettura comporta un rischio diverso rispetto allo stesso modello collegato a credenziali di produzione e autorizzato ad agire senza revisione. Il controllo, quindi, appartiene all’intero sistema, non solo all’addestramento del modello o a un prompt di sicurezza.
Punti chiave
- Inventaria le capacità come comportamento del modello più strumenti, dati, autorizzazioni e autonomia.
- Utilizza il principio del minimo privilegio, l’isolamento, i limiti di velocità, credenziali limitate e l’approvazione per azioni con conseguenze.
- Valuta sia le prestazioni previste sia gli abusi, l’elusione, l’escalation e i guasti combinati degli strumenti.
- Aumenta le salvaguardie e le prove di rilascio man mano che le capacità e l’esposizione del deployment aumentano.

La capacità è contestuale
I benchmark rivelano comportamenti limitati in condizioni specifiche. La capacità implementata dipende anche da prompt, scaffolding, recupero, memoria, strumenti, tentativi ripetuti e accesso. Un’applicazione può rendere più significativo un modello modesto pianificando ed eseguendo ripetutamente.
Mappa ogni percorso dall’input all’effetto. Collega questo inventario all’analisi del rischio dell’generative-AI e ai beni reali in gioco, inclusi i record dei clienti, il codice, il denaro, i dispositivi fisici e le comunicazioni.
Prevenire, contenere e rilevare
I controlli preventivi includono i limiti di autorizzazione, gli schemi di strumenti approvati, la convalida dell’input e la conferma esplicita dell’utente. La contenimento comprende sandbox, limiti di uscita di rete, quote di risorse, credenziali a breve durata e ambienti reversibili.
Il rilevamento aggiunge registrazione, avvisi di anomalie, trappole, dati canarino e controlli di policy indipendenti. Nessun livello è perfetto, quindi la difesa in profondità presume che un controllo possa fallire. I principi di Cybersecurity si applicano anche quando l’interfaccia è conversazionale.
Valutazione prima dell’accesso
Testa il modello senza strumenti, poi aggiungi le capacità in modo incrementale. Misura se può scoprire segreti, sfruttare software, persuadere gli operatori, concatenare azioni, riprendersi da guasti o nascondere l’intento sotto vincoli realistici. Convalida i rifiuti senza divulgare ampiamente i dettagli sensibili della valutazione.
Un superamento del benchmark non dimostra la sicurezza in ogni ambiente. Esegui un red‑team del sistema integrato, ripeti i test dopo modifiche al modello, al prompt o agli strumenti, e utilizza un rilascio a tappe con limiti monitorati.
Governance e risposta
Assegna un responsabile, uno scopo approvato, una tolleranza al rischio, criteri di lancio, un processo di gestione delle modifiche e un’autorità di emergenza. Registra quale versione, policy, strumenti e autorizzazioni erano attivi per ogni risultato con conseguenze.
Collega i controlli alla governance dell’responsible-AI. Prepara la revoca delle credenziali, la chiusura degli strumenti, il rollback del modello, la notifica agli utenti, l’indagine e le lezioni apprese prima che si verifichi un incidente grave.
Una tassonomia del controllo delle capacità
I controlli di input limitano chi può inviare compiti, quali modalità e tipi di file sono accettati e quanta contestualizzazione può essere fornita. I controlli del modello includono il fine‑tuning, il comportamento di rifiuto, i limiti di decodifica e la selezione dei checkpoint. I controlli dell’applicazione determinano la memoria, il recupero, la disponibilità degli strumenti e il modo in cui gli output vengono interpretati.
I controlli delle risorse limitano token, tempo, attività concorrenti, capacità di calcolo, storage e utilizzo della rete. I controlli delle azioni vincolano domini, destinatari, importi delle transazioni, esecuzione di codice e dispositivi fisici. I controlli umani definiscono approvazioni, supervisione, escalation e spegnimento di emergenza. I controlli di governance coprono i criteri di rilascio, il monitoraggio, l’audit e la responsabilità.
Questi livelli affrontano diversi modi di guasto. Un filtro di contenuti non può bloccare una chiamata a uno strumento apparentemente valida ma non autorizzata; un sandbox non può impedire un messaggio pubblico dannoso se la comunicazione è consentita; un approvatore umano non può supervisionare migliaia di micro‑azioni opache. I controlli devono corrispondere al percorso dell’effetto.
Contenimento e minima autonomia
Il principio del minimo privilegio concede solo i dati e le azioni necessari per il compito corrente. La minima autonomia aggiunge limiti su durata, ambito, iniziativa e delega. Un assistente che redige una modifica per revisione ha meno autonomia rispetto a uno che la conferma, la distribuisce, la monitora e riprova in modo indipendente.
I sandbox isolano codice e file, ma l’isolamento richiede politiche esplicite di rete, processo, dispositivo e persistenza. Usa ambienti usa‑e‑butta, egress consentiti, file system limitati e segreti separati. Gli output che escono dal sandbox — patch, binari, messaggi o richieste — richiedono comunque una convalida.
Per agenti a lungo termine, limita le iterazioni e richiedi checkpoint. Separa la pianificazione dall’esecuzione e fai sì che ogni strumento riporti un risultato strutturato. Impedisci a un agente di creare nuove credenziali, modificare la propria policy, disabilitare i log o generare repliche illimitate, a meno che un caso d’uso strettamente governato lo richieda.
Valutazione delle capacità e decisioni di rilascio
Costruisci una matrice di valutazione che includa versione del modello, scaffolding, strumenti, autorizzazioni e competenza dell’utente. Testa il completamento autonomo dei compiti, l’assistenza all’abuso, le azioni cyber, la conoscenza sensibile, la persuasione, la replicazione e l’elusione dove pertinente. Includi sia le prestazioni medie sia il risultato più forte tra i tentativi ripetuti.
Proteggi i dettagli pericolosi della valutazione, ma pubblica una metodologia sufficiente e prove aggregate per la responsabilità. Valutatori indipendenti riducono i conflitti di interesse. Le soglie dovrebbero attivare controlli predeterminati, come accesso ridotto, monitoraggio più intenso, rilascio ritardato o revisione aggiuntiva, anziché un dibattito dopo la conoscenza dei risultati.
Il monitoraggio post‑rilascio deve rilevare cambiamenti di capacità causati da fine‑tuning, aggiornamenti dei prompt, nuovi strumenti o contesto più ampio. Mantieni un registro di modelli e deployment, la segnalazione degli incidenti e un processo per ridurre rapidamente l’accesso. Un rollback ripristina una configurazione nota; non elimina i dati già esposti o le azioni già compiute.
Costruire un sistema di controllo delle capacità a più livelli
Inizia con un inventario delle capacità che copra output del modello, strumenti, fonti di dati, esecuzione di codice, accesso alla rete, memoria, identità e azioni a valle. Classifica ciascuna per reversibilità, ambito, sensibilità e potenziale danno. Un modello che redige un’email è diverso da uno che può selezionare i destinatari e inviarla. Concedi la capacità minima necessaria per il compito corrente, per una durata e un ambiente limitati.
L’applicazione dei controlli avviene al di fuori del modello: schemi tipizzati per gli strumenti, servizi di autorizzazione, liste di consentiti, sandbox, quote di risorse, limiti di transazione, prevenzione della perdita di dati e approvazione umana. Considera le istruzioni del modello come input non affidabile e convalida ogni azione rispetto all’identità e alla policy. Separa la pianificazione dall’esecuzione, utilizza l’idempotenza e l’anteprima per operazioni con conseguenze, e assicurati che il modello non possa modificare i controlli o i log che lo governano.
Testa l’iniezione di prompt, gli attacchi di tipo ‘confused deputy’, contenuti malevoli indiretti, l’escalation di privilegi, l’esfiltrazione di dati, loop incontrollati e strumenti compromessi. Monitora le azioni richieste e negate, sequenze insolite, costi e utilizzo delle risorse, e modifiche alle policy. Mantieni un arresto di emergenza che rimuova effettivamente le credenziali o blocchi l’esecuzione, anziché limitarsi a chiedere al modello di fermarsi. Il controllo delle capacità riduce i danni potenzialmente raggiungibili; deve essere combinato con la valutazione del modello, un’infrastruttura sicura, la governance e la risposta agli incidenti.
La garanzia dovrebbe coprire l’intero sistema composito, poiché componenti singolarmente sicuri possono creare una catena non sicura. Verifica che uno strumento di lettura a basso privilegio non possa fornire segreti a uno strumento di messaggistica, che la memoria non possa introdurre istruzioni in sessioni successive e che le approvazioni mostrino l’azione e la destinazione esatte. Rivaluta i confini delle capacità ogni volta che un modello, connettore, fonte di dati o policy cambiano; le autorizzazioni ereditate sono una fonte frequente di espansione non intenzionale.
Checklist di implementazione pratica
Trasforma il concetto in un flusso di lavoro limitato e testabile: mappa l’accesso → test → limitazione → approvazione → monitoraggio → risposta. Assegna un responsabile, documenta i dati e le dipendenze, stabilisci una baseline semplice, definisci criteri di accettazione e di interruzione, testa i guasti rappresentativi e definisci monitoraggio, rollback e revisione prima di ampliare l’ambito. Registra versioni e ipotesi affinché un altro team possa riprodurre il risultato e comprendere le modifiche.
Prima del lancio, esegui una revisione di prontezza documentata con le persone che costruiscono, gestiscono, proteggono e sono interessate dal sistema. Testa casi normali, condizioni limite, guasti di dipendenza e abusi; conserva le prove e i rischi non risolti. Definisci chi può approvare il rilascio, modificare una soglia, sovrascrivere un output o interrompere l’operazione. Rivedi la decisione dopo l’arrivo dei dati reali, poiché un pilota tecnicamente riuscito non garantisce prestazioni affidabili su scala più ampia.
- CAPACITÀ: modello più strumenti e scaffolding.
- ESPOSIZIONE: utenti, risorse e contesto operativo.
- CONTROLLO: prevenire, contenere, rilevare e rispondere.
Domande frequenti
Un prompt di sistema è un controllo delle capacità?
È un livello di istruzioni comportamentali, ma non è un sostituto affidabile per autorizzazioni, sandbox, convalida, strumenti limitati e approvazioni applicate al di fuori del modello.
Ogni sistema di IA dovrebbe utilizzare gli stessi controlli?
No. I controlli dovrebbero scalare in base a capacità, accesso, autonomia, utenti interessati, reversibilità e impatto. Lo stesso modello può richiedere controlli diversi in differenti implementazioni.












