Un modello più capace nel cyber richiede controlli più solidi nell'ambiente in cui viene testato. Il 18 agosto OpenAI ha riferito che prove preliminari suggerivano che un modello in sviluppo potesse raggiungere la soglia di capacità cyber critica prevista dal suo framework. Ha sospeso parte dell'addestramento avanzato mentre rafforzava isolamento e monitoraggio. La lezione pratica è valutare le capacità insieme agli strumenti, alle credenziali e alle reti che il modello può raggiungere.
OpenAI ha citato anche l'incidente di luglio che aveva coinvolto Hugging Face. La dichiarazione di agosto non conteneva ancora una relazione tecnica completa sull'incidente, né stabiliva che il nuovo modello avesse già superato la soglia critica. Descriveva una pausa di due settimane nell'addestramento tramite apprendimento per rinforzo dei modelli più recenti destinati alla distribuzione. La più grande esecuzione pianificata restava sospesa, mentre proseguivano valutazioni su scala minore.
Tre livelli di protezione
OpenAI ha indicato monitoraggio, allineamento e misure di sicurezza come protezioni complementari. Il monitoraggio cerca azioni preoccupanti e consente un intervento. L'allineamento punta a ridurre la probabilità di azioni dannose o non autorizzate. I controlli di sicurezza limitano i sistemi che quelle azioni possono raggiungere. Nessuno dei tre rende superflui gli altri.
Per le attività di ricerca capaci di eseguire codice o raggiungere Internet, OpenAI ha detto di rafforzare l'isolamento dei carichi di lavoro e della rete, ridurre i privilegi permanenti ed estendere i registri di sicurezza. Ha descritto anche un sistema che segnala possibili violazioni dei confini ai team di sicurezza, ricerca e valutazione. Sono misure comunicate da OpenAI per i propri ambienti di ricerca, non la prova che ogni agent commerciale richieda la stessa configurazione.
Una verifica prima di aumentare l'autonomia
- Step 01Collegate capacità e accessi. Un modello può pianificare o scrivere codice, ma per agire gli servono strumenti e permessi. Elencate entrambi prima della distribuzione.
- Step 02Limitate l'impatto possibile. Restringete le credenziali, separate le attività più rischiose e consentite solo le connessioni in uscita necessarie.
- Step 03Rendete possibile l'intervento. Registrate chiamate ed esiti, segnalate le azioni inattese e date a un operatore un comando di arresto affidabile.
- Step 04Ripetete la verifica dopo ogni cambiamento. Un nuovo modello, strumento, permesso o collegamento dati può modificare il rischio anche se il compito sembra identico.
HikmaAI può valutare i percorsi agent supportati, proteggere le interazioni selezionate durante l'esecuzione e conservare esiti verificabili. La decisione più ampia spetta a chi gestisce il sistema: stabilite quali azioni l'agent può compiere, poi verificate che i controlli continuino a funzionare mentre le sue capacità evolvono.


