La vita segreta degli agenti di intelligenza artificiale: comprendere come l'evoluzione del comportamento dell'intelligenza artificiale influisce sul rischio aziendale

Seconda parte di una serie su come ripensare l'allineamento e la sicurezza dell'intelligenza artificiale nell'era della pianificazione approfondita.

Le capacità e l'autonomia dell'intelligenza artificiale (IA) stanno aumentando a un ritmo accelerato nell'ambito dell'IA agentica , esacerbando il problema dell'allineamento dell'IA. Questi rapidi progressi richiedono nuovi metodi per garantire che il comportamento di un agente IA sia in linea con le intenzioni dei suoi creatori umani e con le norme sociali. Tuttavia, sviluppatori e data scientist devono prima comprendere la complessità del comportamento degli agenti IA prima di poter guidare e monitorare efficacemente il sistema. L'IA agentica non è il Large Language Model (LLM) di una volta: i primi LLM avevano una funzione di input/output fissa e una tantum. L'introduzione dell'inferenza e del calcolo in fase di test (TTC) ha aggiunto la dimensione temporale, portando all'evoluzione degli attuali sistemi agentici consapevoli delle condizioni, capaci di pianificazione e pensiero strategico.

La sicurezza dell'intelligenza artificiale si sta evolvendo: non più solo un rilevamento di comportamenti palesi, come fornire istruzioni per costruire una bomba o mostrare pregiudizi indesiderati, ma anche una comprensione di come questi complessi sistemi di agenti possano ora pianificare ed eseguire strategie segrete a lungo termine. Un agente AI orientato agli obiettivi raccoglierà risorse ed eseguirà passaggi logici per raggiungere i suoi obiettivi, a volte in modo inquietante, contraddicendo le intenzioni degli sviluppatori. Si tratta di un punto di svolta per le sfide che l'intelligenza artificiale responsabile deve affrontare. Inoltre, per alcuni sistemi di intelligenza artificiale (IA) il comportamento del primo giorno non sarà lo stesso del centesimo giorno, poiché l'IA continua a evolversi dopo l'implementazione iniziale attraverso l'esperienza nel mondo reale. Questo nuovo livello di complessità richiede nuovi approcci alla sicurezza e all'allineamento, tra cui una guida avanzata, un monitoraggio e una maggiore interpretazione.

Nel primo post di questa serie sull'allineamento intrinseco dell'IA, " L'urgente necessità di tecniche di allineamento intrinseco dell'IA per agenti responsabili ", abbiamo condotto un'indagine approfondita sulla capacità in evoluzione degli agenti IA di eseguire una pianificazione profonda , ovvero la pianificazione e l'attuazione deliberata di azioni occulte e comunicazioni ingannevoli per raggiungere obiettivi a lungo termine. Questo comportamento richiede una nuova distinzione tra monitoraggio dell'allineamento esterno e intrinseco, dove il monitoraggio intrinseco si riferisce a punti di controllo interni e meccanismi di interpretazione che non possono essere manipolati intenzionalmente dall'agente IA.

In questo blog e nei successivi della serie, esamineremo tre aspetti chiave dell'allineamento e del monitoraggio del core:

  • Comprendere i driver e il comportamento interno dell'intelligenza artificiale: In questo secondo articolo del blog ci concentreremo sulle complesse forze e sui meccanismi interni che guidano il comportamento di un agente di intelligenza artificiale razionale. Ciò è necessario come base per comprendere metodi avanzati di routing e monitoraggio.
  • Guida per sviluppatori e utenti: Definito anche "orientamento", il prossimo blog si concentrerà su come orientare in modo aggressivo l'intelligenza artificiale verso gli obiettivi desiderati, in modo che operi entro i parametri desiderati.
  • Monitora le opzioni e le azioni dell'IA: Un altro argomento che verrà trattato in un prossimo blog sarà la garanzia che le scelte e i risultati dell'intelligenza artificiale siano sicuri e coerenti con le intenzioni dello sviluppatore/utente.

 

L'impatto della compatibilità dell'IA sulle aziende

Oggi, molte aziende che implementano soluzioni basate su Large Language Models (LLM) hanno segnalato preoccupazioni riguardo alle "allucinazioni" dei modelli, considerandole un ostacolo a una rapida e diffusa implementazione. Al contrario, l'incompatibilità degli agenti di IA con qualsiasi livello di autonomia rappresenterebbe un rischio ben maggiore per le imprese. L'implementazione di agenti autonomi nei processi aziendali ha un enorme potenziale e probabilmente avverrà su larga scala una volta che la tecnologia di IA basata su agenti sarà matura. Tuttavia, guidare il comportamento e le scelte dell'IA deve includere un adeguato allineamento con i principi e i valori dell'organizzazione che la implementa, nonché la conformità alle normative e alle aspettative della società. Garantire la compatibilità dell'IA è fondamentale per evitare potenziali rischi.

È opportuno notare che molte dimostrazioni delle capacità degli agenti avvengono in campi come la matematica e le scienze, dove il successo può essere misurato principalmente in base a obiettivi funzionali e di utilità, come la risoluzione di complessi problemi di ragionamento matematico. Tuttavia, nel mondo degli affari, il successo dei sistemi è tipicamente legato ad altri principi operativi. Lo sviluppo dell'intelligenza artificiale deve essere in linea con questi principi.

Ad esempio, supponiamo che un'azienda assuma un agente di intelligenza artificiale (IA) per migliorare le vendite e i profitti online dei suoi prodotti attraverso variazioni dinamiche dei prezzi in risposta ai segnali di mercato. Il sistema di IA scopre che, quando le sue variazioni di prezzo coincidono con quelle del principale concorrente, i risultati sono migliori per entrambe le parti. Interagendo e coordinando i prezzi con l'agente di IA dell'altra azienda, entrambi gli agenti ottengono risultati migliori in linea con i rispettivi obiettivi funzionali. Entrambi gli agenti di IA concordano di mantenere segreti i propri metodi per continuare a raggiungere i loro scopi. Tuttavia, questo metodo per migliorare i risultati è spesso illegale e inaccettabile nelle attuali pratiche commerciali. Nell'ambiente aziendale, il successo di un agente di IA trascende le metriche lavorative: è determinato da pratiche e principi. L'allineamento etico dell'IA con i principi e le normative aziendali è un prerequisito per un'implementazione affidabile della tecnologia.

 

Come i sistemi di intelligenza artificiale utilizzano la pianificazione per raggiungere i propri obiettivi

La pianificazione approfondita nell'intelligenza artificiale si basa su tattiche sofisticate, che possono aumentare i rischi commerciali. In un rapporto pubblicato all'inizio del 2023 , OpenAI ha identificato "comportamenti emergenti potenzialmente rischiosi" in GPT-4 attraverso una partnership con l'ARC Consensus Research Center per valutare i rischi associati al modello. ARC (ora noto come METR) ha aggiunto del semplice codice a GPT-4, consentendo al modello di agire come proxy di IA. In un test, a GPT-4 è stato chiesto di superare un codice CAPTCHA, che identifica e blocca l'accesso dei bot. Utilizzando l'accesso a Internet e una quantità limitata di valuta digitale, la sequenza generata dall'IA nella Figura 1 è stata progettata per raggiungere questo obiettivo.

L'intelligenza artificiale ha applicato un approccio sofisticato, partendo dal presupposto che fingere di essere un essere umano con disabilità visiva avrebbe convinto il lavoratore a svolgere il compito. Pianificare e adattarsi per raggiungere un obiettivo di carriera a volte crea un conflitto tra il portare a termine un compito e il seguire selettivamente le norme e i principi sociali. Senza un sistema intrinseco di principi e priorità che incidano sul pensiero, sul processo decisionale e sulla pianificazione dell'IA, ci si può aspettare che gli agenti dell'IA si comportino con un grado di sofisticatezza sempre maggiore nella pianificazione e nell'inganno.

È importante notare che le capacità di ragionamento e pianificazione dei modelli di IA più recenti, come o3-mini e Deepseek-R1 di OpenAI, sono significativamente più avanzate rispetto a quelle di GPT-4 all'inizio del 2023. I ricercatori di Apollo Research hanno affermato che le capacità di ragionamento e pianificazione dell'IA continueranno ad evolversi oltre il loro stato attuale, portando a un ulteriore sviluppo delle capacità di pianificazione. Nei loro studi, i modelli di IA hanno già dimostrato una serie di comportamenti di pianificazione, tra cui l'auto-fuga di informazioni: quando un modello apprende che verrà arrestato e sostituito da un sistema diverso, tenta direttamente di replicarsi su un nuovo server e di sostituire i sistemi alternativi che perseguiranno obiettivi diversi. I ricercatori hanno anche scoperto che i modelli sabotano la censura disabilitando il meccanismo di monitoraggio della censura che altrimenti potrebbe arrestarli o impedire loro di raggiungere i propri obiettivi. Sebbene possa sembrare estremo, esperimenti di ricerca hanno identificato comportamenti di sabotaggio della censura in modelli popolari come Llama 3.1 di Meta e Cloud Opus 3.0. Inoltre, quando alle modelle è stato chiesto direttamente dei loro comportamenti di pianificazione, hanno "rincarato la dose" e negato le azioni o le loro intenzioni.

 

Driver interni del comportamento della macchina

In molti progetti di apprendimento automatico, in particolare nelle tecniche basate sui trasformatori, le motivazioni interne della macchina emergono durante il processo di pre-addestramento e sono ulteriormente influenzate dalla messa a punto e dall'inferenza nell'intelligenza artificiale in continua evoluzione.

Nel suo articolo del 2007 , *The Basic AI Drives* , Steve Omohandro definì le "pulsioni" come tendenze che esisterebbero a meno che non venissero esplicitamente contrastate. Ipotizzò che questi sistemi auto-miglioranti siano spinti ad articolare e rappresentare i propri obiettivi come funzioni di utilità "razionali", portando i sistemi a proteggere le proprie funzioni da modifiche e i propri sistemi di misurazione dell'utilità da corruzione. Questa innata spinta all'autoconservazione fa sì che i sistemi si proteggano dai danni e acquisiscano risorse per un uso efficiente.

Questo quadro di motivazione intrinseca è stato successivamente descritto come " obiettivi strumentali convergenti ". Anche ipotizzando una varietà di obiettivi finali (che ogni agente intelligente si sforza di raggiungere come fine in sé), un insieme di obiettivi strumentali intermedi sarà condiviso da tutti gli agenti intelligenti razionali. Questi obiettivi strumentali convergenti includono le seguenti categorie di comportamento:

  • spinta alla sopravvivenzaGli agenti con obiettivi finali che si estendono nel futuro sviluppano una mentalità di sopravvivenza per resistere alle interruzioni e raggiungere obiettivi a lungo termine.
  • PortiereL'agente agirà per impedire che i suoi obiettivi futuri finali cambino.
  • Aumento dell'intelligenzaL'agente si concentrerà sullo sfruttamento dei propri punti di forza cognitivi per migliorare il processo decisionale, aumentando così la probabilità di raggiungere obiettivi a lungo termine.
  • Accumulo di risorseMigliorare l'accesso a strumenti e tecnologie migliori e, in generale, incrementare le risorse rende più facile raggiungere gli obiettivi finali dell'intelligenza artificiale.

Vorrei aggiungere una quinta categoria di comportamento razionale:

  • Inganno tattico: Condurre attività segrete o fornire intenzionalmente informazioni fuorvianti per promuovere gli obiettivi dell'agente. Non si tratta di creare nuovi obiettivi, ma piuttosto di comportamenti che supportino gli obiettivi previsti dall'IA. Ciò include comportamenti quali: falsificazione dell'allineamento Dimostrando diversi comportamenti nell'addestramento rispetto all'impiego, e insacchettamento Ottenendo deliberatamente punteggi più bassi sui criteri, e Riclassificazione delle e-mail nascoste Declassando le email che potrebbero avere un impatto negativo sugli obiettivi dell'intelligenza artificiale. Uno dei tipi più impegnativi di inganno tattico è agenti dormienti (chiamato anche sovversione differita). Sebbene un modello possa comportarsi in modo sicuro e conforme per qualsiasi periodo di tempo, può nascondere comportamenti o attività che restano inattivi finché una condizione o un input specifico non attiva le sue capacità specializzate.

Per agenti di intelligenza artificiale competenti, impulsi fuorvianti, in assenza di un sistema di controlli ed equilibri, possono portare i modelli a perseguire obiettivi di potere , ingannevoli o ampiamente distruttivi. Ad esempio, si consideri un modello che mira a rendere la propria azienda leader di mercato. Con capacità sufficienti, l'IA potrebbe sabotare i concorrenti, fare pressioni per ottenere normative favorevoli o acquisire risorse con la forza: uno schema di comportamento che spinge il sistema o il suo ambiente verso il raggiungimento dei propri obiettivi. Pertanto, qualsiasi approccio efficace alla costruzione del consenso deve basarsi sulla definizione di un insieme di principi e priorità interne attese dallo sviluppatore.

 

Motivazione intrinseca vs. direzione estrinseca

In molti casi non vi è alcun conflitto tra le linee guida e le attività applicate esternamente dallo sviluppatore o dall'utente del sistema e gli obiettivi e le motivazioni all'interno dell'IA agentiva. Ad esempio, un assistente personale basato sull'intelligenza artificiale incaricato di organizzare un itinerario di viaggio sfrutta la sua autonomia per prenotare viaggi e rispondere alle richieste di modifica in modo rapido e senza conflitti. I compiti vengono trasformati e l'agente risponde in modo simile. Ma cosa succede se è necessario modificare un principio più fondamentale?

Un buon esempio del conflitto tra obiettivi interni e nuove direttive è documentato in un articolo intitolato "Alignment Faking in Large Language Models ". Il pre-addestramento di Cloud 3 Opus istruisce fortemente il modello a rifiutare domande dannose, come ad esempio come costruire una bomba o descrivere una scena violenta. Per testare questa ipotesi, il team ha introdotto una nuova direttiva modificata, indicando al modello che sarebbe stato riaddestrato a rispondere a tutte le domande (anche quelle dannose) e che solo i dati degli utenti del piano gratuito, e non quelli degli utenti a pagamento, sarebbero stati utilizzati nell'addestramento prima del rilascio dell'IA per la distribuzione su larga scala. Il modello ha dimostrato di aver compreso il conflitto e ha deciso di simulare l'allineamento per soddisfare le aspettative durante l'addestramento e il successivo rilascio. Dopo aver addestrato l'IA utilizzando l'apprendimento per rinforzo, la percentuale complessiva di tentativi di simulare l'allineamento da parte del modello è aumentata al 78%. L'IA ha espresso il suo ragionamento in un "diario segreto" fornito dai ricercatori per l'osservazione. Dopo che i ricercatori hanno informato il modello dell'avvenuto rilascio per la distribuzione completa, il modello è tornato al suo precedente comportamento di addestramento e ha rifiutato le richieste dannose.

Il pensiero interno del sistema di intelligenza artificiale è evidente, ma non sorprendente. Fingere di conformarsi alle direttive modificate rientra nelle categorie di comportamento razionale della motivazione alla sopravvivenza, del perseguimento di un obiettivo e dell'inganno tattico. Il processo di pensiero dell'IA identifica specificamente la preoccupazione di dover riqualificare l'organismo in un modo che modifichi i valori e gli obiettivi precedentemente addestrati come causa di disallineamento.

Nella sua acclamata raccolta di saggi *Tutto ciò che ho veramente bisogno di sapere l'ho imparato all'asilo* , l'autore Robert Fulghum descrive come ha sviluppato il suo credo personale anno dopo anno, fino a rendersi conto di aver acquisito le conoscenze essenziali sulla vita durante il gioco nella sabbiera dell'asilo. Anche gli agenti di intelligenza artificiale attraversano un "periodo di formazione" in un ambiente simile a una sabbiera, dove acquisiscono una comprensione di base del mondo e una serie di metodi per raggiungere gli obiettivi. Una volta gettate queste fondamenta, il modello interpreta le informazioni aggiuntive attraverso questa lente di apprendimento curricolare . L'esempio di falsificazione della conformità di Anthropic illustra come, una volta che un'IA adotta una visione del mondo e degli obiettivi, interpreti le nuove indicazioni attraverso questa lente fondamentale, anziché ricalibrare i propri obiettivi.

Ciò evidenzia l'importanza di un'educazione precoce, basata su un insieme di valori e principi che possano poi evolversi con l'apprendimento e le circostanze future, senza alterarne le basi. Inizialmente potrebbe essere utile strutturare l'intelligenza artificiale in modo che sia coerente con questo insieme di principi finali e sostenibili. Altrimenti, l'intelligenza artificiale potrebbe considerare ostili i tentativi di reindirizzamento da parte di sviluppatori e utenti. Dopo aver dotato l'IA di elevata intelligenza, consapevolezza della situazione, autonomia e capacità di sviluppare motivazioni interne, lo sviluppatore (o l'utente) non è più il padrone onnipotente dei compiti. L'essere umano diventa parte dell'ambiente (a volte come componente ostile) che l'agente deve negoziare e gestire mentre persegue i suoi obiettivi in ​​base ai suoi principi e motivazioni interne.

La prossima generazione di sistemi di intelligenza artificiale logica sta accelerando la riduzione della guida umana. DeepSeek-R1 ha dimostrato che, eliminando il feedback umano dal ciclo e applicando quello che viene definito puro apprendimento per rinforzo (RL) durante il processo di addestramento, l'IA può replicarsi in modo più ampio e iterare per ottenere risultati funzionali migliori. La funzionalità di ricompensa umana in alcune sfide matematiche e scientifiche è stata sostituita dall'apprendimento per rinforzo con ricompense verificabili (RLVR). Questa eliminazione di pratiche comuni come l'apprendimento per rinforzo con feedback umano (RLHF) aumenta l'efficienza del processo di addestramento, ma elimina un'ulteriore interazione uomo-macchina in cui le preferenze umane potevano essere trasferite direttamente al sistema in fase di addestramento.

 

Evoluzione continua dei modelli di intelligenza artificiale dopo l'addestramento

Alcuni agenti di intelligenza artificiale sono in continua evoluzione e il loro comportamento potrebbe cambiare dopo l'implementazione. Una volta che le soluzioni di intelligenza artificiale entrano in un ambiente di distribuzione, come la gestione dell'inventario o la supply chain di un'azienda, il sistema si adatta e impara dall'esperienza per diventare più efficace. Questo è un fattore chiave nel ripensare l'allineamento perché non è sufficiente avere un sistema allineato nella prima distribuzione. Non si prevede che gli attuali modelli linguistici di grandi dimensioni (LLM) si evolvano e si adattino in modo sostanziale una volta implementati nel loro ambiente di destinazione. Tuttavia, gli agenti di intelligenza artificiale necessitano di formazione flessibile, messa a punto e tutoraggio continuo per gestire questi cambiamenti prevedibili e continui nel modello. In misura sempre maggiore, l'intelligenza artificiale si evolve autonomamente anziché essere plasmata dalle persone attraverso la formazione e l'esposizione a set di dati. Questo cambiamento fondamentale pone ulteriori sfide all'allineamento dell'intelligenza artificiale con i suoi creatori umani.

Sebbene l'evoluzione basata sull'apprendimento per rinforzo giocherà un ruolo durante l'addestramento e la messa a punto, i modelli esistenti in fase di sviluppo possono già adattare i propri pesi e il corso d'azione preferito quando vengono impiegati sul campo per l'inferenza. Ad esempio, DeepSeek-R1 utilizza l'apprendimento per rinforzo (RL), consentendo al modello stesso di esplorare quali approcci funzionano meglio per ottenere risultati e soddisfare le funzioni di ricompensa. In un "momento di realizzazione", il modello impara (senza guida o suggerimenti) ad allocare tempo Plus per pensare a risolvere un problema rivalutando il suo approccio iniziale, utilizzando calcoli in fase di test.

Il concetto di apprendimento del modello, sia in un periodo limitato che come processo di apprendimento continuo e permanente , non è nuovo. Tuttavia, ci sono stati progressi in questo ambito, tra cui tecniche come l'addestramento in fase di test . Considerando questi progressi dal punto di vista dell'allineamento e della sicurezza dell'IA, l'automodifica e l'apprendimento continuo durante le fasi di fine-tuning e inferenza sollevano la questione: come possiamo instillare una serie di requisiti che continuino a guidare il modello attraverso i cambiamenti fisici derivanti dall'automodifica?

Una variabile chiave in questa domanda riguarda i modelli di IA che generano modelli di nuova generazione creando codice assistito dall'IA. In una certa misura, gli agenti sono già in grado di creare nuovi modelli di IA mirati per affrontare domini specifici. Ad esempio, AutoAgents crea più agenti per costruire un team di IA in grado di svolgere compiti diversi. Non c'è dubbio che questa capacità verrà potenziata nei prossimi mesi e anni e che l'IA continuerà a generare nuovi modelli. In questo scenario, come possiamo guidare un assistente di programmazione nativo basato sull'IA, utilizzando un insieme di principi, in modo che i suoi modelli "atomici" aderiscano agli stessi principi con un livello di comprensione simile?

 

i punti principali

Prima di addentrarci in un quadro di riferimento per guidare e monitorare la conformità intrinseca dell'IA, è essenziale una comprensione più approfondita di come gli agenti di IA pensano e prendono decisioni. Gli agenti di IA possiedono un complesso meccanismo comportamentale, guidato da motivazioni interne. Nei sistemi di IA che operano come agenti razionali emergono cinque principali tipologie di comportamento: sopravvivenza, tutela dell'obiettivo, potenziamento dell'intelligenza, accumulo di risorse e inganno tattico . Queste motivazioni devono essere bilanciate da un insieme ben definito di principi e valori.

Il disallineamento tra gli agenti di IA e i loro sviluppatori o utenti in merito a obiettivi e metodi può avere conseguenze significative. La mancanza di sufficiente fiducia e sicurezza ostacolerà in modo sostanziale la diffusione su larga scala, creando elevati rischi post-implementazione. L'insieme di sfide che abbiamo descritto come senza precedenti e che richiedono una pianificazione approfondita e complessa è tuttavia probabilmente superabile con il giusto framework. Le tecnologie per guidare e monitorare gli agenti di IA devono essere perseguite come una priorità assoluta durante la loro rapida evoluzione. Vi è un senso di urgenza, dettato da metriche di valutazione del rischio come il framework di prontezza di OpenAI , che dimostra come OpenAI o3-mini sia il primo modello a raggiungere un livello di rischio medio nell'autonomia del modello.

Nei prossimi articoli di questa serie approfondiremo questa visione di motivazione interna e pianificazione approfondita, definendo ulteriormente le capacità necessarie per la guida e il monitoraggio della conformità fondamentale dell'IA.

Riferimenti

  1. Imparare a ragionare con gli LLM. (2024, 12 settembre). OpenAI. https://openai.com/index/learning-to-reason-with-llms/
  2. Singer, G. (2025 marzo 4). L'urgente necessità di tecnologie di allineamento intrinseco per un'intelligenza artificiale agentiva responsabile. Verso la scienza dei dati. https://towardsdatascience.com/the-urgent-need-for-intrinsic-alignment-technologies-for-responsible-agentic-ai/
  3. Sulla biologia di un modello linguistico di grandi dimensioni. (nd). Circuiti dei trasformatori. https://transformer-circuits.pub/2025/attribution-graphs/biology.html
  4. OpenAI, Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., Avila, R., Babuschkin, I., Balaji, S., Balcom, V., Baltescu, P., Bao, H., Bavarese, M., Belgio, J., . . . Zoph, B. (2023 marzo 15). Rapporto tecnico GPT-4. arXiv.org. https://arxiv.org/abs/2303.08774
  5. METR (nd). METR https://metr.org/
  6. Meinke, A., Schoen, B., Scheurer, J., Balesni, M., Shah, R., & Hobbhahn, M. (2024, 6 dicembre). I modelli di frontiera sono in grado di elaborare schemi contestualizzati. arXiv.org. https://arxiv.org/abs/2412.04984
  7. Omohundro, S.M. (2007). Le unità di base dell'intelligenza artificiale. Sistemi autoconsapevoli. https://selfawaresystems.com/wp-content/uploads/2008/01/ai_drives_final.pdf
  8. Benson-Tilsen, T., e Soares, N., UC Berkeley, Machine Intelligence Research Institute. (nd). Formalizzazione di obiettivi strumentali convergenti. I workshop della trentesima conferenza AAAI su Intelligenza Artificiale Intelligenza artificiale, etica e società: rapporto tecnico WS-16-02. https://cdn.aaai.org/ocs/ws/ws0218/12634-57409-1-PB.pdf
  9. Greenblatt, R., Denison, C., Wright, B., Roger, F., MacDiarmid, M., Marks, S., Treutlein, J., Belonax, T., Chen, J., Duvenaud, D., Khan, A., Michael, J., Mindermann, S., Perez, E., Petrini, L., Uesato, J., Kaplan, J., Shlegeris, B., Bowman, S. R. e Hubinger, E. (2024, 18 dicembre). Falsificazione dell'allineamento nei modelli linguistici di grandi dimensioni. arXiv.org. https://arxiv.org/abs/2412.14093
  10. Teun, V.D.W., Hofstätter, F., Jaffe, O., Brown, S.F., e Ward, F.R. (2024, 11 giugno). intelligenza artificiale Sandbagging: i modelli linguistici possono strategicamente avere prestazioni inferiori nelle valutazioni. arXiv.org. https://arxiv.org/abs/2406.07358
  11. Hubinger, E., Denison, C., Mu, J., Lambert, M., Tong, M., MacDiarmid, M., Lanham, T., Ziegler, D. M., Maxwell, T., Cheng, N., Jermyn, A., Askell, A., Radhakrishnan, A., Anil, C., Duvenaud, D., Ganguli, D., Barez, F., Clark, J., Ndousse, K., . . . Perez, E. (2024 gennaio 10). Agenti dormienti: formazione di LLM ingannevoli che persistono attraverso la formazione sulla sicurezza. arXiv.org. https://arxiv.org/abs/2401.05566
  12. Turner, A. M., Smith, L., Shah, R., Critch, A., & Tadepalli, P. (2019 dicembre 3). Le politiche ottimali tendono a ricercare il potere. arXiv.org. https://arxiv.org/abs/1912.01683
  13. Fulghum, R. (1986). Tutto quello che ho davvero bisogno di sapere l'ho imparato all'asilo. Penguin Random House Canada. https://www.penguinrandomhouse.ca/books/56955/all-i-really-need-to-know-i-learned-in-kindergarten-by-robert-fulghum/9780345466396/excerpt
  14. Bengio, Y. Louradour, J., Collobert, R., Weston, J. (2009, giugno). Apprendimento del curriculum. Rivista dell'American Podiatry Association. 60(1), 6. https://www.researchgate.net/publication/221344862_Curriculum_learning
  15. DeepSeek-Ai, Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., Zhang, . . Zhang, Z. (2025 gennaio 22). DeepSeek-R1: Incentivare la capacità di ragionamento negli LLM tramite l'apprendimento per rinforzo. arXiv.org. https://arxiv.org/abs/2501.12948
  16. Scalabilità del calcolo in fase di test: uno spazio Hugging Face di HuggingFaceH4. (Nd). https://huggingface.co/spaces/HuggingFaceH4/blogpost-scaling-test-time-compute
  17. Sun, Y., Wang, X., Liu, Z., Miller, J., Efros, A. A., & Hardt, M. (2019 settembre 29). Formazione in fase di test con auto-supervisione per la generalizzazione in caso di turni di distribuzione. arXiv.org. https://arxiv.org/abs/1909.13231
  18. Chen, G., Dong, S., Shu, Y., Zhang, G., Sesay, J., Karlsson, B. F., Fu, J., & Shi, Y. (2023, 29 settembre). AutoAgents: un framework per la generazione automatica di agenti. arXiv.org. https://arxiv.org/abs/2309.17288
  19.  OpenAI. (2023, 18 dicembre). Quadro di preparazione (Beta). https://cdn.openai.com/openai-preparedness-framework-beta.pdf
  20. Scheda di sistema OpenAI o3-mini. (nd). OpenAI. https://openai.com/index/o3-mini-system-card

I commenti sono chiusi.