{"id":9483,"date":"2025-04-04T23:06:10","date_gmt":"2025-04-04T23:06:10","guid":{"rendered":"https:\/\/www.ivanoesposito.org\/it\/?p=9483"},"modified":"2025-04-05T05:07:11","modified_gmt":"2025-04-05T05:07:11","slug":"il-fenomeno-della-regurgitation","status":"publish","type":"post","link":"https:\/\/www.ivanoesposito.org\/it\/2025\/04\/04\/il-fenomeno-della-regurgitation\/","title":{"rendered":"Il fenomeno della &#8220;regurgitation&#8221;"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Il fenomeno della <strong>&#8220;regurgitation&#8221;<\/strong> (letteralmente: \u201crigurgito\u201d) nel contesto dell\u2019Intelligenza Artificiale, si riferisce alla capacit\u00e0 di un modello linguistico (come ChatGPT o altri LLM) di <strong>riprodurre fedelmente porzioni di dati protetti da copyright<\/strong> utilizzati nel suo addestramento. Questo \u00e8 uno dei principali timori dei titolari dei diritti d\u2019autore ed \u00e8 oggetto di studio sia dal punto di vista tecnico che legale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Vediamo nel dettaglio <strong>quali strumenti, metodologie e approcci tecnici<\/strong> sono oggi disponibili per rilevare la &#8220;regurgitation&#8221; e verificarne l\u2019attinenza a contenuti protetti da copyright.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83d\udccc 1. Cos\u2019\u00e8 tecnicamente il \u201cregurgitation\u201d<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Il regurgitation avviene quando un modello AI <strong>ripete in modo sostanzialmente identico frasi, paragrafi o interi documenti<\/strong> usati durante l\u2019addestramento, senza una trasformazione creativa. Questo pu\u00f2 configurare una violazione del copyright se:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>il contenuto \u00e8 protetto,<\/li>\n\n\n\n<li>la porzione restituita \u00e8 significativa e riconoscibile,<\/li>\n\n\n\n<li>l\u2019output \u00e8 accessibile pubblicamente o usato commercialmente (<a href=\"https:\/\/arxiv.org\/html\/2406.18664v3\">arxiv.org<\/a>).<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83e\uddea 2. Strumenti tecnici per rilevare il regurgitation<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ecco alcune <strong>tecniche e strumenti usati in ricerca e industria<\/strong> per identificare il regurgitation di contenuti protetti:<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">A. <strong>Extraction-Based Detection (Search Matching)<\/strong><\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Si confrontano gli output generati dal modello con <strong>dataset originali protetti da copyright<\/strong> usando metriche di similarit\u00e0 come BLEU, ROUGE, o Jaccard.<\/li>\n\n\n\n<li>Questo metodo funziona bene per contenuti identici o quasi identici.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">B. <strong>Prompt Injection per Forzare il Regurgitation<\/strong><\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Si usano prompt mirati (&#8220;adversarial prompts&#8221;) per stimolare l\u2019output di contenuti specifici, per esempio chiedendo: <em>&#8220;Recita la seconda pagina del libro X&#8230;&#8221;<\/em> (<a href=\"https:\/\/openreview.net\/forum?id=ar8aRMrmod\">OpenReview<\/a>).<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">C. <strong>Embedding Similarity Matching<\/strong><\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Tecniche di vector search (es. FAISS, Elasticsearch con plugin NLP) per confrontare embedding semantici dell\u2019output con quelli dei dataset di addestramento.<\/li>\n\n\n\n<li>Questa modalit\u00e0 permette di scoprire <strong>parafrasi o contenuti leggermente riformulati<\/strong>.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">D. <strong>Canary Tokens<\/strong><\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Tecnica proattiva: si inseriscono frasi artificiali (&#8220;canarini&#8221;) nel dataset per poi verificare se il modello le riproduce. Se accade, \u00e8 prova diretta di memorizzazione.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">E. <strong>Benchmarks pubblici<\/strong><\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Paper come <em>&#8220;Evaluating Copyright Takedown Methods for Language Models&#8221;<\/em> propongono benchmark e dataset sintetici per valutare la propensione al regurgitation (<a href=\"https:\/\/arxiv.org\/html\/2406.18664v3\">arXiv<\/a>).<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\u2696\ufe0f 3. Profili legali e implicazioni<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Secondo la normativa europea (e anche quella statunitense), <strong>la protezione del copyright si applica all\u2019espressione originale dell\u2019autore<\/strong>, non ai dati o alle informazioni in s\u00e9. Tuttavia:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Se un LLM <strong>restituisce parola per parola<\/strong> un contenuto protetto, pu\u00f2 configurarsi una <strong>violazione<\/strong>.<\/li>\n\n\n\n<li>Se il contenuto \u00e8 stato <strong>trasformato o rielaborato<\/strong>, si entra in un\u2019area grigia della legge, con possibile applicazione del concetto di &#8220;fair use&#8221; o &#8220;eccezioni didattiche&#8221; (<a href=\"https:\/\/www.csis.org\/blogs\/perspectives-innovation\/informing-innovation-policy-debate-key-concepts-copyright-laws\">CSIS<\/a>).<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">In questo contesto, <strong>la verifica tecnica del regurgitation diventa cruciale in cause legali<\/strong> (come quelle contro OpenAI da parte di The New York Times o Getty Images).<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83e\uddea 3.b Caso di studio: OpenAI vs The New York Times<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Il 27 dicembre 2023, il <em>New York Times<\/em> ha intentato una causa contro OpenAI e Microsoft, sostenendo che gli articoli del giornale sarebbero stati utilizzati, senza autorizzazione, per addestrare modelli linguistici come ChatGPT. Secondo l&#8217;accusa, questi modelli sarebbero in grado di rigurgitare <strong>interi passaggi<\/strong> degli articoli originali, a volte anche su richiesta dell\u2019utente (<a href=\"https:\/\/www.agendadigitale.eu\/mercati-digitali\/nyt-contro-openai-il-futuro-del-copyright-nellera-dellia-generativa\/\">AgendaDigitale<\/a>, <a href=\"https:\/\/previti.it\/il-new-york-times-fa-causa-openai\">Previti.it<\/a>).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Uno degli aspetti pi\u00f9 controversi riguarda il fatto che OpenAI avrebbe distrutto accidentalmente i log dei dati, rendendo difficile dimostrare se e quali articoli fossero stati inclusi nei dati di addestramento (<a href=\"https:\/\/www.hdblog.it\/tecnologia\/articoli\/n600309\/ny-times-vs-openai-dati-distrutti-per-errore-tutto-da-rifare\/\">HDblog<\/a>). Il NYT afferma che ci\u00f2 compromette la possibilit\u00e0 di tutelare i propri diritti, mentre OpenAI sostiene che i suoi modelli non memorizzano n\u00e9 riproducono dati testuali in modo letterale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Questa causa rappresenta uno dei primi tentativi concreti da parte di un editore di stabilire un precedente legale sul tema del <strong>copyright applicato all\u2019addestramento dei modelli AI<\/strong>. L\u2019esito sar\u00e0 probabilmente determinante per la futura regolamentazione del settore.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83d\udee0\ufe0f 4. Strumenti e piattaforme open-source per la rilevazione<\/h2>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><th>Nome Strumento<\/th><th>Descrizione<\/th><th>Licenza<\/th><\/tr><tr><td><strong>AI Audit Toolkit (Harvard + Mozilla)<\/strong><\/td><td>Toolkit per audit dei contenuti generati da LLM, incluso detection di rigurgiti.<\/td><td>Open source<\/td><\/tr><tr><td><strong>Tracr (DeepMind)<\/strong><\/td><td>Traccia frasi nel dataset originale e ne verifica l\u2019output nei modelli.<\/td><td>Research tool<\/td><\/tr><tr><td><strong>CopyLeaks AI Content Detector<\/strong><\/td><td>Rileva contenuti copiati da modelli linguistici, usato in ambito educativo.<\/td><td>SaaS<\/td><\/tr><tr><td><strong>OpenAI Evals<\/strong><\/td><td>Benchmarking framework per testare comportamenti specifici di modelli GPT.<\/td><td>MIT License<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83e\udded 5. Raccomandazioni per sviluppatori e content owner<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Integrazione di canary tokens<\/strong> nei contenuti pubblicati per monitorare se un modello li rigurgita.<\/li>\n\n\n\n<li><strong>Accordi di utilizzo e licenza<\/strong> chiari con fornitori AI.<\/li>\n\n\n\n<li>Utilizzo di <strong>strumenti di similarity detection<\/strong> come parte delle attivit\u00e0 di content monitoring.<\/li>\n\n\n\n<li>Collaborazione con piattaforme come <strong>LAION<\/strong> e <strong>OpenReview<\/strong> per verificare dataset pubblici usati in AI.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\ud83d\udcda Fonti principali consultate<\/h2>\n\n\n\n<ol start=\"1\" class=\"wp-block-list\">\n<li><a href=\"https:\/\/arxiv.org\/html\/2406.18664v3\">arXiv: Evaluating Copyright Takedown Methods<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/openreview.net\/forum?id=ar8aRMrmod\">OpenReview: Copyright Risks in LLMs<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/techpolicy.press\/discussing-the-copyrightability-of-generative-ai-outputs\">TechPolicyPress: Copyrightability of AI Outputs<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/www.csis.org\/blogs\/perspectives-innovation\/informing-innovation-policy-debate-key-concepts-copyright-laws\">CSIS: Concepts in Copyright Law<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/academic.oup.com\/jiplp\/article\/19\/7\/557\/7624901\">Oxford Academic: Copyright &amp; Data Mining<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/laion.ai\/blog\/laion-400-open-dataset\/\">LAION AI Dataset Projects<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/www.copyleaks.com\/ai-content-detector\">Copyleaks AI Detection<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/www.agendadigitale.eu\/mercati-digitali\/nyt-contro-openai-il-futuro-del-copyright-nellera-dellia-generativa\/\">Agenda Digitale: NYT vs OpenAI<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/www.hdblog.it\/tecnologia\/articoli\/n600309\/ny-times-vs-openai-dati-distrutti-per-errore-tutto-da-rifare\/\">HDblog: Dati distrutti nel caso NYT<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/previti.it\/il-new-york-times-fa-causa-openai\">Studio Previti<\/a><\/li>\n<\/ol>\n\n\n\n<figure class=\"wp-block-image size-medium is-style-rounded\"><img data-recalc-dims=\"1\" loading=\"lazy\" decoding=\"async\" width=\"300\" height=\"248\" src=\"https:\/\/i0.wp.com\/www.ivanoesposito.org\/it\/wp-content\/uploads\/2025\/04\/image-5.png?resize=300%2C248&#038;ssl=1\" alt=\"\" class=\"wp-image-9484\" srcset=\"https:\/\/i0.wp.com\/www.ivanoesposito.org\/it\/wp-content\/uploads\/2025\/04\/image-5.png?resize=300%2C248&amp;ssl=1 300w, https:\/\/i0.wp.com\/www.ivanoesposito.org\/it\/wp-content\/uploads\/2025\/04\/image-5.png?resize=1024%2C847&amp;ssl=1 1024w, https:\/\/i0.wp.com\/www.ivanoesposito.org\/it\/wp-content\/uploads\/2025\/04\/image-5.png?resize=768%2C635&amp;ssl=1 768w, https:\/\/i0.wp.com\/www.ivanoesposito.org\/it\/wp-content\/uploads\/2025\/04\/image-5.png?w=1200&amp;ssl=1 1200w\" sizes=\"auto, (max-width: 300px) 100vw, 300px\" \/><\/figure>\n","protected":false},"excerpt":{"rendered":"<p>Il fenomeno della &#8220;regurgitation&#8221; (letteralmente: \u201crigurgito\u201d) nel contesto dell\u2019Intelligenza Artificiale, si riferisce alla capacit\u00e0 di un modello linguistico (come ChatGPT o altri LLM) di riprodurre fedelmente porzioni di dati protetti da copyright utilizzati nel suo addestramento. Questo \u00e8 uno dei principali timori dei titolari dei diritti d\u2019autore ed \u00e8 oggetto di studio sia dal punto [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":9484,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","jetpack_publicize_message":"","jetpack_publicize_feature_enabled":true,"jetpack_social_post_already_shared":false,"jetpack_social_options":{"image_generator_settings":{"template":"highway","default_image_id":0,"font":"","enabled":false},"version":2}},"categories":[874,86],"tags":[1922,96,1924,1923,1925,150,1931,1927,1930,1916,157,1921,1926,597,1915,1705,215,1919,1274,233,1271,1467,1917,1920,245,1929,1928,1914,1918],"class_list":["post-9483","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news","category-intelligenza-artificiale-news","tag-addestramento-ai","tag-ai","tag-audit-ai","tag-canary-tokens","tag-content-detection","tag-copyright","tag-creativita-automatica","tag-data-scraping","tag-dataset","tag-dati-protetti","tag-deep-learning","tag-diritto-dautore","tag-embedding-matching","tag-etica-digitale","tag-fair-use","tag-gpt","tag-intelligenza-artificiale","tag-legal-tech","tag-llm","tag-machine-learning","tag-modelli-linguistici","tag-nlp","tag-nyt-vs-openai","tag-open-source-2","tag-openai","tag-output-generativi","tag-protezione-contenuti","tag-regurgitation","tag-text-mining"],"jetpack_publicize_connections":[],"_links":{"self":[{"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/posts\/9483","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/comments?post=9483"}],"version-history":[{"count":3,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/posts\/9483\/revisions"}],"predecessor-version":[{"id":9487,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/posts\/9483\/revisions\/9487"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/media\/9484"}],"wp:attachment":[{"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/media?parent=9483"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/categories?post=9483"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.ivanoesposito.org\/it\/wp-json\/wp\/v2\/tags?post=9483"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}