# Metodo e fonti del corpus

Questo documento risponde alla domanda che un lettore critico farà per prima:
*da dove vengono le frasi, e con quale diritto le avete estratte?*

## Principio: proponi, poi attesta

Il cancello d'ingresso nel dataset non è l'origine della proposta ma la sua
**attestazione nel corpus**: una formula esiste se ricorre in almeno 3
articoli distinti di italiano accademico reale, pubblicato e ad accesso
aperto — altrimenti non esiste, chiunque l'abbia proposta. Le proposte
possono venire dall'estrazione automatica, da una lista scritta a mano, o
da un modello linguistico: è irrilevante, perché nessuna proposta entra
senza superare l'attestazione, e ogni frase porta con sé esemplari reali
(campo `esemplari`) e le occorrenze documentate in `data/provenienza.json`
(rivista, anno, articolo, conteggio).

Questa formulazione sostituisce una regola precedente («estrai, poi
redigi») che vincolava l'origine invece del risultato: una verifica
empirica sulle formule di attenuazione ha mostrato che l'estrazione a
n-grammi vedeva solo una minima parte delle formule realmente attestate
nel corpus. Restano fermi due divieti: nessuna traduzione da risorse
protette (in particolare dall'Academic Phrasebank di Manchester, proprietà
intellettuale di quell'ateneo), e nessuna immissione in blocco di frasi
generate da modelli direttamente nel dataset — la generazione può al
massimo produrre *proposte da attestare*, mai frasi.

### Lo stato «verificata»

Per decisione del responsabile del progetto (luglio 2026), lo stato
`verificata` è assegnato da un cancello meccanico stringente, non da una
revisione manuale frase per frase: **almeno 3 articoli reali distinti**
dopo la deduplicazione del corpus, **almeno 2 riviste** (oppure almeno 4
articoli, per le formule proprie di un solo ambito), **almeno 2 esemplari
puliti con riempimenti diversi dello stesso slot**, e **almeno 2 forme
distinte** della frase attestante — le ripetizioni identiche (boilerplate,
ristampe, tic d'autore) contano come una sola attestazione. Le frasi che
superano la soglia minima ma non il cancello pieno restano `bozza`,
visibili nel sito solo con il filtro esplicito.

## Come nascono le proposte

Tre passaggi complementari, tutti con lo stesso cancello (≥3 articoli
distinti):

1. **N-grammi contigui** (`scripts/estrai.mjs`, passaggio A): sequenze
   fisse di 4–8 parole frequenti per articoli distinti. Resa: i connettivi
   fissi («va da sé che», «non è un caso che»).
2. **Firme lessicali** (`data/firme.json`, passaggio B): scheletri con
   flessioni e sinonimi ammessi negli slot, proposti a mano e verificati
   meccanicamente contro il corpus. Resa: le impalcature lunghe a lessico
   variabile («è possibile ipotizzare che», «non è possibile escludere che»).
3. **Skip-gram** (passaggio C): sequenze con 1–2 posizioni libere scoperte
   dal corpus stesso, senza alcuna proposta umana. Resa: ciò che nessuno
   pensa di cercare.

Due regole di redazione discendono dall'attestazione: i segnaposto si
mettono dove il corpus mostra variazione, non dove sembra naturale metterli;
e ogni frase con segnaposto richiede **almeno due esemplari con riempimenti
diversi dello stesso slot** (la validazione lo impone). Se i due esemplari
non esistono, quello slot è contenuto congelato, non uno slot.

## Base giuridica dell'estrazione

1. **Text and data mining.** L'estrazione di pattern fraseologici da opere
   lecitamente accessibili ricade nelle eccezioni per estrazione di testo e
   dati degli artt. 70-*ter* (ricerca scientifica) e 70-*quater* (uso
   generale, salvo opt-out) della l. 633/1941, che recepiscono gli artt. 3 e
   4 della direttiva (UE) 2019/790.
2. **Natura dei frammenti estratti.** Le formule raccolte («nei limiti del
   campione esaminato», «va tuttavia rilevato che») sono brevi, formulari e
   prive di carattere creativo: non costituiscono espressione protetta, e la
   loro raccolta non riproduce alcuna parte originale delle opere sorgenti.
3. **Il corpus non è ridistribuito.** I PDF scaricati restano nella
   directory locale `/corpus`, esclusa dal repository via `.gitignore`. Ciò
   che viene pubblicato è soltanto il dataset di formule con i relativi
   metadati di provenienza (rivista, anno, link all'articolo).
4. **Rispetto dell'opt-out.** Prima di includere una fonte verifichiamo
   `robots.txt` e `/.well-known/tdmrep.json` (TDM Reservation Protocol). Se
   una fonte esprime una riserva — anche quando formalmente non indirizzata
   al nostro strumento — la escludiamo (vedi sotto il caso *Argomenti*).

Questa non è consulenza legale; se il progetto cresce, il quadro va
verificato da chi di dovere.

### Perché le licenze NC e ND non ostano all'estrazione

Una delle riviste in corpus (RPD) pubblica con licenza CC BY-NC-ND. Le
clausole NC (non commerciale) e ND (niente derivati) condizionano il
riutilizzo dell'**opera protetta**: articoli, loro traduzioni, adattamenti.
L'estrazione di formule fraseologiche non riutilizza l'opera in nessuno di
questi sensi — i frammenti formulari non raggiungono la soglia di
originalità e quindi non sono oggetto della licenza; l'attività di mining è
coperta dalle eccezioni di legge, che operano a prescindere dalla licenza;
e il corpus non viene né ripubblicato né ridistribuito. Le clausole NC e ND,
in breve, non hanno presa su ciò che effettivamente preleviamo.

## Riviste incluse

Ogni testata è stata verificata a mano il 25 luglio 2026, prima
dell'inclusione: endpoint OAI-PMH funzionante (`verb=Identify`), full text
PDF scaricabile, prevalenza di italiano su un campione di 100 record,
licenza dichiarata nelle pagine della rivista, `robots.txt` e
`/.well-known/tdmrep.json` privi di riserve TDM.

| Testata | Ateneo/editore | Ambito | Licenza | Endpoint OAI-PMH | Verifiche |
|---|---|---|---|---|---|
| Enthymema | Università di Milano | scienze umane (teoria della letteratura) | CC BY 4.0 | `riviste.unimi.it/index.php/enthymema/oai` | ok; robots: solo `Crawl-delay: 10`, rispettato dallo script |
| Stato, Chiese e pluralismo confessionale | Università di Milano | giurisprudenza | CC BY-SA 4.0 | `riviste.unimi.it/index.php/statoechiese/oai` | ok; robots: solo `Crawl-delay: 10`, rispettato dallo script |
| Ricerche di Pedagogia e Didattica | Università di Bologna | scienze umane (pedagogia) | CC BY-NC-ND 4.0 | `rpd.unibo.it/oai` | ok; robots senza riserve TDM; su NC/ND vedi sopra |
| SocietàMutamentoPolitica | Firenze University Press | scienze sociali (sociologia) | CC BY 4.0 | `oajournals.fupress.net/index.php/smp/oai` | ok; robots senza riserve |
| Ingegneria dell'Ambiente | Assoc. Ingegneria dell'Ambiente (Milano) | ingegneria | Open Access, senza licenza CC dichiarata (TDM ex art. 70-ter; il corpus non è ridistribuito) | `ingegneriadellambiente.net/ojs/index.php/ida/oai` | ok (verificata il 26/7/2026); 100% italiano su campione di 100 record; robots senza riserve |
| Rivista italiana di informatica e diritto | CNR-IGSG | ingegneria e informatica (informatica giuridica; prosa a dominante giuridica) | CC BY-NC-SA 4.0 | `rivistaitalianadiinformaticaediritto.it/index.php/riid/oai` | ok (verificata il 26/7/2026); 91% italiano; robots senza riserve |

La raccolta avviene esclusivamente via **OAI-PMH** — l'interfaccia che le
riviste espongono deliberatamente per l'interoperabilità — con uno
User-Agent che identifica il progetto, mai con scraping delle pagine web.

## Testate valutate ed escluse

| Testata | Ambito | Motivo dell'esclusione |
|---|---|---|
| Argomenti (Università di Urbino) | economia | `robots.txt` con blocco esplicito dei crawler AI (GPTBot, anthropic-ai, Claude-Web, CCBot, ...). Il blocco non nomina il nostro harvester, ma è una riserva dichiarata contro il mining da parte di sistemi AI: la trattiamo come opt-out ex art. 70-quater ed escludiamo la testata. |
| Moneta e Credito (Sapienza) | economia | endpoint irraggiungibile (handshake TLS fallito con più client, riverificato a luglio 2026); impossibile verificare e raccogliere. |
| Cambio (Firenze University Press) | scienze sociali | non più presente sui domini OJS attuali dell'editore. |
| Acta Biomedica e Medicina Historica (Mattioli 1885) | medicina | endpoint OAI-PMH funzionante ma 100% dei record campionati in inglese: fuori dall'oggetto del progetto. |
| Rivista Italiana di Economia Demografia e Statistica (SIEDS) | economia | dominio della piattaforma non più raggiungibile. |
| Sinappsi (INAPP) | economia/lavoro | piattaforma OJS non raggiungibile. |

## Limiti dichiarati di copertura

Il corpus copre **quattro degli otto ambiti** della tassonomia (scienze
umane, scienze sociali, giurisprudenza e — dal luglio 2026 — ingegneria e
informatica). Restano senza copertura **economia, medicina e scienze
naturali**: le testate italiane ad accesso aperto in quegli ambiti, dove
esistono, pubblicano in inglese, sono irraggiungibili o riservano
esplicitamente il mining (le esclusioni sono documentate qui sopra). Le
frasi di questi ambiti, quando arriveranno, richiederanno nuove fonti
verificate con lo stesso metodo; fino ad allora il dataset non attribuisce
a quegli ambiti alcuna frase attestata.

Un secondo limite: le annate raccolte dipendono dall'ordine di restituzione
degli endpoint OAI (che pagina per data di registrazione del *record*, non
di pubblicazione). La composizione per annata è documentata nei
`metadata.jsonl` del corpus, e va tenuta d'occhio: un corpus sbilanciato su
un periodo può confermare artificialmente ipotesi sul registro.
