BERT NER – Letteratura Storica Italiana
Modello BERT Italian Cased fine-tuned per il riconoscimento di entità nominate (NER) su testi letterari e storici italiani (XV–XX secolo). Questo modello fa parte di un progetto di tesi di laurea presso l'Università Federico II di Napoli.
Label Supportate e Prestazioni (F1 Score)
Lo schema di annotazione (IOB2) supporta 9 classi di entità progettate specificamente per il dominio storico-letterario. La tabella mostra la composizione semantica e i punteggi F1 ottenuti in fase di test:
| Label | Descrizione | Esempi | F1 Score |
|---|---|---|---|
| PER | Persone e Personaggi | Dante, Francesco Petrarca, Ludovico | 0.81 |
| LOC | Luoghi (reali o fittizi) | Roma, Firenze, Costantinopoli, Purgatorio | 0.71 |
| DATE | Riferimenti temporali, anni, epoche | 1628, quindicesimo secolo | 0.66 |
| ORG | Organizzazioni / enti | Santa Sede, Senato, Università di Bologna | 0.60 |
| WORK | Titoli di opere letterarie/artistiche | Divina Commedia, Operette Morali | 0.58 |
| TIT | Titoli, cariche, appellativi | Papa, Conte, Messer, Imperatore | 0.50 |
| EVENT | Eventi storici o narrativi | Concilio di Trento, Battaglia di Lepanto | 0.36 |
| REL | Entità religiose | Dio, Cristo, Vergine Maria, Spirito Santo | 0.36 |
| FANT | Creature / elementi fantastici | draghi, Cerbero, ippogrifo, diavolo | 0.11 |
🚀 Uso Rapido
Puoi utilizzare il modello direttamente tramite la pipeline di HuggingFace:
from transformers import pipeline
ner = pipeline("ner", model="aendriu/bert-ner-italian-historical", aggregation_strategy="simple")
results = ner("Dante Alighieri nacque a Firenze e scrisse la Divina Commedia.")
for ent in results:
print(f"{ent['word']:30s} {ent['entity_group']:6s} {ent['score']:.4f}")
Limiti Noti e Problemi Aperti (Known Limitations)
Nonostante i buoni risultati sulle classi principali, il modello presenta alcune importanti criticità e limiti strutturali di cui tenere conto durante l'utilizzo:
- Fallimento sulle Classi Rare: Come evidenziato dai punteggi F1, il modello è inaffidabile per le classi
FANT(0.11),EVENT(0.36) eREL(0.36). Non usatelo se il vostro scopo primario è estrarre eventi storici o creature mitologiche. - Ambiguità TIT / PER: Il modello fatica enormemente a separare i titoli nobiliari o professionali dai nomi propri adiacenti. Molto spesso "Conte Ugolino" o "Don Abbondio" vengono interamente classificati come
PER, assorbendo la classeTITe sporcando l'estrazione. - Sovrapposizione Religiosa (REL vs LOC vs PER): L'italiano antico è denso di riferimenti religiosi che confondono il modello. "San Pietro" viene spesso predetto in modo inconsistente: a volte come persona (
PER), a volte come luogo (LOC, es. la Basilica) o come entità religiosa (REL), abbattendo le metriche di queste tre categorie. - Bias del Dataset Sintetico: Poiché il 60% del dataset è stato generato artificialmente (LLM), il modello potrebbe aver appreso dei pattern sintattici ricorrenti o "troppo perfetti" non sempre riscontrabili nei veri testi del XV secolo.
- Dipendenza dal Pre-processing: Il modello è stato addestrato su testi storici puliti. Se gli fornite in pasto un testo grezzo pieno di artefatti OCR (es. "L udovico", "1l C0nte"), le prestazioni NER crolleranno drasticamente. Richiede un modulo di OCR cleaning a monte.
- Arcaismi e Tokenizer: Il modello base (
bert-italian-cased) ha un vocabolario moderno. Parole con ortografie arcaiche (es. et, de lo, virtute) vengono spezzate in moltissimi sub-token, riducendo a volte la capacità del modello di riconoscerle come entità unitarie.
- Downloads last month
- 76
Model tree for aendriu/bert-ner-italian-historical
Base model
osiria/bert-italian-cased-ner