BERT NER – Letteratura Storica Italiana

Modello BERT Italian Cased fine-tuned per il riconoscimento di entità nominate (NER) su testi letterari e storici italiani (XV–XX secolo). Questo modello fa parte di un progetto di tesi di laurea presso l'Università Federico II di Napoli.

Label Supportate e Prestazioni (F1 Score)

Lo schema di annotazione (IOB2) supporta 9 classi di entità progettate specificamente per il dominio storico-letterario. La tabella mostra la composizione semantica e i punteggi F1 ottenuti in fase di test:

Label Descrizione Esempi F1 Score
PER Persone e Personaggi Dante, Francesco Petrarca, Ludovico 0.81
LOC Luoghi (reali o fittizi) Roma, Firenze, Costantinopoli, Purgatorio 0.71
DATE Riferimenti temporali, anni, epoche 1628, quindicesimo secolo 0.66
ORG Organizzazioni / enti Santa Sede, Senato, Università di Bologna 0.60
WORK Titoli di opere letterarie/artistiche Divina Commedia, Operette Morali 0.58
TIT Titoli, cariche, appellativi Papa, Conte, Messer, Imperatore 0.50
EVENT Eventi storici o narrativi Concilio di Trento, Battaglia di Lepanto 0.36
REL Entità religiose Dio, Cristo, Vergine Maria, Spirito Santo 0.36
FANT Creature / elementi fantastici draghi, Cerbero, ippogrifo, diavolo 0.11

🚀 Uso Rapido

Puoi utilizzare il modello direttamente tramite la pipeline di HuggingFace:

from transformers import pipeline

ner = pipeline("ner", model="aendriu/bert-ner-italian-historical", aggregation_strategy="simple")
results = ner("Dante Alighieri nacque a Firenze e scrisse la Divina Commedia.")
for ent in results:
    print(f"{ent['word']:30s}  {ent['entity_group']:6s}  {ent['score']:.4f}")

Limiti Noti e Problemi Aperti (Known Limitations)

Nonostante i buoni risultati sulle classi principali, il modello presenta alcune importanti criticità e limiti strutturali di cui tenere conto durante l'utilizzo:

  1. Fallimento sulle Classi Rare: Come evidenziato dai punteggi F1, il modello è inaffidabile per le classi FANT (0.11), EVENT (0.36) e REL (0.36). Non usatelo se il vostro scopo primario è estrarre eventi storici o creature mitologiche.
  2. Ambiguità TIT / PER: Il modello fatica enormemente a separare i titoli nobiliari o professionali dai nomi propri adiacenti. Molto spesso "Conte Ugolino" o "Don Abbondio" vengono interamente classificati come PER, assorbendo la classe TIT e sporcando l'estrazione.
  3. Sovrapposizione Religiosa (REL vs LOC vs PER): L'italiano antico è denso di riferimenti religiosi che confondono il modello. "San Pietro" viene spesso predetto in modo inconsistente: a volte come persona (PER), a volte come luogo (LOC, es. la Basilica) o come entità religiosa (REL), abbattendo le metriche di queste tre categorie.
  4. Bias del Dataset Sintetico: Poiché il 60% del dataset è stato generato artificialmente (LLM), il modello potrebbe aver appreso dei pattern sintattici ricorrenti o "troppo perfetti" non sempre riscontrabili nei veri testi del XV secolo.
  5. Dipendenza dal Pre-processing: Il modello è stato addestrato su testi storici puliti. Se gli fornite in pasto un testo grezzo pieno di artefatti OCR (es. "L udovico", "1l C0nte"), le prestazioni NER crolleranno drasticamente. Richiede un modulo di OCR cleaning a monte.
  6. Arcaismi e Tokenizer: Il modello base (bert-italian-cased) ha un vocabolario moderno. Parole con ortografie arcaiche (es. et, de lo, virtute) vengono spezzate in moltissimi sub-token, riducendo a volte la capacità del modello di riconoscerle come entità unitarie.
Downloads last month
76
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for aendriu/bert-ner-italian-historical

Finetuned
(1)
this model