Cos'è

Anatema è un progetto di ricerca linguistica e machine learning, senza alcuno scopo di lucro. Non ci sono account, non viene raccolto nessun dato personale: solo le frasi che scrivi e i punteggi che ne derivano, in forma anonima.

Perché proprio la blasfemia

Al netto dell'aspetto goliardico, l'argomento non è scelto a caso. La bestemmia italiana è un terreno linguisticamente difficile da trattare bene: combina figure religiose, insulti, animali, accuse e costruzioni sintattiche in modi estremamente creativi e regionalmente variabili. È un banco di prova serio per un classificatore, proprio per la ricchezza e la fantasia con cui la lingua italiana la genera.

Come funziona

Scrivi una frase, il sistema la valuta e restituisce un giudizio (bestemmia o no) insieme a due punteggi: quanto è "potente" e quanto è creativa rispetto a tutto quello che ha già visto.

I modelli usati

Il giudizio finale nasce da una media pesata di tre modelli diversi, ciascuno con i suoi punti di forza:

Un progetto in evoluzione

Come ogni progetto di machine learning gestito seriamente, anche questo prevede un processo di iterazione: il dataset si arricchisce, i modelli vengono riaddestrati, gli errori vengono corretti quando emergono. Il giudizio che ricevi oggi non è definitivo: il sistema migliora nel tempo, non è statico.

Da dove vengono i dati

Il dataset è costruito ed etichettato a mano, con il contributo di alcuni volontari, non recuperato automaticamente da qualche parte. Tutto fatto da zero.

Una precisazione che ci tengo a fare L'intento di questo progetto non è in alcun modo offendere qualcuno o prendere in giro la fede di chicchessia. È un esercizio di linguistica computazionale che usa un fenomeno linguistico italiano autentico come materiale di studio. Se qualcosa nel sito ti ha turbato, scrivimi pure: il link qui sotto serve anche a quello.