Cos'è
Anatema è un progetto di ricerca linguistica e machine learning, senza alcuno scopo di lucro. Non ci sono account, non viene raccolto nessun dato personale: solo le frasi che scrivi e i punteggi che ne derivano, in forma anonima.
Perché proprio la blasfemia
Al netto dell'aspetto goliardico, l'argomento non è scelto a caso. La bestemmia italiana è un terreno linguisticamente difficile da trattare bene: combina figure religiose, insulti, animali, accuse e costruzioni sintattiche in modi estremamente creativi e regionalmente variabili. È un banco di prova serio per un classificatore, proprio per la ricchezza e la fantasia con cui la lingua italiana la genera.
Come funziona
Scrivi una frase, il sistema la valuta e restituisce un giudizio (bestemmia o no) insieme a due punteggi: quanto è "potente" e quanto è creativa rispetto a tutto quello che ha già visto.
I modelli usati
Il giudizio finale nasce da una media pesata di tre modelli diversi, ciascuno con i suoi punti di forza:
Un progetto in evoluzione
Come ogni progetto di machine learning gestito seriamente, anche questo prevede un processo di iterazione: il dataset si arricchisce, i modelli vengono riaddestrati, gli errori vengono corretti quando emergono. Il giudizio che ricevi oggi non è definitivo: il sistema migliora nel tempo, non è statico.
Da dove vengono i dati
Il dataset è costruito ed etichettato a mano, con il contributo di alcuni volontari, non recuperato automaticamente da qualche parte. Tutto fatto da zero.