Lezioni di linguistica computazionale – ELISABETTA JEZEK
Esame in tre parti:
Progetto scritto: approfondimento su uno degli strumenti del corso:
Lettura e commento di un articolo scientifico (da scegliere + commento)
o Survey su un argomento (da scegliere + commento)
o Report di un progetto sperimentale (p.e. annotazione automatica dati)
o
(progetto) Almeno 4 max 5 pg, formato due colonne pdf da inviare al docente 7 gg
prima esame
Presentazione orale progetto:
Presentazione progetto con slide circa 8’
o Domande e chiarimenti progetto
o
Verifica orale conoscenze programma del corso
1
LEZIONE 1, 06/11/2025
LINGUISTICA COMPUTAZIONALE VS NLP
30/11/2022: OpenAI accesso pubblico a “macchine parlanti” (LLM – large language models)
chatGPT
come (e con) in generative AI (genera
(nel corso vedremo come si costruisce un LLM)
linguaggio) un prodotto della linguistica computazionale > AI DEL LINGUAGGIO.
Computazionale calcolare con il computer
con il pc => usata per tutte le discipline che
usano capacità di calcolo del computer e i vari strumenti, oltre ai sistemi per svolgere
ricerche, eseguire compiti, effettuare previsioni.
Linguistica computazionale:
In ambito umanistico per indicare ambito in cui si fa ricerca sulle lingue – si può
considerare un ramo della linguistica – che consentono di analizzare i testi in modo
automatico per studiare i fenomeni linguistici.
NLP: Area di ricerca finalizzata a scopi applicativi (che non sia la comprensione delle teorie
linguistiche etc) area di ricerca in cui si ha a che fare con il linguaggio
linguaggio naturale = linguaggio prodotto da essere umani;
compiti
“disciplina volta a sviluppare sistemi per risolvere dei linguistici, simulando
le competenze e i comportamenti linguistici degli esseri umani” (definizione)
grosso problema: noi non sappiamo come elaboriamo il linguaggio (= come lo
impariamo, come lo usiamo esistono teorie che si avvalgono di studi neurali =
neurolinguistica) quindi insegnarlo a una macchina è un grosso problema;
task(s):
Compiti = hanno tutti dei determinati scopi
Task storico di NLP = traduzione automatica (anni ’50) un sistema prende
☼ come input un testo in una lingua e dà in tempo reale come output un testo
linguistico
in una lingua diversa è un task di tipo in cui l’output è
linguistico. Possono essere non linguistici (= eseguono comandi “spegni la
luce” output: azione)
Language detection la macchina che sa quale è la lingua di input
(simula ciò che noi sappiamo fare riconoscere)
Traduzione in tempo reale (sistemi CAT computer-aided translation)
Sottotitolaggio automatico
Information retrieval ambito della linguistica computazionale che recupera
☼ informazioni. Si sviluppano tecniche che diventano dei sistemi per rispondere
ai bisogni di un utente, che formula una domanda (bisogno informativo –
query) e recuperano le informazioni a partire da identificazione oggetti che la
contengono (documenti, pagine web, immagini) = mettono etichette su testi,
parole. Per web search usiamo search engines che sono l’interfaccia di
sistemi complessi che indicizzano enormi quantità di testi e recuperano
documenti effettuandone un ranking – si inseriscono delle key words
È cambiato il modo di interagire: web search > answer search (AI
overview in Google) (stiamo vivendo questo cambiamento)
Information retrival affiancato da tecniche di mark up semantico ‘leggono’
☼ doc in rete e li etichettano con metadati tag che danno info su contenuto
documenti
KNOLEDGE GRAPHS – nostre ricerche che possono restituire pannelli
informativi (tipo quelli di Wikipedia su google) tramite i knowledge
graphs che estraggono info dai doc in rete e le rappresentano come
relazioni tra concetti ed entità
(speech recognition)
Sistemi di riconoscimento vocale
☼ Trascrivono automaticamente un segnale acustico in formato
simbolico/testuale 2
Su base di info riguardo associazioni tra segnali e parole e cercano la
parola che ha la probabilità più alta di essere associata al segnale
acustico percepito
Ci danno risposte
Eseguono comandi
Conoscono il contesto (geolocalizzazione)
Conoscono la mia rete sociale
Agenti conversazionali
☼ Sistemi progettati per comunicare con utenti umani (chatterbot o
chatbot)
Alcuni usano solo input e output di tipo testuale mentre altri
prevedono modalità più complesse
Primo chatbot: Eliza, 1960 – psicologia artificiale
2022: OpenAI che propone chatGPT GPT = Generative Pre-
Trained Transformer (è un tipo di rete neurale. Transformer: ultima
generazione di rete neurale)
Test di Touring
☼ Suggerito nel 1950 per determinare se una macchina esibisce un
comportamento linguistico umano intelligente:
Interazione in cui ci sono tre partecipanti (ex umano giudice,
ex umano testato, sistema informatico) in ambienti separati,
non si vedono. C’è interazione tra di loro attraverso il
linguaggio. Il giudice deve stabilire chi è essere umano e chi è
macchina. Se giudice non in grado di distinguere: macchina
che supera il test apparentemente
Test di Touring superato da ChatGPT
Superato perché molti interagiscono come se stessero
parlando con un essere umano cambia il tipo di
ciò non indica che chatGPT sia intelligente
comunicazione
imita i nostri modelli linguistici senza possedere
un’autentica capacità di comprendere il linguaggio naturale
= non sono macchine pensanti, hanno la competenza (e
l’informazione) ma non la comprensione superato nelle
modalità in cui risponde ma non nella sostanza
Processing in NLP: centrale l’idea che i computer comprendessero i testi oltre
☼ che produrli, ma abbiamo preso delle ‘scorciatoie’ (Cristianini) quella
statistica:
Se noi studiamo statisticamente comportamento linguistico umano, le
relazioni statistiche possono essere riprodotte senza capirne il
contenuto MA sono sufficienti a emulare il comportamento linguistico
non costruiamo più macchine per comprendere ma per emulare =
motivo per cui i sistemi presentano errori che consideriamo banali
(come la traduzione automatica)
In presenza di sufficienti dati si può usare esclusivamente
(machine learning
l’apprendimento statistico – come si
insegna qualcosa a un sistema)
Speech to text
☼ Text to speech
☼ Text classification
☼ Text summarizing
☼ Opinion mining
☼ Author profiling
☼ Sentiment analysis
☼ scopi di previsione per le previsioni di risultati elettorali a partire da
linguaggio dei social + esperimento brexit
usata in modo commerciale: estraggono dalle recensioni
Emotion detection
☼ 3
Hate speech detection
☼ Identificazione presenza fake news
☼ Area medica
☼ Analisi automatica cartelle cliniche che possono servire come
base
diagnosi da usare come per prendere decisioni molto
informate
Task eseguito da un modello computazionale deep learning
NLP connesso al machine learning (apprendimento automatico – perché è
legato alle reti neurali profonde), informatica, ingegneria informatica
Rapporti con intelligenza artificiale:
Nasce negli anni 50 (1955, università di Standford) programmi capaci di fare
ragionamenti – legati alla matematica ‘the science and engineering of making
intelligent machines, especially intelligent computer programs’
Moderne applicazioni che non implicano creazione di macchine in grado di sviluppare
coscienza autonoma, apprezzamento del contesto nel quale si opera o una visione
del mondo
Non mostrano alcuna forma di intelligenza simile a quella umana sia per capacità che
per consapevolezza
Anni 50: volevamo tradurre in modo automatico, trascrivere parlato, riconoscere
oggetti e volti, rispondere a domande
Oggi: compiti come vagliare domande di lavoro, assistere decisioni giudiziarie,
decidere se concedere un prestito …
Intelligenza artificiale che implica delegare decisioni alle macchine
Ci sono sfide etiche compito scienze umani e sociali (Cristianini)
Linguistica computazionale:
Nasce intorno al 1950
Index Thomisticus
Italia: progetto pioneristico di Busa (padre gesuita) costruzione
corpus elettronico opere Tommaso d’Aquino, sponsorizzato da IBM, costituito da
circa 10mln di parole ACL
1962: Association for Computational Linguistics –
Primo tentativo traduzione automatica, 1954: dimostrazione pubblica, 49 frasi da
russo > inglese usano dizionario di 250 parole e 6 regole grammaticali settore
spinto da situazione storicopolitica traduzione automatica supportata da fondi
anche militari
Fasi fondamentali linguistica computazionale che corrispondono a sviluppi tecnologici
sistemi informatici evoluzioni nella disciplina dettate dallo sviluppo tecnologico che
ha a che fare con:
Aumento della disponibilità di dati linguistici già in formato digitale primi
☼ corpora = trasferimenti di dati scritti su supporto digitale – big data che ha
fatto in modo di costruire i LLG, addestrati per risponderci con grande
disponibilità di dati
Capacità dei computer di calcolare e memorizzare
☼
Evoluzione dei modelli:
Modelli a regole
☼ Modelli di machine learning (statistici)
☼ Modelli di deep learning (reti neurali)
☼ Modelli fondazionali (LLM attraverso le reti neurali) fanno più task
☼
LEZIONE 2, 07/11/2025
modelli a regole modelli machine learning statistici deep learning
Si è partiti con i > quindi >
modelli fondazionali
(comunque statistici ma lavorano con le reti neurali) > (attuali) 4
Modello computazionale
Complesso oggetto di calcolo, fatto di algoritmi, funzioni, parametri, variabili implicite
o esplicite con i rispettivi valori e/o pesi;
È applicato ai dati linguistici ed è in grado di svolgere in modo automatico e con il
miglior esito possibile un compito linguistico, replicando ciò che noi umani siamo
capaci di fare con il linguaggio
MODELLI A REGOLE
Sono i primi modelli, da metà 50 (primo modello del 1954 – esempio di
☼ traduzione da inglese a russo, 250 vocaboli, 6 regole)
Risolvono i task usando sistemi di regole creati a mano da esperti (linguisti e
☼ informatici)
Regole che formalizzano le strutture lessicali e grammaticali delle lingue
☼ P.e.: Named Entity Recognition (NER) riconoscimento di nomi
propri di persone, luoghi e organizzazione nei testi
parsing)
Non sono abbandonati (come NER o
☼
MODELLI STATISTICI
Metà anni 90
☼ Modelli machine learning (= apprendimento automatico)
☼ Non si basano su regole definite a priori da un esperto
☼ Vengono costruiti a partire da osservazione statistica di grandi quantità di
☼ dati linguistici
Imparano a risolvere task linguistici usando regolarità statistiche estratte
☼ automaticamente dai dati estraggono i pattern linguistici
Possono essere costruiti con diversi tipi di algoritmi (SVM, regressione lineare
☼ e logistica, …)
MODELLI NEURALI (deep learning)
Primi anni 10 anni 2000
☼ Modelli di deep learning
☼ Sono anche questi modelli di machine learning ma usano le reti neurali dal
☼ punto di vista algoritmico
Imparano a risolvere task attraverso reti neurali artificiali (= modelli
☼ computazionali il cui nome e la struttura sono ispirati al funzionamento
neurologico del cervello umano, imitando il modo in cui i neuroni biologici si
inviano segnali)
Primi studi: anni ’60 (Rosenblatt 1962, Rumelhart 1986)
☼ Sono modelli computazionali composti da un insieme interconnesso di nodi
☼ (= “neurone” della rete), che costituiscono ciascuno una piccola e singola
unità di calcolo
RETE NEURALE
☼ Nodi connessi in strati:
Input (di entrata)
Nascosti (dove avviene il calcolo computazionale; possono
essere più di uno) ‘nascosti’ perché non sappiamo che
(black boxes)
calcoli avvengono
Output (di uscita)
DEEP NEURAL NETWORKS:
☼ Deve consistere almeno in due livelli
LARGE LANGUAGE MODELS (fondazionali)
Probabilistici, usano reti neurali
☼ Predicono
☼ la probabilità di sequenza di lettere
probabilità di occorrenza di una lettera, parola o frase (< generativo)
Sono costituiti con modelli neurali
☼ Usano corpora di enormi dimensioni per svolgere un determinato task
☼ Su tali dati si stima la probabilità di occorrenza
☼ Fondazionali:
☼ 5
pre-trained
sono stati in un task di predizione ma possono essere
adattati specializzandoli con una piccola porzione di dati specifici per
(fine-tuning)
il task che voglio eseguire
task che vengono svolti dal modello dando in input un’istruzione
prompt
accuratamente costruita = ( descrizione in linguaggio
naturale del task da svolgere)
Comunità della linguistica computazionale (ACL), ci sanno tante conferenze diverse sia da
quelle di linguistica che quelle di informatica (EACL, AACL, EMNLP, …), ci sono delle riviste
(Computational Linguistics, JNLE, …). In Italia: Associazione Italiana di Linguistica
Computazionale (AIILC) https://www.ai-lc.it/en/ (prendono in particolare l’italiano come lingua
di analisi); repertori di papers: ACL Anthology, ArXic, sezione computation and language;
scuole ESSLLI, in Italia Lectures on Computational Linguistics (quest’anno a Bolzano!!!),
campagne di valutazione di sistemi (shared task) https://www.evalita.it
DATI LINGUISTICI, CORPORA, E GIUDIZI DI ACCETTIBILITÀ – preparare i testi per l’utilizzo
computazionale
Dati linguistici
Il prodotto dell’attività linguistica dei parlanti di una lingua che sono oggetto di
Processo di analisi
☼ Processo di addestramento automatico
☼
Forniscono evidenza empirica
Possono essere molto strutturati o poco, di grande ampiezza o molto ridotta
Tre tipi di dati:
Introspettivi (1)
☼ Sperimentali (2)
☼ Naturali (3)
☼
1 e 3: molto usati nella linguistica computazionale.
Dati introspettivi:
Quelli che lo studioso ottiene interrogando la propria (e quella di altri parlanti)
☼ competenza linguistica che confermano o meno i suoi giudizi relativi
all’accettabilità
Hanno costituito tipologia di dato principale usata per elaborazione di teorie
☼ linguistiche soprattutto di orientamento formale giudizio
Sono fondamentali per la valutazione dei sistemi computazionali
☼ di accettabilità
Dati sperimentali:
Raccolti attraverso un questionario e in un contesto sperimentale controllato
☼ Vengono raccolti con variabili sociolinguistiche
☼ Sono importanti negli approcci psicolinguistici e cognitivi allo studio del
☼ linguaggio
Dati naturali:
Dati linguistici prodotti in modo spontaneo dai parlanti
☼ Hanno grande rilevanza i corpora nell’analisi linguistica
☼
1: per valutare i modelli;
3: per costruire i modelli
Corpora Insieme di testi disponibili in formato digitale, selezionati e organizzati
Funzionali all’analisi linguistica e computazionale (input dei sistemi computazionali)
Campione rappresentativo della lingua
TIPOLOGIE DI TESTI:
Nativi digitali;
☼ Cartacei digitalizzati (Optical Character Recognition -OCR)
☼ 6
Linguistica dei corpora
Disciplina che studia i fenomeni linguistici a partire da osservazione sistematica testi
Ha radici nella tradizione anglosassone
Tipi di corpora (a possiamo accedervi con un’interfaccia)
Generali, non costruiti per una specifica applicazione o specifico obiettivo di ricerca
Di riferimento, per lo studio di una lingua specifica e concepiti come standard per la
lingua stessa
Bilanciati, contenenti un ampio spettro di tipi testuali (stampa, prosa, letteraria,
accademica, narrativa) e di domini tematici dei testi
Specialistici, concepiti per lo studio della variazione di dominio, di registro, …; p.e.
corpora di linguaggio medico, giornalistico, giuridico, politico, …
Di lingua scritta e di lingua parlata trascritta, contenenti p.e. conversazioni in
presenza, conversazioni telefoniche, trasmissioni, talk shows
Tratti dal web (generali)
Interattivi, prodotti da uso tecnologie p.e. chat whatsapp
Audio, anche per sviluppo di sistemi per il riconoscimento automatico del parlato
Multimodali, audio-visivi
Sincronici, che rispecchiano la lingua in un preciso momento della sua storia
Diacronici, composti da testi appartenenti a periodi storici diversi e pensati per
studiare il cambiamento di una lingua nel tempo
Paralleli, che contengono sia testi in L1 che la traduzione in un’altra lingua
Paralleli allineati, importanti per lo sviluppo di sistemi di traduzione automatica in cui
l’unità tipica di allineamento tra le due lingue è la frase learner corpora
Apprendenti, contengono dati di apprendenti di una seconda lingua =
Ampiezza di un corpus token
Generalmente calcolata in base al numero di (unità minime che compongono
un corpus) che includono le occorrenze delle forme delle parole, la punteggiatura, i
numeri, i simboli, le sigle
Copora di lingua parlata: ampiezza = durata registrazione
Generazioni di corpora
Prima generazione:
Digitalizza
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
-
Linguistica computazionale - Appunti
-
Appunti di Linguistica computazionale e intelligenza artificiale
-
Linguistica Computazionale appunti lezione prof Alessandro Lenci e Felice Dell'Orletta
-
Appunti esame linguistica acquisizionale