Estratto del documento

Lezioni di linguistica computazionale – ELISABETTA JEZEK

Esame in tre parti:

Progetto scritto: approfondimento su uno degli strumenti del corso:

 Lettura e commento di un articolo scientifico (da scegliere + commento)

o Survey su un argomento (da scegliere + commento)

o Report di un progetto sperimentale (p.e. annotazione automatica dati)

o

(progetto) Almeno 4 max 5 pg, formato due colonne pdf da inviare al docente 7 gg

 prima esame

Presentazione orale progetto:

 Presentazione progetto con slide circa 8’

o Domande e chiarimenti progetto

o

Verifica orale conoscenze programma del corso

 1

LEZIONE 1, 06/11/2025

LINGUISTICA COMPUTAZIONALE VS NLP

30/11/2022: OpenAI accesso pubblico a “macchine parlanti” (LLM – large language models)

chatGPT

come (e con) in generative AI (genera

(nel corso vedremo come si costruisce un LLM)

linguaggio) un prodotto della linguistica computazionale > AI DEL LINGUAGGIO.

Computazionale calcolare con il computer

con il pc => usata per tutte le discipline che

 

usano capacità di calcolo del computer e i vari strumenti, oltre ai sistemi per svolgere

ricerche, eseguire compiti, effettuare previsioni.

Linguistica computazionale:

In ambito umanistico per indicare ambito in cui si fa ricerca sulle lingue – si può

 considerare un ramo della linguistica – che consentono di analizzare i testi in modo

automatico per studiare i fenomeni linguistici.

NLP: Area di ricerca finalizzata a scopi applicativi (che non sia la comprensione delle teorie

 linguistiche etc) area di ricerca in cui si ha a che fare con il linguaggio

 

linguaggio naturale = linguaggio prodotto da essere umani;

compiti

“disciplina volta a sviluppare sistemi per risolvere dei linguistici, simulando

 le competenze e i comportamenti linguistici degli esseri umani” (definizione) 

grosso problema: noi non sappiamo come elaboriamo il linguaggio (= come lo

impariamo, come lo usiamo esistono teorie che si avvalgono di studi neurali =

neurolinguistica) quindi insegnarlo a una macchina è un grosso problema;

task(s):

Compiti = hanno tutti dei determinati scopi

 Task storico di NLP = traduzione automatica (anni ’50) un sistema prende

☼ come input un testo in una lingua e dà in tempo reale come output un testo

linguistico

in una lingua diversa è un task di tipo in cui l’output è

linguistico. Possono essere non linguistici (= eseguono comandi “spegni la

luce” output: azione)

Language detection la macchina che sa quale è la lingua di input

 

(simula ciò che noi sappiamo fare riconoscere)

Traduzione in tempo reale (sistemi CAT computer-aided translation)

 

Sottotitolaggio automatico

Information retrieval ambito della linguistica computazionale che recupera

☼ informazioni. Si sviluppano tecniche che diventano dei sistemi per rispondere

ai bisogni di un utente, che formula una domanda (bisogno informativo –

query) e recuperano le informazioni a partire da identificazione oggetti che la

contengono (documenti, pagine web, immagini) = mettono etichette su testi,

parole. Per web search usiamo search engines che sono l’interfaccia di

sistemi complessi che indicizzano enormi quantità di testi e recuperano

documenti effettuandone un ranking – si inseriscono delle key words

È cambiato il modo di interagire: web search > answer search (AI

 overview in Google) (stiamo vivendo questo cambiamento)

Information retrival affiancato da tecniche di mark up semantico ‘leggono’

☼ doc in rete e li etichettano con metadati tag che danno info su contenuto

documenti

KNOLEDGE GRAPHS – nostre ricerche che possono restituire pannelli

 informativi (tipo quelli di Wikipedia su google) tramite i knowledge

graphs che estraggono info dai doc in rete e le rappresentano come

relazioni tra concetti ed entità

(speech recognition)

Sistemi di riconoscimento vocale

☼ Trascrivono automaticamente un segnale acustico in formato

 simbolico/testuale 2

Su base di info riguardo associazioni tra segnali e parole e cercano la

 parola che ha la probabilità più alta di essere associata al segnale

acustico percepito

Ci danno risposte

 Eseguono comandi

 Conoscono il contesto (geolocalizzazione)

 Conoscono la mia rete sociale

Agenti conversazionali

☼ Sistemi progettati per comunicare con utenti umani (chatterbot o

 chatbot)

Alcuni usano solo input e output di tipo testuale mentre altri

 prevedono modalità più complesse

Primo chatbot: Eliza, 1960 – psicologia artificiale

 2022: OpenAI che propone chatGPT GPT = Generative Pre-

 

Trained Transformer (è un tipo di rete neurale. Transformer: ultima

generazione di rete neurale)

Test di Touring

☼ Suggerito nel 1950 per determinare se una macchina esibisce un

 comportamento linguistico umano intelligente:

Interazione in cui ci sono tre partecipanti (ex umano giudice,

 ex umano testato, sistema informatico) in ambienti separati,

non si vedono. C’è interazione tra di loro attraverso il

linguaggio. Il giudice deve stabilire chi è essere umano e chi è

macchina. Se giudice non in grado di distinguere: macchina

che supera il test apparentemente

Test di Touring superato da ChatGPT

 

Superato perché molti interagiscono come se stessero

 parlando con un essere umano cambia il tipo di

ciò non indica che chatGPT sia intelligente

comunicazione 

imita i nostri modelli linguistici senza possedere

un’autentica capacità di comprendere il linguaggio naturale

= non sono macchine pensanti, hanno la competenza (e

l’informazione) ma non la comprensione superato nelle

modalità in cui risponde ma non nella sostanza

Processing in NLP: centrale l’idea che i computer comprendessero i testi oltre

☼ che produrli, ma abbiamo preso delle ‘scorciatoie’ (Cristianini) quella

statistica:

Se noi studiamo statisticamente comportamento linguistico umano, le

 relazioni statistiche possono essere riprodotte senza capirne il

contenuto MA sono sufficienti a emulare il comportamento linguistico

non costruiamo più macchine per comprendere ma per emulare =

motivo per cui i sistemi presentano errori che consideriamo banali

(come la traduzione automatica)

In presenza di sufficienti dati si può usare esclusivamente

 (machine learning

l’apprendimento statistico – come si

insegna qualcosa a un sistema)

Speech to text

☼ Text to speech

☼ Text classification

☼ Text summarizing

☼ Opinion mining

☼ Author profiling

☼ Sentiment analysis

☼ scopi di previsione per le previsioni di risultati elettorali a partire da

 linguaggio dei social + esperimento brexit

usata in modo commerciale: estraggono dalle recensioni

Emotion detection

☼ 3

Hate speech detection

☼ Identificazione presenza fake news

☼ Area medica

☼ Analisi automatica cartelle cliniche che possono servire come

 base

diagnosi da usare come per prendere decisioni molto

informate

Task eseguito da un modello computazionale deep learning

NLP connesso al machine learning (apprendimento automatico – perché è

legato alle reti neurali profonde), informatica, ingegneria informatica

Rapporti con intelligenza artificiale:

Nasce negli anni 50 (1955, università di Standford) programmi capaci di fare

 

ragionamenti – legati alla matematica ‘the science and engineering of making

intelligent machines, especially intelligent computer programs’

Moderne applicazioni che non implicano creazione di macchine in grado di sviluppare

 coscienza autonoma, apprezzamento del contesto nel quale si opera o una visione

del mondo

Non mostrano alcuna forma di intelligenza simile a quella umana sia per capacità che

 per consapevolezza

Anni 50: volevamo tradurre in modo automatico, trascrivere parlato, riconoscere

 oggetti e volti, rispondere a domande

Oggi: compiti come vagliare domande di lavoro, assistere decisioni giudiziarie,

 decidere se concedere un prestito …

Intelligenza artificiale che implica delegare decisioni alle macchine

 Ci sono sfide etiche compito scienze umani e sociali (Cristianini)

 

Linguistica computazionale:

Nasce intorno al 1950

 Index Thomisticus

Italia: progetto pioneristico di Busa (padre gesuita) costruzione

 

corpus elettronico opere Tommaso d’Aquino, sponsorizzato da IBM, costituito da

circa 10mln di parole ACL

1962: Association for Computational Linguistics –

 Primo tentativo traduzione automatica, 1954: dimostrazione pubblica, 49 frasi da

 russo > inglese usano dizionario di 250 parole e 6 regole grammaticali settore

spinto da situazione storicopolitica traduzione automatica supportata da fondi

anche militari

Fasi fondamentali linguistica computazionale che corrispondono a sviluppi tecnologici

 sistemi informatici evoluzioni nella disciplina dettate dallo sviluppo tecnologico che

ha a che fare con:

Aumento della disponibilità di dati linguistici già in formato digitale primi

☼ corpora = trasferimenti di dati scritti su supporto digitale – big data che ha

fatto in modo di costruire i LLG, addestrati per risponderci con grande

disponibilità di dati

Capacità dei computer di calcolare e memorizzare

Evoluzione dei modelli:

 Modelli a regole

☼ Modelli di machine learning (statistici)

☼ Modelli di deep learning (reti neurali)

☼ Modelli fondazionali (LLM attraverso le reti neurali) fanno più task

LEZIONE 2, 07/11/2025

modelli a regole modelli machine learning statistici deep learning

Si è partiti con i > quindi >

modelli fondazionali

(comunque statistici ma lavorano con le reti neurali) > (attuali) 4

Modello computazionale

Complesso oggetto di calcolo, fatto di algoritmi, funzioni, parametri, variabili implicite

 o esplicite con i rispettivi valori e/o pesi;

È applicato ai dati linguistici ed è in grado di svolgere in modo automatico e con il

 miglior esito possibile un compito linguistico, replicando ciò che noi umani siamo

capaci di fare con il linguaggio

MODELLI A REGOLE

 Sono i primi modelli, da metà 50 (primo modello del 1954 – esempio di

☼ traduzione da inglese a russo, 250 vocaboli, 6 regole)

Risolvono i task usando sistemi di regole creati a mano da esperti (linguisti e

☼ informatici)

Regole che formalizzano le strutture lessicali e grammaticali delle lingue

☼ P.e.: Named Entity Recognition (NER) riconoscimento di nomi

 

propri di persone, luoghi e organizzazione nei testi

parsing)

Non sono abbandonati (come NER o

MODELLI STATISTICI

 Metà anni 90

☼ Modelli machine learning (= apprendimento automatico)

☼ Non si basano su regole definite a priori da un esperto

☼ Vengono costruiti a partire da osservazione statistica di grandi quantità di

☼ dati linguistici

Imparano a risolvere task linguistici usando regolarità statistiche estratte

☼ automaticamente dai dati estraggono i pattern linguistici

Possono essere costruiti con diversi tipi di algoritmi (SVM, regressione lineare

☼ e logistica, …)

MODELLI NEURALI (deep learning)

 Primi anni 10 anni 2000

☼ Modelli di deep learning

☼ Sono anche questi modelli di machine learning ma usano le reti neurali dal

☼ punto di vista algoritmico

Imparano a risolvere task attraverso reti neurali artificiali (= modelli

☼ computazionali il cui nome e la struttura sono ispirati al funzionamento

neurologico del cervello umano, imitando il modo in cui i neuroni biologici si

inviano segnali)

Primi studi: anni ’60 (Rosenblatt 1962, Rumelhart 1986)

☼ Sono modelli computazionali composti da un insieme interconnesso di nodi

☼ (= “neurone” della rete), che costituiscono ciascuno una piccola e singola

unità di calcolo

RETE NEURALE

☼ Nodi connessi in strati:

 Input (di entrata)

 Nascosti (dove avviene il calcolo computazionale; possono

 essere più di uno) ‘nascosti’ perché non sappiamo che

(black boxes)

calcoli avvengono

Output (di uscita)

DEEP NEURAL NETWORKS:

☼ Deve consistere almeno in due livelli

LARGE LANGUAGE MODELS (fondazionali)

 Probabilistici, usano reti neurali

☼ Predicono

☼ la probabilità di sequenza di lettere

 probabilità di occorrenza di una lettera, parola o frase (< generativo)

Sono costituiti con modelli neurali

☼ Usano corpora di enormi dimensioni per svolgere un determinato task

☼ Su tali dati si stima la probabilità di occorrenza

☼ Fondazionali:

☼ 5

pre-trained

sono stati in un task di predizione ma possono essere

 adattati specializzandoli con una piccola porzione di dati specifici per

(fine-tuning)

il task che voglio eseguire

task che vengono svolti dal modello dando in input un’istruzione

 prompt

accuratamente costruita = ( descrizione in linguaggio

naturale del task da svolgere)

Comunità della linguistica computazionale (ACL), ci sanno tante conferenze diverse sia da

quelle di linguistica che quelle di informatica (EACL, AACL, EMNLP, …), ci sono delle riviste

(Computational Linguistics, JNLE, …). In Italia: Associazione Italiana di Linguistica

Computazionale (AIILC) https://www.ai-lc.it/en/ (prendono in particolare l’italiano come lingua

di analisi); repertori di papers: ACL Anthology, ArXic, sezione computation and language;

scuole ESSLLI, in Italia Lectures on Computational Linguistics (quest’anno a Bolzano!!!),

campagne di valutazione di sistemi (shared task) https://www.evalita.it

DATI LINGUISTICI, CORPORA, E GIUDIZI DI ACCETTIBILITÀ – preparare i testi per l’utilizzo

computazionale

Dati linguistici

Il prodotto dell’attività linguistica dei parlanti di una lingua che sono oggetto di

 Processo di analisi

☼ Processo di addestramento automatico

Forniscono evidenza empirica

 Possono essere molto strutturati o poco, di grande ampiezza o molto ridotta

 Tre tipi di dati:

 Introspettivi (1)

☼ Sperimentali (2)

☼ Naturali (3)

1 e 3: molto usati nella linguistica computazionale.

Dati introspettivi:

 Quelli che lo studioso ottiene interrogando la propria (e quella di altri parlanti)

☼ competenza linguistica che confermano o meno i suoi giudizi relativi

all’accettabilità

Hanno costituito tipologia di dato principale usata per elaborazione di teorie

☼ linguistiche soprattutto di orientamento formale giudizio

Sono fondamentali per la valutazione dei sistemi computazionali 

☼ di accettabilità

Dati sperimentali:

 Raccolti attraverso un questionario e in un contesto sperimentale controllato

☼ Vengono raccolti con variabili sociolinguistiche

☼ Sono importanti negli approcci psicolinguistici e cognitivi allo studio del

☼ linguaggio

Dati naturali:

 Dati linguistici prodotti in modo spontaneo dai parlanti

☼ Hanno grande rilevanza i corpora nell’analisi linguistica

1: per valutare i modelli;

3: per costruire i modelli

Corpora Insieme di testi disponibili in formato digitale, selezionati e organizzati

 Funzionali all’analisi linguistica e computazionale (input dei sistemi computazionali)

 Campione rappresentativo della lingua

 TIPOLOGIE DI TESTI:

 Nativi digitali;

☼ Cartacei digitalizzati (Optical Character Recognition -OCR)

☼ 6

Linguistica dei corpora

Disciplina che studia i fenomeni linguistici a partire da osservazione sistematica testi

 Ha radici nella tradizione anglosassone

Tipi di corpora (a possiamo accedervi con un’interfaccia)

Generali, non costruiti per una specifica applicazione o specifico obiettivo di ricerca

 Di riferimento, per lo studio di una lingua specifica e concepiti come standard per la

 lingua stessa

Bilanciati, contenenti un ampio spettro di tipi testuali (stampa, prosa, letteraria,

 accademica, narrativa) e di domini tematici dei testi

Specialistici, concepiti per lo studio della variazione di dominio, di registro, …; p.e.

 corpora di linguaggio medico, giornalistico, giuridico, politico, …

Di lingua scritta e di lingua parlata trascritta, contenenti p.e. conversazioni in

 presenza, conversazioni telefoniche, trasmissioni, talk shows

Tratti dal web (generali)

 Interattivi, prodotti da uso tecnologie p.e. chat whatsapp

 Audio, anche per sviluppo di sistemi per il riconoscimento automatico del parlato

 Multimodali, audio-visivi

 Sincronici, che rispecchiano la lingua in un preciso momento della sua storia

 Diacronici, composti da testi appartenenti a periodi storici diversi e pensati per

 studiare il cambiamento di una lingua nel tempo

Paralleli, che contengono sia testi in L1 che la traduzione in un’altra lingua

 Paralleli allineati, importanti per lo sviluppo di sistemi di traduzione automatica in cui

 l’unità tipica di allineamento tra le due lingue è la frase learner corpora

Apprendenti, contengono dati di apprendenti di una seconda lingua =

Ampiezza di un corpus token

Generalmente calcolata in base al numero di (unità minime che compongono

 un corpus) che includono le occorrenze delle forme delle parole, la punteggiatura, i

numeri, i simboli, le sigle

Copora di lingua parlata: ampiezza = durata registrazione

Generazioni di corpora

Prima generazione:

 Digitalizza

Anteprima
Vedrai una selezione di 11 pagine su 50
Appunti esame Linguistica computazionale Pag. 1 Appunti esame Linguistica computazionale Pag. 2
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 6
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 11
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 16
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 21
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 26
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 31
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 36
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 41
Anteprima di 11 pagg. su 50.
Scarica il documento per vederlo tutto.
Appunti esame Linguistica computazionale Pag. 46
1 su 50
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze antichità, filologico-letterarie e storico-artistiche L-FIL-LET/12 Linguistica italiana

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher eli_sa.17 di informazioni apprese con la frequenza delle lezioni di Linguistica computazionale e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Pavia o del prof Jezek Elisabetta.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community