Estratto del documento

Bioinformatica introduttiva

Il biologo esegue degli esperimenti, interpreta dati e osservazioni ed elabora nuove teorie

Il bioinformatico gestisce e valuta dati grezzi che sono stati prodotti dalle macchine di cui ci si avvale

durante gli esperimenti, elabora anche programmi e software necessari per elaborare l'enorme mole di

dati che derivano da questi esperimenti e infine genera e studia dati elaborati visualizzabili e

interpretabili.

-> l'interazione tra le due figure avviene gia' all'inizio durante l'esperimento in corso

Grafico: essendo una scala logaritmica la curva indica una

crescita esponenziale

Le linee tratteggiate indicano le 2 possibili previsioni messe

a confronto con la legge di Moore (blu)

La legge di Moore e' nata in ambiente elettronico come

osservazione empirica, un ragionamento secondo cui il

numero di transistor nel tempo sarebbe cresciuto

raddoppiando ogni due anni. Indica l'andamento del numero

dei chip nei processori.

E' un fattore abilitante delle ultime due rivoluzioni industriali -> l'evoluzione dell'industria distinta in 4 step:

quella legata all'energia del vapore, l'evoluzione di massa energia elettrica e catena di montaggio,

avvento informatica e automazione ed infine "internet of things" cioe' network e smartphone..

->> La capacita' di sequenziare genomi o in generale produrre dati sta crescendo in modo esponenziale

ancor piu' della legge di Moore. Questo e' un fattore abilitante per una rivoluzione industriale come

quelle viste in passato

Tutti i dati pubblicati vengono raccolti in banche dati che sono open cioe' chiunque puo' accedervi

Gene bank: ogni volta che un gene veniva individuato la sua sequenza veniva inviata a gene bank e

documentato attraverso vari articoli descrittivi la scoperta.

Nata inizialmente negli Stati Uniti e poi banche analoghe in Europa e Giappone e collaborazioni tra questi

3 istituti in cui avviene uno scambio giornalmente.

2.7 miliardi di dollari per il progetto durato decenni di sequenziamento dell'intero genoma

Articoli scientifici

• : ci sono 5 assi attraverso cui si puo' valutare un articolo

○ Novelty: ogni articolo scientifico deve dire qualcosa di nuovo

Altri articoli fanno una review in cui mettono insieme diverse scoperte gia' note, le riassumono,

le integrano o le descrivono in un'ottica nuova.

I manuali e libri nascono da un lavoro ulteriore di sintesi e integrazione di review e articoli

○ Relevance: impatta su quanto e' importante l'osservazione di cui si parla

○ Accuracy: accuratezza e precisione che va di pari passo con la riproducibilita'

○ Reproducibility: tutte le scoperte e invenzioni pubblicate devono essere riproducibili, quindi

devono esserci tutte le informazioni necessarie

○ Impact: legato alla relevance che misura quanto e' risultato importante questo lavoro nella

comunita' scientifica, se e' utile e viene utilizzato

L'impact factor viene misurato in base al numero di citazioni fatte da altri articoli: quelle con

un basso impact factor raccolgono articoli importanti per nicchie specifiche e pochi esperti, un

alto impact factor avra' importanza piu' ampia nel pubblico.

Un'ulteriore sintesi della scoperta va di pari passo a una diminuzione dettaglio delle informazioni che sono

riportate, mentre l'accuratezza cresce cioe' se c'era stato un dato sbagliato pubblicato questo con il

progredire degli studi e analisi di quell'articolo puo' essere individuato e sostituito. La riproducibilita' invece

diminuisce perche' ho bisogno di tutti i dettagli possibili con cui e' stato fatto quell'esperimento quindi devo

rifarmi agli articoli specifici.

-> La scienza parla solo di cio' che e' riproducibile, l'osservazione deve permettere almeno ad un esperto

-> La scienza parla solo di cio' che e' riproducibile, l'osservazione deve permettere almeno ad un esperto

del settore di riprodurla e verificarla.

La peer review "revisione tra pari" nell'ambito della ricerca scientifica e' la procedura di valutazione e di

selezione degli articoli o dei progetti di ricerca effettuata da specialisti del settore per verificarne

l'idoneita' alla pubblicazione o al finanziamento.

Pub Med raccoglie tutti gli articoli scientifici, una sorta di banda dati per gli articoli

Dati necessari ad identificare un articolo: autore, anno, titolo del lavoro, nome del giornale

Struttura di un articolo: e' caratterizzato dal nome della rivista in alto, titolo del lavoro con subito sotto

riportati gli autori del lavoro e l'affiliazione degli autori. Infine prima della descrizione vera e propria c'e'

un abstract che sintetizza il contenuto.

L'articolo e' poi diviso in sezioni:

▫ Introduzione che inquadra il contesto del lavoro, ricca di citazioni ai lavori precedenti, evidenzia

domande aperte e problematiche che l'articolo affronta

▫ Risultati contiene le affermazione (statement) che costituiscono il cuore dell'articolo, spesso

accompagnate da illustrazioni

▫ Materiali e metodi contiene le informazioni necessarie per riprodurre i risultati riportati nell'articolo

▫ Discussione i risultati vengono ripresi e inquadrati nel contesto delle ricerche precedenti, se ne

evidenzia la rilevanza e la novita', si discutono eventuali sviluppi futuri

▫ Referenze con l'elenco degli autori citati

▫ Materiali supplementari perche' poche pagine spesso non son sufficienti a descrivere come il lavoro

e' stato svolto nel dettaglio

▫ Risultati supplementari tipicamente in forma di tabella o codice del software

Banche dat

• i:

Di tipo genomico, quelle che contengono i trascritti, quelle di proteine e poi volendo possiamo indagare

sulle strutture delle proteine e quindi avremo delle banche dati di struttura, dei domini e salendo ancora

possiamo interrogarci su interazioni tra le proteine, di pathway..ecc. Esistono anche data base legate alle

modificazioni epigenomiche, delle malattie..

Un data-base e' un elenco di dati strutturati nello stesso modo: la strutturazione e' data da campi, ci

sono record caratterizzati da campi diversi che ci servono per ricercare un dato (come una rubrica in cui

cercando il nome di un collega possiamo trovare il suo numero di telefono o email)

Esempio di un dato in GeneBank: Esempio di banca di articoli dove il PMID (Pub

Med id) ci permette di identificare l'articolo nella

banca dati

Esempio di banca nucleotidica

L'identificativo univoco in GeneBank si puo' rappresentare come un link attraverso cui tramite un record

cliccando su questo identificativo veniamo rimandati all'articolo in PubMed.

Ma oltre al PMID c'e' anche l'identificativo DOI parecchio usato nelle biblioteche

Banca dati secondaria: non ci sono ridondanze perche' riorganizzano e rielaborano l'informazione

contenuta nelle primarie secondo particolari criteri analitici. Tra queste, le banche dati specializzate

raccolgono solo l'informazione relativa ad uno specifico settore, per esempio sequenze da lieviti, da

anticorpi, proteasi, etc

Nelle primarie come gene bank tutti i ricercatori che lavorano su un gene o sequenza nucleotidica inviano

i loro dati . Gene seq prende tutte queste sequenze e le elabora manualmente creando sequenze di

riferimento in modo che non ci siano ridondanze

RefSeq e' una banca dati secondaria che lavora su sequenze nucleotidiche e proteiche

Uniprot contiene informazioni sulle proteine

Entrez-gene (curato da NCBI) importante quando vogliamo sapere cosa fa un gene, raccoglie attorno

all'identificativo di un gene tutti i trascritti che esso puo' generare, collega quindi i trascritti alle eventuali

proteine che producono e si collega anche a uniprot- riferimenti incrociati che riconducono ogni

informazione sui trascritti e proteine al gene in questione.

Genome-bowser navigare il genoma, dove e come sono organizzati i geni, visualizziamo

Fenomeni che hanno un effetto piccolo, piu' l'effetto e' piccolo piu' e' facile che le affermazioni (claim)

siano sbagliate. Piu' persone lavorano a un articolo piu' e' probabile che qualcuno corregga eventuali

errori

Quante cose vengono dette in un articolo: se lo studio si focalizza su pochi argomenti e' probabile che sia

accurato, piu' lo studio e' grande piu' aumenta la probabilita' che ci sia qualcosa di sbagliato.

Esempio articolo sul covid:

In Pub med central si trova il testo completo, sull'altro tasto sulla destra si va all'articolo originale

rimandandoci alla rivista.

Studio pilota condotto su 70 pazienti ma risultati ritenuti abbastanza validi da cercare di renderli piu'

sicuri con ulteriori studi ed esperimenti su maggior numero di pazienti e centri diversi -> potrebbero esserci

dei Baiars nello stesso centro

Quando si legge un articolo e' importante guardare se un lavoro ha un numero di citazioni molto alto, le

affiliazioni

Le ricerche che hanno un impatto medico immediato come gli studi su nuovi farmaci per combattere una

malattia hanno percorso chemical trial molto rigoroso prima che i farmaci vengano usati, molto raro che

ci siano errori, la comunita' scientifica li valuta prima in modo accurato

CDS versione tradotta in termini di amminoacidi del record che stiamo guardando, in questo caso un

record nucleotidico, un trascritto. Le sequenze UTR sono regioni non tradotte al 3' e 5' di un mrna.

Troviamo poi un identificativo univoco che ci rimanda alle proteine che produce

Cliccando sulle diverse voci possiamo farci indicare i vari esoni, le sequenze in cui un enzima lega il

substrato, le sequenze poliA, quelle regolatorie..

Tutti i riferimenti incrociati

Visualizzazione a genom browser in cui si ha la sequenza nucleotidica di un cromosoma indicata su una

retta x e poi delle tacchette che indicano la presenza degli esoni e una freccia per il verso in cui viene

codificato il trascritto.

Genebank contiene le sequenze nucleotidiche cosi' come sono state inviate da un qualche autore, e

contiene anche dei record, dei campi che contengono identificativi univoci per cui noi possiamo spostarci in

altri data base che ci rimandano agli specifici articoli.

Banche dati secondarie come liveseq raccolgono tutte queste informazioni e le rendono piu' sintetiche e

curate

Differenza tra uniprot e tremble:

Uniprot e' composto da due sezioni: una generata automaticamente e una manualmente curata

TrEMBLE e' una grossa banca dati europea che contiene trascritti nucleotidici che vengono automaticamente

convertiti in proteine ed inseriti in Swiss-Prot (sezione manualmente curata) In silico translation

si riferisce a un

software che

permette di

tradurre il

messaggio in

proteina

Il genoma di un mammifero e' composto per il 2% da sequenze codificanti proteine, 26% introni, grandissima

porzione di sequenze ripetute n volte che hanno diverse funzioni nella regolazione genica.

In una open reading frame possiamo prendere ciascuna tripletta della sequenza e tradurla nel

corrispondente amminoacido.

Ci sono 64 diversi codoni possibili: 4 tipi di basi per la prima posizione, altrettanti per la seconda e ancora

per la terza posizione della tripletta o codone, quindi 4^3 cioe' 64. Ogni quante triplette in una sequenza

casuale mi aspetto di avere un codone

di stop? 3 ogni 64 codoni perche' in

tutto esistono 64 codoni ma esistono

anche 3 tipi diversi di codoni di stop,

quindi 1 ogni 21 triplette. Inoltre si

osserva che la lunghezza media di una

proteina e' di 300 residui cioe' >> 21,

questo vuol dire che le regioni che

codificano per le proteine sono

particolarmente povere di codoni di

stop. Ma in una stessa ORF posso avere

3 frame di lettura diversi e posso

capire qual e' quella corretta

individuando la ATG corrispondente alla

metionina e TAG alla fine e soprattutto

sara' quella piu' lunga!

Sul genoma devono esserci delle sequenze che contengono pochi codoni di stop cioe' le regioni codificanti e

1 21 e' solo un'ipotesi, una possibilita' teorica.

/

Allineamenti di sequenza

Sappiamo dell'esistenza di strutture omologhe tra i vari vertebrati

Il fenotipo e' l'insieme di tutte le caratteristiche manifestate da un organismo vivente, morfologia, sviluppo,

fisiologia, comportamento..A definire il fenotipo contribuisce anche l'ambiente: durante l'evoluzione gli

organismi cambiano in modo ereditabile, quindi cambia il genotipo, cambiano le informazioni genetiche che

determinano le caratteristiche fondamentali del fenotipo.

Il genotipo e' l'insieme delle informazioni ereditabili, ovvero che vengono trasmesse di generazione in

generazione. Determina le caratteristiche fondamentali del fenotipo.

Funzione molecolare si sia adattata a una funzione diversa, a processo biologico diverso

Omologia: due stringhe o strutture anatomiche hanno un antenato comune, strutture simili ma diverse

funzioni

Analogia: non comune antenato, strutture diverse ma stessa funzione

Il dna e le proteine sono dei polimeri costituiti da monomeri rispettivamente 4nucleotidi e 20aa -> possono

essere considerate delle stringhe

Se vogliamo confrontare ora diverse stringhe, cioe' confrontare sequenze geniche di diverse specie,

dobbiamo allinearle! Allineiamo le due stringhe attraverso 3 edit cioe' 3 modifiche ma

esistono diversi modi.

Sostituzione, rimozione e aggiunta di un nucleotide sono le 3

operazioni possibili per modificare le stringhe e renderle identiche a

un'altra. Tra tutti i diversi tipi di allineamento quello piu'

interessante sara' quello con il numero minore di operazioni

-> edit distance: quante operazioni elementari devo fare per passare dalla prima sequenza alla seconda,

e' la distanza tra le due stringhe.

Attraverso l'edit distance si puo' stimare la probabilita' che due sequenze abbiano un antenato comune:

tanto piu' lontano nel tempo tanto piu' distanti le sequenze.

• se le sequenze sono troppo diverse non e' probabile che ci sia un antenato comune.

• Posizioni caratterizzate da * sono posizioni di match, il . indica mismatch

Ipotesi nulla: le sequenze sono casuali, i nucleotidi sono equiprobabili e sequenze sono entrambe lunghe L

Se due sequenze sono completamente scorrelate, mi aspetto un match ogni 4 basi: assumendo che i 4

nucleotidi siano equiprobabili io in ogni posizione ho 1 4 di probabilita' di ritrovare lo stesso nucleotide

/

nell'altra sequenza -> La mia edit distance sara' di 3 L.

/4

Se ho "tanti piu'" match di quelli che mi aspetto per caso (nell'ipotesi nulla) allora le sequenze hanno un

antenato comune

Possiamo calcolare il numero di questi match (si sono 1 4 ma cioe' quanti?) attraverso la statistica

/

ottenendo un P-value

Ma i nucleotidi non sono tutti equiprobabili ad es C e G sono meno frequenti

Nel genoma si osserva che la frequenza con cui le G seguono C e' molto meno di quello che ci

aspetteremmo: in media sul genoma le G e C si presentano con una media del 20% l'una, quindi la

frequenza di CpG (G che seguono C) atteso e' 0.2x0.2 0.04

=

Invece il risultato osservato e' 21% dell'atteso, molto meno di cio' che ci

aspettavamo.. questo potrebbe essere dovuto al fatto che la 5-metil-citosina

tende a deaminare spontaneamente in timina

-> isole CpG sono regioni precise che tendono a non essere metilate e in queste regioni la frequenza di C e

G e' molto piu' alta di quella che ci si aspetta per caso

Scoring system:

Creo una matrice in cui assegno il valore di 1 per i match e di -2 per i mismatch quindi possiamo sommare

tutti questi numeri in base ai match e mismatch e otteniamo uno score che misura la similarita' tra le due

sequenze

Ad esempio possiamo utilizzare questo meccanismo perdare un peso diverso a mutazioni frequenti rispetto

a quelle rare:

I gap negli allineamenti sono generati da eventi di inserzione o delezione nell'evoluzione. Questi eventi sono

piu' rari dei cambi di nucleotide, sono piu' penalizzati e complicano notevolmente la statistica degli

allineamenti. Generalmente si penalizza in modo diverso l'apertura e l'estensione del gap: si da' una

penalita' piu' grave all'apertura e meno all'estensione.

Sostituendo un aa acido di una proteina con un altro aa acido poco cambiera', invece sostituendo uno

idrofilico con uno idrofobico la mutazione sara' piu' dannosa e spesso anche piu' rara perche' non

selezionata dall'evoluzione in quanto non favorevole.

Allineamento di proteine indica appaiamento, il . appaiamento simile ma diverso, : posizioni in cui non c'e'

|

match ma due aa piuttosto simili quindi uno score abbastanza alto, vuoto aa molto diversi, - mismatch

Matrici PAM si basano su un set piccolo di sequenze non molto sensibili allo scoring system e assumono che

due sequenze siano vicine tra loro se contengono aa con caratteristiche biochimiche simili

BLOSUM matrix invece di chiedere che la proteina sia simile in tante diverse specie, si utilizza in questo caso

non l'intero allineamento ma ci si limita a dei blocchi ben conservati:

Se partiamo da blocchi simili otteniamo matrici indicate per ottenere un buon

score e proteine vicine evolutivamente. Se i blocchi gia' in partenza hanno

una percentuale di identita' diversa otterremo proteine lontane

Pam utilizza l'intera sequenza delle proteine

Blosum solo porzioni di proteina ma che sono altamente simili ma solo in

quel blocco

Allineamento globale: se ci sono due proteine scorrelate salvo per una porzione simile ad es un dominio

transmembrana l'allineatore globale fallira' nel riconoscere queste sequenze, mettera' un po' di gap qua e

la' raggiungendo il miglior allineamento possibile per le due sequenze ma non allineera' le due porzioni

transmembrana. (Needleman-Wunsch)

Algoritmi esatti: data l'ipotesi nulla trovano esattamente il best score tra le due sequenze (globale) o tra

parti delle due sequenze (locale) -> l'allineamento locale riconosce le due sottostringhe di A e B altamente

simili e le ap

Anteprima
Vedrai una selezione di 19 pagine su 86
Bio-informatica molecolare Pag. 1 Bio-informatica molecolare Pag. 2
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 6
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 11
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 16
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 21
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 26
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 31
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 36
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 41
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 46
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 51
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 56
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 61
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 66
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 71
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 76
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 81
Anteprima di 19 pagg. su 86.
Scarica il documento per vederlo tutto.
Bio-informatica molecolare Pag. 86
1 su 86
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze biologiche BIO/11 Biologia molecolare

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher Eliiii99 di informazioni apprese con la frequenza delle lezioni di Bio-informatica molecolare e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli studi di Torino o del prof Maldotti Mara.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community