Estratto del documento

LEZIONE 2 BIOINFORMATICA

Una delle attività principali dei bioinformatici, consiste nella progettazione e nella costruzione di banche

dati.

BANCHE DATI

Le banche dati, possiamo paragonarle a dei grandi contenitori, in cui vengono raccolti e immagazzinati dati

in maniera razionale.

-> Sono dei grandi contenitori deputati a raccogliere dati seguendo una logica precisa e standardizzata.

Le banche dati di interesse biologico raccolgono dati provenienti da esperimenti di laboratorio e lavori di

letteratura scientifica e possono essere continuamente aggiornate e arricchite (-> con l’aggiunta di nuovi

dati)

Le banche dati di interesse biologico sono varie e possono contenere:

• Sequenze nucleotidiche

• Sequenze proteiche

• Motivi funzionali

• Strutture 3D

• Ligandi

• Articoli scientifici

…

La maggior parte di queste banche dati, sono facilmente accessibili in rete mediante un qualsiasi browser

(es. mozilla -firefox o chrome)

-> Un bravo biologo deve avere le capacità di identificare ed utilizzare le banche dati più utili per la propria

ricerca.

-> DB sta per Database (= Banca dati)

ENTRIES

Una banca dati è costituita da entries.

Una entry, possiamo paragonarla ad una scheda. Questa scheda, oltre a contenere l’oggetto di interesse

della nostra banca dati (-> che può essere ad esempio una sequenza nucleotidica o una sequenza proteica),

contiene anche una serie di informazioni aggiuntive, che ci aiutano a classificare meglio l’oggetto stesso.

Queste informazioni aggiuntive di contorno prendono il nome di headers -> Si tratta di intestazioni che ci

permettono di descrivere in maniera più accurata l’oggetto di interesse di una determinata entry

-> Il più importante tra tutti è l’Accession number

L’accession number è un codice identificativo univoco e ci permette di identificare in maniera univoca una

specifica sequenza nucleotidica o proteica.

Gioca un ruolo importantissimo nelle banche dati di interesse biologico!

-> Ogni qual volta viene inserita (sottomessa) una nuova sequenza nucleotidica o proteica all’interno di una

baca dati, a quest’ultima gli viene sempre assegnato un accession number (che mi identifica univocamente

quella sequenza).

L’accession number ci permette di risalire in maniera immediata alla entry (=> alla scheda) di una

determinata sequenza.

RICORDA! Una sequenza nucleotidica o proteica può anche essere associata a più accession number ->

che però sono tutti connessi ad un accession number principale (che prende il nome di accession number

primario)

Mi spiego meglio… Quando in una banca dati devo aggiungere delle informazioni ad una data sequenza (sia

essa nucleotidica o proteica) , posso agire in due possibili modi:

• Apportando delle semplici modifiche alla sua scheda (entry)

• Aggiungendo una nuova scheda (entry) relativa a quella sequenza

-> Questa scheda avrà un nuovo accession number collegato al primo (definito appunto primario)

Alla scheda di quella sequenza, possono accedere con entrambi gli accession number

IMPORTANTE…

• In una banca dati di sequenze nucleotidiche -> le due informazioni che devono essere sempre

presenti nella scheda di una sequenza nucleotidica sono:

- La sequenza nucleotidica

- L’accession number

• In una banca dati di sequenze proteiche -> le due informazioni che devono essere sempre presenti

nella scheda di una proteina sono:

- La sequenza amminoacidica

- L’accession number

-> Tutte le altre informazioni possono essere anche omesse (però averle a disposizione ci permette di

descrivere meglio l’oggetto di interesse di quella entry)

ORA… Vediamo come potrebbe apparire l’entry relativa ad una specifica sequenza nucleotidica:

Ciò che vediamo elencati a sinistra sono gli headers -> ovvero tutte le intestazioni relative all’oggetto

d’interesse di quella entry (sequenza nucleotidica).

-> Al termine di questa scheda ritroviamo l’oggetto principale della entry -> ovvero la sequenza nucleotidica

(SQ).

Le righe di questa sequenza sono composte ciascuna da 60 caratteri (=> da 60 nucleotidi)

FEATURES -> Oltre all’accession number, un ruolo importante lo giocano anche le features (FT), che ci

danno informazioni utili sulla sequenza nucleotidica in esame (es. informazioni relative alla sua traduzione).

FORMATO FLAT-FILE -> Nella maggior parte delle banche dati di interesse biologico, i contenuti sono

disponibili in formato flat-file (file di testo in formato semplice).

Il formato flat- file, consente un’immediata lettura del contenuto di una banca dati.

-> Durante il corso, utilizzeremo anche delle banche dati che danno accesso a stessi dati, ma con un

formato graficamente più elaborato.

CROSS-REFERENCES :

Le banche dati di interesse biologico devono essere tra loro in comunicazione (-> è importante che ci siano

delle comunicazioni tra oggetti di banche dati diverse)

I legami che si instaurano tra oggetti di banche dati diverse prendono il nome di cross-references (o legami

crociami)

CAPIAMO MEGLIO LE CROSS REFERENCES…

-> Se mi trovo in una banca dati di sequenze nucleotidiche e sono interessato al prodotto proteico di una

specifica sequenza nucleotidica; mediante una cross-references presente nella sua scheda (entry); ho la

possibilità di passare ad una banca dati di sequenze proteiche e collegarmi in maniera immediata alla

scheda (entry) relativa al suo prodotto proteico.

Questi collegamenti sono possibili, perché le entry di diverse banche dati, possiedono dei codici

identificativi univoci che ne garantiscono la comunicazione.

-> Se in una banca dati di sequenze nucleotidiche, sto analizzando la entry di una specifica sequenza

nucleotidica, mediante una cross-reference posso passare ad una banca dati che contiene informazioni

sul suo prodotto proteico.

Volendo… con un’altra cross-referenze posso passare ad una banca dati che contiene informazioni sulle sue

interazioni proteina- proteina e così via.

RICORDA! I legami crociati (o cross-references) , rendono possibili i passaggi di informazione tra banche

dati diverse e ne favoriscono l’integrazione.

-> Ci permettono di passare da una banca dati ad un’altra mediante dei link e ci fanno aumentare le

informazioni a nostra disposizione

IMPORTANTE! Tutte le banche dati devono essere organizzate in un formato tale da consentirne lo scambio

efficace di dati.

OPERATORI BOOLEANI

Per poter effettuare delle ricerche efficaci i in una banca dati, occorre fare un uso di semplici operatori

logici che prendono il nome di operatori booleani.

Gli operatori booleani più usati sono: AND, OR e NOT

-> Ci permettono di fare intersezioni, somme ed esclusioni tra due o più insiemi

• OPERATORE AND -> Ci permette di fare delle intersezioni tra insiemi

• OPERATORE OR -> Ci permette di fare delle somme tra insiemi

• OPERATORE NOT -> Ci permette di fare delle esclusioni tra insiemi

Nelle ricerche in banche dati, l’operatore booleano più utilizzato è AND.

Questo perché? Solitamente, quando effettuiamo una ricerca in una banca dati, il nostro obiettivo è quello di

ridurre il numero di dati a nostra disposizione e selezionare nella maniera più immediata possibile la scheda

di nostro interesse (-> ovvero quella contenete l’oggetto d’interesse della nostra ricerca)

RICORDA! Gli operatori booleani possono essere anche utilizzati per effettuare delle selezioni di tipo

complesso.

In altre parole … ci permettono di fare delle operazioni matematiche non solo tra due insiemi; ma anche tra

tre o più insiemi

In questi casi però, sarebbe opportuno fare uso di parentesi matematiche! Perché ci dettano l’ordine con

cui vogliamo che queste operazioni vengano effettuate (similmente ad un’espressione)

BANCHE DATI PRIMARIE E SECONDARIE

Le banche dati si dividono in:

• BANCHE DATI PRIMARIE

• BANCHE DATI SECONDARIE

-> Le banche dati primarie sono banche dati di acidi nucleici (DNA/RNA) -> Banche dati di sequenze

nucleotidiche.

Ne esistono tre: una europea (EMBL datalibrary), una americana (GenBank) e una giapponese (DDBJ)

Queste banche, si scambiano i dati che raccolgono e offrono servizi simili.

Alcune interfacce di banche dati presentate dal Prof:

• ENA -> Banca dati di sequenze nucleotidiche

• DDJB -> Banca dati di sequenze nucleotidiche

NCBI -> Il sito dell’NCBI contiene diversi database (=> diverse banche dati):

• Di sequenze nucleotidiche

• Di sequenze proteiche (=> di proteine)

• Di letteratura scientifica

• Di genomi

…

-> Le banche dati secondarie sono banche dati di sequenze proteiche.

UNIPROT -> Banca dati di proteine più grande d’Europa

La più importante banca dati di sequenze proteiche è la Uniprot (-> utilizzata per fare delle ricerche mirate su

singole proteine).

È costituita da due parti: Swiss- Prot e TrEMBLE

-> La porzione di Swiss-Prot contiene esclusivamente proteine curate manualmente (-> ad opera di una

persona fisica che prende il nome di CURATORE)

-> La porzione di TrEMBL contiene predizioni o proteine da poco sottomesse e non ancora curate

manualmente

La banca dati Uniprot, contiene un totale di circa 90.600.000 proteine.

La maggior parte di queste (circa 90.050.000) sono disponibili nella sezione TrEMBL (=> sono predizioni o

proteine da poco sottomesse e non ancora curate manualmente); mentre le restanti 550.000 sono curate

manualmente e disponibili nella sezione Swiss-Prot

RICERCA GENERICA E PER CAMPI

La ricerca in una banca dati può essere effettua:

• IN MANIERA GENERICA

• PER CAMPI

Entrambe le ricerche fanno uso di parole-chiave

Esempio: Siamo interessati alla mioglobina nell’uomo

-> Come primo passo ci dirigiamo nella banca dati Uniprot e nella casella di ricerca principale effettuiamo

una ricerca composta con l’operatore AND : “ myoglobin AND Homo sapiens”.

Ciò che stiamo facendo però, non è una ricerca per campi, bensì una ricerca generica. Perché non stiamo

dicendo alla banca dati che il nostro organismo d’interesse è Homo sapiens e la nostra proteina di interesse

è la mioglobina; ma gli stiamo semplicemente chiedendo di fornirci tutte quelle entries che contengono le

parole Homo sapiens e myoglobin

Effettuando una ricerca di questo tipo su Uniprot, otteniamo un numero totale di 20 entries

LA RICERCA CHE ABBIAMO EFFETTUATO PERO’ È SBAGLIATA!

-> IL MODO CORRETTO PER EFFETTUARE QUESTO TIPO DI RICERCA È PER CAMPI

In una ricerca per campi, le parole-chiave che utilizziamo per la nostra ricerca, devono appartenere a

specifici campi.

-> In questo caso, i due campi da utilizzare sono: Organism [OS] e Protein name [DE]

• Nel campo Organism -> inserisco la parola-chiave Homo sapiens

• Nel campo Protein name -> inserisco la parola-chiave myoglobin

RICORDA! La ricerca per campi prevede sempre l’utilizzo degli Operatori booleani.

Dopo aver selezionato e riempito i due campi di ricerca; si sceglie l’operatore booleano più adatto per

portare a termine la nostra ricerca (-> nel nostro caso AND)

Effettuando una ricerca di questo tipo, stiamo dicendo alla nostra banca dati di fornirci tutte quelle entries,

che nelle intestazioni: Organism [OS] e Protein name [DE] contengono le parole-chiave: Homo sapiens e

myoglobin

In altre parole…Stiamo dicendo alla banca dati che il nostro organismo d’interesse è Homo sapiens e la nostra

proteina d’interesse è la mioglobina.

Delle 14 entries che otteniamo, solamente una appartiene alla sezione Swiss-prot, le altre 13 appartengono

alla sezione TrEMBLE.

L’entry appartenente alla sezione Swiss- prot, è quella che contiene la nostra proteina d’interesse (ovvero la

mioglobina umana)

RICORDA! Quando siamo interessati alla proteina di un organismo ed effettuiamo una ricerca per campi su

Uniprot -> Se la ricerca viene effettuata correttamente, tra tutte le entries che otteniamo, solamente una

appartiene alla sezione Swiss- prot (ed è quella che contiene la nostra proteina di interesse)

Queste ricerche per campi vengono sempre effettuate cliccando nella sezione “Advanced”

In Uniprot, è possibile fare anche delle operazioni tra più campi.

Se la nostra ricerca richiede operazioni tra più di due campi, cliccando su Add field è possibile aggiungere

nuovi campi.

-> Nelle operazioni tra più campi, bisogna fare molta attenzione ad utilizzare correttamente gli operatori

booleani.

IMPORTANTE! In una banca dati, le ricerche vengono sempre effettuate per campi!

Questo perché? Le ricerche per campi, ci permettono di risalire in maniera immediata alle entry di nostro

interesse, senza commettere errori e finire per selezionare delle schede che non sono utili per la ricerca che

stiamo effettuando.

ACCESSION NUMBER IN UNIPROT

-> Il codice indicato con la freccia in rosso è l’accession number di quella proteina.

Se clicco sull’accession number di quella proteina, accedo ad una pagina scrollabile, in cui sono presenti

alcune informazioni relative quella proteina.

-> Queste informazioni sono contenute che in varie sezioni (Function, Names and Taxonomy, Subcellular

location, Diseas and Variants ecc.)

La sequenza di una proteina può essere facilmente scaricabile accedendo alla sezione: Sequence e Isoform

(talvolta solo Sequence) e cliccando sul tasto Download.

La sequenza di questa proteina viene scaricata in un formato di testo semplice (che prende il nome di

formato FASTA)

FORMATO FASTA -> Il formato FASTA è un formato di testo semplice, con il quale è possibile visualizzare una

sequenza proteica o nucleotidica all’interno di una banca dati.

La prima riga di un formato FASTA comincia sempre con il simbolo >, a cui seguono una serie di informazioni

riguardanti l’oggetto d’interesse della nostra entry (sequenza nucleotidica o proteica)

-> Nel caso di una sequenza proteica, dopo il simbolo > possiamo avere: l’accession number della proteina, il

nome della proteina, il nome dell’organismo in cui si trova, il nome del gene ecc.

Dalla seconda riga in poi, abbiamo l’elenco di tutti gli amminoacidi/ i nucleotidi che compongono la

sequenza.

Ciascuna riga della sequenza contiene un totale di 60 caratteri contigui (=> un totale di 60

amminoacidi/nucleotidi contigui)

-> Se il numero totale dei suoi residui non è un multiplo di 60, l’ultima riga sarà più corta delle altre.

RICORDA! Una sequenza proteica o nucleotidica può essere anche visualizzata con un formato grafico.

Il formato grafico possiede un tipo di formattazione diverso da quello del formato FASTA. In esso, i

nucleotidi o gli amminoacidi della sequenza sono raggruppati in colonne da 10 caratteri e presentano delle

spaziature

SEZIONE EXTERNAL LINKS -> Cliccando nella sezione External links, si accede ad una pagina che contiene le

cross-references => tutti i link necessari per accedere alle altre banche dati

-> Le cross-references, ci permettono di avere a diposizione altre informazioni utili su quella proteina

IN UNA BANCA DATI DI INTERESSE BIOLOGICO, LE RICERCHE DEVONO ESSERE EFFETTUATE IN INGLESE

I NOMI DELLE SPECIE DEVONO ESSERE IN LATINO

PUBMed

Pub med -> È la più importante Banca dati di letteratura biomedica

Contiene articoli scientifici sia in forma gratuita che a pagamento

Esite anche una sezione di PubMed (PubMed Central), all’interno della quale sono contenuti solamente

articoli scientifici in formato completo e gratuito (-> si parla di articoli in Open access)

Pub Med contiene moltissime Review

REVIEW -> Le review sono degli articoli scientifici, in cui un gruppo di studiosi decide di fare un summary (=>

un riassunto) su tutto quello che si conosce riguardo un determinato argomento

Gli argomenti affrontati dalle review possono essere vari

-> Abbiamo review inerenti alle tecniche di laboratorio, altre che riguardano i meccanismi molecolari ecc.

Interfaccia di PubMed:

RICORDA! L’accesso a Pub Med, si può effettuare anche dal sito dell’NCBI, selezionando l’opzione “Pub

Med” (al posto di “All databases”) e cliccando su “Search”

-> Anche in Pub med, le ricerche possono essere effettuate in maniera generica o per campi (=> utilizzando

delle parole chiave da inserire all’interno di specifici campi e facendo uso degli operatori booleani)

-> La ricerca per campi ci permette di accedere in maniera immediata alla scheda (entry) di nostro

interesse (-> ovvero quella contenente l’articolo scientifico a cui siamo interessati).

In Pub med, ciascuna entry possiede una serie di intestazioni, tra cui: titolo, autori, estremi di referenza,

codice PMID ecc.

CODICE PMID -> Il codice PMID (PubMed Id), similmente alla accession number è un codice identificativo

univoco e ci permette di indentificare in maniera univoca un lavoro scientifico.

In Pub Med, le ricerche per campi vengono sempre effettuate cliccando sulla sezione “Advanced” e

inserendo in campi specifici: il nome degli autori, il nome della rivista, la data di pubblicazione ecc.

Anche qui… il corretto utilizzo degli operatori booleani è necessario per accedere velocemente alle schede

(entries) che contengono gli articoli scientifici a cui siamo interessati

Es. Nella nostra banca dati Pub med, siamo interessati a tutti quegli articoli scientifici pubblicati da Helmer

Citterich sulla rivista “Journal of molecolar biology”

COSA FACCIAMO? Effettuiamo una ricerca per campi

1. Clicchiamo sulla sezione Advanced

2. Inseriamo nel campo [Journal] la parola-chiave “Journal of molecular biology”, nel campo [Author] òa

parola-chiave “Helmer Citterich” e facciamo un’intersezione tra i due campi

Anteprima
Vedrai una selezione di 10 pagine su 269
Bioinformatica Pag. 1 Bioinformatica Pag. 2
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 6
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 11
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 16
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 21
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 26
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 31
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 36
Anteprima di 10 pagg. su 269.
Scarica il documento per vederlo tutto.
Bioinformatica Pag. 41
1 su 269
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Ingegneria industriale e dell'informazione ING-INF/06 Bioingegneria elettronica e informatica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher camillagioritwitter di informazioni apprese con la frequenza delle lezioni di Bioinformatica e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Roma Tor Vergata o del prof Helmer-Citterich Manuela.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community