LEZIONE 2 BIOINFORMATICA
Una delle attività principali dei bioinformatici, consiste nella progettazione e nella costruzione di banche
dati.
BANCHE DATI
Le banche dati, possiamo paragonarle a dei grandi contenitori, in cui vengono raccolti e immagazzinati dati
in maniera razionale.
-> Sono dei grandi contenitori deputati a raccogliere dati seguendo una logica precisa e standardizzata.
Le banche dati di interesse biologico raccolgono dati provenienti da esperimenti di laboratorio e lavori di
letteratura scientifica e possono essere continuamente aggiornate e arricchite (-> con l’aggiunta di nuovi
dati)
Le banche dati di interesse biologico sono varie e possono contenere:
• Sequenze nucleotidiche
• Sequenze proteiche
• Motivi funzionali
• Strutture 3D
• Ligandi
• Articoli scientifici
…
La maggior parte di queste banche dati, sono facilmente accessibili in rete mediante un qualsiasi browser
(es. mozilla -firefox o chrome)
-> Un bravo biologo deve avere le capacità di identificare ed utilizzare le banche dati più utili per la propria
ricerca.
-> DB sta per Database (= Banca dati)
ENTRIES
Una banca dati è costituita da entries.
Una entry, possiamo paragonarla ad una scheda. Questa scheda, oltre a contenere l’oggetto di interesse
della nostra banca dati (-> che può essere ad esempio una sequenza nucleotidica o una sequenza proteica),
contiene anche una serie di informazioni aggiuntive, che ci aiutano a classificare meglio l’oggetto stesso.
Queste informazioni aggiuntive di contorno prendono il nome di headers -> Si tratta di intestazioni che ci
permettono di descrivere in maniera più accurata l’oggetto di interesse di una determinata entry
-> Il più importante tra tutti è l’Accession number
L’accession number è un codice identificativo univoco e ci permette di identificare in maniera univoca una
specifica sequenza nucleotidica o proteica.
Gioca un ruolo importantissimo nelle banche dati di interesse biologico!
-> Ogni qual volta viene inserita (sottomessa) una nuova sequenza nucleotidica o proteica all’interno di una
baca dati, a quest’ultima gli viene sempre assegnato un accession number (che mi identifica univocamente
quella sequenza).
L’accession number ci permette di risalire in maniera immediata alla entry (=> alla scheda) di una
determinata sequenza.
RICORDA! Una sequenza nucleotidica o proteica può anche essere associata a più accession number ->
che però sono tutti connessi ad un accession number principale (che prende il nome di accession number
primario)
Mi spiego meglio… Quando in una banca dati devo aggiungere delle informazioni ad una data sequenza (sia
essa nucleotidica o proteica) , posso agire in due possibili modi:
• Apportando delle semplici modifiche alla sua scheda (entry)
• Aggiungendo una nuova scheda (entry) relativa a quella sequenza
-> Questa scheda avrà un nuovo accession number collegato al primo (definito appunto primario)
Alla scheda di quella sequenza, possono accedere con entrambi gli accession number
IMPORTANTE…
• In una banca dati di sequenze nucleotidiche -> le due informazioni che devono essere sempre
presenti nella scheda di una sequenza nucleotidica sono:
- La sequenza nucleotidica
- L’accession number
• In una banca dati di sequenze proteiche -> le due informazioni che devono essere sempre presenti
nella scheda di una proteina sono:
- La sequenza amminoacidica
- L’accession number
-> Tutte le altre informazioni possono essere anche omesse (però averle a disposizione ci permette di
descrivere meglio l’oggetto di interesse di quella entry)
ORA… Vediamo come potrebbe apparire l’entry relativa ad una specifica sequenza nucleotidica:
Ciò che vediamo elencati a sinistra sono gli headers -> ovvero tutte le intestazioni relative all’oggetto
d’interesse di quella entry (sequenza nucleotidica).
-> Al termine di questa scheda ritroviamo l’oggetto principale della entry -> ovvero la sequenza nucleotidica
(SQ).
Le righe di questa sequenza sono composte ciascuna da 60 caratteri (=> da 60 nucleotidi)
FEATURES -> Oltre all’accession number, un ruolo importante lo giocano anche le features (FT), che ci
danno informazioni utili sulla sequenza nucleotidica in esame (es. informazioni relative alla sua traduzione).
FORMATO FLAT-FILE -> Nella maggior parte delle banche dati di interesse biologico, i contenuti sono
disponibili in formato flat-file (file di testo in formato semplice).
Il formato flat- file, consente un’immediata lettura del contenuto di una banca dati.
-> Durante il corso, utilizzeremo anche delle banche dati che danno accesso a stessi dati, ma con un
formato graficamente più elaborato.
CROSS-REFERENCES :
Le banche dati di interesse biologico devono essere tra loro in comunicazione (-> è importante che ci siano
delle comunicazioni tra oggetti di banche dati diverse)
I legami che si instaurano tra oggetti di banche dati diverse prendono il nome di cross-references (o legami
crociami)
CAPIAMO MEGLIO LE CROSS REFERENCES…
-> Se mi trovo in una banca dati di sequenze nucleotidiche e sono interessato al prodotto proteico di una
specifica sequenza nucleotidica; mediante una cross-references presente nella sua scheda (entry); ho la
possibilità di passare ad una banca dati di sequenze proteiche e collegarmi in maniera immediata alla
scheda (entry) relativa al suo prodotto proteico.
Questi collegamenti sono possibili, perché le entry di diverse banche dati, possiedono dei codici
identificativi univoci che ne garantiscono la comunicazione.
-> Se in una banca dati di sequenze nucleotidiche, sto analizzando la entry di una specifica sequenza
nucleotidica, mediante una cross-reference posso passare ad una banca dati che contiene informazioni
sul suo prodotto proteico.
Volendo… con un’altra cross-referenze posso passare ad una banca dati che contiene informazioni sulle sue
interazioni proteina- proteina e così via.
RICORDA! I legami crociati (o cross-references) , rendono possibili i passaggi di informazione tra banche
dati diverse e ne favoriscono l’integrazione.
-> Ci permettono di passare da una banca dati ad un’altra mediante dei link e ci fanno aumentare le
informazioni a nostra disposizione
IMPORTANTE! Tutte le banche dati devono essere organizzate in un formato tale da consentirne lo scambio
efficace di dati.
OPERATORI BOOLEANI
Per poter effettuare delle ricerche efficaci i in una banca dati, occorre fare un uso di semplici operatori
logici che prendono il nome di operatori booleani.
Gli operatori booleani più usati sono: AND, OR e NOT
-> Ci permettono di fare intersezioni, somme ed esclusioni tra due o più insiemi
• OPERATORE AND -> Ci permette di fare delle intersezioni tra insiemi
• OPERATORE OR -> Ci permette di fare delle somme tra insiemi
• OPERATORE NOT -> Ci permette di fare delle esclusioni tra insiemi
Nelle ricerche in banche dati, l’operatore booleano più utilizzato è AND.
Questo perché? Solitamente, quando effettuiamo una ricerca in una banca dati, il nostro obiettivo è quello di
ridurre il numero di dati a nostra disposizione e selezionare nella maniera più immediata possibile la scheda
di nostro interesse (-> ovvero quella contenete l’oggetto d’interesse della nostra ricerca)
RICORDA! Gli operatori booleani possono essere anche utilizzati per effettuare delle selezioni di tipo
complesso.
In altre parole … ci permettono di fare delle operazioni matematiche non solo tra due insiemi; ma anche tra
tre o più insiemi
In questi casi però, sarebbe opportuno fare uso di parentesi matematiche! Perché ci dettano l’ordine con
cui vogliamo che queste operazioni vengano effettuate (similmente ad un’espressione)
BANCHE DATI PRIMARIE E SECONDARIE
Le banche dati si dividono in:
• BANCHE DATI PRIMARIE
• BANCHE DATI SECONDARIE
-> Le banche dati primarie sono banche dati di acidi nucleici (DNA/RNA) -> Banche dati di sequenze
nucleotidiche.
Ne esistono tre: una europea (EMBL datalibrary), una americana (GenBank) e una giapponese (DDBJ)
Queste banche, si scambiano i dati che raccolgono e offrono servizi simili.
Alcune interfacce di banche dati presentate dal Prof:
• ENA -> Banca dati di sequenze nucleotidiche
• DDJB -> Banca dati di sequenze nucleotidiche
NCBI -> Il sito dell’NCBI contiene diversi database (=> diverse banche dati):
• Di sequenze nucleotidiche
• Di sequenze proteiche (=> di proteine)
• Di letteratura scientifica
• Di genomi
…
-> Le banche dati secondarie sono banche dati di sequenze proteiche.
UNIPROT -> Banca dati di proteine più grande d’Europa
La più importante banca dati di sequenze proteiche è la Uniprot (-> utilizzata per fare delle ricerche mirate su
singole proteine).
È costituita da due parti: Swiss- Prot e TrEMBLE
-> La porzione di Swiss-Prot contiene esclusivamente proteine curate manualmente (-> ad opera di una
persona fisica che prende il nome di CURATORE)
-> La porzione di TrEMBL contiene predizioni o proteine da poco sottomesse e non ancora curate
manualmente
La banca dati Uniprot, contiene un totale di circa 90.600.000 proteine.
La maggior parte di queste (circa 90.050.000) sono disponibili nella sezione TrEMBL (=> sono predizioni o
proteine da poco sottomesse e non ancora curate manualmente); mentre le restanti 550.000 sono curate
manualmente e disponibili nella sezione Swiss-Prot
RICERCA GENERICA E PER CAMPI
La ricerca in una banca dati può essere effettua:
• IN MANIERA GENERICA
• PER CAMPI
Entrambe le ricerche fanno uso di parole-chiave
Esempio: Siamo interessati alla mioglobina nell’uomo
-> Come primo passo ci dirigiamo nella banca dati Uniprot e nella casella di ricerca principale effettuiamo
una ricerca composta con l’operatore AND : “ myoglobin AND Homo sapiens”.
Ciò che stiamo facendo però, non è una ricerca per campi, bensì una ricerca generica. Perché non stiamo
dicendo alla banca dati che il nostro organismo d’interesse è Homo sapiens e la nostra proteina di interesse
è la mioglobina; ma gli stiamo semplicemente chiedendo di fornirci tutte quelle entries che contengono le
parole Homo sapiens e myoglobin
Effettuando una ricerca di questo tipo su Uniprot, otteniamo un numero totale di 20 entries
LA RICERCA CHE ABBIAMO EFFETTUATO PERO’ È SBAGLIATA!
-> IL MODO CORRETTO PER EFFETTUARE QUESTO TIPO DI RICERCA È PER CAMPI
In una ricerca per campi, le parole-chiave che utilizziamo per la nostra ricerca, devono appartenere a
specifici campi.
-> In questo caso, i due campi da utilizzare sono: Organism [OS] e Protein name [DE]
• Nel campo Organism -> inserisco la parola-chiave Homo sapiens
• Nel campo Protein name -> inserisco la parola-chiave myoglobin
RICORDA! La ricerca per campi prevede sempre l’utilizzo degli Operatori booleani.
Dopo aver selezionato e riempito i due campi di ricerca; si sceglie l’operatore booleano più adatto per
portare a termine la nostra ricerca (-> nel nostro caso AND)
Effettuando una ricerca di questo tipo, stiamo dicendo alla nostra banca dati di fornirci tutte quelle entries,
che nelle intestazioni: Organism [OS] e Protein name [DE] contengono le parole-chiave: Homo sapiens e
myoglobin
In altre parole…Stiamo dicendo alla banca dati che il nostro organismo d’interesse è Homo sapiens e la nostra
proteina d’interesse è la mioglobina.
Delle 14 entries che otteniamo, solamente una appartiene alla sezione Swiss-prot, le altre 13 appartengono
alla sezione TrEMBLE.
L’entry appartenente alla sezione Swiss- prot, è quella che contiene la nostra proteina d’interesse (ovvero la
mioglobina umana)
RICORDA! Quando siamo interessati alla proteina di un organismo ed effettuiamo una ricerca per campi su
Uniprot -> Se la ricerca viene effettuata correttamente, tra tutte le entries che otteniamo, solamente una
appartiene alla sezione Swiss- prot (ed è quella che contiene la nostra proteina di interesse)
Queste ricerche per campi vengono sempre effettuate cliccando nella sezione “Advanced”
In Uniprot, è possibile fare anche delle operazioni tra più campi.
Se la nostra ricerca richiede operazioni tra più di due campi, cliccando su Add field è possibile aggiungere
nuovi campi.
-> Nelle operazioni tra più campi, bisogna fare molta attenzione ad utilizzare correttamente gli operatori
booleani.
IMPORTANTE! In una banca dati, le ricerche vengono sempre effettuate per campi!
Questo perché? Le ricerche per campi, ci permettono di risalire in maniera immediata alle entry di nostro
interesse, senza commettere errori e finire per selezionare delle schede che non sono utili per la ricerca che
stiamo effettuando.
ACCESSION NUMBER IN UNIPROT
-> Il codice indicato con la freccia in rosso è l’accession number di quella proteina.
Se clicco sull’accession number di quella proteina, accedo ad una pagina scrollabile, in cui sono presenti
alcune informazioni relative quella proteina.
-> Queste informazioni sono contenute che in varie sezioni (Function, Names and Taxonomy, Subcellular
location, Diseas and Variants ecc.)
La sequenza di una proteina può essere facilmente scaricabile accedendo alla sezione: Sequence e Isoform
(talvolta solo Sequence) e cliccando sul tasto Download.
La sequenza di questa proteina viene scaricata in un formato di testo semplice (che prende il nome di
formato FASTA)
FORMATO FASTA -> Il formato FASTA è un formato di testo semplice, con il quale è possibile visualizzare una
sequenza proteica o nucleotidica all’interno di una banca dati.
La prima riga di un formato FASTA comincia sempre con il simbolo >, a cui seguono una serie di informazioni
riguardanti l’oggetto d’interesse della nostra entry (sequenza nucleotidica o proteica)
-> Nel caso di una sequenza proteica, dopo il simbolo > possiamo avere: l’accession number della proteina, il
nome della proteina, il nome dell’organismo in cui si trova, il nome del gene ecc.
Dalla seconda riga in poi, abbiamo l’elenco di tutti gli amminoacidi/ i nucleotidi che compongono la
sequenza.
Ciascuna riga della sequenza contiene un totale di 60 caratteri contigui (=> un totale di 60
amminoacidi/nucleotidi contigui)
-> Se il numero totale dei suoi residui non è un multiplo di 60, l’ultima riga sarà più corta delle altre.
RICORDA! Una sequenza proteica o nucleotidica può essere anche visualizzata con un formato grafico.
Il formato grafico possiede un tipo di formattazione diverso da quello del formato FASTA. In esso, i
nucleotidi o gli amminoacidi della sequenza sono raggruppati in colonne da 10 caratteri e presentano delle
spaziature
SEZIONE EXTERNAL LINKS -> Cliccando nella sezione External links, si accede ad una pagina che contiene le
cross-references => tutti i link necessari per accedere alle altre banche dati
-> Le cross-references, ci permettono di avere a diposizione altre informazioni utili su quella proteina
IN UNA BANCA DATI DI INTERESSE BIOLOGICO, LE RICERCHE DEVONO ESSERE EFFETTUATE IN INGLESE
I NOMI DELLE SPECIE DEVONO ESSERE IN LATINO
PUBMed
Pub med -> È la più importante Banca dati di letteratura biomedica
Contiene articoli scientifici sia in forma gratuita che a pagamento
Esite anche una sezione di PubMed (PubMed Central), all’interno della quale sono contenuti solamente
articoli scientifici in formato completo e gratuito (-> si parla di articoli in Open access)
Pub Med contiene moltissime Review
REVIEW -> Le review sono degli articoli scientifici, in cui un gruppo di studiosi decide di fare un summary (=>
un riassunto) su tutto quello che si conosce riguardo un determinato argomento
Gli argomenti affrontati dalle review possono essere vari
-> Abbiamo review inerenti alle tecniche di laboratorio, altre che riguardano i meccanismi molecolari ecc.
Interfaccia di PubMed:
RICORDA! L’accesso a Pub Med, si può effettuare anche dal sito dell’NCBI, selezionando l’opzione “Pub
Med” (al posto di “All databases”) e cliccando su “Search”
-> Anche in Pub med, le ricerche possono essere effettuate in maniera generica o per campi (=> utilizzando
delle parole chiave da inserire all’interno di specifici campi e facendo uso degli operatori booleani)
-> La ricerca per campi ci permette di accedere in maniera immediata alla scheda (entry) di nostro
interesse (-> ovvero quella contenente l’articolo scientifico a cui siamo interessati).
In Pub med, ciascuna entry possiede una serie di intestazioni, tra cui: titolo, autori, estremi di referenza,
codice PMID ecc.
CODICE PMID -> Il codice PMID (PubMed Id), similmente alla accession number è un codice identificativo
univoco e ci permette di indentificare in maniera univoca un lavoro scientifico.
In Pub Med, le ricerche per campi vengono sempre effettuate cliccando sulla sezione “Advanced” e
inserendo in campi specifici: il nome degli autori, il nome della rivista, la data di pubblicazione ecc.
Anche qui… il corretto utilizzo degli operatori booleani è necessario per accedere velocemente alle schede
(entries) che contengono gli articoli scientifici a cui siamo interessati
Es. Nella nostra banca dati Pub med, siamo interessati a tutti quegli articoli scientifici pubblicati da Helmer
Citterich sulla rivista “Journal of molecolar biology”
COSA FACCIAMO? Effettuiamo una ricerca per campi
1. Clicchiamo sulla sezione Advanced
2. Inseriamo nel campo [Journal] la parola-chiave “Journal of molecular biology”, nel campo [Author] òa
parola-chiave “Helmer Citterich” e facciamo un’intersezione tra i due campi
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.