Dizi Hizalama — Biyolojik Dizi Hizalama
Biological Sequence Alignment · Ayrıca şöyle bilinir: pairwise alignment, multiple sequence alignment, MSA, sequence comparison
Dizi hizalama, iki veya daha fazla DNA, RNA veya protein dizisini benzerlik bölgelerini ortaya çıkarmak, evrimsel ilişkileri çıkarmak, fonksiyonel alanları belirlemek ve referans genomlara dizileme okumalarını eşlemek için düzenleyen temel bir biyoinformatik tekniğidir. Varyant çağırma ve gen ifadesi nicelemesinden filogenetiğe ve yapısal annotasyona kadar neredeyse her aşağı akış genomik analizin temelini oluşturur.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+5 tane daha
Ne zaman kullanılır
Biyolojik dizileri karşılaştırmanız gerektiğinde dizi hizalamayı kullanın: varyant çağırma veya ifade nicelemesinden önce kısa okumaları bir referans genomuna eşlemek; türler arasında homolog genleri veya proteinleri belirlemek; korunmuş fonksiyonel alanları tespit etmek; veya filogenetik analize girdi olarak evrimsel ilişkileri çıkarmak. İki diziyi karşılaştırmak için çiftli hizalama uygundur; üç veya daha fazla homologu hizalarken MSA gereklidir. Nicel özellik veya ifade çalışmaları için tek başına bir analiz olarak dizi hizalamayı kullanmayın — bu bir ön işleme adımıdır, son nokta yöntemi değildir. DNA için tasarlanmış hizalama araçlarını, uygun bir yerine koyma matrisi seçmeden protein verilerine uygulamaktan kaçının ve yalnızca yerel benzerliğin beklendiği durumlarda (örneğin, kısa bir alanı tam uzunlukta bir proteine karşılaştırırken) global hizalama algoritmalarını kullanmayın.
Güçlü yönler & sınırlılıklar
- Matematiksel olarak temellendirilmiş: dinamik programlama, belirli bir puanlama şeması için optimal hizalamayı garanti eder.
- Tüm organizmalardaki DNA, RNA ve protein dizilerine evrensel olarak uygulanabilir.
- İki dizinin çiftli karşılaştırmasından milyarlarca kısa okumanın genom çapında okuma eşlemesine kadar ölçeklenir.
- Yaygın olarak doğrulanmış ve olgun, topluluk tarafından sürdürülen yazılımlara (BLAST, BWA-MEM, STAR, MUSCLE, MAFFT) gömülüdür.
- Hizalama dosyaları (SAM/BAM) standartlaştırılmıştır ve tüm aşağı akış genomik araç zinciriyle uyumludur.
- Optimal dinamik programlama algoritmaları (Needleman–Wunsch, Smith–Waterman) hesaplama açısından pahalıdır (O(mn) zaman ve alan) ve sezgisel hızlandırma olmadan tam genom karşılaştırmaları için pratik değildir.
- Hizalama kalitesi, genellikle uygun şekilde ayarlanması için alan bilgisi gerektiren yerine koyma matrisi ve boşluk cezalarının seçimine duyarlıdır.
- Yüksek derecede farklılaşmış diziler (düşük kimlik), gerçek homolojiyi yansıtmayan güvenilmez hizalamalara neden olabilir.
- Büyük, değişken uzunluklu veri kümelerinin çoklu dizi hizalaması, kesin anlamda NP-zorudur; sezgisel MSA araçları küresel olarak değil, yerel olarak optimal çözümler döndürebilir.
- Tekrarlayan genomik bölgeler, okumaların belirsiz bir şekilde eşlenmesine neden olur ve çoklu eşleşen okumalar, aşağı akış artefaktlarından kaçınmak için dikkatli bir şekilde ele alınmalıdır.
SSS
Global ve yerel hizalama arasındaki fark nedir?
Global hizalama (Needleman–Wunsch), her iki dizinin tam uzunluğunu baştan sona hizalar, gerektiğinde boşluklar ekler. Her iki dizinin de benzer uzunlukta olduğu ve tüm uzantıları boyunca homolog olması beklendiği durumlarda uygundur (örneğin, ortolog tam uzunlukta proteinleri karşılaştırırken). Yerel hizalama (Smith–Waterman), uçtan uca kapsama gerektirmeden en yüksek puan alan ardışık eşleşen alt dizileri bulur. Daha büyük, aksi takdirde farklılaşmış bir dizi içindeki korunmuş bir alanı ararken veya sorgu ve hedef uzunlukları önemli ölçüde farklı olduğunda tercih edilir.
BLAST ile BWA gibi bir kısa okuma hizalayıcısı ne zaman kullanılmalıdır?
BLAST, veritabanı benzerliği araması için tasarlanmıştır — bir veya birkaç diziniz vardır ve büyük bir veritabanındaki homologları bulmak istersiniz. Puanlanmış eşleşmeleri E-değerine göre sıralanmış olarak döndürür ve rastgele uzunluktaki dizileri işler. Kısa okuma hizalayıcıları (BWA, Bowtie2, HISAT2), NGS platformları tarafından üretilen milyonlarca kısa okumayı (50–300 bp) tek bir referans genomuna çok yüksek verimlilikle eşlemek üzere optimize edilmiştir. Açıklama ve homoloji aramaları için BLAST'ı kullanın; genomik, transkriptomik veya epigenomik deneylerde okuma eşlemesi için kısa okuma hizalayıcısını kullanın.
E-değeri nedir ve hangi eşiği kullanmalıyım?
BLAST aramasındaki E-değeri (beklenen değer), aynı boyuttaki bir veritabanında şans eseri bu puan seviyesinde beklenen eşit veya daha iyi puana sahip hizalama sayısını bildirir. 0.001'lik bir E-değeri, bu puan seviyesinde yaklaşık olarak her 1000 aramada bir yanlış pozitif anlamına gelir. Eşikler bağlama bağlıdır: 1e-5, homoloji çıkarımı için yaygın bir muhafazakar kesme noktasıdır; 1e-3 uzak homologlar için kullanılabilir; 0.01'in üzerindeki değerler dikkatle yorumlanmalıdır. Her zaman E-değerini yüzde kimlik ve hizalama kapsamıyla birleştirin — kısa hizalama kapsamıyla düşük bir E-değeri hala biyolojik olarak bilgilendirici olmayabilir.
Dizi hizalama uzun okuma dizileme verileri için çalışır mı?
Evet, ancak standart kısa okuma hizalayıcıları uygun değildir. Oxford Nanopore veya PacBio platformlarından gelen uzun okumalar tipik olarak 1–50 kb'dir ve Illumina okumalarından daha yüksek baz başına hata oranlarına sahiptir. minimap2 ve NGMLR gibi araçlar uzun okuma hizalaması için tasarlanmıştır; farklı bir tohum stratejisi (minimizerler) kullanırlar ve uzun okuma teknolojilerinin karakteristik özelliği olan artan indel oranlarına toleranslıdırlar.
Protein hizalaması için nasıl bir yerine koyma matrisi seçmeliyim?
BLOSUM ailesi, çoğu protein hizalama görevi için standart seçimdir. BLOSUM62, BLAST'ta varsayılandır ve yaklaşık %30–60 kimliğe sahip diziler için iyi performans gösterir. Daha uzak akraba proteinler için ( %30 kimliğin altında) daha farklı eğitim setleri üzerinde kalibre edilmiş ve nadir ama evrimsel olarak olası yerine koymalar için daha yüksek puanlar atayan BLOSUM45 veya BLOSUM30'u kullanın. PAM matrisleri daha eski bir alternatiftir; PAM250, uzak karşılaştırmalar için BLOSUM45'e kabaca benzerdir.
Kaynaklar
- Needleman, S. B., & Wunsch, C. D. (1970). A general method applicable to the search for similarities in the amino acid sequence of two proteins. Journal of Molecular Biology, 48(3), 443–453. DOI: 10.1016/0022-2836(70)90057-4 ↗
- Smith, T. F., & Waterman, M. S. (1981). Identification of common molecular subsequences. Journal of Molecular Biology, 147(1), 195–197. DOI: 10.1016/0022-2836(81)90087-5 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Biological Sequence Alignment. ScholarGate. https://scholargate.app/tr/bioinformatics/sequence-alignment
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- ChIP-seq Peak CallingBiyoenformatik↔ karşılaştır
- Genom Çapında İlişkilendirme Çalışması (GWAS)Biyoenformatik↔ karşılaştır
- Filogenetik AnalizBiyoenformatik↔ karşılaştır
- RNA-seq Diferansiyel İfadeBiyoenformatik↔ karşılaştır
- Tek hücre RNA-seq AnaliziBiyoenformatik↔ karşılaştır
- Variant CallingBiyoenformatik↔ karşılaştır