Kısa cevap: Erişilemeyen bir IBM Storwize veya DS3300 depolama sisteminden veri kurtarmak çoğu durumda mümkündür. Önce sistemi kapatırsınız ve disklerin sırasını not edersiniz. Rebuild ya da yeniden başlatma (initialize) işlemi yapmazsınız. Laboratuvarda her diskin imajı alınır, RAID yapısı sanal olarak yeniden kurulur ve veriler orijinal disklere hiç yazılmadan çıkarılır.
Kurumsal depolama sistemleri uzun süre sorunsuz çalıştığı için yedekleme çoğu zaman ertelenir. Bir sabah ise tüm paylaşımlı alan birden ulaşılamaz hâle gelebilir. Bu yazıda IBM Storwize veri kurtarma sürecini, PITS Global laboratuvarlarında çözülen bir IBM System Storage DS3300 vakası üzerinden anlatıyoruz. Arızanın ilk saatlerinde BT ekibinin neye dokunması, neye dokunmaması gerektiğini de ele alıyoruz.
IBM DS3300 ve Storwize sistemleri nedir?
IBM DS3300 ve Storwize, şirketlerin birçok sunucuya ortak depolama alanı sunmak için kullandığı kurumsal depolama sistemleridir. Diskler bir RAID denetleyicisi (controller) tarafından yönetilir. Sunuculara ağ üzerinden blok düzeyinde depolama alanı (SAN, Storage Area Network) sağlanır.
DS3300 iki birim yüksekliğinde kompakt bir ünitedir. Gövdede 12 disk yuvası bulunur, genişletme modülleriyle 48 diske kadar büyütülebilir. SAS ve SATA diskleri destekler. Bu esneklik büyüyen şirketler için büyük kolaylık sağlar. Ancak veri kaybında işi karmaşıklaştıran da yine bu esnekliktir.
Bu sistemlerde veri kurtarmayı zorlaştıran nedir?
- Özel RAID yapısı: Disk sırası, şerit boyutu (stripe size) ve parite dönüşü gibi bilgiler denetleyicinin kendi meta verisinde tutulur.
- Çok katmanlı yapı: RAID dizisinin üzerinde mantıksal sürücüler (LUN) yer alır. Onların üzerinde de NTFS, VMFS veya ext4 gibi bir dosya sistemi bulunur.
- Disk sayısı: Disk sayısı arttıkça her birinin sağlıklı okunması ve doğru sıraya konması daha çok emek ister.
Vaka: Disk genişletme sırasında çöken DS3300
Bu vakada orta ölçekli bir şirketin DS3300 sistemi, rutin bir disk genişletme işlemi sırasında tamamen erişilemez hâle geldi. Sistemde fotoğraf, video ve iş belgeleri vardı. Güncel bir yedek ise yoktu.
Şirket, cihazın yedekli güç kaynağına ve hataya dayanıklı yapılandırmasına güveniyordu. Fakat bu önlemler donanım arızasına karşı koruma sağlar, mantıksal bir çöküşe karşı değil. Genişletme sırasında başlayan zincirleme hata, dizinin tamamını devre dışı bıraktı.
Genişletme işlemi neden risklidir?
Kapasite genişletme sırasında denetleyici, verileri yeni disk sayısına göre baştan dağıtır (restriping). İşlem yarıda kesilirse dizinin bir kısmı eski yerleşimde, bir kısmı yeni yerleşimde kalabilir. RAID meta verisi de tutarsız hâle gelebilir. Böyle bir durumda denetleyici diziyi tanımayabilir.
Laboratuvardan not: Yarım kalmış genişletmelerde en büyük tehlike, sistemi “düzeltmek” için atılan adımlardır. Diziyi yeniden oluşturmak veya diskleri zorla çevrim içi yapmak, sağlam kalan RAID meta verisinin üzerine yazabilir. Bu da sanal yeniden yapılandırmayı çok daha zor hâle getirir.
IBM Storwize veri kurtarma laboratuvarda nasıl yapılır?
Profesyonel süreçte orijinal disklere hiçbir şey yazılmaz. Önce disklerin kopyası alınır, RAID yapısı bu kopyalar üzerinde sanal olarak kurulur. Bu vakada PITS Global laboratuvarlarındaki uzman ekip aşağıdaki adımları izledi.
1. Ön analiz ve diskleri tek tek kontrol
Diskler sıraları korunarak sistemden çıkarıldı. Her biri salt okunur araçlarla tek tek incelendi. Fiziksel arıza belirtisi gösteren bir disk olsaydı, önce sertifikalı temiz oda (cleanroom) ortamında onarılması gerekirdi. Örneğin okuma-yazma kafası (head) değişimi buna girer. Sabit disklerin donanım ve firmware teşhisinde PC-3000 Express gibi araçlar kullanılır.
2. Sektör sektör imaj alma
Her diskin sektör sektör tam kopyası (imaj alma, imaging) çıkarıldı. Okuması zorlaşan disklerde DeepSpar Disk Imager gibi cihazlar kullanılır. Bu cihazlar okuma hızını ve tekrar sayısını kontrol ederek zayıf diski fazla yormadan veri toplar. Sonraki tüm işlemler orijinaller üzerinde değil, bu imajlar üzerinde yapıldı.
3. RAID parametrelerinin bulunması ve sanal yeniden yapılandırma
DS3300’ün özel RAID yapılandırması tersine mühendislikle çözüldü. Ekip disk sırasını, şerit boyutunu, parite dönüş yönünü ve diğer parametreleri belirledi. Ardından dizi, orijinal disklere dokunulmadan sanal ortamda yeniden kuruldu (RAID yeniden yapılandırma).
4. Dosya sisteminin onarımı ve verilerin çıkarılması
Sanal dizi kurulduktan sonra dosya sistemine erişildi. Dosya tablosunda bozulma ve RAID meta verisinde tutarsızlıklar vardı. Buna rağmen temel veri kümeleri çıkarıldı. İmaj üzerinden dosya sistemini yeniden yapılandırmak için ACE Lab Data Extractor gibi yazılımlar kullanılır.
5. Doğrulama ve teslim
Kurtarılan dosyaların bütünlüğü hash kontrolleriyle doğrulandı. Veriler daha sonra güvenli bir harici ortama aktarıldı. Sonuçta yapılandırılmış dosyalar, iş belgeleri ve multimedya içerikleri dahil tüm temel veriler geri alındı. Hem de herhangi bir yedek olmadan.
SAN depolama arızalandığında ilk ne yapmalısınız?
Yapmanız gereken ilk şey, sisteme yazma yapan her işlemi durdurmak ve hiçbir onarım adımını otomatik olarak onaylamamaktır. İlk saatlerde verilen kararlar, kurtarmanın ne kadar kolay olacağını büyük ölçüde belirler.
| Belirti | Olası neden | Ne yapmalı | Ne yapmamalı |
|---|---|---|---|
| Genişletme sonrası dizi “failed” veya “offline” | Yarım kalan yeniden dağıtım, tutarsız RAID meta verisi | Sistemi kapatın, olay günlüklerinin ekran görüntüsünü alın | Diziyi silip yeniden oluşturmayın, initialize yapmayın |
| Birden fazla disk aynı anda arızalı görünüyor | Fiziksel disk arızası, kablo/arka panel sorunu veya denetleyici hatası | Disk sırasını etiketleyin, uzmana danışın | Diskleri zorla çevrim içi yapmayın, yerlerini değiştirmeyin |
| Rebuild başladı ama ilerlemiyor ya da hata veriyor | Kalan disklerden birinde kötü sektör (bad sector) | İşlemi durdurup sistemi kapatmayı değerlendirin | Rebuild’i tekrar tekrar başlatmayın |
| LUN görünüyor ama dosya sistemi açılmıyor | Dosya sistemi veya bölüm tablosu bozulması | Sunucu tarafında birimi salt okunur tutun | CHKDSK, fsck veya “onar” araçlarını çalıştırmayın |
| Diskten tık, sürtünme veya vızıltı sesi geliyor | Mekanik hasar, kafa veya motor sorunu | Sistemi hemen kapatın | Tekrar tekrar açıp kapatmayın |
BT ekibi için güvenli kontrol listesi
- Depolamaya bağlı sunuculardaki yazma işlemlerini durdurun, uygulamaları kapatın.
- Yönetim arayüzündeki uyarıları ve olay günlüklerini (event log) değiştirmeden kaydedin. Ekran görüntüsü yeterlidir.
- Her diskin bulunduğu yuvayı ve genişletme modülündeki yerini etiketleyin.
- Son yapılan işlemi yazın: genişletme, firmware güncellemesi, disk değişimi gibi.
- Sistemi düzgün şekilde kapatın ve diskleri çıkarırsanız antistatik ambalajda saklayın.
Laboratuvardan not: Önemli olan “ne kadar çabuk tekrar çalışır” değil, “veri ne kadar az değişir” sorusudur. Rebuild ya da initialize gibi her otomatik onarım, disklerdeki ham veriyi değiştirir. Başarısız rebuild durumları için RAID 5 rebuild başarısız olunca ne yapmalı yazımıza da bakabilirsiniz.
Ne zaman profesyonel yardım almalısınız?
Dizi çevrim dışıysa, birden fazla disk arızalı görünüyorsa ya da yedeğiniz yoksa kendi başınıza deneme yapmadan uzman desteği almalısınız. Kurumsal RAID yapılarında yanlış bir adımı geri almak çoğu zaman mümkün değildir.
Aşağıdaki durumlardan biri varsa, sistemi çalıştırmaya devam etmeyin:
- Genişletme, firmware güncellemesi veya denetleyici değişimi sonrası dizi açılmıyor.
- Yönetim yazılımı diziyi silmenizi ya da yeniden oluşturmanızı öneriyor.
- Disklerden mekanik ses geliyor veya diskler hiç algılanmıyor.
- Veriler kişisel veri içeriyor ve yedeği bulunmuyor.
PITS Global Veri Kurtarma Hizmetleri, Ataşehir’deki merkez laboratuvarında RAID veri kurtarma ve sunucu veri kurtarma hizmeti verir. Verileriniz gizlilik ilkesiyle ve KVKK’ya (6698 sayılı Kişisel Verilerin Korunması Kanunu) uygun şekilde işlenir. Süreci adım adım görmek için veri kurtarma sürecimizi inceleyebilirsiniz.
Bu vakadan çıkarılacak dersler
Yedekli güç ve RAID gibi önlemler, yedeklemenin yerini tutmaz. Bu vaka, iyi kurulmuş bir sistemde bile tek bir bakım işleminin tüm verilere erişimi kesebileceğini gösteriyor.
- Genişletmeden önce yedek alın: Kapasite artırma, firmware güncellemesi gibi işlemlerden önce güncel ve doğrulanmış bir yedek olmalı.
- Yedeği farklı bir yerde tutun: Sürümlü ve tesis dışında saklanan bir yedek, mantıksal hatalara karşı da korur.
- Belgeleyin: RAID seviyesini, disk sırasını ve LUN yapısını bir yerde kayıtlı tutun.
- Arızada durun: Otomatik onarım tekliflerini kabul etmeden önce uzmana danışın.
Önemli Noktalar
- Erişilemeyen IBM DS3300 veya Storwize dizilerinden veri kurtarmak çoğu durumda mümkündür. Sonuç, hasarın türüne ve arızadan sonra yapılan işlemlere bağlıdır.
- Disk genişletme, verileri yeniden dağıttığı için yarıda kalırsa RAID meta verisini tutarsız hâle getirebilir.
- Rebuild, initialize, CHKDSK/fsck ve disk sırasını değiştirmek veri kaybını kalıcı hâle getirebilir.
- Profesyonel süreç şöyle ilerler: imaj alma, sanal RAID yeniden yapılandırma, dosya sistemi onarımı ve hash ile doğrulama.
- RAID bir yedekleme yöntemi değildir; düzenli ve sistem dışında tutulan yedek şarttır.
Kurumsal depolamanız için ücretsiz analiz
IBM Storwize, DS serisi veya başka bir SAN/NAS sisteminiz erişilemez durumdaysa, sistemi kapatıp disk sırasını not edin ve bize ulaşın. PITS Global Veri Kurtarma Hizmetleri ücretsiz analiz ve ücretsiz kargo sunar. Verileriniz kurtarılamazsa ücret alınmaz. Ataşehir’deki merkez laboratuvarımızın yanında İstanbul, Ankara, İzmir, Antalya, Bursa, Gaziantep ve Samsun şubelerimizden de destek alabilirsiniz. Bize (0216) 599 00 11 numarasından ulaşabilir ya da fiyat teklifi formunu doldurabilirsiniz.
Sıkça Sorulan Sorular
IBM DS3300'de RAID dizisi offline olduysa diskleri başka bir cihaza takarak açabilir miyim?
Önerilmez. Diskleri farklı bir denetleyiciye ya da kasaya takmak, yeni cihazın diskleri yabancı olarak algılamasına ve yapılandırmayı silmeyi önermesine yol açabilir. Yanlış bir onay RAID meta verisinin üzerine yazar. Daha güvenli yol, diskleri sırasıyla etiketleyip her birinin imajını almak ve diziyi orijinal disklere dokunmadan sanal olarak yeniden kurmaktır.
SAN depolamadan veri kurtarma ne kadar sürer?
Süre disk sayısına, disklerin kapasitesine ve fiziksel olarak sağlam olup olmadıklarına göre değişir. Her diskin tam imajının alınması gerektiği için çok diskli kurumsal sistemlerde süreç tek bir diske göre daha uzundur. Ücretsiz ön analizden sonra arızanın türü belli olur ve size bulgular ile tahmini süreç hakkında bilgi verilir.
Kurtarma için IBM depolama ünitesinin tamamını mı göndermem gerekiyor?
Çoğu durumda diskler yeterlidir. Ancak diskler mutlaka yuva sıraları etiketlenerek ve antistatik ambalajda gönderilmelidir. Bazı durumlarda denetleyici yapılandırması veya olay günlükleri teşhisi hızlandırabilir. Bu yüzden göndermeden önce uzmanla görüşüp hangi parçaların gerektiğini netleştirmeniz en doğrusudur.
Şirket verilerimiz kurtarma sürecinde gizli kalır mı?
PITS Global Veri Kurtarma Hizmetleri verileri gizlilik ilkesiyle ve 6698 sayılı Kişisel Verilerin Korunması Kanunu'na (KVKK) uygun şekilde işler. Kurtarma orijinal diskler yerine imajlar üzerinde yapılır. Veriler yalnızca dosya listesinin doğrulanması ve teslim için kullanılır. Kurumunuzun ek gizlilik gereksinimleri varsa analiz aşamasında bunları paylaşabilirsiniz.
Rebuild yarıda kaldıysa veriler tamamen kaybolmuş mu demektir?
Hayır, çoğu zaman değil. Yarım kalan bir rebuild verilerin bir kısmını yeni yerleşime göre değiştirmiş olabilir. Ama diskler fiziksel olarak okunabiliyorsa büyük bölümü kurtarılabilir. Önemli olan işlemi tekrar başlatmamak ve sisteme yeni veri yazmamaktır. Başarı, ne kadar verinin değiştiğine ve disklerin durumuna bağlıdır.
