Serveriai · Stebėsena

RAID veikia, bet ar sužinotumėte apie sugedusį diską?

Serveris gali toliau aptarnauti darbuotojus, nors diskų masyvas jau praradęs dalį atsparumo. Svarbu ne tik turėti RAID, bet ir patikrinti, kas gauna perspėjimą bei organizuoja gedimo šalinimą.

· INsec komanda

Kai darbuotojai dar nepastebi problemos

Įsivaizduokime failų serverį su veidrodiniu diskų masyvu. Vienas diskas sugenda, tačiau dokumentai vis dar atsidaro. Darbuotojai nesikreipia į pagalbą, o administratorius tą savaitę sprendžia kitas užduotis. Gedimas lieka nepastebėtas, nes pranešimai siunčiami į nebenaudojamą pašto dėžutę.

Tai iliustracinis scenarijus, o ne konkretaus incidento aprašymas. Jis parodo, kodėl veikiančios programos nėra pakankamas serverio būklės rodiklis. Gedimui atsparus sprendimas turi suteikti laiko sureaguoti, tačiau tam reikia veikiančios stebėsenos ir atsakingo žmogaus.

Masyvo ir disko būklė – skirtingi dalykai

Linux programinių MD masyvų dokumentacijoje atskirai pateikiama masyvo būsena, jo narių būsenos ir atkūrimo procesai. Masyvo duomenų apsaugą lemia jo lygis bei likę veikiantys komponentai. Pavyzdžiui, RAID0 nesuteikia duomenų perteklumo. Todėl vien žodis „RAID“ serverio apraše dar nepasako, kokį gedimą aplinka gali atlaikyti.

Vertinant Linux MD aplinką reikia remtis konkrečia konfigūracija ir būsenomis, o ne visiems serveriams taikyti vieną taisyklę. Techninės būsenos aprašytos Linux branduolio RAID dokumentacijoje. Aparatiniams valdikliams būtina naudoti jų gamintojo nurodytus būklės šaltinius.

Ką gali parodyti SMART stebėsena?

Projekto „smartmontools“ tarnyba smartd stebi palaikomų diskų SMART informaciją, registruoja pokyčius ir klaidas. Ją galima sukonfigūruoti siųsti perspėjimus elektroniniu paštu. Tačiau paleista tarnyba dar neįrodo, kad ji mato visus fizinius diskus: automatinio aptikimo galimybės priklauso ir nuo valdiklio bei konfigūracijos.

Oficialioje dokumentacijoje Linux automatinio nuskaitymo apraše atskirai pažymima aparatinių RAID valdiklių diskų išimtis. Todėl po diegimo reikia patikrinti realų stebimų įrenginių sąrašą. Šaltinis – oficialaus smartmontools projekto smartd vadovas.

Pradėkite nuo inventorizacijos

INsec rekomenduojame kiekvienam svarbiam serveriui turėti trumpą saugyklos aprašą. Jame pažymėkite masyvo tipą, fizinių diskų skaičių, jų identifikatorius ir stebėsenos šaltinį. Atskirkite operacinės sistemos diskus nuo duomenų saugyklos, jei jie prižiūrimi skirtingai.

Inventorizacijoje naudinga užrašyti ir atsarginių dalių gavimo tvarką. Kas tikrina garantiją? Kas gali patekti prie serverio? Kas patvirtina pakeitimą? Atsakymai tampa ypač svarbūs, kai perspėjimas gaunamas ne darbo metu arba atsakingas specialistas atostogauja.

Išbandykite visą pranešimo kelią

Siūlome naudoti pasirinkto įrankio numatytą testinį pranešimą arba izoliuotą bandomąją aplinką. Veikiančiame produkciniame serveryje nereikia tyčia ištraukti disko vien tam, kad patikrintumėte elektroninio laiško pristatymą. Testo tikslas – įsitikinti, kad signalas pasiekia tinkamą gavėją ir yra pastebimas.

Užfiksuokite pranešimo išsiuntimo bei gavimo laiką. Patikrinkite, ar nurodytas konkretus serveris, problema ir veiksmas, kurio tikimasi iš gavėjo. Jei pranešimai integruoti į pagalbos sistemą, įsitikinkite, kad sukuriama užklausa ir paskiriamas atsakingas žmogus.

Atskirai numatykite, kas nutinka pranešimui likus nepatvirtintam. Bendras adresas be aiškios atsakomybės gali tapti vieta, kur perspėjimai kaupiasi. Taip pat verta stebėti paties duomenų rinkimo veikimą: ilgai neatnaujinta būsena neturėtų būti pateikiama kaip patvirtinimas, kad viskas gerai.

Disko pakeitimas dar neužbaigia patikros

INsec rekomenduojame prieš pakeitimą tiksliai patvirtinti probleminio disko identifikatorių ir jo fizinę vietą. Veiksmus derinkite su konkretaus serverio ar valdiklio procedūra. Vien bendro pobūdžio instrukcija neturėtų būti pagrindas keisti diską nežinomoje konfigūracijoje.

Po pakeitimo patikrinkite, ar masyvo atkūrimas baigtas, ar grįžo numatyta būsena ir ar neatsirado kitų klaidų. Užklausa turėtų būti uždaroma pagal patikros rezultatą, o ne vien pagal faktą, kad naujas diskas įdėtas. Darbuotojams svarbi paslauga taip pat turi veikti įprastai.

RAID ir atsarginės kopijos turi atskiras užduotis

Kartu rekomenduojame peržiūrėti atkūrimo planą. Masyvo stebėsena atsako į klausimą apie jo veikimą, o atsarginių kopijų bandymas – ar galėtumėte susigrąžinti reikalingus duomenis. Vieno patikrinimo rezultatu nereikėtų pakeisti kito.

Pirmas praktinis žingsnis: pasirinkite vieną svarbų serverį, patikrinkite jo masyvo ir diskų būklę, o tada išsiųskite testinį perspėjimą. Užfiksuokite, kas jį gavo ir kas būtų atsakingas už tikro gedimo šalinimą.

INsec padeda prižiūrėti serverius ir patikrinti stebėsenos pranešimų veikimą. Aptarkime jūsų infrastruktūros priežiūrą.

Šaltiniai

Techninės savybės paremtos projektų dokumentacija; darbo organizavimo ir patikrų eiga – INsec praktinės rekomendacijos.