기술 가이드

서버 이중화란? HA 솔루션과 FT 솔루션의 차이

무중단 솔루션을 검토할 때 가장 많이 받는 질문은 "이중화를 했는데 왜 서비스가 멈췄나"입니다. 이중화 방식마다 감당할 수 있는 장애의 종류와 멈추는 시간이 다르기 때문입니다. 이 문서는 서버 이중화의 구성 방식을 정리하고, HA(고가용성)와 FT(장애허용)를 복구 시간·데이터 손실·가용성 기준으로 비교합니다.

1. 서버 이중화란 무엇인가

서버 이중화는 서버를 이루는 자원을 두 벌 이상 준비해 두고, 한쪽에 장애가 발생하더라도 다른 쪽이 업무를 이어받아 서비스가 멈추지 않도록 하는 구성을 말합니다. 영어로는 이중화의 목적에 따라 고가용성(High Availability)과 장애허용(Fault Tolerance)으로 나뉘며, 국내 현장에서는 무중단 솔루션, 무정지 서버, 이중화 서버 같은 표현이 함께 쓰입니다.

주의할 점은 "이중화했다"는 말이 항상 같은 수준을 뜻하지 않는다는 것입니다. 전원 공급 장치만 두 개인 서버도 이중화이고, 두 대의 서버가 실시간으로 같은 연산을 수행하는 구성도 이중화입니다. 따라서 검토 단계에서는 무엇을 이중화했는지, 그리고 장애가 났을 때 몇 초를 멈추는지를 반드시 확인해야 합니다.

이중화의 계층

부품 이중화

전원 장치, 팬, 디스크(RAID), 네트워크 카드를 두 벌 두는 구성. 해당 부품 고장만 견딥니다.

서버 이중화

서버 자체를 두 대 이상 두는 구성. 메인보드·CPU·메모리 고장까지 견딥니다.

사이트 이중화 (DR)

떨어진 장소에 동일 시스템을 두는 구성. 화재·정전 등 건물 단위 사고에 대비합니다.

백업 (별개 영역)

이중화로는 막을 수 없는 데이터 삭제·손상·랜섬웨어에 대비합니다. 이중화의 대체재가 아닙니다.

2. 서버 이중화를 구성하는 3가지 방식

흔히 "클러스터는 소프트웨어, FT는 하드웨어"로 나누지만 정확한 구분이 아닙니다. 클러스터도 소프트웨어가 하는 일이고, 두 번째 방식도 마찬가지입니다. 실제 차이는 이중화를 누가 알고 있어야 하는가입니다. 애플리케이션과 운영체제가 이중화를 알고 맞춰줘야 하는지, 아니면 몰라도 되는지에 따라 세 가지로 나뉩니다.

방식마다 장애를 처리하는 원리가 다르고, 그에 따라 중단 시간과 데이터 보호 수준, 구축·운영 비용도 달라집니다. 아래로 갈수록 비싸지는 것은 아닙니다. 클러스터는 공유 스토리지와 클러스터 소프트웨어, 노드마다 붙는 라이선스, 전환 시나리오 검증까지 더해져 전체 비용이 오히려 더 커지는 경우도 많습니다. 제품 가격표만 보지 마시고, 업무 요구사항과 전체 소유비용(TCO)을 함께 놓고 비교하십시오.

01

HA 클러스터 (Cluster)

애플리케이션·OS 인지형 — 앱과 운영체제가 이중화를 알아야 한다

두 대 이상의 서버를 묶어두고 한 대가 업무를 처리하다가, 장애가 감지되면 대기 중인 서버가 업무를 넘겨받습니다. 이때 대기 서버에서 애플리케이션을 다시 띄우는 것이라, 클러스터 소프트웨어가 그 애플리케이션을 알고 있어야 하고 애플리케이션도 재기동을 견뎌야 합니다. 전통적인 구성 방식이며 데이터베이스·웹 서비스 등 재기동으로 복구되는 업무에 적합합니다.

  • · 장애 감지·재기동·복구 과정에서 서비스 중단이 발생합니다.
  • · 복구 시간은 DB·애플리케이션 상태에 따라 길어집니다.
  • · 전환 시점에 진행 중이던 트랜잭션과 메모리 상태는 유실될 수 있습니다.
  • · 애플리케이션이 재기동을 견디도록 설계되어 있어야 합니다.
  • · 공유 스토리지, 클러스터 소프트웨어 등 구성 요소가 늘어 관리 부담이 큽니다.
02

소프트웨어 이중화 (HA/FT)

가상머신 복제 기반 — 앱은 이중화를 몰라도 된다

표준 x86 서버 두 대에 이중화 소프트웨어를 얹고, 그 위에서 도는 가상머신을 통째로 복제하는 방식입니다. 복제는 가상머신 바깥에서 이루어지므로 그 안의 운영체제와 애플리케이션은 이중화를 알 필요가 없습니다. 전용 하드웨어 없이 구성할 수 있어 도입 문턱이 낮고, 요구 수준에 따라 HA 모드와 FT 모드를 골라 쓸 수 있는 제품도 있습니다.

  • · 기존 서버 자산을 활용할 수 있어 초기 비용 부담이 작습니다.
  • · 업무별로 보호 수준(HA / FT)을 나눠 적용할 수 있습니다.
  • · 클러스터 방식과 달리 애플리케이션 수정이나 페일오버 스크립트가 필요하지 않습니다.
  • · 두 서버를 잇는 네트워크 대역과 지연이 성능을 좌우합니다.
everRun 자세히 보기
03

하드웨어 FT 플랫폼 (FT)

목적형 하드웨어 — 서버 자체가 이중화되어 있다

Stratus ftServer는 중복된 하드웨어 구성요소가 동기화되어 동작하는 전통적인 하드웨어 FT 플랫폼입니다. 운영체제와 애플리케이션에는 하나의 서버로 보이며, 보호 대상 하드웨어 구성요소에 장애가 발생해도 처리 중인 데이터와 서비스가 유지되도록 설계되었습니다.

ztC Endurance는 이를 발전시킨 Evolutionary Fault Tolerance 아키텍처를 사용합니다. 컴퓨트 모듈은 Active/Standby로, 스토리지·I/O·전원은 Active/Active로 구성되며, AUL(Automated Uptime Layer)의 Smart Exchange가 장애 징후를 감지하면 컴퓨트 업무를 자동으로 정상 모듈에 이전합니다. 이 과정은 운영체제와 애플리케이션에 투명하게 수행되도록 설계되었습니다.

  • · 복구 시간이 없고, 진행 중이던 처리와 메모리 상태가 유지됩니다.
  • · 이중화를 위한 별도 설정이나 애플리케이션 개조가 필요 없습니다.
  • · 고장 부품은 운영 중 교체할 수 있습니다.
  • · 관리 인력이 상주하지 않는 현장에 특히 유리합니다.
ztC Endurance 자세히 보기

3. HA 솔루션과 FT 솔루션 비교

두 방식의 결정적인 차이는 "장애가 났을 때 멈추는가"입니다. HA 솔루션은 빠르게 다시 시작하는 기술이고, FT 솔루션은 애초에 멈추지 않는 기술입니다.

아래 수치는 일반적인 구성에서의 기준값이며, 실제 값은 업무 특성과 구성에 따라 달라집니다.

HA 솔루션과 FT 솔루션 비교표
구분 HA 솔루션 (고가용성) FT 솔루션 (장애허용)
장애 시 동작 감지 후 대기 노드로 전환(페일오버) OS·애플리케이션에 투명하게 처리 지속 (재기동 없음)
서비스 중단 장애 감지·재기동·복구 과정에서 중단 발생 보호 대상 하드웨어 장애 시 애플리케이션 중단이 발생하지 않도록 설계
처리 중 데이터 미완료 트랜잭션과 메모리 상태 유실 가능 보호 대상 하드웨어 장애 시 메모리와 처리 중 데이터를 보호
한계 복구 시간은 DB·애플리케이션 상태에 따라 증가 소프트웨어 오류·오조작·사이트 장애·랜섬웨어까지 방지하는 것은 아님
애플리케이션 요구사항 재기동·페일오버를 견디도록 설계 필요 수정 불필요, 일반 OS·앱 그대로 사용
운영 난이도 클러스터 설정·전환 시나리오 검증 필요 단일 시스템처럼 운영
적합한 업무 웹 서비스, 사내 시스템, 배치 업무 생산 라인 제어, 관제, 금융 거래, 엣지 설비

가용성 수치를 시간으로 환산하면

같은 "이중화"라도 소수점 자리 하나에 따라 연간 정지 시간이 열 배씩 달라집니다.

가용성별 연간 환산 정지 시간
가용성 연간 환산 정지 시간
99.9% 약 8시간 46분
99.95% 약 4시간 23분
99.99% 약 52분 34초
99.999% 약 5분 15초
99.99999% 약 3.15초
  • 일반 HA — 약 99.95~99.99%, 연 약 53분 ~ 4시간 23분
  • 지속 가용성 / FT — 99.999% 이상, 연 약 5분 15초 이하 수준
  • ztC Endurance — 99.99999% 컴퓨팅 플랫폼 가용성, 연 환산 약 3.15초

4. 어느 쪽을 선택해야 하는가

판단 기준은 예산이 아니라 1분 정지의 대가입니다. 아래 조건에 하나라도 해당한다면, 일반 HA 구성만으로 허용 가능한 중단 시간(RTO)과 데이터 손실 범위(RPO)를 지킬 수 있는지 먼저 확인해 보십시오. 지키기 어렵다면 FT 구성이나, 애플리케이션 차원에서 두 시스템이 동시에 서비스하는 Active/Active 구성을 우선 검토하실 단계입니다.

시스템이 멈추면 생산 라인이나 설비가 함께 멈춘다.

재기동 후 수작업 복구·데이터 정합성 확인에 몇 시간이 든다.

현장에 IT 담당자가 상주하지 않아, 장애 시 출동에 시간이 걸린다.

노후 애플리케이션이라 클러스터 전환에 맞춰 수정할 수 없다.

정지 시간이 안전·법규·계약상 문제로 직결된다.

반대로 사용자가 몇 분의 재접속을 감수할 수 있고 애플리케이션이 재기동에 안전하게 설계되어 있다면, HA 구성으로 충분한 경우가 많습니다. 실제 현장에서는 업무별로 등급을 나눠 핵심 업무에만 FT를 적용하고 나머지는 HA로 묶는 방식이 비용 대비 효과가 가장 좋습니다.

5. 무중단 솔루션 제품 라인업

벤터스아이티는 스트라투스(Stratus Technologies)의 무중단 서버와 고가용성 솔루션을 공급합니다. 도입 환경과 요구 가용성에 따라 아래 네 가지 중에서 선택할 수 있습니다.

6. 자주 묻는 질문

서버 이중화란 무엇인가요? +

서버를 구성하는 자원을 두 벌 이상 두어, 한쪽에 장애가 발생해도 다른 쪽이 업무를 이어받아 서비스가 멈추지 않도록 하는 구성입니다. 이중화 대상은 서버 본체뿐 아니라 전원, 네트워크, 스토리지, 그리고 서버가 위치한 사이트까지 포함될 수 있습니다.

HA 솔루션과 FT 솔루션의 차이는 무엇인가요? +

HA(고가용성) 솔루션은 장애를 감지한 뒤 대기 노드로 전환하는 방식이라 감지·재기동·복구 과정에서 서비스 중단이 발생하고, 미완료 트랜잭션과 메모리 상태가 유실될 수 있습니다. 복구 시간은 DB와 애플리케이션의 상태에 따라 길어집니다. FT(장애허용) 솔루션은 중복된 구성요소가 동기화되어 동작하므로, 한쪽에 장애가 발생해도 처리가 운영체제와 애플리케이션에 투명하게 이어집니다. 중단이나 재기동이 발생하지 않습니다.

이중화를 하면 백업은 필요 없나요? +

필요합니다. 이중화는 하드웨어 고장으로 인한 중단을 막는 기술이며 데이터 자체를 보호하지는 않습니다. 랜섬웨어 감염, 오조작에 의한 삭제, 애플리케이션 오류로 잘못된 데이터가 기록되면 그 결과가 이중화된 양쪽에 그대로 반영됩니다. 이중화와 백업, 재해복구(DR)는 서로를 대체하지 않는 별개의 대비책입니다.

가상화나 클라우드를 쓰면 이중화가 자동으로 되나요? +

가상화 플랫폼의 HA 기능은 호스트 장애 시 가상머신을 다른 호스트에서 재기동해 주는 방식이므로, 부팅 시간만큼 서비스가 멈추고 메모리 상태는 유실됩니다. 재기동으로 복구되는 업무에는 충분하지만, 중단 자체가 허용되지 않는 생산 라인 제어나 관제 시스템에는 FT 수준의 대비가 필요합니다.

어떤 업무에 FT 솔루션이 필요한가요? +

정지 시간이 곧 물리적 손실이나 안전 문제로 이어지는 업무입니다. 제조 라인 제어(MES·SCADA), 교통·에너지·수처리 관제, 금융 거래 처리, 병원 시스템, 그리고 관리 인력이 상주하지 않는 원격지·엣지 설비가 대표적입니다.

어떤 이중화가 맞는지 함께 확인해 드립니다

현재 시스템 구성과 허용 가능한 정지 시간을 알려주시면 적합한 구성안을 제안해 드립니다.