로그와 관측 개념
주제 목차 · 다음: 서버 프로세스 관리
이 문서의 결과: HandStack에서 확인해야 할 로그 종류와 GlobalID 기준 관측 방법을 설명한다.
로그는 장애 이후에만 보는 것이 아니다
로그는 장애가 난 뒤 보는 파일이 아니라, 시스템이 지금 무엇을 하고 있는지 알려주는 운영 데이터입니다. HandStack은 다음을 함께 확인해야 합니다.
ack시작 로그와 런타임 로그- 모듈별 로그(
wwwroot,transact,dbclient,function등) - 거래 요청/응답 로그(GlobalID 기준)
권장하는 로그 식별자와 민감정보 보호 기준은 twelvefactor 로그에서 확인합니다.
GlobalID를 관측의 기준으로 삼기
10. 테스트와 디버깅에서 GlobalID로 실패한 거래 하나를 추적했습니다. 운영에서는 이를 개별 장애 조사뿐 아니라 정상 기준을 세우는 데에도 사용합니다.
| 관측 항목 | 정상 기준 예시 |
|---|---|
| 거래 성공률 | 특정 시간대 실패율이 평소 대비 급증하지 않음 |
| 응답 시간 | 조회 거래가 일정 시간 안에 응답함 |
| 반복 실패 패턴 | 같은 ServiceID에서 반복적으로 실패가 발생하지 않음 |
이런 기준을 미리 정해 두면 "평소와 다르다"는 것을 로그만 보고도 빠르게 알아챌 수 있습니다.
다운타임 관점에서 로그 보기
서버가 완전히 멈추는 다운타임뿐 아니라, 응답이 느려지거나 일부 거래만 실패하는 부분 장애도 있습니다. 다운타임을 줄이는 아이디어는 프로그램 다운타임 최소화 아이디어에서 다루며, 그 전제는 결국 "무엇이 정상인지"를 로그로 정의해 두는 것입니다.
이것만 기억하세요
- 로그는 평상시에도 관찰하는 운영 데이터다.
- GlobalID를 기준으로 개별 장애 조사와 전체 정상 기준 수립을 모두 할 수 있다.