grep

DevOps

System Monitoring 서비스 소개 (TOAST Service 들여다 보기)

NHN

2019년 9월 17일

원문에서 보기 ↗

System Monitoring이란?

지난 7월 말에 System Monitoring 서비스가 새롭게 출시되었습니다. 클라우드에서 VM 인스턴스를 생성하여 그 위에 서비스를 구축하게 되면 가장 중요한 점은 시스템을 모니터링할 수 있어야 한다는 것입니다.

시스템 모니터링 기능은 평상시에는 사용자의 개입 없이도 안정적으로 다양한 시스템 지표를 수집하고 있다가, 사용자가 주목해야 할 이벤트가 발생하면 사용자에게 그 이벤트를 알려주고 이벤트 발생 시점의 지표들이 평상시와 어떻게 다른지 파악하여 이벤트나 장애에 대응할 수 있도록 시각화를 통해 지표 데이터를 제공하게 됩니다. 자동화된 시스템 모니터링 기능이 없다면 사용자가 직접 정기적으로 지표 데이터를 수집하고 있다가 장애가 발생하고 나서야 지표 데이터를 살펴보고 경험적으로 원인을 분석할 수밖에 없어서 서비스 안정성에 영향을 주게 됩니다.

System Monitoring 서비스는 Instance 서비스의 보조 기능으로 제공되고 있어서 Instance 서비스에서도 사용 가능하며, 별도의 메뉴를 통해 접근하여 사용할 수도 있습니다.

모니터링 시작 방법

우선, 에이전트(agent)를 설치하여 모니터링을 시작해보겠습니다. Compute > Instance 서비스로 접근합니다. VM 인스턴스를 하나 골라서 클릭하면 하단에 "기본 정보"와 "접속 정보", "모니터링" 영역이 노출되는데, 이 중에서 "모니터링" 탭 메뉴를 클릭하면 시스템 모니터링 탭 화면이 노출됩니다.

이미 에이전트가 설치되어 시스템 지표를 정상적으로 수집하고 있는 중이라면 차트가 노출되고, 그렇지 않다면 에이전트 설치 가이드가 노출됩니다. 해당 VM 인스턴스에 접속하여 에이전트 설치 가이드에 따라 명령을 실행하면 에이전트가 설치/실행되어 이때부터 시스템 지표를 수집하게 됩니다.

1.png

시스템 지표가 수집되면 해당 탭에서 다음과 같이 차트가 노출되는 것을 확인할 수 있습니다.

2.png

기본적으로 제공되는 지표는 CPU 사용률과 평균 부하, 메모리 사용률, 디스크 사용률, 디스크 전송률, 네트워크 전송률입니다.

System Monitoring 서비스가 제공하는 기능

레이아웃과 차트 관리

System Monitoring 서비스의 지표는 별도 메뉴에서도 확인 가능합니다. Compute > System Monitoring 메뉴로 접근하면 여러 VM 인스턴스의 시스템 지표를 함께 확인 가능합니다.

대시보드 탭에서는 여러 VM 인스턴스의 지표들을 미리 정의된 레이아웃에 따라 배치된 차트를 보고 확인할 수 있습니다. 3 main.png

"레이아웃 생성(Create Layout)" 버튼을 클릭하여 새로운 레이아웃을 만들거나 "차트 추가(Add Chart)" 버튼을 클릭하여 사용자가 원하는 차트를 추가한 뒤, 원하는 위치에 배치할 수 있습니다.

Instance 서비스의 Monitoring 탭에서 기본적으로 제공되던 시스템 지표보다는 좀 더 다양한 지표를 확인할 수 있습니다. 추가적으로 제공되는 시스템 지표에는 CPU User/System/Nice/IO Wait, 메모리 Used/Buffers/Cached/Free, Swap Used/Total, Swap 사용률, 네트워크 전송률(pps), Process 수가 있습니다.

차트 위에 마우스를 올려놓으면 특정 시간의 지표 수치를 확인할 수 있고, Drag&Drop을 하면 확대해서 상세히 살펴볼 수도 있습니다.

사용자 그룹 관리

Compute > System Monitoring 메뉴 > 사용자 그룹(User Group) 탭에서는 시스템 모니터링 기능을 함께 사용할 사용자들을 그룹 별로 분리하여 관리할 수 있습니다. "그룹 만들기(Create Group)" 버튼을 클릭하여 그룹을 만들고 여기에 사용자들을 추가할 수 있습니다. 이렇게 만들어진 그룹은 "알림 그룹(Notify Group)" 탭에서 알림을 수신할 대상자로 사용할 수 있습니다.

4.png

알림 그룹 관리

Compute > System Monitoring 메뉴 > 알림 그룹(Notify Group) 탭에서는 이벤트 감시 설정과 이벤트 알림을 수신할 사용자 그룹과 알림 유형 등을 관리할 수 있습니다.

5.png

특정 인스턴스의 시스템 지표가 사용자가 정의한 감시 설정의 기준치에 도달했을 때, 이벤트가 발생했다고 판단하여 이벤트 발생 알림을 송신하게 됩니다. 미리 정의된 수신 대상 사용자 그룹에게 SMS나 Email로 이벤트 발생 알림이 송신되어 사용자가 이를 수신하여 시스템 지표가 이상 수치에 도달했음을 인지할 수 있도록 합니다.

사용자는 감시 대상 인스턴스, 감시 설정(시스템 지표 기준치), 수신 대상 사용자 그룹, 알림 유형 등을 미리 설정해두면 시스템 장애나 서비스 부하로 인한 이벤트를 인지할 수 있습니다.