서버 상태 모니터링
서버의 리소스 사용량과 성능을 실시간으로 모니터링하세요.
모니터링 대시보드
접속 방법
- 워크스페이스 앱에서 메트릭 열기
- 확인할 서버 클릭
- 실시간 메트릭 차트 확인
모니터링 메트릭
서버 차트(CPU, 메모리, 디스크, 디스크 I/O, 네트워크)와 메트릭 알림 규칙은 메트릭 확장 기능에 포함됩니다. 무료 플랜에서는 이 기능을 켤 수 없습니다. Essentials 및 Enterprise 워크스페이스에서는 **워크스페이스 설정 > 통합 > 확장 기능**에서 켤 수 있습니다. 기존 유료 플랜 워크스페이스에는 이미 켜져 있고, 새로 만든 워크스페이스에는 처음에 꺼져 있습니다.
확장 기능을 켜면 대시보드에 다음 차트가 표시됩니다.
- CPU 사용량: 전체 CPU 사용률
- 메모리 사용량: 시스템 메모리 사용률
- 디스크 사용량: 파티션별 디스크 사용량
- 디스크 I/O: 디스크별 읽기 및 쓰기 속도(최댓값/평균)
- 네트워크 트래픽: 인터페이스별 네트워크 사용량(bps/pps)
확장 기능이 켜져 있는 동안 새 데이터가 약 1분마다 들어옵니다.
확장 기능이 꺼져 있으면 차트와 메트릭 알림에 빈 차트 대신 확장 기능이 켜져 있지 않거나 현재 플랜에서 켤 수 없다는 안내가 표시됩니다.
모든 플랜에서 확장 기능 상태와 관계없이 두 가지를 계속 사용할 수 있습니다. 하나는 서버의 온라인/오프라인 상태와 오프라인 알림이고, 다른 하나는 기본 디스크 사용량 알림에 쓰이는 디스크 사용량입니다. 디스크 사용량은 보통 서버 자체 볼륨만 집계하며, 에이전트가 해당 볼륨을 식별하지 못하면 모든 볼륨을 집계합니다. 최신 측정값은 모든 플랜에서 확장 기능 상태와 관계없이 서버의 개요 탭에 있는 에이전트 정보의 볼륨 사용량에 표시됩니다. API를 사용하는 경우 서버의 컬렉션 프로필에서 같은 값을 확인할 수 있습니다.
2.37.0부터 메트릭 개요는 최신 메트릭 엔드포인트에서 각 서버의 최신 값을 읽습니다. 스크립트나 통합 기능에서도 같은 방식으로 이 엔드포인트를 호출할 수 있습니다.
네트워크 인터페이스
alpamon v2.7.3부터는 에이전트를 업그레이드해도 서버의 인터페이스 목록에서 인터페이스가 제거되지 않습니다. 달라지는 것은 네트워크 트래픽 차트입니다. 컨테이너에서 쓰는 가상 인터페이스인 veth 쌍의 한쪽, macvlan 또는 ipvlan 인터페이스, tun 또는 tap 장치, dummy 인터페이스는 트래픽 보고를 중단하므로 수명이 짧은 컨테이너 인터페이스가 차트를 채우지 않습니다. 이 인터페이스들은 목록에 남고 차트에만 데이터가 표시되지 않습니다. 컨테이너 안에서 실행되는 에이전트처럼 이들을 제외하면 서버에서 트래픽을 보고하는 인터페이스가 하나도 남지 않는 경우에는 에이전트가 해당 인터페이스의 트래픽을 계속 보고합니다.
루프백과 WireGuard, OpenVPN tun, PPP 링크처럼 하드웨어 주소가 없는 인터페이스는 원래 표시되지 않았으며, 아래 설정으로도 추가할 수 없습니다.
특정 가상 인터페이스의 트래픽을 다시 보려면 에이전트 설정 파일의 [interface] 아래
include_virtual에 해당 인터페이스를 추가한 다음 에이전트를 재시작하세요:
[interface]
include_virtual = veth0, cali*
차트뿐 아니라 인터페이스 목록에서도 해당 인터페이스를 제거하려면 [interface] 아래
exclude_virtual_from_inventory = true를 설정하세요. 단, Alpacon 서버가 2.37.2 이상일 때만
사용하세요. 이전 버전 서버에서 이 방식으로 인터페이스를 제거하면 트래픽 기록도 함께 삭제됩니다.
macOS와 Windows에서는 에이전트가 이전과 같이 이름을 기준으로 트래픽을 보고할 인터페이스를 결정합니다.
차트 보기
차트의 선 위에 마우스를 올리면 툴팁에서 자세한 정보를 확인할 수 있습니다.
기간 선택
선택할 수 있는 기간은 요금제마다 다릅니다. 요금제별로 제공되는 기간은 요금제 및 결제를 참고하세요.
차트 상단에서 기간을 선택하세요.
- 최근 1시간
- 최근 24시간 (1일)
- 최근 7일 (1주)
- 최근 1개월
- 최근 3개월
- 최근 1년
- 직접 기간 지정
요금제의 데이터 보관 기간 안에 드는 기간만 선택할 수 있습니다. Essentials에서는 최근 1개월까지, Enterprise에서는 모든 기간을 선택할 수 있습니다.
차트 새로고침
Refresh 필드에서 새로고침 간격을 분 단위로 설정할 수 있습니다. 오른쪽의 화살표 아이콘 버튼을 누르면 차트가 즉시 새로고침됩니다.
메트릭 알림
메트릭 알림도 Metrics 확장 기능에 포함됩니다. 위의 차트와 같은 방법으로 확장 기능을 켜세요. 규칙은 메트릭 하나를 감시하다가 설정한 임계값을 넘으면 알림을 발생시킵니다.
규칙이 알림을 발생시키는 조건
Alpacon은 에이전트가 이미 전송한 데이터를 사용해 약 1분마다 모든 규칙을 확인합니다. 값이 설정한 시간 동안 임계값을 넘은 상태로 유지되면 알림이 발생합니다. 지속 시간을 0으로 설정했다면 첫 번째 측정값에서 바로 발생합니다. 알림은 값이 복구 임계값을 넘어 되돌아왔을 때만 해제됩니다. 복구 임계값을 설정하지 않았다면 알림 발생 임계값을 다시 넘어 되돌아와야 해제됩니다. 따라서 값이 임계값 부근에서 움직여도 알림이 켜졌다 꺼졌다 하지 않습니다.
지속 시간을 0보다 크게 설정할 때는 감시 대상의 데이터 수집 간격을 최소 두 번 포함해야 합니다. 이보다
짧으면 두 번째 측정값이 안정적으로 들어오지 않아, 지속 시간을 설정했더라도 첫 측정값에 바로 반응하는
규칙처럼 작동할 수 있습니다. 첫 측정값에서 알림을 발생시키는 0에는 이 제한이 적용되지 않습니다.
지속 시간 설정 위치는 규칙에서 설정할 수 있는 항목을 참고하세요.
모든 워크스페이스에 기본으로 제공되는 CPU 사용량 및 메모리 사용량 규칙은 값이 약 5분 동안 80% 이상으로 유지되면 알림을 발생시키고, 75% 미만으로 내려가면 해제합니다. 기본 디스크 사용량 규칙은 측정값 하나가 80%에 도달하면 바로 알림을 발생시키고, 78% 미만으로 내려가면 해제합니다.
값이 너무 높거나 낮을 때 알림을 받을 수 있습니다. 디스크 사용량, 디스크 I/O, 네트워크 규칙에서는 디스크나 인터페이스마다 별도의 알림이 발생합니다. 서버가 보고하는 모든 장치 대신 특정 장치 하나에만 규칙을 적용할 수도 있습니다.
서버가 설정한 시간보다 오래 메트릭을 보고하지 않을 때도 알림을 발생시킬 수 있습니다. 서버의 보고가 끊긴 동안 알림은 열린 상태로 유지되며, 데이터가 들어오지 않는다는 이유만으로 해제되지 않습니다.
각 규칙에는 심각도도 설정됩니다. 심각도는 critical, warning, info 중 하나이며, 발생한 알림에 표시되고 이메일이나 Slack으로 알림을 보낼 수 있는지도 결정합니다. 각 심각도의 동작은 규칙에서 설정할 수 있는 항목을 참고하세요.
서버에 알림 연결
- 워크스페이스 앱에서 메트릭 열기
- 서버를 선택하고 규칙 탭으로 이동
- 규칙 할당 클릭
- 워크스페이스에서 만든 알림 중 선택
알림은 먼저 워크스페이스의 메트릭 앱 메트릭 알림 화면에서 만들어야 합니다.
규칙 추가
메트릭 앱의 메트릭 알림 화면에서 만듭니다.
- 새 규칙 클릭
- 대상 선택. CPU 사용량, 메모리 사용량, 디스크 사용량을 선택하면 모든 워크스페이스에 처음부터 있는 기본 규칙의 값이 입력된 양식이 열림. 디스크 I/O와 네트워크를 대상으로 선택하면 임계값을 직접 입력
- 조건, 범위, 전달, 고급에서 필요한 항목 수정
- 저장
모든 필드는 규칙에 설정할 수 있는 항목에 나와 있습니다.
목록에는 성능 규칙이 연결되지 않은 서버가 한 대 이상 있으면 해당 서버 수와 서버 목록으로 바로 가는 링크도 설명 옆에 표시됩니다.
참고: 대상마다 기본 규칙은 하나만 만들 수 있습니다.
기본 규칙이란? 새 서버를 등록하면 자동으로 적용되는 규칙입니다. 모든 워크스페이스에는 처음부터 세 가지가 있습니다. CPU 사용량과 메모리 사용량은 값이 약 5분 동안 80% 이상이면 알림이 발생하고 75% 미만으로 내려가면 해제됩니다. 디스크 사용량은 첫 측정값이 80% 이상이면 알림이 발생하고 78% 미만으로 내려가면 해제됩니다.
규칙 수정
규칙 이름을 클릭하면 탭 두 개가 있는 규칙 페이지가 열립니다. 규칙 탭에는 규칙의 동작을 한 문장으로 요약한 내용과 각 필드의 설정이 표시되고, 업데이트 탭에서는 새 규칙과 같은 양식이 열립니다. 적용된 서버에는 이 규칙이 연결된 모든 서버가 표시됩니다. 서버별 재정의로 규칙 적용에서 제외된 서버도 여기에 표시됩니다. 목록 행의 작업 메뉴에서 목록을 벗어나지 않고 규칙을 수정하거나 삭제할 수 있습니다.
- 대상의 유일한 기본 규칙은 삭제할 수 없음
규칙 수정 및 삭제 권한
워크스페이스 관리자는 모든 규칙을 수정하거나 삭제할 수 있습니다. 역할에 규칙 수정 및 삭제 권한이
있는 사용자도 그렇게 할 수 있습니다. 기본 제공 operator 역할에는 두 권한이 모두 있지만 member
역할에는 없습니다. 규칙을 만들었다는 이유만으로 만든 사람에게 별도의 접근 권한이 주어지지는
않습니다.
관리자는 개인, 그룹 또는 서비스 토큰에 전체 역할을 바꾸지 않고 특정 규칙 하나의 수정 및 삭제 권한을 부여할 수도 있습니다. 현재 역할로 관리할 수 없는 규칙이 있다면 워크스페이스 관리자에게 요청하세요. 아직 규칙 페이지에서는 이 권한을 부여할 수 없습니다.
일부 오래된 규칙은 만든 사람이 여전히 해당 규칙을 수정하고 삭제할 수 있습니다. Alpacon이 규칙을 만들 때 자동으로 부여한 권한 때문이며, Alpacon은 이 권한을 점차 정리하고 있습니다.
기본 CPU 사용량 규칙과 메모리 사용량 규칙은 다른 규칙과 마찬가지로 규칙 수정 권한이 있으면 누구나 수정할 수 있습니다. 모든 워크스페이스에 처음부터 있는 디스크 사용량 규칙은 다릅니다. 이 규칙은 워크스페이스 관리자만 수정하거나, 다른 규칙을 이 기본 규칙으로 바꾸거나 이 규칙을 일반 규칙으로 바꾸거나, 서버별 재정의를 추가·수정·삭제하거나, 서버에서 연결을 해제할 수 있습니다. 이 규칙을 서버에 다시 연결할 때는 이런 제한이 적용되지 않으며, 이미 규칙을 볼 수 있는 사람은 계속 미리 볼 수 있습니다.
디스크 사용량 규칙을 포함해 어떤 기본 규칙도 기본 규칙으로 지정되어 있는 동안에는 삭제할 수 없습니다.
규칙에 설정할 수 있는 항목
콘솔 양식에서 이 항목을 모두 설정할 수 있으며, 조건, 범위, 전달, 고급으로 묶여 있습니다. 알림 규칙 API에서도 같은 필드를 사용할 수 있습니다.
| 필드 | 기능 | 설정 조건 |
|---|---|---|
| 이름 | 규칙을 식별함 | 워크스페이스에서 고유해야 함 |
| 대상 | 규칙이 감시하는 메트릭: CPU 사용량, 메모리 사용량, 디스크 사용량, 디스크 I/O(읽기·쓰기 최대값 또는 평균값), 네트워크 트래픽(송신·수신 최대값 또는 평균값, bps 또는 pps) | — |
| 임계값 | 알림이 발생하는 기준값 | — |
| 방향 | 값이 임계값 이상이거나 이하일 때 알림 발생 | — |
| 지속 시간 | 값이 임계값을 넘은 상태로 유지되어야 알림이 발생하는 시간 | 0이면 첫 측정값에서 바로 알림 발생, 양수이면 대상 메트릭 수집 주기의 2배 이상이어야 함 |
| 복구 임계값 | 알림이 해제되려면 메트릭 값이 돌아와야 하는 기준값 | 알림 발생 방향의 반대편에 있어야 함: 방향이 임계값 이상이면 임계값보다 낮아야 하고, 임계값 이하이면 임계값보다 높아야 함. 비워 두면 임계값 자체를 기준으로 알림 해제 |
| 데이터 미수신 기간 | 이 기간보다 오래 메트릭이 수신되지 않으면 별도 알림 발생 | 메트릭 수집 주기 이상, 24시간 이하여야 함 |
| 장치 | 규칙 적용 대상을 디스크 또는 네트워크 인터페이스 하나로 제한 | 디스크 사용량, 디스크 I/O, 네트워크 규칙에만 적용 가능. CPU와 메모리는 서버 전체에 적용되므로 장치별로 범위를 제한할 수 없음 |
| 심각도 | 발생한 알림의 심각도와 아래 두 전송 대상 중 실제로 알림을 받는 대상 결정: 긴급은 이메일과 Slack 모두 가능, 경고는 Slack만 가능, 정보는 둘 다 받지 않음 | 기본값은 경고 |
| 이메일 수신 대상 | 서버를 볼 수 있는 사람 중 알림 이메일을 받을 대상: 서버를 볼 수 있는 모든 사람, 워크스페이스 관리자만, 서버 그룹 구성원과 소유자, 또는 개별 알림 이메일 수신 안 함. 심각도가 긴급인 규칙에만 적용 | 기본값은 서버를 볼 수 있는 모든 사람 |
| Slack 채널 게시 | 알림 발생 및 해제 내용을 워크스페이스에 연결된 Slack 채널에 게시할지 여부 | 기본값은 켜짐 |
| 기본 규칙 | 이후 등록되는 모든 서버에 자동으로 적용됨 | 대상과 장치 조합당 기본 규칙은 하나만 허용 |
심각도에 따라 위의 두 전송 수단 중 실제로 사용할 수 있는 수단이 정해집니다. 각 필드는 해당 수단의 수신 대상이나 게시 여부를 정합니다. 심각도가 긴급이면 두 필드의 설정대로 이메일을 보내고 Slack에 게시합니다. 기본값인 경고이면 이메일 수신 대상 설정과 관계없이 이메일을 보내지 않으며, Slack 채널 게시가 켜져 있을 때만 게시합니다. 심각도가 정보이면 이메일도 보내지 않고 Slack에도 게시하지 않습니다. 심각도와 관계없이 모든 알림은 콘솔과 알림 종 아이콘에 기록되고, 해당 규칙의 이벤트를 구독한 웹훅으로 전달됩니다. 알림이 해제되기 전까지는 워크스페이스 관리자에게 매시간 보내는 미해결 알림 요약에도 포함됩니다. 이메일을 계속 보내야 하는 규칙은 심각도를 긴급으로 설정하세요.
서버별로 규칙의 임계값, 복구 임계값, 지속 시간을 다르게 설정하거나 규칙 적용에서 서버를 완전히 제외할 수도 있습니다. 자세한 내용은 서버별 재정의를 참고하세요. 위의 이메일 및 Slack 전송 설정과 심각도는 워크스페이스 전체에만 적용됩니다.
서버별 설정
서버마다 워크스페이스 규칙의 임계값, 복구 임계값 또는 지속 시간을 따로 설정하거나 해당 규칙을 적용하지 않을 수 있습니다. 다른 서버에 적용되는 규칙은 바뀌지 않습니다. 다만 모든 워크스페이스에 기본으로 제공되는 디스크 사용량 규칙은 예외입니다. 자세한 내용은 규칙을 수정하거나 삭제할 수 있는 사람을 참고하세요.
서버의 규칙 탭에서 설정하세요. 규칙 행의 작업 메뉴를 열고 서버별 설정을 선택하세요. 처음 열린 양식에는 규칙의 값이 표시되며, 현재 서버에도 그 값이 적용됩니다. 필드를 규칙의 값 그대로 두면 이후 규칙의 값이 바뀔 때 이 서버에도 반영됩니다. 다른 숫자를 입력하면 그 필드에만 별도 값이 적용됩니다. 서버를 규칙에서 제외하려면 이 서버에 이 규칙 적용을 해제하세요. 규칙 값으로 되돌리기를 선택하면 서버별 설정이 삭제됩니다.
같은 탭의 적용 상태 열에는 각 규칙이 규칙 값, 별도 설정, 적용 안 함 중 어느 상태인지 표시됩니다.
관리 권한이 있는 서버라면 규칙별 서버 설정 API에서도 같은 항목을 설정할 수 있습니다.
알림 수신
임계값을 넘거나 메트릭 보고가 끊겨 규칙이 발동하면 즉시 콘솔의 알림 목록과 대시보드에 표시되고, 이벤트를 구독한 웹훅에도 전달됩니다. 이메일과 Slack 메시지는 약 2분 더 기다렸다가 문제가 계속되는지 확인한 뒤 보냅니다. 그 전에 문제가 해소되면 해당 알림의 이메일과 Slack 메시지는 보내지 않습니다. 콘솔 알림 목록에는 해결된 상태로 남고, 해결 이벤트를 구독한 웹훅에도 전달됩니다.
이메일이나 Slack 메시지를 보낼 만큼 알림이 오래 지속되면 규칙의 심각도에 따라 수신 대상이 달라집니다. 긴급 알림은 규칙에 지정된 이메일 수신 대상에게 전달되며, 규칙에서 Slack 채널 게시를 켰다면 워크스페이스에 연결된 Slack 채널에도 게시됩니다. 여러 알림이 동시에 발생하면 하나의 요약으로 묶입니다. 새 규칙의 기본값인 경고 알림은 이메일 수신 대상 설정과 관계없이 개별 이메일을 보내지 않습니다. Slack 채널 게시를 켰을 때만 Slack에 게시되며, 설정 여부와 관계없이 알림이 열려 있는 동안 워크스페이스 관리자에게 매시간 발송되는 열린 알림 요약에 포함됩니다. 정보 알림은 이메일이나 Slack으로 전달되지 않습니다. 긴급 규칙은 기본적으로 서버를 볼 수 있는 모든 사람에게 이메일을 보내지만, 수신 대상을 워크스페이스 관리자만, 서버가 속한 그룹의 구성원과 소유자, 또는 개별 알림 이메일을 받는 사람 없음으로 좁힐 수 있습니다. 두 설정 항목은 규칙에서 설정할 수 있는 항목을 참고하세요. 이메일을 계속 받아야 하는 규칙은 심각도를 긴급으로 설정하세요. 서버를 볼 수 있는 사람의 범위, 이메일에 본인 이름이 표시되는 이유, 본인의 이메일을 끄는 방법은 알림 수신 방식을 참고하세요.
알림이 하나일 때 이메일과 Slack 메시지의 제목에는 규칙이 감지한 내용이 담깁니다. 예를 들어 지속
시간이 설정된 규칙이라면 CPU usage 92% ≥ 80% for 5 minutes on web-01, 메트릭 보고가 끊겼다면
CPU usage stopped reporting on web-01처럼 표시됩니다. 여러 알림이 동시에 발생하면 짧은 요약이
제목으로 표시됩니다.
이메일이나 Slack으로 알림을 받은 뒤 문제가 해결되면 같은 수신 대상에게 후속 메시지를 보내고 이유를 알려줍니다. 메트릭이 정상으로 돌아왔거나 서버가 데이터를 다시 보고하기 시작한 경우, 규칙이 변경되거나 서버에 더 이상 적용되지 않는 경우, 서버가 규칙 적용 대상에서 제외된 경우, 서버를 더 이상 관리하지 않는 경우가 이에 해당합니다.
웹훅이나 다른 알림 채널은 이메일이나 Slack 메시지를 거치지 않고 규칙의 임계값 초과 및 해소 이벤트를 직접 구독할 수 있으며, 약 2분의 대기 시간도 없습니다. 두 이벤트 유형과 전달 데이터는 메트릭 임계값 이벤트를 참고하세요.
알림 이력
Metrics 앱의 알림 이력에는 이미 해제된 메트릭 알림이 표시됩니다. 발생한 알림, 적용된 규칙,
서버, 심각도, 장치, 발생 시각과 해제 시각, 지속 시간, 해제 이유인 원인을 확인할 수 있습니다. 규칙
열의 링크를 누르면 해당 규칙 페이지로 이동하며, 자세한 내용은 규칙 수정을 참고하세요.
규칙 이름 아래에는 알림 조건인 임계값 또는 메트릭 보고 중단이 표시됩니다. 규칙이
삭제되었거나 기록된 규칙이 없으면 링크 대신 규칙 없음이 표시됩니다. 원인에는
해제된 이벤트의 cause 필드와 같은 값이
사용됩니다. 메트릭이 정상으로 돌아왔거나, 서버가 보고를 재개했거나, 규칙이 삭제되었거나 서버가
규칙에서 분리되었거나, 규칙이 변경되어 이 서버나 장치에 더 이상 적용되지 않거나, 서버별 예외
설정으로 서버가 제외되었거나, 서버가 더 이상 관리되지 않거나, 적용되는 규칙이 더 이상 없거나, 장치별
알림이 이 알림을 대체했거나, 서버가 장치를 더 이상 보고하지 않거나, 구체적인 원인을 확인할 수 없지만
조건이 더 이상 적용되지 않는 경우입니다. 이 열이 생기기 전에 해제된 알림에는 원인이 표시되지
않습니다. 아직 해제되지 않은 알림은 이 페이지가 아닌 대시보드에 표시됩니다. 규칙 페이지에도 해당
규칙의 알림만 보이도록 이 목록을 필터링하는 알림 이력 링크가 있습니다.
전달 내역 열에는 알림이 발생했을 때 실제로 전송된 내용이 표시됩니다. 전달에 성공한 채널마다 칩이 하나씩 표시됩니다. 예를 들어 Email · 3처럼 수신자 수가 표시될 수 있지만, Slack은 사람 목록이 아닌 채널에 게시하므로 숫자가 표시되지 않습니다. 전송에 실패한 채널에는 Email · 전송 실패 또는 Slack · 전송 실패가 표시되며, 툴팁에는 전송을 시도했지만 실패했다고 나옵니다. 아무것도 전송하지 않은 알림에는 흐리게 표시된 칩 하나가 나타나고, 툴팁에는 이유가 나옵니다. 대기 시간이 아직 끝나지 않았거나, 대기 시간이 끝나기 전에 조건이 해제되었거나, 규칙에 설정된 전송 대상 때문에 어떤 채널에도 전송되지 않았거나, 전송 요청은 처리되었지만 전달 기록이 없는 경우입니다. 즉시 알림을 전송하지 않는 유형에는 기록되지 않음이 표시됩니다.
이력은 알림이 해제된 뒤 30일 동안 보관합니다. 해제되지 않은 알림은 지속 시간과 관계없이 삭제하지 않습니다. Metrics 확장 기능이 꺼져 있으면 기본으로 제공되는 핵심 디스크 사용량 규칙 외의 확장 규칙에서 발생한 메트릭 알림은 이 목록, 대시보드, 요약에 표시되지 않습니다. 핵심 디스크 사용량 규칙의 알림은 확장 기능 상태와 관계없이 표시됩니다.
필터를 클릭해 목록을 특정 규칙의 알림으로 좁히거나, 기간을 사용해 알림 발생 시점을 기준으로 오늘, 최근 7일, 최근 30일 또는 직접 지정한 기간의 알림만 표시하세요.
오프라인 알림
서버가 약 5분 동안 오프라인 상태이면 Alpacon이 오프라인 알림을 보냅니다. 서버가 다시 연결되면 알림은 자동으로 해제됩니다.
에이전트를 재시작하거나 업그레이드한 직후에는 예상된 중단으로 보고 알림을 보내지 않습니다. 하지만 아래 시간까지 서버가 다시 연결되지 않으면 알림이 발생합니다.
| 수행한 작업 | 알림 발생 기준 시간 |
|---|---|
| 에이전트 재시작 | 약 15분 |
| 에이전트 업그레이드 | 약 40분 |
작업 세션에서 직접 재부팅하거나 종료하거나 OS 패키지를 업그레이드할 때는 알림이 자동으로 억제되지 않습니다. 이런 작업을 계획한다면 먼저 서버 알림을 음소거하세요.
클라우드 제공업체에서 클라우드 인스턴스를 중지하거나 종료해도 알림이 발생하지 않습니다.
알림을 받는 방법
서버가 약 5분 동안 오프라인 상태이면 해당 서버의 알림을 볼 수 있는 워크스페이스 관리자, 서버가 속한 그룹의 구성원, 서버 소유자 모두에게 이메일이 발송됩니다. 워크스페이스에 Slack 채널이 연결되어 있으면 채널에도 메시지가 게시됩니다. 콘솔의 알림 목록에도 표시됩니다.
여러 서버가 동시에 오프라인 상태가 되면 서버마다 따로 알리지 않고, 모든 서버를 나열한 요약 이메일 한 통과 Slack 게시물 하나를 보냅니다.
서버가 다시 연결되면 같은 사람들에게 알림이 해제된 이유와 알림이 유지된 시간을 담은 후속 이메일을 보냅니다. 해제 이유는 에이전트가 다시 연결된 경우이거나 아래에 나온 다른 이유일 수 있습니다. Slack에 알림이 게시되었다면 같은 스레드에 알림 해제와 서버가 오프라인이었던 시간을 확인하는 답글이 달립니다. 답글에는 이유가 반복되지 않으므로 이메일을 확인하세요. 서버의 오프라인 알림을 끄거나, 서버를 비활성화하거나 워크스페이스에서 제거하거나, 클라우드 제공업체에 인스턴스가 중지된 것으로 표시되어 알림이 해제된 경우에는 후속 이메일에 그 이유가 명시됩니다.
서버가 한 시간 안에 세 번 이상 연결이 끊겼다가 다시 연결되면 Alpacon은 연결이 끊길 때마다 보내던
이메일과 Slack 게시물을 멈추고, 지난 한 시간 동안 연결이 끊긴 횟수를 알리는 공지 하나를 보냅니다.
이메일 제목은 web-01 has an unstable connection입니다. 알림 목록, 대시보드, 종 모양 알림에는
연결이 끊기고 다시 연결된 기록이 매번 남으며, 이메일과 Slack 메시지만 일시 중단됩니다. 서버가 30분
동안 연결을 유지하면 Resolved: web-01 has a stable connection again이라는 제목의 이메일을 한 통
보내고, 앞선 공지가 Slack에 게시되었다면 같은 스레드에 답글도 남깁니다. 이후 연결이 끊길 때마다
이메일을 다시 보냅니다. 서버가 다시 연결되지 않으면 연결이 끊긴 채 30분이 지난 뒤 지속 중인 장애를
일반 오프라인 알림 이메일로 알립니다. 서버의 오프라인 알림을 끄면 아래 설명과 같이 이 공지도 보내지
않습니다.
모든 알림 이메일 끝에는 이메일을 받은 이유가 표시됩니다. 워크스페이스 관리자이거나 서버가 속한 그룹의 구성원이거나 서버 소유자이기 때문이며, 그 뒤에 Preferences > Notifications 링크가 있습니다. 이 알림에도 본인의 알림 설정이 적용됩니다. 이메일을 음소거해도 채널의 Slack 게시물은 그대로 유지됩니다.
서버별 오프라인 알림 끄기
전원이 간헐적으로 켜지는 호스트나 작업을 마치면 스스로 종료되는 호스트처럼, 원래 오프라인 상태가 될 수 있는 서버는 오프라인 알림을 끄세요.
서버 편집 화면에서 이 서버가 오프라인 상태가 되면 알림을 끄세요. 그 서버에 이미 열린 알림이 있다면 설정을 끄는 즉시 닫히지는 않습니다. 약 5분 안에 다음 확인이 이루어지면 알림이 닫히고, 후속 이메일에 그 이유가 안내됩니다.
API로도 설정할 수 있습니다.
curl -X PATCH "https://your-workspace.ap1.alpacon.io/api/servers/servers/{server_id}/" \
-H "Authorization: token=\"alpat-xxxxxxxxxxxxxxxxxx\"" \
-H "Content-Type: application/json" \
-d '{"offline_alert_enabled": false}'
필드 정보는 Servers API를 참고하세요.
알림 일시 중지
디스크 교체처럼 서버에 영향이 생길 것을 미리 아는 작업 중에는 알림을 잠시 중지하세요. 해당 서버 때문에 호출 알림이 반복되지 않습니다.
서버 알림 일시 중지
서버 상세 페이지에서 알림 일시 중지를 열거나, 서버 목록에서 서버를 하나 이상 선택한 뒤 일괄 작업에서 알림 일시 중지를 선택하세요. 기간은 1시간, 4시간, 또는 지금부터 최대 7일 이내의 지정한 시각까지 중에서 고를 수 있습니다. 사유도 최대 255자까지 입력할 수 있습니다.
서버 알림을 일시 중지하면 서버 목록, 서버 카드, 상세 페이지 등 서버가 표시되는 모든 곳에 종료 시각을 알려 주는 배지가 나타납니다. 예를 들어 18:00까지 일시 중지라고 표시됩니다. 일시 중지가 끝나면 배지는 자동으로 사라집니다.
서버 알림을 일찍 다시 받으려면 같은 메뉴를 열고 알림 일시 중지 해제를 선택하세요.
서버 알림 일시 중지 중
알림은 계속 정상적으로 생성되어 알림 종 아이콘과 알림 목록에 표시됩니다. 해결된 뒤에는 메트릭 알림은 알림 기록에, 오프라인 알림은 해당 서버의 오프라인 알림 기록에 남습니다. 하지만 일시 중지가 끝날 때까지 이메일, Slack 메시지, 푸시 알림, 웹훅은 전송되지 않습니다. 메트릭 임계값 알림과 매시간 발송되는 열린 알림 요약을 포함해 해당 서버의 모든 알림에 적용됩니다. 알림 기록의 전송 상태 열에는 이렇게 보류된 메트릭 알림이 일시 중지로 보류됨으로 표시됩니다.
일시 중지가 끝나면
일시 중지가 끝났을 때 알림 조건이 여전히 지속 중이면 보류했던 알림이 전송됩니다. 서버 알림을 일시 중지한 사이 조건이 해소됐다면 그 알림은 전송되지 않습니다. 일시 중지 전에 이미 전송된 알림의 해결 통지는 일시 중지 중에도 보류되지 않고 평소처럼 전송됩니다.
서버 알림을 음소거할 수 있는 권한
서버 알림을 음소거하거나 해제하려면 다른 서버 정보 수정과 같은 권한이 필요합니다. 서버 소유자,
서버가 속한 그룹의 소유자나 관리자, 또는 Staff/Superuser가 할 수 있습니다. 서비스 토큰에는
server:mute 범위도 필요합니다. Alpamon 에이전트는 서버 알림을
음소거하거나 해제할 수 없습니다.
서버 알림을 음소거하거나 해제한 내역은 모두 활동 로그에 기록됩니다. 수행자, 음소거 종료 시각, 입력한 경우 그 이유도 기록됩니다.
유지보수 시간과의 차이
유지보수 시간과 음소거는 모두 일정 시간 서버 알림을 잠잠하게 하지만 처리 방식은 다릅니다.
- 유지보수 시간에는 알림 자체가 억제되어 알림이 발생하지 않고 목록에도 기록되지 않음. 음소거 중에는 알림이 발생해 목록에 표시되지만 알림 통지만 보류됨
- 유지보수 시간에는 오프라인 알림과 메트릭 수집 중단 알림만 억제되고 메트릭 임계값 알림은 영향받지 않음. 음소거 중에는 메트릭 임계값 알림도 보류됨
- 유지보수 시간에는 오프라인 알림의 해소 통지가 유지보수 시간이 끝날 때까지 미뤄짐. 음소거가 시작되기 전에 이미 통지된 알림의 해소 통지는 보류되지 않고 즉시 발송됨
구독한 웹훅은 오프라인 알림과 메트릭 수집 중단 알림에 대해 두 경우 모두 같은 방식으로 동작합니다. 유지보수 시간이나 음소거 중에는 이벤트가 없고, 끝나면 이벤트가 한 번 발생합니다. 메트릭 임계값 알림의 웹훅은 유지보수 시간의 영향을 받지 않으며 음소거 중에만 보류됩니다.
로그 보기
에이전트 로그
- 서버 상세 > 로그 탭
- 최근 로그에서 Alpamon 에이전트 로그 확인
로그 내용:
- 에이전트 시작 및 중지
- 연결 상태 변경
- 오류 및 경고 메시지
백홀 기록
최근 백홀에서 데이터 전송 기록을 확인하세요.
- 전송 시각
- 전송 상태
- 데이터 크기
서버 개요
개요 탭에서 서버 정보를 종합적으로 확인하세요.
시스템 정보:
- 에이전트: Alpamon 버전 및 상태
- OS: 운영체제 및 배포판
- 하드웨어: CPU, 메모리, 디스크 사양
- 운영: 가동 시간 및 부팅 시각
추가 정보:
- 시스템 패키지: 설치된 패키지 목록
- 네트워크 인터페이스: 활성 네트워크 인터페이스
활동 기록
활동 탭에서 명령 실행 기록을 확인하세요.
명령 기록:
- 실행 시각
- 실행한 사용자
- 실행한 명령
- 실행 결과
문제 해결
메트릭이 표시되지 않는 경우:
- Metrics 확장 기능이 활성화되어 있는지 확인(워크스페이스 설정 > 통합 > 확장 기능)
- 서버가 Connected 상태인지 확인
- 에이전트가 정상적으로 실행 중인지 확인
- 로그 탭에서 오류 메시지 확인
- 서버가 수집하는 항목과 메트릭이 누락된 이유를 정확히 알려면 수집 프로필 확인
알림이 발송되지 않는 경우:
- 서버 알림이 음소거 상태인지 확인
- 메트릭 알림이 올바르게 설정되었는지 확인
- 서버를 볼 수 있는 권한이 있는지 확인(워크스페이스 관리자, 서버가 속한 그룹의 구성원 또는 서버 소유자)
- 메트릭 알림은 규칙의 심각도 확인. 심각도가 critical인 규칙만 개별 이메일을 발송함. warning인 규칙은 Slack 알림이 켜져 있으면 Slack에 게시되고 시간별 요약에 포함되며, info인 규칙은 어느 쪽도 발송하지 않음
- 심각도가 critical인 규칙은 이메일 수신 대상 및 Slack 채널 게시 설정 확인. 서버를 볼 수 있는 모든 사람보다 수신 대상이 좁게 지정되거나 발송이 꺼져 있을 수 있음
- 스팸 폴더 확인