grep

Engineering

수억 건의 보안 신호 속 진짜 위협 찾기 — AI로 보안 모니터링의 패러다임을 바꾸다

jerry.shim, jackson.c카카오

2026년 3월 16일

원문에서 보기 ↗

1부. 건초더미 속 바늘, 그리고 AI의 필요성

매일 수억 건의 보안 신호가 쏟아집니다. 그중 실제로 대응이 필요한 위협은 과연 몇 건일까요?

엔드포인트에서 발생하는 프로세스 실행, 네트워크 연결, 파일 변경, 권한 상승과 같은 행위는 모두 이벤트로 수집됩니다. 서비스가 확장될수록 이벤트의 총량은 기하급수적으로 증가합니다. 그러나 그 안에 포함된 실제 공격의 비율은 거의 변하지 않습니다. 건초더미는 계속 커지지만, 그 속의 바늘은 여전히 소수입니다.

자연스럽게 떠오르는 해법은 "사람을 더 투입하자"입니다. 하지만 이벤트 규모가 두 배로 늘 때마다 분석 인력도 두 배로 늘릴 수 있을까요? 서비스 확장과 함께 이벤트가 계속 성장하는 환경에서, 인력 투입은 구조적으로 지속 가능한 전략이 아니었습니다.

문제의 본질은 인간의 인지 한계를 초과하는 데이터 규모와 복잡성에 있습니다. 그래서 저희는 질문을 바꾸었습니다.

“더 많은 사람이 아니라, 더 많은 맥락을 이해할 수 있는 시스템은 불가능할까?”

대규모 로그를 통계적·행위 기반으로 해석하고, 서로 다른 이벤트 간의 관계를 학습하며, 정상과 비정상의 경계를 동적으로 조정할 수 있는 접근이 필요했습니다. 단순히 경보를 더 많이 발생시키는 것이 아니라, 실제로 대응 가치가 높은 신호를 선별하는 능력이 요구되었습니다. 이 지점에서 AI의 필요성이 극대화되었습니다.

이 글에서는 엔터프라이즈 보안 환경에서 왜 기존 방식만으로는 한계에 도달했는지, 그리고 AI를 활용하여 보안 모니터링의 구조를 어떻게 재설계했는지를 이야기해보고자 합니다.


2부. 우리가 마주한 현실 — 규칙의 한계

기존에 저희는 규칙 기반 탐지 시스템에 의존하고 있었습니다. “이 명령어가 실행되면 경고”, "이 경로에 파일이 생성되면 차단"과 같이 명확하고 빠르지만, 현실의 복잡함 앞에서는 한계가 분명했습니다.

첫 번째 한계는 높은 오탐율이었습니다. 개발자가 서버에 배포 스크립트를 실행하는 것과 공격자가 백도어를 설치하는 것은, 명령어 수준에서는 놀라울 만큼 유사합니다. 규칙은 "무엇이 실행되었는가"는 알지만, "왜, 누가, 어떤 맥락에서 실행했는가"는 알지 못했습니다. 결과적으로 정상적인 업무 활동이 대량으로 악성 경고에 포함되었고, 분석가들은 진짜 위협을 가려내기 위해 반복적인 수작업에 시달려야 했습니다.

두 번째는 분석 일관성의 문제였습니다. 같은 이벤트를 보더라도 분석가의 경험과 숙련도에 따라 판정이 달라졌습니다. 주간과 야간, 주중과 주말에 따라 분석 품질의 편차가 발생하는 것은 구조적인 문제였습니다.

세 번째는 맥락 조립의 복잡도였습니다. 하나의 이벤트가 실제 위협인지 판단하려면, 해당 호스트의 자산 정보, 네트워크 세션, 프로세스 실행 이력, 관련 로그를 여러 소스에서 모아 사건 단위로 연결해야 합니다. 이 과정만으로도 분석가의 시간과 인지 부하가 과도하게 소모되었습니다.

네 번째는 탐지 범주의 다양화였습니다. 통계 기반 이상 탐지, 행위 시퀀스 분석, 다중 소스 상관 분석, 희소 이벤트 식별 등 분석해야 할 신호의 유형이 계속 늘어났지만, 각각에 대해 규칙을 수작업으로 작성하고 유지하는 것은 현실적으로 불가능에 가까웠습니다.

다섯 번째는 비용 구조의 문제였습니다. 인력 중심 운영 모델에서는 이벤트가 증가하면 비용도 선형으로 증가합니다. 서비스가 성장할수록 보안 운영 비용이 함께 늘어나는 구조는 지속 가능하지 않았습니다.

기존에도 SIEM 환경에서는 서로 다른 보안 장비와 시스템 로그를 연관지어 분석하는 상관분석(Correlation) 기법이 존재했습니다. 복수의 이벤트 소스를 조합하고, 사전 정의된 시나리오에 매칭하여 위협을 탐지하는 방식으로, 단일 규칙보다 진화한 접근이었습니다.

그러나 저희가 실제 엔터프라이즈 환경에서 마주한 현실은 훨씬 복잡했습니다. 상관분석 규칙은 결국 "사전에 정의한 시나리오"에 한정되기 때문에, 알려지지 않은 공격 패턴이나 미세한 행위 변형에는 대응하기 어려웠습니다. 규칙 수가 늘어날수록 유지보수 비용도 기하급수적으로 증가했고, 이벤트 규모가 수억 건을 넘어서면서 규칙 매칭 자체의 성능 한계도 드러났습니다.

결국 기존 방식은 이벤트를 연결하는 데에는 성공했지만, "왜 이 행위가 위협인가"를 맥락적으로 이해하는 데에는 구조적 한계가 있었습니다. 단순히 더 많은 규칙을 작성하는 것이 아니라, 행위의 흐름과 맥락 자체를 이해할 수 있는 새로운 분석 패러다임이 필요한 시점이었습니다.

2024년 이후 생성형 AI 기술이 급격히 발전하면서, 이러한 한계를 보완하고 행위 맥락을 이해하려는 시도가 본격화되기 시작했습니다.


3부. 설계 철학 — 깔때기, 교차 검증, 그리고 자가 학습

저희는 처음부터 모든 이벤트를 AI에 넣는 것이 아니라, AI가 분석할 가치가 있는 이벤트만 골라내는 구조를 설계하는 것에서 출발했습니다.

다단계 깔때기 구조

매일 수억 건의 이벤트가 유입되지만, 실제로 정밀 분석이 필요한 것은 극소수입니다. 저희는 대량의 이벤트를 단계적으로 필터링하여, 최종적으로 AI 분석 엔진에 도달하는 이벤트를 극한까지 정제하는 깔때기 구조를 설계했습니다.

첫 번째 레이어에서는 규칙 기반 필터가 명백한 노이즈를 제거합니다. 두 번째 레이어에서는 반복적인 정상 패턴을 자동으로 학습하여 예외 처리합니다. 이 두 단계를 거친 후에야 세 번째 레이어인 AI 분석 엔진이 정밀 분석을 수행합니다. 대부분의 노이즈가 사전에 걸러지기 때문에, AI는 정말 판단이 필요한 이벤트에만 집중할 수 있습니다.

멀티 모델 교차 검증

단일 AI 모델에 의존하지 않는 것은 저희 설계의 핵심 원칙입니다. 서로 다른 추론 특성을 가진 여러 모델이 동일한 이벤트를 독립적으로 분석하고, 그 결과를 교차 대조합니다. 특정 모델이 가진 편향이나 취약 영역에서의 오탐과 누락을 상호 보완할 수 있고, 모델 간 판정이 불일치하는 경우에는 이를 "불확실성 신호"로 활용하여 분석가의 심층 검토를 유도합니다.

이 전략의 핵심은 정확도만이 아닙니다. 특정 모델의 장애, API 가용성 저하, 또는 업데이트에 따른 품질 변동이 발생하더라도 다른 모델로 즉시 전환하여 분석을 중단 없이 지속할 수 있는 운영 신뢰성과 복원력이 진짜 목표입니다.

하이브리드 접근

AI가 만능은 아닙니다. 저희는 규칙 기반 탐지의 정밀함과 AI 기반 분석의 유연함을 결합하는 하이브리드 철학을 채택했습니다. 명확한 패턴은 규칙이 빠르게 처리하고, 맥락 판단이 필요한 복합 상황은 AI가 담당합니다.

확장 가능한 프레임워크

새로운 유형의 위협이 등장하거나, 분석해야 할 신호의 범주가 추가되더라도 동일한 분석 프레임워크로 수용할 수 있는 구조를 지향했습니다. 특정 시나리오에 국한된 시스템이 아니라, 다양한 탐지 범주를 하나의 파이프라인에서 처리할 수 있는 범용성을 설계 초기부터 고려했습니다.

자가 학습 루프

마지막으로, 이 시스템은 운영할수록 스스로 정확해지는 구조를 갖추고 있습니다. AI의 분석 결과가 검증을 거쳐 자동으로 탐지 정책에 반영되고, 이렇게 갱신된 정책이 다시 이벤트 필터링에 적용되는 피드백 루프를 설계했습니다. 시간이 지날수록 정상 패턴의 학습이 축적되어, 오탐은 줄고 분석 정밀도는 높아집니다.

물론 이 모든 설계에는 트레이드오프가 존재합니다. 사전 필터링을 강화하면 비용과 정밀도가 개선되지만, 필터 단계에서 실제 위협을 놓칠 가능성도 있습니다. 멀티 모델 교차 검증은 신뢰성을 높이지만 비용이 증가합니다. 저희는 이러한 비용, 속도, 정확도의 삼각 트레이드오프를 끊임없이 조율하며 균형점을 찾아가고 있습니다.

[도식 A] 추상화된 다단계 파이프라인 개념도 — 대량의 이벤트가 단계적 필터를 거쳐 정제되고, AI 분석 엔진이 정밀 분석을 수행하는 깔때기 구조. 분석가의 피드백은 다시 자동 예외 처리에 반영된다.


4부. 기술적 도전과 해결 — 시행착오의 기록

설계 철학을 현실로 옮기는 과정은 순탄하지 않았습니다. AI에게 "우리 환경을 아는 분석가"가 되도록 가르치고, 그 판단을 신뢰할 수 있도록 만들기까지 수많은 시행착오를 거쳤습니다.

도전 1. AI에게 맥락을 가르치다

처음 시도: 범용 LLM에 보안 이벤트를 그대로 전달하고 분석을 요청했습니다.

문제 발견: 범용 모델은 저희의 내부 환경을 전혀 알지 못했습니다. 어떤 서버가 어떤 서비스를 운영하는지, 어떤 계정이 자동화 작업에 사용되는지, 어떤 네트워크 통신이 정상적인 업무 흐름인지 — 이 맥락 없이는 정상적인 배포 활동도 의심스러운 침투 시도로 판정해버렸습니다.

개선: 저희는 AI에게 "분석에 필요한 내부 맥락"을 사전에 주입하는 컨텍스트 설계 방식을 도입했습니다. 분석 대상 호스트의 역할, 관련 서비스 정보, 해당 환경에서의 정상 행위 패턴 등을 구조화하여 AI가 "우리 환경을 이해하는 전문 분석가"처럼 동작하도록 만들었습니다. 단순히 데이터를 넘기는 것이 아니라, AI가 올바른 판단을 내리기 위한 배경 지식을 설계하는 것이 핵심이었습니다.

도전 2. 정상과 공격의 경계

처음 시도: 개별 명령어나 프로세스 실행을 하나씩 분석하는 방식으로 접근했습니다.

문제 발견 : 개발자의 배포 작업과 공격자의 침투 시퀀스는 개별 명령어 수준에서 거의 동일합니다. curl로 파일을 다운로드하고, chmod로 권한을 변경하고, 스크립트를 실행하는 — 이 행위 자체만 보면 정상인지 악성인지 구분할 수 없었습니다.

개선 : 개별 이벤트가 아니라, 호스트 단위의 전체 행위 흐름을 하나의 분석 단위로 재구성하는 방식으로 전환했습니다. 프로세스 실행 이력, 네트워크 세션, 파일 변경 등을 시간 순서로 연결하면, 동일한 명령어라도 "언제, 어떤 순서로, 어떤 맥락에서 실행되었는가"에 따라 전혀 다른 의미를 갖게 됩니다. AI는 이 흐름 전체를 읽고, 정상적인 업무 패턴과 공격 시퀀스의 미묘한 차이를 식별하도록 학습되었습니다.

도전 3. 데이터를 AI의 언어로 번역하다

처음 시도: 원본 이벤트 데이터를 가공 없이 AI에 전달했습니다.

문제 발견: 두 가지 문제가 동시에 발생했습니다. 첫째, 원본 데이터에는 분석과 무관한 정보가 대량으로 포함되어 있어 토큰을 낭비하고 분석 정확도를 떨어뜨렸습니다. 둘째, 탐지 유형마다 AI가 주목해야 할 신호가 달랐습니다. 통계 기반 이상 탐지에 필요한 데이터와 행위 시퀀스 분석에 필요한 데이터는 본질적으로 다릅니다. 하나의 고정 포맷으로는 모든 분석 관점을 만족시킬 수 없었습니다.

개선 : 표준화된 이벤트 스키마를 설계하여 원본 데이터를 AI가 효율적으로 처리할 수 있는 형태로 정제하고, 분석 관점에 맞춘 동적 피처 구성 방식을 도입했습니다. 탐지 유형별로 AI에 전달할 핵심 특징을 동적으로 선별하고 재구성함으로써, 토큰 효율과 분석 정확도를 동시에 개선할 수 있었습니다.

도전 4. 스스로 학습하는 탐지 정책

처음 시도: AI 분석 결과를 바탕으로 수동으로 탐지 정책을 갱신했습니다.

[참고] 탐지 정책(Detection Policy): 여러 탐지 조건과 대응 액션을 묶어 하나의 탐지 시나리오를 구성하는 정책 단위를 말합니다. 단일 규칙(Rule)이 아니라, 복수의 조건과 액션을 포함하는 상위 개념입니다.

문제 발견: AI가 "이 패턴은 정상"이라고 판정한 결과가 축적되어도, 이를 탐지 정책에 반영하려면 분석가가 직접 검토하고 수작업으로 정책을 추가해야 했습니다. AI가 학습한 지식이 시스템에 자동으로 환류되지 않는 단절이 있었습니다.

개선: AI의 판정 결과가 검증을 거쳐 자동으로 탐지 정책에 반영되는 피드백 루프를 구축했습니다. 저희는 이 시스템을 WALT(Whitelist-Assisted Learning and Tuning)라고 부릅니다. AI가 반복적으로 정상이라 판정한 패턴은 자동으로 예외 정책으로 등록되고, 이 정책은 다음번 동일 패턴의 이벤트가 발생했을 때 AI 분석 전에 필터링합니다. 현재 수천 건의 탐지 정책이 이 방식으로 자동 생성되어 운영 중이며, 운영 시간이 길어질수록 시스템의 정밀도가 자동으로 향상되고 있습니다.

[도식 B] 자가 학습 피드백 루프 개념도 — AI의 분석 결과가 검증을 거쳐 탐지 정책에 자동 반영되고, 갱신된 정책이 다시 이벤트 필터링에 적용되는 순환 구조. 루프가 반복될수록 시스템의 분석 정밀도가 향상된다.

도전 5. 비용, 속도, 신뢰성의 양립

처음 시도: 모든 이벤트를 AI에 투입하여 분석했습니다.

문제 발견: 비용이 폭증했습니다. 수억 건의 이벤트를 모두 AI로 분석하는 것은 경제적으로 지속 가능하지 않았고, 처리 속도도 실시간 대응에 턱없이 부족했습니다.

개선 : 다계층 엔드투엔드 최적화를 통해 비용, 속도, 신뢰성을 동시에 개선했습니다. 대량 이벤트에서 분석 대상을 실시간으로 선별하는 전처리 계층 , 분석 유형과 긴급도에 따라 모델 호출 우선순위를 동적으로 조정하는 스케줄링 계층 , 유사 이벤트의 분석 결과를 재활용하여 중복 호출을 제거하는 캐싱 계층 , 그리고 멀티 모델 간 판정 결과를 통합하는 후처리 계층이 유기적으로 결합되었습니다. 저희는 이 시스템을 MRS(Multi-layer Routing System)라고 부릅니다.

특히 멀티 모델 구조는 성능만이 아니라 운영 안정성의 핵심입니다. 특정 모델의 장애나 품질 변동이 발생해도 다른 모델로 즉시 전환하여 분석 파이프라인이 중단되지 않는 무중단 처리 체계를 확보했습니다. 결과적으로 분석 응답 시간을 수십 배 단축하면서도, 분석 품질과 맥락 보존을 희생하지 않는 균형을 달성했습니다.


이 다섯 가지 도전은, 각 도전의 해결이 다음 도전의 토대가 되는 연쇄적인 진화의 과정이기도 했습니다. 도전 1에서 맥락을 가르친 AI가 도전 2의 행위 흐름을 분석할 수 있게 되었고, 도전 3의 데이터 정제가 도전 5의 비용 최적화를 가능하게 했으며, 도전 4의 자가 학습 루프가 전체 시스템의 정밀도를 지속적으로 끌어올릴 수 있었습니다.


5부. 실전 적용 — 위협 대응 리드타임을 90% 줄이다

설계가 실전에서 동작한다는 것을 보여드리겠습니다.

가상 시나리오: 의심스러운 행위 탐지

어느 날, 한 엔드포인트에서 비정상적인 행위 시퀀스가 감지됩니다. 외부에서 파일이 다운로드되고, 시스템 설정이 변경되며, 이전에 관찰되지 않았던 네트워크 연결이 시도됩니다.

기존 방식에서는 탐지 자체는 SIEM 및 상관분석 체계를 통해 비교적 신속하게 이루어졌습니다. 그러나 탐지 이후 단계에서 분석가가 여러 로그 소스를 교차 조회하고, 시간축 기준으로 행위를 재구성하며, 자산 정보 및 과거 이력과 대조해 공격 여부를 판단하고, 그 결과를 보고서 형태로 정리해야 했습니다. 즉, 탐지 이후의 심층 분석과 맥락 재구성, 리포팅 과정이 상당한 운영 시간을 요구했고, 이 구간이 전체 대응 리드타임의 대부분을 차지했습니다.

AI 기반 시스템에서는 이 흐름이 구조적으로 달라집니다. 이벤트가 발생하면 관련 로그와 자산 정보가 자동으로 연계되어 행위 맥락이 재구성되고, AI가 전체 시퀀스를 분석해 위험도를 산출합니다. 분석 결과는 구조화된 리포트 형태로 제공되며, 분석가는 이를 검증하고 최종 대응 여부를 결정합니다. 기존에 분석가가 수행하던 교차 조회, 시계열 재구성, 맥락 해석, 보고서 정리 과정이 자동화됨으로써 전체 리드타임이 크게 단축되었습니다.

[도식 C] Before/After 대응 리드타임 비교 — 기존에도 조치는 신속했으나, 분석/문서화/정리 등 수작업이 전체 리드타임을 늘렸다. AI 자동화를 통해 이 전체 과정이 압축되었다.

핵심 성과

지표성과
위협 대응 리드타임분석/문서화/정리를 포함한 전체 리드타임 90% 이상 단축
오탐률피드백 루프, 교차 검증, 지속적 정책 고도화를 통해 오탐률 1% 미만 달성
운영 효율반복 분석 공정 자동화를 통해, 동일 인력 규모로 분석 커버리지를 수십 배 확장 — 분석가는 정책 고도화·위협 헌팅 등 고부가가치 업무에 집중
운영 비용 (TCO)자동화·표준화·멀티 모델 운영 효율화를 통해 건당 분석 비용을 기존 대비 1/100 수준으로 개선 — 이벤트 증가에도 추가 증원 없이 대응 가능한 구조
탐지 정책수천 건의 탐지 정책이 자동 생성되어 운영 중

저희는 이번 성과를 "현재 시점의 스냅샷"이라고 봅니다. 시스템을 지속적으로 개선 중이며, 새로운 유형의 위협이 등장할 때마다 새로운 도전이 시작된다고 생각합니다.

반복적인 이벤트 재구성과 1차 분류 업무를 자동화함으로써, 기존 분석 인력이 탐지 정책 고도화, 위협 헌팅, 탐지 전략 설계 같은 고차원 업무로 전환할 수 있었고, 그 결과 동일한 조직 규모에서 대응 범위와 속도가 함께 확장되었습니다.

특히 강조하고 싶은 정성적 변화도 있습니다. AI가 일관된 기준으로 1차 판정을 수행하면서, 분석 품질의 하한선이 가장 숙련된 분석가의 수준에 맞춰 상향 평준화되었다는 점입니다. 이는 “평균”을 올린 것이 아니라, 최소 품질 기준(quality floor)을 보장하는 구조적인 변화입니다. 시간대나 분석가 개인에 따른 판정 편차가 해소되고, 보안 조직 전체의 판정 기준이 표준화되었습니다.


6부. AI는 대체자가 아니라 조력자다

이 프로젝트를 통해 저희가 배운 것은 기술만이 아닙니다.

기술적으로 가장 큰 교훈은, 멀티 모델 전략이 단순히 정확도를 높이는 수단이 아니라 신뢰성과 연속성의 문제였다는 것입니다. AI 모델의 성능은 빠르게 변화하고 있고, 어떤 시점에 "최고"인 모델도 다음 달에는 달라질 수 있습니다. 중요한 것은 특정 모델에 의존하는 것이 아니라, 어떤 상황에서도 분석이 중단되지 않고 일관된 품질을 유지하는 구조를 만드는 것이었습니다. 또한 탐지 정책의 자가 학습은 운영 비용을 줄이는 것을 넘어, 시스템이 스스로 성장하는 구조를 만들었습니다.

조직적으로 가장 큰 변화는, AI 도입이 "일하는 방식의 전환"이었다는 점입니다. 반복적인 분류와 문서화에 쓰이던 역량이, 탐지 전략 설계와 고차원 위협 헌팅으로 재배치되었습니다. 조직의 규모가 아니라 업무의 구조가 바뀐 것 입니다. AI는 보안 전문가를 대체하는 것이 아니라, 전문가가 정말 중요한 일에 집중하도록 돕는 조력자입니다.

저희의 여정은 여기서 끝이 아닙니다. 추가 탐지 범주의 확장, 멀티모달 분석, 자동 대응 고도화와 함께, Agentic AI 기반의 자율 보안 운영 체계로의 전환이라는 과제도 남아 있습니다. 특히 Agentic AI는 단순히 이벤트를 분석하고 분류하는 수준을 넘어, 위협 가설을 스스로 수립하고 필요한 데이터를 능동적으로 수집·검증하며, 사전 정의된 가드레일 내에서 대응 조치를 실행하는 단계까지 확장하는 것을 목표로 합니다. 이는 분석 보조 도구를 넘어, 제한된 범위 내에서 자율적으로 사고하고 행동하는 보안 운영 에이전트로의 진화를 의미합니다.

궁극적으로 저희가 지향하는 모습은 "운영할수록 스스로 정확해질 뿐 아니라, 스스로 탐색하고 판단하며 대응까지 수행하는 시스템"입니다. 그 방향성에 대한 확신은 더욱 강해지고 있습니다.

이 프로젝트는 혼자 만든 것이 아닙니다. 끊임없이 피드백을 주고 시스템을 함께 다듬어온 보안 분석팀, 안정적인 인프라를 지탱해준 엔지니어링팀, 그리고 "더 나은 방법이 있을 것"이라는 믿음을 공유한 모든 동료에게 감사드립니다.


이 글에서 다루는 시스템은 지속적으로 개선 중이며, 설명된 설계와 성과는 특정 시점의 상태를 반영합니다.