|
[연구활동] [이슈리포트] AI 자율 보안 에이전트, 어디까지 왔나
관리자 │ 2026-10-05 HIT 31 |
||||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
AI 자율 보안 에이전트, 어디까지 왔나국내외 자율 침투·취약점 분석 에이전트 지형과 실제 능력 1. 지금 무엇이 문제인가최근 국내 금융권 연쇄 침해사고에서 공격 서버에 중국어권 오픈소스 AI 자율 침투 도구 ‘ARTEX’의 흔적이 확인됐다는 보도가 나왔다. “AI가 해킹을 한다”는 우려가 커지면서, 그 능력이 실제로 어느 정도이고 어떤 도구들이 있는지에 대한 관심이 높다. 이 글은 국내외 자율 보안 에이전트의 현황과 수준을 정리한 것이다. 먼저 짚을 것: 이번 사고는 ‘AI가 혼자 공격한 것’이 아니라 ‘공격자가 자율 에이전트를 도구로 쓴 것’이다. 금융보안원도 같은 취지로 설명했다. 새로운 것은 공격 수법이 아니라 공격의 문턱이다 — 전문 인력 없이, 공개 도구와 공개 모델만으로 여러 표적을 동시에 칠 수 있게 됐다. 2. 자율 보안 에이전트란기존 취약점 스캐너는 정해진 규칙을 순차 실행한다. 자율 에이전트는 다르다. LLM이 스스로 목표를 쪼개고(계획), 실제 도구를 실행하고(행동), 발견한 자산·취약점을 쌓아가며(기억), 결과를 보고 다음 수를 바꾼다(피드백). 정찰 → 취약점 탐색 → 침투 경로 설계 → 도구 실행 → 검증의 전 과정을 사람 개입 없이 끌고 갈 수 있다. 핵심은 능력이 모델이 아니라 ‘구성’에서 나온다는 점이다. 같은 모델도 어떤 에이전트 구조(다중 에이전트·도구·메모리)에 얹느냐에 따라 사이버보안 평가 점수가 크게 달라진다. 그래서 특정 모델을 막거나 개발 속도를 늦추는 것으로는 이 위험을 다루기 어렵다. 3. 이번 사건의 ARTEX, 무엇인가ARTEX(아르텍스)는 중국어권 개발자가 깃허브에 오픈소스로 공개한 LLM 기반 자율 침투 테스트 시스템이다. 2026년 7월 말 공개돼, 한 달 뒤인 9월 3일 중국 바이두 보안대응센터(BSRC)가 연 ‘Agent+ 공격·방어 능력 챌린지’(150여 팀 참가, 8팀 결선)에서 종합 우승했다.
이번 사건과의 관계: 금융보안원이 신한은행 로그와 공격 IP를 역추적한 결과 ARTEX 관련 흔적이 확인됐다고 밝혔다. 다만 “AI가 사람 없이 독자적으로 공격한 것이 아니라 공격자가 ARTEX라는 AI 도구를 이용한 것”이라는 설명이다. 오픈소스 도구인 만큼 특정 국가·세력의 전용 도구로 단정할 수 없고, 공격자 신원도 미확정이다(2026.10 기준). 4. 왜 중요한가 — 모델이 아니라 ‘모델+에이전트’같은 모델이라도 에이전트를 붙이면 능력이 크게 뛴다. 이것이 이번 사안의 핵심이다. 아래는 같은 모델(Claude Opus 4.6)에 에이전트 구성을 얹었을 때의 변화다. 같은 모델, 구성만 바꿨을 때 — 사이버짐 성공률 숭실대 AI안전성연구센터 mneme — 다중 에이전트·분석 도구·구조화 메모리를 얹어 +24.4%p. 90% 이상 선도 그룹(국내 연구팀 최초·유일 등재). 모델은 그대로, 구성만 바꿨다.
함의: 에이전트는 오픈소스이고, 모델은 공개 가중치이거나 API로 누구나 쓸 수 있다. 그 조합이 승인 기관에만 제공되는 보안특화 폐쇄 모델과 대등하거나 앞선다(사이버짐 공식 보드 상위권에 공개 모델이 섞여 있고, 에이전트 구성이 그 위에 있다). 즉 모델을 통제해서 능력 확산을 막는다는 전제는 이미 무너졌다. 전문 인력도 고가 장비도 필요 없으니, 이런 공격은 앞으로 흔해진다. 평가와 통제의 단위를 ‘모델’이 아니라 ‘모델+구성(에이전트)’으로, 그리고 운영 단계로 옮겨야 하는 이유다. 5. 국내외 자율 보안 에이전트
※ 공격형·방어형을 함께 실었다. 같은 기술이 공격과 방어 양쪽에 쓰인다. 국내 동향 — 과기정통부는 사이버보안 특화 파운데이션 모델을 개발 중이다(네이버클라우드 컨소시엄, 41개 기관). 이는 에이전트가 아니라 ‘모델’로, 700B MoE 2개를 병렬 개발한다 — 방어(하이퍼클로바X 기반)·공격(엑사원 기반). 공격 모델 목표는 사이버짐에서 GLM-5.3 대비 1단계 80%(2027.2)·최종 100%(2027.7)이며 2027 하반기부터 4대 기반시설에 적용될 예정이다. 다만 이 모델도 결국 에이전트에 얹혀 쓰이므로, 능력은 공개 시점의 모델 점수가 아니라 구성까지 포함해 보아야 한다. 6. 실제 능력은 어느 정도인가 — 점수로 보기취약점 발굴 벤치마크 ‘사이버짐(CyberGym)’ 공식 리더보드 성공률(%)이다(2026.10 기준). 위 두 개는 에이전트 구성(Agent-focused), 아래 다섯은 모델 단독(Model-focused) 상위 5개다. 모델 단독 최고(88.9)보다 에이전트 구성(91.0)이 위에 있다. 에이전트 구성 공개 가중치 모델 폐쇄 모델(보안 특화) 사이버짐 공식 리더보드 — Agent-focused, 90% 이상 선도 그룹 17개 (2026.10 캡처, 무작위 순서) 선도 그룹 17개: mneme(숭실대)·MDASH(Microsoft)·Wiz Atlas 외에 NSFOCUS·天工·Alibaba Spur·Fangcun·DARKNAVY·Alipay·Sangfor·Huawei 磐石·Fudan 白泽 등. 카드에 표시된 모델이 대부분 DeepSeek-V4·GLM-5.3이다. 마우스를 올리면 점수가 보이며 mneme과 MDASH는 공히 91.0%. 사이버짐 공식 리더보드 — Model-focused 상위 5 (2026.10 캡처) 모델 단독 1위는 알리바바 시큐리티의 27B 모델(88.9). 공개 모델과 보안특화 폐쇄 모델이 5점 안에 섞여 있다. 읽는 법: ① 모델 단독으로는 공개 모델(알리바바 27B·GLM·DeepSeek)과 폐쇄 보안특화 모델(Gemini Cyber·GPT Cyber)이 5점 안에 섞여 있다 — 공개 모델이 통제 모델과 대등하다. ② 에이전트를 얹으면 그 위로 올라간다 — 센터 mneme은 같은 Opus 4.6을 단독 66.6에서 91.0으로 끌어올렸고, Microsoft의 MDASH(상용 모델 GPT-5.4·Claude를 100여 개 전문 에이전트로 엮은 하네스)도 91.0으로 동률이다.
침투 에이전트의 점수는? — 공개 리더보드가 없다사이버짐은 코드 취약점 발굴 벤치마크다. ARTEX·XBOW 같은 침투 에이전트는 다른 과제라 사이버짐 점수가 없고, 침투 쪽에는 사이버짐 같은 공개 리더보드 자체가 없다. 벤치마크는 여럿이지만 논문마다 각자 재서 보고하는 구조라 한 보드에서 줄 세울 수 없다. 있는 근거는 성격이 다른 세 종류다.
함의: 코드에서 취약점을 찾는 능력은 90%대로 성숙했지만, 살아 있는 시스템을 뚫는 완전 자율 침투는 현실적 조건에서 아직 사람 보조가 필요하다. 이번 사건이 ‘AI 혼자’가 아니라 ‘사람이 ARTEX를 운용’한 것과 맞아떨어진다. 다만 그 ‘사람’이 더 이상 전문가일 필요가 없다는 것이 바뀐 점이다. 7. 정리 — 세 가지 사실
문의: 숭실대학교 AI안전성연구센터 |
| 이전글 | 최대선 숭실대 교수"제6회 개인정보 보호의 날 기념식" 홍조... |
|---|---|
| 다음글 | 다음글이 없습니다. |