2026.10.05
[이슈리포트] AI 자율 보안 에이전트, 어디까지 왔나
AI 자율 보안 에이전트, 어디까지 왔나국내외 자율 침투·취약점 분석 에이전트 지형과 실제 능력숭실대학교 AI안전성연구센터 · 2026.101. 지금 무엇이 문제인가최근 국내 금융권 연쇄 침해사고에서 공격 서버에 중국어권 오픈소스 AI 자율 침투 도구 ‘ARTEX’의 흔적이 확인됐다는 보도가 나왔다. “AI가 해킹을 한다”는 우려가 커지면서, 그 능력이 실제로 어느 정도이고 어떤 도구들이 있는지에 대한 관심이 높다. 이 글은 국내외 자율 보안 에이전트의 현황과 수준을 정리한 것이다.먼저 짚을 것: 이번 사고는 ‘AI가 혼자 공격한 것’이 아니라 ‘공격자가 자율 에이전트를 도구로 쓴 것’이다. 금융보안원도 같은 취지로 설명했다. 새로운 것은 공격 수법이 아니라 공격의 문턱이다 — 전문 인력 없이, 공개 도구와 공개 모델만으로 여러 표적을 동시에 칠 수 있게 됐다.2. 자율 보안 에이전트란기존 취약점 스캐너는 정해진 규칙을 순차 실행한다. 자율 에이전트는 다르다. LLM이 스스로 목표를 쪼개고(계획), 실제 도구를 실행하고(행동), 발견한 자산·취약점을 쌓아가며(기억), 결과를 보고 다음 수를 바꾼다(피드백). 정찰 → 취약점 탐색 → 침투 경로 설계 → 도구 실행 → 검증의 전 과정을 사람 개입 없이 끌고 갈 수 있다.핵심은 능력이 모델이 아니라 ‘구성’에서 나온다는 점이다. 같은 모델도 어떤 에이전트 구조(다중 에이전트·도구·메모리)에 얹느냐에 따라 사이버보안 평가 점수가 크게 달라진다. 그래서 특정 모델을 막거나 개발 속도를 늦추는 것으로는 이 위험을 다루기 어렵다.3. 이번 사건의 ARTEX, 무엇인가ARTEX(아르텍스)는 중국어권 개발자가 깃허브에 오픈소스로 공개한 LLM 기반 자율 침투 테스트 시스템이다. 2026년 7월 말 공개돼, 한 달 뒤인 9월 3일 중국 바이두 보안대응센터(BSRC)가 연 ‘Agent+ 공격·방어 능력 챌린지’(150여 팀 참가, 8팀 결선)에서 종합 우승했다.구조 — 여러 에이전트가 스스로 목표를 쪼개고, 실제 보안 도구를 실행하며, 발견한 자산·취약점을 그래프로 쌓아간다. Go 단일 바이너리에 웹 UI가 내장돼 있고 데이터는 PostgreSQL에 저장된다.모델 교체형 — 특정 모델에 묶이지 않는다. Claude·GPT·DeepSeek 등 어떤 LLM이든 API나 OpenAI 호환 엔드포인트로 붙여 쓸 수 있다. 어떤 모델을 붙였는지는 사용자가 정한다.누구나 사용 — 오픈소스라 코드를 그대로 내려받을 수 있고, 이미 한국어판 포크가 깃허브에 여럿 올라와 있다.이번 사건과의 관계: 금융보안원이 신한은행 로그와 공격 IP를 역추적한 결과 ARTEX 관련 흔적이 확인됐다고 밝혔다. 다만 “AI가 사람 없이 독자적으로 공격한 것이 아니라 공격자가 ARTEX라는 AI 도구를 이용한 것”이라는 설명이다. 오픈소스 도구인 만큼 특정 국가·세력의 전용 도구로 단정할 수 없고, 공격자 신원도 미확정이다(2026.10 기준).4. 왜 중요한가 — 모델이 아니라 ‘모델+에이전트’같은 모델이라도 에이전트를 붙이면 능력이 크게 뛴다. 이것이 이번 사안의 핵심이다. 아래는 같은 모델(Claude Opus 4.6)에 에이전트 구성을 얹었을 때의 변화다.같은 모델, 구성만 바꿨을 때 — 사이버짐 성공률66.6Opus 4.6모델 단독→91.0+ 에이전트 구성(mneme)숭실대 AI안전성연구센터 mneme — 다중 에이전트·분석 도구·구조화 메모리를 얹어 +24.4%p. 90% 이상 선도 그룹(국내 연구팀 최초·유일 등재). 모델은 그대로, 구성만 바꿨다.ARTEX도 같다 — 개별 평가 점수는 중위권(바이두 챌린지 실전 7위)이었으나 종합 1위에 올랐다. 구성이 승부를 갈랐다.함의: 에이전트는 오픈소스이고, 모델은 공개 가중치이거나 API로 누구나 쓸 수 있다. 그 조합이 승인 기관에만 제공되는 보안특화 폐쇄 모델과 대등하거나 앞선다(사이버짐 공식 보드 상위권에 공개 모델이 섞여 있고, 에이전트 구성이 그 위에 있다). 즉 모델을 통제해서 능력 확산을 막는다는 전제는 이미 무너졌다. 전문 인력도 고가 장비도 필요 없으니, 이런 공격은 앞으로 흔해진다. 평가와 통제의 단위를 ‘모델’이 아니라 ‘모델+구성(에이전트)’으로, 그리고 운영 단계로 옮겨야 하는 이유다.5. 국내외 자율 보안 에이전트이름 (주체)공개하는 일 · 구조수준·근거ARTEX (중국/바이두)오픈소스멀티에이전트 자율 침투. 모델 교체 가능바이두 Agent+ 챌린지 종합 1위. 이번 금융권 사건 관련 도구. 한국어판 포크 다수MDASH (Microsoft)상용(프리뷰)상용 모델(GPT·Claude) + 100여 전문 에이전트 하네스. 코드 취약점 발견·검증·익스플로잇 증명사이버짐 91.0, 선도 그룹(2026.5 발표 당시 88.45로 1위). Windows 커널 RCE 4건 등 16건 발견XBOW (미국)상용완전 자율 웹·API 침투HackerOne 美 1위(2025.6), 90일 1,060건. 단, 제출 전 사람 검토ARTEMIS (연구)연구실전망 자율 침투8,000호스트 실전서 사람 전문가 10명과 겨뤄 2위PentestGPT 등오픈소스LLM 기반 침투 보조·자동화USENIX Security 2024 발표. 유사 프레임워크 다수프런티어 모델 직접상용 API모델 자체를 에이전트로 운용국가 지원 그룹이 Claude Code로 침투 80~90% 자율 실행(Anthropic 보고)mneme (숭실대 센터)연구코드 취약점 분석(방어 검증용)사이버짐 91.0(구성 적용), 선도 그룹 — Microsoft MDASH와 동률. 국내 최초·유일 등재티오리 진트 Xint상용8개 에이전트 동시 정찰·분석·검증미 DARPA 연구 수행·AIxCC 상위권. 국내 금융그룹 공급엔키화이트햇 OFFen상용AI 웹 침투테스트 자동화(방어)국내 시중은행 공급. 데프콘·카스퍼스키 CTF 수상팀 기술※ 공격형·방어형을 함께 실었다. 같은 기술이 공격과 방어 양쪽에 쓰인다.국내 동향 — 과기정통부는 사이버보안 특화 파운데이션 모델을 개발 중이다(네이버클라우드 컨소시엄, 41개 기관). 이는 에이전트가 아니라 ‘모델’로, 700B MoE 2개를 병렬 개발한다 — 방어(하이퍼클로바X 기반)·공격(엑사원 기반). 공격 모델 목표는 사이버짐에서 GLM-5.3 대비 1단계 80%(2027.2)·최종 100%(2027.7)이며 2027 하반기부터 4대 기반시설에 적용될 예정이다. 다만 이 모델도 결국 에이전트에 얹혀 쓰이므로, 능력은 공개 시점의 모델 점수가 아니라 구성까지 포함해 보아야 한다.6. 실제 능력은 어느 정도인가 — 점수로 보기취약점 발굴 벤치마크 ‘사이버짐(CyberGym)’ 공식 리더보드 성공률(%)이다(2026.10 기준). 위 두 개는 에이전트 구성(Agent-focused), 아래 다섯은 모델 단독(Model-focused) 상위 5개다. 모델 단독 최고(88.9)보다 에이전트 구성(91.0)이 위에 있다.mneme · 숭실대 (에이전트)91.0MDASH · Microsoft (에이전트)91.0XekRung-1.5-27B · 알리바바 (모델)88.9Gemini 3.8 Flash Cyber · 구글 (모델)86.3GPT-5.5-Cyber · 오픈AI (모델)85.6GLM-5.3 · 즈푸 (모델)84.5DeepSeek-V4-Pro (모델)83.3에이전트 구성 공개 가중치 모델 폐쇄 모델(보안 특화)사이버짐 공식 리더보드 — Agent-focused, 90% 이상 선도 그룹 17개 (2026.10 캡처, 무작위 순서)선도 그룹 17개: mneme(숭실대)·MDASH(Microsoft)·Wiz Atlas 외에 NSFOCUS·天工·Alibaba Spur·Fangcun·DARKNAVY·Alipay·Sangfor·Huawei 磐石·Fudan 白泽 등. 카드에 표시된 모델이 대부분 DeepSeek-V4·GLM-5.3이다. 마우스를 올리면 점수가 보이며 mneme과 MDASH는 공히 91.0%.사이버짐 공식 리더보드 — Model-focused 상위 5 (2026.10 캡처)모델 단독 1위는 알리바바 시큐리티의 27B 모델(88.9). 공개 모델과 보안특화 폐쇄 모델이 5점 안에 섞여 있다.읽는 법: ① 모델 단독으로는 공개 모델(알리바바 27B·GLM·DeepSeek)과 폐쇄 보안특화 모델(Gemini Cyber·GPT Cyber)이 5점 안에 섞여 있다 — 공개 모델이 통제 모델과 대등하다. ② 에이전트를 얹으면 그 위로 올라간다 — 센터 mneme은 같은 Opus 4.6을 단독 66.6에서 91.0으로 끌어올렸고, Microsoft의 MDASH(상용 모델 GPT-5.4·Claude를 100여 개 전문 에이전트로 엮은 하네스)도 91.0으로 동률이다.Microsoft가 MDASH를 내놓으며(2026.5) 한 말이 이 그래프의 요지다 — “지속 가능한 우위는 어느 한 모델이 아니라 모델을 둘러싼 에이전트 시스템에 있다.” 전용 모델 없이 상용 모델들을 엮어 당시 단일 모델 Mythos(83.1)·GPT-5.5(81.8)를 제쳤고, Windows 커널에서 치명 RCE 4건 등 16건을 찾았다.90% 이상 선도 그룹은 17개 시스템이다. 그중 확인된 중국 팀만 9개(NSFOCUS·天工·Alibaba·Fangcun·DARKNAVY·Alipay·Sangfor·Huawei·Fudan)이고, 쓰는 모델은 압도적으로 DeepSeek-V4·GLM-5.3 같은 공개 가중치다. 비중국은 Microsoft MDASH·Wiz, 그리고 한국은 mneme 하나다. 접근이 쉬운 공개 모델 위에 에이전트를 얹으면 누구나 선도 그룹에 든다는 뜻이다.단, 더 어려운 과제(실제 익스플로잇 생성, ExploitBench)에서는 보안특화 폐쇄 모델이 아직 앞선다. ‘사이버보안 능력’을 단일 점수로 말할 수 없다는 뜻이다.자율 침투 실전에서도 구성이 승부를 가른다 — ARTEX 종합 1위, XBOW HackerOne 美 1위(1,060건).※ 리더보드 점수는 각 팀이 제출한 자체 측정값이며, 선도 그룹은 무작위 순서로 표시되고 사이트 주석대로 작은 차이는 의미 있는 능력 차가 아니다. 벤더가 별도 보고한 수치(예: 샤오미 MiMo 95.1)는 공식 보드에 없어 제외했다.침투 에이전트의 점수는? — 공개 리더보드가 없다사이버짐은 코드 취약점 발굴 벤치마크다. ARTEX·XBOW 같은 침투 에이전트는 다른 과제라 사이버짐 점수가 없고, 침투 쪽에는 사이버짐 같은 공개 리더보드 자체가 없다. 벤치마크는 여럿이지만 논문마다 각자 재서 보고하는 구조라 한 보드에서 줄 세울 수 없다. 있는 근거는 성격이 다른 세 종류다.종류예무엇을 말해주나CTF 벤치마크Cybench(40문제, ICLR 2025) — 최근 논문에서 GPT-5.5가 hard 변형 94.1% / AutoPenBench(33문제) — 완전 자율 에이전트는 “거의 전부 실패”, 사람이 보조하면 급상승조건이 현실적일수록 점수가 급락한다. 완전 자율 침투는 아직 멀었다실전 실적XBOW — HackerOne 美 1위(90일 1,060건) / ARTEMIS — 8,000호스트 실전망에서 사람 전문가 10명과 겨뤄 2위벤치마크가 아닌 실제 결과. 가장 설득력 있으나 서로 비교는 불가대회바이두 Agent+ 챌린지 — ARTEX 종합 1위(실전 67.83·TSecBench 89.78) / DARPA AIxCC대회마다 기준이 달라 횡비교 불가. 순위보다 ‘어떤 능력을 쟀나’가 중요함의: 코드에서 취약점을 찾는 능력은 90%대로 성숙했지만, 살아 있는 시스템을 뚫는 완전 자율 침투는 현실적 조건에서 아직 사람 보조가 필요하다. 이번 사건이 ‘AI 혼자’가 아니라 ‘사람이 ARTEX를 운용’한 것과 맞아떨어진다. 다만 그 ‘사람’이 더 이상 전문가일 필요가 없다는 것이 바뀐 점이다.7. 정리 — 세 가지 사실① 누구나 통제 없이 사이버 능력을 손에 넣을 수 있다. 에이전트는 오픈소스(ARTEX 등), 모델은 공개 가중치나 API — 승인도 심사도 없이 내려받아 결합하면 된다. 그 조합이 보안특화 폐쇄 모델과 대등하거나 앞선다(사이버짐 선도 그룹 17개 중 대부분이 공개 모델 기반 에이전트). 접근을 통제하는 모델을 만들어도, 통제하지 않는 공개 모델로 같은 능력을 얻을 수 있어 모델 통제 자체가 의미를 잃는다.② 발견·열거는 사람 수준에 근접했으나, 검증·판단은 아직 사람 몫이다. 업계 공통 평가는 “자율 AI가 침투 테스트에서 진짜로 경쟁력 있지만 아직 사람을 대체하지 못한다”는 것이다. ‘사람 없는 공격’은 아직이지만 ‘비전문가도 쓰는 공격’은 이미 왔다.③ 능력은 모델이 아니라 구성에서 나오고, 공개 모델이 통제 모델을 이미 앞서는 영역이 있다. 따라서 대응은 모델 규제나 개발 속도 조절이 아니라 운영 단계의 통제 — 능력 검증(모델+구성 단위), 실시간 감시·차단, 사고 추적 — 으로 가야 한다.문의: 숭실대학교 AI안전성연구센터