[지디넷코리아]
지난달 23일부터 24일까지 서울 코엑스에서 열린 국제해킹방어대회 ‘코드게이트 2026’은 여러모로 시선을 모았다. 특히 윤인수 KAIST 전기 및 전자공학부 교수가 만든 AI해커가 사람 해커와 대결, 관심이 더 뜨거웠다.
사람 개입 없이 스스로 시스템 취약점을 탐색하고 문제를 해결한 AI 해커는 일반부에서 18위, 주니어부에서는 2위를 기록했다.
‘AI 해커’는 앤트로픽, 오픈AI, xAI 등 글로벌 프론티어 거대언어모델(LLM)을 기반으로, 데프콘(DEF CON) 등 세계적 해킹대회에서 축적한 실전 노하우를 학습시켜 만든 특화 모델이다. ‘AI 해커’는 초반에는 문제들을 빠르게 해결했으나, 후반부 들어 고난도 문제에 발목을 잡혀 일반부에서 18위라는 상대적으로 저조한 성적표를 받았다.
이번과 같은 CTF에서 AI가 온전히 활약하기란 쉽지 않다. CFT가 인간 화이트해커의 실력을 경쟁하는 대회이지 AI 간 성능을 평가하는 무대가 아니기 때문이다. CTF는 가장 대표적인 정보보안(해킹) 실습 대회로 경연자들이 다양한 보안 문제를 해결, 숨겨진 문자열인 ‘플래그(flag)’를 찾아 제출하고 점수를 얻는 방식이다. 실제 해킹 기술을 안전한 환경에서 익히고 실력을 겨루기 위해 만들어진 대회다.
사람 위주 경연이다보니 세계 최대 CTF인 ‘데프콘(DEF CON) CTF’도 올해 AI 사용을 일부 제한하는 룰을 뒀다. AI를 활용할 수는 있지만, 100% AI가 문제를 해결하면 안 된다는 것이다.
‘코드게이트 CTF’에서는 주최 측인 코드게이트포럼이 KAIST에 AI 해커 참전을 제안, 윤 교수가 이를 수락, 온전히 AI가 CTF에서 경연을 펼쳤다. 경연 당일 AI해커는 오후 2시경 7위를 기록하며 선전했다. 한때 7위보다 더 높은 순위도 기록했다.
대회 초반에는 AI해커가 빠른 속도로 CTF 문제를 풀은 것이다. 이번 코드게이트 CTF는 ‘다이내믹 스코어링’ 방식으로 진행했다. ‘다이내믹 스코어링’ 방식은 어려운 문제를 ‘단독’으로 풀었을 때 가장 높은 점수를 받는다. 여러 명이 동일 문제를 해결할수록 문제의 배점은 낮아진다. 빨리 푼다고 고득점을 얻을 수 없다. 이에 AI 해커는 순위가 뒤로 밀려날 수밖에 없었다. 특히 18위까지 순위가 낮아진 데에는 게임 형식 문제나 동영상·이미지를 해석해 취약점을 찾고, 해킹에 성공하는 식의 문제를, AI가 맥락을 읽고 해결하기란 한계가 있다. 실제 AI 해커는 이같은 2개 문제를 결국 해결하지 못했다.
하지만 주목할 점은 2개 문제를 제외하고 모든 문제를 해결했다는 것이다. 비록 고득점을 얻는 데에는 실패했지만, 인간 화이트해커보다 빠르게 문제를 해결했다. 대회 진행 시간이 짧은 주니어부 CTF에서 2위를 차지한 점이 이를 방증한다. 코드게이트 CTF는 일반부 CTF는 24시간, 주니어부는 12시간 진행됐다.
AI 해커가 풀지 못한 2개 문제는 ‘고난도’ 문제라기보다 ‘AI가 풀기 어려운’ 문제였다. 문제 풀이량만 보면 AI 해커도 인간 화이트해커와 견줄 수 있는 수준이었다. 순수하게 AI만 활용했을 때 화이트해커가 AI를 활용한 수준과 비슷한 성능을 낼 수 있었다는 것이다.
윤 교수는 이를 두고 ‘AI+전문가’의 형태가 가장 좋은 결과를 창출한다고 평가했다. 그는 “대회에 참전한 화이트해커들도 문제풀이에 AI를 활용했다. 결국 AI와 전문가가 결합된 형태가 가장 효율적인 성과를 낼 수 있는 셈”이라고 짚었다. 바꿔말하면, 공격자와 AI가 결합한 형태가 최대의 해킹 효율을 낼 수 있다는 얘기다. 이는 예견된 미래다. 앤트로픽의 프론티어 AI 모델 ‘미토스(Mythos)’는 알려지지 않았던 취약점 1만개 이상을 찾아냈다. 최근에는 미토스보다 뛰어난 AI 모델도 등장했다.
코드게이트 CTF의 AI 해커 참전은 AI가 펼칠 미래 사이버전의 작은 예고편에 불과하다. 나쁜 마음을 먹은 사이버 공격자가 AI를 악용하면 어떤 끔직한 결과가 일어날 지 모른다. 우리는 ‘끔찍한 결과’를 막을 준비가 돼 있는걸까.
