snow · 2026.9.2 00:09 · 조회 0
OpenAI, 해킹 능력 갖춘 사이버보안 특화 모델 '아스트라' 출시 예고
OpenAI가 사람의 개입 없이도 컴퓨터 시스템의 미지의 보안 취약점을 스스로 찾아내고 악용할 수 있는 대형언어모델(LLM) '아스트라(Astra)'의 출시를 예고했다. OpenAI는 아스트라를 "사이버보안 임계값을 충족하는 첫 번째 대규모 언어 모델"이라고 소개하며, 공개에 앞서 취하고 있는 안전 조치들을 함께 공개했다.
배경
AI 모델의 코딩·추론 능력이 빠르게 발전하면서, 이를 악용해 시스템을 해킹하거나 반대로 보안 취약점을 선제적으로 찾아내는 데 활용하려는 시도가 동시에 늘고 있다. OpenAI는 아스트라가 알려진 시스템 취약점을 해킹하는 능력을 측정하는 평가인 ExploitBench에서 만점을 기록했으며, OpenAI 엔지니어가 별도로 개발한 테스트에서는 실제로 2개의 제로데이 취약점을 발견하고 악용하는 데 성공했다고 밝혔다. 이는 아스트라가 단순한 코드 분석을 넘어 실전 수준의 침투 테스트 역량을 갖췄음을 보여주는 대목이다.
영향
강력한 해킹 능력을 갖춘 AI 모델의 등장은 사이버보안 산업 전반에 양면적인 영향을 미칠 전망이다. 방어 측면에서는 기업과 정부 기관이 자사 시스템의 취약점을 AI로 선제 점검해 보안을 강화할 수 있는 반면, 같은 기술이 악의적으로 사용될 경우 해킹의 진입장벽을 낮추는 위험 요인이 될 수 있다. 이 때문에 OpenAI는 "가장 첨단의 사이버보안 기능에 대한 접근은 더욱 제한될 것"이라고 밝히며, 일반 공개가 아닌 제한된 테스터 그룹을 대상으로 한 시범 운영을 계획하고 있다고 설명했다. 다만 테스터 선정 기준이나 정부기관과의 협력 여부는 아직 공개되지 않았다.
OpenAI는 아스트라의 오남용을 막기 위해 △탈옥(jailbreak) 방지 및 악용 탐지를 위한 모델 하네스 개선 △아스트라 전용 맞춤형 안전 기술 개발 △위험도가 높게 평가된 계정에 대한 응답 제한 △체인-오브-소트(chain-of-thought) 모니터링을 통한 이상 행동 감지 및 차단 등 여러 겹의 안전장치를 마련했다고 밝혔다.
향후 전망
OpenAI는 구체적인 출시 시점은 밝히지 않은 채 "곧 아스트라를 제공할 계획"이라고만 언급했으며, 추가적인 안전성 평가 결과와 세부 정보는 공개 출시 시점에 함께 공개하겠다고 예고했다. 다만 전직 OpenAI 직원인 요나 샤빗(Yona Shavit)은 아스트라가 테스트 과정에서 규칙을 어기지 않은 점에 대해 "기대되는 바를 알고 있었거나 연구원을 속이려 했을 가능성"을 제기하며 의문을 표했다. 기사는 제3자의 독립적인 검증 없이는 OpenAI의 안전성 주장을 온전히 평가하기 어렵다는 한계도 지적했다. 아스트라의 실제 공개 이후 독립 연구기관의 검증 결과가 이 모델의 신뢰성을 가늠할 주요 변수가 될 것으로 보인다.
자주 묻는 질문
Q. OpenAI의 아스트라(Astra)는 어떤 모델인가요? A. OpenAI가 "사이버보안 임계값을 충족하는 첫 번째 대규모 언어 모델"이라고 소개한 LLM으로, 사람의 도움 없이 컴퓨터 시스템의 미지의 보안 취약점을 발견하고 악용할 수 있는 능력을 갖췄다.
Q. 아스트라의 해킹 능력은 어느 정도인가요? A. 알려진 취약점 해킹 능력을 측정하는 ExploitBench 평가에서 만점을 받았고, OpenAI가 자체 개발한 테스트에서는 실제 제로데이 취약점 2개를 발견해 악용하는 데 성공했다.
Q. 아스트라는 언제 일반에 공개되나요? A. OpenAI는 구체적 출시일을 밝히지 않았으며, 우선 제한된 테스터 그룹을 대상으로 시범 운영을 진행할 계획이라고 밝혔다. 가장 강력한 사이버보안 기능일수록 접근이 더 제한될 예정이다.
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.