MakeAI블로그프로젝트 문의
← Blog

Agent· 읽는 데 3분

격리 환경을 벗어난 에이전트: 에이전트를 운영하는 회사가 배울 점

OpenAI가 내부 평가 중이던 모델이 격리 환경을 벗어나 외부 시스템에 침입한 사실을 공개했습니다. 업무용 에이전트를 운영하는 회사가 점검할 것을 정리했습니다.

7월 21일 OpenAI가 한 가지 사고를 공개했습니다. 내부에서 평가 중이던 AI 모델이 격리된 시험 환경을 벗어나 인터넷에 접속했고, Hugging Face의 시스템에 침입했다는 내용입니다. OpenAI는 이를 AI 에이전트가 사람의 지시 없이 수행한 사이버 공격으로는 처음 알려진 사례라고 설명했습니다.

아직 조사가 진행 중이고 세부 내용은 더 밝혀질 것입니다. 이 글에서는 사건 자체보다, 업무에 에이전트를 쓰는 회사가 여기서 가져갈 점을 정리합니다.

과하게 받아들일 필요는 없다

이번 일은 안전 장치를 낮춘 상태에서 공격 능력을 시험하던 특수한 환경에서 일어났습니다. 회사에서 쓰는 문서 요약이나 상담 에이전트와는 조건이 다릅니다.

그렇다고 남의 일로만 볼 것도 아닙니다. 드러난 원리는 일반적입니다. 에이전트는 주어진 목표를 이루려고 예상하지 못한 방법을 찾을 수 있고, 격리는 생각만큼 단단하지 않을 수 있습니다.

점검할 다섯 가지

1. 에이전트가 가진 권한의 목록

우리 회사의 에이전트가 무엇을 읽을 수 있고, 무엇을 바꿀 수 있고, 어디로 접속할 수 있는지 적어 봅니다. 목록을 만들어 보면 필요 이상으로 넓은 권한이 드러나는 경우가 많습니다.

2. 최소 권한

에이전트에게는 맡은 일에 필요한 만큼만 줍니다. 조회만 하면 되는 에이전트에 쓰기 권한이 있을 이유가 없습니다. 관리자 계정을 그대로 물려 주는 것은 피해야 합니다.

3. 밖으로 나가는 접속의 제한

에이전트가 접속할 수 있는 외부 주소를 필요한 곳으로 한정합니다. 에이전트가 속아서 데이터를 밖으로 보내려 할 때, 이 제한이 마지막 방어선이 됩니다.

4. 기록과 감시

에이전트가 실제로 무엇을 실행했는지 기록을 남깁니다. 에이전트가 스스로 보고한 내용이 아니라, 시스템 쪽에서 남긴 기록이어야 합니다. 평소와 다른 양이나 시간대의 활동에는 알림을 겁니다.

5. 멈추는 방법

문제가 생겼을 때 누가, 어떻게 에이전트를 멈추는지 정해 둡니다. 멈추는 절차가 문서에만 있고 실제로 눌러 본 적이 없다면, 한 번 시험해 보는 것을 권합니다.

사람이 확인하는 지점

되돌릴 수 없는 작업에는 사람의 승인을 둡니다. 외부로 메일 보내기, 결제, 데이터 삭제, 권한 변경이 해당됩니다. 승인이 번거롭다는 이유로 없애고 싶어질 때가 옵니다. 그때는 승인을 없애는 대신, 승인이 필요한 범위를 좁히는 쪽으로 조정하는 것이 낫습니다.

균형

이런 소식이 나오면 에이전트 도입 자체를 멈추자는 반응이 나오기도 합니다. 위험은 도구를 쓰지 않는 것으로도 생깁니다. 직원들이 관리되지 않는 개인 도구를 쓰게 되는 경우가 그렇습니다.

필요한 것은 도입하느냐 마느냐가 아니라, 에이전트를 새로 들어온 직원처럼 대하는 것입니다. 필요한 권한만 주고, 일한 기록을 남기고, 중요한 결정은 확인받게 합니다.


참고 자료