Security
요청은 게이트웨이에서 거르고,
AI 에이전트의 행동은 기록하고 판정합니다.
GenAI Shield는 조직의 모든 AI 호출이 거쳐 가는 단일 게이트웨이입니다. 요청이 OpenAI·Anthropic으로 나가기 전에 개인정보를 걸러내고, 응답이 사용자에게 도착하기 전에 한 번 더 확인하며, 조직·팀·개인 단위로 예산을 관리합니다. 여기에 AI 에이전트가 어떤 도구를 어떤 값으로 호출했는지 기록하고 위험도를 판정하는 에이전트 행위 보안(GuardTrail)을 애드온으로 제공합니다.
01 · 게이트웨이 DLP
요청과 응답 양쪽에서 개인정보를 거릅니다
주민등록번호·카드번호·계좌번호·전화번호·이메일·API 키 등 15종을 정규식으로 찾아내고, 유형별로 부분 마스킹 / 완전 가림 / 차단 / 경고 가운데 하나를 정합니다. 원문은 어디에도 저장하지 않으며, 탐지 기록에는 일부를 가린 샘플만 남깁니다.
- 입력 검사: 외부 모델로 보내기 전 대화 내용 전체(이미지 첨부의 텍스트 포함)
- 출력 검사: 답변 본문과 도구 호출 값(
tool_calls인자)까지 — 모델이 도구 호출로 답할 때 새어 나가는 경로도 막습니다 - 스트리밍 응답: 조각 단위로 잘린 패턴도 이어 붙여 찾아내고 기록합니다
- 프롬프트 인젝션 탐지(경고 또는 차단), 사내 프로젝트명 같은 사용자 지정 단어 필터
- 조직별 프리셋(교육·공공·기업)과 항목별 개별 설정, 감사 리포트 CSV/PDF 내려받기
| 단계 | 시점 | 검사 대상 | 처리 |
|---|---|---|---|
| ① 입력 검사 | 요청을 받은 직후 | 개인정보·API 키·인젝션 문구 | 유형별 마스킹 / 가림 / 차단 / 경고 |
| ② 접근 통제 | 모델을 정한 직후 | 허용된 이용 방식·허용된 AI 회사·판매 카테고리 | 권한이 없으면 403과 사유 반환 |
| ③ 예산 확인 | 외부 호출 직전 | 키 → 개인 → 팀 → 조직 순서의 크레딧 | 부족하면 402, 기준 초과 시 경보 메일 |
| ④ 출력 검사 | 응답을 받은 직후 | 답변 본문·도구 호출 값 | 마스킹 후 전달, 탐지 기록(스트리밍은 기록만) |
| ⑤ 기록 | 항상 | 일부 가린 샘플과 요약 수치만 | 원문은 저장하지 않고 보존 기간이 지나면 삭제 |
02 · 조직 격리
조직 간 데이터는 한 바이트도 섞이지 않습니다
모든 조회는 조직 단위로 제한됩니다. API 키 원문·사용량·크레딧·구성원 정보는 다른 조직에 절대 보이지 않고, 같은 조직 안에서도 관리자는 전체를, 일반 사용자는 자기 키의 기록만 봅니다. 세 방향 격리 테스트가 회귀를 막습니다.
03 · 예산 통제
키 → 개인 → 팀 → 조직 순서로 차감
충전한 크레딧을 팀과 개인에게 나눠 예치하면, 각자의 호출은 자기 몫에서만 차감됩니다. 소진율 경보 기준은 시스템 기본값 → 팀 → 개인 순으로 물려받고, 개인이 직접 기준을 정하거나 끌 수 있습니다. 같은 시각에 겹치는 경보는 한 통으로 보냅니다.
04 · 벤더 키 관리
키가 없으면 대체하지 않고 즉시 알립니다
고객사 전용 키 → 공용 키 풀 순서로 호출하고, 쓸 키가 없으면 다른 키로 몰래 대체하지 않고 원인을 담아 실패합니다. 값이 등록되지 않은 키는 "사용불가"로 표시하고, 자동 발급(Admin API)과 수동 등록을 배지로 구분합니다.
05 · 에이전트 행위 보안 — GuardTrail
모델이 무슨 말을 했는지가 아니라, 에이전트가 무엇을 했는지를 봅니다
AI 에이전트의 위험은 이상한 문장이 아니라 어떤 권한으로 어떤 도구를 어떤 순서로 호출해 실제 시스템에 무엇을 바꿨는가에 있습니다. GuardTrail은 모델과 도구 사이에 검문소를 두고, 도구 호출을 하나하나 기록하며 실행 직전에 허용 여부를 판정합니다. 프롬프트 검사기가 아니라 에이전트용 EDR(행위 기반 탐지·대응)입니다.
게이트웨이를 지나는 응답의 도구 호출(tool_calls)을 기록하고, 내장 규칙으로
행위 종류(읽기·쓰기·삭제·실행·전송·네트워크)와 위험도, 판정(허용·주의·차단 예정)을 붙입니다. 관찰 모드라서 실행을 막지는 않습니다.
요청에 선언된 도구 설명에 숨은 조작 문구(툴 포이즈닝)도 경고합니다. 켠 조직에서만 동작하고, 끈 조직에서는 코드가 한 줄도 실행되지 않습니다.
에이전트 옆(개발자 PC 또는 사이드카)에서 MCP 도구 호출을 가로채 실행 직전에 판정합니다. 비밀키 유출·외부 전송·파괴적인 명령은 고정 규칙으로 차단하고, 위험한 행위만 사람이 승인합니다.
호출 하나하나는 정상이어도 탐색 → 수집 → 압축 → 외부 전송 순서는 공격입니다. 세션 그래프, 평소 패턴과 다른 행동 탐지, 사고 시간순 재현, 긴급 중지 스위치를 제공합니다.
설계 원칙
rm -rf /가 위험한지 AI에게 물을 이유가 없습니다. 명확한 금지 사항은 규칙으로 막고, 문맥이 필요한 판단에만 AI를 보조로 씁니다.
모든 판정에 근거 코드와 점수가 붙습니다(예: 삭제 행위 +90, 시스템 핵심 경로 +30). 오탐은 규칙 시뮬레이션 화면에서 미리 확인합니다.
호출 값과 결과는 일부를 가린 미리보기·해시·크기만 남깁니다. 원문이 꼭 필요하면 고객 측 저장소에만 둡니다.
사용하지 않는 조직에는 응답 속도·조회·화면·데이터 구조가 전혀 바뀌지 않습니다. 켠 조직만 자기 설정대로 동작합니다.
데모 조직에서 개인정보 필터와 에이전트 행위 기록을 실제 화면으로 보실 수 있습니다.