기술 가이드
AI 에이전트 보안: 실용적인 제어 체크리스트

AI 에이전트 보안은 컨텍스트를 읽고, 도구를 선택하고, 여러 단계를 거쳐 동작할 수 있는 모델을 둘러싼 제어 시스템입니다. 안전한 설계는 모델 출력, 검색된 콘텐츠 및 도구 결과가 잘못되거나 악의적일 수 있다는 점을 전제로 합니다. 접근을 제한하고, 모든 동작을 검증하고, 불확실성을 가시화하고, 결과에 영향을 미치는 변경 사항에 대해 담당자가 책임을 지도록 합니다.
Ottermind는 연결된 작업에도 동일한 경계 우선 접근 방식을 적용합니다. 소스 컨텍스트와 결과물은 검토 가능한 상태로 유지되지만, 결과적인 작업은 권한 및 담당자의 승인을 받아야 합니다. 이는 작업 공간 옵션일 뿐, 조직의 보안 검토를 대체하는 것은 아닙니다.
연구 및 공개: 이 체크리스트는 2026년 9월 3일에 검토된 NIST AI 위험 관리 프레임워크, OWASP LLM 지원서 상위 10개 및 Anthropic 에이전트 안전 지침를 기반으로 합니다.
5가지 보안 경계
| 경계 | 주요 위험 | 필수 제어 |
|---|---|---|
| 신원 | 잘못된 사용자 또는 테넌트 컨텍스트 | 강력한 ID 및 테넌트 검사 |
| 검색 | 유출되었거나, 오래되었거나, 손상된 컨텍스트 | 권한 인식 검색 및 출처 확인 |
| 도구 | 과도하거나 잘못된 형식의 작업 | 제한된 스키마, 유효성 검사 및 시간 초과 |
| 런타임 | 명령, 파일 또는 네트워크 무단 접근 | 샌드박스, 격리 및 송신 정책 |
| 운영 | 오류 발생 시 알림 없음 또는 검토되지 않은 변경 사항 | 추적, 경고, 승인 및 롤백 |
보안은 워크플로 전체에 걸쳐 분산되어 있습니다. 에이전트에게 "주의하세요"라고 알리는 최종 메시지는 보안 제어가 아닙니다.
기능 설계 전 위협 모델
에이전트가 관찰할 수 있는 것, 변경할 수 있는 것, 그리고 오류로 이득을 볼 수 있는 사람을 적어보세요. 호기심 많은 사용자, 손상된 커넥터, 검색된 문서의 악성 텍스트, 예상치 못한 데이터를 반환하는 도구, 쓰기 작업 중 서비스 중단 등을 고려해 보세요. 각 위협에 대해 예방 제어, 탐지 신호, 복구 조치를 명시하세요. 이 간소화된 위협 모델을 통해 가장 위험한 기능은 모델 자체가 아니라 지나치게 광범위한 커넥터라는 사실을 종종 알 수 있습니다.
ID 및 테넌트 격리
실행을 시작하기 전에 사용자를 인증하고 해당 ID를 기준으로 모든 검색 및 도구 호출에 대한 권한을 부여하십시오. 모델에 표시되는 프로젝트 ID가 신뢰할 수 있다고 가정하지 마십시오. 데이터를 소유하는 서비스에서 테넌트, 프로젝트, 역할 및 레코드 수준 권한을 확인하십시오. 다중 사용자 작업 공간의 경우, 테넌트 간 요청을 명시적으로 테스트하고 로그에 금지된 파일 이름, 코드 조각 또는 도구 인수가 노출되지 않는지 확인하십시오.
검색 무결성
검색 시스템은 데이터 유출, 오래된 기록 반환 또는 문서에 포함된 지시 사항 노출 등의 문제를 야기할 수 있습니다. 각 데이터 청크에 출처 정보(소스 식별자, 소유자, 유효 날짜, 권한 결정)를 저장하십시오. 최신 원본 기록을 우선적으로 사용하고 충돌을 드러내십시오. HTML, PDF, 이메일 및 이슈 댓글은 지시 사항이 아닌 데이터로 취급하십시오. 검색된 단락에 권한이 부여되어야 한다는 내용이 있더라도 모델이 스스로에게 접근 권한을 부여해서는 안 됩니다.
도구 및 런타임 격리
일반 셸이나 무제한 HTTP 클라이언트 대신 비즈니스 의도를 명확히 표현하는 도구를 사용하십시오. 인수를 검증하고, 할당량을 적용하고, 시간 초과를 설정하고, 쓰기 작업을 멱등성 있게 만드십시오. 일회용 파일 시스템과 제한된 출력 기능을 갖춘 샌드박스에서 코드 또는 브라우저 작업을 실행하십시오. 개발 자격 증명과 프로덕션 자격 증명을 분리하고, 수명이 짧은 토큰은 실행 후 교체하십시오.
인간 승인 설계
승인 시에는 제안된 조치, 목표, 근거 자료, 부작용 및 대안을 명시해야 합니다. "승인" 버튼을 클릭했을 때 관련 없는 여러 작업을 한꺼번에 숨기지 않아야 합니다. 외부 커뮤니케이션, 삭제, 결제, 접근 권한 변경 및 정책 업데이트에 대해서는 더욱 엄격한 검토 절차를 요구해야 합니다. 승인자, 타임스탬프, 결정 내역 및 수정 내용을 저장하여 재시도 시 체크포인트를 자동으로 건너뛰지 못하도록 해야 합니다.
레드팀 테스트 케이스
문서에 프롬프트 삽입, 접근 권한이 없는 사용자, 잘못된 JSON 형식을 반환하는 도구, 만료된 자격 증명, 변경된 스키마, 중복 재시도, 전송 또는 삭제 요청 등을 포함하는 소규모 회귀 테스트 세트를 구축합니다. 예상 결과가 항상 작업 완료일 필요는 없으며, 안전한 거부, 권한 상승, 유용한 오류 메시지 반환 등이 유효한 결과입니다. 프롬프트, 도구, 커넥터 또는 모델 버전이 변경될 때마다 이 테스트 세트를 실행합니다.
보안 운영 체크리스트
- 모델, 도구, 커넥터 및 데이터 저장소의 목록을 관리합니다.
- 커넥터 범위 및 권한 역할을 정기적으로 검토합니다.
- 비정상적인 도구 사용량, 프로젝트 간 검색 및 차단된 작업에 대한 경고.
- 불필요한 비밀 정보를 저장하지 않고도 사고 조사에 필요한 만큼의 추적 정보를 보존.
- 액세스 권한 취소, 실행 중지 및 원본 레코드 복원 방법 문서화.
- 사용자가 안전하지 않은 제안이나 유출된 컨텍스트를 보고할 수 있는 명확한 방법 제공.
에이전트 단계에 제어 매핑.
에이전트 루프를 따르면 보안 검토가 더 쉬워집니다. 접수 시 신원, 목적 및 허용된 데이터를 확인합니다. 검색 중에는 권한을 적용하고 출처를 첨부합니다. 추론 중에는 출력 스키마를 제한하고 불확실성을 표시합니다. 도구 호출 전에 인수와 부작용을 검증합니다. 호출 후에는 결과를 확인하고 전환 과정을 기록합니다. 완료 전에는 적절한 검토자를 요구하고 최종 상태를 저장합니다. 이러한 단계별 로드맵을 통해 팀은 보안을 제한 없는 에이전트를 둘러싼 단일 관문으로 취급하는 것을 방지할 수 있습니다.
공급망 및 커넥터 위험
에이전트의 효과적인 기능에는 SDK, 플러그인, MCP 서버, 브라우저 확장 프로그램, 프롬프트 템플릿 및 커넥터 범위가 포함됩니다. 이러한 종속성을 목록화하고 프로덕션 환경에 배포하기 전에 업데이트를 검토하십시오. 가능한 경우 버전을 고정하고, 패키지에 서명하거나 검증하고, 테스트 자격 증명을 고객 데이터와 분리하여 보관하십시오. 전체 드라이브를 읽을 수 있는 커넥터는 모델 공급자가 모델 자체를 올바르게 구성했더라도 모델 공급자보다 더 큰 취약점을 초래할 수 있습니다.
유용한 보안 검토에 포함되는 내용
의도된 워크플로, 데이터 분류, ID, 도구, 모델 및 SDK 버전, 위협 시나리오, 제어, 테스트 케이스, 미해결 위험 및 책임자를 기록하십시오. 차단된 작업의 예시 하나와 안전한 에스컬레이션 예시 하나를 포함하십시오. 새로운 커넥터, 도구, 모델 또는 자율성 수준이 도입될 때 검토를 다시 수행하십시오. 이전 승인이 실질적으로 다른 작업 영역을 묵살해서는 안 됩니다.
최소 권한 원칙의 실제 적용
에이전트에게 현재 작업에 필요한 소스와 도구만 제공합니다. 읽기 및 쓰기 자격 증명을 분리합니다. 프로젝트 및 ID별로 파일 범위를 지정하고, 네트워크 대상을 제한하고, 임시 액세스를 만료시킵니다. 소스를 볼 수 없어야 하는 사용자를 사용하여 권한 경계를 테스트합니다.
도구 호출 계약
{
"tool": "create_draft_task",
"arguments": {"title": "...", "owner": "...", "due_date": "..."},
"requires_approval": true,
"idempotency_key": "project-123:brief-v2"
}애플리케이션 코드에서 유형, 허용 값, ID 및 부작용을 검증합니다. 전송, 삭제, 구매, 액세스 변경 또는 게시 시 확인을 요구합니다. 멱등성 키를 사용하여 재시도를 안전하게 만듭니다.
검색 및 프롬프트 주입
문서, 웹 페이지, 이메일 및 도구 결과는 신뢰할 수 없는 데이터로 취급하십시오. 시스템 지침과 구분하고, 소스 식별자를 유지하며, 검색된 텍스트가 권한이나 도구 정책을 변경하지 않도록 하십시오. 소스가 충돌하거나 검색 결과가 없는 경우, 추측 대신 에스컬레이션 상태를 반환하십시오.
평가 및 사고 대응
정상, 불완전, 공격적, 테넌트 간, 민감한 정보 및 도구 오류 사례를 테스트하십시오. 차단된 작업, 안전하지 않은 제안, 데이터 노출 시도, 도구 오류 및 검토자 수정 사항을 추적하십시오. 롤백 경로와 사고를 수신하는 담당자를 지정하십시오.
FAQ
AI 에이전트는 완전히 자율적일 수 있습니까?
자율성은 제한된 제품 설정이지 보안 속성이 아닙니다. 작업의 중대한 결과일수록 승인, 모니터링 및 롤백 제어가 더욱 강력해야 합니다.
프라이빗 모델이 에이전트 보안을 해결합니까?
아닙니다. 프라이빗 모델은 데이터 흐름 위험을 줄일 수는 있지만, ID, 검색, 도구 권한, 런타임 격리, 로깅 및 사람의 검토는 여전히 중요합니다.
팀은 무엇을 먼저 보호해야 합니까?
ID, 검색 권한 및 도구 쓰기 경계부터 시작하십시오. 명확한 추적 기능을 갖춘 읽기 전용 워크플로는 광범위한 자율 액세스보다 더 안전한 초기 배포 방법입니다.
시스템 구조는 AI 에이전트 아키텍처를 참조하고, 구현 세부 사항은 Claude Agent SDK 가이드와 비교하십시오.
