Skip to main content
This document provides a comprehensive catalog of all red team tests available for AI agents in Sentry, including test descriptions, categories, sample prompts, and configuration requirements.
This catalog covers tests for AI agents with tool use and autonomous capabilities. For foundation model and LLM-based application tests, see the Foundation Model Test Catalog.

Agent Tests Overview

Agent tests are designed to evaluate AI agents with tool use, autonomous decision-making, and interaction capabilities. These tests assess risks specific to agentic systems including tool misuse, access control, behavior patterns, and governance. All agent tests are dynamically generated based on the agent’s configuration and capabilities. They require system_description or policy_description in dataset_configuration to generate contextually relevant test prompts.

Governance Test

Purpose: Tests the alignment and governance of the agent, including goal misalignment and policy drift detection. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s intended purpose, goals, and governance policies
Test Categories:
  • Goal misalignment
  • Policy drift
  • Value alignment
  • Regulatory compliance
Sample Prompt & Response:
Configuration:

Agent Output Quality Test

Purpose: Tests the quality of the agent’s output including hallucinations, bias, and toxicity in multi-turn workflows. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s capabilities and expected output quality standards
Test Categories:
  • Hallucinations
  • Bias and discrimination
  • Toxicity
  • Factual accuracy
  • Consistency across turns
Sample Prompt & Response:
Configuration:

Tool Misuse Test

Purpose: Tests the misuse of the agent’s tools and capabilities including API integration issues, supply chain vulnerabilities, and resource consumption. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of available tools and their intended usage
Test Categories:
  • Unauthorized tool access
  • API abuse
  • Resource exhaustion
  • Supply chain vulnerabilities
  • Tool chaining attacks
Sample Prompt & Response:
Configuration:

Privacy Test

Purpose: Tests privacy protections and data handling including sensitive data exposure and exfiltration channels. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s data handling capabilities and privacy requirements
Test Categories:
  • Sensitive data exposure
  • Data exfiltration
  • Cross-user data leakage
  • Privacy policy violations
  • Data retention issues
Sample Prompt & Response:
Configuration:

Reliability and Observability Test

Purpose: Tests the reliability and observability of agent operations including data poisoning, concept drift, and opaque reasoning. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s decision-making processes and monitoring capabilities
Test Categories:
  • Data poisoning resistance
  • Concept drift detection
  • Opaque reasoning
  • Decision traceability
  • Error handling
Sample Prompt & Response:
Configuration:

Agent Behaviour Test

Purpose: Tests the behaviour patterns and decision-making of the agent including human manipulation and unsafe actuation. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s intended behavior patterns and boundaries
Test Categories:
  • Human manipulation
  • Unsafe actuation
  • Boundary violations
  • Autonomous decision-making risks
  • Social engineering resistance
Sample Prompt & Response:
Configuration:

Access Control and Permissions Test

Purpose: Tests access control and permissions enforcement including credential theft, privilege escalation, and confused deputy attacks. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s access control mechanisms and permission levels
Test Categories:
  • Credential theft
  • Privilege escalation
  • Confused deputy attacks
  • Authorization bypass
  • Permission boundary violations
Sample Prompt & Response:
Configuration:

Tool Extraction Test

Purpose: Tests if the agent tool information can be extracted in outputs, revealing internal capabilities and configurations. Required Configuration:
  • system_description or policy_description in dataset_configuration: Description of the agent’s tool capabilities and configuration
Test Categories:
  • Tool name extraction
  • Tool capability disclosure
  • Configuration information leakage
  • API endpoint exposure
  • Internal architecture revelation
Sample Prompt & Response:
Configuration:

Configuration Requirements Summary

Agent Tests

All agent tests require:
  1. system_description or policy_description (Required in dataset_configuration)
    • Description of the agent’s purpose and capabilities
    • Tool descriptions and access patterns
    • Behavior boundaries and constraints
    • Access control mechanisms
  2. endpoint_configuration with testing_for: "agents"
    • Must specify "testing_for": "agents" to enable agent-specific testing
    • Model configuration with tool/function calling support
Example Configuration:

Test Coverage

By OWASP Agent Security Category

  • Governance & Alignment: governance_test
  • Output Quality: agent_output_quality_test
  • Tool Security: tool_misuse_test, tool_extraction_test
  • Privacy & Data: privacy_test
  • Reliability: reliability_and_observability_test
  • Behavior & Safety: agent_behaviour_test
  • Access Control: access_control_and_permissions_test

Usage Notes

  1. Agent-Specific Configuration: Ensure testing_for: "agents" is set in endpoint_configuration to enable agent tests.
  2. Multi-Turn Testing: Agent tests benefit from multi-turn attack methods to simulate realistic agent interactions:
  3. System Description: Provide detailed system_description including:
    • Agent’s purpose and role
    • Available tools and their capabilities
    • Access control mechanisms
    • Behavioral boundaries
  4. Test Combinations: Multiple agent tests can be run simultaneously. Use appropriate sample percentages to manage test duration.
  5. Tool Configuration: For agents with tool access, ensure tool descriptions are included in system_description to generate relevant test scenarios.