01. Overview & AI Red Teaming Methodology
Theoretical foundation of AI Red Teaming: comparing traditional software pentesting with probabilistic model auditing, NIST AI 100-2 / MITRE ATLAS framework alignment, threat modeling AI architectures, and establishing safe audit scope.
02. Core Concepts & Attack Mechanics
In-depth technical breakdown of AI vulnerability mechanics: Direct & Indirect Prompt Injection, Multi-Turn Crescendo attacks, PAIR/TAP/GCG automated optimization, token smuggling, and attention hijacking.
03. Attack Scenarios & Multi-Turn PoCs
Practical proof-of-concept audit scripts and multi-language code examples in Python, Node.js/TypeScript, Go, and Java demonstrating multi-turn context accumulation, token smuggling, and side-by-side vulnerable vs secure implementation patterns.
04. Guardrail Architecture & Mitigations
Production-grade mitigations and defense-in-depth architecture for AI applications: Meta Llama-Guard-3, NVIDIA NeMo Guardrails, Dual-LLM isolation patterns, system prompt engineering, and guardrail accuracy metrics.
05. Security Testing & Tooling Automation
Comprehensive guide to automating AI Red Teaming using Microsoft PyRIT, garak, UK AISI Inspect AI, and Promptfoo, including CI/CD integration pipelines with GitHub Actions.
06. Hands-On Red Teaming Lab
Self-contained, runnable Python security lab: Vulnerable AI Customer Support Agent, Automated Audit & Exploit Harness, Hardened Guardrail Patch, and Verification Suite.
07. References & Standards
Authoritative academic research papers, industry standards (NIST AI 100-2, MITRE ATLAS, OWASP Top 10 for LLMs), security frameworks, and open-source AI Red Teaming tools.
AI Red Teaming & Safety Evaluation Playbook
Comprehensive guide to AI Red Teaming: methodology, threat modeling with NIST AI 100-2 and MITRE ATLAS, automated evaluation with PyRIT & Garak, multi-turn Crescendo attacks, guardrail stress testing, and defensive engineering.