Architecture, Tool Use, Security and Operations
Introduction
Chapter 1: The Evolution from LLM Applications to Agentic Systems
- Single-Shot Prompting: The Baseline
- Conversational Interfaces and Multi-Turn Design
- Tool-Augmented Models and Function Calling
- The Leap to Autonomy: When Tools Become Decisions
- Why Agents Are Fundamentally Different Systems
Chapter 2: Agent Architectures and Control Loops
- The Basic Agent Loop: Observe, Think, Act, Reflect
- Event-Driven vs Request-Response vs Streaming Architectures
- Sequential Chain vs Parallel Fan-Out vs Recursive Decomposition
- Supervisor-Subordinate Patterns
- Reactive Agents vs Deliberative Agents
- Trade-Offs Summary
Chapter 3: Reasoning, Planning, and Reflection
- Chain-of-Thought and Its Production Variants
- Tree of Thoughts, Graph of Thoughts, and Planning Trees
- Backtracking and Self-Correction Loops
- Reflection Patterns: Self-Critique, Outcome Analysis, Iterative Improvement
- Decomposition Strategies: Top-Down, Bottom-Up, Mixed-Initiative
- When Reasoning Helps vs When It Adds Cost Without Value
Chapter 4: Memory, State Management, and Context Engineering
- Short-Term vs Long-Term Memory Architectures
- Vector Databases for Semantic Memory
- Working Memory: Conversation State, Intermediate Results, Scratchpad
- State Persistence: Databases, Queues, Event Sourcing
- Context Window Management: Compression, Summarization, Selective Retrieval
- Context Engineering: What to Include, What to Exclude, Ordering Effects
- Memory Poisoning Attacks and Data Integrity
Chapter 5: Tool Use and Function Calling
- The Function Calling Protocol Across Major Providers
- Schema Design: Types, Descriptions, Constraints, Examples
- Tool Discovery and Dynamic Registration
- Error Handling and Retry Semantics for Tool Calls
- Parsing Structured Outputs: Strict Mode vs Lenient Mode
- Tool Composition: Pipelines, Parallel Execution, Conditional Branching
- Latency and Cost of Tool Calls in Multi-Step Workflows
Chapter 6: Building Tools for Agents: APIs, Shells, Files, Browsers
- Designing APIs for Agents vs Humans
- File System Operations: Listing, Reading, Writing, Diffing
- Shell and Command Execution: Parsing, Streaming Output, Handling Failures
- Database Interactions: SQL Generation, Result Formatting, Safety Constraints
- Browser Automation for Agents
- Rate Limiting, Authentication, and Error Semantics for External Services
Chapter 7: Model Context Protocol and Interoperability
- What MCP Is and Why It Was Created
- MCP Architecture: Servers, Clients, Transport Layers
- MCP Resource and Tool Primitives
- Building MCP Servers for Custom Tools and Data Sources
- Comparing MCP to Alternative Approaches
- Multi-Vendor and Multi-Model Interoperability Challenges
- Limitations and What MCP Does Not Solve
Chapter 8: Single-Agent vs Multi-Agent Architectures
- Single Agent: Monolithic Reasoning with Tool Use
- Multi-Agent Patterns: Specialization, Debate, Hierarchy, Marketplace
- Routing Tasks to Specialized Agents
- Agent Communication Protocols and Message Formats
- Coordination: Shared State, Consensus, Deadlock Avoidance
- When Multi-Agent Adds Value vs When It Adds Pointless Complexity
- Cost, Latency, and Debugging Implications
Chapter 9: Model Selection, Routing, and Inference
- Model Capabilities: Reasoning, Coding, Vision, Multilingual, Tool Use
- Model Routing Strategies: Cost-Based, Capability-Based, Latency-Based
- Fallback and Escalation Patterns
- Structured Outputs: JSON Mode, Strict Schemas, Validation
- Token Budgets and Cost Estimation
- Caching Strategies for Inference
- Running Models Locally vs Remotely
Chapter 10: Prompt and Context Design
- System Prompts: Structure, Specificity, Guardrails
- Few-Shot Examples: Selection, Formatting, Maintenance
- Instruction Hierarchy: What Overrides What
- Output Formatting Requirements That Actually Work
- Prompt Templates vs Dynamic Prompt Generation
- Testing Prompt Changes: A/B, Evaluation Harnesses
- Prompt Drift, Regression, and Version Control
Chapter 11: Reliability Engineering for Agent Systems
- Non-Determinism and Reproducibility Challenges
- Retries with Exponential Backoff and Jitter
- Timeouts: Per-Step, Per-Operation, Per-Session
- Idempotency: Making Actions Safe to Repeat
- Checkpointing and State Recovery
- Circuit Breakers for Failing Tools and Models
- Deadlocks, Livelocks, and Infinite Loops
- Graceful Degradation Strategies
Chapter 12: Security Foundations for Agent Systems
- Why Agents Are Security Nightmares by Default
- Identity and Access Management for Agents
- Secrets Management and Key Rotation
- Zero-Trust Principles Applied to Agent Architectures
- Least Privilege for Tool Access
- Authentication Flows: API Keys, OAuth, mTLS
- Data Classification and Handling Requirements
- Security as a Design Constraint, Not a Bolt-On
Chapter 13: Sandboxing and Isolation
- The Need for Isolation: Agents Can and Will Escape Constraints
- Container-Based Isolation: Docker, gVisor, Firecracker
- Virtual Machine Isolation for High-Risk Operations
- Filesystem Isolation: Read-Only Roots, Ephemeral Storage, Volume Mounts
- Network Isolation: Egress Filtering, DNS Control, Proxy Enforcement
- CPU and Memory Limits: Preventing Resource Exhaustion
- Process Namespaces and Capability Dropping
- Choosing Isolation Level Based on Risk
Chapter 14: Agent-Specific Attack Vectors
- Prompt Injection: Direct, Indirect, Nested, Image-Based
- Tool Poisoning and Malicious Tool Registration
- Data Exfiltration Through Tool Calls and Outputs
- Privilege Escalation Through Reasoning Manipulation
- Supply-Chain Attacks: Malicious Packages, Dependencies, Datasets
- Jailbreaking and Guardrail Evasion
- Indirect Injection Through Retrieved Context
- Mitigations Summary
Chapter 15: Policy Enforcement and Guardrails
- Input Filtering and Sanitization
- Output Validation and Filtering
- Runtime Policy Enforcement: OPA, Custom Policy Engines
- Content Safety: Toxicity, PII, Copyright, Regulated Data
- Action Authorization: What Tools Can Be Called Under What Conditions
- Rate Limiting and Quota Enforcement
- Human Approval Workflows for High-Risk Actions
- Guardrail Performance: Latency Impact, False Positives
Chapter 16: Observability, Tracing, and Monitoring
- The Observability Challenge: Non-Deterministic, Multi-Step, Multi-Component
- Logging: What to Log, When, at What Verbosity, Structured Formats
- Tracing: Distributed Traces Across Model Calls and Tool Invocations
- Metrics: Latency, Cost, Success Rates, Error Patterns, Token Usage
- Dashboards and Alerting
- Debugging Specific Agent Failures: Replay, State Inspection
- Audit Trails for Compliance and Forensics
- Privacy and Data Retention in Logs
Chapter 17: Testing, Evaluation, and Red Teaming
- Unit Testing Individual Components
- Integration Testing: End-to-End Agent Workflows
- Evaluation Harnesses: Accuracy, Completeness, Safety
- Automated Evaluation with LLM-as-Judge
- Human Evaluation Processes
- Red Teaming Methodologies for Agents
- Regression Testing for Prompt and Model Changes
- Chaos Engineering for Agent Systems
- Continuous Evaluation in Production
Chapter 18: Deployment Architectures and CI/CD
- Deployment Models: Serverless, Containerized, Bare Metal
- Infrastructure as Code for Agent Platforms
- CI/CD Pipelines for Agent Systems: Testing Prompts, Tools, Models
- Environment Separation and Promotion Gates
- Blue/Green and Canary Deployments for Agent Features
- Configuration Management: Environment-Specific Settings
- Rollback Strategies for Failing Agent Deployments
Chapter 19: Scaling, Performance, and Cost Optimization
- Scaling Patterns: Horizontal Scaling of Agent Workers, Tool Servers
- Queue-Based Task Processing
- Batch Processing vs Real-Time Processing
- Latency Optimization: Streaming, Early Exit, Parallel Tool Calls
- Token Optimization: Context Reduction, Efficient Prompting
- Cost Monitoring and Attribution
- Auto-Scaling Based on Queue Depth and SLAs
- Caching Layers for Repeated Operations
Chapter 20: Governance, Compliance, and Human-in-the-Loop
- Regulatory Landscape: EU AI Act, Sector-Specific Requirements
- Documentation and System Cards
- Incident Response for Agent Failures
- Human Oversight: Escalation, Approval, Correction Workflows
- Change Management for Agent Systems
- Ethical Considerations and Algorithmic Accountability
- Vendor Risk Management for Model Providers
- Building a Culture of Responsible Agent Engineering
Conclusion: Principles for Building Agent Systems
- Ten Principles for Production Agent Engineering
- What We Know Now vs What Remains Uncertain
- The Trajectory: Where Agent Systems Are Headed
- Skills and Mindset Shifts for Engineers
- Final Recommendations