Authors: Ayo Adedeji, Lavi Nigam, Sarita A Joshi, Stephanie Gervasi
This repository contains hands-on exercises, code samples, and projects accompanying the book "GenAI on Google Cloud: Enterprise Generative AI Systems and Agents". Each chapter folder includes:
- Colab Notebooks - Interactive tutorials and exercises
- Projects - End-to-end implementations
- Solutions - Reference implementations (selected exercises)
- Google Cloud Platform account
- Vertex AI API enabled
- Python 3.9 or higher
# Clone this repository
git clone https://github.com/ayoisio/genai-on-google-cloud.git
# Install required dependencies
pip install -r requirements.txt
# Configure Google Cloud credentials
gcloud auth application-default loginIntroduction to LLM complexities and production deployment challenges.
- Topics: LLM fundamentals, SLM vs LLM tradeoffs, agent architecture (model, tools, orchestration, runtime), context engineering strategies (prompting, RAG, controlled generation)
- Resources: 3 Coursera courses, 6 video tutorials, links to 5 official Gemini 3 getting-started notebooks
Comprehensive strategies for preparing data for LLM applications.
- Topics: Data readiness dimensions, unified data platform, document processing, RAG evolution (Naive β Advanced β Agentic), vector search, GraphRAG with Spanner, enterprise RAG patterns, security & governance
- Hands-On: 8 Colab notebooks across two learning paths
- Foundations (5): BigQuery exploration, Document AI, embeddings, RAG pipeline, Vertex AI RAG Engine
- Advanced RAG (3): Enterprise RAG with BigQuery/Cloud SQL, GraphRAG with Spanner Graph, Agentic RAG with MCP + ADK
Hands-on development of agents processing text, images, and video using Google's Agent Development Kit.
- Topics: Agent fundamentals, custom tools, multi-agent delegation, state management (session/user/app scopes), semantic memory with Vertex AI Memory Bank, multimodal processing, real-time streaming, security & guardrails
- Hands-On: 8 progressive samples following a SmartHome Customer Support theme
01_hello_agentβ Basic agent in 7 lines02_tool_agentβ Custom function tools03_multi_agentβ Hybrid delegation architecture04_stateful_agentβ State management across scopes05_memory_agentβ Vertex AI Memory Bank integration06_multimodal_agentβ Image analysis and artifact generation07_streaming_agentβ Live API for voice-enabled agents08_guardrails_agentβ Callbacks, plugins, and enterprise compliance
Multi-agent systems, MCP, and A2A protocols for enterprise collaboration.
- Topics: Why monolithic agents don't scale, workflow agents (SequentialAgent, ParallelAgent, LoopAgent), state passing with output_key, Model Context Protocol (MCP) for tool access, Agent-to-Agent (A2A) protocol for delegation
- Hands-On: 8 samples with progressive complexity
01_sequential_agentthrough03_loop_agentβ Workflow patterns04_mcp_agentβ MCP server integration05_a2a_server/06_a2a_clientβ Distributed agent communication07_hybrid_agentβ Combined MCP + A2A architecture08_production_agentβ Production-ready patterns
Metrics, benchmarking, and optimization techniques for LLM applications and agents.
- Topics: Evaluation dimensions (quality, task success, performance, robustness, safety), human-centered methods (rubrics, A/B testing, red teaming), automated metrics (ROUGE, BLEU, BERTScore), agent-specific metrics (tool usage, trajectory), LLM-as-Judge patterns, optimization strategies
- Hands-On: 2 code samples (
agent_eval,custom_eval) + links to 27+ Vertex AI evaluation notebooks covering multimodal evaluation, custom metrics, and model comparison
Fine-tuning strategies and production inference infrastructure on Google Cloud.
- Topics: Fine-tuning decision framework, QLoRA (4-bit quantization + LoRA), infrastructure bottleneck patterns (bandwidth, memory, compute, network), deployment platforms (Agent Engine, Cloud Run, GKE, Vertex AI Prediction)
- Hands-On: 3 Colab notebooks + links to official Model Garden notebooks
01_gemma_finetuningβ Fine-tune Gemma 7B with QLoRA for financial analysis02_model_garden_deploymentβ Deploy models from Vertex AI Model Garden03_vllm_servingβ Efficient LLM serving with vLLM and PagedAttention
AgentOps practices for production AI systemsβbridging "the model works" in development to "the model works reliably in production."
- Topics: The 9 pillars of AgentOps, MLOps evolution (MLOps β GenAI Ops β Agent Ops), data versioning & lineage, experiment tracking, model registry & governance, Vertex AI Pipelines, comprehensive monitoring with Cloud Trace, CI/CD with Cloud Build & Deploy, security with Model Armor, cost management with FinOps Hub, AgentOps maturity progression
- Decision Frameworks (NEW): Production decision support for retraining triggers, cost attribution models (per-request, team-based, agent-level), circuit breaker configuration, multi-stakeholder model approval workflows (technical, business, compliance, ethical reviews)
- Production Patterns (NEW): Detecting semantic drift in LLM outputs, model collapse prevention, ablation studies for feature impact analysis, feedback loop amplification safeguards, catastrophic model shift detection, multi-agent coordination monitoring
- Team Organization (NEW): Role clarity matrix (ML Engineer, DevOps, SRE, Data Engineer responsibilities), escalation paths for production incidents, cross-functional communication protocols
- Hands-On: 35+ curated Vertex AI notebooks across 10 categories with enhanced "Chapter Concepts" column
- ML Metadata & lineage tracking (reproducibility, artifact tracking)
- Experiment tracking with autologging (systematic experimentation)
- Model Registry and versioning (approval workflows)
- Pipelines (KFP, challenger vs blessed deployment, A/B testing)
- Model Monitoring (drift detection with PSI/KL divergence, batch prediction monitoring)
- Feature Store for LLM grounding (real-time context)
- Deployment (dedicated endpoints, VPC-SC security, streaming, custom containers with circuit breakers)
- Explainable AI (feature attributions, ethical review support)
- GenAI/LLM operations (resilience patterns, semantic drift detection)
- Agent Operations (ADK deployment, multi-agent monitoring)
Measuring and advancing your organization's AI capabilities across strategic, cultural, and operational dimensionsβwith actionable playbooks for phase transitions.
- Core Framework: 3 maturity dimensions (Vision & Leadership, Talent & Culture, Operational & Technical) Γ 3 phases (Tactical β Strategic β Transformational) = 9 maturity states with clear progression indicators
- Phase Transition Playbooks (NEW):
- 90-Day Tactical β Strategic: Month-by-month roadmap covering foundation assessment, data governance (Ch 2), evaluation framework (Ch 5), MLOps platform (Ch 7), first strategic project deployment
- 12-Month Strategic β Transformational: Quarterly progression through cultural transformation, platform democratization (Gemini Enterprise Hub), advanced capabilities (multi-agent systems from Ch 4, AIOps), market leadership
- Dimension Interdependencies (NEW): Why isolated optimization failsβfailure mode analysis (Strong Vision/Weak Talent, Strong Ops/Weak Vision, Strong Talent/Weak Ops), dependency sequencing strategy, quarterly balancing approach
- Technology Decision Frameworks (NEW):
- Build vs Buy decision trees with real examples (chatbots β BUY, fraud detection β BUILD, domain code gen β HYBRID)
- Organizational structure guidance (Centralized CoE vs Distributed vs Hybrid by phase)
- Platform selection criteria (Tactical: Workbench+AutoML, Strategic: Full Vertex AI, Transformational: Vertex+GKE)
- Role-Based Maturity Actions (NEW): Tailored guidance for CFO (AI financial strategy, cost attribution, ROI), CIO/CTO (infrastructure scaling, deployment velocity), CHRO (workforce transformation, AI literacy), Individual Contributors (career navigation, skill roadmaps)
- Cross-Chapter Integration (NEW): Learning journey maps connecting Ch 2 (data foundation) β Ch 5 (evaluation) β Ch 6 (fine-tuning) β Ch 7 (MLOps) β Ch 8 (maturity assessment), persona-based reading paths (Executives, Technical Leaders, ML Practitioners)
- Assessment Tools:
maturity_assessment.mdβ Self-assessment workbook (28+ questions across dimensions)maturity_rubric.mdβ Detailed phase descriptions with scoring criteriause_case_mapping.mdβ Value vs Effort prioritization (Quick Wins, Strategic Bets, Fill-ins, Avoid)roadmap_template.mdβ Phase transition planning with success metricsresources.mdβ Google Cloud certifications, AI maturity frameworks, compliance guidance (EU AI Act)
- Case Studies: Cymbal Health (Tactical β Strategic), Cymbal Retail (Strategic β Transformational), Cymbal Media (Transformational maintenance) with phase transition examples
- Google Cloud Platform: Vertex AI, BigQuery, Cloud Run, GKE
- Frameworks: Agent Development Kit (ADK)
- Languages: Python, SQL
- Models: Gemini, open-source models
We welcome contributions! Please see CONTRIBUTING.md for guidelines.
This project is licensed under the MIT License - see the LICENSE file for details.
For questions and discussions:
- Open an issue in this repository


