Get in Touch
 Duration 21 hours

Course Outline

Fundamental Principles of Cloud Operations on AWS

  • Defining operational roles and duties within cloud environments.
  • Structuring AWS accounts, organizations, and implementing multi-account strategies.
  • Core operational tools: CloudWatch, CloudTrail, and AWS Config.

Infrastructure as Code and Resource Provisioning

  • Core concepts of IaC and the benefits of immutable infrastructure.
  • Provisioning resources using Terraform and AWS CloudFormation.
  • Handling state, modules, and managing environment promotions.

CI/CD Pipelines and Deployment Methodologies

  • Architecting CI/CD pipelines for cloud-native applications.
  • Implementing blue/green, canary, and rolling deployment techniques.
  • Automating rollback procedures, health checks, and release verification.

Monitoring, Observability, and Alerting Systems

  • Managing metrics, logs, and traces: collection, storage, and analysis.
  • Utilizing CloudWatch, X-Ray, and external observability solutions.
  • Establishing SLOs/SLIs, alerting policies, and on-call workflows.

Security Operations and Identity Governance

  • IAM best practices, enforcing least privilege, and managing cross-account access.
  • Managing secrets, KMS, and secure parameter stores.
  • Operational security measures: patching strategies, vulnerability scanning, and audit trails.

Resilience, Backup, and Disaster Recovery Planning

  • Designing systems for fault tolerance and high availability.
  • Developing backup strategies, snapshot automation, and restore protocols.
  • Formulating disaster recovery plans and creating runbooks.

Cost Optimization and Governance Frameworks

  • Enhancing cost visibility through billing, tagging, and allocation strategies.
  • Rightsizing resources, utilizing reserved instances/savings plans, and budget controls.
  • Governance mechanisms: policies, guardrails, and compliance automation.

Containers, Serverless, and Runtime Management

  • Operational aspects of ECS, EKS, and Lambda.
  • Service discovery, autoscaling mechanisms, and resource constraints.
  • Logging, tracing, and debugging for containerized workloads.

Incident Response, Playbooks, and Chaos Engineering

  • Runbook-driven incident management and postmortem analysis.
  • Automating remediation and implementing self-healing patterns.
  • Introduction to chaos experiments for validating system resilience.

Practical Workshop: Managing a Sample Workload

  • Deploying a sample application using IaC and a CI/CD pipeline.
  • Implementing monitoring, alerts, and automated remediation scripts.
  • Simulating incidents and practicing runbook-based response protocols.

Recap and Future Directions

Requirements

  • Fundamental comprehension of cloud architecture and networking principles.
  • Proficiency with the Linux command line and scripting languages.
  • Practical experience with version control systems (Git) and introductory CI/CD workflows.

Target Audience

  • Cloud operations specialists.
  • Site Reliability Engineers (SREs) and platform architects.
  • DevOps engineers and technical leadership.

Number of participants


Price per participant

Testimonials (1)

Upcoming Courses

Related Categories