Site Reliability Engineer (SRE) at Air Apps
on-site · full_time · Visa sponsorship
Apply for this role at Air Apps
Responsibilities:
- Architect and maintain reliable, scalable cloud services and microservices.
- Implement and improve observability: metrics, logging, tracing, dashboards and alerts (Prometheus, Grafana, ELK, Datadog).
- Automate infrastructure and deployment pipelines using IaC (Terraform/CloudFormation) and CI/CD tooling.
- Optimize system performance, scalability, and cloud cost-efficiency.
- Lead incident response, on-call duties, runbook creation and RCA processes.
- Design HA, failover and disaster recovery mechanisms; tune load balancing.
- Collaborate with development teams to improve system design and testability.
Requirements:
- ~4+ years in SRE, DevOps or systems engineering roles.
- Strong experience with cloud providers (AWS/Azure/GCP) and cloud-native patterns.
- Practical knowledge of observability and monitoring stacks (Prometheus, Grafana, ELK, Datadog).
- Proficient with IaC tools (Terraform, CloudFormation, Pulumi) and CI/CD improvements.
- Container and orchestration experience (Docker, Kubernetes, Helm).
- Solid Linux system administration and networking skills.
- Comfortable scripting in Bash, Python or Go and handling incident investigations.