Hiring.Camp

Senior Site Reliability Engineer

AirAsia Berhad

·

Today

Location
Wisma Capital A, Malaysia
Type
Full-time
Department
Engineering
Seniority
Senior
Experience
5+ years
Education
Bachelor
Source
Workday

Description


Job Description

We are looking for a highly motivated Senior Site Reliability Engineer (SRE) to join our Platform Engineering team. In this role, you will design, build, and operate highly available, secure, and scalable cloud platforms while driving automation across the software delivery lifecycle.

You will partner closely with Engineering, Security, DevOps, and Product teams to improve platform reliability, developer productivity, operational excellence, and cloud governance. This is a hands-on engineering role requiring strong expertise in cloud infrastructure, Infrastructure as Code (IaC), GitOps, observability, and incident management.



Key Responsibilities

  • Design, build, and operate highly available production platforms on Google Cloud Platform (GCP).
  • Develop Infrastructure as Code (IaC) using Terraform to provision and manage cloud infrastructure.
  • Implement and maintain GitOps workflows using Argo CD and GitLab.
  • Build and enhance CI/CD pipelines using GitLab to enable secure, reliable, and automated software delivery.
  • Develop automation solutions to eliminate repetitive operational tasks using scripting and APIs.
  • Manage and optimize Cloudflare services including DNS, WAF, CDN, Load Balancing, Zero Trust, and security controls.
  • Build and maintain observability platforms including monitoring, logging, alerting, tracing, dashboards, and SLO/SLI reporting.
  • Drive platform reliability through proactive monitoring, capacity planning, performance tuning, resilience testing, and automation.
  • Participate in an on-call rotation, troubleshoot production incidents, lead incident response, perform root cause analysis (RCA), and implement permanent corrective actions.
  • Improve operational excellence by reducing toil through automation and self-service capabilities.
  • Collaborate with development teams to improve application reliability, deployment strategies, and operational readiness.
  • Ensure platform security by implementing infrastructure best practices, policy enforcement, secrets management, and least-privilege access.
  • Create and maintain technical documentation, operational runbooks, and standard operating procedures.
  • Mentor junior engineers and promote SRE best practices across engineering teams.


Required Qualifications

  • Bachelor's degree in Computer Science, Information Technology, Engineering, or equivalent practical experience.
  • 5+ years of experience in Site Reliability Engineering, Platform Engineering, Cloud Engineering, or DevOps.
  • Strong hands-on experience with Google Cloud Platform (GCP).
  • Strong experience with Terraform and Infrastructure as Code.
  • Hands-on experience with GitLab CI/CD.
  • Experience implementing GitOps using Argo CD.
  • Experience managing Cloudflare services including DNS, WAF, CDN, and Load Balancing.
  • Strong Linux administration and troubleshooting skills.
  • Experience with container technologies including Docker and Kubernetes.
  • Strong scripting skills using Bash, Python, or Go.
  • Experience with monitoring, logging, and observability platforms.
  • Experience with incident management, production support, and on-call operations.
  • Excellent troubleshooting and root cause analysis skills.
  • Strong communication and stakeholder management skills.


Preferred Qualifications

  • Experience operating Kubernetes platforms such as GKE.
  • Experience with service mesh technologies (Istio, Linkerd, or Envoy).
  • Knowledge of SRE principles including SLIs, SLOs, Error Budgets, and Toil Reduction.
  • Experience implementing platform security and DevSecOps practices.
  • Experience with FinOps and cloud cost optimization.
  • Experience with policy-as-code and infrastructure governance.
  • Google Cloud Professional certifications are an advantage.
  • Knowledge in API’s and gateways is added advantages




What Success Looks Like

Within your first 12 months, you will:

  • Improve platform reliability and availability through automation and engineering improvements.
  • Reduce operational toil by automating manual processes.
  • Improve deployment reliability using GitOps and CI/CD best practices.
  • Enhance observability with actionable monitoring and alerting.
  • Strengthen platform security and operational governance.
  • Enable engineering teams to deliver software faster and more reliably.

Skills

PythonGCPDockerKubernetesTerraformCI/CDLinuxGitLabDevOpsSRE

Similar Jobs

30

Senior Site Reliability Engineer

StraitsX · Jakarta, Jakarta, Indonesia

Today

Senior Site Reliability Engineer [SRE Infrastructure]

Draftkings · Remote - Bulgaria +1 · Remote

Today

Senior Site Reliability Engineer - Infra Ops

Circle · U.S. - California, United States of America · Remote

Today

Senior Site Reliability Engineer

Theaccessgroup · United States Remote, United States of America · Remote

Today

Senior Site Reliability Engineer

Akamai · United States, US · Remote

Yesterday

Senior Site Reliability Engineer

Akamai · United States, US · Remote

Yesterday

Senior Site Reliability Engineer - CloudVision

Arista Networks · Dublin, Ireland · Remote

Yesterday

Senior Site Reliability & Observability Engineer (SRE)

TransUnion · Eagle - D.F. Del. Miguel Hidalgo, Mexico · Remote, Onsite

Yesterday

Senior Site Reliability Engineer

Walmart · IN TN CHENNAI Home Office Capita Land, India

Yesterday

Senior Site Reliability Engineer

Walmart · IN TN CHENNAI Home Office Capita Land, India

Yesterday

Senior Site Reliability Engineer - Cloud

Nvidia · US, CA, Santa Clara, United States of America

Yesterday

Senior Site Reliability Engineer (SRE) I

Thomson Reuters · India, Bengaluru, Karnataka +1 · Hybrid

Yesterday

Senior Site Reliability Engineer - Digital Health Products

Roche · Pune DIA, India

Yesterday

[8SN] Senior Site Reliability / Production Support Engineer

Software Mind · Montreal, Canada, Canada · Remote

3 days ago

Senior Site Reliability Engineer (Kubernetes)

Mirantis · Calgary, British Columbia, Canada · Remote

4 days ago

Senior Site Reliability Engineer

Gradle Technologies · Europe (GMT) +1

4 days ago

Senior Site Reliability Engineer (SRE)

Branch · Remote, US · Remote

4 days ago

Senior Site Reliability Engineer

Gradle Technologies · North America (PST)

4 days ago

Senior Site Reliability Engineer - Remote

Akamai · Poland, PL · Remote

4 days ago

Senior Site Reliability Engineer

Rbs · Bengaluru, India

4 days ago

Senior Site Reliability Engineer, Production Engineer - ThousandEyes

Cisco · USA-SAN FRANCISCO, United States of America · Hybrid

4 days ago

Senior Site Reliability Engineer

Cisco · GBR-LONDON, United Kingdom · Hybrid

4 days ago

Senior Site Reliability Engineer (SRE)

Arrow · Ahmedabad, India +3

4 days ago

Senior Site Reliability Engineer

Cubic · Hyderabad, Telangana, India · Hybrid

4 days ago

Senior Site Reliability Engineer

Oracle · Austin, TX, United States

4 days ago

Senior Site Reliability Engineer (SRE)

Mirantis · Warsaw, Masovian Voivodeship, Poland · Remote

5 days ago

Senior Site Reliability Engineer

NielsenIQ · Pune, MH, India

5 days ago

Senior Site Reliability Engineer

Pingidentity · Bengaluru, Karnataka, India

5 days ago

Senior Site Reliability Engineer / DevOps Engineer

Sertis · Bangkok, Bangkok Metropolis, Thailand

5 days ago

Senior Site Reliability Engineer

Issgovernance · Mumbai, India

5 days ago
Senior Site Reliability Engineer at AirAsia Berhad | Hiring.Camp