…

Senior DevOps Engineer – Service Layer / QTC Cloud Platform

TALPRO INDIA PRIVATE LIMITED · Staffing & Recruitment

  • Bengaluru, India
  • On-site
  • Posted 27 days ago
  • IT & Infrastructure
  • Contract

About the job

Senior DevOps Engineer – Service Layer / QTC Cloud Platform

Role Details

Role: Senior DevOps Engineer
Experience: 7+ years
AWS Experience: 4+ years hands-on
Primary Skills: AWS, Terraform, CI/CD, DevSecOps, Kafka / MSK, Kubernetes, Docker, AWS Networking, Cloud Security, Observability
Platform Exposure: AWS Serverless, EKS/ECS, API Gateway, ALB/NLB, CloudFront, Route53, RDS/Aurora PostgreSQL, DynamoDB, SQS/SNS, EventBridge
Domain Exposure: Quote-to-Cash, Customer Lifecycle, Enterprise Integrations preferred
Location /Mode: Bengaluru/Hybrid

Role Overview

We are looking for a strong, hands-on, and highly motivated Senior DevOps Engineer to design, build, secure, and operate the cloud platform powering the Service Layer (SL-QTC) ecosystem supporting Quote-to-Cash (QTC) , customer lifecycle, and enterprise integration workloads.

The role involves building and operating a cloud-native, event-driven platform based on AWS, Kafka / AWS MSK, serverless technologies, databases, observability platforms, and DevSecOps toolchains .

The ideal candidate should have strong expertise in AWS cloud infrastructure, Infrastructure-as-Code, CI/CD, networking, security, observability, platform engineering, and production operations for mission-critical distributed systems.

Key Responsibilities

AWS Cloud Platform Engineering

Design, build, and maintain AWS cloud infrastructure supporting highly available event-driven workloads.
Work across AWS services including Lambda, API Gateway, EC2, EKS/ECS, S3, RDS/Aurora PostgreSQL, DynamoDB, SQS, SNS, EventBridge, IAM, CloudWatch, and VPC .
Ensure cloud infrastructure is reliable, scalable, secure, resilient, and cost-efficient.
Support business-critical workloads across APIs, databases, messaging platforms, serverless applications, and enterprise integrations.

Infrastructure-as-Code & Automation

Design and implement Infrastructure-as-Code (IaC) using Terraform .
Build reusable automation frameworks for repeatable, secure, and scalable platform provisioning.
Standardize infrastructure deployment practices across environments.
Maintain infrastructure modules, templates, automation scripts, and configuration standards.

CI/CD & DevSecOps

Build and maintain secure CI/CD pipelines for application, infrastructure, and platform deployments.
Implement deployment automation, release strategies, automated testing, quality checks, and environment management.
Drive DevSecOps practices by integrating: - Security scanning
Policy enforcement
Infrastructure validation
Container security
Dependency management
Compliance checks
Work with tools such as GitLab CI, Jenkins, GitHub Actions , or similar platforms.

AWS Networking & Traffic Management

Design, implement, and manage AWS networking architecture including: - VPCs
Subnets
Route tables
NAT Gateways
Transit Gateway
PrivateLink
Security Groups
VPNs
Hybrid connectivity
Manage application ingress, routing, and content delivery using: - Route53
API Gateway
Application Load Balancers
Network Load Balancers
CloudFront

Cloud Security & Identity Management

Implement cloud security controls using: - AWS WAF
AWS Shield
IAM
Encryption
Secrets management
Vulnerability management
Audit logging
Compliance frameworks
Configure and support enterprise identity integrations using: - Microsoft Entra ID / Azure AD
SAML
OAuth2
OpenID Connect
Single Sign-On
Ensure secure-by-design practices across infrastructure, deployment, networking, and application layers.

Kafka / MSK Platform Operations

Support Kafka / AWS MSK platform operations including: - Topic management
Access controls
Capacity planning
Monitoring
Scaling
Disaster recovery
Partner with engineering teams to improve event-driven workload reliability, availability, and operational supportability.

Observability, Monitoring & Operations

Implement and manage observability solutions covering: - Monitoring
Centralized logging
Distributed tracing
Alerting
Dashboarding
Operational analytics
Work with tools such as: - CloudWatch
Grafana
Datadog
Prometheus
OpenTelemetry
ClickHouse
Create operational dashboards and alerts to support real-time platform visibility.

Reliability, Resiliency & FinOps

Perform platform performance tuning, capacity planning, backup validation, recovery testing, and disaster recovery readiness.
Drive business continuity and operational resilience activities.
Lead FinOps initiatives by monitoring cloud usage, optimizing resource utilization, reducing wastage, and improving cost efficiency.
Implement tagging strategies, budget governance, and cost reporting.

Production Support & Continuous Improvement

Troubleshoot production issues and perform root-cause analysis for business-critical systems.
Drive corrective and preventive actions to improve platform stability.
Contribute to platform standards, operational runbooks, automation initiatives, and engineering best practices.
Work closely with Engineering, Architecture, Security, Product, and DevOps teams.

Must-Have Skills

AWS Cloud Infrastructure

Strong experience designing and operating AWS cloud platforms.
Hands-on experience with: - Lambda
API Gateway
EC2
EKS / ECS
S3
RDS / Aurora PostgreSQL
DynamoDB
SQS / SNS
EventBridge
IAM
CloudWatch
VPC services

AWS Networking

Strong experience with: - VPCs
Subnets
Route tables
Security Groups
NAT Gateways
Transit Gateway
PrivateLink
Route53
VPNs
Hybrid connectivity

Traffic Routing & Edge Security

Strong experience with: - Route53
Application Load Balancers
Network Load Balancers
CloudFront
API Gateway
AWS WAF
AWS Shield

Infrastructure-as-Code

Strong hands-on experience with Terraform .
Experience building infrastructure automation at enterprise scale.
Ability to manage reusable IaC modules, environment provisioning, and governance controls.

CI/CD & DevSecOps

Strong experience building and managing CI/CD and DevSecOps pipelines.
Hands-on exposure to: - Automated deployments
Code quality validation
Security scanning
Vulnerability management
Release automation
Tools: GitLab CI, Jenkins, GitHub Actions , or equivalent.

Containers & Kubernetes

Strong experience with: - Docker
Kubernetes
EKS
Container orchestration
Cloud-native operational practices

Event-Driven Platforms

Strong experience supporting event-driven architecture and messaging platforms such as: - Kafka
AWS MSK
RabbitMQ
Equivalent messaging technologies

Identity & Access Management

Strong understanding of: - IAM
RBAC
OAuth2
OpenID Connect
SAML
SSO
Enterprise federation patterns

Observability & Monitoring

Experience implementing monitoring, logging, tracing, and alerting solutions using: - CloudWatch
Grafana
Datadog
Prometheus
OpenTelemetry
ClickHouse

Security, Compliance & Automation

Strong understanding of cloud security and compliance frameworks including: - Encryption at rest and in transit
Secrets management
Vulnerability management
Audit logging
Security monitoring
Secure software delivery practices
Strong scripting and automation experience using: - Python
Bash
PowerShell
Similar scripting technologies

FinOps

Experience with FinOps practices including: - Cloud cost optimization
Resource utilization analysis
Tagging strategies
Budget governance
Cost reporting

Required Qualifications

Bachelor’s degree in Computer Science, Engineering, Information Technology , or related discipline.
7+ years of experience in DevOps, Platform Engineering, Cloud Infrastructure, or related roles.
4+ years of hands-on experience designing and operating AWS-based cloud platforms.
Experience supporting highly available, secure, and scalable distributed systems in production environments.
Strong experience working in Agile delivery environments with cross-functional engineering teams.
Strong problem-solving and troubleshooting skills with production support experience.

Nice to Have

Certifications such as: - AWS Certified DevOps Engineer – Professional
AWS Solutions Architect
AWS Security Specialty
CKA / CKAD
Equivalent cloud / Kubernetes certifications
Experience implementing SRE practices , including: - SLIs
SLOs
Error budgets
Operational excellence frameworks
Experience with multi-account AWS governance, Control Tower, landing zones, and enterprise cloud operating models.
Strong exposure to large-scale enterprise integration or Quote-to-Cash platforms.