Senior DevOps Engineer

Posted Sep 10

This is a fully remote position, open to applicants in New Jersey.

📋 Description

• Design, develop, and sustain scalable and secure infrastructure along with DevOps methodologies.

• Deploy and oversee scalable infrastructure within AWS and hybrid cloud settings.

• Manage infrastructure as code utilizing Terraform, CloudFormation, or comparable tools.

• Maintain environments based on Linux.

• Conceptualize and implement Docker containerization alongside Kubernetes orchestration.

• Design, deploy, and manage workloads for AI agents, encompassing compute provisioning and resource scaling for inference-intensive tasks.

• Construct and uphold AI model deployment pipelines, which include versioning, testing, and rollback to production.

• Monitor AI API usage and infrastructure expenses; establish alerting and usage controls.

• Enforce security guardrails at the infrastructure level for AI systems, such as access controls and data isolation.

• Oversee monitoring and observability through Prometheus, Grafana, and the ELK stack.

• Troubleshoot system problems and assist in incident response and root cause analysis activities.

• Enhance system reliability, performance, and uptime.

• Construct, maintain, and refine CI/CD pipelines utilizing Jenkins, Bitbucket CI/CD, or similar platforms.

• Automate builds, testing, deployments, and system updates.

• Integrate pipelines with Akkadian tools.

• Apply secure DevOps methodologies, security protocols, compliance initiatives, and vulnerability remediation strategies.

• Collaborate with DevOps, engineering, QA, and product teams during deployments and releases.

• Maintain thorough documentation regarding infrastructure, processes, and operations.

• Engage in team collaboration processes and initiatives for continuous improvement.


⛳️ Requirements

• Over 10 years of experience in DevOps or Site Reliability Engineering (SRE).

• Proficiency with AWS services, including EC2, ECS, S3, IAM, Lambda, and CloudWatch.

• Expertise in infrastructure as code tools, particularly Terraform and CloudFormation.

• Strong understanding of Linux environments.

• Experience with Docker and Kubernetes technologies.

• Proficient in scripting languages such as Python, Bash, or similar.

• Experience in building or maintaining CI/CD pipelines and associated tools.

• Familiarity with Prometheus, Grafana, and ELK for monitoring and observability purposes.

• Background in implementing secure DevOps practices and compliance frameworks like SOC2 and ISO.

• Experience in supporting AI or machine learning workloads and compute environments.

• Familiarity with AI model deployment pipelines and practices for model versioning.

• Knowledge of hybrid cloud or on-premises environments.

• Awareness of DevOps security best practices, particularly regarding AI-specific data isolation and access controls.

• Experience in supporting production systems and participating in on-call duties.


🏝️ Benefits

• Fully remote working environment.

• Medical insurance coverage.

• Dental insurance coverage.

• Vision insurance coverage.

• Company-sponsored life insurance.

• Company-sponsored disability insurance policies.

• 401(k) plan with a generous matching contribution.

• Paid time off.

People also viewed

Horizon3.ai1 day ago

Staff Site Reliability Engineer

US flagUnited States OnlyFull-timeDevOps & Site Reliability Engineer (SRE)$199.8k – $270k/year
ApplyView job
CLOUD MANTA GmbH1 day ago

Senior DevOps Engineer, Containers & Private Cloud

DE flagGermany OnlyFull-timeDevOps & Site Reliability Engineer (SRE)€70k – €80k/year
ApplyView job
Stefanini LATAM1 day ago

Senior DevOps

AR flagArgentina OnlyFull-timeDevOps & Site Reliability Engineer (SRE)
ApplyView job
Akamai Technologies1 day ago

Principal Site Reliability Engineer – Lead

PL flagPoland OnlyFull-timeDevOps & Site Reliability Engineer (SRE)
ApplyView job
PingWind Inc. (SDVOSB)1 day ago

DevSecOps Engineer

US flagAlabama, +1 more stateFull-timeDevOps & Site Reliability Engineer (SRE)
ApplyView job
Ad Hoc LLC1 day ago

Staff DevOps Engineer

US flagUnited States OnlyFull-timeDevOps & Site Reliability Engineer (SRE)$130k – $150k/year
ApplyView job

Never miss a great job!

Get handpicked remote jobs straight to your inbox weekly.

Trusted by 7,400+ designers