All jobs
RemoteListed Jul 22, 2026

Site Reliability Engineer Sr.

Acciona IT

  • Cloud-Infrastructure
  • DevOps
  • Platform-Engineering
  • Principal-Site-Reliability-Engineer
  • SRE
  • Senior-Site-Reliability-Engineer
  • Senior-Site-Reliability-Engineering-Architect
  • Site-Reliability-Engineering
  • Site-Reliability-Engineering-Lead
  • Site-Reliability-Engineering-Manager
  • Staff-Site-Reliability-Engineer-(SRE)

Assessed from original listing evidence

The role

Job description

Site Reliability Engineer Sr. (SRE)

Ubicación

  • 100% Remoto

Proyecto

  • Asignación para proyecto internacional con equipo de Estados Unidos.
  • Ambiente altamente colaborativo y orientado a la confiabilidad, automatización y escalabilidad de plataformas críticas.

Idioma

  • Inglés avanzado (oral y escrito) excluyente.

Sobre la posición

Buscamos un/a Site Reliability Engineer Sr. (SRE) con sólida experiencia en infraestructura cloud, automatización, observabilidad y gestión de entornos productivos. La persona será responsable de garantizar la confiabilidad, disponibilidad, escalabilidad y rendimiento de las plataformas, trabajando estrechamente con equipos de desarrollo e infraestructura.

Requisitos

Experiencia

  • Más de 5 años de experiencia en posiciones de Site Reliability Engineering, DevOps o Infraestructura.
  • Experiencia trabajando en entornos de producción críticos.
  • Experiencia en gestión y resolución de incidentes.
  • Conocimientos sólidos de administración de sistemas Linux/Unix.

Formación

  • Título universitario en Ciencias de la Computación, Ingeniería o carreras afines.

Conocimientos técnicos

  • Cloud Platforms: AWS, Azure o Google Cloud Platform.
  • Infraestructura como Código (IaC), preferentemente Terraform.
  • Automatización y scripting con Python, Bash o tecnologías similares.
  • Contenedores y orquestación: Docker y Kubernetes.
  • CI/CD: Jenkins, GitHub Actions, GitLab CI o herramientas equivalentes.
  • Implementación y gestión de soluciones de monitoreo, logging y alertas.
  • Conocimientos de sistemas distribuidos, networking y diseño de arquitecturas escalables.
  • Experiencia trabajando con métricas de confiabilidad como SLIs, SLOs y SLAs.

Principales responsabilidades

Automatización y eficiencia operativa

  • Automatizar procesos operativos, despliegues, aprovisionamiento y monitoreo.
  • Desarrollar scripts y herramientas internas.
  • Diseñar, implementar y optimizar pipelines de CI/CD.
  • Reducir tareas manuales y repetitivas mediante automatización.

Gestión de infraestructura cloud

  • Provisionar y mantener infraestructura en AWS, Azure o GCP.
  • Gestionar infraestructura mediante Terraform u otras herramientas IaC.
  • Garantizar escalabilidad, resiliencia y alta disponibilidad.
  • Implementar mecanismos de auto-scaling y self-healing.

Confiabilidad y performance

  • Monitorear aplicaciones e infraestructura mediante métricas, logs y trazas.
  • Definir y mejorar indicadores de servicio (SLIs, SLOs y SLAs).
  • Realizar análisis de rendimiento y optimización de sistemas.
  • Ejecutar actividades de capacity planning.

Gestión de incidentes

  • Participar activamente en incidentes críticos de producción.
  • Realizar troubleshooting y resolución de problemas complejos.
  • Liderar análisis de causa raíz (RCA).
  • Impulsar acciones de mejora continua para prevenir recurrencias.

Observabilidad

  • Implementar y administrar herramientas de monitoreo y alertamiento.
  • Diseñar dashboards e indicadores de salud de aplicaciones y plataformas.
  • Mejorar la visibilidad end-to-end de los sistemas.

Colaboración con equipos de desarrollo

  • Trabajar junto a equipos de ingeniería para mejorar arquitectura y despliegues.
  • Promover buenas prácticas de código resiliente y escalable.
  • Integrar prácticas DevOps y SRE dentro del ciclo de desarrollo.

Resiliencia y continuidad operativa

  • Implementar prácticas de Chaos Engineering.
  • Ejecutar pruebas de carga y estrés.
  • Garantizar estrategias de Disaster Recovery y planes de contingencia.

Gobernanza y buenas prácticas

  • Definir estándares operativos y de confiabilidad.
  • Documentar procesos, procedimientos y arquitecturas.
  • Promover y garantizar prácticas de seguridad bajo enfoques DevSecOps.

Originally posted on Himalayas

Keep exploring