Start Your Search Here

Job Search

TALYCAP GLOBAL SAS

Bogotá Ciudad / Global

Líder de Site Reliability Engineering (SRE)

Job Description

¡Buscamos Líder de Site Reliability Engineering (SRE)!

¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?

Objetivo del rol: Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.

Requisitos del perfil Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.

Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.

Conocimientos obligatorios: Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud

DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura

Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core

Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores

ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP

Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering

Conocimientos deseables: Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP

Competencias personales Liderazgo estratégico de equipos multidisciplinarios.

Pensamiento analítico orientado a la confiabilidad operativa.

Capacidad de toma de decisiones bajo escenarios críticos.

Comunicación efectiva con áreas técnicas y de negocio.

Orientación a la mejora continua y la innovación tecnológica.

Responsabilidades principales Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.

Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.

Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.

Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.

Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.

Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.

Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.

Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.

Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.

Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.

Condiciones laborales Ubicación: Hibrido (Sopó 4x1)

Tipo de contrato: Nomina

Horario: Tiempo completo

Salario: A convenir

#J-18808-Ljbffr

Aplicar Now

Similar Opportunities

View all jobs