Analista Operações Cloud (SRE) | Pleno (13535)

Campinas, São Paulo, Brasil | Product Engineering | Full-time | Fully remote

Apply

Vaga 100% remota

Aqui a gente conecta o mundo 

Sensedia é uma multinacional brasileira provedora de plataforma de gerenciamento de APIs, governança de agentes e soluções de integração, além de serviços profissionais. A companhia impulsiona a transformação digital de grandes empresas habilitando arquiteturas mais ágeis, modernas e escaláveis, possibilitando assim que seus clientes ofereçam produtos e experiências digitais a todo o seu ecossistema.

Trabalhar aqui é pertencer a uma cultura plural, descontraída e inovadora. É para quem tem coragem de ir além, pensar e agir fora da caixa. Preferimos pedir desculpas ao invés de pedir permissão e estamos sempre dispostos a nos transformar, nos reinventar.
Nossas pessoas são incríveis e você pode fazer parte disso tudo. Nos comprometemos em garantir um ambiente de trabalho acolhedor e respeitoso.

Conheça + em nosso site: https://br.sensedia.com/sensedia-careers


Qual a missão do Cargo?

Garantir a disponibilidade, a observabilidade e a previsibilidade da plataforma API Management que sustenta, em produção, as APIs de nossos clientes. É um ambiente heterogêneo, em cloud (AWS, Kubernetes, Terraform), em que o API Gateway está no caminho crítico do negócio dos nossos clientes. Indisponibilidade ou degradação não é apenas inconveniência operacional: ela se propaga para todas as aplicações, canais e parceiros que consomem essas APIs, gerando impactos severos em fluxos produtivos. O desafio central é evoluir a operação de reativa para preventiva. Isso significa construir observabilidade que antecipe problemas, como saturação de capacidade, degradação de latência e erros por tenant. Significa também eliminar, por meio de automações, o trabalho manual repetitivo. A pessoa nesta posição será referência na operação da plataforma APIM, atuando junto de arquitetos cloud e de software, além de desenvolvedores, com responsabilidade compartilhada pelos ambientes em produção.

Quais serão suas atividades do dia-a-dia? 

  • Observabilidade e Monitoração Evoluir o monitoramento: Construir e aprimorar a monitoração de produção com o foco central em antecipar falhas antes que elas ocorram. Métricas de experiência: Definir e instrumentar indicadores que reflitam a experiência real do usuário (SLIs/SLOs), e não apenas a saúde do recurso (como uso de CPU ou disco). Limpeza de alertas: Reduzir ativamente o ruído e os alertas falsos positivos, garantindo que o time só seja acionado por problemas reais. Dashboards estratégicos: Manter painéis visuais que realmente sustentem decisões técnicas. 
  •  Automação e Redução de Toil (Trabalho Braçal) Fim do trabalho manual: Identificar e eliminar tarefas repetitivas ligadas a provisionamento, configuração e rotinas diárias. Infraestrutura como Código (IaC): Evoluir e manter a infraestrutura baseada em Terraform e Helm como a fonte única e absoluta de verdade. Desenvolvimento de scripts: Criar automações e ferramentas em Python e Shell para agilizar as operações recorrentes do time. Padronização: Converter procedimentos empíricos e não documentados em runbooks claros e executáveis.
  • Sustentação e Resposta a Incidentes Linha de frente de produção: Atuar diretamente na triagem, mitigação e resolução de incidentes quando a plataforma apresentar problemas. Cultura Blameless: Documentar e conduzir os post-mortems dos incidentes focando em descobrir a causa raiz e definir ações preventivas (investigar o sistema, não as pessoas). Atuação conjunta: Sustentar os ambientes em parceria diária com o time de engenharia de software. Controle de custos (FinOps): Acompanhar o consumo e os custos da infraestrutura

Quais são os requisitos obrigatórios para esse cargo? 

Experiência demonstrável, não familiaridade conceitual:

  • Kubernetes em Produção: Ter operado a ferramenta de fato, incluindo debug de pods, análise de consumo de recursos e entendimento dos modos de falha.
  • Cloud de Missão Crítica: Experiência em nuvem rodando ambientes críticos (a preferência da vaga é por AWS). 
  • Infraestrutura como Código (IaC): Capacidade de escrever e manter códigos usando Terraform e Helm, o que inclui realizar revisões (Code Review) das mudanças feitas por outras pessoas.
  • Monitoração (Prometheus e Grafana): Ter construído monitoração do zero (criação de métricas e regras de alerta), não apenas consumindo dashboards que já estavam prontos.
  • Troubleshooting Avançado em Linux: Autonomia para investigar e resolver problemas envolvendo serviços, processos, disco, rede e análise de logs.
  • Desenvolvimento de Automações: Ter criado automações em Python ou Shell que foram adotadas e usadas por outras pessoas do time.
  • Gestão de Incidentes: Experiência real participando de respostas a incidentes em produção, tendo clareza e bom julgamento sobre quando tentar resolver sozinho e quando escalar o problema.
  • Conhecimentos de Rede: Base sólida para investigação técnica, englobando segmentação de redes, DNS, TLS, VPN e uso de ferramentas de debug.

 

Quais serão os requisitos diferencias para este cargo? 

  • APIs: Vivência prática com APIs, padrão REST e ferramentas de API Gateway.
  • Gestão de Logs em Larga Escala: Experiência com ferramentas de centralização e análise de logs, como Elasticsearch, OpenSearch, Loki ou equivalentes.
  • CI/CD: Conhecimento na construção e manutenção de esteiras de integração e entrega contínuas (pipelines).
  • SLIs, SLOs e Error Budgets: Prática na definição de Service Level Indicators e Service Level Objectives, além do uso de "orçamento de erro" para guiar decisões técnicas.
  • Configuração como Código: Experiência com ferramentas de gerência de configuração, como Ansible ou similares.
  • Idioma: Inglês intermediário/técnico com capacidade para leitura de documentação técnica.

 

Aqui você vai encontrar:

  • Vale Refeição/Vale Alimentação (Cartão Flash benefícios), Plano de Saúde, Plano Odontológico, Seguro de Vida, PPR, TotalPass, Auxílio Creche, Programa Well-Being (destinado para saúde física e mental), Universidade Corporativa (nossa #SensediaAcademy), com diversas trilhas de desenvolvimento; Parceiros culturais e educacionais, com descontos especiais; Somos uma empresa cidadã,  proporcionando licença maternidade e licença paternidade estendida.

  • Temos #WorkWhereYouBelong como proposta de valor, que é um modelo flexível de trabalho que nos ajuda a aumentar o senso de pertencimento dos Sensediers.
    Trabalhe onde você pertence, porque as barreiras físicas estão menores, e o sentimento é de que exista apenas uma Sensedia em qualquer lugar que você esteja trabalhando.

Esta oportunidade também é para PCD! ;)


Suas experiências são compatíveis? Se candidate e venha conhecer a maior referência de APIs no Brasil! Queremos você em nossa equipe!!

 

  • Pensando em promover times cada vez mais diversos e ambientes de trabalho plurais, nossa missão é  mapear os diferentes públicos que alcançamos com ele! Por isso, faremos algumas perguntinhas relacionadas à diversidade*, tudo bem? =)
 
 *Os dados pessoais e dados pessoais sensíveis coletados serão tratados de acordo com a Lei Geral de Proteção de Dados - Lei n° 13.709/2018