- Location
- São Paulo, Brazil · BR - SAO PAULO
- Department
- IT
Description
Sobre a área:
Somos responsáveis por manter a estabilidade e a continuidade do serviço em produção, garantindo resposta eficiente a incidentes e evolução contínua da operação. Nessa estrutura, a IA é utilizada para aumentar produtividade e assertividade na análise e resposta, mantendo governança, rastreabilidade e revisão humana para decisões críticas.
Atuamos com gestão de incidentes, observabilidade, análise de causa raiz (RCA/Problem Management), runbooks e automações, sempre transformando incidentes em aprendizado e backlog para as squads com decisões de release e mudança considerando prontidão operacional e risco.
A tecnologia no BTG é um dos pilares das grandes transformações do banco. Por isso, investimos continuamente nas ferramentas e práticas mais modernas do mercado.
Valorizamos a meritocracia e contamos com uma equipe versátil, colaborativa e engajada. Buscamos pessoas com mentalidade de dono, que sonham grande e são apaixonadas por aprender e compartilhar conhecimento.
No seu dia a dia:
- Atuará na gestão de incidentes: detecção, triagem, contenção, mitigação e recuperação, coordenando war room quando necessário e comunicando-se de forma estruturada com stakeholders;
- Evoluirá dashboards, alertas e instrumentação, melhorando a relação sinal/ruído e dando suporte a SLO/SLI e à visão de disponibilidade das plataformas;
- Conduzirá análises de causa raiz, identificando causas estruturais e recorrências e definindo ações corretivas/preventivas que retroalimentam o backlog das squads;
- Criará e manterá runbooks/playbooks, automatizará rotinas de mitigação e preparará readiness para janelas críticas, estratégias de rollback e procedimentos de contingência;
- Usará IA para acelerar diagnóstico, triagem, sumarização de incidentes e documentação, com senso crítico e validação das recomendações;
- Manterá gestão do conhecimento e evidências (documentação viva, postmortems, lições aprendidas), garantindo rastreabilidade para auditoria;
- Terá relacionamento próximo com áreas de negócio, PMs, squads de tecnologia e Risco/Compliance.
Esperamos de você:
- Formação superior completa em engenharia, ciências da computação ou áreas relacionadas;
- Forte capacidade de troubleshooting, conforto com ambientes produtivos e tratativa de incidentes, com experiência em logs, métricas e ferramentas de observabilidade;
- Tecnologias obrigatórias: Datadog (ou ferramenta equivalente de observabilidade), Azure, GitHub (issues, PRs, evidências técnicas), Confluence (runbooks, postmortems) e ferramentas de IA para operação (análise de logs, sumarização de incidentes, busca em conhecimento, recomendação de runbooks/ações);
- Tecnologias desejáveis: Kibana/Elastic, ServiceNow / Jira Service Management, Power BI, scripting/automação (Python, Shell) e ferramentas de AIOps (correlação de eventos, detecção de anomalia, redução de ruído);
- Disponibilidade para trabalhar no modelo híbrido no escritório de São Paulo.
Diferenciais:
- ITIL (Incident/Problem/Change Management), COBIT, fundamentos de SRE (SLO/SLI, error budget, incident command)
- Conhecimentos de IA aplicada (uso seguro, validação de resultados, privacidade/compliance, governança de prompts e rastreabilidade);
Benefícios:
- Participação nos Lucros e Resultados (PLR);
- Auxílio Alimentação e Refeição;
- Plano Médico;
- Plano Odontológico;
- Auxílio Creche/Babá;
- Vale Transporte;
- WellHub;
- TotalPass;
- Programa de Apoio Pessoal (EAP);
- Planos por adesão como Previdência Privada e Seguro de Vida;
- Desconto em Farmácia;
- Programa de Gestantes;
- Licença Maternidade e Paternidade Estendida – empresa Cidadã.