Hiring.Camp

SRE COMPUTE

Thales

·

Today

Location
PARIS 9ème, France
Workplace
Hybrid
Type
Full-time
Department
IT
Source
Workday

Description

QUI SOMMES-NOUS ?

S3NS est né du partenariat industriel entre Thales, leader mondial de la cyber sécurité, et Google Cloud, leader mondial des solutions cloud. Nous avons pour ambition d’offrir le meilleur des deux mondes à l’ensemble des organisations soucieuses de protéger leurs données sensibles (institutions publiques, OIV, OSE…). C’est-à-dire une solution équivalente à Google Cloud Platform (incluant à la fois les services IaaS et PaaS de GCP) et respectant les exigences du label SecNumCloud.


Une première offre, ‘Contrôles locaux avec S3NS’, est déjà disponible depuis février 2023 pour permettre à nos clients de bénéficier d’un premier niveau de transparence et contrôles additionnels, et d'accélérer la trajectoire vers le cloud de confiance.

Votre Quotidien

En tant qu'Ingénieur(e) SRE Compute, votre mission sera au cœur de l'exploitation de notre univers GCP : 

  • Vous serez responsable du maintien en condition opérationnelle, de l'exploitation et de la gestion de l'ensemble des plateformes Compute (GCE, GKE, Vertex AI…), au sein d'un environnement équivalent à l'univers GCP.

  • Vous gérerez les incidents de production 24h/24 et 7j/7, et développerez une compréhension approfondie des services techniques qui constituent l'épine dorsale des services GCP utilisés par des millions de clients. 

  • Grâce à notre partenariat privilégié, Google nous partage ses connaissances et vous ouvre les portes de sa pile technique interne (Borg, Colossus, Spanner, Sawmill, etc.). Vous bénéficierez d'un programme de formation accéléré et intensif, dispensé au contact direct des experts Google et de nos équipes S3NS déjà formées par leurs soins, pour maîtriser des technologies d'exception habituellement réservées aux ingénieurs internes de Google.

Responsabilités Clés :

  • Monitoring SLI/SLO : Surveiller la disponibilité, l'évolutivité, la latence et l'efficacité des services souverains GCP liés au COMPUTE en traitant les incidents de production. 

  • Gestion d'Infrastructure : Gérer le parc de machines et les stacks de compute sous-jacentes (Borg et les différents control plane de Google) pour garantir une performance optimale.

  • Diagnostic et Résolution d'incidents : Garantir la fiabilité maximale de la plateforme. Afin d'assurer un maintien en condition opérationnelle 24/7 de notre cloud, le poste implique des permanences en journée ainsi que des astreintes de nuit par roulement.

  • Collaboration d'équipe : Collaborer avec des experts des services GCP à travers le monde pour aider à mitiger et à résoudre les incidents.

  • Automatisation & Connaissance : Documenter les connaissances pour s'assurer que tous les SRE S3NS travaillent avec la même information, standardiser les flux de résolution et améliorer les playbooks opérationnels.

  • Revues Post-incident : Après un incident, réunir les équipes pour effectuer un post-mortem, comprendre les causes, tirer des leçons et encourager l'amélioration continue. 

Conformément aux exigences de qualification SecNumCloud de nos services, délivrée par l'ANSSI, ce poste est soumis à des exigences de sécurité renforcées. Le candidat retenu devra se soumettre à une enquête de sécurité menée par nos services, conformément à notre politique de sécurité du personnel. 

Votre Profil 

Ce qui vous passionne et vous motive : 

  • L'innovation technologique, le Cloud, et l'exploitation de services et d'infrastructures en mode "as code"

  • L'excellence opérationnelle à grande échelle : L'exploitation et la haute disponibilité (≥ 99,99 %) de bases de données critiques et de moteurs analytiques à forte volumétrie.

  • L'ADN de l'ingénierie Compute chez Google : La curiosité d'explorer comment un hyperscaler gère des millions de cœurs et l'envie de maîtriser plus de 20 ans d'innovation en systèmes distribués (GCE, GKE, Borg, Colossus, Spanner, etc.).

  • L'impact au sein d'un collectif d'experts : La perspective de rejoindre une équipe spécialisée au cœur des enjeux Compute (parc de machines, control plane, virtualisation et orchestration).

Expérience : 

  • Diplômé(e) d'une école d'ingénieur ou titulaire d'un Master. 

  • Au moins 3 ans d'expérience en SRE et automatisation des opérations. Poste ouvert aux profils juniors justifiant d'une expérience significative en alternance dans un périmètre similaire.

  • Exposition à un environnement international avec un bon niveau d’anglais requis.

  • Bonus: Une expérience précédente sur GCP est un plus mais votre soif d'apprendre notre propre Cloud est primordiale ! 

Le mot de l'équipe 

« Envie de rejoindre une équipe passionnée à taille humaine ? Intégrez notre équipe SRE Compute : un collectif de 7 ingénieurs au cœur du moteur de notre cloud de confiance. Votre mission est critique : piloter le parc de machines et les stacks de compute sous-jacentes (Borg, control plane). Si vous aimez l'infrastructure pure et les systèmes à grande échelle, venez faire vibrer votre expertise avec nous ! »

Skills

GCPSRE

Similar Jobs

24

Compute Platform Engineer, License Scheduling

Nvidia · Santa Clara, CA,US, US +1

4 days ago

Senior Infrastructure Automation Engineer, Compute Platform

Nvidia · Santa Clara, CA,US, US +1 · Hybrid

4 days ago

Senior Compute Platform Engineer, LSF 

Nvidia · US, CA, Santa Clara, United States of America +1 · Remote, Hybrid

4 days ago

Senior Infrastructure Automation Engineer, Compute Platform

Nvidia · US, CA, Santa Clara, United States of America +1 · Hybrid

4 days ago

Compute Platform Engineer, License Scheduling

Nvidia · US, CA, Santa Clara, United States of America +1

4 days ago

Senior Compute Platform Engineer, LSF

Nvidia · Santa Clara, CA,US, US +1 · Remote, Hybrid

4 days ago

Senior Software Engineer, Compute Platform Integration

Andurilindustries · Irvine, California, United States

5 days ago

Engineer – Cloud and Compute Platform Teams

Target · 7000 Target Pkwy N,NCD-0375 Brooklyn Park,MN 55445, United States of America

6 days ago

D&E - Virtual Compute Platform Software Engineer - Linkou

Asml · Linkou ASML Factory, Taiwan

3 weeks ago

Systems Engineer (Functional Safety) – Compute Platform Systems

Torcrobotics · Ann Arbor, MI +1

1 month ago

Site Reliability Engineer, Compute

Fluidstack · San Francisco, CA +3 · Onsite

1 month ago

Sr. Engineer – Cloud and Compute Platform Teams

Target · 7000 Target Pkwy N,NCD-0375 Brooklyn Park,MN 55445, United States of America

2 months ago

Compute Platform Engineer II

GSK · London The Stanley Building, United Kingdom · Remote

2 months ago

Senior Compute Platform Engineer

GSK · London The Stanley Building, United Kingdom · Remote

2 months ago

System Software Engineer, Robot Platform — GPU & Accelerated Compute

Sunday · Redwood City, CA · Onsite

3 months ago

Specialist Platform and Compute Engineer (Backup Focused)

Logicalis · Johannesburg, South Africa

3 months ago

Senior/Staff Systems Engineer - Compute Platform Verification and Validation

Zoox · Foster City, CA · Hybrid

7 months ago

Compute Platform System Safety Engineer

Zoox · Foster City, CA · Hybrid

7 months ago

Senior Software Engineer, Compute Platform

Moonlite · Chicago, IL or Remote · Remote

9 months ago

Staff ML Engineer, ML Compute Platform

General Motors · Mountain View Technical Center - Mountain View Technical Center, United States of America +1 · Hybrid

10 months ago

Senior Platform Engineer II, Compute Services

Coreweave · Remote

10 months ago

Software Engineer, Compute Platform

Replit · Foster City, CA (Hybrid) In office M,W,F · Hybrid, Onsite

1+ year ago

Platform and Compute Engineer

Logicalis · Cape Town, South Africa +1

1+ year ago

Sr. Computer Scientist (Data Platform Engineer)

Adobe · Bangalore, India

4 months ago