- Location
- Montréal · Montréal, Quebec, Canada
- Department
- Science
- Source
- Greenhouse
Description
Nous sommes à la recherche d’une personne visionnaire et dotée de solides compétences techniques pour occuper le poste de développeur.se sénior de plateforme de données d’apprentissage automatique. Dans ce rôle, vous serez responsable d’architecturer, de mettre en œuvre, de faire évoluer et d'entretenir le moteur de données qui alimente nos modèles de pointe de nouvelle génération.
Dans ce poste à fort impact, vous assurerez la jonction entre la recherche de pointe en intelligence artificielle et l'ingénierie haute performance, en traitant la plateforme de données comme un produit interne dont les chercheurs.es sont les principaux clients. Vous ferez la gestion de pipelines de traitement de données automatisés à l'échelle du pétaoctet et veillerez à ce que chaque résultat soit efficace, fiable et entièrement traçable. Notre environnement technique n’est pas figé et évoluera au rythme de la croissance de nos projets. Nous recherchons une personne capable de le faire évoluer, non seulement en suivant les tendances de l'industrie, mais aussi en remettant en question l'existant et en prenant des décisions durables, en étroite collaboration avec nos équipes de recherche et de produits.
Responsabilités principales
-
Optimiser et automatiser la chaîne de traitement des données pour gérer des pétaoctets de données et en assurer le bon fonctionnement.
-
Concevoir la couche d'exécution pour les différentes étapes des pipelines selon leur profil de calcul, en associant chaque étape au moteur approprié et en maintenant le pipeline à pleine capacité du début à la fin.
-
Garantir l'utilisation efficace des ressources informatiques, y compris l'accès aux processeurs graphiques (GPU) pour les tâches de traitement de données exigeantes en puissance de calcul.
-
Assurer la fiabilité des pipelines à grande échelle grâce à une reprise sur panne fluide, une capacité de redémarrage et une observabilité permettant d'attribuer les goulots d'étranglement et les coûts à l'étape responsable.
-
Garantir que tous les jeux de données, y compris les sorties intermédiaires de chaque étape de transformation, soient versionnés, reproductibles et entièrement traçables afin de répondre aux besoins expérimentaux précis et dynamiques, et qu'ils soient accompagnés de fiches techniques (datasheets) conformément aux politiques internes de gouvernance des données.
-
Collaborer avec l'équipe de recherche pour veiller à ce que les jeux de données produits s'intègrent de manière transparente aux pipelines d'entraînement.
Compétences et qualifications requis
-
Diplôme universitaire de premier cycle (baccalauréat) dans un domaine pertinent (p. ex., informatique, génie informatique, génie logiciel) obligatoire.
-
Plus de 5 ans d'expérience dans la conception, la mise en œuvre et la gestion de systèmes de traitement de données distribués à grande échelle, ou dans le travail avec des cadres de traitement de données d'apprentissage automatique distribués à grande échelle, avec une expérience récente d'outils tels que Ray, Apache Spark, des orchestrateurs de flux de travaux, Apache Arrow ou Parquet.
-
Preuve d'autonomie et de prise en charge d'un système de traitement de données soumis à de fortes contraintes de débit, de fiabilité et de coûts. Les outils précis importent moins que votre capacité démontrée à analyser les points de rupture d'un pipeline d'envergure et à en comprendre les causes.
-
Expérience dans le profilage et l'optimisation du débit et des coûts pour des charges de travail hétérogènes, y compris les étapes accélérées par GPU.
-
Expérience avec les outils de versionnage des jeux de données, de traçabilité (lineage) et de reproductibilité.
-
Capacité à collaborer efficacement avec des équipes multidisciplinaires, à documenter les meilleures pratiques et à vous maintenir à jour quant aux dernières avancées en matière de traitement de données à grande échelle et de développement logiciel.
-
Expérience avec des gestionnaires de charges de travail (p. ex., Ray, Kubernetes, Slurm).
-
Connaissance des outils de conteneurisation (p. ex., Docker, Enroot).
-
Connaissance des infrastructures et plateformes de données (p. ex., bases de données vectorielles).
À propos de LoiZéro
LoiZéro est une organisation à but non lucratif dédiée à faire progresser la recherche et à développer des solutions techniques permettant de concevoir des systèmes d'IA sécuritaires. Son approche scientifique repose sur de nouvelles recherches et méthodes proposées par le professeur Yoshua Bengio, le chercheur en IA le plus cité au monde. Basée à Montréal, LoiZéro mène des recherches pour concevoir des systèmes d’IA non agentiques qui apprennent à comprendre le monde plutôt qu'à y intervenir, en répondant de manière véridique aux questions posées sur la base d'un raisonnement probabiliste transparent et extériorisé. De tels systèmes d'IA pourraient être utilisés pour accélérer la découverte scientifique, superviser les systèmes d'IA agentiques et faire progresser notre compréhension des risques de l'IA et des moyens de les éviter. LoiZéro croit que l’IA doit être considérée comme un bien public mondial, développée et utilisée de manière sécuritaire pour favoriser l’épanouissement humain. Plus d’information : www.loizero.org
Vous avez votre place ici
À LoiZéro, la diversité nous tient à cœur. Nous valorisons un environnement de travail équitable, ouvert et respectueux des différences. Nous encourageons les candidatures de personnes hautement qualifiées désireuses de travailler à la réalisation de notre mission dans un cadre respectueux, inclusif et collaboratif.
Vos informations personnelles seront collectées et traitées par LoiZéro afin d'évaluer votre demande d'emploi conformément à notre politique de vie privée. En vertu des lois sur la protection de la vie privée en vigueur dans votre pays de résidence, vous pouvez disposer de plusieurs droits en matière de protection de la vie privée, comme celui de demander l'accès à vos informations personnelles ou de demander que vos informations personnelles soient rectifiées ou effacées. Vous trouverez des détails sur la manière dont vous pouvez exercer vos droits dans notre politique de protection de la vie privée.