Nous sommes Auchan Retail France, une entreprise de distribution de plus de [nombre non précisé] collaborateurs au service de millions de clients chaque année.
Ce que nous voulons, c'est aider nos clients à bien manger et vivre mieux, tout en préservant la planète. Que l'on soit en entrepôt, en magasin ou sur des fonctions support, notre point commun à tous, c'est de faire en sorte que nos clients aient plaisir à faire leurs courses chez nous. Parce que nos collaborateurs sont aussi nos premiers clients, nous veillons chaque jour à leur bien-être et leur évolution professionnelle.
Votre mission en tant que Site Reliability Engineer consiste à contribuer directement à la disponibilité, la performance et la fiabilité de notre cloud privé et des services managés qui y reposent. Rattaché(e) au Head of Infrastructures & Managed Services, vous participez activement au déploiement du modèle SRE au sein de la DSI.
Vos missions
Fiabilité & Exploitation
- Définir, mesurer et faire vivre les indicateurs SLO/SLI/SLA de vos périmètres applicatifs et d'infrastructure.
- Gérer les *error budgets* et arbitrer entre vélocité des changements et stabilité du service.
- Participer aux astreintes, à la gestion des incidents et à la résolution des pannes critiques.
- Animer et documenter les post-mortems dans une culture *blameless*, orientée apprentissage.
- Anticiper les risques via des exercices de *chaos engineering* et des tests de résilience.
Cloud Privé & Services Managés
- Concevoir, déployer et maintenir les briques d'infrastructure (compute, stockage, virtualisation, orchestration de conteneurs) en environnement hybride multi-datacenter.
- Automatiser l'exploitation via l'*Infrastructure as Code* (Terraform, Puppet ou équivalent) et les pratiques *GitOps*.
- Mettre en place et exploiter les outils d'observabilité (Prometheus, Grafana, Datadog ou équivalents) pour garantir une visibilité de bout en bout.
- Contribuer au cycle de vie complet des services managés (*build, run, improve*) et à la qualité de service associée.
- Développer des mécanismes de *self-healing* et réduire la charge opérationnelle manuelle (*toil*).
Sécurité & Amélioration continue
- Appliquer les principes de sécurité *by design* (durcissement des systèmes, gestion des secrets, conformité aux normes applicables au retail).
- Proposer et mettre en œuvre des optimisations techniques et des évolutions d'architecture.
- Documenter les procédures, *runbooks* et bonnes pratiques d'exploitation.
- Collaborer étroitement avec les équipes Réseau, Sécurité, Développement et Architecture pour garantir la cohérence du SI.
- Contribuer aux tableaux de bord et reportings de performance à destination des équipes techniques et du management.