Blog · Monitoring
5 tâches critiques à monitorer avec Mortemain (et pourquoi)
Des dizaines de jobs tournent automatiquement sur vos serveurs. La question, c'est qui les surveille. Voici les cinq dont l'échec silencieux fait le plus mal, et la ligne qu'il faut à chacun.
Quand un job planifié s'arrête sans prévenir, les conséquences sont réelles : perte de données, processus métier bloqué, certificat expiré qui met un site hors ligne. Rien n'émet d'erreur, donc votre dashboard reste au vert. Un check-in Mortemain transforme chacun de ces cas en alerte. Commencez par ceux-ci.
1. Les sauvegardes
Une sauvegarde qui ne tourne pas, ce sont des données non protégées, et vous ne le saurez qu'au moment de la restauration, trop tard. Pinguez sur succès à la fin du job :
rsync -avz /data/ backup:/backups/data/ && curl -fsS -m 10 https://ping.mortemain.com/votre-uuid
Par outil : pg_dump · restic · Borg · toutes les sauvegardes
2. Les tâches cron
Nettoyage de logs, rafraîchissement de cache, envoi d'e-mails. Supprimez-en une par erreur ou laissez-la mourir en silence, personne ne le remarque. Ajoutez le ping à la ligne crontab :
0 3 * * * /usr/local/bin/report.sh && curl -fsS -m 10 https://ping.mortemain.com/votre-uuid
Voir le guide cron et le pas-à-pas en 3 étapes.
3. Les pipelines CI/CD
Un pipeline qui échoue bloque les déploiements. Un pipeline qui ne se déclenche même pas est invisible pour votre outil de CI. Une étape finale qui s'exécute toujours comble le trou :
- name: Notify Mortemain if: always() # même en cas d'échec run: curl -fsS -m 10 https://ping.mortemain.com/votre-uuid
Par outil : GitHub Actions · GitLab CI · Jenkins
4. Les synchronisations de données (ETL, Airflow)
Une synchronisation qui s'arrête laisse vos systèmes silencieusement désynchronisés. Pinguez à la fin du script :
import requests requests.get("https://ping.mortemain.com/votre-uuid", timeout=10)
Par outil : Python · Airflow · Prefect · Dagster
5. Le renouvellement de certificats
Un certificat expiré met tout le site hors ligne, et les outils classiques ne détectent pas toujours un renouvellement en échec. Signalez le succès, ou /fail si le renouvellement échoue :
certbot renew --quiet && curl -fsS -m 10 https://ping.mortemain.com/votre-uuid \ || curl -fsS -m 10 https://ping.mortemain.com/votre-uuid/fail
Lesquelles surveiller en premier
Priorisez les tâches qui :
- n'ont aucune redondance : si elles tombent, rien ne prend le relais ;
- sont critiques pour le business (sauvegardes, paiements, facturation) ;
- s'exécutent sans supervision humaine (cron, CI/CD) ;
- peuvent échouer en silence, sans logs ni erreur.
Choisissez-en une, ajoutez son check-in, puis simulez une panne pour vérifier que l'alerte arrive. Essayez Mortemain gratuitement (20 checks, sans carte bancaire).