Le travail ennuyeux qui évite 80 % des incidents. Ces guides traitent des correctifs sans surprise, des sauvegardes qui existent vraiment, des certificats qui n'expirent pas en silence et d'une page de statut que vos clients peuvent lire eux-mêmes.
Une page de statut sur le même serveur que le service qu'elle décrit est hors ligne quand vous en avez besoin. Voici la configuration qui fonctionne : Uptime Kuma sur un VPS séparé et bon marché, des contrôles de l'extérieur en HTTP, TLS et TCP, une page publique sur status.votredomaine.be avec son propre certificat, des mises à jour d'incident postées depuis votre téléphone, et les détails DNS et cache qui décident si la page reste joignable quand le reste brûle.
Une mise à jour du noyau est la seule mise à jour de routine qui exige un redémarrage et qui peut laisser votre serveur bloqué. Voici la checklist que nous utilisons nous-mêmes : pré-vérifications (/boot, DKMS, Secure Boot), snapshot, installation, un repli GRUB qui choisit automatiquement l'ancien noyau après un démarrage raté, et la vérification après redémarrage. Dans une fenêtre de quinze minutes.
Let's Encrypt se renouvelle tout seul — jusqu'au jour où le hook échoue, la validation DNS casse ou quelqu'un a retiré le cron. Ce script trouve chaque certificat sur chaque port de chaque hôte (les internes aussi, le mail aussi, le reverse proxy dont plus personne ne se souvient), calcule les jours restants et pousse une alerte à 14 et 7 jours. Sans Nagios, sans service externe.
L'installation par défaut d'unattended-upgrades applique les correctifs de sécurité mais laisse les services tourner sur d'anciennes bibliothèques et le nouveau noyau sur le disque. Voici la configuration qui corrige cela pour Ubuntu 24.04 et Debian 12 : origines, liste noire, needrestart, politique de redémarrage, mail — plus le script cron qui signale quels hôtes attendent un redémarrage depuis des jours.
Une tâche de sauvegarde qui renvoie exit 0 prouve que la tâche a tourné — pas qu'il y a quelque chose d'utilisable dans l'archive. Trois contrôles à automatiser : fraîcheur (mtime), intégrité (restic/borg check) et un test de restauration mensuel qui se journalise lui-même. Plus le piège de rsync qui préserve les mtimes.