SMART
Acronyme de « self-monitoring, analysis and reporting technology » (technologie d'auto-surveillance, d'analyse et de rapport) : un système de surveillance inclus dans les disques durs et les SSD d'ordinateur afin de détecter et de signaler divers indicateurs de fiabilité du lecteur dans le but d'anticiper les pannes matérielles imminentes.
SMART : système d'alerte précoce intégré à votre disque
SMART signifie « Self-Monitoring, Analysis and Reporting Technology » (technologie d'auto-surveillance, d'analyse et de rapport). Il s'agit d'un système de surveillance au niveau du micrologiciel intégré aux disques durs (HDD) et aux disques SSD (Solid-State Drives) qui suit en permanence la santé physique et opérationnelle du support de stockage. Le disque lui-même collecte des données sur des dizaines d'attributs, tels que les taux d'erreur de lecture, les performances du temps de recherche, le temps de démarrage, la température et les comptes d'équilibrage d'usure, et les compare aux seuils du fabricant pour prédire une panne avant qu'elle ne se produise.
Chaque disque maintient un ensemble d'attributs surveillés, généralement numérotés de 1 à 255, bien que seul un sous-ensemble soit activement suivi en fonction du type de disque et du fabricant. Par exemple, l'attribut 5 suit le nombre de secteurs réalloués (mauvais secteurs remappés sur des secteurs de rechange), l'attribut 9 enregistre les heures de mise sous tension, et l'attribut 194 enregistre la température du disque en Celsius. Lorsque la valeur brute d'un attribut dérive vers son seuil de défaillance, SMART signale le disque comme dégradé ou critique. Le système n'empêche pas la défaillance ; il signale simplement la probabilité qu'une défaillance soit imminente, généralement dans les jours ou les semaines.
Limites et fiabilité
SMART est utile mais imparfait. Il prédit bien certains modes de défaillance, en particulier l'usure mécanique des disques durs et la dégradation des cellules flash des disques SSD, mais ne peut pas détecter les pannes soudaines causées par une défaillance du contrôleur, une corruption du micrologiciel ou un choc physique. Des études ont montré que les alertes SMART sont corrélées à la défaillance réelle du disque dans une fourchette de 50 à 80 %, selon le type de défaillance et l'implémentation du fabricant. Un disque peut tomber en panne sans avertissement, et inversement, un disque peut signaler un état critique et continuer à fonctionner pendant des mois. SMART est un outil de probabilité, pas une certitude.
La surveillance des données SMART est courante dans les centres de données et les environnements de serveurs. Les systèmes d'exploitation et les utilitaires tiers (tels que smartmontools sur les systèmes de type Unix, ou les outils spécifiques aux fabricants) lisent les attributs SMART via des commandes ATA ou SCSI standard et les enregistrent pour l'analyse des tendances. Les systèmes de surveillance automatisés peuvent déclencher des alertes lorsque les seuils sont dépassés, permettant aux administrateurs de planifier le remplacement ou la migration des données avant qu'une perte ne se produise. Les appareils grand public exposent rarement les données SMART aux utilisateurs, bien qu'elles puissent être consultées via un logiciel spécialisé.
La norme est ouverte : les spécifications ATA et NVMe définissent les ensembles d'attributs SMART et les formats de rapport, de sorte que tout disque conforme peut être interrogé par des outils standard. Cependant, les fabricants conservent une certaine flexibilité dans les réglages des seuils et la pondération des attributs, ce qui signifie que deux disques de marques différentes peuvent rapporter les mêmes valeurs brutes mais ne pas être d'accord sur l'état de santé général. Pour cette raison, les tendances au fil du temps sont plus importantes que les chiffres absolus lors du diagnostic de l'état du disque.
Sources
- Source de la définitionWiktionary