Español
Electrónica industrial

SMART

Acrónimo de self-monitoring, analysis and reporting technology: un sistema de monitoreo incluido en los discos duros y SSD de las computadoras para detectar e informar varios indicadores de la fiabilidad de la unidad con la intención de anticipar fallas inminentes del hardware.

SMART: sistema de alerta temprana integrado en su unidad

SMART significa Tecnología de Auto-Monitoreo, Análisis y Reporte. Es un sistema de monitoreo a nivel de firmware integrado en las unidades de disco duro (HDD) y las unidades de estado sólido (SSD) que rastrea continuamente la salud física y operativa del medio de almacenamiento. La propia unidad recopila datos sobre docenas de atributos, como tasas de error de lectura, rendimiento del tiempo de búsqueda, tiempo de giro, temperatura y recuentos de nivelación de desgaste, y los compara con los umbrales del fabricante para predecir fallas antes de que ocurran.

Cada unidad mantiene un conjunto de atributos monitoreados, típicamente numerados del 1 al 255, aunque solo un subconjunto se rastrea activamente dependiendo del tipo de unidad y del fabricante. Por ejemplo, el atributo 5 rastrea el recuento de sectores reasignados (sectores defectuosos reasignados a repuestos), el atributo 9 registra las horas de encendido y el atributo 194 registra la temperatura de la unidad en grados Celsius. Cuando el valor bruto de un atributo se desvía hacia su umbral de falla, SMART marca la unidad como degradada o crítica. El sistema no previene la falla; simplemente informa la probabilidad de que una sea inminente, generalmente en cuestión de días o semanas.

Limitaciones y fiabilidad

SMART es útil pero imperfecto. Predice bien ciertos modos de falla, particularmente el desgaste mecánico en los HDD y la degradación de las celdas flash en los SSD, pero no puede detectar fallas repentinas causadas por fallas del controlador, corrupción del firmware o golpes físicos. Los estudios han demostrado que las alertas SMART se correlacionan con la falla real de la unidad en un rango del 50 al 80 por ciento, dependiendo del tipo de falla y la implementación del fabricante. Una unidad puede fallar sin previo aviso y, a la inversa, una unidad puede reportar un estado crítico y seguir funcionando durante meses. SMART es una herramienta de probabilidad, no de certeza.

El monitoreo de datos SMART es rutinario en centros de datos y entornos de servidores. Los sistemas operativos y las utilidades de terceros (como smartmontools en sistemas tipo Unix, o herramientas específicas del fabricante) leen los atributos SMART a través de comandos ATA o SCSI estándar y los registran para su análisis de tendencias. Los sistemas de monitoreo automatizados pueden activar alertas cuando se superan los umbrales, lo que permite a los administradores programar el reemplazo o la migración de datos antes de que ocurra una pérdida. Los dispositivos de consumo rara vez exponen los datos SMART a los usuarios, aunque se puede acceder a ellos a través de software especializado.

El estándar es abierto: las especificaciones ATA y NVMe definen los conjuntos de atributos SMART y los formatos de informe, por lo que cualquier unidad compatible puede ser consultada por herramientas estándar. Sin embargo, los fabricantes conservan flexibilidad en la configuración de umbrales y la ponderación de atributos, lo que significa que dos unidades de diferentes marcas pueden reportar los mismos valores brutos pero discrepar sobre el estado general de salud. Por esta razón, las tendencias a lo largo del tiempo importan más que los números absolutos al diagnosticar la condición de la unidad.

Fuentes

Entrada IG734624/11/2010

Más de Electrónica industrial

Ver todo

Reciba la palabra del día

Un término industrial cada día, con el oficio al que pertenece y por qué vale la pena conocerlo. Sin publicidad.