19 jun.
<p>Os valores de endurance estão entre as especificações mais frequentemente mal interpretadas numa ficha técnica de SSD. Dois discos com capacidade idêntica e resultados de benchmark quase idênticos podem apresentar limites de escrita que diferem por um fator de dez, e a diferença de preço entre eles só se torna compreensível quando se entende o que esses limites realmente prometem. Para quem especifica armazenamento para workstations, hosts de virtualização ou uma frota inteira de equipamentos, TBW e DWPD são os indicadores que decidem se um disco se reforma após uma década de serviço ou se esgota a sua garantia ao fim de dezoito meses.</p><p>Este artigo explica como funciona o desgaste do flash ao nível do silício, como são derivados os dois principais indicadores de endurance, porque é que a vida útil real é frequentemente melhor do que a ficha técnica indica, e como verificar a vida útil restante de discos já em utilização.</p><h2>Porque é que a NAND flash tem um orçamento de escrita limitado</h2><p>Uma célula NAND armazena informação ao capturar eletrões atrás de uma fina camada isolante de óxido. Cada operação de programação e apagamento força carga através desse isolador, e cada passagem danifica-o microscopicamente. Após suficientes ciclos de programação/apagamento (ciclos P/E), a célula deixa de conseguir reter uma carga estável, as taxas de erro aumentam, e o controlador desativa permanentemente o bloco afetado. Isto não é um defeito de fabrico – é a física fundamental das memórias charge-trap e floating-gate.</p><p>Quantos ciclos uma célula tolera depende principalmente de quantos bits armazena. Células mais densamente compactadas utilizam janelas de tensão mais estreitas e, por isso, desgastam-se mais rapidamente:</p><ul><li><strong>SLC</strong> (1 bit por célula) – cerca de 60.000 a 100.000 ciclos P/E; hoje limitado a nichos industriais e de caching</li><li><strong>MLC</strong> (2 bits por célula) – cerca de 3.000 a 10.000 ciclos</li><li><strong>TLC</strong> (3 bits por célula) – tipicamente 1.000 a 3.000 ciclos; o padrão mainstream tanto para discos de cliente como empresariais</li><li><strong>QLC</strong> (4 bits por célula) – cerca de 300 a 1.000 ciclos; posicionado para cargas de trabalho intensivas em leitura e orientadas à capacidade</li></ul><p>O empilhamento 3D-NAND moderno, uma correção de erros mais forte e algoritmos de wear leveling prolongam consideravelmente estes números brutos, razão pela qual a endurance é garantida ao nível do disco e não prometida por célula.</p><h2>TBW: o volume total de escrita</h2><p>TBW (terabytes written) indica a quantidade cumulativa de dados do host que o fabricante garante que o disco consegue absorver antes de terminar a cobertura de garantia por desgaste. Escala com a capacidade, uma vez que um disco maior tem mais células pelas quais o controlador pode distribuir as escritas. Uma linha de produto TLC representativa poderia especificar 300 TBW para o modelo de 500 GB, 600 TBW para 1 TB e 1200 TBW para 2 TB, enquanto um equivalente QLC da mesma capacidade pode oferecer cerca de metade disso.</p><p>Dois detalhes são frequentemente ignorados. Primeiro, TBW é um limiar de garantia, não um temporizador de autodestruição: ultrapassá-lo não desliga o disco, apenas termina a garantia do fabricante no que respeita ao desgaste. Segundo, a garantia é uma condição dupla – termina ou após o período indicado, habitualmente cinco anos, ou assim que o valor de TBW for atingido, consoante o que ocorrer primeiro. Um disco sujeito a escritas intensas 24 horas por dia pode, portanto, sair da garantia anos antes da data de calendário.</p><h2>DWPD: O mesmo orçamento, expresso por dia</h2><p>DWPD (drive writes per day) responde a uma outra questão de aquisição: quantas vezes pode a capacidade total do disco ser sobrescrita todos os dias, ao longo de todo o período de garantia? Os dois indicadores são matematicamente intercambiáveis – DWPD corresponde a TBW dividido pelo produto da capacidade do disco e do período de garantia em dias.</p><blockquote><p>Exemplo: Um SSD de data center de 1,92 TB com 3.504 TBW ao longo de uma garantia de cinco anos resulta em 3.504.000 GB ÷ (1.920 GB × 1.825 dias) ≈ 1,0 DWPD.</p></blockquote><p>O mercado empresarial segmenta os produtos de acordo com este número. Discos abaixo de 1 DWPD servem funções intensivas em leitura, como entrega de conteúdos e analítica. A classe de 1 a 3 DWPD abrange virtualização mista e tarefas gerais de base de dados. Classificações de 3 DWPD e superiores destinam-se a cargas de trabalho intensivas em escrita, como logging, camadas de caching e processamento de transações de alta frequência.</p><h2>Amplificação de escrita: porque as escritas do host não são escritas NAND</h2><p>O NAND pode ser escrito em pequenas páginas, mas só pode ser apagado em blocos muito maiores. Quando o controlador consolida dados válidos durante a garbage collection, reescreve internamente páginas existentes, de modo que a flash absorve mais dados do que o host alguma vez enviou. A relação entre ambos é o Write Amplification Factor (WAF). Uma carga de trabalho sequencial e compatível com TRIM pode atingir um WAF próximo de 1, enquanto escritas aleatórias pequenas e contínuas num disco quase cheio podem fazer o valor subir para 3 ou mais.</p><p>Os fabricantes respondem a isto com over-provisioning – NAND reservado, invisível para o sistema operativo, que dá espaço à garbage collection para trabalhar. Os modelos empresariais dedicam bastante mais área de reserva do que os discos de cliente, o que é uma razão pela qual os seus valores de endurance são mais elevados, mesmo quando a flash subjacente é idêntica. Não deixar permanentemente um disco de cliente cheio alcança um efeito mais suave do mesmo princípio, e sem custos.</p><h2>Um cálculo realista da vida útil</h2><p>Os dados de telemetria de ambientes de cliente mostram consistentemente que o uso comum de desktop e de escritório escreve muito menos do que a maioria dos compradores supõe – normalmente entre 10 e 40 GB por dia, com estações de trabalho de criação de conteúdo a atingir ocasionalmente 100 GB ou mais.</p><blockquote><p>Considere um disco de 2 TB com 1.200 TBW. Assumindo escritas diárias exigentes do host de 50 GB e um WAF conservador de 2, resultam 100 GB de escritas na flash por dia. 1.200.000 GB ÷ 100 GB = 12.000 dias – quase 33 anos de funcionamento ininterrupto.</p></blockquote><p>A conclusão prática: em cargas de trabalho de cliente, o esgotamento do NAND quase nunca é a razão para o fim de um disco. Falhas de controlador, erros de firmware e eventos de energia são causas de morte estatisticamente muito mais prováveis, o que desloca o foco de compra do TBW bruto para a qualidade geral de construção, a profundidade de validação e o historial do fabricante.</p><h2>Discos de cliente vs. discos de data center</h2><p>Se as margens de endurance são tão generosas, porque existe sequer o segmento empresarial? Porque a especificação abrange muito mais do que apenas o desgaste. Os modelos de data center garantem um desempenho estável sob carga mista contínua, incluem condensadores para proteção contra falhas de energia, que salvam dados em curso durante uma falha, e são validados para ciclos de funcionamento 24/7 a temperaturas elevadas. O seu comportamento de retenção também é especificado de forma diferente: a JEDEC exige que um disco de cliente sem energia conserve os dados durante um ano a 30 °C, enquanto as unidades empresariais trocam a retenção sem energia por margem de endurance em funcionamento contínuo.</p><p>Para clusters de virtualização, hosts de bases de dados e qualquer carga de trabalho com pressão de escrita contínua, um disco da <a href='https://distrinode.pt/ssd-empresariais'>categoria de SSD empresariais</a> com uma classe de DWPD adequada continua a ser a especificação correta, independentemente de quão impressionante um valor de TBW de um disco de cliente pareça no papel.</p><h2>Acompanhar o desgaste no terreno</h2><p>Todo o SSD moderno comunica o seu próprio consumo. Os discos NVMe apresentam um contador Percentage-Used, que indica diretamente a endurance consumida, juntamente com um atributo Data-Units-Written, que pode ser convertido em terabytes totais do host. Os modelos SATA publicam atributos SMART comparáveis, como Total Host Writes e um indicador de Wear-Leveling ou Media-Wearout.</p><p>Para frotas geridas, a regra operacional é simples: consulte estes contadores através da sua stack de monitorização, alerte num limiar sensato como 80 % da endurance nominal e planeie a substituição como manutenção de rotina em vez de intervenção de emergência. O desgaste anuncia-se com anos de antecedência; as falhas não planeadas vêm de outro lado, razão pela qual a disciplina de backup é mais importante do que qualquer valor de endurance.</p><h2>Perguntas frequentes</h2><h3>Uma classificação TBW mais elevada é sempre um indicador de uma unidade melhor?</h3><p>Não. O TBW reflete a resistência proporcionada, não a qualidade global. Uma unidade com um TBW modesto, mas com um controlador comprovado, cache DRAM e um histórico de firmware sólido é frequentemente a melhor compra para cargas de trabalho comuns. Trate o TBW como um requisito entre vários, ponderado de acordo com o seu volume real de escrita.</p><h3>As operações de leitura consomem resistência?</h3><p>Efetivamente, não. A leitura não força carga através da camada de óxido, como faz a programação. Existe um fenómeno chamado Read Disturb em leituras muito elevadas, mas os controladores gerem-no de forma transparente, atualizando os blocos afetados, e isso não reduz o orçamento de TBW.</p><h3>O DWPD é relevante fora do centro de dados?</h3><p>Raramente. Um dispositivo de escritório típico escreve uma pequena fração da capacidade da unidade por dia – muitas vezes o equivalente a 0,02 DWPD ou menos. A métrica só se torna significativa para cargas de trabalho de servidor contínuas, em que o volume diário de escrita representa uma fração significativa da capacidade total.</p><h3>Como posso verificar quanto o meu SSD já escreveu?</h3><p>Utilize o utilitário de dashboard do fabricante ou qualquer leitor SMART. Compare o total de escritas de host reportado com o TBW nominal da ficha técnica para obter uma percentagem consumida; as unidades NVMe simplificam isto através do campo integrado Percentage-Used.</p><h3>O que acontece no dia em que uma unidade ultrapassa o seu valor de TBW?</h3><p>Nada visível. A unidade continua a funcionar normalmente; apenas a obrigação de garantia relacionada com o desgaste caduca. Experiências independentes de resistência levaram SSD de consumo a um múltiplo do seu TBW nominal antes de ocorrer uma falha, embora a operação acima da classificação nominal seja, naturalmente, por sua conta e risco.</p><p>Os valores de resistência recompensam os compradores que os leem em contexto: adeque a classe DWPD à utilização em servidor, trate o TBW de cliente como um limite superior generoso e não como uma contagem decrescente, e deixe os dados de monitorização determinar os planos de substituição. Compare modelos e capacidades atuais na nossa <a href='https://distrinode.pt/discos-ssd'>gama de produtos SSD</a>, onde a classificação de resistência está indicada para cada modelo – na DistriNode consideramo-la parte da especificação principal, não letras pequenas.</p>
Deixar um comentário