Para os administradores do sistema:O XRISS DDR4 32GB 2666MHz RDIMM ECC é um módulo de substituição e expansão para o ecossistema de memória de servidor ECC registrado em DDR4.Abaixo estão os procedimentos de verificação e monitoramento que recomendamos para implantação empresarial.
Este RDIMM usa ICs DRAM x4-organizados com ECC completo de 72 bits (64 dados + 8 ECC).que permitam a operação a velocidade máxima com todos os canais de memória abertos. Cada módulo passa por um ensaio de queima de 72 horas a 55 °C com ensaio contínuo de injecção de erro ECC antes da expedição,garantir que não só os IC DRAM, mas também o chip de registo e os caminhos de sinal associados sejam fiáveis em condições térmicas de centro de dados sustentadas.
Para clusters VMware vSphere, este módulo foi validado em configurações vSAN all-flash, onde erros de memória podem corromper a camada de cache vSAN.A proteção ECC garante que os cálculos da soma de verificação no cache ARC sejam verificáveis. Para servidores de banco de dados de metal nu executando PostgreSQL ou MySQL com grandes pools de buffer,O ECC impede o cenário de corrupção de dados silenciosos em que um erro de um único bit no pool de buffer se propaga para o disco durante o próximo ponto de verificação.
Q1. Como monitorar as taxas de erro ECC em um servidor Linux em execução para detectar problemas de memória antes que eles causem tempo de inatividade?
R: Instalar e configurar rasdaemon (RAS - Reliability, Availability, Serviceability daemon) que está disponível nos repositórios de todas as principais distribuições Linux.`ras-mc-ctl --summary` mostra o número de erros corrigíveis e não corrigíveis por DIMMUm único erro corrigível por mês é normal e esperado devido à radiação de fundo.uma tendência crescente de 1 erro/mês para 1 erro/semana para 1 erro/dia indica uma célula DRAM em degradação e o módulo deve ser substituído proativamenteA maioria dos BMCs de servidor (iDRAC, iLO, XClarity) também rastreia erros de memória e pode ser configurada para enviar armadilhas SNMP ou alertas de e-mail quando as taxas de erro corrigíveis excedem os limiares configuráveis.Para o VMware ESXi, o monitoramento de estado do hardware do vCenter fornece funcionalidades equivalentes através do fornecedor do CIM.
P2. Pode este RDIMM ser usado em uma placa-mãe de desktop de consumo que suporta ECC (como algumas placas ASRock ou ASUS)?
R: Não. Os RDIMM (DIMM registrados) são electricamente incompatíveis com as placas-mãe de computadores de escritório.O chip buffer registrado no módulo requer suporte específico do controlador de memória e BIOS, que está presente apenas em plataformas de servidor e estação de trabalho (Intel Xeon E5/E7/Scalable, AMD EPYC e algumas séries Intel Xeon E-2300 com chipset C256).As placas-mãe de consumo que anunciam suporte a ECC (normalmente AMD AM4/AM5 com processadores Ryzen não APU) exigem ECC UDIMMs (DIMMs sem buffer com ECC), não RDIMMs. O nosso produto ECC UDIMM (55610999) é o módulo correto para essas plataformas. Instalar um RDIMM em um slot UDIMM resultará em uma condição sem POST e sem danos,Mas o sistema simplesmente não vai arrancar.
Q3. Qual é a diferença entre a organização de DRAM x4 e x8 para a memória do servidor, e por que isso importa?
A: organização x4 significa que cada chip DRAM contribui com 4 bits para cada palavra de dados, exigindo 18 chips para uma palavra ECC de 72 bits (64 dados + 8 ECC). organização x8 usa 8 bits por chip, exigindo apenas 9 chips.A organização x4 é padrão para a memória do servidor empresarial porque fornece resistência superior à falha do chip: se um chip x4 falhar completamente, apenas 4 bits de dados são afetados, e o motor ECC pode teoricamente corrigir isso (um "chipkill" ou capacidade SDDC).que exceda a capacidade de correção ECC de 8 bits e resulte num erro incorrigívelEste módulo usa ICs DRAM x4-organizados, razão pela qual é adequado para implantações de servidores de missão crítica onde é necessária resiliência à falha de um único chip.
Q4. Nosso servidor tem sido executado por 3 anos sem um único erro ECC. Isso significa que o ECC não está realmente fazendo nada?
R: Não significa que o ECC está a funcionar perfeitamente e corrigindo silenciosamente erros que nunca precisa de saber.um sistema a nível do mar com 256 GB de experiências DDR4 aproximadamente 0.5-2 erros corrigíveis por dia em média.(1) Seu monitor não está configurado para relatar erros corrigíveis (verifique a configuração do rasdaemon), (2) seu servidor está em um ambiente de baixa radiação de fundo (data center subterrâneo, gabinete revestido de chumbo), (3) seu lote específico de DRAM tem características de erro melhores do que a média,ou (4) os erros estão simplesmente abaixo do limiar de comunicação da sua configuração de monitorização específicaA ausência de erros notificados não é prova de que o ECC é desnecessário, mas sim de que o sistema funciona correctamente.A primeira vez que você vê um erro incorrigível que o ECC detecta (evitando a corrupção de dados silenciosos que poderiam derrubar um banco de dados ou sistema de arquivos) é quando o valor do ECC se torna tangível.
P5. Posso usar este módulo para expandir a memória em um servidor Dell PowerEdge que atualmente usa memória certificada pela Dell?
R: Sim, a mistura de XRISS RDIMMs com memória certificada pela Dell é suportada, embora para um desempenho ideal, recomendamos seguir as diretrizes de população do seu servidor para configurações equilibradas.Principais consideraçõesSe a sua memória existente for de 2666 MHz, este módulo funcionará a 2666 MHz; se a memória existente for de 2400 MHz, todos os módulos operarão a 2400 MHz;(2) Combinar a organização de classificação (uniclasse vs.. duplo nível), sempre que possível, uma vez que a mistura de níveis pode afectar a interligação de memórias;(3) Os servidores Dell PowerEdge podem registar um evento não crítico "memória não certificada Dell detectada" no log do controlador de ciclo de vida.A política de garantia da Dell não exige o uso de memória certificada pela Dell.