La bibliothèque de modèles Scorecards offre un moyen simplifié de répondre aux cas d'utilisation d'ingénierie et commerciaux. En utilisant les bonnes pratiques des grandes entreprises, la bibliothèque offre des solutions aux défis d'ingénierie courants.
Chaque modèle de la bibliothèque est entièrement personnalisable pour répondre aux normes de votre organisation. Vous pouvez modifier les requêtes, les règles et les seuils pour adapter le Scorecards à vos besoins.
Certains modèles étiquettent leurs règles avec des niveaux de maturité (de L0 à L3).
Modèles de tableaux de bord
Objectif : vérifie si vos services sont prêts pour le déploiement en production en vérifiant les objectifs définis, la configuration des alertes et l'activité de déploiement récente.
Importance : permet de trouver les lacunes de préparation avant de déployer en production.
Prérequis :
Règles clés :
Defined SLOs: établit des cibles claires pour les performances et la fiabilité.
APM service alerts configuration: vérifie que les alertes sont définies pour une détection prompt des problèmes.
Recent deployments: vérifie les déploiements réussis au cours du mois dernier.
Runbook availability: confirme que des runbooks existent pour les conditions d'alerte déclenchées le mois dernier.
Objectif : évalue la fiabilité par rapport aux normes AWS en matière de sécurité et de redondance dans les opérations cloud.
Importance : vous aide à trouver des lacunes de fiabilité et de sécurité dans votre infrastructure cloud.
Prérequis : monitoring d'AWS de New Relic
Règles clés :
- EFS Encrypted check: confirme le chiffrement des volumes du système de fichiers Elastic (EFS).
- RDS Instance check retention period: vérifie les périodes de conservation des sauvegardes pour le service de bases de données relationnelles (RDS).
- RDS DeletionProtection check: vérifie la protection contre la suppression.
- RDS MultiAZ presence check: vérifie le déploiement sur plusieurs zones de disponibilité (MultiAZ).
- RDS AutoMinorVersionUpgrade check: confirme les mises à niveau automatiques des versions mineures.
Objectif : Évaluer l’allocation des ressources et les améliorations des processus à l’aide d’indicateurs de performances clés.
Importance : Quantifie les performances de livraison de logiciels, facilitant ainsi la prise de décision stratégique.
Prérequis :
Règles clés :
Deployment frequency: suit les taux de déploiement réussis.
Mean time to recovery: mesure le temps de récupération après une défaillance.
Change failure rate: suit le pourcentage de modifications qui entraînent des échecs.
Lead time for changes: mesure le temps écoulé entre le commit du code et le déploiement.
Objectif : établit et applique des pratiques de tag cohérentes pour les ressources au sein de votre organisation.
Importance : des tags cohérents vous aident à filtrer et à regrouper les services dans des vues telles que les cartes et les catalogues.
Prérequis : APM
Règles clés :
- Team Tag Exists: vérifie que les services portent un tag owning-team pour une propriété et une responsabilité claires.
- Environment Tag Exists: vérifie que les services portent un tag d'environnement cohérent pour le filtrage et le regroupement.
- APM Criticality is set: vérifie que les services ont un tag de criticité pour les prioriser par importance métier.
Objectif : établit une stratégie de tag complète et une visibilité totale sur les dépendances et les relations des services.
Importance : met en évidence les lacunes dans les tags, les relations, les trace et la couverture Synthétique afin que vous puissiez y remédier.
Prérequis :
Règles clés :
(L0) Team Tag Coverage: identifie les entités auxquelles il manque un tag
team.(L0) Environment Tag Coverage: identifie les entités auxquelles il manque un tag
environment.(L0) Uninstrumented Entities: signale les entités de service HTTP et de base de données ayant des relations inconnues qui nécessitent une instrumentation supplémentaire.
(L0) Distributed Trace Coverage: mesure le pourcentage d'entités APM émettant des données de traces distribuées.
(L0) Synthetic Coverage: mesure le pourcentage d'entités APM couvertes par des outils pour monitorer de manière Synthétique.
Objectif : développe une stratégie d'alerte complète et une approche de gestion des incidents pour la fiabilité des services.
Importance : met en évidence les lacunes en matière d'alertes, le bruit et la couverture SLI afin que vous puissiez prioriser les services critiques.
Prérequis :
Gestion des niveaux de service
Règles clés :
(L1) Infrastructure Alert Coverage: identifie les hôtes et les pods Kubernetes qui manquent de couverture d'alerte.
(L1) Service Delivery Alert Coverage: identifie les services, les navigateurs, les mobiles et les monitorer Synthétiques qui manquent de couverture d'alerte.
(L1) Critical Alert Coverage: signale une dépendance excessive aux conditions d’alerte critiques pouvant causer une fatigue due aux alertes.
(L1) Alert Noise: identifie les politiques qui génèrent un volume élevé d'incidents.
(L2) Service Level Coverage: vérifie si les entités ont un SLI (indicateur de niveau de service) défini.
(L2) Alerts Mean Time To Close: évalue le temps nécessaire pour fermer les incidents, en visant une résolution dans les 30 minutes.
(L2) APM Criticality Tag Coverage: identifie les entités auxquelles il manque un tag
criticality.(L3) Service Level Attainment: évalue le score de conformité pour chaque SLI défini, en utilisant un seuil par défaut de 95 %.
Objectif : met l'accent sur l'utilisation efficace des ressources et des pratiques de sécurité robustes grâce au monitoring de l'utilisation du CPU et de la mémoire, à l'intégration du suivi des changements et à la détection des vulnérabilités.
Importance : le respect des standards de ressources, de suivi des changements et de sécurité vous aide à exploiter une infrastructure efficace et sécurisée.
Prérequis :
Règles clés :
(L1) CPU Utilization: vérifie le 95e percentile de l’utilisation du CPU pour les entités d’infrastructure par rapport aux bonnes pratiques d’efficacité.
(L1) Memory Utilization: vérifie le 95e percentile de l'utilisation de la mémoire pour les entités d'infrastructure par rapport aux bonnes pratiques d'efficacité.
(L2) Change Tracking: vérifie les événements de suivi des changements sur l’ensemble de vos entités APM.
(L3) Service Vulnerabilities: vérifie le pourcentage d'entités APM présentant des vulnérabilités détectées.
Objectif : monitore les performances frontend et l’interaction utilisateur via les erreurs JavaScript, les erreurs HTTP 5xx et les métriques Core Web Vitals.
Importance : le respect des normes d'erreurs frontend et Core Web Vitals vous aide à maintenir une expérience utilisateur solide.
Prérequis :
Gestion des niveaux de service
Règles clés :
(L1) JS Error Rate: vérifie le pourcentage d'entités de navigateur avec des erreurs JavaScript.
(L1) Service Error Rate: vérifie le pourcentage de services APM signalant des erreurs 5xx dans les requests HTTP.
(L2) Core Web Vitals: Largest Contentful Pane (LCP): signale les entités dont le LCP au 75e percentile dépasse 2,5 secondes.
(L2) Core Web Vitals: Interaction to Next Paint (INP): signale les entités dont l’INP du 75e percentile dépasse 200 millisecondes.
(L2) Core Web Vitals: Cumulative Layout Shift (CLS): signale les entités dont le CLS du 75e percentile dépasse 0,1.
(L3) Service Level Attainment: évalue le score de conformité pour chaque SLI défini, en utilisant un seuil par défaut de 95 %.
Objectif : évalue le risque de vulnérabilités sur l'ensemble des services APM et de l'infrastructure.
Importance : la mise en évidence des vulnérabilités critiques et de gravité élevée, des CVE de ransomwares actifs et de la probabilité d’exploitation aide à prioriser la remédiation.
Prérequis :
Monitoring de l'infrastructure
Règles clés :
APM: Under 3 Critical Severity: vérifie qu'un service APM présente moins de 3 vulnérabilités de gravité critique.
APM: Under 5 High Severity: vérifie qu'un service APM présente moins de 5 vulnérabilités de gravité élevée.
APM: Active Ransomware: signale les CVE signalées qui font l'objet d'une campagne de ransomware active.
APM: Exploit Probability: signale les vulnérabilités critiques ou de gravité élevée susceptibles d'être exploitées (95e+ percentile EPSS).
INFRA: Under 3 Critical Severity: vérifie qu’un hôte ou un conteneur a moins de 3 vulnérabilités de gravité critique.
INFRA: Under 5 High Severity: vérifie qu’un hôte ou un conteneur présente moins de 5 vulnérabilités de gravité élevée.
INFRA: Active Ransomware: signale les CVE signalées qui font l'objet d'une campagne de ransomware active.
INFRA: Exploit Probability: signale les vulnérabilités critiques ou de gravité élevée susceptibles d'être exploitées (95e+ percentile EPSS).
Objectif : mesure la qualité opérationnelle et la gouvernance des réponses de l'IA en matière de sécurité, de rentabilité et de conformité des modèles.
Importance : le respect des normes de qualité et de gouvernance de l'IA vous aide à garder une utilisation de l'IA responsable et rentable.
Prérequis : monitoring de l’IA
Règles clés :
- LLM Runtime Error Rate: vérifie que les applications compatibles LLM maintiennent un faible taux d’erreur opérationnel.
- Cost Efficiency - Average tokens per assistant response: vérifie que le nombre moyen de jetons par réponse de l’assistant reste dans le budget.
- Model Governance - Approved model usage for assistant responses: vérifie que seuls les modèles approuvés sont utilisés pour les réponses de l’assistant en production.