Aperçu
Nous travaillons toujours sur cette fonctionnalité, mais nous aimerions que vous l'essayiez !
Cette fonctionnalité est actuellement fournie dans le cadre d'un programme d'aperçu conformément à nos politiques de pré-sortie.
Lorsqu'une alerte se déclenche pour un pic de latence ou une augmentation des erreurs, votre premier défi est de trouver où se situe le problème. Au lieu de conserver votre contexte d'investigation, le workflow standard vous plonge dans une liste non filtrée de milliers de traces — vous forçant à reconstruire manuellement les filtres et à parcourir les données pour trouver la seule trace qui montre le problème.
Intelligent Exemplar (IE) élimine cette recherche. Il préserve le contexte exact de votre clic, fait ressortir de manière algorithmique les traces qui représentent le mieux l'anomalie et vous dirige directement vers le span défaillant — vous passez ainsi du pic au span racine en quelques clics au lieu de plusieurs heures.
Une fois que vous avez identifié le span défaillant, utilisez l'Analyse de corrélation d'attributs pour répondre à la question de savoir pourquoi il est défaillant — en comparant statistiquement vos traces anormales à une base de référence saine et en faisant ressortir les attributs spécifiques à l'origine du problème.
Comment fonctionne Intelligent Exemplar
IE combine trois comportements pour combler l'écart entre une métrique de haut niveau et la trace exacte au niveau du code dont vous avez besoin :
Préservation du contexte Lorsque vous cliquez sur une fenêtre temporelle sur un graphique d'erreur ou de latence pris en charge, Intelligent Exemplar capture tout ce qui est dans le champ d'application à ce moment-là : l'entité, la plage de temps exacte, tous les filtres actifs tels que transaction.name ou error.class, et les facettes sélectionnées. Ceux-ci sont transmis nativement au backend. Vous n'êtes jamais redirigé vers une liste de traces générique et non filtrée.
Priorisation algorithmique des traces Plutôt que d'afficher un échantillon aléatoire ou ordonné chronologiquement, Intelligent Exemplar évalue l'ensemble complet de données de trace et fait ressortir une liste organisée de jusqu'à 500 traces qui représentent le mieux l'anomalie. Les traces fragmentées sont filtrées automatiquement. Les traces sont pondérées en fonction des occurrences qui se situent dans la fenêtre du pic. Si une seule variable — telle qu'un nom de transaction unique, un hôte ou une version de déploiement — représente plus de 60 % des traces anormales, elle ressort automatiquement comme point de départ suggéré.
Navigation dans les spans anormaux Lorsque vous sélectionnez une trace dans la liste, l'interface utilisateur navigue directement vers le span anormal — pas le span racine, ni le span le plus lent dans l'ensemble, mais le span qui s'écarte le plus du comportement de la base de référence pour cette opération. Dans une cascade de 200 spans qui traverse plusieurs services en aval, cela élimine la traversée manuelle requise pour localiser où les choses ont mal tourné.
Exigences
Avant d'utiliser Intelligent Exemplar:
- Le tracing distribué doit être activé pour vos services.
- Plus les services de votre chemin de trace sont instrumentés, plus la carte des dépendances en aval est complète. Les services non instrumentés créent des lacunes dans le chemin causal.
Démarrer une investigation
Intelligent Exemplar est disponible sur les graphiques d'erreur et de latence à trois emplacements :
- APM & Services > Summary: graphique du temps des transactions web et graphique du taux d’erreur
- Errors Inbox: graphiques d’erreurs et de latence sur la page d’accueil Errors Inbox
- Transactions: graphiques d’erreurs et de latence sur la page d’accueil Transactions
Les étapes sont les mêmes dans les trois emplacements :
- Cliquez sur la fenêtre de temps sur le graphique d'erreur ou de latence qui correspond au pic que vous souhaitez examiner.
- Dans l'infobulle qui apparaît, sélectionnez Intelligent Traces.
Passer en revue la page d'accueil
Après avoir sélectionné la fenêtre du pic, la page de destination Intelligent Exemplar s'ouvre avec une image complète du comportement anormal pour ce service et cette plage de temps. Aucune création de requête ni configuration manuelle de filtre n'est requise — votre contexte issu du clic a déjà été appliqué.
La page de destination comporte quatre composants :
Barre de résumé
Affiche la plage de temps, le type d’anomalie (latence ou erreurs) et le nombre de traces de valeurs hors norme identifiées pour cette fenêtre.
Modèles que nous avons détectés
Signaux catégorisés qui identifient où l'anomalie se produit et ce qui peut la causer. Vous pouvez sélectionner un ou plusieurs modèles pour concentrer la liste de traces de valeurs hors norme sur un signal spécifique.
Modèle | Ce que cela signifie |
|---|---|
Latence en aval | La latence p95 ou p99 d'une dépendance est corrélée au pic de l'entité focale. La cause première se trouve probablement dans un service en aval de celui d'où vous êtes parti. |
Erreurs en aval | Un taux d’erreur dans un service en aval a augmenté pendant la fenêtre du pic. L'anomalie se propage à partir d'une dépendance. |
Latence de l'entité focale | Le service à partir duquel vous avez commencé est lui-même la source de latence — le problème n'est pas causé par une dépendance en aval. |
Augmentation du débit | Une forte augmentation du volume de requêtes dans l'entité focale ou une entité en aval est corrélée au pic de latence ou d'erreur. L'anomalie peut être induite par la charge plutôt que par une défaillance de code ou d'infrastructure. |
Conseil
Si un seul modèle représente plus de 60 % des traces anormales, Intelligent Exemplar le sélectionne automatiquement comme point de départ suggéré. Vous pouvez le désélectionner et choisir un modèle différent pour explorer des hypothèses alternatives.
Traces de valeurs hors norme
La liste classée des traces qui présentent un comportement anormal dans la fenêtre sélectionnée. Les traces sont triées par leur contribution au pic. Sélectionnez n'importe quelle trace pour l'ouvrir et naviguer directement vers le span anormal.
Nuage de points
Une comparaison visuelle des traces de valeurs hors norme par rapport à toutes les autres traces dans la fenêtre temporelle.
- X-axis: temps dans la fenêtre sélectionnée
- Y-axis: durée de la trace (pour les investigations de latence) ou nombre d'erreurs
- Outlier traces sont tracées distinctement de la série de base de référence All Traces
Utilisez le nuage de points pour confirmer que les traces de valeurs hors norme se regroupent autour de la fenêtre du pic plutôt que d'être réparties de manière aléatoire sur l'ensemble de la plage de temps. Un cluster serré confirme que l'anomalie est limitée dans le temps et que les traces sélectionnées sont véritablement représentatives du pic.
Inspectez le span anormal
La sélection d'une trace dans la liste des valeurs hors norme ouvre le panneau des détails de la trace. Intelligent Exemplar ne vous amène pas au span racine — il navigue directement vers le span qui s'écarte le plus du comportement de base de référence attendu pour cette opération.
Cela importe le plus dans les traces profondes et multiservices. Dans une cascade de 200 spans qui traverse cinq services en aval, le span anormal peut être enfoui à plusieurs couches de profondeur dans une dépendance que vous ne soupçonniez pas initialement. Intelligent Exemplar vous y dirige automatiquement.
À partir de la span anormale, vous pouvez :
- Passez en revue les attributs du span pour voir les valeurs qui s'écartent de la base de référence
- Naviguer vers l'entité qui possède le span pour voir son résumé APM
- Afficher les spans environnants dans la cascade pour plus de contexte
- Exécutez l'analyse de corrélation d'attribut pour identifier les paires attribut-valeur spécifiques à l'origine de l'anomalie — telles qu'une version de déploiement, un hôte ou une classe d'erreur
Pour un guide complet sur l'utilisation des détails de trace et des attributs de span, consultez Comprendre la page de l'interface utilisateur des détails de trace.
Comprendre la corrélation en aval
Lorsque l'anomalie provient d'une dépendance en aval, Intelligent Exemplar cartographie le chemin de propagation causale à travers votre graphe de dépendance de services.
Le système analyse automatiquement les modèles de latence et d'erreur corrélés à travers les entités en aval et calcule la contribution de chaque chemin à la défaillance globale.
Conseil
Une instrumentation plus complète sur votre chemin de trace produit une attribution en aval plus précise. Si un service en aval n'est pas instrumenté, sa contribution n'apparaîtra pas dans la carte de corrélation.
Et ensuite ?
- Identifier la cause première: Exécutez l'Analyse de corrélation d'attributs pour identifier les paires attribut-valeur spécifiques — telles qu'une version de déploiement, un hôte, une région ou une classe d'erreur — responsables de l'anomalie.
- Gérer le volume de traces: consultez Contrôler l'ingestion des données de tracing distribué pour gérer les coûts d'ingestion de traces pendant et après un incident.
- Ajuster l'échantillonnage: voir Configurer l'échantillonnage pour ajuster les taux d'échantillonnage pour le service affecté.