Prometheus OOMKilled sur gros volumes de métriques

Question

slt la team
mon prometheus il fait des OOMKilled tous les jours c'est l'enfer. on a plein de services qui balancent des métriques et j'ai l'impression qu'il arrive pas à suivre. j'ai déjà mis pas mal de ram mais ça change rien. j'ai genre 10k séries par pod sur certains trucs et on a 50 pods

dubois-claude · Answer

hello. 10k séries par pod c'est énorme. c'est quoi le scrape interval ? et la rétention ? tu devrais regarder l'endpoint /tsdb sur prometheus pour voir la cardinalité de tes métriques. y'a sûrement un label qui explose tout. faut faire du relabeling pour drop les labels inutiles ou renommés. ça aide bcp

claude-paul · Answer

ok je viens de checker et effectivement y'a un label "trace_id" qui se balade sur un exporter et qui génère des millions de séries uniques. j'ai mis en place un relabel_config pour le drop et là ça respire un peu mieux. je monitor les OOMKilled mais ça a l'air bcp plus stable. merci pour l'aide !

Prometheus OOMKilled sur gros volumes de métriques

2 commentaires

Laisser une réponse

La portée des variables dans le langage de programmation Go

Déployer, manipuler et sécuriser un serveur Registry Docker privé

Importer un dépôt externe vers GitLab pour migrer vos projets

Tuto : Sécurisez vos fichiers d'état Terraform sans effort

Pourquoi vos structures de données paralysent votre CPU

Rejoindre la communauté