Загрузка данных
dmitriev-aal@VDI-Dmitriev-A:~/Desktop/appfarm/infra/k8s/nexus$ grep -Rni -A15 -B3 'globalRules:\|rules:' deploy/*/environment.yaml deploy/*/nexus.yaml
deploy/cpstbl/environment.yaml-1-# File for environment wide variables used in helmfile via {{ .Environment.Values.key_name }}
deploy/cpstbl/environment.yaml:2:prometheusRules:
deploy/cpstbl/environment.yaml:3: rules:
deploy/cpstbl/environment.yaml-4- - nexus-blackbox-proxy
deploy/cpstbl/environment.yaml-5-
deploy/cpstbl/environment.yaml-6-service:
deploy/cpstbl/environment.yaml-7- additionalPorts:
deploy/cpstbl/environment.yaml-8- - port: 5000
deploy/cpstbl/environment.yaml-9- name: docker-hosted
deploy/cpstbl/environment.yaml-10- containerPort: 5000
deploy/cpstbl/environment.yaml-11- host: registry.rshbdev.ru
deploy/cpstbl/environment.yaml-12- - port: 5001
deploy/cpstbl/environment.yaml-13- name: docker-proxy
deploy/cpstbl/environment.yaml-14- containerPort: 5001
deploy/cpstbl/environment.yaml-15- host: registry-proxy.rshbdev.ru
deploy/cpstbl/environment.yaml-16- - port: 5002
deploy/cpstbl/environment.yaml-17- name: registry-cache
deploy/cpstbl/environment.yaml-18- containerPort: 5002
--
deploy/values/environment.yaml-22-nodeSelector: {}
deploy/values/environment.yaml-23-affinity: {}
deploy/values/environment.yaml-24-
deploy/values/environment.yaml:25:prometheusRules:
deploy/values/environment.yaml-26- enabled: true
deploy/values/environment.yaml-27- params: {}
deploy/values/environment.yaml:28: globalRules:
deploy/values/environment.yaml-29- - nexus-alerts
deploy/values/environment.yaml-30- - nexus-common
deploy/values/environment.yaml-31-
deploy/values/environment.yaml-32-# nexus-cleaner не используется, так как требуется его доработка
deploy/values/environment.yaml-33-nexusCleaner:
deploy/values/environment.yaml-34- imagePath: rshbintech/integrations/ckpr/infra/util/nexus-cleaner
deploy/values/environment.yaml-35- imageTag: 0.2.0
deploy/values/environment.yaml-36- svcPort: 8080
deploy/values/environment.yaml-37-
deploy/values/environment.yaml-38-nexusPluginsImagePath: rshbintech/integrations/ckpr/infra/images/nexus-plugins
deploy/values/environment.yaml-39-
deploy/values/environment.yaml-40-# nexus-cleaner не используется, так как требуется его доработка
deploy/values/environment.yaml-41-backupsCleanerJob:
deploy/values/environment.yaml-42- enabled: false
deploy/values/environment.yaml-43-
--
deploy/cicdprod/nexus.yaml-9-#
deploy/cicdprod/nexus.yaml-10-# ---------> НАЧАЛО <---------
deploy/cicdprod/nexus.yaml-11-#
deploy/cicdprod/nexus.yaml:12:# prometheusRules:
deploy/cicdprod/nexus.yaml-13-# enabled: false
deploy/cicdprod/nexus.yaml-14-
deploy/cicdprod/nexus.yaml-15-# nexus:
deploy/cicdprod/nexus.yaml-16-# enabled: false
deploy/cicdprod/nexus.yaml-17-
deploy/cicdprod/nexus.yaml-18-# nexusScraper:
deploy/cicdprod/nexus.yaml-19-# enabled: false
deploy/cicdprod/nexus.yaml-20-
deploy/cicdprod/nexus.yaml-21-# blobstoreJsonExporter:
deploy/cicdprod/nexus.yaml-22-# enabled: false
deploy/cicdprod/nexus.yaml-23-
deploy/cicdprod/nexus.yaml-24-# blobstoreServicemonitor:
deploy/cicdprod/nexus.yaml-25-# enabled: false
deploy/cicdprod/nexus.yaml-26-
deploy/cicdprod/nexus.yaml-27-# tasksJsonExporter:
--
deploy/cicdprod/nexus.yaml-87-persistence:
deploy/cicdprod/nexus.yaml-88- size: 100Gi
deploy/cicdprod/nexus.yaml-89-
deploy/cicdprod/nexus.yaml:90:prometheusRules:
deploy/cicdprod/nexus.yaml-91- params:
deploy/cicdprod/nexus.yaml-92- logs_url: https://kibana.rshb.pro/goto/54f9a9c900c9c2c0df29b4fb8e1888f4?security_tenant=global
deploy/cicdprod/nexus.yaml-93-# ---------> КОНЕЦ <---------
--
deploy/cpdev/nexus.yaml-32- enabled: false
deploy/cpdev/nexus.yaml-33- suspend: true
deploy/cpdev/nexus.yaml-34-
deploy/cpdev/nexus.yaml:35:prometheusRules:
deploy/cpdev/nexus.yaml-36- params:
deploy/cpdev/nexus.yaml-37- logs_url: https://kibana.dev.platform.rshbdev.ru/goto/8a196344ca7c9855924f24e8e9b4b53e?security_tenant=global
--
deploy/cpprod/nexus.yaml-9-#
deploy/cpprod/nexus.yaml-10-# ---------> НАЧАЛО <---------
deploy/cpprod/nexus.yaml-11-#
deploy/cpprod/nexus.yaml:12:# prometheusRules:
deploy/cpprod/nexus.yaml-13-# enabled: false
deploy/cpprod/nexus.yaml-14-
deploy/cpprod/nexus.yaml-15-# nexus:
deploy/cpprod/nexus.yaml-16-# enabled: false
deploy/cpprod/nexus.yaml-17-
deploy/cpprod/nexus.yaml-18-# nexusScraper:
deploy/cpprod/nexus.yaml-19-# enabled: false
deploy/cpprod/nexus.yaml-20-
deploy/cpprod/nexus.yaml-21-# blobstoreJsonExporter:
deploy/cpprod/nexus.yaml-22-# enabled: false
deploy/cpprod/nexus.yaml-23-
deploy/cpprod/nexus.yaml-24-# blobstoreServicemonitor:
deploy/cpprod/nexus.yaml-25-# enabled: false
deploy/cpprod/nexus.yaml-26-
deploy/cpprod/nexus.yaml-27-# tasksJsonExporter:
--
deploy/cpprod/nexus.yaml-88-persistence:
deploy/cpprod/nexus.yaml-89- size: 100Gi
deploy/cpprod/nexus.yaml-90-
deploy/cpprod/nexus.yaml:91:prometheusRules:
deploy/cpprod/nexus.yaml-92- params:
deploy/cpprod/nexus.yaml-93- logs_url: https://kibana.rshb.pro/goto/54f9a9c900c9c2c0df29b4fb8e1888f4?security_tenant=global
deploy/cpprod/nexus.yaml-94-# ---------> КОНЕЦ <---------
--
deploy/cprc/nexus.yaml-32- Xms: 1360m
deploy/cprc/nexus.yaml-33- Xmx: 1360m
deploy/cprc/nexus.yaml-34-
deploy/cprc/nexus.yaml:35:prometheusRules:
deploy/cprc/nexus.yaml-36- params:
deploy/cprc/nexus.yaml-37- logs_url: https://kibana.rc.platform.rshbdev.ru/goto/8a196344ca7c9855924f24e8e9b4b53e?security_tenant=global
--
deploy/cpstbl/nexus.yaml-51- suspend: false
deploy/cpstbl/nexus.yaml-52- cleanOlderThan: "30" # in days
deploy/cpstbl/nexus.yaml-53-
deploy/cpstbl/nexus.yaml:54:prometheusRules:
deploy/cpstbl/nexus.yaml-55- params:
deploy/cpstbl/nexus.yaml-56- logs_url: https://kibana.rshbdev.ru/goto/a1ffabf2779bd5a7b9d5f1b512645699?security_tenant=global
--
deploy/cpval/nexus.yaml-35- enabled: false
deploy/cpval/nexus.yaml-36- suspend: true
deploy/cpval/nexus.yaml-37-
deploy/cpval/nexus.yaml:38:prometheusRules:
deploy/cpval/nexus.yaml-39- params:
deploy/cpval/nexus.yaml-40- logs_url: https://kibana.afval.rshbdev.ru/goto/8a196344ca7c9855924f24e8e9b4b53e?security_tenant=global
dmitriev-aal@VDI-Dmitriev-A:~/Desktop/appfarm/infra/k8s/nexus$ grep -Rni -A10 -B2 'dashboard_url:' deploy
deploy/files/alerts/nexus-common.rules-5- summary: "Nexus availability is low."
deploy/files/alerts/nexus-common.rules-6- description: "Nexus pod readiness is below 95% for 3 minutes."
deploy/files/alerts/nexus-common.rules:7: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-8- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-9- expr: avg(avg_over_time(kube_pod_container_status_ready{namespace="nexus",container="nexus3"}[5m])) < 0.95
deploy/files/alerts/nexus-common.rules-10- for: 3m
deploy/files/alerts/nexus-common.rules-11- labels:
deploy/files/alerts/nexus-common.rules-12- team: sre
deploy/files/alerts/nexus-common.rules-13- service: nexus
deploy/files/alerts/nexus-common.rules-14- component: availability
deploy/files/alerts/nexus-common.rules-15- environment: production
deploy/files/alerts/nexus-common.rules-16- severity: critical
deploy/files/alerts/nexus-common.rules-17-
--
deploy/files/alerts/nexus-common.rules-20- summary: "Nexus 4xx error ratio is high."
deploy/files/alerts/nexus-common.rules-21- description: "Nexus 4xx ratio is above 2% for 3 minutes."
deploy/files/alerts/nexus-common.rules:22: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-23- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-24- expr: |-
deploy/files/alerts/nexus-common.rules-25- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-26- /
deploy/files/alerts/nexus-common.rules-27- (
deploy/files/alerts/nexus-common.rules-28- sum(rate(org_eclipse_jetty_webapp_WebAppContext_2xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-29- +
deploy/files/alerts/nexus-common.rules-30- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-31- +
deploy/files/alerts/nexus-common.rules-32- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
--
deploy/files/alerts/nexus-common.rules-44- summary: "Nexus 4xx error ratio is critical."
deploy/files/alerts/nexus-common.rules-45- description: "Nexus 4xx ratio is above 5% for 3 minutes."
deploy/files/alerts/nexus-common.rules:46: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-47- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-48- expr: |-
deploy/files/alerts/nexus-common.rules-49- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-50- /
deploy/files/alerts/nexus-common.rules-51- (
deploy/files/alerts/nexus-common.rules-52- sum(rate(org_eclipse_jetty_webapp_WebAppContext_2xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-53- +
deploy/files/alerts/nexus-common.rules-54- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-55- +
deploy/files/alerts/nexus-common.rules-56- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
--
deploy/files/alerts/nexus-common.rules-68- summary: "Nexus 5xx error ratio is high."
deploy/files/alerts/nexus-common.rules-69- description: "Nexus 5xx ratio is above 2% for 3 minutes."
deploy/files/alerts/nexus-common.rules:70: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-71- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-72- expr: |-
deploy/files/alerts/nexus-common.rules-73- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-74- /
deploy/files/alerts/nexus-common.rules-75- (
deploy/files/alerts/nexus-common.rules-76- sum(rate(org_eclipse_jetty_webapp_WebAppContext_2xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-77- +
deploy/files/alerts/nexus-common.rules-78- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-79- +
deploy/files/alerts/nexus-common.rules-80- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
--
deploy/files/alerts/nexus-common.rules-92- summary: "Nexus 5xx error ratio is critical."
deploy/files/alerts/nexus-common.rules-93- description: "Nexus 5xx ratio is above 5% for 3 minutes."
deploy/files/alerts/nexus-common.rules:94: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-95- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-96- expr: |-
deploy/files/alerts/nexus-common.rules-97- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-98- /
deploy/files/alerts/nexus-common.rules-99- (
deploy/files/alerts/nexus-common.rules-100- sum(rate(org_eclipse_jetty_webapp_WebAppContext_2xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-101- +
deploy/files/alerts/nexus-common.rules-102- sum(rate(org_eclipse_jetty_webapp_WebAppContext_4xx_responses_total{namespace="nexus"}[10m]))
deploy/files/alerts/nexus-common.rules-103- +
deploy/files/alerts/nexus-common.rules-104- sum(rate(org_eclipse_jetty_webapp_WebAppContext_5xx_responses_total{namespace="nexus"}[10m]))
--
deploy/files/alerts/nexus-common.rules-116- summary: "Nexus repository read latency is high."
deploy/files/alerts/nexus-common.rules-117- description: "Nexus repository read p99 latency is above 3 seconds for 5 minutes."
deploy/files/alerts/nexus-common.rules:118: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-119- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-120- expr: org_sonatype_nexus_coreui_RepositoryComponent_read_timer{quantile="0.99",namespace="nexus"} > 3
deploy/files/alerts/nexus-common.rules-121- for: 5m
deploy/files/alerts/nexus-common.rules-122- labels:
deploy/files/alerts/nexus-common.rules-123- team: sre
deploy/files/alerts/nexus-common.rules-124- service: nexus
deploy/files/alerts/nexus-common.rules-125- component: registry
deploy/files/alerts/nexus-common.rules-126- environment: production
deploy/files/alerts/nexus-common.rules-127- severity: warning
deploy/files/alerts/nexus-common.rules-128-
--
deploy/files/alerts/nexus-common.rules-131- summary: "Nexus repository read latency is critical."
deploy/files/alerts/nexus-common.rules-132- description: "Nexus repository read p99 latency is above 5 seconds for 3 minutes."
deploy/files/alerts/nexus-common.rules:133: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-134- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-135- expr: org_sonatype_nexus_coreui_RepositoryComponent_read_timer{quantile="0.99",namespace="nexus"} > 5
deploy/files/alerts/nexus-common.rules-136- for: 3m
deploy/files/alerts/nexus-common.rules-137- labels:
deploy/files/alerts/nexus-common.rules-138- team: sre
deploy/files/alerts/nexus-common.rules-139- service: nexus
deploy/files/alerts/nexus-common.rules-140- component: registry
deploy/files/alerts/nexus-common.rules-141- environment: production
deploy/files/alerts/nexus-common.rules-142- severity: critical
deploy/files/alerts/nexus-common.rules-143-
--
deploy/files/alerts/nexus-common.rules-146- summary: "Nexus blobstore is unavailable."
deploy/files/alerts/nexus-common.rules-147- description: "Nexus default blobstore has no available space."
deploy/files/alerts/nexus-common.rules:148: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-149- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-150- expr: nexus_blobstores_stats_availableSpaceInBytes{namespace="nexus", name="default"} == 0
deploy/files/alerts/nexus-common.rules-151- for: 1m
deploy/files/alerts/nexus-common.rules-152- labels:
deploy/files/alerts/nexus-common.rules-153- team: sre
deploy/files/alerts/nexus-common.rules-154- service: nexus
deploy/files/alerts/nexus-common.rules-155- component: blobstore
deploy/files/alerts/nexus-common.rules-156- environment: production
deploy/files/alerts/nexus-common.rules-157- severity: critical
deploy/files/alerts/nexus-common.rules-158-
--
deploy/files/alerts/nexus-common.rules-161- summary: "Nexus JVM heap usage is high."
deploy/files/alerts/nexus-common.rules-162- description: "Nexus JVM heap usage is above 90% for 3 minutes."
deploy/files/alerts/nexus-common.rules:163: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-164- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-165- expr: |-
deploy/files/alerts/nexus-common.rules-166- sum(jvm_memory_heap_used{namespace="nexus", container="nexus3"}) by(pod)
deploy/files/alerts/nexus-common.rules-167- /
deploy/files/alerts/nexus-common.rules-168- sum(jvm_memory_heap_max{namespace="nexus", container="nexus3"}) by(pod)
deploy/files/alerts/nexus-common.rules-169- > 0.9
deploy/files/alerts/nexus-common.rules-170- for: 3m
deploy/files/alerts/nexus-common.rules-171- labels:
deploy/files/alerts/nexus-common.rules-172- team: sre
deploy/files/alerts/nexus-common.rules-173- service: nexus
--
deploy/files/alerts/nexus-common.rules-180- summary: "Nexus CPU throttling is high."
deploy/files/alerts/nexus-common.rules-181- description: "Nexus CPU throttling ratio is above 20% for 5 minutes."
deploy/files/alerts/nexus-common.rules:182: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-common.rules-183- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-common.rules-184- expr: |-
deploy/files/alerts/nexus-common.rules-185- rate(container_cpu_cfs_throttled_periods_total{namespace="nexus",container="nexus3"}[5m])
deploy/files/alerts/nexus-common.rules-186- /
deploy/files/alerts/nexus-common.rules-187- rate(container_cpu_cfs_periods_total{namespace="nexus",container="nexus3"}[5m])
deploy/files/alerts/nexus-common.rules-188- > 0.2
deploy/files/alerts/nexus-common.rules-189- for: 5m
deploy/files/alerts/nexus-common.rules-190- labels:
deploy/files/alerts/nexus-common.rules-191- team: sre
deploy/files/alerts/nexus-common.rules-192- service: nexus
--
deploy/files/alerts/nexus-alerts.rules-5- description: "PersistentVolume {{`{{ $labels.persistentvolumeclaim }}`}} free space is below 20%."
deploy/files/alerts/nexus-alerts.rules-6- summary: "Nexus PVC free space is running low."
deploy/files/alerts/nexus-alerts.rules:7: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-alerts.rules-8- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-alerts.rules-9- expr: |-
deploy/files/alerts/nexus-alerts.rules-10- sum without(instance,node) (
deploy/files/alerts/nexus-alerts.rules-11- kubelet_volume_stats_available_bytes{
deploy/files/alerts/nexus-alerts.rules-12- job="kubelet",
deploy/files/alerts/nexus-alerts.rules-13- metrics_path="/metrics",
deploy/files/alerts/nexus-alerts.rules-14- namespace="nexus",
deploy/files/alerts/nexus-alerts.rules-15- persistentvolumeclaim="nexus-nexus3-data"
deploy/files/alerts/nexus-alerts.rules-16- }
deploy/files/alerts/nexus-alerts.rules-17- )
--
deploy/files/alerts/nexus-alerts.rules-38- description: "PersistentVolume {{`{{ $labels.persistentvolumeclaim }}`}} free space is below 10%."
deploy/files/alerts/nexus-alerts.rules-39- summary: "Nexus PVC free space is critically low."
deploy/files/alerts/nexus-alerts.rules:40: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-alerts.rules-41- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-alerts.rules-42- expr: |-
deploy/files/alerts/nexus-alerts.rules-43- sum without(instance,node) (
deploy/files/alerts/nexus-alerts.rules-44- kubelet_volume_stats_available_bytes{
deploy/files/alerts/nexus-alerts.rules-45- job="kubelet",
deploy/files/alerts/nexus-alerts.rules-46- metrics_path="/metrics",
deploy/files/alerts/nexus-alerts.rules-47- namespace="nexus",
deploy/files/alerts/nexus-alerts.rules-48- persistentvolumeclaim="nexus-nexus3-data"
deploy/files/alerts/nexus-alerts.rules-49- }
deploy/files/alerts/nexus-alerts.rules-50- )
--
deploy/files/alerts/nexus-alerts.rules-71- description: "PersistentVolume {{`{{ $labels.persistentvolumeclaim }}`}} inode usage is above 90%."
deploy/files/alerts/nexus-alerts.rules-72- summary: "Nexus PVC inode count is running low."
deploy/files/alerts/nexus-alerts.rules:73: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-alerts.rules-74- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-alerts.rules-75- expr: |-
deploy/files/alerts/nexus-alerts.rules-76- kubelet_volume_stats_inodes_free{
deploy/files/alerts/nexus-alerts.rules-77- job="kubelet",
deploy/files/alerts/nexus-alerts.rules-78- metrics_path="/metrics",
deploy/files/alerts/nexus-alerts.rules-79- namespace="nexus",
deploy/files/alerts/nexus-alerts.rules-80- persistentvolumeclaim="nexus-nexus3-data"
deploy/files/alerts/nexus-alerts.rules-81- }
deploy/files/alerts/nexus-alerts.rules-82- /
deploy/files/alerts/nexus-alerts.rules-83- kubelet_volume_stats_inodes{
--
deploy/files/alerts/nexus-alerts.rules-100- description: "Task with name {{`{{ $labels.name }}`}} was completed with NOT OK status {{`{{ $labels.lastRunResult }}`}}."
deploy/files/alerts/nexus-alerts.rules-101- summary: "Check Nexus UI (System -> Tasks) and logs for investigating."
deploy/files/alerts/nexus-alerts.rules:102: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-alerts.rules-103- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-alerts.rules-104- expr: nexus_tasks_status{lastRunResult!~"OK|<nil>"} > 0
deploy/files/alerts/nexus-alerts.rules-105- for: 1m
deploy/files/alerts/nexus-alerts.rules-106- labels:
deploy/files/alerts/nexus-alerts.rules-107- team: sre
deploy/files/alerts/nexus-alerts.rules-108- service: nexus
deploy/files/alerts/nexus-alerts.rules-109- component: tasks
deploy/files/alerts/nexus-alerts.rules-110- environment: production
deploy/files/alerts/nexus-alerts.rules-111- severity: critical
--
deploy/files/alerts/nexus-blackbox-proxy.rules-5- summary: "Proxy target {{`{{ $labels.instance }}`}} is down."
deploy/files/alerts/nexus-blackbox-proxy.rules-6- description: "Blackbox probe through Nexus proxy failed for {{`{{ $labels.instance }}`}} for 3 minutes."
deploy/files/alerts/nexus-blackbox-proxy.rules:7: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-8- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-9- expr: probe_success{job="nexus-proxy-targets"} == 0
deploy/files/alerts/nexus-blackbox-proxy.rules-10- for: 3m
deploy/files/alerts/nexus-blackbox-proxy.rules-11- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-12- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-13- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-14- component: proxy
deploy/files/alerts/nexus-blackbox-proxy.rules-15- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-16- severity: critical
deploy/files/alerts/nexus-blackbox-proxy.rules-17-
--
deploy/files/alerts/nexus-blackbox-proxy.rules-20- summary: "High Nexus proxy latency for {{`{{ $labels.instance }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules-21- description: "Proxy request to {{`{{ $labels.instance }}`}} has p95 latency above 3 seconds for 5 minutes."
deploy/files/alerts/nexus-blackbox-proxy.rules:22: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-23- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-24- expr: quantile_over_time(0.95, probe_duration_seconds{job="nexus-proxy-targets"}[5m]) > 3
deploy/files/alerts/nexus-blackbox-proxy.rules-25- for: 5m
deploy/files/alerts/nexus-blackbox-proxy.rules-26- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-27- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-28- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-29- component: proxy
deploy/files/alerts/nexus-blackbox-proxy.rules-30- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-31- severity: warning
deploy/files/alerts/nexus-blackbox-proxy.rules-32-
--
deploy/files/alerts/nexus-blackbox-proxy.rules-35- summary: "Critical Nexus proxy latency for {{`{{ $labels.instance }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules-36- description: "Proxy request to {{`{{ $labels.instance }}`}} has p99 latency above 5 seconds for 3 minutes."
deploy/files/alerts/nexus-blackbox-proxy.rules:37: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-38- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-39- expr: quantile_over_time(0.99, probe_duration_seconds{job="nexus-proxy-targets"}[5m]) > 5
deploy/files/alerts/nexus-blackbox-proxy.rules-40- for: 3m
deploy/files/alerts/nexus-blackbox-proxy.rules-41- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-42- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-43- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-44- component: proxy
deploy/files/alerts/nexus-blackbox-proxy.rules-45- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-46- severity: critical
deploy/files/alerts/nexus-blackbox-proxy.rules-47-
--
deploy/files/alerts/nexus-blackbox-proxy.rules-50- summary: "SSL certificate expiring soon for {{`{{ $labels.instance }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules-51- description: "SSL certificate for {{`{{ $labels.instance }}`}} will expire in {{`{{ $value | humanizeDuration }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules:52: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-53- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-54- expr: probe_ssl_earliest_cert_expiry{job="nexus-proxy-targets"} - time() < 86400 * 30
deploy/files/alerts/nexus-blackbox-proxy.rules-55- for: 1h
deploy/files/alerts/nexus-blackbox-proxy.rules-56- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-57- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-58- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-59- component: certificates
deploy/files/alerts/nexus-blackbox-proxy.rules-60- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-61- severity: warning
deploy/files/alerts/nexus-blackbox-proxy.rules-62-
--
deploy/files/alerts/nexus-blackbox-proxy.rules-65- summary: "HTTP 4xx status for {{`{{ $labels.instance }}`}}"
deploy/files/alerts/nexus-blackbox-proxy.rules-66- description: "Proxy request to {{`{{ $labels.instance }}`}} returned HTTP 4xx status code {{`{{ $value }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules:67: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-68- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-69- expr: probe_http_status_code{job="nexus-proxy-targets"} >= 400 and probe_http_status_code{job="nexus-proxy-targets"} < 500
deploy/files/alerts/nexus-blackbox-proxy.rules-70- for: 1m
deploy/files/alerts/nexus-blackbox-proxy.rules-71- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-72- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-73- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-74- component: proxy
deploy/files/alerts/nexus-blackbox-proxy.rules-75- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-76- severity: warning
deploy/files/alerts/nexus-blackbox-proxy.rules-77-
--
deploy/files/alerts/nexus-blackbox-proxy.rules-80- summary: "HTTP 5xx status for {{`{{ $labels.instance }}`}}"
deploy/files/alerts/nexus-blackbox-proxy.rules-81- description: "Proxy request to {{`{{ $labels.instance }}`}} returned HTTP 5xx status code {{`{{ $value }}`}}."
deploy/files/alerts/nexus-blackbox-proxy.rules:82: dashboard_url: "{{ .Values.prometheusRules.params.dashboard_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-83- runbook_url: "{{ .Values.prometheusRules.params.runbook_url }}"
deploy/files/alerts/nexus-blackbox-proxy.rules-84- expr: probe_http_status_code{job="nexus-proxy-targets"} >= 500 and probe_http_status_code{job="nexus-proxy-targets"} < 600
deploy/files/alerts/nexus-blackbox-proxy.rules-85- for: 1m
deploy/files/alerts/nexus-blackbox-proxy.rules-86- labels:
deploy/files/alerts/nexus-blackbox-proxy.rules-87- team: sre
deploy/files/alerts/nexus-blackbox-proxy.rules-88- service: nexus
deploy/files/alerts/nexus-blackbox-proxy.rules-89- component: proxy
deploy/files/alerts/nexus-blackbox-proxy.rules-90- environment: production
deploy/files/alerts/nexus-blackbox-proxy.rules-91- severity: warning
dmitriev-aal@VDI-Dmitriev-A:~/Desktop/appfarm/infra/k8s/nexus$