Observability Platform Engineer

Job Description

  • Contractor
  • Anywhere

About the job
Job Title: Observability Platform Engineer (Contract)

Location: Calgary, Alberta, Canada (Hybrid – 3 Days Onsite)

 

Job Summary

We are seeking an experienced Observability Platform Engineer to manage and enhance enterprise observability platforms supporting critical business applications and infrastructure. The ideal candidate will have strong expertise in Dynatrace, Splunk, and enterprise monitoring solutions, with hands-on experience in observability, performance monitoring, incident management, and platform administration.

Required Skills

Dynatrace
Splunk (Enterprise/Observability)
Knowledge Management
Problem Management
Enterprise Monitoring & Observability
Primary Responsibilities

Administer and maintain enterprise observability platforms including Dynatrace, Splunk, and SolarWinds Orion.
Configure monitoring environments, dashboards, user access, alerting frameworks, and platform integrations.
Ensure platform availability, scalability, and operational readiness.
Manage agent deployment, monitoring configurations, data collection, and retention policies.
Implement end-to-end observability across metrics, logs, traces, events, and user experience monitoring.
Define and maintain enterprise observability standards, KPIs, SLIs, and SLOs.
Monitor application performance, infrastructure health, and service availability.
Perform root cause analysis using Dynatrace PurePath, Splunk Log Analytics, and Orion monitoring insights.
Analyze performance issues across applications, APIs, microservices, middleware, databases, servers, and network devices.
Design and maintain operational, executive, and business dashboards.
Develop reports, monitoring thresholds, trend analysis, and capacity planning dashboards.
Support incident triage, monitoring escalations, and operational troubleshooting.
Correlate metrics, logs, and traces to reduce MTTR.
Participate in major incident management and post-incident reviews.
Implement monitoring automation, event correlation, anomaly detection, and AIOps capabilities.
Drive continuous improvement of monitoring coverage and operational efficiency.
Preferred Experience

Dynatrace OneAgent, PurePath, Davis AI, Smartscape
Splunk Enterprise & Splunk Observability Cloud
SolarWinds Orion
Azure Monitor and AWS Cloud Monitoring
ServiceNow ITSM
Linux & Windows Administration
API integrations and monitoring automation
Mandatory Skills

Dynatrace
Splunk
Knowledge Management
Problem Management
Nice to Have

AppDynamics
Azure DevOps
Windows Server Administration