Remotery

Healthcare Data Scientist

Posted Aug 4

This is a fully remote position, open to applicants in District of Columbia, +2 more states.

📋 Description

• Design, maintain, and enhance data pipelines utilizing SQL, Python (pandas), and PySpark.

• Execute and oversee notebook-based workflows within Azure Synapse, including debugging and documentation tasks.

• Process and convert structured and semi-structured data in formats such as CSV, JSON/NDJSON, and Parquet.

• Operate within ETL/ELT pipelines that span raw, curated, and production data layers.

• Ingest, profile, map, and transform healthcare data sourced from EHR systems and interface feeds, while maintaining source lineage and clinical context.

• Conduct structured data validation, which includes row counts, null checks, duplicate detection, schema validation, and enforcement of allowed values.

• Identify and address schema drift, inconsistencies, and transformation errors throughout pipeline stages.

• Implement repeatable testing and validation methodologies, replicate issues, verify resolutions, and ensure data reliability.

• Validate source-to-target mappings and reconcile records across source and destination systems during data conversion and migration processes.

• Perform exploratory data analysis to uncover patterns, anomalies, and data quality issues.

• Create derived datasets for reporting, analytics, and downstream data applications.

• Collaborate with stakeholders to translate data requirements into actionable datasets and metrics.

• Interpret schemas, column definitions, data types, keys, and table relationships.

• Manage dataset granularity and evaluate how join strategies impact row counts and outputs.

• Trace data issues from source ingestion through transformation logic to final results.

• Utilize logs and debugging techniques to diagnose and remedy pipeline issues.

• Document transformations, assumptions, mappings, and results of validations.

• Work together with engineers, analysts, and stakeholders to ensure the usability, integrity, and alignment of data requirements.

• Communicate data issues, findings, and workflow progress with technical team members.


⛳️ Requirements

• Demonstrated experience in writing SQL queries for data transformation and analysis.

• Proficiency in using Python, particularly pandas, for data processing tasks.

• Practical experience with PySpark for distributed data processing.

• Familiarity with cloud-based data platforms, preferably Azure Synapse or similar environments.

• Solid understanding of ETL/ELT concepts and data pipeline architecture.

• Experience with structured and semi-structured data formats, including CSV, JSON, and Parquet.

• Knowledge of Git and collaborative development workflows.

• Strong problem-solving and debugging abilities across data pipelines.

• Capacity to validate and ensure data quality through structured checks and testing practices.

• Excellent written and verbal communication skills.


🏝️ Benefits

• Generous paid time-off.

• Employee incentive program.

• Continuous learning culture.

• Internal Investment Projects (IIP).

• Virtual brown-bags/level-ups.

• Additional professional development activities.

• Recruiting bonuses.

• 3% 401k Safe Harbor contributions.

• Medical insurance.

• Dental insurance.

• Vision insurance.

• Long-term disability insurance.

• Short-term disability insurance.

• AD&D insurance.

• Life insurance.

People also viewed

Lincoln Institute of Land Policy11 hours ago

Senior Data Scientist

US flagArizona, +3 more statesFreelanceData Scientist$95k – $115k/year
ApplyView job
General Dynamics Information Technology18 hours ago

Senior Data Scientist – Machine Learning

US flagUnited States OnlyFull-timeData Scientist$123.3k – $166.8k/year
ApplyView job
CFRA Research23 hours ago

Data Scientist, Equity Research

IN flagIndia OnlyFull-timeData Scientist
ApplyView job
Clario1 day ago

Associate Data Manager

HU flagHungary OnlyFull-timeData Scientist
ApplyView job
CrowdStrike1 day ago

Data Scientist, Applied AI/ML

US flagUnited States OnlyFull-timeData Scientist$120k – $180k/year
ApplyView job
CrowdStrike1 day ago

Senior Data Scientist, Applied AI/ML

US flagUnited States OnlyFull-timeData Scientist$140k – $215k/year
ApplyView job

Never miss a great job!

Get handpicked remote jobs straight to your inbox weekly.

Trusted by 7,400+ designers