
Healthcare Data Scientist
Posted Aug 4

Posted Aug 4
This is a fully remote position, open to applicants in District of Columbia, +2 more states.
• Design, maintain, and enhance data pipelines utilizing SQL, Python (pandas), and PySpark.
• Execute and oversee notebook-based workflows within Azure Synapse, including debugging and documentation tasks.
• Process and convert structured and semi-structured data in formats such as CSV, JSON/NDJSON, and Parquet.
• Operate within ETL/ELT pipelines that span raw, curated, and production data layers.
• Ingest, profile, map, and transform healthcare data sourced from EHR systems and interface feeds, while maintaining source lineage and clinical context.
• Conduct structured data validation, which includes row counts, null checks, duplicate detection, schema validation, and enforcement of allowed values.
• Identify and address schema drift, inconsistencies, and transformation errors throughout pipeline stages.
• Implement repeatable testing and validation methodologies, replicate issues, verify resolutions, and ensure data reliability.
• Validate source-to-target mappings and reconcile records across source and destination systems during data conversion and migration processes.
• Perform exploratory data analysis to uncover patterns, anomalies, and data quality issues.
• Create derived datasets for reporting, analytics, and downstream data applications.
• Collaborate with stakeholders to translate data requirements into actionable datasets and metrics.
• Interpret schemas, column definitions, data types, keys, and table relationships.
• Manage dataset granularity and evaluate how join strategies impact row counts and outputs.
• Trace data issues from source ingestion through transformation logic to final results.
• Utilize logs and debugging techniques to diagnose and remedy pipeline issues.
• Document transformations, assumptions, mappings, and results of validations.
• Work together with engineers, analysts, and stakeholders to ensure the usability, integrity, and alignment of data requirements.
• Communicate data issues, findings, and workflow progress with technical team members.
• Demonstrated experience in writing SQL queries for data transformation and analysis.
• Proficiency in using Python, particularly pandas, for data processing tasks.
• Practical experience with PySpark for distributed data processing.
• Familiarity with cloud-based data platforms, preferably Azure Synapse or similar environments.
• Solid understanding of ETL/ELT concepts and data pipeline architecture.
• Experience with structured and semi-structured data formats, including CSV, JSON, and Parquet.
• Knowledge of Git and collaborative development workflows.
• Strong problem-solving and debugging abilities across data pipelines.
• Capacity to validate and ensure data quality through structured checks and testing practices.
• Excellent written and verbal communication skills.
• Generous paid time-off.
• Employee incentive program.
• Continuous learning culture.
• Internal Investment Projects (IIP).
• Virtual brown-bags/level-ups.
• Additional professional development activities.
• Recruiting bonuses.
• 3% 401k Safe Harbor contributions.
• Medical insurance.
• Dental insurance.
• Vision insurance.
• Long-term disability insurance.
• Short-term disability insurance.
• AD&D insurance.
• Life insurance.
Lincoln Institute of Land Policy
General Dynamics Information Technology
CFRA Research
Get handpicked remote jobs straight to your inbox weekly.