Data Engineer | Data Analyst | Databricks Certified Data Engineer Associate
Recent MS Computer Science graduate from USC with hands-on experience building reliable data pipelines, analytics-ready datasets, machine-learning scoring workflows, and interactive dashboards. I use Python, SQL, PySpark, Databricks, Tableau, and data-quality practices to turn raw data into trusted decision-support solutions.
I am a Data Engineer and Data Analyst focused on building reliable pipelines, validated datasets, analytical models, and dashboard-ready outputs for reporting, BI, and machine-learning use cases.
My experience includes cleaning and validating AI-generated transcript data at USC’s Institute for Creative Technologies, extracting and documenting engineering data at Cosasco, and supporting client-facing analytics workflows at Blackcoffer.
I am especially interested in Databricks lakehouse architecture, PySpark, SQL analytics, data quality, customer and healthcare analytics, KPI development, and turning complex datasets into practical business decisions.
Built an end-to-end healthcare analytics platform using Bronze, Silver, and Gold architecture to process patient, admission, condition, medication, lab, and vital-sign data.
Created Patient 360 profiles, hospital operations metrics, monitoring alerts, readmission-risk datasets, explainable risk factors, audit logging, validation checks, watermark tracking, and incremental ingestion workflows.
Built an end-to-end retention decision-support solution for 1,000 telecom customers using data validation, feature engineering, machine-learning risk scoring, SQL analytics, and Tableau.
Identified 750 actionable retention candidates, estimated $805K in annualized revenue exposure, assigned targeted retention actions, and simulated campaign outcomes across multiple budgets.
Built Databricks SQL workflows to ingest, clean, and transform EPA emissions data for state and county-level analysis, including numeric type conversion and population-based calculations.
Created dashboard-ready datasets and visualizations to identify high-emission regions, compare normalized emissions trends, and support geographic emissions analysis.
Extended DuckDB query execution by integrating column imprint bitmaps with zonemap pruning, improving predicate filtering efficiency. Validated performance gains using TPC-H and TPC-DS benchmarks.
Built an AI-powered web application for crop disease detection using tomato leaf images. Implemented image preprocessing, CNN/VGG16-based classification across disease classes, and a recommendation layer that suggests treatment measures based on the detected disease.
Designed REST APIs and data models to support search, filtering, and favorites workflows. Built scalable backend services delivering smooth user interactions with optimized database queries.
Developed a full-stack takeaway ordering system for local restaurants, enabling customers to place orders online and collect food without long queues. Implemented secure payment flows, real-time order tracking, and responsive UI.
I'm currently open to Data Engineer, Data Analyst, Analytics Engineer, Business Intelligence Analyst, and related data opportunities. Let’s discuss how I can contribute to your team.