This project focuses on predicting kidney disease using clinical and laboratory data. It demonstrates a complete end-to-end machine learning pipeline, including data preprocessing, exploratory data analysis (EDA), model training, and evaluation.
The goal is to build a baseline classification model that can assist in early risk identification of kidney disease.
- File: kidney_disease_dataset.csv
- Records: 20,538
- Features: Clinical & laboratory measurements
- Target: Kidney disease risk category
- Age
- Blood Pressure
- Urine Albumin
- Urine Sugar
- Red Blood Cells
- Blood Urea
- White Blood Cell Count
- Red Blood Cell Count
- Hemoglobin
- Target (Disease Risk)
- Data Loading
- Data Cleaning & Preprocessing
- Exploratory Data Analysis (EDA)
- Feature Encoding & Scaling
- Baseline Model Training (Random Forest)
- Model Evaluation
- Feature Importance Analysis
- Algorithm: Random Forest Classifier
- Evaluation Metrics: Accuracy, Precision, Recall, F1-score
- Visualization: Confusion Matrix, Feature Importance
The baseline model demonstrates strong predictive performance and highlights important clinical features contributing to kidney disease prediction.
- Hyperparameter tuning
- Advanced models (XGBoost, Neural Networks)
- Explainable AI (SHAP, LIME)
- Deployment using FastAPI
- Python
- Pandas, NumPy
- Scikit-learn
- Matplotlib, Seaborn
Danish Zulfiqar
AI & ML Engineer