Skip to content

Latest commit

 

History

9 Commits

Folders and files

Repository files navigation

Project Overview

This project focuses on predicting kidney disease using clinical and laboratory data. It demonstrates a complete end-to-end machine learning pipeline, including data preprocessing, exploratory data analysis (EDA), model training, and evaluation.

The goal is to build a baseline classification model that can assist in early risk identification of kidney disease.

Dataset

  • File: kidney_disease_dataset.csv
  • Records: 20,538
  • Features: Clinical & laboratory measurements
  • Target: Kidney disease risk category

Features Included

  • Age
  • Blood Pressure
  • Urine Albumin
  • Urine Sugar
  • Red Blood Cells
  • Blood Urea
  • White Blood Cell Count
  • Red Blood Cell Count
  • Hemoglobin
  • Target (Disease Risk)

Workflow

  1. Data Loading
  2. Data Cleaning & Preprocessing
  3. Exploratory Data Analysis (EDA)
  4. Feature Encoding & Scaling
  5. Baseline Model Training (Random Forest)
  6. Model Evaluation
  7. Feature Importance Analysis

Model Used

  • Algorithm: Random Forest Classifier
  • Evaluation Metrics: Accuracy, Precision, Recall, F1-score
  • Visualization: Confusion Matrix, Feature Importance

Results

The baseline model demonstrates strong predictive performance and highlights important clinical features contributing to kidney disease prediction.

Future Improvements

  • Hyperparameter tuning
  • Advanced models (XGBoost, Neural Networks)
  • Explainable AI (SHAP, LIME)
  • Deployment using FastAPI

Technologies Used

  • Python
  • Pandas, NumPy
  • Scikit-learn
  • Matplotlib, Seaborn

Author

Danish Zulfiqar
AI & ML Engineer

About

Kidney Disease Prediction using Machine Learning

Topics

Resources

Stars

4 stars

Watchers

0 watching

Forks

Contributors

Languages