이 프로젝트는 구글 트렌드 검색량 데이터와 기술적 지표를 결합하여 주가의 상하방 움직임을 예측하는 머신러닝 시스템입니다.
모든 소스 코드는 src/ 하위에 모듈화되어 있으며, 상호 의존성을 최소화하도록 설계되었습니다.
- data/: 원본 데이터 및 전처리된 데이터 세트
- models/: 학습 완료된 모델 바이너리 (.joblib)
- notebooks/: 분석 및 실험용 Jupyter Notebook
- reports/: 분석 결과 시각화 자료 및 성능 지표 CSV
- src/: 실제 실행 가능한 소스 코드 (전처리, 학습, 평가, 유틸리티)
- 데이터 병합: 주가 데이터와 트렌드 데이터를 시계열 기준으로 정밀 병합
- 피처 엔지니어링: 100개 이상의 기술적 지표 및 트렌드 피처 생성
- 앙상블 모델: Random Forest, XGBoost, Logistic Regression 기반의 앙상블 학습
- 엄격한 검증: TimeSeriesSplit을 이용한 시계열 교차 검증 및 데이터 누수 방지
필요한 패키지를 설치합니다.
pip install -r requirements.txt(참고: 프로젝트 루트에 requirements.txt가 아직 없는 경우 생성 필요)
전체 파이프라인(데이터 전처리부터 모델 평가까지)을 실행하려면 src/main.py를 실행합니다.
python src/main.py- 모든 데이터 처리는
src/processing/내에서 이루어집니다. - 모델 설정 및 하이퍼파라미터는
src/utils/config.py에서 관리합니다. - 상세한 아키텍처 가이드는
GEMINI.md를 참조하세요.