Welcome to my GitHub profile! Here you will find a collection of projects, scripts, and code related to my professional experience in data science, software development, AI, and business analytics. I enjoy exploring various tools and technologies to solve real-world problems. Below, I provide an overview of my skills, tools, and platforms I work with.
Temporal pattern modeling, sequential prediction, and dynamic pricing systems
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Traffic Forecasting | ||
| When Neural Networks Fail: A Cautionary Tale on Extrapolation Limits in Electricity Price Forecasting | • Deep Feed-Forward Neural Networks (64-64 architecture) • Relative MAE (rMAE) Custom Loss Function • Hourly Time-Series Forecasting (57,649 records) • 52-Dimensional Feature Engineering (temporal, capacity, weather, fuel prices) • Scenario Analysis Framework (2030–2050 transition pathways) • Extrapolation Limit Diagnostics (15–40x capacity growth) • Merit Order Effect Modeling • Monte Carlo Dropout for Uncertainty Quantification • Hybrid Modeling Strategy (NN + Fundamental Pricing) • Policy Target Validation (RUPTL, JETP) • MinMax/Standard Scaling Pipelines • Early Stopping & Learning Rate Scheduling |
Report Code |
| Deep Learning for Railway Delay Prediction & Management | • Periodic Event Scheduling Problem (PESP) • Graph Neural Networks (GNN) • Graph Attention Networks (GAT) • Long Short-Term Memory (LSTM) • Spatiotemporal Modeling • Reinforcement Learning (PPO) • Delay Propagation Modeling • Uncertainty Quantification (MC Dropout) • Real-Time Prediction System |
Report |
| Dynamic Flight Price Forecasting with XGBoost | • XGBoost Regression (500 iterations) • Feature Engineering (temporal, route, carrier) • Target Encoding • Early Stopping & Regularization • Residual Analysis • 80-20 Train-Test Split |
Report |
| Advanced Ensemble Flight Price Prediction (98.47% R²) | • Stacking Ensemble • Blending Ensemble • XGBoost, LightGBM, CatBoost • Random Forest, Ridge Regression • 5-fold Cross-Validation • Meta-Learner Training |
Report |
| Flight Price Prediction | • LightGBM with DART Boosting • Chronological Train/Test Split • SHAP Interpretability • Booking Window Simulation • Holiday Proximity Features • Revenue Elasticity Modeling |
Report |
| Empu Harga — Used-Motorcycle Price Suggestion (Rekomendasi Harga) | • LightGBM Quantile Regression (α ∈ {0.1, 0.5, 0.9}) on 36 engineered features • Conformalized Quantile Regression / CQR (Romano, Patterson & Candès, 2019) for finite-sample marginal coverage • Spatially-Weighted Conformal Prediction / SW-CP (Hjort, 2025) for per-kecamatan conditional coverage • Hierarchical Bayesian Target Encoding with smoothing across (brand, model, year, kecamatan) • Three-Layer Hierarchical Cold-Start Fallback (feature encoding + calibration + confidence inflation) • Synthetic Indonesian Listings (80k) calibrated against public MSRP + depreciation + BPS-income priors • Kaggle India 2W Cross-Market Structural Validation • 35 models × 11 years × 70 kecamatan × 3 kondisi = 80,850 Precomputed Cells in DuckDB • FastAPI + uvicorn Serving (production reference) + Pre-Baked JSON via Vercel CDN (zero-cost path) • Wasserstein-1 Drift Detector (vs PSI: PSI=+inf where W₁=0.18 on brand drift) • MLflow Experiment Tracking + Optuna 50-trial Hyperparameter Search • Next.js 16 + Tailwind v4 CarGurus-style Deal-Tier UI • 54+ pytest invariants across 9 test files • Cost: Rp 188 per 1,000 suggestions on GCP Cloud Run (4.8× cheaper than naive GPU) |
Report Code Demo |
Relational data modeling, network analysis, and graph-based recommendation
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Graph-Theoretic Analysis of Indonesian Railway Networks | • NetworkX + Neo4j Graph Database Integration • Centrality Analysis: Betweenness, PageRank, HITS (Hubs & Authorities), Degree, Closeness, Eigenvector • Vulnerability Assessment: Targeted Attack Simulation (Albert et al., 2000) • Monte Carlo Resilience Testing (50 iterations, random vs targeted) • Community Detection: Louvain Method (Modularity Q=0.769, 10 communities) • Scale-Free Network Assessment (Power-law fitting, γ=1.13) • Synthetic Dataset: 97 stations, 116 connections, 8 rail lines (KRL, MRT, LRT) • Validation against Buchwald & Sobczak (2021) Silesian Network Study • Critical Debugging Journey: HITS convergence, clustering coefficient=0, disconnected components |
Report Code |
| Graph-Based Dementia Detection from Clinical Speech (GraDD-ID) | • Hierarchical Graph Representation (455 nodes, 5-level ontology tree) • 348 Linguistic Features across 7 Branches (Acoustic, Discourse, Lexical, Syntactic, Psycholinguistic, Spatial, Anagraphic) • Graph Convolutional Networks (GCNN) with Global Mean Pooling • Graph2Vec + Weisfeiler-Lehman Kernel Embeddings (128-dim) • Indonesian Clinical Dataset (500 conversations, 310 patients, MMSE-labeled) • Multi-Task Learning (Binary/3-Class/5-Class Classification + MMSE Regression) • Ablation Study Framework (Branch-wise feature importance) • Cross-Validation with Statistical Significance Testing (Paired t-tests, Cohen's d) • Critical Finding: Baseline Dominance due to Dataset Constraints (500 samples insufficient for GCNN) • Scientific Integrity: Transparent documentation of graph method limitations in low-resource settings |
Report Code |
| Deep Learning for Railway Delay Prediction & Management | • Periodic Event Scheduling Problem (PESP) • Graph Neural Networks (GNN) • Graph Attention Networks (GAT) • Long Short-Term Memory (LSTM) • Spatiotemporal Modeling • Reinforcement Learning (PPO) • Delay Propagation Modeling • Uncertainty Quantification (MC Dropout) • Real-Time Prediction System |
Report |
| Graph-Based Fraud Detection: From Theory to Production | Industry workshop for fintech compliance teams (Feb 2026) • 45-minute technical deep dive • Live Neo4j/Python demo • Q&A on production deployment • Neo4j Aura + NetworkX • 36-client fraud ring detection • Eigenvector centrality for ringleader identification |
Workshop Slides Demo Code |
| Graph-Based E-Commerce Recommender System | • Neo4j Graph Database • Cypher Query Language • Jaccard Similarity Index • Collaborative Filtering • Graph Traversal Algorithms • Network Visualization • Real-time Recommendation Engine |
Report Code |
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Wasserstein Logistics: Optimal Transport for Indonesian Supply Chains | • Classical Kantorovich LP (Network Simplex, Birkhoff bound validation) • Entropic OT / Sinkhorn Algorithm (ε sweep 0.001–1.0) • Unbalanced OT with KL Marginal Relaxation (Chizat et al. 2018) • Partial OT with Capacity Constraints (Chapel et al. 2020) • Graph-Augmented Cost Matrices (Dijkstra shortest paths, hybrid α-interpolation) • Novel Multi-Period Dynamic OT (Temporal Frobenius coupling, λ sweep 0.01–1.0) • Block-Coordinate Proximal Sinkhorn with Gradient Clipping • 3 Indonesian Networks (Jabodetabek 12×200, Java Intercity 8×150, Archipelago 50×90) • 4 Seasonal Scenarios (Normal S/D≈1.2, Ramadan S/D≈0.4, Harbolnas S/D≈0.1, Lebaran S/D≈0.5) • Segment-Aware Demand Generation (Food ×2.5 Ramadan, Electronics ×4.5 Harbolnas) • Fairness Analysis (Gini coefficient, urban/rural fulfilment ratios up to 14:1) • N_RUNS=5 Statistical Validation with Bootstrap Confidence Intervals • POT Library (Python Optimal Transport) |
Report Code |
| Moving Mass, Losing Nothing: Sparse Optimal Transport via Conditional Gradient Methods | • Frank-Wolfe (Conditional Gradient) Algorithm with Exact Line Search (Jaggi, 2013) • Away-Step Frank-Wolfe with Active Set Management (Lacoste-Julien & Jaggi, 2015) • Fully Corrective Frank-Wolfe / FC-GCG (Bredies, Carioni, Fanzon & Walter, 2024) • Sinkhorn-Knopp Algorithm with Log-Domain Stabilization (Cuturi, 2013) • Quadratic-Regularized OT via Semi-Dual L-BFGS (Blondel, Seguy & Rolet, 2018) • Tsallis q-Entropy Regularization with q-Sinkhorn Iteration (Muzellec et al., 2022) • Epsilon-Scaling Sinkhorn with Cost Normalization (Schmitzer, 2019) • Wasserstein Barycenters via Iterative Bregman Projections (Cuturi & Doucet, 2014) • Sparse FW Barycenter with Alternating Plan-Barycenter Optimization • Free-Support Barycenter with Adam Optimizer • Dual Certificate Analysis & Complementary Slackness Verification • MNDSC-Related Support Gap Analysis (Carioni & Del Grande, 2023) • Linear Minimization Oracle via Network Simplex on Transportation Polytope • Indonesian Provincial Population Distribution Compression (6 Island Groups, 1,600-point grids) • 8 Experiments: Sparsity Benchmark, Pareto Frontier, Convergence Analysis, Dual Certificates, Barycenters, Indonesian Application, Scalability, Regularization Sensitivity • 6 Algorithmic Bug Fixes via Paper-by-Paper Numerical Audit (15 referenced papers) |
Report Code |
| Bridging the Wasserstein Gap: A Systematic Empirical Validation of Optimal Transport Theory in Generative Adversarial Networks | • WGAN with Gradient Penalty • True Wasserstein Distance (LP) • 79% W₁ Reduction Achieved • Mode Collapse Elimination • Bootstrap Confidence Intervals • Statistical Significance Tests |
Report Code |
| Progressive Adaptive Optimal Transport for Domain Adaptation | • Four-Stage Progressive Pipeline: – Stage 1: Partial OT (80% mass transport for outlier robustness) – Stage 2: Hierarchical OT (cluster-guided cost modification, 20% reduction) – Stage 3: Low-Rank Denoising (SVD truncation, k=10) – Stage 4: Adaptive Fusion (MMD-based weighting) • Domain Adaptation Benchmarking (6 synthetic datasets: rotating_moons, partial_domain, corrupted_manifold) • Critical Failure Analysis: Transparent documentation of limitations (e.g., -11.43% degradation on gaussian_label_shift) • Statistical Validation: 5-run significance testing, MMD gap quantification • Computational Diagnostics: 6-bug debugging journey (hierarchical disaggregation disaster, API incompatibilities) • Key Result: +18.22% accuracy on partial domains where standard OT fails completely (0% → 18.22%) |
Report Code |
Facility location, equity constrained optimization, and reinforcement learning for emergency services
| Project Title | Methods & Techniques | Links |
|---|---|---|
| When Minutes Mean Lives: Optimizing Ambulance Placement in New York City with Equity Constraints and Reinforcement Learning | • Equity Constrained Model (ECM): Novel weighted p Median / p Center hybrid with tunable alpha parameter for efficiency equity Pareto frontier generation (Bertsimas et al., 2011) • p Median Facility Location Problem (demand weighted average RT minimization, MIP via PuLP/CBC) • Maximal Covering Location Problem / MCLP (Church & ReVelle, 1974; 8 minute threshold coverage maximization) • Maximum Expected Covering Location Problem / MEXCLP with M/M/c queueing busy fraction (Daskin, 1983) • OpenStreetMap Road Network Analysis via OSMnx (Boeing, 2025): 55,268 nodes, 139,160 edges, Dijkstra shortest path OD matrix (237 x 237 ZIP codes) • Proximal Policy Optimization (PPO) for dynamic ambulance redeployment (Schulman et al., 2017; Liu & Zeng, ICLR 2024) • Hierarchical Borough Level RL Action Decomposition (Sivagnanam et al., ICML 2024) • Vectorized NumPy RL Environment (1000x faster than SimPy DES, 5 minute time steps, 288 slots/day) • Equity Aware Constrained Reward Function (Gini penalty + Rawlsian P90 penalty) • Gini Coefficient Analysis for Response Time Inequality (Enayati et al., 2023) • NYC 911 EMS Incident Dispatch Data: 18.1M cleaned incidents, 237 ZIP codes, 5 boroughs (FDNY CAD system) • Clinical Survival Estimation: OHCA decay model 7%/min (Holmen et al., 2020) • Pareto Frontier Visualization: 21 solutions across alpha sweep (0.0 to 1.0) • Key Result: ECM reduces worst case RT by 78% (1800s to 392s) with only 19% mean RT increase • RL Agent: 15.3% improvement over random redeployment (explained variance 0.957) • Estimated Impact: 93 to 299 additional cardiac arrest survivors per year • Iterative Debugging: Gini MAD linearization failure, demand scaling error, SimPy speed trap (all documented) • 20 referenced papers spanning OR, RL, health equity, and network science |
Report Code Flow |
| Nonlinear MPC for Wind Assisted Ship Propulsion | • do-mpc + CasADi 3.6 + IPOPT (interior point NLP solver, Wächter & Biegler 2006) • 3 DOF Maneuvering Plant: Fossen (2011) handbook formulation, RK4 integration at 1 s • Flettner Rotor Aerodynamics: Magnus effect, Tillig & Ringsberg (2020) coefficients (C_L, C_D vs spin ratio) • Two MPC Formulations: Tracking NMPC (setpoint, w_track=50, w_fuel=8) and Economic NMPC (fuel primary, w_fuel=150, w_sched=3, slow steaming) • Receding Horizon Optimization (Mayne et al. 2000), 18 to 24 step lookahead • Stochastic Wind Modeling: Two scale Ornstein Uhlenbeck process (Uhlenbeck & Ornstein, 1930), synoptic + gust components • Time Varying Parameter (TVP) Forecast Injection at every control step • Monte Carlo Validation (12 scenarios, all compass directions, Beaufort 4 to 6) • Baseline Comparison: PID engine only vs PID + always on sail vs Tracking MPC vs Economic MPC • Reference Vessel: 6000 DWT bulker (MV Annika Braren class), 4 MW main engine, twin 30m × 4m rotors • Critical Debugging Journey: SFC unit conversion, MPC weight calibration, frozen plant horizon tradeoff, the "fixed sail loses fuel" finding that turned out to be physics not bug |
Report |
Retrieval-augmented generation, regulatory QA assistants, and zero-budget LLM orchestration
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Patih — Asisten Regulasi Kemensos (Indonesian Regulation QA Chatbot) | • Citation-enforced Hybrid Parent-Document RAG: BM25 (lexical) + dense multilingual-e5-large ONNX (semantic) fused via Reciprocal Rank Fusion (k=60); parent = Pasal, child = ayat/huruf for citation granularity• Multi-document corpus — 22 Indonesian social-affairs regulations (19 article-structured + 3 reference docs) with document-scoped cross-reference resolution + always-on definitions article (Document-Level Retrieval Mismatch mitigation, implicit routing) • Legislation-aware structure parser (BAB/Bagian/Pasal/ayat/huruf AST + 5 real-world fixes: Penjelasan strip, omnibus exclusion, pre-BAB recovery, period tolerance, cross-chapter de-dup) + generic section-chunker for non-Pasal docs (SOP/RPJMN) • HalluGraph-inspired Layer-2 validators: citation whitelist + Entity-Grounding + Relation-Preservation → threshold gate → HITL queue + confidence badge (🟢/🟡/🔴) • Calibrated abstention (refuses out-of-scope questions) • LiteLLM gateway with per-provider token buckets + fallback chain — Groq Llama 3.3 70B (workhorse) → Gemini 2.5 Flash → Cerebras Qwen 3 → OpenRouter • Bilingual ID/EN (translate the query, not the corpus; citations stay verbatim Indonesian) • Folder-watcher ingest with auto-generated metadata sidecars; PyMuPDF + Tesseract OCR ( ind) fallback for scans• RAGAS evaluation framework + tiered 50-question golden set; 5/7 acceptance thresholds PASS (RP 0.98, EG 1.00, refusal 100%, P95 ~4–7s, 0 hard-fail) • Chainlit conversational UI + mounted FastAPI sidecar ( /health, /api/query); SQLite persistence; Langfuse tracing• Local-first — data/embeddings/retrieval/index on-device; only the LLM call is cloud; e5-large ONNX FP32 on CPU • 307-test suite (unit + integration + golden) • Total run cost: $0/month (free-tier LLM) |
Report Code |
Text classification, sentiment analysis, and linguistic feature engineering
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Unmasking Hoaxes in Bahasa: A Dual-Stream Knowledge-Enhanced Graph Neural Network for Indonesian Fake News Detection | • IndoBERT Indonesian Language Model (Indo4B corpus, 110M parameters) • Graph Attention Networks (GAT) with 4 heads, 2 layers • Dual-Stream Architecture (Text + Graph fusion) • Knowledge-Enhanced Entity Graphs (Type-aware edge construction) • Attention-Gated Fusion Mechanism • Focal Loss for Class Imbalance (α=0.6, γ=2.0) • 8 Indonesian News Domains (Politik, Ekonomi, Kesehatan, Teknologi, Sosial, Hukum, Pendidikan, Lingkungan) • Layer Freezing Strategy (freeze first 8 BERT layers) • Bootstrap Confidence Intervals (1,000 iterations) • McNemar's Test for Statistical Significance • 5,000-article dataset with entity annotations (120 orgs, 60 persons, 50 locations) |
Report |
| Sentiment-Driven Rating Prediction for Hotel Reviews | • TF-IDF Vectorization • Count Vectorization • Random Forest (500 trees) • N-gram Analysis (1-3 grams) • 5-fold Stratified Cross-Validation • spaCy NLP Processing |
Report |
| High-Performance Hotel Review Classification (92% Accuracy) | • Logistic Regression • TF-IDF Vectorization • Multi-class Classification (One-vs-Rest) • Text Preprocessing Pipeline • Hyperparameter Tuning (C parameter) |
Report |
| Comparative Analysis: ML vs Deep Learning for Sentiment | • Random Forest, SVC, Decision Tree • LSTM Neural Networks • TensorFlow/Keras • Word Embeddings (128-dim) • Dropout Regularization • GridSearchCV |
Report |
| NLP-Based Password Strength Classification | • TF-IDF Character N-grams • Shannon Entropy Calculation • Pattern Recognition • Dictionary Word Detection • Keyboard Adjacency Detection |
Report |
Hypothesis testing, experimental design, and causal frameworks
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Does the Policy Actually Work? Causal Inference for Indonesian Social Protection Programs | • 13 Methods Benchmark: Classical, ML, Deep Learning, Panel Data • Classical: Propensity Score Matching (PSM), Inverse Propensity Weighting (IPW), Doubly Robust Estimation (AIPW) • Meta-Learners: S-Learner, T-Learner, X-Learner • Causal Forest & Double Machine Learning (DML) • Deep Learning: CEVAE, Counterfactual Regression Network (CFRNet) • Panel Data: Difference-in-Differences (DiD), Synthetic Control Method (SCM) • Ground Truth Evaluation: √PEHE, Coverage Rate, Monte Carlo Simulation (50 seeds) • 3 Indonesian Programs: PKH Cash Transfers, JKN Healthcare, Provincial Wage Policies • Policy-Relevant Heterogeneous Treatment Effects (HTE) • Transparent Debugging Journey: EconML discrete_treatment, CEVAE CI inconsistency |
Report Code |
| Predictive Validation of Multi-Level Educational Placement Systems | • Stratified Random Sampling • One-Way ANOVA & Tukey HSD • Pearson Correlation • Cohen's d Effect Sizes • Eta-Squared (η²) • Shapiro-Wilk & Levene's Tests • Cross-Sectional Study Design |
Report |
| Statistical Investigation of Fandango Rating Bias | • Benjamini-Hochberg FDR Correction • Bootstrap Confidence Intervals (10,000 resamples) • Benford's Law Fraud Detection • Non/Parametric Testing (Mann-Whitney U, t-tests) • Natural Experiment Design • Causal Inference Framework |
Report |
Outlier identification and irregular pattern discovery
| Project Title | Methods & Techniques | Links |
|---|---|---|
| HybridGAD: Multi-Strategy Graph Neural Network for Financial Fraud Detection | • Graph Convolutional Networks (3-layer, 128-dim hidden) • Multi-Strategy Fusion (RQGNN + GGAD + GAD-NR) • Multi-Head Attention Mechanism (4 heads, adaptive weighting) • Financial Transaction Graph Analysis (10K-100K nodes) • Synthetic Fraud Pattern Generation (5 types: collusion, laundering, wash trading, Ponzi, camouflaged) • Barabási-Albert Scale-Free Network Topology • Class Imbalance Handling (33x fraud weighting for 2% fraud rate) • Optimal Threshold Selection via Precision-Recall Curve • Benford's Law Feature Engineering (20-dimensional financial attributes) • Early Stopping & Learning Rate Scheduling (ReduceLROnPlateau) • Camouflage Level Control (Low/Medium/High difficulty) • PyTorch Geometric Implementation (190K parameters) • Perfect Detection on Low-Camouflage Synthetic Data (F1=1.0, AUC-ROC=1.0) |
Report Code |
Market analysis, strategic decision support, and insight-driven visualization
| Project Title | Methods & Techniques | Links |
|---|---|---|
| Data-Driven Market Selection for E-Learning Platform | • Market Sizing Analysis • Willingness-to-Pay Analysis • Composite Scoring • Geographic Heat Mapping • Quadrant Analysis |
Report |
| College Major Economic Outcomes Visualization | • Scatter Plots, Histograms, Box Plots • Distribution & Correlation Analysis • Gender Equity Analysis • Data Normalization |
Report |
Technical workshops delivered to industry audiences
| Workshop Title | Audience & Context | Core Technical Project | Materials |
|---|---|---|---|
| Graph-Based Fraud Detection: From Theory to Production | Industry workshop (Feb 2026) • 45-minute technical deep dive • Live Neo4j/Python demo • Q&A on production deployment |
Graph ML Project • Neo4j Aura + NetworkX • 36-client fraud ring detection • Eigenvector centrality for ringleader identification |
Workshop Slides Demo Code |
| Graph-Based E-Commerce Recommender System | Workshop • 60-minute technical deep dive • Theoritical Fundamentals on graphs • Live Python demo |
Graph ML Project • Neo4j Graph Database • Cypher Query Language • Jaccard Similarity Index • Collaborative Filtering • Graph Traversal Algorithms • Network Visualization • Real-time Recommendation Engine |
Report Code |